Технозаметки Малышева
11.9K subscribers
5.19K photos
1.95K videos
43 files
5.18K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
Forwarded from Data Secrets
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами

https://arxiv.org/abs/2608.26263

Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.

Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.

В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:

– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.

– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.

– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.

Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.

На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.

На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.

Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
🔥1442
😁182🔥2😢1
Антропики опубликовали системный промпт Клода Fable 5.1

изучаем тут:

https://platform.claude.com/docs/en/release-notes/system-prompts/claude-fable-5-1

для тех, кто без интернета файл в комментариях

#Fable #prompt
———
@tsingular
52👌1🤝1
This media is not supported in your browser
VIEW IN TELEGRAM
Lieflat Charts: новый дизайнер навык для агента для построения точных диаграмм

Китайская лаборатория выпустила skill для агентов, который превращает сырые данные не в дефолтные графики, а в аккуратные, «редакторские» макеты, как в качественном журнале.

В коллекции уже 49 шаблонов графиков и 12 целых шаблонов отчётных макетов, адаптированных для Claude Code, Codex и других агентов, поддерживающих формат SKILL.md.

🔧 В чём суть:
Skill это набор правил выбора языка визуализации: сначала определяется структура данных, потом подбирается шаблон.

Data-контракт ограничивает скоуп работы: «одна гифка, один вывод», не больше.
Колонки, оси, подписи создаются каждый раз заново с полным контролем.
Всё выполняется в HTML, открывается в браузере и сохраняется в PDF.

📊 Реализует три направления визуальной грамматики:
Lupi «Editorial»: медленное вдумчивое чтение, 15 шаблонов для статей и отчетов с крупными цифрами, разделенными отступами, настоящими деталями и архивом данных;
Glance «Быстрый взгляд»: 18 шаблонов, данные сгруппированы, смещения подсвечены, читаются за 10 секунд, идеально для дашбордов и еженедельной аналитики;
Basics «Основа»: 13 базовых шаблонов, привычные типы (линейные, столбчатые, кольцевые, тепловые карты) в готовой редакции.

💼 Для кого полезно:
Обычные AI-инструменты сейчас умеют «генерировать диаграмму» - это или шаблонный код на питоне или машинная «фантазия на тему».
Lieflat Charts умеет создавать продуманный дизайн данных, который отражает реальность: единицы измерения реальные, цифры на месте, дополнительные примечания и источник данных в комплекте.

Более того, - навык умеет подгонять дизайн под «предпочтительный» стиль: весь дизайн открыт, автоматически подбирается монохромный или один из трех фирменных цветовых пресетов, и всё это запускается одной командой.

📎 GitHub · Демо-шаблоны · README

#агенты #данные #визуализация #навыки
———
@tsingular
🔥622🆒1
HiveTraceGuard-Pro: маленький охранник для больших моделей

Российская команда HiveTrace выложила в open source компактную guardrail-модель на 0,6B параметров, которой можно закрыть и вход, и выход LLM.
Главное: она понимает русский и английский, отдаёт ровно один токен, safe или unsafe, и при этом в топе мирового лидерборда именно на русских данных.

🔧 Что она делает:
Работает в двух режимах: input guard проверяет запрос пользователя до ухода в модель, output guard проверяет ответ ассистента в контексте запроса.
Политика фиксированная, а навык широкий: находит вредоносный контент по 15 категориям, джейлбрейки, prompt injection, обфускацию, извлечение секретов и угон инструментов агента.

Благодаря фиксированной политике префикс истории один для всех запросов, поэтому KV-кэш работает по максимуму: p95-задержка отклика всего 28,8 мс.

📊 Позиции на GuardRate Leaderboard:
Интегральный результат 0.743, топ-3 при размере 0,6B, тогда как соседи сверху намного тяжелее: Sing-Guard-2B втрое, YuFeng-XGuard-Reason-8B в 13 раз больше.
На внутренних русских наборах модель почти безупречна: 0.952 и 0.999 на Aya RU и RU-тестах, а вот ложные срабатывания всего 1.6%, то есть не блокирует безобидные русские запросы.

На англоязычных сценах она скромнее: 0.778 на XSTest против 0.922 у Shieldstral. Выбор для русскоязычного прода явно в её пользу.

💼 Где взять:
Модель доступна в трёх вариантах: открытые веса на Hugging Face, интерактивная Colab-демка и API в Cloud.ru Evolution Foundation Models по цене 42,7₽ за миллион входных токенов, при этом генерируемые токены бесплатны.

А 3 сентября в 17:00 команда расскажет подробнее: как создавали и оценивали модель, что такое GuardRateTools и как теперь жить с guardrails. Регистрация открыта: https://aisecuritylab.timepad.ru/event/4144904/

📎 Hugging Face · GuardRate Leaderboard · Cloud.ru API

#guardrails #русскийLLM #HiveTrace #cybersecurity
———
@tsingular
🔥1341🆒1
Forwarded from Data Secrets
Fable 5.1 это конечно хорошо, но вы видели, что выпустил стартап Фей-Фей Ли?

Встречаете Atlas – первую в истории мультимодальную world model. Она генерирует изображения и видео с контролем камеры на уровне пикселей и (!!!) может реконструировать их в 3D сцены в явном формате point cloud и 3D Gaussian splats. Также обучена Space-time симуляции (четвертый пример).

Длительность видео – до 1 минуты в 1440p, и можно прикреплять до 6 референсных изображений.

Архитектура – мультимодальный диффузионный трансформер. По сути это гибрид LLM-архитектуры (от нее тут авторегрессия+кэширование) и диффузионных видеомоделей (от них денойзинг), дополнительно объединенный с идеей пространственного контекста. Это значит, что каждый элемент контекста имеет явную 3D-привязку через позицию камеры.

По бенчмаркам заявляют превосходство над специализированными моделями и в генерациях с контролем камеры (MiniMax, Gemini Omni Flash, FLUX и др.), и в 3D-реконструкции (Pi3X, VGGT, Depth Anything 3 и др.).

Движок настолько точный, что на нем можно обучать роботов. Atlas может по видео построить явную 3D-сцену, в которой можно симулировать движение робота и обучать его (это называется Real-to-Sim-to-Real подход). Модель генерирует RGB и depth именно с точки зрения бортовых камер робота, и может даже построить симуляцию, в которой возможна манипуляция объектами.

Потрясающий релиз

https://www.worldlabs.ai/blog/atlas
🔥147🤯641
PT Dephaze: LLM в дистрибутиве ищет пароли в сетевых папках

Positive Technologies встроила локальную LLM в автопентестер PT Dephaze: теперь продукт сам ищет логины и пароли в корпоративных файлах и строит на них атаки. Именно похищенные учётные записи используются в четырех из пяти кибератак 2026 года.

🔧 Что под капотом:
Модель едет в коробке, вместе с дистрибутивом, и не отправляет данные в интернет или третьим лицам.
Она читает конфигурационные и текстовые файлы в сетевых папках, извлекает потенциальные логины и пароли и валидирует их в тестируемой инфраструктуре.
Неактуальные комбинации отсеиваются, а рабочие используются для дальнейшего развития атаки.
Найденные файлы можно удалить, снизив шанс взлома.

📊 Почему сейчас:
За последний год злоумышленники в два раза чаще применяют ИИ: быстрее создают вредоносы, находят уязвимости и автоматизируют рутину.
Интеграция LLM для предупреждения атак с использованием учетных данных это первый этап долгосрочного развития PT Dephaze в области использования искусственного интеллекта.

🛡 Куда метит релиз:
Релиз нацелен на: органы власти, госучреждения, госкорпорации и компании на отечественном ПО.
Продукт научился работать со службами каталогов на FreeIPA: распознаёт домены, подбирает учётные данные, анонимно выгружает список пользователей.
А если сотрудник использует одну пару логин-пароль в разных системах, Dephaze проверяет её во всех сервисах.

💼 Планы развития:
ИИ в атаках и ИИ в защите растут в одном темпе.
Пентестер противника ускорить можно только собственным автотулом, поэтому вендоры встраивают LLM в симуляторы атак.
В планах расширить продукт техниками атак на российские ОС.

📎 Пресс-релиз · Обзор CISOCLUB

#PositiveTechnologies #cybersecurity #ИБ #LLM #пентест
———
@tsingular
🔥6221
bb: агентная IDE, которая строит сама себя

На рынке мультиагентных сред свежий игрок: bb, 2,9 тысячи звёзд и 5 344 коммита под лицензией MIT.
Идея в том, что тут агенты сами достраивают свою рабочую среду: сервер держит всё состояние в SQLite, демон на каждой машине готовит workspace и запускает процессы агентов, а вход в систему один и тот же из десктопа, веба, CLI и HTTP API.

🔧 Как устроено:
Провайдеры подключаются уже авторизованные: Claude Code, Codex, Pi и любые агенты по протоколу ACP, ту же идею развили OpenClaw и Hermes.
Сервер хранит состояние в SQLite и ничего не знает про устройства workspace, этим занимается демон на конкретной машине.
Единица работы это поток: manager-поток координирует дочерние, которые выполняют делегированные задачи.
За работой следишь вживую и рулишь на лету, а поток можно передать другому агенту.

Расширяется плагинами, которые он сам для себя может дописать: задачи и воркфлоу, автоматизации по расписанию, общая память, ограничение параллельности и отложенная отправка.

📊 Чем отличается от аналогов:
Paperclip строит «компанию из агентов» с оргструктурой, бюджетами и целями. Multica раздаёт агентам задачи как коллегам по доске. Omnigent монтирует meta-harness поверх CLI с политиками и песочницами.
Все три управляют работой, а bb даёт среду, в которой агенты строят и расширяют собственную фабрику.
Мультиагентность тут встроена в саму модель работы: несколько исполнителей одновременно, у каждого свой поток и общий журнал событий.
Можно работать через приложение на телефоне, это по сути оболочка вокруг того же веб-интерфейса.

💼 Кому это может быть интересно:
Командам, у которых агены уже в проде и которые устали от двадцати терминалов без общего контекста.
Одна команда npx bb-app@latest, и вся инфраструктура в едином саморазвивающемся окне. На Windows запуск тоже возможен через WSL.

Среда, которую агенты достраивают под себя, эволюционирует вместе с командой.
Можно навайбкодить личный метахарнесс.

📎 GitHub · Систем-обзор · Vision · Changelog 0.41.0

#bb #метахарнесс #агенты #мультиагентность #opensource
———
@tsingular
4🤯42🔥2
Forwarded from XOR
This media is not supported in your browser
VIEW IN TELEGRAM
Google выпустила Gemini 3.8 Flash — новая быстрая модель уже обходит гигантов в кодинге.

По данным WSJ, во внутренних тестах сотрудники Google предпочитали её ответы Claude Opus. Сама модель обещает быть дешевой и заточенной под кодинг и агентные задачи.

Gemini 3.8 Flash уже начала появляться у пользователей, так что ждем официального релиза.

Сентябрь жаркий на модели 😻

@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12🤣5
Keenable SELECT: веб как таблица, к которой пишешь SQL

Стартап Keenable, который в августе вышел из стелса с $26 млн от Accel, показал вторую большую идею: SELECT, отдельный MCP-сервер, где агент запрашивает данные из открытого веба одним SQL-запросом и получает таблицу вместо стены ссылок.

Да, по сути каждый сайт становится строкой таблицы: сервер сам гоняет поиски, скачивает страницы, вытаскивает запрошенные поля и собирает строки с источниками.

🔧 Как это работает:
Ты спрашиваешь агента по-человечески, а агент, по гайду внутри самого тула, пишет read-only SELECT на диалекте DuckDB.
В запросе живут табличные функции WEB_SEARCH и WEB_FETCH, а семантические функции SEM_EXTRACT и SEM_NORM достают и нормализуют поля силами LLM.
Реальный пример из документации: один вызов прогнал 7 поисков, слил 1 400 результатов в 1 125 страниц, вытащил три поля с каждой и сгруппировал в таблицу «модель, источники, запас хода, цена».

Ответ приезжает компактным табличным кодированием вместо JSON, поэтому таблица почти не ест контекст.

📊 Фишка для дальних сессий:
Каждый вызов возвращает id набора данных, и повторный вопрос читает сохранённое, без нового обхода веба.
«А теперь только до €30 000, отсортируй по убыванию» выполняется по сохранённой таблице за секунды, наборы данных живут до 30 дней.

💼 Зачем это агентам:
Фаундеры Андрей Стыскин и Матиас Петри по 20 лет строили поиск в Яндексе и Amazon Alexa, в Keenable уже проиндексировано 100+ млрд страниц, поиск для агентов в разы дешевле.
Схема «агент читает ссылки по одной и собирает ответ руками» становится одним tool call'ом: сервер отдаёт готовые строки с источниками.

Подключается за минуту к Claude Code, Cursor, VS Code, ChatGPT в developer mode, по одному API-ключу на всё.

Честные оговорки из документации: запрос занимает секунды-минуты, извлечение не проверяет факты, точные цифры сверяй по независимым страницам.

📎 SELECT · Документация · TechCrunch о раунде

#Keenable #агенты #SQL
———
@tsingular | Max | YouTube | RuTube
🔥641👍1
Gemini 3.8 Flash и отдельная версия для кибербеза

Google выкатил Gemini 3.8 Flash: лучшую свою модель для кодинга и рассуждений при цене и скорости 3.7, плюс отдельный вариант 3.8 Flash Cyber для ИБ.

Оба варианта построены на общем ядре, прокачанном в том числе тренировкой на задачах кибербезопасности.

🔧 Что умеет базовая 3.8 Flash:
На DeepSWE v1.1 обходит большинство больших фронттир-моделей в автономном решении инженерных задач, при этом стоит дешевле.
В профессиональных областях обходит 3.7 и конкурентов: Vals Finance Agent V2 для финансов, Harvey Legal Agent для юристов, 54,9% на HLE-Verified.
На сложных задачах модель работает усерднее, делает больше шагов и чаще использует инструменты, даже если тратит больше токенов.
Для экономных режимов есть параметр effort и по-прежнему поддерживаемая 3.7 Flash.

🛡 А теперь про Cyber-вариант:
Отдельная модель для доверенных защитников по программе Fairwind (Palo Alto Networks, Snowflake, Wiz среди партнёров).
На CyberGym, бенчмарке поиска уязвимостей, показывает фронттир-уровень, обходит 3.5 Flash Cyber и модели крупнее.
На внутреннем бенчмарке по 20 языкам находит уязвимости с успехом выше 70%.
Приоритет отдан патчингу, а не эксплойтам: на CWE-Bench 47,2% pass@1 против 47,8% у лидирующей фронттир-модели, но дешевле.
Google уже использует 3.8 Flash Cyber для защиты собственного кода.

Цены до конца года: $0,75 за миллион входных токенов и $3,75 за выходные, с 1 января дороже. ($1.5 вход/ $7.5 выход)

Получается реальный конкурент DeepSeek Pro и GLM 5.3 вышел.

📎 Анонс в блоге Google

#Gemini #cybersecurity #агенты
———
@tsingular | Max | YouTube | RuTube
🔥911
This media is not supported in your browser
VIEW IN TELEGRAM
Nousportal запустили реффералку.

теперь при покупке подписки вы получите $15 скидки.
Т.е. план будет стоить не $20 для вас, а всего $5

Регаться по ссылке

#NousResearch #скидки
———
@tsingular
❤‍🔥421
Higgsfield выпустили плагин для смартфона, который превращает его в контроллер камеры в сцене.
В итоге нейрорендер получил еще больше реализма в кадре.

Осталось подключить модели, которые видео рендерят быстрее реального времени и можно прикручивать к играм.

#higgsfield #нейрорендер
------
@tsingular
🔥9432