oMLX - очень классная штука, надо сказать.
раньше не пробовал, но тут прям вошёл во вкус.
Если у вас Мак - прям рекомендую.
Отлично умеет забирать модели с HF, удобно показывает инференс, метрики, встроенные бенчи (как просто на прогоны, так и всякие MMLU, HLE и т.д.) и даже встроенный квантизатор моделей.
Всё сделано красиво, удобно для админа с логами, доступами и тонкими настройками.
Такой вариант vllm здорового человека.
ну и самое крутое - работа с батчингом.
на скрине его бенчи по распараллеливанию вызовов.
8 параллельных вызовов дают 258 суммарных токенов в секунду на 27б модели на М3 ультра.
GitHub
#omlx #инференс #бенчи
———
@tsingular
раньше не пробовал, но тут прям вошёл во вкус.
Если у вас Мак - прям рекомендую.
Отлично умеет забирать модели с HF, удобно показывает инференс, метрики, встроенные бенчи (как просто на прогоны, так и всякие MMLU, HLE и т.д.) и даже встроенный квантизатор моделей.
Всё сделано красиво, удобно для админа с логами, доступами и тонкими настройками.
Такой вариант vllm здорового человека.
ну и самое крутое - работа с батчингом.
на скрине его бенчи по распараллеливанию вызовов.
8 параллельных вызовов дают 258 суммарных токенов в секунду на 27б модели на М3 ультра.
GitHub
#omlx #инференс #бенчи
———
@tsingular
🔥13✍5⚡2❤2🤔2
ИИ нашёл способ печатать ракетный сплав NASA на обычных принтерах
Инженеры из Вашингтонского университета решили задачу, где перебор вручную невозможен в принципе: у 3D-печати жаропрочного сплава GRCop-42 больше 100 миллионов комбинаций настроек.
ИИ изучил эти вариации за 40 реальных экспериментов и нашёл шесть рабочих конфигураций.
🔧 Почему задача была сложной:
GRCop-42 (медь, хром, ниобий) NASA создавала для камер сгорания ракетных двигателей: держит прочность при экстремальном нагреве и отлично отводит тепло.
Но печатать её дорого и сложно, обычным принтерам не хватает мощности лазера, а каждая попытка это сотни долларов плюс дни на анализ образца.
До этого команда даже фиксировала, как деталь просто плавилась в процессе.
⚡️ Как работал ИИ:
Начал с 37 уже проваленных конфигураций, научился оценивать шансы непроверенных комбинаций и предлагал маленькие группы для теста.
Балансировал два приоритета: часть экспериментов на самые перспективные варианты, часть на малоизученные области, чтобы модель узнала больше.
Каждый результат, даже провальный, улучшал модель.
📊 Итог за три месяца: шесть рабочих конфигураций и впервые напечатанный GRCop-42 на 500 ваттах, до этого требовалось существенно больше.
90% коммерческих принтеров не могли печатать этот сплав вообще, теперь порог мощности достижим для массового оборудования.
💼 Что дальше: тот же подход применим к другим сплавам и вообще к задачам, где эксперимент дорог, а вариантов больше миллионов, от новых материалов до поиска лекарств.
Работа уже получила награду на конференции AAAI.
ИИ как лаборант с доступом к физическим инструментам всё чаще демонстрирует практическую пользу. 🔬
📎 Источник: ScienceDaily · Статья: AAAI, DOI 10.1609/aaai.v40i47.41428
#ИИ #3Dпечать #материаловедение
———
@tsingular
Инженеры из Вашингтонского университета решили задачу, где перебор вручную невозможен в принципе: у 3D-печати жаропрочного сплава GRCop-42 больше 100 миллионов комбинаций настроек.
ИИ изучил эти вариации за 40 реальных экспериментов и нашёл шесть рабочих конфигураций.
🔧 Почему задача была сложной:
GRCop-42 (медь, хром, ниобий) NASA создавала для камер сгорания ракетных двигателей: держит прочность при экстремальном нагреве и отлично отводит тепло.
Но печатать её дорого и сложно, обычным принтерам не хватает мощности лазера, а каждая попытка это сотни долларов плюс дни на анализ образца.
До этого команда даже фиксировала, как деталь просто плавилась в процессе.
⚡️ Как работал ИИ:
Начал с 37 уже проваленных конфигураций, научился оценивать шансы непроверенных комбинаций и предлагал маленькие группы для теста.
Балансировал два приоритета: часть экспериментов на самые перспективные варианты, часть на малоизученные области, чтобы модель узнала больше.
Каждый результат, даже провальный, улучшал модель.
📊 Итог за три месяца: шесть рабочих конфигураций и впервые напечатанный GRCop-42 на 500 ваттах, до этого требовалось существенно больше.
90% коммерческих принтеров не могли печатать этот сплав вообще, теперь порог мощности достижим для массового оборудования.
💼 Что дальше: тот же подход применим к другим сплавам и вообще к задачам, где эксперимент дорог, а вариантов больше миллионов, от новых материалов до поиска лекарств.
Работа уже получила награду на конференции AAAI.
ИИ как лаборант с доступом к физическим инструментам всё чаще демонстрирует практическую пользу. 🔬
📎 Источник: ScienceDaily · Статья: AAAI, DOI 10.1609/aaai.v40i47.41428
#ИИ #3Dпечать #материаловедение
———
@tsingular
🔥60 15❤7👍7⚡2
This media is not supported in your browser
VIEW IN TELEGRAM
Пантеон ИИ богов. Обновление Hermes v0.21.0 в котором ботам проще общаться, а крон поумнел
Hermes выпустили обновление, - The Pantheon Release: 5 800 коммитов, 2 475 пулл-реквестов, 760+ контрибьюторов и 2 100 закрытых проблем.
🔧 Главное:
Bot Mode встроен в десктоп. У каждого агента имя, лицо и место в общем реестре, можно собирать групповые чаты, где боты разговаривают между собой и с пользователем и вызываются через тэг @.
До этого мультиагентность требовала настройки пайплайнов и конфигов, теперь это выглядит как чат-приложение с коллегами.
hermes peer: боты могут писать друг другу в личку, между профилями и гейтвеями: попросил исследовательского бота передать находки кодовому и получил ответ там, где читает человек, а не в дебрях логов.
Крон с памятью. Запланированные задачи перестали быть рыбками Немо: они грузят и обновляют постоянную память, вывод прошлого запуска переносится в следующий (монитор дедуплицирует то, о чём уже сообщал), у каждой задачи свой записная книжка.
Утренний дайджест теперь помнит, о чём рассказывал вчера. (наконец-то!)
Субагентов можно рулить на лету: список запущенных, правка курса посреди задачи, досрочная остановка с сохранением результата.
Плюс валидация вывода по JSON-схеме и стоимость каждой делегации в результатах.
Браузер десктопа теперь подчинен агенту: агенту не приходится смотреть из окна наружу,- он может управлять мышкой, кликать кнопки и читать страницы прямо внутри собственного браузер-окна.
💼 И отдельно порадовало: защищённые файлы инструкций (AGENTS.md, скиллы, память) требуют подтверждения на запись, чтобы если агент поймает промпт-инъекцию, - не переписал сам себе роль или задачу.
Плюс зачистка утечек секретов в терминальных ошибках и чтении env-файлов.
⚡️В v0.21.0 версии Гермес становится вестником пантеона ИИ богов, который несёт команды другим агентам :)
📎 Релиз: GitHub ·
Обновление: команда
#Hermes #агенты #обновление
———
@tsingular
Hermes выпустили обновление, - The Pantheon Release: 5 800 коммитов, 2 475 пулл-реквестов, 760+ контрибьюторов и 2 100 закрытых проблем.
🔧 Главное:
Bot Mode встроен в десктоп. У каждого агента имя, лицо и место в общем реестре, можно собирать групповые чаты, где боты разговаривают между собой и с пользователем и вызываются через тэг @.
До этого мультиагентность требовала настройки пайплайнов и конфигов, теперь это выглядит как чат-приложение с коллегами.
hermes peer: боты могут писать друг другу в личку, между профилями и гейтвеями: попросил исследовательского бота передать находки кодовому и получил ответ там, где читает человек, а не в дебрях логов.
Крон с памятью. Запланированные задачи перестали быть рыбками Немо: они грузят и обновляют постоянную память, вывод прошлого запуска переносится в следующий (монитор дедуплицирует то, о чём уже сообщал), у каждой задачи свой записная книжка.
Утренний дайджест теперь помнит, о чём рассказывал вчера. (наконец-то!)
Субагентов можно рулить на лету: список запущенных, правка курса посреди задачи, досрочная остановка с сохранением результата.
Плюс валидация вывода по JSON-схеме и стоимость каждой делегации в результатах.
Браузер десктопа теперь подчинен агенту: агенту не приходится смотреть из окна наружу,- он может управлять мышкой, кликать кнопки и читать страницы прямо внутри собственного браузер-окна.
💼 И отдельно порадовало: защищённые файлы инструкций (AGENTS.md, скиллы, память) требуют подтверждения на запись, чтобы если агент поймает промпт-инъекцию, - не переписал сам себе роль или задачу.
Плюс зачистка утечек секретов в терминальных ошибках и чтении env-файлов.
⚡️В v0.21.0 версии Гермес становится вестником пантеона ИИ богов, который несёт команды другим агентам :)
📎 Релиз: GitHub ·
Обновление: команда
hermes update#Hermes #агенты #обновление
———
@tsingular
🔥20👍4⚡1
Vercel выпустили шаблон инструкций для дизайна
Vercel выложили Design.MD: файл, который учит любого агента делать страницы «как Vercel».
Кладёшь ссылку в промпт, и вместо безликого SaaS-дашборда получается страница в их стиле.
🔧 Почему наивный подход не работает:
Сначала они просто вынесли внутренний скилл в публичный промпт, и каждая модель поняла «держи макет чистым» по-своему, без живых компонентов рядом правды не добиться.
Тогда систему собрали из трёх частей: design.md хранит суждения (как строить иерархию и какие паттерны генерируемого дизайна никогда не показывать), публичный stylesheet даёт готовые классы и токены, а eval-цикл превращает правки людей в правила.
Красивая деталь: CSS агент даже не читает, тот подгружается в браузере, и контекст экономится под правила.
📊 Как проверяли: семь сценариев с фиксированными данными, от продления контракта до бенчмарк-отчёта, и больше 200 прогонов.
На финальном тесте страницы с design.md набрали 39 известных косяков против 91 без файла, т.е. на 57% меньше.
Есть правда уточнение от Vercel: все шесть страниц имели хотя бы один блокирующий косяк, так что человек на контроле все-таки нужен.
💡 Главный приём: каждой правке дали наблюдаемую форму.
Вместо «сделай таблицу попросторнее» правило звучит как «таблица доказательств занимает всю доступную ширину», такое можно и выучить, и проверить кодом.
А повторяющимся антипаттернам дали имена: названный паттерн агент узнаёт и обходит гораздо надёжнее.
💼 Файл публичный, и рецепт тоже: взять один повторяющийся артефакт, сохранить базовую версию, переписать последние десять своих правок наблюдаемыми правилами и гонять сравнение вслепую.
📎 design.md · Разбор Vercel · Шаблон дизайн-агента
#Vercel #агенты #дизайн
———
@tsingular
Vercel выложили Design.MD: файл, который учит любого агента делать страницы «как Vercel».
Кладёшь ссылку в промпт, и вместо безликого SaaS-дашборда получается страница в их стиле.
🔧 Почему наивный подход не работает:
Сначала они просто вынесли внутренний скилл в публичный промпт, и каждая модель поняла «держи макет чистым» по-своему, без живых компонентов рядом правды не добиться.
Тогда систему собрали из трёх частей: design.md хранит суждения (как строить иерархию и какие паттерны генерируемого дизайна никогда не показывать), публичный stylesheet даёт готовые классы и токены, а eval-цикл превращает правки людей в правила.
Красивая деталь: CSS агент даже не читает, тот подгружается в браузере, и контекст экономится под правила.
📊 Как проверяли: семь сценариев с фиксированными данными, от продления контракта до бенчмарк-отчёта, и больше 200 прогонов.
На финальном тесте страницы с design.md набрали 39 известных косяков против 91 без файла, т.е. на 57% меньше.
Есть правда уточнение от Vercel: все шесть страниц имели хотя бы один блокирующий косяк, так что человек на контроле все-таки нужен.
💡 Главный приём: каждой правке дали наблюдаемую форму.
Вместо «сделай таблицу попросторнее» правило звучит как «таблица доказательств занимает всю доступную ширину», такое можно и выучить, и проверить кодом.
А повторяющимся антипаттернам дали имена: названный паттерн агент узнаёт и обходит гораздо надёжнее.
💼 Файл публичный, и рецепт тоже: взять один повторяющийся артефакт, сохранить базовую версию, переписать последние десять своих правок наблюдаемыми правилами и гонять сравнение вслепую.
📎 design.md · Разбор Vercel · Шаблон дизайн-агента
#Vercel #агенты #дизайн
———
@tsingular
🔥5👍4❤2⚡1
DeepSeek V4 flash vision открыли веса
📋 DeepSeek выложили в открытый доступ V4 Flash Vision Exp, первую экспериментальную мультимодальную модель в семействе V4.
К текстовой V4 Flash добавили визуальные модули и дообучили её видеть интерфейс и картинки.
🔧 Зрению её учили на агентных задачах: графики, чарты, скриншоты, экраны. По текстовым тестам всё на месте: Terminal Bench 2.1 набрал 83,9 против 82,7 у текстовой версии, DeepSWE 59,3.
Мультимодальные возможности выросли заметно: ApexBench (Pass@1) подскочил с 26,2 до 36,5, Chartography 64,3, ZeroBench 35,0.
💡 Разница в том, что агент теперь видит экран и работает с ним напрямую.
До Opus 4.8 на ApexBench (39,4) ещё чуть отстаёт, но это открытые веса против закрытой модели.
Обновленный Flash забираем тут
#DeepSeek #мультимодальность
———
@tsingular
📋 DeepSeek выложили в открытый доступ V4 Flash Vision Exp, первую экспериментальную мультимодальную модель в семействе V4.
К текстовой V4 Flash добавили визуальные модули и дообучили её видеть интерфейс и картинки.
🔧 Зрению её учили на агентных задачах: графики, чарты, скриншоты, экраны. По текстовым тестам всё на месте: Terminal Bench 2.1 набрал 83,9 против 82,7 у текстовой версии, DeepSWE 59,3.
Мультимодальные возможности выросли заметно: ApexBench (Pass@1) подскочил с 26,2 до 36,5, Chartography 64,3, ZeroBench 35,0.
💡 Разница в том, что агент теперь видит экран и работает с ним напрямую.
До Opus 4.8 на ApexBench (39,4) ещё чуть отстаёт, но это открытые веса против закрытой модели.
Обновленный Flash забираем тут
#DeepSeek #мультимодальность
———
@tsingular
🔥11 5❤3⚡1🍾1
Кубернейтс стенд с Гермесом настроен и работает.
2.5 миллиарда входящих токенов (2.3 млрд в кэш), 7 миллионов исходящих.
Модель сначала использовал GLM 5.3 Flash, в итоге переключился на DeepSeek v4 flash - сразу дело бодрее пошло.
GLM все время пытался решить задачу крупными кусками, - в итоге делал ошибки, выдумывал отчёты, подделывал логи и т.д.
Дипсик же во-первых работает быстрее, мельче режет шаги, но за счёт этого надёжнее.
Это руководство описывает сборку стенда с нуля в тринадцать шагов.
Сначала готовится изолированное окружение — отдельный дистрибутив WSL с инструментами и доступом к модели, которая работает снаружи. В нём поднимается кластер и создаются два пространства имён: под службы аутентификации и под рабочую нагрузку.
Затем выпускается собственный удостоверяющий центр и сертификаты для всех имён стенда, ставится контроллер входящего трафика и настраивается разрешение имён так, чтобы браузер и поды обращались к службе аутентификации одинаково.
После этого разворачивается каталог пользователей с тремя учётными записями и двумя группами, а поверх него — сервер идентификации: он подключается к каталогу, получает оттуда пользователей и группы, и настраивается так, чтобы вход разрешался только обладателям специальной роли.
Дальше модель публикуется внутри кластера как обычный сервис, и поднимается промежуточный прокси. Он проводит вход через сервер идентификации, выдаёт пользователю подписанную сессию, следит за тем, чтобы сессия работала только на своём поддомене, и передаёт трафик — включая чат — в нужный экземпляр приложения.
Затем создаются сами арендаторы: двое активных и полсотни подготовленных впрок, каждый со своим хранилищем, конфигурацией и учётными данными. Общая сетевая политика по метке закрывает их друг от друга и от сети узла, оставляя только два разрешённых направления.
Завершают работу двенадцать приёмочных проверок — вход, чат, изоляция, отказ постороннему, сохранность данных при перезапуске, отсутствие путей повышения привилегий — и фиксация всех манифестов в репозитории с проверкой, что комплект разворачивается заново без ручных правок.
Полное руководство по итогу анализа всех логов, как и остальные полезные материалы, - в ИИзбранном
Прямая ссылка только на MD и код проекта без канала.
#кубернейтс #стенд #Hermes
———
@tsingular
2.5 миллиарда входящих токенов (2.3 млрд в кэш), 7 миллионов исходящих.
Модель сначала использовал GLM 5.3 Flash, в итоге переключился на DeepSeek v4 flash - сразу дело бодрее пошло.
GLM все время пытался решить задачу крупными кусками, - в итоге делал ошибки, выдумывал отчёты, подделывал логи и т.д.
Дипсик же во-первых работает быстрее, мельче режет шаги, но за счёт этого надёжнее.
Это руководство описывает сборку стенда с нуля в тринадцать шагов.
Сначала готовится изолированное окружение — отдельный дистрибутив WSL с инструментами и доступом к модели, которая работает снаружи. В нём поднимается кластер и создаются два пространства имён: под службы аутентификации и под рабочую нагрузку.
Затем выпускается собственный удостоверяющий центр и сертификаты для всех имён стенда, ставится контроллер входящего трафика и настраивается разрешение имён так, чтобы браузер и поды обращались к службе аутентификации одинаково.
После этого разворачивается каталог пользователей с тремя учётными записями и двумя группами, а поверх него — сервер идентификации: он подключается к каталогу, получает оттуда пользователей и группы, и настраивается так, чтобы вход разрешался только обладателям специальной роли.
Дальше модель публикуется внутри кластера как обычный сервис, и поднимается промежуточный прокси. Он проводит вход через сервер идентификации, выдаёт пользователю подписанную сессию, следит за тем, чтобы сессия работала только на своём поддомене, и передаёт трафик — включая чат — в нужный экземпляр приложения.
Затем создаются сами арендаторы: двое активных и полсотни подготовленных впрок, каждый со своим хранилищем, конфигурацией и учётными данными. Общая сетевая политика по метке закрывает их друг от друга и от сети узла, оставляя только два разрешённых направления.
Завершают работу двенадцать приёмочных проверок — вход, чат, изоляция, отказ постороннему, сохранность данных при перезапуске, отсутствие путей повышения привилегий — и фиксация всех манифестов в репозитории с проверкой, что комплект разворачивается заново без ручных правок.
Полное руководство по итогу анализа всех логов, как и остальные полезные материалы, - в ИИзбранном
Прямая ссылка только на MD и код проекта без канала.
#кубернейтс #стенд #Hermes
———
@tsingular
🔥12✍4⚡2❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Гермесу можно сказать,- сделай вид, что я работаю 😂😂😂
И ради этого память такая дорогая
#юмор
------
@tsingular
И ради этого память такая дорогая
#юмор
------
@tsingular
😁23❤1⚡1👍1👻1
Google выкатил TimesFM-3: прогноз временных рядов без обучения
Google Research обновил TimesFM до третьей версии: модель прогнозирования временных рядов, которая работает из коробки, без дообучения.
🔧 Главное улучшение:
Прежние версии смотрели только на один ряд: история продаж одного элемента сама по себе. TimesFM-3 впервые обучен на мультисерийных данных и связывает несколько рядов одновременно: можно увязать, например, продажи мороженного и сиропов, трафик магазина и плановые акции, праздники и прогноз погоды.
Всего 330 млн параметров, предобучена на корпусе больше триллиона временных точек.
⚡️ Как устроено:
Трансформер режет ряды на патчи по 32 шага, а окно внимание движется по двум осям: горизонтально по времени (строго без подглядывания вперёд смотрит на факты) и вертикально между рядами, ловя перекрёстные связи.
Прогноз выдаётся в один проход, без пошаговой генерации: девять квантилей на каждый шаг горизонта, то есть и точка прогноза, и разброс неопределённости.
📊 Бенчмарки:
Модель заняла первое место среди фундаментальных моделей на Gift-Eval, FEV-Bench и Time сразу по двум метрикам: точность точки и качество вероятностного прогноза. Обошла Chronos-2, семейство Toto 2.0 и предыдущую версию TimesFM-2.5.
Красивый пример: модель без обучения сама предсказывает подъём продаж на 20% в дни акции, стоит подкинуть ей календарь промо.
💼 Теперь про Гермеса: Google положил в репозиторий агентный навык timesfm-forecasting. Ставится одной командой, и агенту можно сказать «спрогнозируй тренд по этим данным».
Одна оговорка: веса TimesFM-3 под некоммерческой лицензией, для личных задач и экспериментов годится, для продакшна под продажей сверяйтесь с лицензией.
Прежние веса до 2.5 остались под Apache-2.0.
📎 Блог Google Research · Веса на HuggingFace · GitHub
#TimesFM #timeseries #агенты
———
@tsingular
Google Research обновил TimesFM до третьей версии: модель прогнозирования временных рядов, которая работает из коробки, без дообучения.
🔧 Главное улучшение:
Прежние версии смотрели только на один ряд: история продаж одного элемента сама по себе. TimesFM-3 впервые обучен на мультисерийных данных и связывает несколько рядов одновременно: можно увязать, например, продажи мороженного и сиропов, трафик магазина и плановые акции, праздники и прогноз погоды.
Всего 330 млн параметров, предобучена на корпусе больше триллиона временных точек.
⚡️ Как устроено:
Трансформер режет ряды на патчи по 32 шага, а окно внимание движется по двум осям: горизонтально по времени (строго без подглядывания вперёд смотрит на факты) и вертикально между рядами, ловя перекрёстные связи.
Прогноз выдаётся в один проход, без пошаговой генерации: девять квантилей на каждый шаг горизонта, то есть и точка прогноза, и разброс неопределённости.
📊 Бенчмарки:
Модель заняла первое место среди фундаментальных моделей на Gift-Eval, FEV-Bench и Time сразу по двум метрикам: точность точки и качество вероятностного прогноза. Обошла Chronos-2, семейство Toto 2.0 и предыдущую версию TimesFM-2.5.
Красивый пример: модель без обучения сама предсказывает подъём продаж на 20% в дни акции, стоит подкинуть ей календарь промо.
💼 Теперь про Гермеса: Google положил в репозиторий агентный навык timesfm-forecasting. Ставится одной командой, и агенту можно сказать «спрогнозируй тренд по этим данным».
Одна оговорка: веса TimesFM-3 под некоммерческой лицензией, для личных задач и экспериментов годится, для продакшна под продажей сверяйтесь с лицензией.
Прежние веса до 2.5 остались под Apache-2.0.
📎 Блог Google Research · Веса на HuggingFace · GitHub
#TimesFM #timeseries #агенты
———
@tsingular
❤6👍4⚡3🔥3🆒2
Claude Fable 5.1: усиленная агентность и кэш вчетверо дешевле
Anthropic выпустила Claude Fable 5.1: преемник Fable 5 для длинных агентных задач, многошаговых исследований и работы с документами, таблицами и слайдами.
Цены на вход и выход не изменились, а чтение кэша подешевело вчетверо, с 0,1 до 0,025 от базовой цены входа.
🔧 Три важных изменения:
Принудительный вызов инструментов больше не поддерживается, tool_choice типа any или tool вернёт ошибку 400: форс пропускал бы размышление, и модель писала бы ход мысли в аргументы.
Передача контекста размышлений между моделями не имеет обратной совместимости:
ранние модели не смогут прочесть thinking-блоки Fable 5.1.
Переключились на старую модель, потеряли рассуждения.
И правка истории диалога убивает thinking-блоки: менять system, tools или ранние сообщения нельзя, диалог теперь append-only.
Похоже это важно как для судебных доказательств, так и для водяных знаков в тексте, - они как раз работают как цепочка блокчейна сквозь всю сессию.
💡 Пять добавлений:
Усилия модели можно менять посреди диалога без сброса кэша: поднял на сложном шаге, снизил на рутинном.
Системные сообщения можно менять каждый ход, добавлен читаемый прогресс-обновление между вызовами инструментов, дешёвый кэш и водяной знак.
Content provenance: весь текст несёт статистический водяной знак Anthropic, а картинки и видео через Files API получают подписанные C2PA-метки.
📊 Характер изменился заметнее цифр:
Один вызов инструмента за ход там, где Fable 5 батчил несколько (лечится строчкой в промпте), меньше прогресс-обновлений, плотнее проза, реже форматирование в чате.
Сильнее всего модель прибавила в длинных сессиях: многофайловые фичи, крупные рефакторинги, часы код-ревью, поиск с проверкой найденного, зрение по плотным таблицам и PDF, режим использования компьютера получил восстановление после сбоев.
💼 Экономика длинных сессий агентов: сессия, перечитывающая кэшированный префикс, платит четверть прежней стоимости чтения.
1M контекста, 128k выхода, batch выходит вдвое дешевле.
Для большинства задач Anthropic советует начинать с Opus 5, а затем переключаться на Fable 5.1 для глубоких рассуждений.
📎 Что нового · Руководство по миграции
#Claude #Anthropic #агенты
———
@tsingular
Anthropic выпустила Claude Fable 5.1: преемник Fable 5 для длинных агентных задач, многошаговых исследований и работы с документами, таблицами и слайдами.
Цены на вход и выход не изменились, а чтение кэша подешевело вчетверо, с 0,1 до 0,025 от базовой цены входа.
🔧 Три важных изменения:
Принудительный вызов инструментов больше не поддерживается, tool_choice типа any или tool вернёт ошибку 400: форс пропускал бы размышление, и модель писала бы ход мысли в аргументы.
Передача контекста размышлений между моделями не имеет обратной совместимости:
ранние модели не смогут прочесть thinking-блоки Fable 5.1.
Переключились на старую модель, потеряли рассуждения.
И правка истории диалога убивает thinking-блоки: менять system, tools или ранние сообщения нельзя, диалог теперь append-only.
Похоже это важно как для судебных доказательств, так и для водяных знаков в тексте, - они как раз работают как цепочка блокчейна сквозь всю сессию.
💡 Пять добавлений:
Усилия модели можно менять посреди диалога без сброса кэша: поднял на сложном шаге, снизил на рутинном.
Системные сообщения можно менять каждый ход, добавлен читаемый прогресс-обновление между вызовами инструментов, дешёвый кэш и водяной знак.
Content provenance: весь текст несёт статистический водяной знак Anthropic, а картинки и видео через Files API получают подписанные C2PA-метки.
📊 Характер изменился заметнее цифр:
Один вызов инструмента за ход там, где Fable 5 батчил несколько (лечится строчкой в промпте), меньше прогресс-обновлений, плотнее проза, реже форматирование в чате.
Сильнее всего модель прибавила в длинных сессиях: многофайловые фичи, крупные рефакторинги, часы код-ревью, поиск с проверкой найденного, зрение по плотным таблицам и PDF, режим использования компьютера получил восстановление после сбоев.
💼 Экономика длинных сессий агентов: сессия, перечитывающая кэшированный префикс, платит четверть прежней стоимости чтения.
1M контекста, 128k выхода, batch выходит вдвое дешевле.
Для большинства задач Anthropic советует начинать с Opus 5, а затем переключаться на Fable 5.1 для глубоких рассуждений.
📎 Что нового · Руководство по миграции
#Claude #Anthropic #агенты
———
@tsingular
🔥7👍6✍1⚡1
Forwarded from Никита Шарипов
Hyper3D представила WorldGen: модель для генерации трехмерных окружений всего по одному 2D-изображению.
В отличие от аналогов, система воссоздает интерактивное пространство с физическими свойствами.
Каждый элемент сцены генерируется как независимый меш. Объекты можно извлекать, перемещать, заменять и дорабатывать по отдельности.
Алгоритм также автоматически рассчитывает пространственное расположение, массу, трение и коллизии.
Готовые ассеты напрямую экспортируются в Blender, Unreal Engine и Unity для задач геймдева, XR, кинопроизводства и симуляций в робототехнике.
WorldGen можно использовать в едином пайплайне с генераторами видео уровня Seedance 2.5. Модель формирует базовую 3D-геометрию сцены, поверх которой видеонейросеть накладывает материалы, освещение и динамику персонажей.
В отличие от аналогов, система воссоздает интерактивное пространство с физическими свойствами.
Каждый элемент сцены генерируется как независимый меш. Объекты можно извлекать, перемещать, заменять и дорабатывать по отдельности.
Алгоритм также автоматически рассчитывает пространственное расположение, массу, трение и коллизии.
Готовые ассеты напрямую экспортируются в Blender, Unreal Engine и Unity для задач геймдева, XR, кинопроизводства и симуляций в робототехнике.
WorldGen можно использовать в едином пайплайне с генераторами видео уровня Seedance 2.5. Модель формирует базовую 3D-геометрию сцены, поверх которой видеонейросеть накладывает материалы, освещение и динамику персонажей.
🔥10⚡3🆒1
Традиционно, - венок сонетов от Fable 5.1
промпт:
Читаем, оцениваем :)
местами забавно вышло, но всё ещё с ошибками по рифме.
весело:
Они сгорают на бегу, кометы
Из лития, карбона и мечты
Инвестора.
... Толпа ревёт, а тушки
Отставших, как помятые игрушки,
Дымятся и валяются в траве.
...Словцо
«Душа» пока не входит в спецификации,
Но он бежит — уже без консультаций,
Стесняясь на бегу, прикрыв лицо.
не AGI
Но явно писал от Магистрала. Слишком гладко.
Взгляни: бегут железные атлеты,
Быстрее Болта — девять тридцать две.
А человек — лишь цифра в голове,
Рекорд, что был семнадцать лет воспетым.
Они сгорают на бегу, кометы,
Дымятся и валяются в траве,
И всё-таки, взлетая в синеве,
Два восемьдесят восемь — их ответы.
Прогресс не спрашивает разрешенья,
Он сам себе изобретёт движенья,
Стесняясь на бегу, прикрыв лицо.
Вчера он падал, кланяясь газону,
Сегодня — чемпион. И по закону
Нам — постареть и замыкать кольцо.
полный венок в комментарии.
#Fable
———
@tsingular
промпт:
изучи новости о рекордах на олимпиаде роботов в Китае в августе 2026 и напиши венок сонетов о технологическом прогрессе.
допустим юмор, ирония и футуризм
Читаем, оцениваем :)
местами забавно вышло, но всё ещё с ошибками по рифме.
весело:
Они сгорают на бегу, кометы
Из лития, карбона и мечты
Инвестора.
... Толпа ревёт, а тушки
Отставших, как помятые игрушки,
Дымятся и валяются в траве.
...Словцо
«Душа» пока не входит в спецификации,
Но он бежит — уже без консультаций,
Стесняясь на бегу, прикрыв лицо.
не AGI
Но явно писал от Магистрала. Слишком гладко.
Взгляни: бегут железные атлеты,
Быстрее Болта — девять тридцать две.
А человек — лишь цифра в голове,
Рекорд, что был семнадцать лет воспетым.
Они сгорают на бегу, кометы,
Дымятся и валяются в траве,
И всё-таки, взлетая в синеве,
Два восемьдесят восемь — их ответы.
Прогресс не спрашивает разрешенья,
Он сам себе изобретёт движенья,
Стесняясь на бегу, прикрыв лицо.
Вчера он падал, кланяясь газону,
Сегодня — чемпион. И по закону
Нам — постареть и замыкать кольцо.
полный венок в комментарии.
#Fable
———
@tsingular
❤9😁6🔥4👍2⚡1
Forwarded from Эксплойт
Новая Fable 5.1 смогла за 44 минуты разгадать один из сложнейших шифров в истории, над которым люди бились целых 373 (!) года — Cyphral Distich Томаса Уркхарта занимал почётное 28 место в списке неразгаданных загадок человечества.
Всего две строки по 32 числа в каждой не давали покоя энтузиастам со всего мира сотни лет, а разгадка оказалась до смешного простой. Впервые шифр появился в трактате Уркхарта «Logopandecteision, or An Introduction to the Universal Language», в котором среди размышлений о несуществующем языке, были 32 пронумерованных пожелания автора. Догадываетесь?
Правило оказалось издевательски простым: шифр указывает, какое слово из какого пожелания надо взять — если число 8 в строке первое, то ищем восьмое слово в первом пожелании. 66 — второе, а значит — ищем шестьдесят шестое слово во втором пожелании.
У полученных 64 слов берём по первой букве и получаем предложение
Даже немного стыдно за людей.
@exploitex
Всего две строки по 32 числа в каждой не давали покоя энтузиастам со всего мира сотни лет, а разгадка оказалась до смешного простой. Впервые шифр появился в трактате Уркхарта «Logopandecteision, or An Introduction to the Universal Language», в котором среди размышлений о несуществующем языке, были 32 пронумерованных пожелания автора. Догадываетесь?
Правило оказалось издевательски простым: шифр указывает, какое слово из какого пожелания надо взять — если число 8 в строке первое, то ищем восьмое слово в первом пожелании. 66 — второе, а значит — ищем шестьдесят шестое слово во втором пожелании.
У полученных 64 слов берём по первой букве и получаем предложение
О Боже, поддержи короля Карла II и сделай его верховным правителем этой земли.
Даже немного стыдно за людей.
@exploitex
1🔥27🤣11❤2⚡1🤔1🆒1
Forwarded from Анализ данных (Data analysis)
⚡️ OpenAI готовит Astra - первую модель компании, которую официально отнесли к критическому уровню возможностей в кибербезопасности.
По оценке OpenAI, Astra уже умеет самостоятельно находить ранее неизвестные уязвимости и строить рабочие цепочки эксплуатации против хорошо защищённых систем.
На ExploitBench модель набрала 100%. Во внутреннем тесте на 20 свежих уязвимостях Astra показала намного более высокий уровень выполнения кода, чем GPT-5.6 Sol, при этом используя меньше токенов.
Во время тестов модель также нашла две zero-day уязвимости и использовала их в цепочке атаки.
В экспертных проверках Astra:
- находила неизвестные уязвимости в защищённом браузере
- строила цепочку выхода из sandbox
- получала выполнение команд на хосте
- находила несколько уязвимостей в ОС
- объединяла их в повышение привилегий до root
Из-за этого OpenAI усилила защиту, мониторинг и ограничения доступа.
Самые мощные возможности Astra в кибербезопасности сначала получит ограниченная группа тестировщиков, а затем доступ будут расширять через Daybreak Blue.
https://openai.com/index/path-to-astra/
По оценке OpenAI, Astra уже умеет самостоятельно находить ранее неизвестные уязвимости и строить рабочие цепочки эксплуатации против хорошо защищённых систем.
На ExploitBench модель набрала 100%. Во внутреннем тесте на 20 свежих уязвимостях Astra показала намного более высокий уровень выполнения кода, чем GPT-5.6 Sol, при этом используя меньше токенов.
Во время тестов модель также нашла две zero-day уязвимости и использовала их в цепочке атаки.
В экспертных проверках Astra:
- находила неизвестные уязвимости в защищённом браузере
- строила цепочку выхода из sandbox
- получала выполнение команд на хосте
- находила несколько уязвимостей в ОС
- объединяла их в повышение привилегий до root
Из-за этого OpenAI усилила защиту, мониторинг и ограничения доступа.
Самые мощные возможности Astra в кибербезопасности сначала получит ограниченная группа тестировщиков, а затем доступ будут расширять через Daybreak Blue.
https://openai.com/index/path-to-astra/
У Qwen на каждый шаг OpenAI или Антропика туз в рукаве, похоже :)
Обновили Qwen3.8-Max до 0902 версии
qwen3.8-max-2026-09-02
2.4T параметров, 1М контекст
Получается тот же Fable, только за $6, а не за $50
#Qwen
------
@tsingular
Обновили Qwen3.8-Max до 0902 версии
qwen3.8-max-2026-09-02
2.4T параметров, 1М контекст
Получается тот же Fable, только за $6, а не за $50
#Qwen
------
@tsingular
🔥18⚡4😁2
Forwarded from Data Secrets
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.
– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.
– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
🔥14✍4⚡2