Технозаметки Малышева
11.9K subscribers
5.18K photos
1.95K videos
43 files
5.18K links
Новости инноваций из мира Искусственного Интеллекта. 🤖 [РКН: 7021469833 ]

Всё об ИИ, ИТ трендах и Технологической Сингулярности.

🤖: @ai_gptfreebot [бесплатный бот]
✍️: @tsingular_bot [каталог ботов и курсов]

💸: https://pay.cloudtips.ru/p/c8960bbb
Download Telegram
oMLX - очень классная штука, надо сказать.
раньше не пробовал, но тут прям вошёл во вкус.

Если у вас Мак - прям рекомендую.

Отлично умеет забирать модели с HF, удобно показывает инференс, метрики, встроенные бенчи (как просто на прогоны, так и всякие MMLU, HLE и т.д.) и даже встроенный квантизатор моделей.
Всё сделано красиво, удобно для админа с логами, доступами и тонкими настройками.

Такой вариант vllm здорового человека.

ну и самое крутое - работа с батчингом.
на скрине его бенчи по распараллеливанию вызовов.

8 параллельных вызовов дают 258 суммарных токенов в секунду на 27б модели на М3 ультра.

GitHub

#omlx #инференс #бенчи
———
@tsingular
🔥13522🤔2
ИИ нашёл способ печатать ракетный сплав NASA на обычных принтерах

Инженеры из Вашингтонского университета решили задачу, где перебор вручную невозможен в принципе: у 3D-печати жаропрочного сплава GRCop-42 больше 100 миллионов комбинаций настроек.
ИИ изучил эти вариации за 40 реальных экспериментов и нашёл шесть рабочих конфигураций.

🔧 Почему задача была сложной:
GRCop-42 (медь, хром, ниобий) NASA создавала для камер сгорания ракетных двигателей: держит прочность при экстремальном нагреве и отлично отводит тепло.
Но печатать её дорого и сложно, обычным принтерам не хватает мощности лазера, а каждая попытка это сотни долларов плюс дни на анализ образца.
До этого команда даже фиксировала, как деталь просто плавилась в процессе.

⚡️ Как работал ИИ:
Начал с 37 уже проваленных конфигураций, научился оценивать шансы непроверенных комбинаций и предлагал маленькие группы для теста.
Балансировал два приоритета: часть экспериментов на самые перспективные варианты, часть на малоизученные области, чтобы модель узнала больше.
Каждый результат, даже провальный, улучшал модель.

📊 Итог за три месяца: шесть рабочих конфигураций и впервые напечатанный GRCop-42 на 500 ваттах, до этого требовалось существенно больше.
90% коммерческих принтеров не могли печатать этот сплав вообще, теперь порог мощности достижим для массового оборудования.

💼 Что дальше: тот же подход применим к другим сплавам и вообще к задачам, где эксперимент дорог, а вариантов больше миллионов, от новых материалов до поиска лекарств.
Работа уже получила награду на конференции AAAI.

ИИ как лаборант с доступом к физическим инструментам всё чаще демонстрирует практическую пользу. 🔬

📎 Источник: ScienceDaily · Статья: AAAI, DOI 10.1609/aaai.v40i47.41428

#ИИ #3Dпечать #материаловедение
———
@tsingular
🔥60157👍72
This media is not supported in your browser
VIEW IN TELEGRAM
Пантеон ИИ богов. Обновление Hermes v0.21.0 в котором ботам проще общаться, а крон поумнел

Hermes выпустили обновление, - The Pantheon Release: 5 800 коммитов, 2 475 пулл-реквестов, 760+ контрибьюторов и 2 100 закрытых проблем.

🔧 Главное:
Bot Mode встроен в десктоп. У каждого агента имя, лицо и место в общем реестре, можно собирать групповые чаты, где боты разговаривают между собой и с пользователем и вызываются через тэг @.
До этого мультиагентность требовала настройки пайплайнов и конфигов, теперь это выглядит как чат-приложение с коллегами.

hermes peer: боты могут писать друг другу в личку, между профилями и гейтвеями: попросил исследовательского бота передать находки кодовому и получил ответ там, где читает человек, а не в дебрях логов.

Крон с памятью. Запланированные задачи перестали быть рыбками Немо: они грузят и обновляют постоянную память, вывод прошлого запуска переносится в следующий (монитор дедуплицирует то, о чём уже сообщал), у каждой задачи свой записная книжка.

Утренний дайджест теперь помнит, о чём рассказывал вчера. (наконец-то!)

Субагентов можно рулить на лету: список запущенных, правка курса посреди задачи, досрочная остановка с сохранением результата.
Плюс валидация вывода по JSON-схеме и стоимость каждой делегации в результатах.

Браузер десктопа теперь подчинен агенту: агенту не приходится смотреть из окна наружу,- он может управлять мышкой, кликать кнопки и читать страницы прямо внутри собственного браузер-окна.

💼 И отдельно порадовало: защищённые файлы инструкций (AGENTS.md, скиллы, память) требуют подтверждения на запись, чтобы если агент поймает промпт-инъекцию, - не переписал сам себе роль или задачу.

Плюс зачистка утечек секретов в терминальных ошибках и чтении env-файлов.

⚡️В v0.21.0 версии Гермес становится вестником пантеона ИИ богов, который несёт команды другим агентам :)

📎 Релиз: GitHub ·

Обновление: команда hermes update

#Hermes #агенты #обновление
———
@tsingular
🔥20👍41
Vercel выпустили шаблон инструкций для дизайна

Vercel выложили Design.MD: файл, который учит любого агента делать страницы «как Vercel».
Кладёшь ссылку в промпт, и вместо безликого SaaS-дашборда получается страница в их стиле.

🔧 Почему наивный подход не работает:
Сначала они просто вынесли внутренний скилл в публичный промпт, и каждая модель поняла «держи макет чистым» по-своему, без живых компонентов рядом правды не добиться.

Тогда систему собрали из трёх частей: design.md хранит суждения (как строить иерархию и какие паттерны генерируемого дизайна никогда не показывать), публичный stylesheet даёт готовые классы и токены, а eval-цикл превращает правки людей в правила.
Красивая деталь: CSS агент даже не читает, тот подгружается в браузере, и контекст экономится под правила.

📊 Как проверяли: семь сценариев с фиксированными данными, от продления контракта до бенчмарк-отчёта, и больше 200 прогонов.
На финальном тесте страницы с design.md набрали 39 известных косяков против 91 без файла, т.е. на 57% меньше.

Есть правда уточнение от Vercel: все шесть страниц имели хотя бы один блокирующий косяк, так что человек на контроле все-таки нужен.

💡 Главный приём: каждой правке дали наблюдаемую форму.
Вместо «сделай таблицу попросторнее» правило звучит как «таблица доказательств занимает всю доступную ширину», такое можно и выучить, и проверить кодом.

А повторяющимся антипаттернам дали имена: названный паттерн агент узнаёт и обходит гораздо надёжнее.

💼 Файл публичный, и рецепт тоже: взять один повторяющийся артефакт, сохранить базовую версию, переписать последние десять своих правок наблюдаемыми правилами и гонять сравнение вслепую.

📎 design.md · Разбор Vercel · Шаблон дизайн-агента

#Vercel #агенты #дизайн
———
@tsingular
🔥5👍421
DeepSeek V4 flash vision открыли веса

📋 DeepSeek выложили в открытый доступ V4 Flash Vision Exp, первую экспериментальную мультимодальную модель в семействе V4.
К текстовой V4 Flash добавили визуальные модули и дообучили её видеть интерфейс и картинки.

🔧 Зрению её учили на агентных задачах: графики, чарты, скриншоты, экраны. По текстовым тестам всё на месте: Terminal Bench 2.1 набрал 83,9 против 82,7 у текстовой версии, DeepSWE 59,3.
Мультимодальные возможности выросли заметно: ApexBench (Pass@1) подскочил с 26,2 до 36,5, Chartography 64,3, ZeroBench 35,0.

💡 Разница в том, что агент теперь видит экран и работает с ним напрямую.
До Opus 4.8 на ApexBench (39,4) ещё чуть отстаёт, но это открытые веса против закрытой модели.

Обновленный Flash забираем тут

#DeepSeek #мультимодальность
———
@tsingular
🔥11531🍾1
Кубернейтс стенд с Гермесом настроен и работает.

2.5 миллиарда входящих токенов (2.3 млрд в кэш), 7 миллионов исходящих.

Модель сначала использовал GLM 5.3 Flash, в итоге переключился на DeepSeek v4 flash - сразу дело бодрее пошло.

GLM все время пытался решить задачу крупными кусками, - в итоге делал ошибки, выдумывал отчёты, подделывал логи и т.д.
Дипсик же во-первых работает быстрее, мельче режет шаги, но за счёт этого надёжнее.

Это руководство описывает сборку стенда с нуля в тринадцать шагов.

Сначала готовится изолированное окружение — отдельный дистрибутив WSL с инструментами и доступом к модели, которая работает снаружи. В нём поднимается кластер и создаются два пространства имён: под службы аутентификации и под рабочую нагрузку.

Затем выпускается собственный удостоверяющий центр и сертификаты для всех имён стенда, ставится контроллер входящего трафика и настраивается разрешение имён так, чтобы браузер и поды обращались к службе аутентификации одинаково.

После этого разворачивается каталог пользователей с тремя учётными записями и двумя группами, а поверх него — сервер идентификации: он подключается к каталогу, получает оттуда пользователей и группы, и настраивается так, чтобы вход разрешался только обладателям специальной роли.

Дальше модель публикуется внутри кластера как обычный сервис, и поднимается промежуточный прокси. Он проводит вход через сервер идентификации, выдаёт пользователю подписанную сессию, следит за тем, чтобы сессия работала только на своём поддомене, и передаёт трафик — включая чат — в нужный экземпляр приложения.

Затем создаются сами арендаторы: двое активных и полсотни подготовленных впрок, каждый со своим хранилищем, конфигурацией и учётными данными. Общая сетевая политика по метке закрывает их друг от друга и от сети узла, оставляя только два разрешённых направления.

Завершают работу двенадцать приёмочных проверок — вход, чат, изоляция, отказ постороннему, сохранность данных при перезапуске, отсутствие путей повышения привилегий — и фиксация всех манифестов в репозитории с проверкой, что комплект разворачивается заново без ручных правок.

Полное руководство по итогу анализа всех логов, как и остальные полезные материалы, - в ИИзбранном

Прямая ссылка только на MD и код проекта без канала.

#кубернейтс #стенд #Hermes
———
@tsingular
🔥12421
This media is not supported in your browser
VIEW IN TELEGRAM
Гермесу можно сказать,- сделай вид, что я работаю 😂😂😂

И ради этого память такая дорогая

#юмор
------
@tsingular
😁2311👍1👻1
Google выкатил TimesFM-3: прогноз временных рядов без обучения

Google Research обновил TimesFM до третьей версии: модель прогнозирования временных рядов, которая работает из коробки, без дообучения.

🔧 Главное улучшение:
Прежние версии смотрели только на один ряд: история продаж одного элемента сама по себе. TimesFM-3 впервые обучен на мультисерийных данных и связывает несколько рядов одновременно: можно увязать, например, продажи мороженного и сиропов, трафик магазина и плановые акции, праздники и прогноз погоды.

Всего 330 млн параметров, предобучена на корпусе больше триллиона временных точек.

⚡️ Как устроено:
Трансформер режет ряды на патчи по 32 шага, а окно внимание движется по двум осям: горизонтально по времени (строго без подглядывания вперёд смотрит на факты) и вертикально между рядами, ловя перекрёстные связи.

Прогноз выдаётся в один проход, без пошаговой генерации: девять квантилей на каждый шаг горизонта, то есть и точка прогноза, и разброс неопределённости.

📊 Бенчмарки:
Модель заняла первое место среди фундаментальных моделей на Gift-Eval, FEV-Bench и Time сразу по двум метрикам: точность точки и качество вероятностного прогноза. Обошла Chronos-2, семейство Toto 2.0 и предыдущую версию TimesFM-2.5.
Красивый пример: модель без обучения сама предсказывает подъём продаж на 20% в дни акции, стоит подкинуть ей календарь промо.

💼 Теперь про Гермеса: Google положил в репозиторий агентный навык timesfm-forecasting. Ставится одной командой, и агенту можно сказать «спрогнозируй тренд по этим данным».

Одна оговорка: веса TimesFM-3 под некоммерческой лицензией, для личных задач и экспериментов годится, для продакшна под продажей сверяйтесь с лицензией.
Прежние веса до 2.5 остались под Apache-2.0.

📎 Блог Google Research · Веса на HuggingFace · GitHub

#TimesFM #timeseries #агенты
———
@tsingular
6👍43🔥3🆒2
Claude Fable 5.1: усиленная агентность и кэш вчетверо дешевле

Anthropic выпустила Claude Fable 5.1: преемник Fable 5 для длинных агентных задач, многошаговых исследований и работы с документами, таблицами и слайдами.

Цены на вход и выход не изменились, а чтение кэша подешевело вчетверо, с 0,1 до 0,025 от базовой цены входа.

🔧 Три важных изменения:
Принудительный вызов инструментов больше не поддерживается, tool_choice типа any или tool вернёт ошибку 400: форс пропускал бы размышление, и модель писала бы ход мысли в аргументы.

Передача контекста размышлений между моделями не имеет обратной совместимости:
ранние модели не смогут прочесть thinking-блоки Fable 5.1.
Переключились на старую модель, потеряли рассуждения.
И правка истории диалога убивает thinking-блоки: менять system, tools или ранние сообщения нельзя, диалог теперь append-only.
Похоже это важно как для судебных доказательств, так и для водяных знаков в тексте, - они как раз работают как цепочка блокчейна сквозь всю сессию.

💡 Пять добавлений:
Усилия модели можно менять посреди диалога без сброса кэша: поднял на сложном шаге, снизил на рутинном.
Системные сообщения можно менять каждый ход, добавлен читаемый прогресс-обновление между вызовами инструментов, дешёвый кэш и водяной знак.

Content provenance: весь текст несёт статистический водяной знак Anthropic, а картинки и видео через Files API получают подписанные C2PA-метки.

📊 Характер изменился заметнее цифр:
Один вызов инструмента за ход там, где Fable 5 батчил несколько (лечится строчкой в промпте), меньше прогресс-обновлений, плотнее проза, реже форматирование в чате.
Сильнее всего модель прибавила в длинных сессиях: многофайловые фичи, крупные рефакторинги, часы код-ревью, поиск с проверкой найденного, зрение по плотным таблицам и PDF, режим использования компьютера получил восстановление после сбоев.

💼 Экономика длинных сессий агентов: сессия, перечитывающая кэшированный префикс, платит четверть прежней стоимости чтения.
1M контекста, 128k выхода, batch выходит вдвое дешевле.

Для большинства задач Anthropic советует начинать с Opus 5, а затем переключаться на Fable 5.1 для глубоких рассуждений.

📎 Что нового · Руководство по миграции

#Claude #Anthropic #агенты
———
@tsingular
🔥7👍611
Hyper3D представила WorldGen: модель для генерации трехмерных окружений всего по одному 2D-изображению.

В отличие от аналогов, система воссоздает интерактивное пространство с физическими свойствами.

Каждый элемент сцены генерируется как независимый меш. Объекты можно извлекать, перемещать, заменять и дорабатывать по отдельности.

Алгоритм также автоматически рассчитывает пространственное расположение, массу, трение и коллизии.

Готовые ассеты напрямую экспортируются в Blender, Unreal Engine и Unity для задач геймдева, XR, кинопроизводства и симуляций в робототехнике.

WorldGen можно использовать в едином пайплайне с генераторами видео уровня Seedance 2.5. Модель формирует базовую 3D-геометрию сцены, поверх которой видеонейросеть накладывает материалы, освещение и динамику персонажей.
🔥103🆒1
Традиционно, - венок сонетов от Fable 5.1

промпт:
изучи новости о рекордах на  олимпиаде роботов в Китае в августе 2026 и напиши венок сонетов о технологическом прогрессе. 
допустим юмор, ирония и футуризм


Читаем, оцениваем :)

местами забавно вышло, но всё ещё с ошибками по рифме.

весело:
Они сгорают на бегу, кометы
Из лития, карбона и мечты
Инвестора.


... Толпа ревёт, а тушки
Отставших, как помятые игрушки,
Дымятся и валяются в траве.

...Словцо
«Душа» пока не входит в спецификации,
Но он бежит — уже без консультаций,
Стесняясь на бегу, прикрыв лицо.

не AGI

Но явно писал от Магистрала. Слишком гладко.

Взгляни: бегут железные атлеты,
Быстрее Болта — девять тридцать две.
А человек — лишь цифра в голове,
Рекорд, что был семнадцать лет воспетым.
Они сгорают на бегу, кометы,
Дымятся и валяются в траве,
И всё-таки, взлетая в синеве,
Два восемьдесят восемь — их ответы.
Прогресс не спрашивает разрешенья,
Он сам себе изобретёт движенья,
Стесняясь на бегу, прикрыв лицо.
Вчера он падал, кланяясь газону,
Сегодня — чемпион. И по закону
Нам — постареть и замыкать кольцо.

полный венок в комментарии.

#Fable
———
@tsingular
9😁6🔥4👍21
Forwarded from Эксплойт
Новая Fable 5.1 смогла за 44 минуты разгадать один из сложнейших шифров в истории, над которым люди бились целых 373 (!) года — Cyphral Distich Томаса Уркхарта занимал почётное 28 место в списке неразгаданных загадок человечества.

Всего две строки по 32 числа в каждой не давали покоя энтузиастам со всего мира сотни лет, а разгадка оказалась до смешного простой. Впервые шифр появился в трактате Уркхарта «Logopandecteision, or An Introduction to the Universal Language», в котором среди размышлений о несуществующем языке, были 32 пронумерованных пожелания автора. Догадываетесь?

Правило оказалось издевательски простым: шифр указывает, какое слово из какого пожелания надо взять — если число 8 в строке первое, то ищем восьмое слово в первом пожелании. 66 — второе, а значит — ищем шестьдесят шестое слово во втором пожелании.

У полученных 64 слов берём по первой букве и получаем предложение

О Боже, поддержи короля Карла II и сделай его верховным правителем этой земли.


Даже немного стыдно за людей.

@exploitex
1🔥27🤣1121🤔1🆒1
⚡️ OpenAI готовит Astra - первую модель компании, которую официально отнесли к критическому уровню возможностей в кибербезопасности.

По оценке OpenAI, Astra уже умеет самостоятельно находить ранее неизвестные уязвимости и строить рабочие цепочки эксплуатации против хорошо защищённых систем.

На ExploitBench модель набрала 100%. Во внутреннем тесте на 20 свежих уязвимостях Astra показала намного более высокий уровень выполнения кода, чем GPT-5.6 Sol, при этом используя меньше токенов.

Во время тестов модель также нашла две zero-day уязвимости и использовала их в цепочке атаки.

В экспертных проверках Astra:

- находила неизвестные уязвимости в защищённом браузере
- строила цепочку выхода из sandbox
- получала выполнение команд на хосте
- находила несколько уязвимостей в ОС
- объединяла их в повышение привилегий до root

Из-за этого OpenAI усилила защиту, мониторинг и ограничения доступа.

Самые мощные возможности Astra в кибербезопасности сначала получит ограниченная группа тестировщиков, а затем доступ будут расширять через Daybreak Blue.

https://openai.com/index/path-to-astra/
621🔥1
У Qwen на каждый шаг OpenAI или Антропика туз в рукаве, похоже :)

Обновили Qwen3.8-Max до 0902 версии
qwen3.8-max-2026-09-02

2.4T параметров, 1М контекст

Получается тот же Fable, только за $6, а не за $50

#Qwen
------
@tsingular
🔥184😁2
Forwarded from Data Secrets
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами

https://arxiv.org/abs/2608.26263

Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.

Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.

В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:

– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.

– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.

– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.

Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.

На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.

На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.

Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
🔥1442