ml phys
2.8K subscribers
198 photos
12 videos
2 files
123 links
Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Download Telegram
2_5260573882280089928.pdf
71.3 KB
Обязательно прочитайте предыдущий длин-пост

Если кому-то интересно, сами задачи, что он смог решить, сделал хороший файл с ними
9🔥3🥰1
Как вам кажется, развитие ИИ больше угрожает женскому рынку труда или мужскому?
Anonymous Poll
35%
Женскому
65%
Мужскому
🤷‍♀21😁62
Новый самый сложный бенчмарк для агентов

FrontierCode - benchmark для coding agents, где агенту дают сделать pull request в реальном репозитории, а дальше мейнтейнер репозитория решает, можно ли это мержить в main. В SWE-Bench итоговая оценка завязана на прохождение тестов. Тут критерий жёстче: принял бы такой PR мейнтейнер.

Сначала запускались юнит-тесты и стандартные проверки репозитория: build, lint, typecheck, style-checks и другие команды. Так устроены почти все coding-бенчмарки, и агенты уже неплохо научились это проходить. Отдельно проверяли тесты, которые написал сам агент: их запускали на старом коде, и они должны были падать. Если тест проходит до фикса, он не доказывает, что агент поймал исходную проблему.

Для каждой задачи мейнтейнеры заранее задавали конкретные ограничения проверки: какие файлы здесь допустимо менять, какие трогать нельзя, какой размер diff будет подозрительным, какие требования к стилю, архитектуре и поддерживаемости важны именно в этом месте кода. Эти пункты проверялись автоматически. Часть можно проверить обычным кодом: список файлов, размер diff, число изменённых строк. Часть проверял LLM-ревьюер: ему давали diff и текстовое требование, а он смотрел, соблюдён ли критерий. Например, в одной задаче агент вместо переиспользования общей функции LOG_WARNING() для логирования писал напрямую в stderr. Формально это работает и может проходить тесты, но PR всё равно плохой: код обходит общую логику проекта.

Лучше всех с большим отрывом показал себя Opus 4.8, но даже он пока далёк от стабильного end-to-end качества.
7
Кстати mythos вышел
🔥83🥰2
Не могу понять, почему все так начали обсуждать 30-дневный data retention mythos? У антропиков в Claude Code и так по умолчанию для всех пользователей подписок data retention 30 дней. Дополнительно, если вы делаете оценку чата или ставите лайк/дизлайк на какие-то сообщения, то Антропик будет хранить ваш чат 5 лет. Для всех моделей кроме mythos есть программа Zero Data Retention, но она доступна только корпоративным клиентам и только по ручному согласованию. Этим пользуются меньше чем 0.1% трафика.

если вы пользуетесь подпиской, то и для mythos, и для остальных моделей период составляет 30 дней. Он был таким с самого появления cc. Смысл фразы в релизе Mythos, что они будут просматривать и сохранять все чаты, означает лишь то, что эта программа Zero Data Retention для корпоративных клиентов не распространяется на новую модель.
7🐳1
Во время reasoninga mythos изобрел собственный язык.

При обучения модели не дают (или почти не дают) референс-резонинга так как это делают самими ответами, например, обучая на question-answering датасетах. А через RL учат модель самостоятельно придумывать такой резонинг, приводящий к правильному ответу

Google полгода назад показали, что во время решения математики их модель иногда думает о еде. Так что в целом идея о том, что рассуждения модели не должны совпадать с человеческими паттернами мыслей, не нова.

И еще до выхода ChatGPT, самой первой большой текстовой reasoning модели в мире, были идеи использовать в целом не человеческий язык во время ризенинга, а просто набор векторов эмбэйдингов. Почему-то от такой идеи отказались и все перешли на человекочитаемый reasoning.

Но Mythos решила иначе, что ей лучше размышлять вот так.
🔥12😁4🗿3🤷‍♂11😨1
Fable 5 разобралась как работает NSEvent.pressure в новом macOS 26 и заввншотила аппку
14😁13🤯5🏆5
Anthropic сделала все по технике
1) релизнула сота модель, которая значимо лучше всего остального
2) предлагает остановить всем лабораториям исследования в области фронтирного ИИ на неопределенный срок до тех пор, пока не разрабатываем механизмы безопасности
3) profit

Reuters
😁24👍4🐳2
Linkedin moment

К стати подписывайтесь на мой
17😁10❤‍🔥6🔥2🤣2🤔1
No comments
😁295🤣4🤔2
Несколько недель назад сенатор Берни Сандерс предлагал «национализировать половину Anthropic» — ну, формально заставить OpenAI, Anthropic и xAI заплатить разовый налог в 50% акций в публичный фонд.

Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.

А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.

Чем чёрт не шутит.

https://x.com/BernieSanders/status/2061631422188626083
9😁2👍1
OpenRouter выпустил Fusion, свою модель “Mythos дома”: в API это openrouter/fusion, а внутри один запрос параллельно уходит в несколько LLM. Потом модель-судья сравнивает ответы: где модели сошлись, где противоречат друг другу, какие куски каждая пропустила. Финальный ответ собирается уже из этого разбора.

У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
👍123🐳2🤝2
У меня жутко горит с современных бенчмарков LLM, особенно агентских. Результаты шумные: Anthropic может написать в карточке модели один результат, авторы бенчмарка потом прогоняют ту же модель сами и получают другой.

Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.

Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
🔥72
Небольшой флешбек из 2019-го
10😁6👍1
Алексей Маметьев
Photo
Чем больше вчитываюсь, тем больше вопросов это вызывает

Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion

Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки

При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
😁105👏2
Please open Telegram to view this post
VIEW IN TELEGRAM
How it started

How it going
😁28🤯9🏆21
Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.

Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.


Заходите в чат канала
10🔥4🍾2
Мне кажется что сейчас наступает лучшее время для десктопного линукса

Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.

Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.

К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
17👍10🤝3👀1