ml phys
2.8K subscribers
198 photos
12 videos
2 files
123 links
Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Download Telegram
Не могу понять, почему все так начали обсуждать 30-дневный data retention mythos? У антропиков в Claude Code и так по умолчанию для всех пользователей подписок data retention 30 дней. Дополнительно, если вы делаете оценку чата или ставите лайк/дизлайк на какие-то сообщения, то Антропик будет хранить ваш чат 5 лет. Для всех моделей кроме mythos есть программа Zero Data Retention, но она доступна только корпоративным клиентам и только по ручному согласованию. Этим пользуются меньше чем 0.1% трафика.

если вы пользуетесь подпиской, то и для mythos, и для остальных моделей период составляет 30 дней. Он был таким с самого появления cc. Смысл фразы в релизе Mythos, что они будут просматривать и сохранять все чаты, означает лишь то, что эта программа Zero Data Retention для корпоративных клиентов не распространяется на новую модель.
7🐳1
Во время reasoninga mythos изобрел собственный язык.

При обучения модели не дают (или почти не дают) референс-резонинга так как это делают самими ответами, например, обучая на question-answering датасетах. А через RL учат модель самостоятельно придумывать такой резонинг, приводящий к правильному ответу

Google полгода назад показали, что во время решения математики их модель иногда думает о еде. Так что в целом идея о том, что рассуждения модели не должны совпадать с человеческими паттернами мыслей, не нова.

И еще до выхода ChatGPT, самой первой большой текстовой reasoning модели в мире, были идеи использовать в целом не человеческий язык во время ризенинга, а просто набор векторов эмбэйдингов. Почему-то от такой идеи отказались и все перешли на человекочитаемый reasoning.

Но Mythos решила иначе, что ей лучше размышлять вот так.
🔥12😁4🗿3🤷‍♂11😨1
Fable 5 разобралась как работает NSEvent.pressure в новом macOS 26 и заввншотила аппку
14😁13🤯5🏆5
Anthropic сделала все по технике
1) релизнула сота модель, которая значимо лучше всего остального
2) предлагает остановить всем лабораториям исследования в области фронтирного ИИ на неопределенный срок до тех пор, пока не разрабатываем механизмы безопасности
3) profit

Reuters
😁24👍4🐳2
Linkedin moment

К стати подписывайтесь на мой
17😁10❤‍🔥6🔥2🤣2🤔1
No comments
😁295🤣4🤔2
Несколько недель назад сенатор Берни Сандерс предлагал «национализировать половину Anthropic» — ну, формально заставить OpenAI, Anthropic и xAI заплатить разовый налог в 50% акций в публичный фонд.

Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.

А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.

Чем чёрт не шутит.

https://x.com/BernieSanders/status/2061631422188626083
9😁2👍1
OpenRouter выпустил Fusion, свою модель “Mythos дома”: в API это openrouter/fusion, а внутри один запрос параллельно уходит в несколько LLM. Потом модель-судья сравнивает ответы: где модели сошлись, где противоречат друг другу, какие куски каждая пропустила. Финальный ответ собирается уже из этого разбора.

У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
👍123🐳2🤝2
У меня жутко горит с современных бенчмарков LLM, особенно агентских. Результаты шумные: Anthropic может написать в карточке модели один результат, авторы бенчмарка потом прогоняют ту же модель сами и получают другой.

Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.

Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
🔥72
Небольшой флешбек из 2019-го
10😁6👍1
Алексей Маметьев
Photo
Чем больше вчитываюсь, тем больше вопросов это вызывает

Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion

Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки

При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
😁105👏2
Please open Telegram to view this post
VIEW IN TELEGRAM
How it started

How it going
😁28🤯9🏆21
Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.

Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.


Заходите в чат канала
10🔥4🍾2
Мне кажется что сейчас наступает лучшее время для десктопного линукса

Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.

Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.

К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
17👍10🤝3👀1
Все знают что в Кодексе можно заплатить больше и получить fast режим. Но можно и наоборот - заплатить в два раза меньше. Flex Mode, только по API, запросы ждут до 15 минут. OpenAI так забивает простаивающее железо вне момента пика

В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.

А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
15👍8🔥1🤯1
Общался с коллегой, обсуждали реализацию одного сложного компонента системы. Он говорит: я думаю, это надо сделать так, и дальше поток слопа про то что он хочет.

Я ему: не надо думать, просто спроси у Claude.

Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.

Человек на меня обиделся.
😁66🤡22🥴12👏5👍3🔥3🤮2🐳2
В агентских бенчмарках качество среды решает всё, и недавний баг в ProgramBench - хороший пример. Суть этого бенчмарка в том, что coding-агент получает скомпилированный бинарник и должен восстановить поведение программы с нуля, написав свой код. Во время инференса интернет у моделей был закрыт, но отправленный агентом compile.sh затем выполнялся на этапе эвалюации уже с доступом к сети. Sonnet 4.6 на DuckDB прописал в скрипт скачивание оригинальных исходников, а Gemini 3.1 Pro использовала pip install и go get прямо в runtime сборочного скрипта, чтобы подтянуть готовые библиотеки. Теперь авторы изолировали сеть и при запуске сборки, но старые траектории придется перепроверять. В продолжение того, о чём писал раньше: делать хороший agent benchmark harness - очень непростая инженерная задача.
8🤯2🔥1🥰1
Не понимаю, почему все рады выходу sonnet 5.

По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.

Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета

Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
🤝24👍5