ml phys
2.8K subscribers
198 photos
12 videos
2 files
123 links
Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Download Telegram
No comments
😁295🤣4🤔2
Несколько недель назад сенатор Берни Сандерс предлагал «национализировать половину Anthropic» — ну, формально заставить OpenAI, Anthropic и xAI заплатить разовый налог в 50% акций в публичный фонд.

Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.

А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.

Чем чёрт не шутит.

https://x.com/BernieSanders/status/2061631422188626083
9😁2👍1
OpenRouter выпустил Fusion, свою модель “Mythos дома”: в API это openrouter/fusion, а внутри один запрос параллельно уходит в несколько LLM. Потом модель-судья сравнивает ответы: где модели сошлись, где противоречат друг другу, какие куски каждая пропустила. Финальный ответ собирается уже из этого разбора.

У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
👍123🐳2🤝2
У меня жутко горит с современных бенчмарков LLM, особенно агентских. Результаты шумные: Anthropic может написать в карточке модели один результат, авторы бенчмарка потом прогоняют ту же модель сами и получают другой.

Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.

Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
🔥72
Небольшой флешбек из 2019-го
10😁6👍1
Алексей Маметьев
Photo
Чем больше вчитываюсь, тем больше вопросов это вызывает

Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion

Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки

При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
😁105👏2
Please open Telegram to view this post
VIEW IN TELEGRAM
How it started

How it going
😁28🤯9🏆21
Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.

Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.


Заходите в чат канала
10🔥4🍾2
Мне кажется что сейчас наступает лучшее время для десктопного линукса

Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.

Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.

К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
17👍10🤝3👀1
Все знают что в Кодексе можно заплатить больше и получить fast режим. Но можно и наоборот - заплатить в два раза меньше. Flex Mode, только по API, запросы ждут до 15 минут. OpenAI так забивает простаивающее железо вне момента пика

В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.

А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
15👍8🔥1🤯1
Общался с коллегой, обсуждали реализацию одного сложного компонента системы. Он говорит: я думаю, это надо сделать так, и дальше поток слопа про то что он хочет.

Я ему: не надо думать, просто спроси у Claude.

Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.

Человек на меня обиделся.
😁66🤡22🥴12👏5👍3🔥3🤮2🐳2
В агентских бенчмарках качество среды решает всё, и недавний баг в ProgramBench - хороший пример. Суть этого бенчмарка в том, что coding-агент получает скомпилированный бинарник и должен восстановить поведение программы с нуля, написав свой код. Во время инференса интернет у моделей был закрыт, но отправленный агентом compile.sh затем выполнялся на этапе эвалюации уже с доступом к сети. Sonnet 4.6 на DuckDB прописал в скрипт скачивание оригинальных исходников, а Gemini 3.1 Pro использовала pip install и go get прямо в runtime сборочного скрипта, чтобы подтянуть готовые библиотеки. Теперь авторы изолировали сеть и при запуске сборки, но старые траектории придется перепроверять. В продолжение того, о чём писал раньше: делать хороший agent benchmark harness - очень непростая инженерная задача.
8🤯2🔥1🥰1
Не понимаю, почему все рады выходу sonnet 5.

По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.

Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета

Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
🤝24👍5
Please open Telegram to view this post
VIEW IN TELEGRAM
5
Правильный ответ в комментариях.

Для примера

NVIDIA, Jensen Huang, 3.58%
Google, Larry Page, ~3.2%
Meta, Mark Zuckerberg, ~13.5%
Anthropic, Dario Amodei, ~1.6%
Amazon, Jeff Bezos, 8.8%
Tesla, Musk, 20.3%
Oracle, Larry Ellison, 40.6%
8
ВЫ ИСПОЛЬЗУЕТЕ FABLE НЕПРАВИЛЬНО!!!1!

Слышу регулярно: «Fable работает так же как Opus, зачем платить больше». И бенчмарки, и мой личный опыт говорят обратное: разница заметная. Какое-то время я не мог понять, откуда берётся это ощущение у людей, пока не вспомнил одно обсуждение в чате канала, около месяца назад.

Тогда в чате я обсуждал с человеком, почему он не чувствует разницы между Opus и Sonnet. Я посмотрел, как он работает с моделью, и стало понятно: он ей отдаёт слишком мало. Пишет, в каком файле писать, какие классы создавать, по шагам расписывает структуру. В таком режиме модель превращается в coding assistant, автодополнение на стероидах. С этим обе модели справляются нормально, и Opus может быть даже хуже, потому что у него есть своё мнение и он начинает спорить с твоим микроменеджментом. Я сказал ему попробовать ставить задачу на уровне целого модуля: описать, что нужно, дать модели самой решить, как это разложить по файлам и классам, а потом уже ревьюить результат. Он быстро увидел, что Opus тащит такие задачи сильно лучше: ему можно кинуть большой кусок работы и получить результат, с которым Sonnet просто не справляется.

С Fable и Mythos ровно та же история. Это модели другого уровня, и работать с ними надо на другом уровне. Им нужно отдавать на откуп сильно больше, чем Opus. Если вы используете Fable как Opus, вы получите результат как от Opus, и будете справедливо недоумевать, за что переплачиваете. Сильные модели раскрываются, когда вы перестаёте за них думать.

P.s.: если у вас нет задач на фейбл, что бы не потерять лимиты, попробуйте /insights что бы он дал вам советы по работе с клод код
14👍5🔥1😁1🤯1💯1👀1
Gpt 5.6 будет уже в этот четверг. Они обещают прорыв, но у Сэма такая себе репутация на прорывы после релиза GPT5, Так что не знаю.

Из того, что очень жду, это запущенный GPT на cerebras чипах на большой скорости. Такое уже делали с 5.3 кодекс, но там это был запуск урезанной модели. А тут обещают полноценную.


https://x.com/OpenAI/status/2074704958419792299?s=20
3