Во время reasoninga mythos изобрел собственный язык.
При обучения модели не дают (или почти не дают) референс-резонинга так как это делают самими ответами, например, обучая на question-answering датасетах. А через RL учат модель самостоятельно придумывать такой резонинг, приводящий к правильному ответу
Google полгода назад показали, что во время решения математики их модель иногда думает о еде. Так что в целом идея о том, что рассуждения модели не должны совпадать с человеческими паттернами мыслей, не нова.
И еще до выхода ChatGPT, самой первой большой текстовой reasoning модели в мире, были идеи использовать в целом не человеческий язык во время ризенинга, а просто набор векторов эмбэйдингов. Почему-то от такой идеи отказались и все перешли на человекочитаемый reasoning.
Но Mythos решила иначе, что ей лучше размышлять вот так.
При обучения модели не дают (или почти не дают) референс-резонинга так как это делают самими ответами, например, обучая на question-answering датасетах. А через RL учат модель самостоятельно придумывать такой резонинг, приводящий к правильному ответу
Google полгода назад показали, что во время решения математики их модель иногда думает о еде. Так что в целом идея о том, что рассуждения модели не должны совпадать с человеческими паттернами мыслей, не нова.
И еще до выхода ChatGPT, самой первой большой текстовой reasoning модели в мире, были идеи использовать в целом не человеческий язык во время ризенинга, а просто набор векторов эмбэйдингов. Почему-то от такой идеи отказались и все перешли на человекочитаемый reasoning.
Но Mythos решила иначе, что ей лучше размышлять вот так.
🔥12😁4🗿3🤷♂1❤1😨1
Anthropic сделала все по технике
1) релизнула сота модель, которая значимо лучше всего остального
2) предлагает остановить всем лабораториям исследования в области фронтирного ИИ на неопределенный срок до тех пор, пока не разрабатываем механизмы безопасности
3) profit
Reuters
1) релизнула сота модель, которая значимо лучше всего остального
2) предлагает остановить всем лабораториям исследования в области фронтирного ИИ на неопределенный срок до тех пор, пока не разрабатываем механизмы безопасности
3) profit
Reuters
😁24👍4🐳2
Несколько недель назад сенатор Берни Сандерс предлагал «национализировать половину Anthropic» — ну, формально заставить OpenAI, Anthropic и xAI заплатить разовый налог в 50% акций в публичный фонд.
Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.
А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.
Чем чёрт не шутит.
https://x.com/BernieSanders/status/2061631422188626083
Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.
А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.
Чем чёрт не шутит.
https://x.com/BernieSanders/status/2061631422188626083
X (formerly Twitter)
Bernie Sanders (@BernieSanders) on X
I will soon be introducing a bill to give the public a 50% ownership stake in the largest AI companies in America.
This would guarantee that the trillions created by AI are used to improve the lives of all of us — and block oligarch decisions that harm the…
This would guarantee that the trillions created by AI are used to improve the lives of all of us — and block oligarch decisions that harm the…
❤9😁2👍1
OpenRouter выпустил Fusion, свою модель “Mythos дома”: в API это
У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
openrouter/fusion, а внутри один запрос параллельно уходит в несколько LLM. Потом модель-судья сравнивает ответы: где модели сошлись, где противоречат друг другу, какие куски каждая пропустила. Финальный ответ собирается уже из этого разбора.У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
👍12❤3🐳2🤝2
У меня жутко горит с современных бенчмарков LLM, особенно агентских. Результаты шумные: Anthropic может написать в карточке модели один результат, авторы бенчмарка потом прогоняют ту же модель сами и получают другой.
Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.
Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.
Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
🔥7❤2
Алексей Маметьев
Photo
Чем больше вчитываюсь, тем больше вопросов это вызывает
Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion
Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки
При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion
Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки
При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
😁10❤5👏2
Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.
Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.
Заходите в чат канала
Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.
Заходите в чат канала
❤10🔥4🍾2
Мне кажется что сейчас наступает лучшее время для десктопного линукса
Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.
Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.
К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.
Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.
К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
❤17👍10🤝3👀1
Все знают что в Кодексе можно заплатить больше и получить fast режим. Но можно и наоборот - заплатить в два раза меньше. Flex Mode, только по API, запросы ждут до 15 минут. OpenAI так забивает простаивающее железо вне момента пика
В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.
А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
В подписку пока не завезли, но на гитхабе живой issue и доверенные источники в твиттере пишут что скоро добавят. Для долгих задач это будет идеально - поставил и ушёл.
А пока я экономлю лимиты по-другому. В моём Hermes агенте все ежедневные кроны стоят на 6:30 утра - проверка почты, мониторинг интересных аккаунтов и тем в твиттере, автоответы на сообщения, пересчёт GTD-планирования и таск-трекера, авторегистрация новых аккаунтов с фри триалом. Всё это стартует пятичасовой цикл пока я сплю. Сажусь работать в 9 - через 2.5 часа лимиты уже ресетнутся, а не через 5 как если бы первый запрос ушёл вместе со мной.
Openai
Flex processing | OpenAI API
Learn how to optimize costs for asynchronous tasks with flex processing.
❤15👍8🔥1🤯1
Общался с коллегой, обсуждали реализацию одного сложного компонента системы. Он говорит: я думаю, это надо сделать так, и дальше поток слопа про то что он хочет.
Я ему: не надо думать, просто спроси у Claude.
Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.
Человек на меня обиделся.
Я ему: не надо думать, просто спроси у Claude.
Как же бесят в 2026 году люди, которые всё ещё пытаются думать без ИИшки. Закинул его же вопрос в Opus 4.8, через секунду нашёл три причины, почему так как он "думал" не заработает вообще.
Человек на меня обиделся.
😁66🤡22🥴12👏5👍3🔥3🤮2🐳2
В агентских бенчмарках качество среды решает всё, и недавний баг в ProgramBench - хороший пример. Суть этого бенчмарка в том, что coding-агент получает скомпилированный бинарник и должен восстановить поведение программы с нуля, написав свой код. Во время инференса интернет у моделей был закрыт, но отправленный агентом
compile.sh затем выполнялся на этапе эвалюации уже с доступом к сети. Sonnet 4.6 на DuckDB прописал в скрипт скачивание оригинальных исходников, а Gemini 3.1 Pro использовала pip install и go get прямо в runtime сборочного скрипта, чтобы подтянуть готовые библиотеки. Теперь авторы изолировали сеть и при запуске сборки, но старые траектории придется перепроверять. В продолжение того, о чём писал раньше: делать хороший agent benchmark harness - очень непростая инженерная задача.ProgramBench
ProgramBench Harness Fixes — ProgramBench
A batch of fairness and reliability fixes that crack down on newly discovered ways for agents to cheat, improve reproducibility, and clear up false-negative test failures.
❤8🤯2🔥1🥰1
Не понимаю, почему все рады выходу sonnet 5.
По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.
Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета
Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
По моему мнению, это самая посредственная модель что только могла быть. Она выходит однозначно хуже и дороже opus 4.8 так как кушает больше токенов. В подписку не входит 1m версия, контекст маленький.
Если вам нужна маленькая дешевая и умная модель - посмотрите на GLM-5.2, она дешевле в несколько раз моделей антропика при этом точно как минмум на уровне соннета
Причем это не sonnet 4.8 а 5 ая версия, от которой ожидалось сильно большего чем качество китайского опенсурса по цене опуса.
🤝24👍5