2_5260573882280089928.pdf
71.3 KB
Обязательно прочитайте предыдущий длин-пост
Если кому-то интересно, сами задачи, что он смог решить, сделал хороший файл с ними
Если кому-то интересно, сами задачи, что он смог решить, сделал хороший файл с ними
❤9🔥3🥰1
Как вам кажется, развитие ИИ больше угрожает женскому рынку труда или мужскому?
Anonymous Poll
35%
Женскому
65%
Мужскому
🤷♀21😁6❤2
Новый самый сложный бенчмарк для агентов
FrontierCode - benchmark для coding agents, где агенту дают сделать pull request в реальном репозитории, а дальше мейнтейнер репозитория решает, можно ли это мержить в main. В SWE-Bench итоговая оценка завязана на прохождение тестов. Тут критерий жёстче: принял бы такой PR мейнтейнер.
Сначала запускались юнит-тесты и стандартные проверки репозитория: build, lint, typecheck, style-checks и другие команды. Так устроены почти все coding-бенчмарки, и агенты уже неплохо научились это проходить. Отдельно проверяли тесты, которые написал сам агент: их запускали на старом коде, и они должны были падать. Если тест проходит до фикса, он не доказывает, что агент поймал исходную проблему.
Для каждой задачи мейнтейнеры заранее задавали конкретные ограничения проверки: какие файлы здесь допустимо менять, какие трогать нельзя, какой размер diff будет подозрительным, какие требования к стилю, архитектуре и поддерживаемости важны именно в этом месте кода. Эти пункты проверялись автоматически. Часть можно проверить обычным кодом: список файлов, размер diff, число изменённых строк. Часть проверял LLM-ревьюер: ему давали diff и текстовое требование, а он смотрел, соблюдён ли критерий. Например, в одной задаче агент вместо переиспользования общей функции LOG_WARNING() для логирования писал напрямую в stderr. Формально это работает и может проходить тесты, но PR всё равно плохой: код обходит общую логику проекта.
Лучше всех с большим отрывом показал себя Opus 4.8, но даже он пока далёк от стабильного end-to-end качества.
FrontierCode - benchmark для coding agents, где агенту дают сделать pull request в реальном репозитории, а дальше мейнтейнер репозитория решает, можно ли это мержить в main. В SWE-Bench итоговая оценка завязана на прохождение тестов. Тут критерий жёстче: принял бы такой PR мейнтейнер.
Сначала запускались юнит-тесты и стандартные проверки репозитория: build, lint, typecheck, style-checks и другие команды. Так устроены почти все coding-бенчмарки, и агенты уже неплохо научились это проходить. Отдельно проверяли тесты, которые написал сам агент: их запускали на старом коде, и они должны были падать. Если тест проходит до фикса, он не доказывает, что агент поймал исходную проблему.
Для каждой задачи мейнтейнеры заранее задавали конкретные ограничения проверки: какие файлы здесь допустимо менять, какие трогать нельзя, какой размер diff будет подозрительным, какие требования к стилю, архитектуре и поддерживаемости важны именно в этом месте кода. Эти пункты проверялись автоматически. Часть можно проверить обычным кодом: список файлов, размер diff, число изменённых строк. Часть проверял LLM-ревьюер: ему давали diff и текстовое требование, а он смотрел, соблюдён ли критерий. Например, в одной задаче агент вместо переиспользования общей функции LOG_WARNING() для логирования писал напрямую в stderr. Формально это работает и может проходить тесты, но PR всё равно плохой: код обходит общую логику проекта.
Лучше всех с большим отрывом показал себя Opus 4.8, но даже он пока далёк от стабильного end-to-end качества.
❤7
Не могу понять, почему все так начали обсуждать 30-дневный data retention mythos? У антропиков в Claude Code и так по умолчанию для всех пользователей подписок data retention 30 дней. Дополнительно, если вы делаете оценку чата или ставите лайк/дизлайк на какие-то сообщения, то Антропик будет хранить ваш чат 5 лет. Для всех моделей кроме mythos есть программа Zero Data Retention, но она доступна только корпоративным клиентам и только по ручному согласованию. Этим пользуются меньше чем 0.1% трафика.
если вы пользуетесь подпиской, то и для mythos, и для остальных моделей период составляет 30 дней. Он был таким с самого появления cc. Смысл фразы в релизе Mythos, что они будут просматривать и сохранять все чаты, означает лишь то, что эта программа Zero Data Retention для корпоративных клиентов не распространяется на новую модель.
если вы пользуетесь подпиской, то и для mythos, и для остальных моделей период составляет 30 дней. Он был таким с самого появления cc. Смысл фразы в релизе Mythos, что они будут просматривать и сохранять все чаты, означает лишь то, что эта программа Zero Data Retention для корпоративных клиентов не распространяется на новую модель.
❤7🐳1
Во время reasoninga mythos изобрел собственный язык.
При обучения модели не дают (или почти не дают) референс-резонинга так как это делают самими ответами, например, обучая на question-answering датасетах. А через RL учат модель самостоятельно придумывать такой резонинг, приводящий к правильному ответу
Google полгода назад показали, что во время решения математики их модель иногда думает о еде. Так что в целом идея о том, что рассуждения модели не должны совпадать с человеческими паттернами мыслей, не нова.
И еще до выхода ChatGPT, самой первой большой текстовой reasoning модели в мире, были идеи использовать в целом не человеческий язык во время ризенинга, а просто набор векторов эмбэйдингов. Почему-то от такой идеи отказались и все перешли на человекочитаемый reasoning.
Но Mythos решила иначе, что ей лучше размышлять вот так.
При обучения модели не дают (или почти не дают) референс-резонинга так как это делают самими ответами, например, обучая на question-answering датасетах. А через RL учат модель самостоятельно придумывать такой резонинг, приводящий к правильному ответу
Google полгода назад показали, что во время решения математики их модель иногда думает о еде. Так что в целом идея о том, что рассуждения модели не должны совпадать с человеческими паттернами мыслей, не нова.
И еще до выхода ChatGPT, самой первой большой текстовой reasoning модели в мире, были идеи использовать в целом не человеческий язык во время ризенинга, а просто набор векторов эмбэйдингов. Почему-то от такой идеи отказались и все перешли на человекочитаемый reasoning.
Но Mythos решила иначе, что ей лучше размышлять вот так.
🔥12😁4🗿3🤷♂1❤1😨1
Anthropic сделала все по технике
1) релизнула сота модель, которая значимо лучше всего остального
2) предлагает остановить всем лабораториям исследования в области фронтирного ИИ на неопределенный срок до тех пор, пока не разрабатываем механизмы безопасности
3) profit
Reuters
1) релизнула сота модель, которая значимо лучше всего остального
2) предлагает остановить всем лабораториям исследования в области фронтирного ИИ на неопределенный срок до тех пор, пока не разрабатываем механизмы безопасности
3) profit
Reuters
😁24👍4🐳2
Несколько недель назад сенатор Берни Сандерс предлагал «национализировать половину Anthropic» — ну, формально заставить OpenAI, Anthropic и xAI заплатить разовый налог в 50% акций в публичный фонд.
Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.
А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.
Чем чёрт не шутит.
https://x.com/BernieSanders/status/2061631422188626083
Тогда это звучало как максимально левый популизм, и я даже не стал про это писать.
А теперь США уже заставили Anthropic отключить Fable 5 и Mythos 5 по директиве экспортного контроля.
Чем чёрт не шутит.
https://x.com/BernieSanders/status/2061631422188626083
X (formerly Twitter)
Bernie Sanders (@BernieSanders) on X
I will soon be introducing a bill to give the public a 50% ownership stake in the largest AI companies in America.
This would guarantee that the trillions created by AI are used to improve the lives of all of us — and block oligarch decisions that harm the…
This would guarantee that the trillions created by AI are used to improve the lives of all of us — and block oligarch decisions that harm the…
❤9😁2👍1
OpenRouter выпустил Fusion, свою модель “Mythos дома”: в API это
У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
openrouter/fusion, а внутри один запрос параллельно уходит в несколько LLM. Потом модель-судья сравнивает ответы: где модели сошлись, где противоречат друг другу, какие куски каждая пропустила. Финальный ответ собирается уже из этого разбора.У меня от этого лёгкое дежавю: пару лет назад были популярны пайплайны вокруг моделей с ранкерами, реранкерами и судьями, потом все поверили в одну большую модель, а теперь идея возвращается. Самое сложное место тут, модель-судья: LLM сильно biased, и честно сравнивать ответы ей тяжело. Если OpenRouter это нормально решит, получится очень сильная инженерная обвязка.
👍12❤3🐳2🤝2
У меня жутко горит с современных бенчмарков LLM, особенно агентских. Результаты шумные: Anthropic может написать в карточке модели один результат, авторы бенчмарка потом прогоняют ту же модель сами и получают другой.
Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.
Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
Но это только половина проблемы. Дальше начинается бардак с условиями запуска: у моделей разный reasoning effort, у open source разные квантизации, у всех разные обвязки: Codex, Claude Code, свои мини-агенты, открытые фреймворки. А иногда к самому бенчмарку тоже есть вопросы: непонятные задания, странные ограничения, спорные параметры запуска, таймауты, экономия токенов. В итоге уже непонятно, что измеряется: модель, обвязка вокруг неё или фантазия автора.
Может, кто-то знает нормальный сайт, где можно смотреть все эти результаты вместе: бенчмарки, условия запуска, параметры, фильтры и честные сравнения на одном лидерборде?
🔥7❤2
Алексей Маметьев
Photo
Чем больше вчитываюсь, тем больше вопросов это вызывает
Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion
Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки
При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
Бенчмарк, на котором они гоняли модели, это 100 задач по Deep Research на различные тематики, типа медицины, законов и так далее - а это идеальная среда для fusion
Во-вторых, они сами пишут, что если сделать фьюжн из опуса + опуса, то результат будет примерно таким же, как фьюжн опуса, GPT, Gemini и Fable. То есть основной импакт в выигрыш дает не использование разных моделей, а синтезатор. Тогда не понятно, в чем moat open router'a - если не нужно использовать разные модельки
При этом на этом же самом бенчмарке Deep Research от Perplexity с использованием только одной старой модели Opus 4.6 выбивал 70.5%, то есть больше, чем все Fusion модели на картинке от OpenRouter, но они почему-то про это не написали.
😁10❤5👏2
Xiaomi разогнали 1T-модель MiMo до 1000+ токенов/с на обычном 8-GPU сервере. Ускорение собрали из FP4-квантизации и speculative decoding. С такой скоростью с моделью удобно вайбкодить: мысль не срывается, пока ждёшь ответ, а код и пояснения идут почти сразу. К концу года выйдет новая NVIDIA Vera Rubin, на которой inference будет в 5 раз быстрее H20.
Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.
Заходите в чат канала
Для облаков на специализированном для ЛЛМ железе Groq и Cerebras это проблема. В 2024 их было легко продать: у нас ответы летят быстрее, чем у GPU-провайдеров. Теперь обычная NVIDIA-инфра тоже становится достаточно быстрой для живой работы с моделью, но остаётся гибче и привычнее. Мы как раз обсуждали Groq LPU в чате канала; там уже больше 100 человек, и часто идут живые обсуждения про ИИ, агентов и агентскую разработку.
Заходите в чат канала
❤10🔥4🍾2
Мне кажется что сейчас наступает лучшее время для десктопного линукса
Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.
Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.
К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
Небольшая история - я сидел на arch linux около 7 лет - пока не решил пересесть на мак. Пересел как раз в тот момент когда понял что зарабатываю в час слишком много что бы тратить это время на вечное сетапанье разного, без чего к сожалению на линуксе не куда, хотя по итогу получается сильно удобнее чем любой макос, хотя он и работает из коробки.
Сейчас же есть AI агенты, и через них делать такое одно удовольствие и то что раньше требовало бы дни копания в конфигах теперь делается за 1 промпт.
К тому же новые процессоры от nvidia очень многообещающие в плане перфоманса на ватт.
❤17👍10🤝3👀1