Sonnet 5 и косты
Тема костов становится все более актуальной не только для компаний, но и для индивидуалов.
Как только появилась Соннет 5, многие стали говорить о том, что это лучшая модель по соотношению цена/качество - люди смотрят на результаты модели, на raw стоимость токенов и делают выводы. Но что стоит модели достичь таких результатов? Сколько шагов ей нужно сделать и сколько токенов сжечь? Помните тот анекдот про музыканта виртуоза?
Забавно, но для LLM этот принцип часто тоже работает - более мощные и умные модели (GPT 5.5, Fable) за меньшее количество шагов достигают той же цели, сжигая в разы меньше токенов на пути. И новая Sonnet 5 как раз отличный пример такого поведения - она на столько много "ищет", что в итоге на многих задачах по цене выходит дороже Opus 4.8 и прям ощутимо дороже GPT 5.5. Не мудрая, в общем модель)
Например, из CursorBench можно увидеть, что Sonnet 5 high с результатом (57%) vs GPT 5.5 medium (59.2%) получается. То есть, даже с учетом скидки Sonnet 5 может оказаться дороже GPT 5.5. Любопытно, что ни по FrontierCode ни по CursorBench результаты не опубликовали в анонсе, они есть только в system card.
Понятно, что по API сейчас соннет дают с небольшой скидкой, что все-таки делает ее слегка дешевле, чем Opus 4.8, но каким образом Sonnet 5 будут чарджить по подписке - пока загадка.
Ждем другие бенчмарки для объективности, но по костам картина уже вырисовывается довольно объективная. И конечно, ждем новое семейство GPT 5.6 - там как раз наоборот по соотношению цена-качество ожидают куда более интересное соотношение, особенно у средней модели Terra.
Что касается меня, то я уже недели три как почти полностью пересел на GPT-5.5 (сразу после отключение Fable), и при оптимальном выборе reasoning - medium / high, в целом, лимитов на 200$ подписке стало хватать на всё. Fable, видимо, буду использовать точечно, как и писал выше в своем обзоре - и смысла теперь в Claude подписке без Fable не вижу, разве что для ревью когда нужен "независимый взгляд".
Ну и напомню, что если цель - сокращение костов и у вас большая кодовая база (1М+ строк), то хороший контекстный движок (например, CodeAlive) - это один из наиболее выгодных способов снижения костов (и существенного ускорения стадии ресерча кодовой базы заодного). Конкретно на exploration даже на небольшой кодовой базе сокращение потребления токенов получается -45% в среднем в нашем RepoQA бенчмарке.
Источники:
Твит от Artificial Analysis на эту тему.
Sonnet 5 System Card (для тех, кто любит копать глубже - похоже, что они прогоняют Main набор FrontierCode на 100 задач ).
Расскажите про свои впечатления от Sonnet 5 и актуальна ли для вас вообще проблема костов/экономии токенов.
@ai_driven
Тема костов становится все более актуальной не только для компаний, но и для индивидуалов.
Как только появилась Соннет 5, многие стали говорить о том, что это лучшая модель по соотношению цена/качество - люди смотрят на результаты модели, на raw стоимость токенов и делают выводы. Но что стоит модели достичь таких результатов? Сколько шагов ей нужно сделать и сколько токенов сжечь? Помните тот анекдот про музыканта виртуоза?
На улице недалеко друг от друга подрабатывают два гитариста - молодой и старый. Молодой музыкант показывает суперскоростную технику, "пилит" по всему грифу, сногсшибательно импровизирует, а старый скромно стоит в сторонке и извлекает вдумчиво пару-другую нот. Около молодого гитариста - никого, около старого - толпа народу.
Один слушатель не выдержал, подошел к старому музыканту и спрашивает: "Как так получается, что тот молодой музыкант быстро играет, показывает фантастическую технику, и его никто не слушает, а вы спокойно играете несколько нот и вас слушает толпа народу?" Старый музыкант подумал и ответил: "Он только еще ищет свою ноту, а я уже нашел..."
Забавно, но для LLM этот принцип часто тоже работает - более мощные и умные модели (GPT 5.5, Fable) за меньшее количество шагов достигают той же цели, сжигая в разы меньше токенов на пути. И новая Sonnet 5 как раз отличный пример такого поведения - она на столько много "ищет", что в итоге на многих задачах по цене выходит дороже Opus 4.8 и прям ощутимо дороже GPT 5.5. Не мудрая, в общем модель)
Например, из CursorBench можно увидеть, что Sonnet 5 high с результатом (57%) vs GPT 5.5 medium (59.2%) получается. То есть, даже с учетом скидки Sonnet 5 может оказаться дороже GPT 5.5. Любопытно, что ни по FrontierCode ни по CursorBench результаты не опубликовали в анонсе, они есть только в system card.
Понятно, что по API сейчас соннет дают с небольшой скидкой, что все-таки делает ее слегка дешевле, чем Opus 4.8, но каким образом Sonnet 5 будут чарджить по подписке - пока загадка.
Ждем другие бенчмарки для объективности, но по костам картина уже вырисовывается довольно объективная. И конечно, ждем новое семейство GPT 5.6 - там как раз наоборот по соотношению цена-качество ожидают куда более интересное соотношение, особенно у средней модели Terra.
Что касается меня, то я уже недели три как почти полностью пересел на GPT-5.5 (сразу после отключение Fable), и при оптимальном выборе reasoning - medium / high, в целом, лимитов на 200$ подписке стало хватать на всё. Fable, видимо, буду использовать точечно, как и писал выше в своем обзоре - и смысла теперь в Claude подписке без Fable не вижу, разве что для ревью когда нужен "независимый взгляд".
Ну и напомню, что если цель - сокращение костов и у вас большая кодовая база (1М+ строк), то хороший контекстный движок (например, CodeAlive) - это один из наиболее выгодных способов снижения костов (и существенного ускорения стадии ресерча кодовой базы заодного). Конкретно на exploration даже на небольшой кодовой базе сокращение потребления токенов получается -45% в среднем в нашем RepoQA бенчмарке.
Источники:
Твит от Artificial Analysis на эту тему.
Sonnet 5 System Card (
Расскажите про свои впечатления от Sonnet 5 и актуальна ли для вас вообще проблема костов/экономии токенов.
@ai_driven
❤9👍7
/goal или вайб-кодинг по ключТут наш друг Костя Доронин хороший кейс с
/goal описал про, фактически, создание приложений "под ключ", когда агент по подробному плану может работать сутки и более: https://t.me/kdoronin_blog/1312Но там есть пара важнейших нюансов, которые я не смог не прокоментировать, продублирую:
При всей моей любви к GPT 5.5 Pro - это вообще не панацея. Я довольно часто использую эту модель для разных задач, в т. ч. для V0 примерно как Костя описал и хочу сказать, что GPT 5.5 Pro это все еще совсем не магия. В кейсах "приложение под ключ с нуля" именно этап интервью критически важен - чем оно подробнее тем лучше результат на выходе. И в целом, такой подход довольно рискованный. Даже Pro модель часто такую дичь может напланировать, что можно вообще приложение свое не узнать после этих 26-ти часов. И, конечно, бизнесовый контекст в этом случае очень важно давать - для кого приложение, нефункциональные требования (профиль нагрузки, например), иначе может как переусложнить (часто) так и упростить не там, где надо.
Ну и UX лучше отдельно прорабатывать - а то, вроде, все красиво делает и функционально, но дико неудобно и совершенно непонятно для пользователя, который видит приложение в первый раз. Поэтому по UX прям отдельно интервью лучше провести, а по-хорошему, сначала макеты посмотреть.
Кстати, раз уж про инженерию с нуля заговорили, расскажу про свой мини-проектик новый, вайб стек называется. Короч, помимо бизнесовых требований, чтобы разработка и сопровождение шли как гладко, довольно важно еще и с технологиями оптимальными определиться - собсна, вайб стэк эту проблему и решает, давая очень оптимальные opinionated дефолты: https://github.com/CodeAlive-AI/vibe-stack/
На днях подробнее расскажу подробнее про эту штуку.
@ai_driven
Telegram
Константин Доронин
Далеко идущие цели.
Или как за выходные потратить 80% недельной Pro-подписки OpenAI за $200 на экспериментах с /goal.
/goal – это режим для AI-агента (я использовал Codex CLI), который позволяет задать агенту цель. Он будет идти до неё, пока не достигнет.…
Или как за выходные потратить 80% недельной Pro-подписки OpenAI за $200 на экспериментах с /goal.
/goal – это режим для AI-агента (я использовал Codex CLI), который позволяет задать агенту цель. Он будет идти до неё, пока не достигнет.…
👍15❤8
GigaChat 3.5 - что по агентному кодингу? Terminal Bench 2.0
Пока мы все ждем релиз GPT-5.6, в каналах все чаще наблюдаю анонсы новой модели от Сбера. Очевидно, что работа была проделана немаленькая, поэтому поздравляю ребят с релизом! Там действительно получился довольно большой скачок в сравнении с их предыдущей моделью, а в пабликах часто наблюдаю как пишут, что уровень модели сопоставим, либо даже выше, чем DeepSeek V3.2. Но для нас главный вопрос - что с агентным кодингом?Поскольку мне Сбер денег не занес, придется писать правду.
И тут главная проблема в том, что из официального релиза это практически не понятно. Т. к. единственный прямой agentic coding бенчмарк, который опубликовала команда - это Terminal Bench 2 (в этом месте хочется позанудствовать, что не существует бенчмарка Terminal Bench 2, а существует Terminal Bench 2.0 и более честная его версия Terminal Bench 2.1 - догадаемся, что речь про 2.0 ). Причем даже в нем мы видим сравнение только с DeepSeek V3.2 и GigaChat 3.1 Ultra. Ну что ж, мы не из робкого десятка, поэтому соберем результаты других моделей по крупицам из разных источников. Например, результаты Terminal Bench 2.0/2.1 удобно смотреть здесь и здесь.
Результаты
GigaChat-3.5-Ultra: 13.48 (харнесс Terminus 2, данные от команды сбера)
GPT-OSS-120B: 18.7 (Terminus 2, данные из лидерборда tbench)
Qwen3.6-35B-A3B: 24.6 (харнесс little-coder)
DeepSeek-3.2: 39.6 (Terminus 2)
Nemotron 3 Ultra (550B-A55): 50.94 (Terminus 2, результаты из vals.ai)
Видимо, агентный кодинг пока не приоритет для команды GigaChat.
Тем не менее, на рынке РФ из отечественных моделей, похоже, что GigaChat 3.5 пока самая сильная. Но объективно сказать трудно, т. к. ни Яндекс, ни Сбер более широкого сравнения не публикуют и друг друга в бенчмарки не добавляют - а зря, ведь современные бенчмарки достаточно легко прогоняются через Harbor, нужны только токены.
Кстати, внимательный читатель мог обратить внимание на не сильно популярную модельку Nemotron 3 Ultra, которая при своем относительно небольшом размере показывает весьма впечатляющие результаты (50.94), чуть хуже Kimi K2.6 (53.56) - напомню, что это одна из самых свежих LLM от Nvidia. Любители on-prem LLM - присмотритесь.
А к колегам по цеху предложение на будущее публиковать System Card модели с техническими подробностями, как это делают OpenAI и Anthropic, а также показывать больше современных бенчмарков: хотя бы DeepSWE 1.1 и SWE-rebench 2.0.
@ai_driven
Пока мы все ждем релиз GPT-5.6, в каналах все чаще наблюдаю анонсы новой модели от Сбера. Очевидно, что работа была проделана немаленькая, поэтому поздравляю ребят с релизом! Там действительно получился довольно большой скачок в сравнении с их предыдущей моделью, а в пабликах часто наблюдаю как пишут, что уровень модели сопоставим, либо даже выше, чем DeepSeek V3.2. Но для нас главный вопрос - что с агентным кодингом?
И тут главная проблема в том, что из официального релиза это практически не понятно. Т. к. единственный прямой agentic coding бенчмарк, который опубликовала команда - это Terminal Bench 2 (
Результаты
GigaChat-3.5-Ultra: 13.48 (харнесс Terminus 2, данные от команды сбера)
GPT-OSS-120B: 18.7 (Terminus 2, данные из лидерборда tbench)
Qwen3.6-35B-A3B: 24.6 (харнесс little-coder)
DeepSeek-3.2: 39.6 (Terminus 2)
Nemotron 3 Ultra (550B-A55): 50.94 (Terminus 2, результаты из vals.ai)
Видимо, агентный кодинг пока не приоритет для команды GigaChat.
Тем не менее, на рынке РФ из отечественных моделей, похоже, что GigaChat 3.5 пока самая сильная. Но объективно сказать трудно, т. к. ни Яндекс, ни Сбер более широкого сравнения не публикуют и друг друга в бенчмарки не добавляют - а зря, ведь современные бенчмарки достаточно легко прогоняются через Harbor, нужны только токены.
Кстати, внимательный читатель мог обратить внимание на не сильно популярную модельку Nemotron 3 Ultra, которая при своем относительно небольшом размере показывает весьма впечатляющие результаты (50.94), чуть хуже Kimi K2.6 (53.56) - напомню, что это одна из самых свежих LLM от Nvidia. Любители on-prem LLM - присмотритесь.
А к колегам по цеху предложение на будущее публиковать System Card модели с техническими подробностями, как это делают OpenAI и Anthropic, а также показывать больше современных бенчмарков: хотя бы DeepSWE 1.1 и SWE-rebench 2.0.
@ai_driven
👍19❤4
Forwarded from Pavel Zloi
Хорошо, что я решил не спешить с перетестом GigaChat 3.5 432B, а дождался разбора (от Родиона @ai_driven) поддержки агентности этой модели, если кратенько, то я в целом чего-то подобного и ожидал, модель оказалась слабее GPT-OSS-120B.
Моё предложение для спецов из Сбера как собрать датасет чтобы сделать модель лучше:
1. обновить уже наконец линейку сберовских моделей доступных по API, а то GigaChat 2 морально устарела во всём, плюс не только ваши модели, добавьте все какие хотите дистилить, ту же gpt-oss-120b и скажем kimi k2.7
2. добавить специальный ДЕШЁВЫЙ тариф для агентов работающих через API
3. запустить рекламу про домашнего агента, скажем на примере OpenClaw, ну или скажем моего Coddy Agent ;)
4. поощрять юзеров которые пользуются агентом через ваше API плюшками, скидками на услуги, повышенной ставкой по вкладу и так далее, вы это всё умеете
5. собирать логи работы с апишкой
6. обучить уже наконец крутую агентную модель и зарелизить её в OpenSource
UPD.
7. сменить релизную политику, к моменту AI Journey в сентябре конкуренты выпустят десяток новых моделей и ваша "четвёрка" опять окажется слабее аналогов.
UPD2.
8. СРАЗУ добавлять новые модели на своё API после релиза, веса это конечно хорошо, но что толку от них если большинство не сможет попробовать модель без железа?
Моё предложение для спецов из Сбера как собрать датасет чтобы сделать модель лучше:
1. обновить уже наконец линейку сберовских моделей доступных по API, а то GigaChat 2 морально устарела во всём, плюс не только ваши модели, добавьте все какие хотите дистилить, ту же gpt-oss-120b и скажем kimi k2.7
2. добавить специальный ДЕШЁВЫЙ тариф для агентов работающих через API
3. запустить рекламу про домашнего агента, скажем на примере OpenClaw, ну или скажем моего Coddy Agent ;)
4. поощрять юзеров которые пользуются агентом через ваше API плюшками, скидками на услуги, повышенной ставкой по вкладу и так далее, вы это всё умеете
5. собирать логи работы с апишкой
6. обучить уже наконец крутую агентную модель и зарелизить её в OpenSource
UPD.
7. сменить релизную политику, к моменту AI Journey в сентябре конкуренты выпустят десяток новых моделей и ваша "четвёрка" опять окажется слабее аналогов.
UPD2.
8. СРАЗУ добавлять новые модели на своё API после релиза, веса это конечно хорошо, но что толку от них если большинство не сможет попробовать модель без железа?
👍19👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Мне нужен такой робот)) Кто знает где взять?)
😁44❤3
Forwarded from .NET epeshk blog
Claude Fable 5 написал GC для .NET на C#
Если точнее, модель довела до ума проект по написанию managed GC от Kevin Gosse. На некоторых бенчмарках, AI сгенерированный нейронкой GC не уступает в производительности оригинальному
neuecc с помощью Fable 5 ускорил WriteInt в MessagePack. Вместо того, чтобы просить AI ускорить код и make no mistakes применили итеративный подход. В промпт загружались C# исходник и его disassembly после JIT-компиляции + результаты бенчмарков. Модель анализировала ассемблерные инструкции и шаг за шагом подгоняла исходный C# код. Результат — ускорение в 4 раза
Anthropic купили bun — Javascript рантайм, на котором работает Claude Code. Сразу после покупки Fable 5 переписал bun с Zig на Rust за 11 дней, потратив на это $165K токенов
====
Нейронки эволюционировали и теперь успешно пишут не только веб на реакте, но и низкоуровневый код. Масштабные проекты и сложные переписывания архитектуры теперь реализуемы за пару недель. Единственное ограничение — бюджет на токены.
Языку Zig не повезло. ИИ просто исключил его из цепочки, отдав предпочтение более надежному Rust. Похожая участь досталась C# NativeAOT, когда порт компилятора TypeScript сделали на Go.
Можно считать, что ценность стека технологий == ценности проектов, которые на нём написаны. И теперь технологии без прочной экосистемы популярных продуктов будут быстро вытесняться нейросетями в пользу мейнстрима
@epeshkblog
Если точнее, модель довела до ума проект по написанию managed GC от Kevin Gosse. На некоторых бенчмарках, AI сгенерированный нейронкой GC не уступает в производительности оригинальному
neuecc с помощью Fable 5 ускорил WriteInt в MessagePack. Вместо того, чтобы просить AI ускорить код и make no mistakes применили итеративный подход. В промпт загружались C# исходник и его disassembly после JIT-компиляции + результаты бенчмарков. Модель анализировала ассемблерные инструкции и шаг за шагом подгоняла исходный C# код. Результат — ускорение в 4 раза
Anthropic купили bun — Javascript рантайм, на котором работает Claude Code. Сразу после покупки Fable 5 переписал bun с Zig на Rust за 11 дней, потратив на это $165K токенов
====
Нейронки эволюционировали и теперь успешно пишут не только веб на реакте, но и низкоуровневый код. Масштабные проекты и сложные переписывания архитектуры теперь реализуемы за пару недель. Единственное ограничение — бюджет на токены.
Языку Zig не повезло. ИИ просто исключил его из цепочки, отдав предпочтение более надежному Rust. Похожая участь досталась C# NativeAOT, когда порт компилятора TypeScript сделали на Go.
Можно считать, что ценность стека технологий == ценности проектов, которые на нём написаны. И теперь технологии без прочной экосистемы популярных продуктов будут быстро вытесняться нейросетями в пользу мейнстрима
@epeshkblog
X (formerly Twitter)
Kevin Gosse (@KooKiz) on X
My ".NET GC written in C#" project is coded by hand, bit by bit, as an educational project. But I couldn't resist the temptation of having Fable "speedrun" the project and show me a glimpse of what it could look like if I had more time.
So I let Fable work…
So I let Fable work…
😁5🤔5
Стрим: улучшение агентов через DSPy
Ну что, возобновляем сезон стримов.
Есть такая чудесная штука DSPy - инструмент этот позволяет агентов улучшать и LLM-пайплайны в автоматизированном режиме. А качество мелких LLMок с его помощью и вовсе можно улучшить в разы.
На недавнем митапе я познакомился с Николаем Сениным, который не просто активно пользуется DSPy, но и получает великолепные результаты с его помощью.
У Николая уже была готовая теоритическая преза, но поскольку инструмент непростой быстро стало ясно, что нагляднее всего будет показать его на примере реального кейса. В кач-ве кейса выбрали проект Николая - умный суммаризатор-разметчик для материалов (YouTube, книги и др), который умеет здорово размечать действительно нетривиальные и полезные идеи из текста, сервис называется Knowlume. Главное, что будет возможность заглянуть под капот сервиса - и код посмотреть и понять как там вообще все работает.
Время: вторник 21 июля 13:00 МСК (15:00 по Алматы).
Регистрация по ссылке.
А еще, открыта предварительная запись на стрим про CodeAlive и контекстные движки в четверг в 11:00 МСК (13:00 по Алматы). Полноценный анонс будет чуть позже.
@ai_driven
Ну что, возобновляем сезон стримов.
Есть такая чудесная штука DSPy - инструмент этот позволяет агентов улучшать и LLM-пайплайны в автоматизированном режиме. А качество мелких LLMок с его помощью и вовсе можно улучшить в разы.
На недавнем митапе я познакомился с Николаем Сениным, который не просто активно пользуется DSPy, но и получает великолепные результаты с его помощью.
У Николая уже была готовая теоритическая преза, но поскольку инструмент непростой быстро стало ясно, что нагляднее всего будет показать его на примере реального кейса. В кач-ве кейса выбрали проект Николая - умный суммаризатор-разметчик для материалов (YouTube, книги и др), который умеет здорово размечать действительно нетривиальные и полезные идеи из текста, сервис называется Knowlume. Главное, что будет возможность заглянуть под капот сервиса - и код посмотреть и понять как там вообще все работает.
Время: вторник 21 июля 13:00 МСК (15:00 по Алматы).
Регистрация по ссылке.
А еще, открыта предварительная запись на стрим про CodeAlive и контекстные движки в четверг в 11:00 МСК (13:00 по Алматы). Полноценный анонс будет чуть позже.
@ai_driven
👍16❤6
Forwarded from CodeAlive — Context Engine
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍5
Ну, это так для сравнения (DeepSWE 1.1).
Юзает ли кто-нибудь Gemini нынче? Кажется, совсем у них дела плохи. Раньше хоть дешевые мелкие модели были (мы в CodeAlive вовсю их гоняли при индексации), а сейчас вообще юзкейсы непонятны.
Я, кстати, в добавку к Codex и Claude взял еще на Grok подписку и использую в кач-ве ревьюера - действительно находит много интересного, я доволен.
А Fable использую как эксперта-консультанта, вызываю просто из Codex через свой скилл agents-consilium.
Еще молва пошла, что квен 3.8 якобы дюже силен. Но бенчмарков нету вообще, что подозрительно. Успел уже попробовать кто-нибудь новый квен? У меня уже хобби команду ревьюеров из сильных моделей собирать: обычно 5.6 Sol medium/high делает, затем зовет Grok 4.5/GLM 5.2/Opus 4.8 ревьюить, затем когда у простых работяг вопросов не остается, передает работу Fable на ревью. Видимо, команда моя скоро пополнится новой кими и квеном.
@ai_driven
Юзает ли кто-нибудь Gemini нынче? Кажется, совсем у них дела плохи. Раньше хоть дешевые мелкие модели были (мы в CodeAlive вовсю их гоняли при индексации), а сейчас вообще юзкейсы непонятны.
Я, кстати, в добавку к Codex и Claude взял еще на Grok подписку и использую в кач-ве ревьюера - действительно находит много интересного, я доволен.
А Fable использую как эксперта-консультанта, вызываю просто из Codex через свой скилл agents-consilium.
Еще молва пошла, что квен 3.8 якобы дюже силен. Но бенчмарков нету вообще, что подозрительно. Успел уже попробовать кто-нибудь новый квен? У меня уже хобби команду ревьюеров из сильных моделей собирать: обычно 5.6 Sol medium/high делает, затем зовет Grok 4.5/GLM 5.2/Opus 4.8 ревьюить, затем когда у простых работяг вопросов не остается, передает работу Fable на ревью. Видимо, команда моя скоро пополнится новой кими и квеном.
@ai_driven
❤4👍2
Вырубал комментарии временно, защищаясь от наплыва ботов. Сейчас вернул - пишите!