Forwarded from .NET epeshk blog
Claude Fable 5 написал GC для .NET на C#
Если точнее, модель довела до ума проект по написанию managed GC от Kevin Gosse. На некоторых бенчмарках, AI сгенерированный нейронкой GC не уступает в производительности оригинальному
neuecc с помощью Fable 5 ускорил WriteInt в MessagePack. Вместо того, чтобы просить AI ускорить код и make no mistakes применили итеративный подход. В промпт загружались C# исходник и его disassembly после JIT-компиляции + результаты бенчмарков. Модель анализировала ассемблерные инструкции и шаг за шагом подгоняла исходный C# код. Результат — ускорение в 4 раза
Anthropic купили bun — Javascript рантайм, на котором работает Claude Code. Сразу после покупки Fable 5 переписал bun с Zig на Rust за 11 дней, потратив на это $165K токенов
====
Нейронки эволюционировали и теперь успешно пишут не только веб на реакте, но и низкоуровневый код. Масштабные проекты и сложные переписывания архитектуры теперь реализуемы за пару недель. Единственное ограничение — бюджет на токены.
Языку Zig не повезло. ИИ просто исключил его из цепочки, отдав предпочтение более надежному Rust. Похожая участь досталась C# NativeAOT, когда порт компилятора TypeScript сделали на Go.
Можно считать, что ценность стека технологий == ценности проектов, которые на нём написаны. И теперь технологии без прочной экосистемы популярных продуктов будут быстро вытесняться нейросетями в пользу мейнстрима
@epeshkblog
Если точнее, модель довела до ума проект по написанию managed GC от Kevin Gosse. На некоторых бенчмарках, AI сгенерированный нейронкой GC не уступает в производительности оригинальному
neuecc с помощью Fable 5 ускорил WriteInt в MessagePack. Вместо того, чтобы просить AI ускорить код и make no mistakes применили итеративный подход. В промпт загружались C# исходник и его disassembly после JIT-компиляции + результаты бенчмарков. Модель анализировала ассемблерные инструкции и шаг за шагом подгоняла исходный C# код. Результат — ускорение в 4 раза
Anthropic купили bun — Javascript рантайм, на котором работает Claude Code. Сразу после покупки Fable 5 переписал bun с Zig на Rust за 11 дней, потратив на это $165K токенов
====
Нейронки эволюционировали и теперь успешно пишут не только веб на реакте, но и низкоуровневый код. Масштабные проекты и сложные переписывания архитектуры теперь реализуемы за пару недель. Единственное ограничение — бюджет на токены.
Языку Zig не повезло. ИИ просто исключил его из цепочки, отдав предпочтение более надежному Rust. Похожая участь досталась C# NativeAOT, когда порт компилятора TypeScript сделали на Go.
Можно считать, что ценность стека технологий == ценности проектов, которые на нём написаны. И теперь технологии без прочной экосистемы популярных продуктов будут быстро вытесняться нейросетями в пользу мейнстрима
@epeshkblog
X (formerly Twitter)
Kevin Gosse (@KooKiz) on X
My ".NET GC written in C#" project is coded by hand, bit by bit, as an educational project. But I couldn't resist the temptation of having Fable "speedrun" the project and show me a glimpse of what it could look like if I had more time.
So I let Fable work…
So I let Fable work…
😁5🤔5
Стрим: улучшение агентов через DSPy
Ну что, возобновляем сезон стримов.
Есть такая чудесная штука DSPy - инструмент этот позволяет агентов улучшать и LLM-пайплайны в автоматизированном режиме. А качество мелких LLMок с его помощью и вовсе можно улучшить в разы.
На недавнем митапе я познакомился с Николаем Сениным, который не просто активно пользуется DSPy, но и получает великолепные результаты с его помощью.
У Николая уже была готовая теоритическая преза, но поскольку инструмент непростой быстро стало ясно, что нагляднее всего будет показать его на примере реального кейса. В кач-ве кейса выбрали проект Николая - умный суммаризатор-разметчик для материалов (YouTube, книги и др), который умеет здорово размечать действительно нетривиальные и полезные идеи из текста, сервис называется Knowlume. Главное, что будет возможность заглянуть под капот сервиса - и код посмотреть и понять как там вообще все работает.
Время: вторник 21 июля 13:00 МСК (15:00 по Алматы).
Регистрация по ссылке.
А еще, открыта предварительная запись на стрим про CodeAlive и контекстные движки в четверг в 11:00 МСК (13:00 по Алматы). Полноценный анонс будет чуть позже.
@ai_driven
Ну что, возобновляем сезон стримов.
Есть такая чудесная штука DSPy - инструмент этот позволяет агентов улучшать и LLM-пайплайны в автоматизированном режиме. А качество мелких LLMок с его помощью и вовсе можно улучшить в разы.
На недавнем митапе я познакомился с Николаем Сениным, который не просто активно пользуется DSPy, но и получает великолепные результаты с его помощью.
У Николая уже была готовая теоритическая преза, но поскольку инструмент непростой быстро стало ясно, что нагляднее всего будет показать его на примере реального кейса. В кач-ве кейса выбрали проект Николая - умный суммаризатор-разметчик для материалов (YouTube, книги и др), который умеет здорово размечать действительно нетривиальные и полезные идеи из текста, сервис называется Knowlume. Главное, что будет возможность заглянуть под капот сервиса - и код посмотреть и понять как там вообще все работает.
Время: вторник 21 июля 13:00 МСК (15:00 по Алматы).
Регистрация по ссылке.
А еще, открыта предварительная запись на стрим про CodeAlive и контекстные движки в четверг в 11:00 МСК (13:00 по Алматы). Полноценный анонс будет чуть позже.
@ai_driven
👍17❤7
Forwarded from CodeAlive — Context Engine
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11👍7
Ну, это так для сравнения (DeepSWE 1.1).
Юзает ли кто-нибудь Gemini нынче? Кажется, совсем у них дела плохи. Раньше хоть дешевые мелкие модели были (мы в CodeAlive вовсю их гоняли при индексации), а сейчас вообще юзкейсы непонятны.
Я, кстати, в добавку к Codex и Claude взял еще на Grok подписку и использую в кач-ве ревьюера - действительно находит много интересного, я доволен.
А Fable использую как эксперта-консультанта, вызываю просто из Codex через свой скилл agents-consilium.
Еще молва пошла, что квен 3.8 якобы дюже силен. Но бенчмарков нету вообще, что подозрительно. Успел уже попробовать кто-нибудь новый квен? У меня уже хобби команду ревьюеров из сильных моделей собирать: обычно 5.6 Sol medium/high делает, затем зовет Grok 4.5/GLM 5.2/Opus 4.8 ревьюить, затем когда у простых работяг вопросов не остается, передает работу Fable на ревью. Видимо, команда моя скоро пополнится новой кими и квеном.
@ai_driven
Юзает ли кто-нибудь Gemini нынче? Кажется, совсем у них дела плохи. Раньше хоть дешевые мелкие модели были (мы в CodeAlive вовсю их гоняли при индексации), а сейчас вообще юзкейсы непонятны.
Я, кстати, в добавку к Codex и Claude взял еще на Grok подписку и использую в кач-ве ревьюера - действительно находит много интересного, я доволен.
А Fable использую как эксперта-консультанта, вызываю просто из Codex через свой скилл agents-consilium.
Еще молва пошла, что квен 3.8 якобы дюже силен. Но бенчмарков нету вообще, что подозрительно. Успел уже попробовать кто-нибудь новый квен? У меня уже хобби команду ревьюеров из сильных моделей собирать: обычно 5.6 Sol medium/high делает, затем зовет Grok 4.5/GLM 5.2/Opus 4.8 ревьюить, затем когда у простых работяг вопросов не остается, передает работу Fable на ревью. Видимо, команда моя скоро пополнится новой кими и квеном.
@ai_driven
❤5👍4
Вырубал комментарии временно, защищаясь от наплыва ботов. Сейчас вернул - пишите!
Все лимиты и ресеты для Codex 200$ закончились. Рекорд - расход 2 недельных подписки за сутки (работа над RepoContextBench v2 ведется полным ходом). А Claude медленный, да еще и с лимитированным фейблом. В итоге, взял Грока за 300$ 100$ - говорят, там лимиты почти бесконечные и все очень быстро. Грок за 30$ мне понравился как по качеству, так и по скорости.
Грока я использую в качестве исполнителя внутри OpenCode (возможно, перееду теперь на его нативный харнесс Grok Build) через свой скилл agents-consilium, его вызывает Codex App или Claude как субагента, поэтому получается очень удобно.
Итого, сетап теперь такой:
Планирует Fable или GPT-5.6 Sol high/xhigh, а что вместе. Иногда GPT 5.6 Sol Pro.
Выполняет Grok 4.5 high
Ревьят: Opus 4.8, GPT 5.6 Sol, GLM 5.2 и по итогу Fable. Позже добавлю Kimi K3 в ревьюеры и посмотрим еще на возможности релизной DeepSeek V4 Pro и Qwen 3.8.
Итого 4 подписки: Codex 200$, Claude 100$ (для Fable и ревью), OpenCode 10$ для ревью через китайцев (для работы практически бессмысленная, только нечастые ревью разве что).
Есть еще темная лошадка SWE 1.7 от ребят из Devin - супер быстрый (на Cerebras чипах) и, судя по Frontier Code, с классными результатами. Если кто пробовал - отпишитесь.
Еще, мне регулярно перестает хватать мощностей моего мака на комфортную разработку, поэтому планирую арендовать VMку и делегировать тяжелые задачи агента туда.
Ах да, напоследок - лайфхак. Поскольку ручной сброс кодекс лимитов просто стартует новую неделю - получается, что выгоднее сразу после органического сброса как можно быстрее выжать лимиты, затем сделать ручной сброс, тогда вы за один и тот же помежуток временисделаете больше работы нагенерите больше кода и, условно, в месячной подписке станет почти 6 полных недельных квот вместо 5-ти (без учета общих сбросах). Почему-то об этом никто не пишет.
@ai_driven
Грока я использую в качестве исполнителя внутри OpenCode (возможно, перееду теперь на его нативный харнесс Grok Build) через свой скилл agents-consilium, его вызывает Codex App или Claude как субагента, поэтому получается очень удобно.
Итого, сетап теперь такой:
Планирует Fable или GPT-5.6 Sol high/xhigh, а что вместе. Иногда GPT 5.6 Sol Pro.
Выполняет Grok 4.5 high
Ревьят: Opus 4.8, GPT 5.6 Sol, GLM 5.2 и по итогу Fable. Позже добавлю Kimi K3 в ревьюеры и посмотрим еще на возможности релизной DeepSeek V4 Pro и Qwen 3.8.
Итого 4 подписки: Codex 200$, Claude 100$ (для Fable и ревью), OpenCode 10$ для ревью через китайцев (для работы практически бессмысленная, только нечастые ревью разве что).
Есть еще темная лошадка SWE 1.7 от ребят из Devin - супер быстрый (на Cerebras чипах) и, судя по Frontier Code, с классными результатами. Если кто пробовал - отпишитесь.
Еще, мне регулярно перестает хватать мощностей моего мака на комфортную разработку, поэтому планирую арендовать VMку и делегировать тяжелые задачи агента туда.
Ах да, напоследок - лайфхак. Поскольку ручной сброс кодекс лимитов просто стартует новую неделю - получается, что выгоднее сразу после органического сброса как можно быстрее выжать лимиты, затем сделать ручной сброс, тогда вы за один и тот же помежуток времени
@ai_driven
3❤19👍9
Opus 5
Похоже, все-таки придется снова брать Claude 200$...
Для гурманов: Opus 5 System Card. (193 страницы paper!)
Похоже, все-таки придется снова брать Claude 200$...
Для гурманов: Opus 5 System Card. (193 страницы paper!)
🤯8👍4
Аномалии Opus 5 и оптимальный reasoning effort
Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне.
И там видно, что в Opus 5 medium effort часто оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК).
Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем.
Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво.
И любопытный факт - новенький FrontierBench v0.1 (уже третий "фронтир" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high.
@ai_driven
Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне.
И там видно, что в Opus 5 medium effort часто оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК).
Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем.
Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво.
И любопытный факт - новенький FrontierBench v0.1 (уже третий "фронтир" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high.
@ai_driven
👍12❤7
Kimi K3 и ревью моделями разных семейств
Ну как вам новая Kimi K3? Медленно? Если использовать ее не как основную модель, а как еще одно мнение - вполне норм, тем более, что она действительно находит интересное в дополнение к Опусу. Сейчас как раз работаю над очень сложной задачкой по улучшению комплексного и длительного воркфлоу, он должен быть устойчивым к разным сбоям, там всякие outbox'ы, умные фолбеки и другие нетривиальные штуки, в которых нейронки часто ошибаются. Предыдущие агенты полноценно не могли осисить эту задачу - постоянно что-то где-то вылетало. План делали уже по традиции Sol, Fable, Opus и даже Kimi K3 - в комплексных (или исследовательских) задачах, когда много unknown unknowns чем больше хороших и разнообразных моделей - тем лучше. Но даже самый сильный план не всегда гарантия идеального кода, поэтому в таких случаях есть смысл еще и итоговую реализацию дополнительно ревьюить (тем более, что исполнителям иногда свойственно срезать углы). Так вот, конкретно в этом кейсе ревью я прогнал через Opus 5 (medium) и Kimi K3 (max) (на DeepSWE, кстати, у обоих 69%). Результаты на скрине.
Собсна, чье ревью сильнее даже не так важно в данном случае, важнее - кол-во уникальных (не пересекающихся) находок, а их 4 у Kimi и 5 у Opus - т. е. кими дополнила ревью опуса аж 4-мя находками и главное все они оказались релевантны. Однозначно беру в коллекцию ревьюеров. Будем наблюдать дальше.
Кстати, в самых тяжелых случаях все еще можно отправить архив релевантных файлов на ревью в GPT 5.6 Pro. Но тут сразу важный нюанс - если у вас такая задача, что самые мощные модели 2+ раза подряд находят реальные проблемы, то это хороший повод задуматься о том, что, скорее всего, все-таки есть переусложнение, и, вероятно, на нее уже есть готовое и хорошо протестированное решение - возможно, будет дешевле поискать их получше. Ну, либо задача слишком большая и стоило бить ее на меньшие сабтаски.
Про Опус 5: хоть ее все равно все еще приходится направлять и подсказывать (а вы что хотели?), мне моделька нравится - весьма понимающая и не соглашается на все в подряд. А слог ее так вообще шикарен. GPT семейство по традиции общается довольно сухо, у Opus'а же наоборот частенько проскакивают нотки гуманитария, речь богаче и живее - это приятно.
Что касается практической части, то напомню, что ревью я запускаю через скилл agents-consilium - он теперь наблюдаемый и умеет стримить прогресс вызывающей стороне - стало сильно удобнее. А еще, там появилось два совершенно новых режима explore и delegate, про которые я расскажу отдельно.
Итого, текущий джентельменский наборвайб-кодера agentic инженера: Опус/Фейбл/Sol/Kimi K3 - план и интервью, Grok 4.5 (ну или Terra/Luna) - исследование контекста и реализация, и все те же Опус, Фейбл, Sol, K3 код-ревью. Стадию плана лучше дополнять парочкой очень важных скиллов для борьбы со сложностью (FPF, code-that-fits-in-your-head).
Kimi K3 я использую внутри OpenCode через подписку OpenCode Go за 10$/мес (моя рефка с бонусом) и еще держу резерв на Synthetic за 30$ (моя рефка тоже с бонусом).
@ai_driven
Ну как вам новая Kimi K3? Медленно? Если использовать ее не как основную модель, а как еще одно мнение - вполне норм, тем более, что она действительно находит интересное в дополнение к Опусу. Сейчас как раз работаю над очень сложной задачкой по улучшению комплексного и длительного воркфлоу, он должен быть устойчивым к разным сбоям, там всякие outbox'ы, умные фолбеки и другие нетривиальные штуки, в которых нейронки часто ошибаются. Предыдущие агенты полноценно не могли осисить эту задачу - постоянно что-то где-то вылетало. План делали уже по традиции Sol, Fable, Opus и даже Kimi K3 - в комплексных (или исследовательских) задачах, когда много unknown unknowns чем больше хороших и разнообразных моделей - тем лучше. Но даже самый сильный план не всегда гарантия идеального кода, поэтому в таких случаях есть смысл еще и итоговую реализацию дополнительно ревьюить (тем более, что исполнителям иногда свойственно срезать углы). Так вот, конкретно в этом кейсе ревью я прогнал через Opus 5 (medium) и Kimi K3 (max) (на DeepSWE, кстати, у обоих 69%). Результаты на скрине.
Собсна, чье ревью сильнее даже не так важно в данном случае, важнее - кол-во уникальных (не пересекающихся) находок, а их 4 у Kimi и 5 у Opus - т. е. кими дополнила ревью опуса аж 4-мя находками и главное все они оказались релевантны. Однозначно беру в коллекцию ревьюеров. Будем наблюдать дальше.
Кстати, в самых тяжелых случаях все еще можно отправить архив релевантных файлов на ревью в GPT 5.6 Pro. Но тут сразу важный нюанс - если у вас такая задача, что самые мощные модели 2+ раза подряд находят реальные проблемы, то это хороший повод задуматься о том, что, скорее всего, все-таки есть переусложнение, и, вероятно, на нее уже есть готовое и хорошо протестированное решение - возможно, будет дешевле поискать их получше. Ну, либо задача слишком большая и стоило бить ее на меньшие сабтаски.
Про Опус 5: хоть ее все равно все еще приходится направлять и подсказывать (а вы что хотели?), мне моделька нравится - весьма понимающая и не соглашается на все в подряд. А слог ее так вообще шикарен. GPT семейство по традиции общается довольно сухо, у Opus'а же наоборот частенько проскакивают нотки гуманитария, речь богаче и живее - это приятно.
Что касается практической части, то напомню, что ревью я запускаю через скилл agents-consilium - он теперь наблюдаемый и умеет стримить прогресс вызывающей стороне - стало сильно удобнее. А еще, там появилось два совершенно новых режима explore и delegate, про которые я расскажу отдельно.
Итого, текущий джентельменский набор
Kimi K3 я использую внутри OpenCode через подписку OpenCode Go за 10$/мес (моя рефка с бонусом) и еще держу резерв на Synthetic за 30$ (моя рефка тоже с бонусом).
@ai_driven
2👍14❤4
Агентам не нужен TDD
Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей.
А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование... Кто-то считает CRAP и делает мутационные тесты? Если первое ещё иногда интересно, то второе довольно спорная техника - если практикуете расскажите.
TDD != тесты
А по поводу TDD (его щас прям любят вайб кодеры тиражировать), то давно понятно, что классический TDD цикл (красный тест > код > зелёный тест > рефакторинг, причем мелкими итерациями) с агентами больше похож на прожигание токенов, чем на что-то полезное. Смысл имеет скорее разнообразные тест кейсы перед реализацией продумывать с агентом (включая интересные техники типа pairwise testing), сохранить их в маркдаун или (по BDD или нет - не принципиально).
Ну и, конечно, одних лишь юнитов недостаточно совсем, они в принципе часто мало чего хорошего дадут проверить просто by design - идеально использовать умную связку из разных видов тестов - по пирамиде тестирования или лучше даже по трофею (статические проверки), ну или на худой конец хотя бы e2e или browser use/computer use.
А когда вайб кодеры говорят про важность TDD часто просто имеют в виду, что нужно тестировать и верифицировать результат - что, конечно, бесспорно. Но Кент Бэк TDD это же не про это, это именно про красный тест > код > зелёный тест. Вот так начинают путаться классические термины с этими нашими вайб кодингами... В общем, если вы ещё используете TDD с агентами - скорее всего, онвам им не нужен.
@ai_driven
Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей.
А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование... Кто-то считает CRAP и делает мутационные тесты? Если первое ещё иногда интересно, то второе довольно спорная техника - если практикуете расскажите.
TDD != тесты
А по поводу TDD (его щас прям любят вайб кодеры тиражировать), то давно понятно, что классический TDD цикл (красный тест > код > зелёный тест > рефакторинг, причем мелкими итерациями) с агентами больше похож на прожигание токенов, чем на что-то полезное. Смысл имеет скорее разнообразные тест кейсы перед реализацией продумывать с агентом (включая интересные техники типа pairwise testing), сохранить их в маркдаун или (по BDD или нет - не принципиально).
Ну и, конечно, одних лишь юнитов недостаточно совсем, они в принципе часто мало чего хорошего дадут проверить просто by design - идеально использовать умную связку из разных видов тестов - по пирамиде тестирования или лучше даже по трофею (статические проверки), ну или на худой конец хотя бы e2e или browser use/computer use.
А когда вайб кодеры говорят про важность TDD часто просто имеют в виду, что нужно тестировать и верифицировать результат - что, конечно, бесспорно. Но Кент Бэк TDD это же не про это, это именно про красный тест > код > зелёный тест. Вот так начинают путаться классические термины с этими нашими вайб кодингами... В общем, если вы ещё используете TDD с агентами - скорее всего, он
@ai_driven
1👍24👎10🤔7❤2🎉2
AI-Driven Development. Родион Мостовой
Агентам не нужен TDD Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей. А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование...…
Какой-то баг с реациями в ТГ случился (навайбкодили опять) и были доступны только дизлайки и сомнения, поэтому мы с дядей Бобом собрали рекордное кол-во дизайков под постом, я еще начал думать, что никто уже не читает такие "длинные" посты до конца. Короче, если вы хотели отреагировать как-то иначе - теперь можно. А еще лучше - подключайтесь к дискусси, тк дебаты разгорелись нехилые в комментариях...
😁16🎉2🤔1🤯1