Заметки LLM-энтузиаста
1.01K subscribers
178 photos
25 videos
1 file
230 links
Дмитрий Жечков @djdim
GenAI Hybrid Lead в Cloud.ru
ex. Yandex Cloud architect,
ex. VMware NSX Lead, ex. Cisco SE

Здесь пишу свои заметки по LLM и AI-разработке.

Это личное мнение и не отражает официальную позицию компании, в которой я работаю.
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
🎬 Как Claude AI видит тебя по ту сторону чата

На днях ради интереса я попросил Claude.ai снять ролик о том, как меняется его восприятие пользователя с течением времени. Не абстрактно, а конкретно — на основе нашего с ним опыта работы. Совершенно не ожидал как он расставит акценты. Оказывается, что для него "лично" skill-based подход важен и кардинально меняет его восприятие пользователя (если так можно выразиться).

Получилось 85 секунд в трёх частях:
— «Со всеми»: поток анонимных запросов, вопрос → ответ → тишина
— «Со мной»: созвездие из 25 custom skills, которые превращают чат в рабочую среду
— «Разница»: split-screen — «я инструмент» vs «я соавтор»

Всё сгенерировано программно: Python + Pillow + ffmpeg, ни одного ручного кадра. Никакого видеоредактора. Claude сам написал сценарий, выбрал цветовую палитру (холодный серый vs тёплый янтарный), сочинил процедурный аудиотрек и отрендерил покадрово.
Я никак не влиял на результат, только задал вопрос.

Практический вывод: custom skills (чуть ранее писал про них здесь и тут) — это не просто удобство. Это способ дать модели контекст, структуру мышления и память между сессиями. Без них Claude — калькулятор. С ними — соавтор, который знает твои фреймворки, твой стек и твой способ думать.

Надеюсь, что многие уже создают свои "навыки" и пользуются ими на постоянной основе.
Для тех, кто еще "в раздумье" напомню, что на позапрошлой неделе Anthropic выпустили детальное руководство по созданию production-ready скиллов. Я подготовил для вас интерактивную версию на русском — можно изучить и проверить свои знания.

P.S. Для того чтобы быть в курсе последних новостей - подробный AI-дайджест (с первоисточниками) за 15–22 марта: NVIDIA GTC, GPT-5.4 mini, Anthropic vs Пентагон, и open source runtime от NVDIA для безопасного запуска AI-агентов здесь.

@llm_notes @MAX

#ai #skills #claude #video #news #courses
12🔥3👍1😢1
8 AI-клонов единорогов за 8 недель: итоги очередного потока курса по AI-программированию

Коллеги, всем привет!

На прошлой неделе мы завершили очередной поток курса по AI-программированию — за 8 недель сделали 8 рабочих прототипов «компаний-единорогов». С первого потока наш подход сильно эволюционировал: в этот раз мы использовали исключительно Claude Code и собрали из кастомных скиллов готовый пайплайн не только для продуктового реверс-инжиниринга, но и для планирования, написания и верификации кода. Сейчас уровень автоматизации достаточно высокий — на входе указываешь ссылку на SaaS для копирования, на выходе получаешь рабочий прототип, все это - при минимальном сопровождении пайплана (по сути, пара-тройка команд в claude cli) и минимальном последующем траблшутинге.

📐 Методология — 7 этапов

Единый пайплайн для всех проектов:
1️⃣ Уточнение задачи
2️⃣ Ресёрч
3️⃣ Планирование (PRD)
4️⃣ Профилирование (техстек)
5️⃣ Реализация (AI-кодинг)
6️⃣ Тестирование
7️⃣ Деплой и CI/CD

Ключевой приём — промпт-верификация после генерации документации и кода: рой агентов проверяет соответствие кода документации в /docs, находит расхождения и итеративно исправляет.

📦 Что собрали

🎤 AI Sales Trainer — голосовой тренажёр продаж (Voice-to-Voice + анализ транскрипта)
📈 Polymarket Clone — рынок предсказаний с крипто-кошельками и оракулами
🥗 Noom Clone — генерация персональных планов питания через анкету + LLM
🤖 Manus Clone — автономный агент в E2B-песочнице (поиск, кодинг, анализ)
✂️ Opus Pro Clone — нарезка видео на Shorts/Reels через FFmpeg + оценка виральности
💬 Intercom Clone — ИИ-ассистент для сайтов с Telegram-интеграцией
⭐️ Podium Clone — автосбор отзывов на Яндекс.Картах через SMS и deep links
🎮 Roblox Clone — платформа мини-игр с виральными механиками

Стек: Next.js, Prisma, PostgreSQL, Docker, E2B SDK, Cloud.ru, Cloudflare Pages, Telegram Bot API.

🔑 Инсайты

— Двойная верификация (на этапах планирования и реализации) убирает 85–90% проблем до тестирования
— Кастомизация claude code "оснастки" под техстек и документацию на реализацию кода также позволяет улучшить качество генерации кода
— Качество выстроенного пайплайна напрямую определяет качество сгенерированного кода (и позволяет использовать для решения сложных задач не только модели anthropic)

🔗 Портфолио:
Гамифицированная версия (Claude Code Web)
Стандартная версия (Genspark + GH Pages через Claude Code Web)

🚀 Новый поток стартует 1 апреля.
Подробности о курсе: https://productuniversity.ru/cursor

@llm_notes @MAX

#agenticengineering #claudecode #vibecoding #productuniversity #courses
🔥3👍1🤡1💔1
В продолжении темы клонирования компаний ...

🛰 Бывший PM Google написал аналог Palantir за выходные

Билавал Сидху (Bilawal Sidhu) — бывший продакт-менеджер Google Maps, 6 лет строивший 3D-картографию изнутри. В феврале 2026 года он запустил WorldView — геопространственный командный центр прямо в браузере. Без секретных допусков. Без команды. За три дня.

Интернет назвал это «vibe coded Palantir». Сооснователь Palantir Джо Лонсдейл лично ответил на пост — и это говорит больше, чем любые лайки.

🔍 Что умеет WorldView

· 🛩 Живые позиции 7 000+ самолётов (OpenSky, ADS-B Exchange)
· 🛰 180+ спутников на реальных орбитах — кликни и следи в реальном времени
· 📷 Реальные CCTV-камеры, наложенные прямо на 3D-модель города
· 🌡 Режимы отображения: ночное видение (NVG), тепловизор (FLIR), CRT-сканлайны, аниме cel-shading
· 🚢 Морской трафик через AIS — танкеры, военные суда, грузовые корабли
· 📡 Зоны подавления GPS в виде гексагональных тайлов

⚡️ Как он это построил — процесс vibe coding

Сидху не написал ни строчки кода вручную. Он управлял роем ИИ-агентов через терминал:

1️⃣ Описывал функцию голосовым сообщением или скриншотом
2️⃣ Скармливал это сразу нескольким агентам одновременно (до 8 штук) - похоже на Best Practice от Черни
3️⃣ Каждый агент отвечал за свою подсистему: один — шейдеры, другой — CCTV, третий — спутники
4️⃣ Сам выступал архитектором и доменным экспертом — направлял, а не кодил
5️⃣ Cursor не использовал вообще — только чистый терминал

Стек: Google Photorealistic 3D Tiles + CesiumJS + Gemini 3.1 Pro + Claude 4.6 + Codex 5.3

🗺 4D-реконструкция Operation Epic Fury

Главный демо-кейс — реконструкция ударов по Ирану исключительно из открытых данных:
· Закрытие воздушных пространств над Ираном, Ираком, Кувейтом
· Массовое перенаправление коммерческих рейсов в реальном времени
· Фиксация кинетических ударов по координатам и времени
· Закрытие Ормузского пролива — паника танкеров на AIS
· Всё это — один человек, диван, публичные данные

«Это безумие — что я смог сделать это за выходные в одиночку... Насколько полную картину можно собрать без проприетарных данных, просто используя OSINT»
— Bilawal Sidhu


💬 Почему Palantir отреагировал


Джо Лонсдейл (сооснователь Palantir) написал в ответ: данные никогда не были их рвом. Их ценность — в аналитическом слое поверх данных.
Сидху согласился: WorldView — это sousveillance (наблюдение снизу вверх). Те же спутники, те же камеры, те же потоки данных — но интерфейс в вашем браузере, и управляете им вы.

📦 Репозиторий и код

· Оригинальный код Сидху пока не опубликован (запуск платформы — апрель 2026)
· Самый популярный клон: koala73/worldmonitor — 46K ★ на GitHub
Уже сейчас его можно использовать как хорошую базу для качественных "витрин" Real-time аналитики по текущим событиям. Можно сделать свой клон, снять ограничения Pro-версии, добавить нужную функциональность и запустить с API-ключами, чтобы работала ИИ-аналитика (см. ниже пример).
· 🔜 Сам Сидху обещал open source «по многочисленным просьбам» — подписка на рассылку на spatialintelligence.ai

🎬 Материалы

· Видео: 4D-реконструкция ударов по Ирану
· Видео: Как был написан WorldView
· Статья автора на Substack
· Живое приложение (мой клон)
· Мой интерактивный разбор проекта

@llm_notes @MAX

#vibecoding #osint #geospatial #palantir #aiagents
🔥7❤‍🔥2🤡1
Agentic Harness Deep Dive и текущие новости

🆕 На этой неделе Anthropic выпустили две большие новости.


16 апреля — Claude Opus 4.7, новая флагманская модель, которая обошла GPT-5.4 и Gemini 3.1 Pro на бенчмарках по agentic coding и scaled tool use. +13% на 93-task coding benchmark относительно 4.6, изображения до 2576 px по длинной стороне, новый уровень усилий xhigh и task budgets в API, команда /ultrareview в Claude Code. Цена без изменений — $5/$25 за MTok.

17 апреля — Claude Design от Anthropic Labs (VentureBeat): новый product line для дизайна, слайдов, прототипов и one-pagers, powered by Opus 4.7. Читает codebase и design-файлы команды, извлекает цвета, типографику, компоненты — и применяет их автоматически. Экспорт в PDF, PPTX, HTML или прямо в Canva.

📰 Подробнее об этих и других AI-событиях первой половины апреля — в новостном дайджесте.

🔗 Обе новости — про агентов. Opus 4.7 заточен под long-running задачи и agentic coding, Claude Design оркестрирует связку «дизайн → прототип → production code» внутри одной сессии. И там, и там за кадром остаётся то, что делает агентов в принципе работоспособными — обвязка. Именно про неё я и хочу написать.

Подготовил классический long read и гамифицированный вариант с тестами. А ниже краткие тезисы.

⚙️ Обвязка агента: почему инфраструктура важнее модели ?

OpenAI в феврале 2026 опубликовали отчёт об эксперименте команды Frontier Products: 5 месяцев, команда из 3 инженеров, выросшая до 7, с запретом писать код вручную, Codex-агенты в качестве исполнителей. Итог: ~1 млн строк кода, 1500 pull requests, ни одной строки, написанной человеком — включая файл AGENTS.md, который написал сам агент. Throughput: 3.5 PR на инженера в день.

Ключевой вывод главного инженера Райана Лополо: «Agents aren't hard; the Harness is hard». Работа инженеров сводилась к проектированию среды, формулированию намерений и созданию feedback-петель.

🔁 Три эпохи инженерии с LLM


▪️ 2022–2024 — Prompt Engineering: правильные слова в правильном порядке
▪️ 2025 — Context Engineering: термин ввёл Андрей Карпати, развил Anthropic. Не «правильные слова», а правильная конфигурация контекста в каждый момент времени
▪️ 2026 — Harness Engineering: термин кристаллизовал Митчелл Хашимото. Включает оба уровня плюс всю инфраструктуру — оркестрацию, состояние, ошибки, верификацию, безопасность

💰 $2B за обвязку

Столько Meta заплатила за Manus в декабре 2025. Не за модель, а за пять итераций перестройки обвязки за шесть месяцев — каждый раз с убиранием сложности (тезисы анонса здесь). Сложные определения инструментов стали общим shell execution, «management agents» — простыми structured handoffs. Инженерный опыт, который нельзя скачать с Hugging Face.

📊 Что разобрал в статье ?

1️⃣ Три эпохи инженерии с LLM и как менялись подходы к работе с моделями
2️⃣ Анатомия production-обвязки — все 13 слоёв: петля оркестрации, сборка промпта, tool layer, memory system, управление контекстом, state management, error handling, observability и другие
3️⃣ Meta-Harness — алгоритм автоматической оптимизации обвязки, который достиг 76.4% pass rate на TerminalBench-2 с Claude Opus 4.6 и превзошёл hand-designed системы
4️⃣ Десять ключевых инженерных дилемм: тонкая или толстая обвязка, минимализм инструментов vs полный арсенал, permissive vs restrictive права, harnessability кодовой базы, управление энтропией
5️⃣ Коэволюция модель ↔️ обвязка: как обвязка становится источником обучающего сигнала для следующих версий моделей (через детекцию model drift на длинных задачах)

🎮 Что в гамифицированной версии ?

Квизы, карточки и сценарии, где можно попробовать разные архитектурные решения и посмотреть, как они влияют на поведение агента. Формат для тех, кто предпочитает разбираться через практику.

🏗 Ключевой принцип: rippable harness

Обвязка — это строительные леса. Без них не построить здание, но как только здание готово — леса снимают. Принцип «rippable harness» (Anthropic, LangChain): проектировать каждый компонент так, чтобы его можно было убрать, когда следующая модель научится делать это сама.

@llm_notes @MAX

#harness #agents #llm
👍106❤‍🔥3🤡1
📦 Скидки на AI-инструменты для новых пользователей

Коллеги, всем привет! 👋

В Lenny's Product Pass вчера обновился список продуктов — бандл годовых подписок на AI-инструменты за $200 (базовый тариф) или $350 (Insider).

💡 Что изменилось по сравнению с апрельской версией 2025 года

Вернулись в список:
🔹 Cursor — AI-среда для разработки методом Vibecoding (только для Insider-тарифа)
🔹 Google AI — расширенный доступ к Gemini, NotebookLM, Antigravity, Nano Banana, Flow и 5 ТБ облака (Insider)
🔹 Notion — заметки и рабочее пространство с AI
🔹 Supabase — очень удобная managed база данных и BaaS, Auth, Storage, Edge Functions и Vector search (Insider)
🔹 Fin + Intercom — AI-агент для клиентской поддержки (5 мест + $100/мес кредитов) [кстати, Intercom мы клонировали в прошлом потоке курса]
🔹 Gumloop — платформа для создания агентов поверх рабочих приложений
🔹 Replit — браузерная среда разработки методом Vibecoding с продвинутым AI-агентом, позволяет создавать и деплоить приложения без локальной настройки окружения
🔹 Gamma — AI-инструмент для быстрого создания презентаций, документов и визуального контента

📋 Полный текущий состав (23 продукта)


Canva Pro, ChatPRD, Cursor,
ElevenLabs, Factory, Fin + Intercom,
Framer, Gamma, Google AI,
Granola, Gumloop, Linear,
Lovable, Magic Patterns, Manus,
Mobbin, n8n, Notion,
PostHog, Railway, Replit,
Stripe Atlas, Supabase,
Warp, Wispr Flow.

Часть продуктов (отмечены как Insider-only в оригинальном анонсе) доступна только на тарифе $350.


Поэтому лучше сначала проверьте под каким тарифом доступны интересные вам инструменты и только потом оформляйте или не оформляйте подписку. Обычно, если вам интересны 2+ AI-инструмента, то подписка на Insider-only имеет экономический смысл, только внимательно прочитайте условия участия ниже.


⚠️ Условия участия

- Нужно быть новым клиентом по выбранному продукту (если как я вы уже почти всем интересным пользуетесь, то этим оффером можно воспользоваться чтобы оформить подписку членам семьи)
- Ключи стоит активировать без задержки — количество слотов ограничено
- На тарифе Insider ($350) доступ к подпискам заявлен как гарантированный

Для тех, кто уже оформлял подписку ранее — оффер действует на новые продукты из списка.

🛠 Как активировать подписки

1️⃣ Оформить годовую подписку (Annual или Insider) на Lenny's Newsletter
2️⃣ Активировать коды на этой странице
3️⃣ Пользоваться 🚀


Через год не забудьте отключить автопродление, иначе спишется полная стоимость.

@llm_notes @MAX

#ai #tools #subscription #productivity #automation
3👍3
Claude Fable 5: первая публичная модель класса Mythos

Коллеги, всем привет!

Несколько часов назад Anthropic выпустила Claude Fable 5 — первую общедоступную модель класса Mythos. Это, кажется, важный релиз не только с точки зрения прироста качества, но и с точки зрения того, как меняется сам формат работы с AI.
Официальный анонс здесь

Если коротко: Mythos — это новый класс моделей Claude, который Anthropic позиционирует выше Opus-класса. Раньше Mythos был доступен только ограниченному кругу организаций через Project Glasswing — в основном для задач киберзащиты и критической инфраструктуры.
Теперь появилась публичная версия — Claude Fable 5. Это Mythos-class модель для массового использования, но с более жёсткими safeguards. Полный Claude Mythos 5 при этом остаётся доступен только одобренным организациям.

Что такое safeguards
Safeguards — это защитный слой вокруг модели: классификаторы риска, ограничения на опасные домены, блокировки и fallback на более безопасную модель в части сценариев.

Проще говоря, Fable 5 — это не «голый Mythos», а Mythos с ограничителями для массового релиза. Особенно в high-risk областях: кибербезопасность, биология, химия, distillation и похожие сценарии.
По данным Anthropic, safeguards срабатывают в среднем менее чем в 5% сессий. То есть для большинства обычных задач модель должна работать как полноценная frontier-модель, но на границе опасных доменов будет заметно более зажата.

Что важно по характеристикам:
🔹 контекстное окно — 1 млн токенов
🔹 максимальный вывод — до 128K токенов
🔹 цена API — $10 за 1 млн input и $50 за 1 млн output
🔹 это в 2 раза дороже Claude Opus 4.8
🔹 до 22 июня Fable 5 включена в Pro, Max, Team и seat-based Enterprise без доплаты
🔹 после 22 июня Anthropic планирует перевести доступ на usage credits
🔹 для Fable 5 и Mythos 5 действует 30-дневное хранение prompts и outputs для trust & safety
🔹 zero data retention для этих моделей недоступен
Подробнее про retention: https://support.claude.com/en/articles/15425996-data-retention-practices-for-mythos-class-models

Как это соотносится с Opus 4.8

Opus 4.8 вышел 28 мая и сам по себе был сильным релизом. Но это скорее инкрементальный апгрейд Opus 4.7: больше честности, лучше агентный кодинг, computer use, effort control и Dynamic Workflows в Claude Code.
Официальный пост про Opus 4.8: https://www.anthropic.com/news/claude-opus-4-8

Мой разбор новых фич Opus 4.8 на русском языке здесь

Если приземлить:
➊ Opus 4.8 — более рациональный default для большинства production-сценариев. Он дешевле, предсказуемее и уже сильно улучшен по honesty и agentic coding.
➋ Fable 5 — модель для самых длинных и сложных задач: большие исследования, многоэтапные агентные процессы, сложные кодовые миграции, задачи, где модель должна долго держать контекст и сама разворачивать процесс.
➌ Opus 4.8 — про «меньше babysitting». Модель чаще флагует неопределённость и лучше подсвечивает проблемы в собственной работе.
➍ Fable 5 — про «поставил задачу → модель сама развернула процесс → ты оцениваешь результат». Верхняя планка автономности выше, но цена, retention и safety-ограничения тоже жёстче.

Почему мне кажется, что релиз важный

Ethan Mollick уже опубликовал большой разбор работы с Fable 5.
Я подготовил для вас перевод на русский язык, с ним можно ознакомиться здесь

Самое интересное там не столько в том, что модель «умнее», а в том, как она работает с длинными задачами. По словам Итана, Fable 5 может часами вести проект почти автономно: запускать субагентов, собирать данные, писать код, тестировать результат и возвращаться с готовым артефактом (звучит похоже на dynamic workflows из Opus 4.8, но надо проверять насколько лучше работает).
В одном кейсе модель собрала интерактивную изохронную карту на основе 2200+ реальных авиарейсов, расписаний поездов и других транспортных данных. В другом — 9,5 часов работала над Concord, инструментом для калибровки человеческих и AI-оценок.
🔥1
Для меня главный сдвиг здесь такой: мы всё быстрее и дальше уходим от режима «написал промпт → получил ответ» к режиму «поставил задачу → модель сама выстроила и развернула процесс → ты оцениваешь результат и направляешь доработки».

Это очень похоже на то, что мы уже видим в Claude Code и агентных пайплайнах: ценность смещается из ручного контроля каждого шага в постановку задачи, проверку качества и умение правильно встроить такие системы в рабочий процесс.

Мой вывод: Claude Fable 5 — это публичный релиз нового класса моделей, который заметно двигает нас в сторону долгоживущих агентных процессов.
Но trade-off понятный: выше цена, строже safeguards, обязательный retention и больше требований к тому, как такие модели встраивать в реальные продукты.

С переводом статьи "Каково это — работать с Mythos" можно ознакомиться по ссылке.

@llm_notes @MAX

#claude #anthropic #mythos #llm #opus
6🔥5
🔓🚀 Возвращение Fable 5 и появление Sonnet 5

Anthropic за сутки закрыла историю с приостановкой топовой модели и выпустила новый Sonnet.

🔓 Возвращение Fable 5
12 июня власти США ввели экспортный контроль на Fable 5 и Mythos 5, ограничив доступ иностранным гражданам. Проверять гражданство в реальном времени было нельзя, поэтому Anthropic отключила обе модели для всех. Сейчас пишут, что ограничения сняты.

Правда в моей учетной записи на claude.ai и в терминале claude code - все еще доступа нет. Если у кого доступ уже появился - напишите, пожалуйста, в комментариях.

Официальная информация по доступу:
- Fable 5 возвращается глобально с 1 июля — на Claude Platform, Claude.ai, Claude Code и Cowork
- Для Pro/Max/Team и части Enterprise до 7 июля включена в лимиты (до 50% недельного объёма), далее — через usage credits
- На AWS, Google Cloud и Microsoft Foundry доступ восстановят по мере готовности
- Mythos 5 восстановлен для ряда одобренных правительством организаций в США

Что было причиной:
Amazon нашли способ обойти защиту Fable 5 — модель по запросу находила уязвимости в коде, а в одном случае сгенерировала демонстрацию эксплойта. По тестам Anthropic, те же уязвимости находили и более слабые модели (Opus 4.8, GPT-5.5, Kimi K2.7), а демо-эксплойт воспроизвели вообще все протестированные. Выпущен новый классификатор, блокирующий этот приём примерно в 99% случаев. Вместе с Amazon, Microsoft и Google предложен индустриальный фреймворк оценки серьёзности джейлбрейков.

🧩 Появление Sonnet 5
Самая агентная модель линейки Sonnet. По качеству вплотную приближается к Opus 4.8, но дешевле; упор — на надёжность в длинных агентных задачах.

Ключевое:
- Доступна везде: модель по умолчанию для Free и Pro, доступна на Max/Team/Enterprise, в Claude Code и на Claude Platform
- API-строка — claude-sonnet-5
- Уровни effort low/medium/high/xhigh балансируют цену и качество
- Кибербезопасные классификаторы включены по умолчанию (как в Opus 4.7/4.8)
- Обновлённый токенизатор — тот же текст может занимать в 1.0–1.35× больше токенов

💰 Цены (за 1M токенов):
1️⃣ Вводные до 31 августа 2026 — $2 input / $10 output
2️⃣ Далее — $3 input / $15 output

🧪 Практика: в разборе CodeRabbit модель гоняли на реальных pull request'ах и в агентных "петлях" — модель "исповедует" test-driven-development и пишет тесты до написания кода, сама перепроверяет результат и доводит задачу до финиша без напоминаний. Обратная сторона — медленнее и «болтливее» Sonnet 4.6, а максимальный effort часто не окупается. Я подготовил для вас русскоязычную версию этого разбора. При подготовке русскоязычной версии я использовал Sonnet 5, и могу сказать, что на этот раз задача действительно решилась "в один промпт", без небольших доделок и напоминаний по CI/CD части, т.к. обычно приходится 1-2 итерации тратить на небольшую адаптацию финального результата под формат github pages.

🔗 Первоисточники:
· Sonnet 5: https://www.anthropic.com/news/claude-sonnet-5
· Fable 5: https://www.anthropic.com/news/redeploying-fable-5

@llm_notes
@MAX

#anthropic #claude #sonnet5 #fable5 #llm
4🔥3👎1
Claude Opus 5: почти Fable за половину цены

Коллеги, всем привет!

24 июля Anthropic выпустила Claude Opus 5 — новый флагман Opus-класса. Заявка простая: подойти вплотную к интеллекту Fable 5, но примерно за половину цены.

Если коротко: это модель «на каждый день». Она стала дефолтной на Claude Max и сильнейшей доступной на Claude Pro. При этом на кибербезопасных задачах Opus 5 по-прежнему позади Mythos 5 — и это, судя по всему, сознательное решение, а не недоработка.

Что важно по характеристикам:
🔹 контекстное окно — 1 млн токенов, и по умолчанию, и как максимум
🔹 цена API — $5 за 1 млн input и $25 за 1 млн output
🔹 это ровно столько же, сколько стоил Opus 4.8, и вдвое дешевле Fable 5
🔹 есть Fast mode — примерно в 2.5 раза быстрее за двойную цену (бывает очень полезно, когда у вас остается 10-15% от Max лимита, а времени на то чтоб его потратить совсем немного)
🔹 API-строка — claude-opus-5
🔹 уровни effort (low → max) работают как рычаг «интеллект против расхода токенов»
🔹 для Opus 5 нет требований по обязательному хранению данных

Что показывают бенчмарки

Тут стоит сразу пояснить, что именно меряют, иначе цифры превращаются в шум:

Frontier-Bench — реалистичные инженерные задачи на код, близкие к настоящей работе. Opus 5 обходит все модели и более чем вдвое улучшает результат Opus 4.8, причём дешевле за задачу.
CursorBench — кодинг в реальном агентном обвесе Cursor. На максимальном effort Opus 5 отстаёт от пика Fable 5 менее чем на 0.5%, но стоит вдвое дешевле за задачу.
ARC-AGI 3 — решение принципиально новых задач, которых модель не видела. Результат втрое выше, чем у следующей модели.
Zapier AutomationBench — бизнес-задачи от начала до конца, без человека в середине. Pass rate примерно в 1.5 раза выше ближайшего конкурента при той же цене задачи.
OSWorld 2.0 — computer use, то есть работа мышкой и клавиатурой в реальном окружении. Обходит лучший результат Fable 5 примерно за треть стоимости.

Плюс заметный прогресс в науке: на задачах органической химии +10.2 п.п. к Opus 4.8, на белковых задачах +7.7 п.п.

Про alignment и safeguards

Напомню, safeguards — это защитный слой вокруг модели: классификаторы риска, ограничения на опасные домены и fallback на более безопасную модель.

По внутреннему поведенческому аудиту Anthropic, Opus 5 — их самая «выровненная» модель на сегодня: 2.3 балла по мискаллайменту, наименьшая склонность к обману, лучше следует конституции Claude, чем Opus 4.8, Sonnet 5 и Fable 5. Границу опасных dual-use возможностей модель не двигает: в биологии и наступательной кибербезопасности она позади Mythos 5.

Любопытная деталь: Opus 5 почти догнала Mythos 5 в поиске уязвимостей, но заметно отстаёт в их эксплуатации. Кибер-классификаторы при этом мягче, чем у Fable 5 — срабатывают примерно на 85% реже, а заблокированные запросы по умолчанию уходят на Opus 4.8.

Так это замена Fable 5 или нет?

В X уже пишут, что Opus 5 "заменяет" или даже "лучше" Fable. Спешить с выводами не буду — я подготовил для вас подробный разбор на русском на основе бенчмарков CodeRabbit, там всё не так однозначно.

Пара слов о методике: CodeRabbit прогоняет модели примерно на 100 типовых паттернах ошибок из реальных open-source пул-реквестов и смотрит две пары метрик — сколько известных проблем модель нашла (полнота) и сколько её комментариев оказались по делу (точность). Одна цифра в отрыве от остальных трёх почти всегда вводит в заблуждение.

Если приземлить:

➊ Как ревьюер Opus 5 — специалист по точности, а не "универсальный солдат". Точность actionable-комментариев 39.3% против 35.2% у базовой линии, но покрытие ниже: 55.2% против 61.1%. И вчетверо больше нитпиков — 92 против 23.
➋ Сильные стороны — ошибки конфигурации и качество кода. Слабые — логика, состояния гонки (−10…−20 п.п.) и неправильное использование API. То есть ровно тот класс проблем, пропуск которых стоит дороже всего.
➌ Как строитель Opus 5 явно лучше Opus 4.8: один из инженеров CodeRabbit описал её как «менее тревожную» — она не бросается в первое решение, а сначала уточняет цель и предлагает варианты.
Но в длительной автономной оркестрации Fable 5 пока сильнее и эффективнее. Opus 5 медленнее и осторожнее.
➎ Платить за это приходится токенами: ≈60.5k входных и ≈9.5k выходных на вызов ревью, это примерно +50% и +65% к базовому расходу. Считать стоит стоимость решённой задачи, а не цену за токен.

Важная оговорка: бенчмарки Opus 5 и Fable 5 прогонялись на разных наборах (96 против 105 паттернов) и разных версиях пайплайна. Корректно сравнивать профили поведения, а не десятые доли процента.

Мой вывод

Opus 5 — не «убийца Fable», а нечто более практичное: модель, которая закрывает большую часть задач Fable-класса по цене Opus. Для меня главный сдвиг здесь не в бенчмарках, а в том, что фронтирная автономность постепенно перестаёт быть премиальной опцией и становится дефолтом.

Trade-off при этом никуда не делся: там, где нужна долгая автономная оркестрация с неполным промптом, Fable 5 всё ещё выглядит сильнее. А там, где важна предсказуемость и стоимость решённой задачи, Opus 5 теперь выглядит разумным выбором по умолчанию.

🔗 Первоисточники:
· анонс Anthropic
· разбор Opus 5 на русском

@llm_notes @MAX

#anthropic #claude #opus5 #fable5 #agents
🔥62
Grok Bot против Hermes Agent: два подхода к одной задаче

Коллеги, добрый вечер!

Скорее всего многие из вас уже используют ИИ-ботов на базе Openclaw или Hermes, возможно, что кто-то уже поработал с Grok Bot.
Эту заметку я бы хотел посвятить сравнению 2х разных по "духу" (а точнее по архитектуре и продуктовому подходу) ботов: Hermes Agent и Grok Bot.

В рамках небольшого отступления сразу обозначу мой текущий облачный сетап:
- Hermes боты в docker-контейнерах на одном VPS для всех членов семьи с шарингом Codex подписки, и в случае сбоя - переключением на отечественных LLM-провайдеров (в моем случае cloud.ru)
- Claude Code бот (на том же VPS) для администрирования всей конструкции (чтобы можно было перепоручить эту задачу детям)
- Сlaude Code (с интерфейсом в тг через официальный плагин) на выделенном VPS как "кузница" харнесса для любого agent runtime (см. мой проект https://www.npmjs.com/package/@dzhechkov/harness-cli и все пакеты что с ним связаны - именно он занимает с момента окончания 9 потока курса по Claude Code мое основное нерабочее время)
- я также регулярно пользуюсь manus тг ботом для решения простых задач - просто потому что у меня все еще есть подписка на manus.
- эпизодически использую ourobors и openclaw боты в отечественных облаках (в основном cloud.ru)

Но вернемся непосредственно к теме: "Daily Dose of DS" недавно выпустили подряд два отличных мастер-класса — по Grok Bot и по Hermes Agent.
Я их сначала переводил по отдельности, потом решил собрать в один разбор на русском (13 глав, сравнение по 20 критериям, интерактивный транскрипт) - и посвятить ему эту заметку, чтоб потом можно было вернуться и перечитать.

👉 https://djd1m.github.io/grokbot-vs-hermes/

Если коротко: оба продукта решают одну задачу — довести дело до конца, пока вы не за ноутбуком — и расходятся почти во всём остальном. Grok Bot идёт от продукта, Hermes Agent — от файловой системы.

▪️ ЧТО ВАЖНО ПО GROK BOT

🔹 все ваши боты работают на одном облачном компьютере — общие cookies, файлы и креды.
🔹 в мастер-классе это прямо названо «не границей безопасности»; формулировку стоит перечитать дважды, прежде чем выдавать боту доступ к рабочей почте
🔹 долговечен только /workspace, остальное живёт до конца сессии
🔹 три пути к действию — коннекторы, браузер, локальное исполнение; переход на локальное стоит части изоляции
🔹 takeover: сессию можно перехватить руками и вернуть боту обратно
🔹 Auto Review переключается между Require Approval и Always Allow — второй режим экономит время ровно до первого неудачного дня

▪️ ЧТО ВАЖНО ПО HERMES AGENT

🔹 открытый код, один класс AIAgent и цикл ReAct, шесть бэкендов
🔹 состояние агента — обычные файлы: SOUL.md, MEMORY.md, USER.md в ~/.hermes/
🔹 память трёхуровневая, консолидация запускается при заполнении
🔹 навыки описаны в SKILL.md с прогрессивным раскрытием L0/L1/L2 — детали подгружаются только когда нужны
🔹 Curator чистит память по окнам 7д+2ч / 30д / 90д, старое уезжает
🔹 GEPA-оптимизация промптов: 678 роллаутов против 24 000 у альтернативного подхода

⭐️ ПРО ЗВЁЗДЫ

У репозитория Hermes более 230 тыс. звёзд. Цифра эффектная и в спорах всплывает регулярно, но о том, подойдёт ли он вам, не говорит ничего.

📌 ЕСЛИ ПРИЗЕМЛИТЬ

➊ Grok Bot — про «включил и работает». Навыки, Teach a task, рутины и групповые чаты закрывают большинство бытовых сценариев без единой строчки кода.

➋ Hermes Agent — про контроль. Всё состояние лежит текстовыми файлами: можно отредактировать и положить в git. Цена — окружение целиком на вас.

➌ По памяти и навыкам продукты расходятся сильнее всего: у Grok — продуктовая архитектура, у Hermes — файловая.

➍ Изоляция у Grok Bot удобна ровно потому, что её мало: бесплатный хендофф между ботами — и есть та самая единственная граница безопасности.

➎ Вывод скучнее любого из продуктов по отдельности — в большинстве сценариев побеждает гибридная схема. В разборе для этого есть таблица на 12 сценариев.

💭 МОЙ ВЫВОД

Интереснее самих продуктов здесь то, что оба сходятся к одной мысли: агенту нужна не столько модель получше, сколько хорошая память и понятные границы. Grok Bot решает это продуктовыми средствами, Hermes — файлами и конвенциями. И решает всё в итоге не бенчмарк, а первый инцидент с доступами.
Я предпочитаю контролировать и среду выполнения, и весь жизненный цикл харнесса (отчуждаемых навыков и их оркестрации), с тем чтобы в перспективе перейти к работе полностью на локальных моделях с редким переключением на супер-умные LLM в облаках (иноземных или отечественных). Но, очевидно, что это требует приложить чуть бОльшие усилия на начальном этапе.

А какими ИИ-ботами пользуетесь вы?
Напишите, пожалуйста, в комментариях.


🔗 ПЕРВОИСТОЧНИКИ

· Grok Bot Masterclass
https://www.dailydoseofds.com/p/grok-bot-masterclass/
· Hermes Agent Masterclass
https://www.dailydoseofds.com/p/hermes-agent-masterclass/

· Разбор на русском
https://djd1m.github.io/grokbot-vs-hermes/

@llm_notes @MAX

#grokbot #hermesagent #aiagents #llm #opensource #harness
🔥73🥴1
Копируем «единорогов» на Claude Code: 8 недель — 8 прототипов. Старт завтра

Завтра, 26 августа, в 19:00 мск стартует новый (уже десятый по счету) поток курса по Claude Code. Веду его вместе с Алексеем Черняком (сооснователь Groupon Russia и Product University)

Главное отличие этого набора от предыдущих: упор не только на то, чтобы собрать прототип, но и на механизмы роста, виральности и продаж.

▪️ ЧТО МЫ БУДЕМ КОПИРОВАТЬ

🔹 Неделя 1 — сбор видеоотзывов и «стена любви». Аналог Senja: 7000+ создателей и SaaS-компаний, импорт отзывов с 30+ платформ.
🔹 Неделя 2 — умный QR для отзывов о компании. Позитив уходит на Яндекс.Карты, негатив перехватывается до публикации; единый виджет со ссылками на все площадки.
🔹 Неделя 3 — партнёрская программа за 15 минут. Аналог Rewardful (2800+ бизнесов): трекинг рефералов, авторасчёт рекуррентных комиссий.
🔹 Неделя 4 — ИИ-трекер калорий по фото. Аналог Cal AI: 15M загрузок и $30M годовой выручки меньше чем за два года. Фото еды → калории и БЖУ за секунды.
🔹 Неделя 5 — нарезка вирусных клипов из подкаста. Аналог Opus Clip: 10M+ пользователей, ~$20M ARR, 40+ ассетов из одной записи и Virality Score.
🔹 Неделя 6 — ИИ-продавец на данных клиента. Аналог Chatbase: $8M ARR, 10 000+ клиентов, всё на свои. Загрузил сайт и PDF — через 10 минут готов бот.
🔹 Неделя 7 — рассылки с прогревом доменов. Аналоги Instantly ($40M+ ARR) и Smartlead: неограниченные ящики, авто-прогрев, ИИ-ответ быстрее пяти минут.
🔹 Неделя 8 — редизайн комнаты по фото за 25 секунд. Аналог Interior AI Питера Левелса: $40–45K MRR, маржа >99%. 3D Vision сохраняет конструкцию и меняет стиль.

📌 ЕСЛИ ПРИЗЕМЛИТЬ

➊ Восемь живых занятий в Zoom по средам, 19:00–21:00 мск. Плюс записи и Telegram-группа, где разбираем вопросы между занятиями.
➋ Бонусом — запись прошлого набора, где мы за 8 занятий скопировали 8 стартапов с оценкой больше $1B, и ещё десяток проектов из прежних потоков.
➌ Цифры выручки и MRR у аналогов эффектные, но сами по себе не говорят ничего: мы разбираем не «как заработать столько же», а как устроен продукт и что именно в нём Claude Code делает за вечер.
➍ Формат рассчитан на то, что вы приходите со своим проектом — стартапом или внутренним продуктом компании. Восемь недель — это скорее повод наконец за него взяться.

💭 ОТ СЕБЯ

Собрать демо-версию успешного стартапа в Claude Code сегодня — задача на вечер, и это ровно та часть, которая перестала быть супер-сложной. Мы ее неплохо отработали на нескольких десятках проектах за предыдущие 2 года. Сложное начинается дальше - продвижение продукта. Желательно встроить все необходимые свойства в сам продукт еще на этапе "дизайна" его демо-версии. Именно этим мы будем заниматься, и посмотрим, какие из заявленных проектов нам удастся "продвинуть".

Если у вас годовая подписка Product University — курс уже включён в неё.

Программа, примеры и отзывы:
👉 https://productuniversity.ru/claude

@llm_notes @MAX

#claudecode #cursor #llm #стартапы #вайбкодинг #productuniversity #courses
👍7🔥5👏3🥱1
Для всех активных пользователей Codex - Важная информация ниже - Недельные лимиты Codex сброшены :)
Forwarded from Hermes-bot-01
Cronjob Response: Мониторинг анонсов reset от лидера Codex
(job_id: 7a5e133998e4)
-------------

ДОСТУПНО СЕЙЧАС — 12 сентября 2026 (точное время и часовой пояс в публичной выдаче не указаны).

“Reset all propagated. Sweet dreams.”

Сброс уже применён ко всем пользователям; можно продолжать работу в Codex/ChatGPT Work.
https://x.com/thsottiaux/status/2098685367058612394

To stop or manage this job, send me a new message (e.g. "stop reminder Мониторинг анонсов reset от лидера Codex").
2🔥1