Anthropic написал статью, как они строили harness для долгих автономных задач, прежде всего для:
• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.
Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.
───
Ключевые выводы статьи
1) Для длинных задач одного агента мало
На длинных прогонах агент:
• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.
Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.
───
2) Они используют роли: planner / generator / evaluator
Planner
• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.
Generator
• делает работу по спринтам/частям,
• реализует фичи одну за другой.
Evaluator
• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.
Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.
───
3) Для долгих задач важна работа с контекстом
Они отдельно подчеркивают проблему context anxiety:
• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.
Раньше они боролись с этим через context resets:
• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.
Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.
───
4) Коммуникация между агентами — через файлы/артефакты
Вместо хаотичного общего чата они передают состояние через структурированные файлы:
• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.
Это делает систему устойчивее и понятнее.
───
5) Для субъективных задач они формализуют критерии
На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:
• design quality
• originality
• craft
• functionality
После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.
───
6) Для full-stack разработки они используют “спринт-контракты”
Перед началом спринта generator и evaluator договариваются, что именно считается done.
Это очень сильная идея:
• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.
───
Что у них получилось
По их словам:
• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.
Пример из статьи:
• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200
То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.
───
Статья не про “волшебную модель”, а про инженерную правду:
1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.
Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.
───
Ключевые выводы статьи
1) Для длинных задач одного агента мало
На длинных прогонах агент:
• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.
Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.
───
2) Они используют роли: planner / generator / evaluator
Planner
• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.
Generator
• делает работу по спринтам/частям,
• реализует фичи одну за другой.
Evaluator
• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.
Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.
───
3) Для долгих задач важна работа с контекстом
Они отдельно подчеркивают проблему context anxiety:
• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.
Раньше они боролись с этим через context resets:
• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.
Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.
───
4) Коммуникация между агентами — через файлы/артефакты
Вместо хаотичного общего чата они передают состояние через структурированные файлы:
• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.
Это делает систему устойчивее и понятнее.
───
5) Для субъективных задач они формализуют критерии
На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:
• design quality
• originality
• craft
• functionality
После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.
───
6) Для full-stack разработки они используют “спринт-контракты”
Перед началом спринта generator и evaluator договариваются, что именно считается done.
Это очень сильная идея:
• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.
───
Что у них получилось
По их словам:
• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.
Пример из статьи:
• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200
То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.
───
Статья не про “волшебную модель”, а про инженерную правду:
1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
Anthropic
Harness design for long-running application development
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
Кстати, к вопросу. Такие обзоры как тот, что выше, пишет мне мой OpenClaw, когда я ему закидываю статью с командой «прочитать, пересказать». Удобно
👍1
Антропик начинает потихоньку разворачивать auto mode в Claude code
X (formerly Twitter)
Claude (@claudeai) on X
New in Claude Code: auto mode.
Instead of approving every file write and bash command, or skipping permissions entirely, auto mode lets Claude make permission decisions on your behalf.
Safeguard…
Instead of approving every file write and bash command, or skipping permissions entirely, auto mode lets Claude make permission decisions on your behalf.
Safeguard…
В продолжение прошлого поста - сейчас есть команда -dangerously skip permissions, которая всегда будет говорить «да» на вопросы пользователя, а теперь будет авто мод, который смотрит, где опасно, где нет, и будет человека дергать, но только по опасным случаям.
Сейчас по отдельным командам можно в настройках разрешения устанавливать, и это работает, но тут все будет работать автоматически, и в разных ситуациях по одной и той же команде Клод будет сам выполнять команду или спрашивать в зависимости от обстоятельств
Сейчас по отдельным командам можно в настройках разрешения устанавливать, и это работает, но тут все будет работать автоматически, и в разных ситуациях по одной и той же команде Клод будет сам выполнять команду или спрашивать в зависимости от обстоятельств
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Figma похоже начали догадываться что людям нужно больше.
Они открыли свой канвас для AI агентов.
Новый use_figma — агент создаёт и редактирует компоненты прямо на канвасе через вашу дизайн-систему. Переменные, компоненты, auto layout.
Claude Code, Codex, Cursor и другие MCP-клиенты теперь могут работать с Figma напрямую.
Появились skills которые объясняют агенту как работать в Figma.
Из основных:
Для команд где дизайнеры живут в Figma, то что нужно.
Сейчас бесплатно (бета), потом будет платным.
Гайд | Skills| GitHub
@tips_ai #news
Они открыли свой канвас для AI агентов.
Новый use_figma — агент создаёт и редактирует компоненты прямо на канвасе через вашу дизайн-систему. Переменные, компоненты, auto layout.
Claude Code, Codex, Cursor и другие MCP-клиенты теперь могут работать с Figma напрямую.
Появились skills которые объясняют агенту как работать в Figma.
Из основных:
• figma-implement-design: читает дизайн из Figma и генерирует рабочий код
• figma-generate-library: строит дизайн-систему в Figma из вашей кодовой базы
• figma-generate-design: собирает экраны из реальных компонентов и переменных
• figma-create-design-system-rules: сохраняет стандарты команды, агент их запоминает и применяет
Для команд где дизайнеры живут в Figma, то что нужно.
Сейчас бесплатно (бета), потом будет платным.
Гайд | Skills| GitHub
@tips_ai #news
Forwarded from Machinelearning
Система оптимизации производительности для AI-агентов. От победителя хакатона Anthropic.
Готовые к продакшену агенты, хуки, скилы, правила и MCP-конфигурации, которые эволюционировали за 10 месяцев ежедневной интенсивной работы над реальными продуктами.
Работает с Claude Code, Codex, Cowork и другими системами для AI-агентов.
@ai_machinelearning_big_data
🎯Полезные Мл-ресурсы
#AI #ML #aiagents #Claude
Please open Telegram to view this post
VIEW IN TELEGRAM
Очень хвалят в Х дистилированный на Qwen 3.5 27B Opus - но чтобы использовать локально надо 32гб или хотя бы 24...
huggingface.co
Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Про ускоренный переход на постквантовую криптографию зацепило (это шифры, которые не ломаются известными квантовыми алгоритмами, в отличие от большинства, используемых сейчас). Вчера еще читал новость, о том, как квантовый компьютер приделали к роботу, и он стал в 30 раз быстрее обрабатывать всю информацию о движениях (наши люди, кстати, делали)...
https://t.me/ai_machinelearning_big_data/9749
https://t.me/ai_machinelearning_big_data/9749
Telegram
Machinelearning
✔️ Apple дистиллирует Google Gemini.
В рамках партнерства с Google, Apple получила глубокий доступ к архитектуре Gemini. Инженеры используют дистилляцию знаний, чтобы перенести логику в легковесные решения для Apple Intelligence.
Модель Apple анализирует…
В рамках партнерства с Google, Apple получила глубокий доступ к архитектуре Gemini. Инженеры используют дистилляцию знаний, чтобы перенести логику в легковесные решения для Apple Intelligence.
Модель Apple анализирует…
Вожусь с графами, чтобы модель лучше ПОНИМАЛА смысл текста. И, судя по всему, проблема (помимо методических) в том, что для создания по тексту графа нельзя использовать дешевые модели, как в RAG. Надо - дорогую, и, возможно, САМУЮ дорогую. Впрочем, стоит ли удивляться - ведь задача-то сложная..
Хотите запустить Qwen 35B на мак мини? С 16гб? Тогда вам сюда. Обещают 30 токенов в секунду. Правда, на контекст мало памяти останется
GitHub
GitHub - walter-grace/mac-code: mac code — Claude Code, but it runs on your Mac for free. 35B AI agent at 30 tok/s via Apple…
mac code — Claude Code, but it runs on your Mac for free. 35B AI agent at 30 tok/s via Apple Silicon flash-paging. $0/month. - walter-grace/mac-code
Maestro
Undenis
Вышла новая Suno 5.5, посвящаю этот трек Маэстро 🐱 🐱
Please open Telegram to view this post
VIEW IN TELEGRAM
Codex запустил плагины в своем приложении типа @gmail @figma, и обнулил лимиты, чтобы можно было их как следует потестировать. Праздник продолжается
X (formerly Twitter)
OpenAI Developers (@OpenAIDevs) on X
We're rolling out plugins in Codex.
Codex now works seamlessly out of the box with the most important tools builders already use, like @SlackHQ, @Figma, @NotionHQ, @gmail, and more.
https://t.co/PQDsLqHGA6
Codex now works seamlessly out of the box with the most important tools builders already use, like @SlackHQ, @Figma, @NotionHQ, @gmail, and more.
https://t.co/PQDsLqHGA6
Ну а Claude code запустил auto fix команду для автоматического исправления ошибок..
X (formerly Twitter)
Noah Zweben (@noahzweben) on X
Thrilled to announce Claude Code auto-fix – in the cloud. Web/Mobile sessions can now automatically follow PRs - fixing CI failures and addressing comments so that your PR is always green.
This happens remotely so you can fully walk away and come back to…
This happens remotely so you can fully walk away and come back to…
Появился ещё один интересный кандидат для голосовых агентов — Voxtral Mini 4B Realtime от Mistral.
Что важно:
• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.
Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.
Ссылки:
• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
Что важно:
• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.
Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.
Ссылки:
• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
huggingface.co
mistralai/Voxtral-Mini-4B-Realtime-2602 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Data Secrets
Google выпустили Gemini 3.1 Flash Live
Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.
Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).
Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.
По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.
Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.
Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.
Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).
Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.
По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.
Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.
Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
Forwarded from Анализ данных (Data analysis)
Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.
Что внутри:
• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов
• Большая библиотека кастомных команд под реальные задачи
• Готовые шаблоны памяти - как для одиночной работы, так и для команд
• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации
• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия
• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам
• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает
• Примеры настройки узкоспециализированных субагентов
• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы
https://github.com/luongnv89/claude-howto
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Может быть интересно, если есть задачки для средненькой модели
https://t.me/ai_machinelearning_big_data/9765
https://t.me/ai_machinelearning_big_data/9765
Telegram
Machinelearning
GLM-5.1 теперь доступна для всех пользователей плана GLM Coding!
http://z.ai/subscribe
@ai_machinelearning_big_data
#news #ai #ml #glm
http://z.ai/subscribe
@ai_machinelearning_big_data
#news #ai #ml #glm
Мне тут Клод пишет, что из-за нехватки памяти Apple сняли с производства Mac Studio M3 Ultra 512….