Как поделелились коллеги, у нас уже был эпизод, когда чувак устроился на работу, используя ИИ, который слушал вопросы и давал подсказки для прохождения интервью. Но с работой не получилось - видимо, был слабоват в вайбкодинге. А так, надо понимать, что скоро все наши резюме будут писать эти ИИшки
https://t.me/machinelearning_interview/2609
https://t.me/machinelearning_interview/2609
Telegram
Machine learning Interview
💼 Полезный опенсорс персональный ИИ-тренер для поиска работы и подготовки к собеседованиям.
Что он делает:
• Сам анализирует вакансию и подгоняет под неё ваше резюме;
• Проводит тренировочные собеседования и разбирает ошибки;
• Если «плаваете» — даёт набор…
Что он делает:
• Сам анализирует вакансию и подгоняет под неё ваше резюме;
• Проводит тренировочные собеседования и разбирает ошибки;
• Если «плаваете» — даёт набор…
Пожалуй попробую. Мой интерес к этой теме в том, чтобы вместо работы с pdf и docs сделать для нейронок промежуточный слой в маркдаун.. Свой OCR я сделал, добавлю в него еще модель
https://t.me/machinelearning_interview/2611
https://t.me/machinelearning_interview/2611
Telegram
Machine learning Interview
🚀 Qianfan-OCR - end-to-end модель на 4B параметров для работы с документами.
Главная идея - одна модель вместо целого пайплайна.
Что умеет:
• 📄 Парсинг документов в один проход
Без разбиения на OCR → post-processing → extraction.
Модель сразу выдаёт…
Главная идея - одна модель вместо целого пайплайна.
Что умеет:
• 📄 Парсинг документов в один проход
Без разбиения на OCR → post-processing → extraction.
Модель сразу выдаёт…
❤1
Про unsloth уже писал, но здесь более подробно. Такой конкурент для Tinking machines..
https://t.me/ai_machinelearning_big_data/9694
https://t.me/ai_machinelearning_big_data/9694
Telegram
Machinelearning
🌟 Unsloth Studio: опенсорный no-code веб-интерфейс для LLM.
Unsloth Studio - это локальный комбайн, который объединяет подготовку данных, обучение, инференс и экспорт модели в одном месте.
Под капотом кастомные Triton-ядра с собственным backprop. По сравнению…
Unsloth Studio - это локальный комбайн, который объединяет подготовку данных, обучение, инференс и экспорт модели в одном месте.
Под капотом кастомные Triton-ядра с собственным backprop. По сравнению…
Forwarded from Анализ данных (Data analysis)
🤖 Claude-to-IM Skill: AI Coding Agent for IM Platforms
Этот репозиторий предоставляет мост между Claude Code/Codex и популярными мессенджерами, такими как Telegram, Discord, Feishu и QQ. Пользователи могут взаимодействовать с AI-агентами для программирования через удобный интерфейс, получая ответы в реальном времени.
🚀 Основные моменты:
- Поддержка четырех платформ: Telegram, Discord, Feishu, QQ
- Интерактивная настройка с пошаговыми инструкциями
- Контроль разрешений на использование инструментов
- Возможность просмотра ответов в реальном времени
- Сохранение сессий после перезапуска
📌 GitHub: https://github.com/op7418/Claude-to-IM-skill
#javascript
Этот репозиторий предоставляет мост между Claude Code/Codex и популярными мессенджерами, такими как Telegram, Discord, Feishu и QQ. Пользователи могут взаимодействовать с AI-агентами для программирования через удобный интерфейс, получая ответы в реальном времени.
🚀 Основные моменты:
- Поддержка четырех платформ: Telegram, Discord, Feishu, QQ
- Интерактивная настройка с пошаговыми инструкциями
- Контроль разрешений на использование инструментов
- Возможность просмотра ответов в реальном времени
- Сохранение сессий после перезапуска
📌 GitHub: https://github.com/op7418/Claude-to-IM-skill
#javascript
Курсор выпустил свою модель на уровне GPT 5.4 - Opus 4.6 (по бенчмаркам самого Курсора). Да, и еще очень быструю. Но кто-то еще использует курсор??
X (formerly Twitter)
Cursor (@cursor_ai) on X
It's frontier-level at coding, priced at:
- Standard: $0.50/M input and $2.50/M output
- Fast: $1.50/M input and $7.50/M output
- Standard: $0.50/M input and $2.50/M output
- Fast: $1.50/M input and $7.50/M output
Forwarded from Anton Vdovitchenko — One Man Enterprise
Привет, друзья. Раздача слонов под закрытие работы цирка.
Те, кто используют Claude Code и знакомы со статьёй от Vercel (tldr: агентам, основанным на современных моделях нужны очень простые базовые инструменты и свобода для их применения, это значительно повышает общее качество работы), знают, что сейчас есть тенденция к тотальному упрощению.
Иными словами. Раньше агентов обвешивали MCP, скиллами, хитрыми RAG, доступом в другие модели, но современные тенденции говорят об обратном: только базовый минимум, CLI-адаптированные инструменты и скиллы.
Например, в статье Vercel описано, как они дали агенту доступ к файловой системе вместо кучи «обвязок» над файлами и получили а) упрощение стуктуры, б) 30% прирост скорости, в) 20% улучшение качества, г) ~40% экономию токенов.
Однажды, изучая проект одного очень талантливого CEO, я подумал, а почему бы не сделать то же самое для TG? В виде CLI a-la Playwright CLI (использую, люблю).
К сожалению, релиз приходится на момент блокировки Телеги, но кто знает, может быть, Паша накопит на сервера для удовлетворения требований 152-ФЗ и РКН…
Представляю вашему вниманию telegram-cli, адаптированный для работы в агентных средах, представляет собой skill для Claude Code, который под капотом использует MTProto и работает в TG от имени пользователя.
Работает так: устанавливаете skill в проект отсюда, создаёте приложение в my.telegram.org, получаете api_id + api_hash, проходите аутентификацию под своим аккаунтом, и voila!
Теперь у Claude Code есть доступ к телеге, можно просить его делать что угодно в агентных циклах: искать, постить, читать посты, лайкать, анализировать, блокировать…
Ну, и, разумеется, вам доступен CLI, в котором поддерживается toon. Вот несколько примеров использования:
1. Дайджест непрочитанного
2. Самые обсуждаемые посты канала (по реакциям)
3. Найти все фото за период
4. Мониторинг канала
5. Быстрый отчёт в группу через pipe
6. Кто пишет в группе — анализ участников
7. Поиск ссылок в чате
8. Скачать документы из чата
9. Проверить инвайт-ссылку перед входом
10. Глобальный поиск по ключевому слову + drill down
Можно начать отвечать на сообщения коллег по статусузадач пока вы спите пока Claude Code их делает за вас. Но я вам про это не говорил :-)
Хорошей пятницы!
p.s. Vibe Coding Alert! Не для прода, пока альфа.
Те, кто используют Claude Code и знакомы со статьёй от Vercel (tldr: агентам, основанным на современных моделях нужны очень простые базовые инструменты и свобода для их применения, это значительно повышает общее качество работы), знают, что сейчас есть тенденция к тотальному упрощению.
Иными словами. Раньше агентов обвешивали MCP, скиллами, хитрыми RAG, доступом в другие модели, но современные тенденции говорят об обратном: только базовый минимум, CLI-адаптированные инструменты и скиллы.
Например, в статье Vercel описано, как они дали агенту доступ к файловой системе вместо кучи «обвязок» над файлами и получили а) упрощение стуктуры, б) 30% прирост скорости, в) 20% улучшение качества, г) ~40% экономию токенов.
Однажды, изучая проект одного очень талантливого CEO, я подумал, а почему бы не сделать то же самое для TG? В виде CLI a-la Playwright CLI (использую, люблю).
К сожалению, релиз приходится на момент блокировки Телеги, но кто знает, может быть, Паша накопит на сервера для удовлетворения требований 152-ФЗ и РКН…
Представляю вашему вниманию telegram-cli, адаптированный для работы в агентных средах, представляет собой skill для Claude Code, который под капотом использует MTProto и работает в TG от имени пользователя.
Работает так: устанавливаете skill в проект отсюда, создаёте приложение в my.telegram.org, получаете api_id + api_hash, проходите аутентификацию под своим аккаунтом, и voila!
Теперь у Claude Code есть доступ к телеге, можно просить его делать что угодно в агентных циклах: искать, постить, читать посты, лайкать, анализировать, блокировать…
Ну, и, разумеется, вам доступен CLI, в котором поддерживается toon. Вот несколько примеров использования:
1. Дайджест непрочитанного
tg chat list --fields "id,title,unreadCount" --toon | grep -v "unreadCount: 0"2. Самые обсуждаемые посты канала (по реакциям)
tg message history @aioftheday --limit 20 --fields "id,text,views,reactions,date" --toon3. Найти все фото за период
tg message search --chat @nerve_ai --filter photos --limit 20 --fields "id,date,mediaType" --jsonl4. Мониторинг канала
tg chat search "продуктовый дизайн" --limit 10
tg message history @uxfromhell --limit 5 --toon5. Быстрый отчёт в группу через pipe
echo "Статус: деплой завершён, все сервисы up. Метрики в норме." | tg message send @codegeek -6. Кто пишет в группе — анализ участников
tg chat members @nerve_ai --limit 50 --fields "id,firstName,lastName,username" --jsonl
7. Поиск ссылок в чате
tg message search --chat @nerve_ai --filter urls --limit 10 --fields "id,text,date" --toon8. Скачать документы из чата
tg message search --chat @nerve_ai --filter documents --limit 5 --fields "id"
tg media download @nerve_ai 42,43,44 -o ./downloads/9. Проверить инвайт-ссылку перед входом
tg chat invite-info "https://t.me/+HASH" --fields "title,participantsCount,alreadyMember"10. Глобальный поиск по ключевому слову + drill down
tg message search --query "Claude 4" --limit 5 --fields "id,text,chatId,date" --toon
tg message replies @channel 1234 --limit 10 --toon
Можно начать отвечать на сообщения коллег по статусу
Хорошей пятницы!
p.s. Vibe Coding Alert! Не для прода, пока альфа.
Тут потестил по апи разные опенсорс нейронки на своих задачках - и минимакс 2.7 оказался чемпионом (кстати, на опен роутере минимакс - самая популярная модель). При этом у модели меньше 300В нейронов и ее можно запускать на одном мак студио… Qwen-3.5 где-то рядом
Нашел тут то, что и не надеялся найти. Какие-то французы написали язык программирования Catala, который применяется для формализации законодательства. То, что нужно. Уже перевел нужные разделы на русский - буду тестировать. Через пару недель выступаю на большой конференции - посмотрим, что успею сделать..
🔥3
На выходных повозился с памятью. Пробовал Cognee (уже второй раз пробую, но сейчас все работает вообще без вопропров), Graphiti, собственное решение с графом (не просто RAG!) на Neo4j. Для индексации использовал Gemini Flash да еще и по подписке. Для графов нужны только большие и умные модели. Денег на них не напасешься (ну разве что купить Мак Студио и поставить МиниМакс). Первые результаты достаточно неожиданные.
Но лимиты по подписке высажены, попробую завтра продолжить - проверить, что лучше работает. Не хочется ошибиться
Но лимиты по подписке высажены, попробую завтра продолжить - проверить, что лучше работает. Не хочется ошибиться
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
LiteParse — парсер документов, чтобы агенты точнее читали текст с PDF, Word, Excel, PowerPoint и картинок.
Обычно Claude Code читает PDF через pypdf или pdfplumber и каждый раз пишет для этого новый Python скрипт.
Тут LiteParse делает это одной командой. Парсит локально, быстро и без GPU.
Подойдет, если хотите, чтобы агент мог быстро прочитать PDF и работать дальше, а если нужно разобрать что-то визуально, то сделает скриншоты.
Для простых доков хватит, для сложных таблиц, нужно решение поточнее, например их облачный LlamaParse или olmOCR 2 на своем GPU.
Установка:
Использовать командами:
• lit parse document.pdf
• lit screenshot document.pdf
Есть еще skill для Claude Code и GitHub
@tips_ai #tools
Обычно Claude Code читает PDF через pypdf или pdfplumber и каждый раз пишет для этого новый Python скрипт.
Тут LiteParse делает это одной командой. Парсит локально, быстро и без GPU.
Подойдет, если хотите, чтобы агент мог быстро прочитать PDF и работать дальше, а если нужно разобрать что-то визуально, то сделает скриншоты.
Для простых доков хватит, для сложных таблиц, нужно решение поточнее, например их облачный LlamaParse или olmOCR 2 на своем GPU.
Установка:
npm i -g @llamaindex/liteparseИспользовать командами:
• lit parse document.pdf
• lit screenshot document.pdf
Есть еще skill для Claude Code и GitHub
@tips_ai #tools
❤1
Вчера в первый раз столкнулся с тем, что Claude code из терминала сам запустил Хром, полез с интернет и начал парсить базу данных..
Скоро так любую программу сможет запускать, не только браузер..
https://t.me/denissexy/11312
Скоро так любую программу сможет запускать, не только браузер..
https://t.me/denissexy/11312
Telegram
Denis Sexy IT 🤖
Антропик правда OpenClaw строит – теперь можно управлять компьютером через Claude:
https://claude.com/product/cowork#dispatch-and-computer-use
Говорите с телефона – мол, иди сделай задачу X, он сам экран смотрит и делает работу ☕️
https://claude.com/product/cowork#dispatch-and-computer-use
Говорите с телефона – мол, иди сделай задачу X, он сам экран смотрит и делает работу ☕️
У Claude code, кстати, появилась команда /schedule , которая позволяет запускать работу по расписанию. Хорошая тема
Блин, я это пишу своими руками… (на как своими, Клод пишет, а я команды даю)
теперь всегда так - только появляется возможность что-то сделать, это делают за тебя..
https://t.me/data_analysis_ml/4866
теперь всегда так - только появляется возможность что-то сделать, это делают за тебя..
https://t.me/data_analysis_ml/4866
Telegram
Анализ данных (Data analysis)
🚀 Похоже, в Claude Code появилась новая фича - Auto-dream
Пока официально не анонсирована, но её уже заметили в /memory
• Что это такое
Auto-dream - это фоновый подагент Claude, который:
- анализирует последние сессии
- извлекает ключевые знания
-…
Пока официально не анонсирована, но её уже заметили в /memory
• Что это такое
Auto-dream - это фоновый подагент Claude, который:
- анализирует последние сессии
- извлекает ключевые знания
-…
Вообще это классно, когда свои модели появляются, но бенчмарки несколько расстраивают.. Впрочем, лиха беда начало.
Есть и еще одна ложка дегтя - неделю назад пробовал подписаться на Сбер, но есть оплата только за апи, и цены выше чем на Соннет. Ну вот к этому я точно не готов. Дайте нормальную подписку - я возьму
https://t.me/ai_machinelearning_big_data/9732
Есть и еще одна ложка дегтя - неделю назад пробовал подписаться на Сбер, но есть оплата только за апи, и цены выше чем на Соннет. Ну вот к этому я точно не готов. Дайте нормальную подписку - я возьму
https://t.me/ai_machinelearning_big_data/9732
Telegram
Machinelearning
⚡️ Сбер выпустил крупнейшее обновление ГигаЧат — и выложил в open source.
GigaChat Ultra и GigaChat-3.1-Lightning уже под MIT-лицензией. Текущее обновление дало заметный прирост по качеству ответов, устойчивости генерации и прикладным сценариям использования.…
GigaChat Ultra и GigaChat-3.1-Lightning уже под MIT-лицензией. Текущее обновление дало заметный прирост по качеству ответов, устойчивости генерации и прикладным сценариям использования.…
GigaChat в долларах
GigaChat 2 Lite
• 20 млн токенов = 1 300 ₽ ≈ $14.4
• 100 млн токенов = 6 500 ₽ ≈ $72.2
• Цена за 1 млн токенов ≈ $0.72
GigaChat 2 Pro
• 3 млн токенов = 1 500 ₽ ≈ $16.7
• 15 млн токенов = 7 500 ₽ ≈ $83.3
• Цена за 1 млн токенов ≈ $5.56
GigaChat 2 Max
• 3 млн токенов = 1 950 ₽ ≈ $21.7
• 15 млн токенов = 9 750 ₽ ≈ $108.3
• Цена за 1 млн токенов ≈ $7.22
За 20 баксов 3 млн токенов гигачата или подписка на Claude, GPT или Gemini - печаль..
Ну нет в стране инференса
GigaChat 2 Lite
• 20 млн токенов = 1 300 ₽ ≈ $14.4
• 100 млн токенов = 6 500 ₽ ≈ $72.2
• Цена за 1 млн токенов ≈ $0.72
GigaChat 2 Pro
• 3 млн токенов = 1 500 ₽ ≈ $16.7
• 15 млн токенов = 7 500 ₽ ≈ $83.3
• Цена за 1 млн токенов ≈ $5.56
GigaChat 2 Max
• 3 млн токенов = 1 950 ₽ ≈ $21.7
• 15 млн токенов = 9 750 ₽ ≈ $108.3
• Цена за 1 млн токенов ≈ $7.22
За 20 баксов 3 млн токенов гигачата или подписка на Claude, GPT или Gemini - печаль..
Ну нет в стране инференса
Наконец, лучшую модель по генерации видео выпустили в публику - компания почти месяц решала проблемы с Голивудом, так как слишком хорошо делала видео с реальными актерами
https://t.me/ai_newz/4493
https://t.me/ai_newz/4493
Telegram
эйай ньюз
🔥🔥🔥 Seedance 2.0 в глобальном доступе
После затяжного переноса ByteDance наконец выкатили SOTA видео-модельку за пределами Китая. Пощупать генерацию можно в CapCut, на Dreamina, а также в агрегаторах. Официально пока раскатили по ограниченному списку стран…
После затяжного переноса ByteDance наконец выкатили SOTA видео-модельку за пределами Китая. Пощупать генерацию можно в CapCut, на Dreamina, а также в агрегаторах. Официально пока раскатили по ограниченному списку стран…
Forwarded from Denis Sexy IT 🤖
https://github.com/DenisSergeevitch/repo-task-proof-loop
(Спека - инструкции как кодинг агенту лучше работать с задачей)
В issue можно отправить агента описать если что-то не работает
***
– Собирал я ее на основе пейпера не про кодинг агента, а про то как агент становится «персональным» – в пейпере как раз про то, как убедится что агент правда делает то, что обещал, мне показалось это интересным подходом чтобы обернуть в кодинг агента
– Работает примерно так: само генерирует критерии приемки исходя из задачи, заставляет кодить саб-агента, проверяет работу, сбрасывает контекстное окно где надо (а где нет - не сбрасывает), фиксит баги, и так по кругу, подробнее в репе
– Устанавливать ее нужно как Skill, и я бы советовал Codex, так как у него саб-агенты лучше сделаны чем у Claude Code
– Использовать так: вы ей даете какую-то гигантскую задачу в стиле: «
Spawn subagents. Use $repo-task-proof-loop to continue the task described below in this repository. Reuse the matching repo-local task if it already exists; if not, stop after explaining that init should be run first....» <- вот тут вы упоминаете задачу или просто вставляете свои А4 текста
– Тестить ее лучше на новых проектах, ну или в проектах где уже есть git, так как она создаст много промежуточных файлов в папке .agents
– план мод можно с ней не использовать
В моих тестах, если агент не забывает вызывать этот скилл, у меня получается делать очень сложные проекты, но тратя больше квоты; ночью Codex работал над задачей почти 5 часов (рекорд у меня пока 12 часов)
Короче, я пока доволен – буду развивать если окажется полезной
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - DenisSergeevitch/repo-task-proof-loop: Spec driven skill with subagents spawning
Spec driven skill with subagents spawning. Contribute to DenisSergeevitch/repo-task-proof-loop development by creating an account on GitHub.
Судя по всему, умные модельки станут заметно менее требовательными к ресурсам. Помечтаем
https://t.me/ai_machinelearning_big_data/9736
https://t.me/ai_machinelearning_big_data/9736
Telegram
Machinelearning
📌 Google разработала алгоритм квантования KV-кэша без потери точности.
Подразделение Research анонсировало TurboQuant, алгоритм векторного квантования, объединяющий 2 других метода - QJL и PolarQuant, который решает проблему увеличения KV-кэша при работе…
Подразделение Research анонсировало TurboQuant, алгоритм векторного квантования, объединяющий 2 других метода - QJL и PolarQuant, который решает проблему увеличения KV-кэша при работе…
Anthropic написал статью, как они строили harness для долгих автономных задач, прежде всего для:
• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.
Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.
───
Ключевые выводы статьи
1) Для длинных задач одного агента мало
На длинных прогонах агент:
• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.
Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.
───
2) Они используют роли: planner / generator / evaluator
Planner
• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.
Generator
• делает работу по спринтам/частям,
• реализует фичи одну за другой.
Evaluator
• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.
Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.
───
3) Для долгих задач важна работа с контекстом
Они отдельно подчеркивают проблему context anxiety:
• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.
Раньше они боролись с этим через context resets:
• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.
Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.
───
4) Коммуникация между агентами — через файлы/артефакты
Вместо хаотичного общего чата они передают состояние через структурированные файлы:
• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.
Это делает систему устойчивее и понятнее.
───
5) Для субъективных задач они формализуют критерии
На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:
• design quality
• originality
• craft
• functionality
После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.
───
6) Для full-stack разработки они используют “спринт-контракты”
Перед началом спринта generator и evaluator договариваются, что именно считается done.
Это очень сильная идея:
• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.
───
Что у них получилось
По их словам:
• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.
Пример из статьи:
• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200
То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.
───
Статья не про “волшебную модель”, а про инженерную правду:
1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.
Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.
───
Ключевые выводы статьи
1) Для длинных задач одного агента мало
На длинных прогонах агент:
• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.
Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.
───
2) Они используют роли: planner / generator / evaluator
Planner
• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.
Generator
• делает работу по спринтам/частям,
• реализует фичи одну за другой.
Evaluator
• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.
Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.
───
3) Для долгих задач важна работа с контекстом
Они отдельно подчеркивают проблему context anxiety:
• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.
Раньше они боролись с этим через context resets:
• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.
Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.
───
4) Коммуникация между агентами — через файлы/артефакты
Вместо хаотичного общего чата они передают состояние через структурированные файлы:
• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.
Это делает систему устойчивее и понятнее.
───
5) Для субъективных задач они формализуют критерии
На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:
• design quality
• originality
• craft
• functionality
После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.
───
6) Для full-stack разработки они используют “спринт-контракты”
Перед началом спринта generator и evaluator договариваются, что именно считается done.
Это очень сильная идея:
• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.
───
Что у них получилось
По их словам:
• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.
Пример из статьи:
• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200
То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.
───
Статья не про “волшебную модель”, а про инженерную правду:
1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
Anthropic
Harness design for long-running application development
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
Кстати, к вопросу. Такие обзоры как тот, что выше, пишет мне мой OpenClaw, когда я ему закидываю статью с командой «прочитать, пересказать». Удобно
👍1