very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Anthropic написал статью, как они строили harness для долгих автономных задач, прежде всего для:

• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.

Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.

───

Ключевые выводы статьи

1) Для длинных задач одного агента мало

На длинных прогонах агент:

• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.

Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.

───

2) Они используют роли: planner / generator / evaluator

Planner

• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.

Generator

• делает работу по спринтам/частям,
• реализует фичи одну за другой.

Evaluator

• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.

Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.

───

3) Для долгих задач важна работа с контекстом

Они отдельно подчеркивают проблему context anxiety:

• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.

Раньше они боролись с этим через context resets:

• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.

Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.

───

4) Коммуникация между агентами — через файлы/артефакты

Вместо хаотичного общего чата они передают состояние через структурированные файлы:

• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.

Это делает систему устойчивее и понятнее.

───

5) Для субъективных задач они формализуют критерии

На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:

• design quality
• originality
• craft
• functionality

После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.

───

6) Для full-stack разработки они используют “спринт-контракты”

Перед началом спринта generator и evaluator договариваются, что именно считается done.

Это очень сильная идея:

• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.

───

Что у них получилось

По их словам:

• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.

Пример из статьи:

• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200

То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.

───

Статья не про “волшебную модель”, а про инженерную правду:

1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
Кстати, к вопросу. Такие обзоры как тот, что выше, пишет мне мой OpenClaw, когда я ему закидываю статью с командой «прочитать, пересказать». Удобно
👍1
В продолжение прошлого поста - сейчас есть команда -dangerously skip permissions, которая всегда будет говорить «да» на вопросы пользователя, а теперь будет авто мод, который смотрит, где опасно, где нет, и будет человека дергать, но только по опасным случаям.

Сейчас по отдельным командам можно в настройках разрешения устанавливать, и это работает, но тут все будет работать автоматически, и в разных ситуациях по одной и той же команде Клод будет сам выполнять команду или спрашивать в зависимости от обстоятельств
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Figma похоже начали догадываться что людям нужно больше.

Они открыли свой канвас для AI агентов.

Новый use_figma — агент создаёт и редактирует компоненты прямо на канвасе через вашу дизайн-систему. Переменные, компоненты, auto layout.

Claude Code, Codex, Cursor и другие MCP-клиенты теперь могут работать с Figma напрямую.

Появились skills которые объясняют агенту как работать в Figma.

Из основных:
• figma-implement-design: читает дизайн из Figma и генерирует рабочий код
• figma-generate-library: строит дизайн-систему в Figma из вашей кодовой базы
• figma-generate-design: собирает экраны из реальных компонентов и переменных
• figma-create-design-system-rules: сохраняет стандарты команды, агент их запоминает и применяет


Для команд где дизайнеры живут в Figma, то что нужно.

Сейчас бесплатно (бета), потом будет платным.

Гайд | Skills| GitHub

@tips_ai #news
Forwarded from Machinelearning
✔️ Репозиторий, который может настроить Claude

Система оптимизации производительности для AI-агентов. От победителя хакатона Anthropic.

Готовые к продакшену агенты, хуки, скилы, правила и MCP-конфигурации, которые эволюционировали за 10 месяцев ежедневной интенсивной работы над реальными продуктами.

Работает с Claude Code, Codex, Cowork и другими системами для AI-агентов.

🟡Github: https://github.com/affaan-m/everything-claude-code
🟡Гайд по работе: https://x.com/affaanmustafa/status/2012378465664745795
🟡Гайд по безопасности: https://x.com/affaanmustafa/status/2033263813387223421

@ai_machinelearning_big_data

🎯Полезные Мл-ресурсы

#AI #ML #aiagents #Claude
Please open Telegram to view this post
VIEW IN TELEGRAM
Про ускоренный переход на постквантовую криптографию зацепило (это шифры, которые не ломаются известными квантовыми алгоритмами, в отличие от большинства, используемых сейчас). Вчера еще читал новость, о том, как квантовый компьютер приделали к роботу, и он стал в 30 раз быстрее обрабатывать всю информацию о движениях (наши люди, кстати, делали)...

https://t.me/ai_machinelearning_big_data/9749
Вожусь с графами, чтобы модель лучше ПОНИМАЛА смысл текста. И, судя по всему, проблема (помимо методических) в том, что для создания по тексту графа нельзя использовать дешевые модели, как в RAG. Надо - дорогую, и, возможно, САМУЮ дорогую. Впрочем, стоит ли удивляться - ведь задача-то сложная..
Хотите запустить Qwen 35B на мак мини? С 16гб? Тогда вам сюда. Обещают 30 токенов в секунду. Правда, на контекст мало памяти останется
Maestro
Undenis
Вышла новая Suno 5.5, посвящаю этот трек Маэстро 🐱🐱
Please open Telegram to view this post
VIEW IN TELEGRAM
А нового DeepSeek все нет, и нет…
Codex запустил плагины в своем приложении типа @gmail @figma, и обнулил лимиты, чтобы можно было их как следует потестировать. Праздник продолжается
Появился ещё один интересный кандидат для голосовых агентов — Voxtral Mini 4B Realtime от Mistral.

Что важно:

• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.

Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.

Ссылки:

• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
Forwarded from Data Secrets
Google выпустили Gemini 3.1 Flash Live

Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.

Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).

Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.

По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.

Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.

Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
📌 Большой мастер-класс по Claude Code!

Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.

Что внутри:

• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов

• Большая библиотека кастомных команд под реальные задачи

• Готовые шаблоны памяти - как для одиночной работы, так и для команд

• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации

• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия

• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам

• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает

• Примеры настройки узкоспециализированных субагентов

• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы

https://github.com/luongnv89/claude-howto
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Мне тут Клод пишет, что из-за нехватки памяти Apple сняли с производства Mac Studio M3 Ultra 512….