very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Как поделелились коллеги, у нас уже был эпизод, когда чувак устроился на работу, используя ИИ, который слушал вопросы и давал подсказки для прохождения интервью. Но с работой не получилось - видимо, был слабоват в вайбкодинге. А так, надо понимать, что скоро все наши резюме будут писать эти ИИшки

https://t.me/machinelearning_interview/2609
🤖 Claude-to-IM Skill: AI Coding Agent for IM Platforms

Этот репозиторий предоставляет мост между Claude Code/Codex и популярными мессенджерами, такими как Telegram, Discord, Feishu и QQ. Пользователи могут взаимодействовать с AI-агентами для программирования через удобный интерфейс, получая ответы в реальном времени.

🚀 Основные моменты:
- Поддержка четырех платформ: Telegram, Discord, Feishu, QQ
- Интерактивная настройка с пошаговыми инструкциями
- Контроль разрешений на использование инструментов
- Возможность просмотра ответов в реальном времени
- Сохранение сессий после перезапуска

📌 GitHub: https://github.com/op7418/Claude-to-IM-skill

#javascript
Курсор выпустил свою модель на уровне GPT 5.4 - Opus 4.6 (по бенчмаркам самого Курсора). Да, и еще очень быструю. Но кто-то еще использует курсор??
Привет, друзья. Раздача слонов под закрытие работы цирка.

Те, кто используют Claude Code и знакомы со статьёй от Vercel (tldr: агентам, основанным на современных моделях нужны очень простые базовые инструменты и свобода для их применения, это значительно повышает общее качество работы), знают, что сейчас есть тенденция к тотальному упрощению.

Иными словами. Раньше агентов обвешивали MCP, скиллами, хитрыми RAG, доступом в другие модели, но современные тенденции говорят об обратном: только базовый минимум, CLI-адаптированные инструменты и скиллы.

Например, в статье Vercel описано, как они дали агенту доступ к файловой системе вместо кучи «обвязок» над файлами и получили а) упрощение стуктуры, б) 30% прирост скорости, в) 20% улучшение качества, г) ~40% экономию токенов.

Однажды, изучая проект одного очень талантливого CEO, я подумал, а почему бы не сделать то же самое для TG? В виде CLI a-la Playwright CLI (использую, люблю).

К сожалению, релиз приходится на момент блокировки Телеги, но кто знает, может быть, Паша накопит на сервера для удовлетворения требований 152-ФЗ и РКН…

Представляю вашему вниманию telegram-cli, адаптированный для работы в агентных средах, представляет собой skill для Claude Code, который под капотом использует MTProto и работает в TG от имени пользователя.

Работает так: устанавливаете skill в проект отсюда, создаёте приложение в my.telegram.org, получаете api_id + api_hash, проходите аутентификацию под своим аккаунтом, и voila!

Теперь у Claude Code есть доступ к телеге, можно просить его делать что угодно в агентных циклах: искать, постить, читать посты, лайкать, анализировать, блокировать…

Ну, и, разумеется, вам доступен CLI, в котором поддерживается toon. Вот несколько примеров использования:

1. Дайджест непрочитанного
tg chat list --fields "id,title,unreadCount" --toon | grep -v "unreadCount: 0"

2. Самые обсуждаемые посты канала (по реакциям)
tg message history @aioftheday --limit 20 --fields "id,text,views,reactions,date" --toon

3. Найти все фото за период
tg message search --chat @nerve_ai --filter photos --limit 20 --fields "id,date,mediaType" --jsonl

4. Мониторинг канала
tg chat search "продуктовый дизайн" --limit 10
tg message history @uxfromhell --limit 5 --toon


5. Быстрый отчёт в группу через pipe
echo "Статус: деплой завершён, все сервисы up. Метрики в норме." | tg message send @codegeek -

6. Кто пишет в группе — анализ участников
tg chat members @nerve_ai --limit 50 --fields "id,firstName,lastName,username" --jsonl

7. Поиск ссылок в чате
tg message search --chat @nerve_ai --filter urls --limit 10 --fields "id,text,date" --toon

8. Скачать документы из чата
tg message search --chat @nerve_ai --filter documents --limit 5 --fields "id"
tg media download @nerve_ai 42,43,44 -o ./downloads/


9. Проверить инвайт-ссылку перед входом
tg chat invite-info "https://t.me/+HASH" --fields "title,participantsCount,alreadyMember"

10. Глобальный поиск по ключевому слову + drill down
tg message search --query "Claude 4" --limit 5 --fields "id,text,chatId,date" --toon
tg message replies @channel 1234 --limit 10 --toon

Можно начать отвечать на сообщения коллег по статусу задач пока вы спите пока Claude Code их делает за вас. Но я вам про это не говорил :-)

Хорошей пятницы!

p.s. Vibe Coding Alert! Не для прода, пока альфа.
Тут потестил по апи разные опенсорс нейронки на своих задачках - и минимакс 2.7 оказался чемпионом (кстати, на опен роутере минимакс - самая популярная модель). При этом у модели меньше 300В нейронов и ее можно запускать на одном мак студио… Qwen-3.5 где-то рядом
Нашел тут то, что и не надеялся найти. Какие-то французы написали язык программирования Catala, который применяется для формализации законодательства. То, что нужно. Уже перевел нужные разделы на русский - буду тестировать. Через пару недель выступаю на большой конференции - посмотрим, что успею сделать..
🔥3
На выходных повозился с памятью. Пробовал Cognee (уже второй раз пробую, но сейчас все работает вообще без вопропров), Graphiti, собственное решение с графом (не просто RAG!) на Neo4j. Для индексации использовал Gemini Flash да еще и по подписке. Для графов нужны только большие и умные модели. Денег на них не напасешься (ну разве что купить Мак Студио и поставить МиниМакс). Первые результаты достаточно неожиданные.

Но лимиты по подписке высажены, попробую завтра продолжить - проверить, что лучше работает. Не хочется ошибиться
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
LiteParse — парсер документов, чтобы агенты точнее читали текст с PDF, Word, Excel, PowerPoint и картинок.

Обычно Claude Code читает PDF через pypdf или pdfplumber и каждый раз пишет для этого новый Python скрипт.

Тут LiteParse делает это одной командой. Парсит локально, быстро и без GPU.

Подойдет, если хотите, чтобы агент мог быстро прочитать PDF и работать дальше, а если нужно разобрать что-то визуально, то сделает скриншоты.

Для простых доков хватит, для сложных таблиц, нужно решение поточнее, например их облачный LlamaParse или olmOCR 2 на своем GPU.

Установка: npm i -g @llamaindex/liteparse

Использовать командами:
• lit parse document.pdf
• lit screenshot document.pdf

Есть еще skill для Claude Code и GitHub

@tips_ai #tools
❤1
Вчера в первый раз столкнулся с тем, что Claude code из терминала сам запустил Хром, полез с интернет и начал парсить базу данных..

Скоро так любую программу сможет запускать, не только браузер..

https://t.me/denissexy/11312
У Claude code, кстати, появилась команда /schedule , которая позволяет запускать работу по расписанию. Хорошая тема
Вообще это классно, когда свои модели появляются, но бенчмарки несколько расстраивают.. Впрочем, лиха беда начало.

Есть и еще одна ложка дегтя - неделю назад пробовал подписаться на Сбер, но есть оплата только за апи, и цены выше чем на Соннет. Ну вот к этому я точно не готов. Дайте нормальную подписку - я возьму

https://t.me/ai_machinelearning_big_data/9732
GigaChat в долларах

GigaChat 2 Lite

• 20 млн токенов = 1 300 ₽ ≈ $14.4
• 100 млн токенов = 6 500 ₽ ≈ $72.2
• Цена за 1 млн токенов ≈ $0.72

GigaChat 2 Pro

• 3 млн токенов = 1 500 ₽ ≈ $16.7
• 15 млн токенов = 7 500 ₽ ≈ $83.3
• Цена за 1 млн токенов ≈ $5.56

GigaChat 2 Max

• 3 млн токенов = 1 950 ₽ ≈ $21.7
• 15 млн токенов = 9 750 ₽ ≈ $108.3
• Цена за 1 млн токенов ≈ $7.22

За 20 баксов 3 млн токенов гигачата или подписка на Claude, GPT или Gemini - печаль..

Ну нет в стране инференса
Forwarded from Denis Sexy IT 🤖
⚙️ Если вы кодите с кодинг агентами, потестируйте пожалуйста спеку которую я собрал:
https://github.com/DenisSergeevitch/repo-task-proof-loop
(Спека - инструкции как кодинг агенту лучше работать с задачей)

В issue можно отправить агента описать если что-то не работает

***

– Собирал я ее на основе пейпера не про кодинг агента, а про то как агент становится «персональным» – в пейпере как раз про то, как убедится что агент правда делает то, что обещал, мне показалось это интересным подходом чтобы обернуть в кодинг агента

– Работает примерно так: само генерирует критерии приемки исходя из задачи, заставляет кодить саб-агента, проверяет работу, сбрасывает контекстное окно где надо (а где нет - не сбрасывает), фиксит баги, и так по кругу, подробнее в репе

– Устанавливать ее нужно как Skill, и я бы советовал Codex, так как у него саб-агенты лучше сделаны чем у Claude Code

– Использовать так: вы ей даете какую-то гигантскую задачу в стиле: «Spawn subagents. Use $repo-task-proof-loop to continue the task described below in this repository. Reuse the matching repo-local task if it already exists; if not, stop after explaining that init should be run first.
...» <- вот тут вы упоминаете задачу или просто вставляете свои А4 текста

– Тестить ее лучше на новых проектах, ну или в проектах где уже есть git, так как она создаст много промежуточных файлов в папке .agents

– план мод можно с ней не использовать

👩‍💻👩‍💻👩‍💻👩‍💻👩‍💻

В моих тестах, если агент не забывает вызывать этот скилл, у меня получается делать очень сложные проекты, но тратя больше квоты; ночью Codex работал над задачей почти 5 часов (рекорд у меня пока 12 часов)

Короче, я пока доволен – буду развивать если окажется полезной
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic написал статью, как они строили harness для долгих автономных задач, прежде всего для:

• генерации качественных интерфейсов,
• многочасовой разработки полноценных приложений без постоянного участия человека.

Главная идея: проблема не только в модели, а в архитектуре процесса вокруг модели.

───

Ключевые выводы статьи

1) Для длинных задач одного агента мало

На длинных прогонах агент:

• теряет нить,
• начинает “закругляться” раньше времени,
• переоценивает качество собственной работы.

Поэтому они ушли от наивного solo-agent режима к многоагентной схеме.

───

2) Они используют роли: planner / generator / evaluator

Planner

• берет короткий пользовательский запрос,
• разворачивает его в полноценный product spec.

Generator

• делает работу по спринтам/частям,
• реализует фичи одну за другой.

Evaluator

• независимо проверяет результат,
• ищет баги и оценивает качество,
• дает обратную связь генератору.

Это важно: агент не должен сам себя честно оценивать — он слишком снисходителен к собственной работе.

───

3) Для долгих задач важна работа с контекстом

Они отдельно подчеркивают проблему context anxiety:

• модель, чувствуя длинный контекст, начинает prematurely wrap up,
• или просто деградирует по качеству.

Раньше они боролись с этим через context resets:

• новый агент,
• чистый контекст,
• структурированный handoff-файл между сессиями.

Позже с Opus 4.5 смогли больше полагаться на compaction, но сама идея осталась:
нельзя просто бесконечно тянуть один и тот же контекст.

───

4) Коммуникация между агентами — через файлы/артефакты

Вместо хаотичного общего чата они передают состояние через структурированные файлы:

• контракт спринта,
• замечания,
• QA-отчеты,
• handoff-артефакты.

Это делает систему устойчивее и понятнее.

───

5) Для субъективных задач они формализуют критерии

На примере frontend-дизайна они показывают, что даже субъективные вещи можно оценивать по критериям:

• design quality
• originality
• craft
• functionality

После этого evaluator может не просто говорить “нравится / не нравится”, а давать направленную обратную связь.

───

6) Для full-stack разработки они используют “спринт-контракты”

Перед началом спринта generator и evaluator договариваются, что именно считается done.

Это очень сильная идея:

• спецификация сверху остается high-level,
• но на каждый спринт есть конкретный контракт,
• evaluator потом проверяет именно его.

───

Что у них получилось

По их словам:

• solo-agent сделал заметно хуже,
• полный harness работал намного дольше и дороже,
• но качество итогового продукта было существенно выше.

Пример из статьи:

• solo run: ~20 минут, ~$9
• full harness: ~6 часов, ~$200

То есть главный trade-off:
качество и автономность растут, но резко растут цена, время и сложность orchestration.

───

Статья не про “волшебную модель”, а про инженерную правду:

1. долгие задачи = это проблема процесса, а не только LLM
2. независимая оценка критична
3. артефакты и контракты важнее длинного чата
4. контекст надо управлять, а не просто копить
Кстати, к вопросу. Такие обзоры как тот, что выше, пишет мне мой OpenClaw, когда я ему закидываю статью с командой «прочитать, пересказать». Удобно
👍1