Вайб-кодинг
51.1K subscribers
1.97K photos
816 videos
30 files
1.29K links
Авторский канал по ВАЙБ КОДИНГУ

Ссылка для друзей: https://t.me/+ll3pbl442dNkZmYy

Cотрудничество: @devmangx

РКН: https://clck.ru/3RRVfk
Download Telegram
Топ-5 самых популярных GitHub-репозиториев этой недели:

Buzz — опенсорс платформа для совместной работы разработчиков и AI-агентов над кодом.
Ego Lite — браузер для AI-агентов, который использует ваши реальные вкладки, куки и авторизации.
Open Code Review — AI-инструмент от Alibaba для автоматического ревью Git-диффов и поиска ошибок в коде.
I Have ADHD — скилл , который заставляет AI отвечать коротко, структурированно и без лишней воды.
Editor — oпенсорс 3D-редактор для проектирования и совместной работы над архитектурными проектами.
OpenAI готовит Astra — новое семейство моделей для длительных задач, где несколько ИИ-агентов работают над одним проектом.

По словам компании, модель смогла получить 10 новых результатов по давно открытым задачам в математике, квантовой теории сложности и теоретической информатике.

Среди них:
– Построена первая явная несофическая группа.
– Опровергнута гипотеза жёсткости Конна.
– Доказана теорема о квантовом параллельном повторении для общего случая двухпользовательских игр с запутанностью.
– Доказана гипотеза об объёме Эрхарта.
– Получено первое улучшение общей оценки экспоненты упаковки сфер с 1978 года.

Ключевые идеи доказательств сгенерировала Astra. Затем модель формализовала их в Lean, получив машинно-проверяемые сертификаты доказательств и рукопись объёмом 249 страниц. А стоимость успешного запуска составила около $2 000 по тарифам Sol API.

Похоже именно её Альтман презентовал в Белом Доме на этой неделе. Внутри OpenAI пока не решили, выйдет ли эта модель как GPT-6 или GPT-5.7.

Сейчас она проходит этап «Trump testing». 🙄
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Эту рабочую игру DeepSeek V4 Flash 0731 создала в Hermes Agent по одному промпту. На выполнение ушло 32 минуты, а весь запуск обошёлся всего в $0,07 — семь центов. 🐸

И дело не только в низкой цене токенов. По данным Artificial Analysis, выполнение тех же бенчмарк-задач обходится ей в 105 раз дешевле, чем Fable 5.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
На заметку всем, кто постоянно работает удалённо через Claude Code CLI: десктопное приложение умеет подключаться по SSH — к серверам, виртуальным машинам, dev-контейнерам и так далее.

Ado из Антропик, как пещерный человек, вспомнил об этом после целой ночи обновления домашней лаборатории через терминал. Не повторяйте его ошибок. 😂
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Google начала открывать Gemini Spark пользователям Google AI Pro за пределами США.

Spark — персональный ИИ-агент, который круглосуточно работает в фоне и выполняет задачи по вашим указаниям, беря основную работу на себя.


Доступ раскатывают постепенно, поэтому пока непонятно, когда он появится у всех. Следующим крупным обновлением должна стать поддержка полноценных MCP — по крайней мере, над ней уже работают. 🐸
Please open Telegram to view this post
VIEW IN TELEGRAM
В копилку скиллов: AntiVibe — скилл для Claude Code, который превращает разбор любого кодбейса в подробный обучающий материал.

Он объясняет архитектурные решения и компромиссы в новом или легаси-коде, чтобы вы понимали логику.
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Совет по Codex: попросите Sol настроить Luna Max как субагента.

В бенчмарке DeepSWE Luna Max набрала 67% против 73% у Sol Max. При этом средняя стоимость выполнения одной задачи оказалась почти в 14 раз ниже: $0,61 против $8,39. Поэтому отдельные чётко ограниченные задачи вполне логично передавать Luna..

Промпт:
Создай кастомного агента luna_worker в файле ~/.codex/agents/luna-worker.toml.

Используй следующие настройки:

model = "gpt-5.6-luna"
model_reasoning_effort = "max"

Добавь описание и инструкции для выполнения чётко ограниченных делегированных задач. Остальную конфигурацию не меняй. Проверь совместимость с установленной у меня версией Codex, покажи diff, а затем используй luna_worker для задач субагента.


Другой вариант - обойтись без файла кастомного агента. Оставьте Sol в основном потоке и попросите её запускать отдельный поток Luna Max для каждой задачи.

В Codex поток — это отдельный диалог с собственным контекстом. Несколько потоков могут работать параллельно, а Sol собирает их результаты в основном потоке.
2
Если пропустили: недавно в Claude Code изменили работу команды /fork. 🇨🇳

Теперь она копирует текущую сессию в новый фоновый сеанс, а вы можете продолжать работу в текущем.

Прежнее поведение — запуск субагента внутри той же сессии с последующим возвратом результата — теперь доступно через команду /subtask.

v2.1.212+
Please open Telegram to view this post
VIEW IN TELEGRAM
Для следующего поколения моделей одного ноутбука уже будет недостаточно.


Tibo из OpenAI написал, что по результатам последних тестов Codex уже сейчас можно считать отличной обвязкой для работы с ИИ-моделями.

Но, по его мнению, уже через 2–3 месяца он будет казаться довольно примитивным. Нас ждёт очередной крупный скачок в том, как мы взаимодействуем с фронтир моделями.

Тем временем, OpenAI купила Ona, чтобы перенести Codex с локальных машин в защищённые постоянные облачные окружения. В анонсе это прямо называют «следующим этапом Codex» и пишут, что агенты смогут продолжать работу даже после того, как вы закроете ноутбук. Сам Тибо тоже цитируется в этом анонсе.

Ещё одна любопытная деталь - это вакансия, которую OpenAI открыла совсем недавно: Software Engineer, Cloud Agents.

Команда строит инфраструктуру для долгоживущих агентов: оркестрацию, песочницы, хранилище, идентификацию, наблюдаемость и контроль расходов. В описании вакансии сказано, что инженеры будут создавать системы для «оркестрации агентов в масштабе» внутри Codex, ChatGPT и API.

Если сложить всё это вместе, напрашивается такая гипотеза: следующий этап это не просто более мощная модель, а модель, способная самостоятельно развернуть инфраструктуру, необходимую для выполнения задачи.

Отдельные компьютеры. Отдельные агенты. Общая память. Инструменты. Разрешения. Дни непрерывной работы.

В таком сценарии ноутбук становится скорее пультом управления, чем местом, где выполняется вся работа. 💃
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Совет по вайбкодингу: подключите GitHub к своему ИИ-агенту и не просите сразу писать код. Это заметно сократит расход токенов.

Новички начинают с запроса вроде: «Напиши мне приложение, которое принесёт $100000, не допускай ошибок». Но гораздо эффективнее сначала дать агенту изучить существующие опенсорс-проекты.

Промпт:
«Я разрабатываю XXX. Пока не создавай файлы и не пиши код. Сначала найди похожие open source-проекты на GitHub и выбери самые полезные в качестве референсов. Проанализируй, какие задачи они решают, какую архитектуру используют, на каких технологиях построены, поддерживаются ли сейчас и какие решения стоит повторить или, наоборот, избежать. Затем, исходя из моих требований, предложи стек технологий, архитектуру системы, границы MVP и последовательность разработки. Только после моего подтверждения переходи к реализации.»


Так агент сначала:
> Найдёт решения, проверенные реальными проектами.
> Разберёт ошибки и компромиссы, с которыми уже столкнулись другие разработчики.
> Подберёт стек и архитектуру под ваши требования.

И только после этого начнёт писать код. Обычно такой подход позволяет избежать множества лишних итераций и заметно сократить расход токенов. 👌
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen 3.8 Max действительно впечатляет.

Модели Qwen 3.8 Max, Claude Opus 5, Kimi K3 и GPT-5.6 Sol получили одну и ту же фотографию неба с просьбой нарисовать силуэт животного по форме облаков.

По этому тесту Qwen 3.8 Max выглядел ничуть не хуже остальных моделей.

А вот GPT, похоже, разглядел в облаках что-то своё. 😄
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Forwarded from Айти мемы
This media is not supported in your browser
VIEW IN TELEGRAM
Ежедневная рутина с Claude
Модель или обвязка?

Если вы разрабатываете ИИ-агентов для продакшена, эту статью стоит сохранить.

Авторы собрали 41 типичный сценарий отказа и классифицировали их по тому, на стыке каких компонентов возникает проблема. Каждая ошибка привязывается к взаимодействию между моделью, обвязкой, пользователем, инструментами, памятью или окружением, а также указывает, на какой стороне находится причина и где её нужно исправлять.

Это хорошо отражает реальную картину: большинство проблем ИИ-агентов возникает не в самой модели, а на стыке модели и окружающей её инфраструктуры.

Подход также подходит для автоматического анализа. В тестах на четырёх передовых моделях лучший ИИ-судья достиг коэффициента согласия Коэна 0,76 по сравнению с ручной разметкой. Это позволяет автоматически классифицировать ошибки прямо в продакшене, а не разбирать их вручную после каждого инцидента.

В этом году инженерия обвязки стала одним из главных факторов качества ИИ-агентов, но общего языка для разделения ошибок модели и ошибок обвязки до сих пор не было. Эта работа как раз предлагает такую систему.

Статья: https://arxiv.org/abs/2607.28802