AI da Code
171 subscribers
223 photos
16 videos
2 files
416 links
Канал про то, как ускорить разработку продуктов с AI
Download Telegram
Дата: 2026-03-28 08:27 UTC | Видео: 45 | Просмотры: 2,437 | Лайки: 1


промежуточные результаты autoresearch для YouTube Shorts
Начал делать полностью автономные компании и потратил пару дней на то, чтобы добавить возможность запускать кодового агента в docker sandbox.

Собственно, чтобы он все делал с кодом, можно было сразу пушить и разворачивать это на проде.

А потом выяснил, что оказывается эта задача уже решена, и есть много готовых решений, причем даже и платных, и open source'ных.

Сейчас пока тестирую несколько из них. Вот попробовал Daytona — вроде как все нормально работает и все отлично интегрируется.

Создается sandbox, выполняется задача, и потом он удаляется по завершении.

Тем достаточно удобно. Плюс они дают 200 долларов, то есть 100 долларов сразу на баланс, а еще 100 при подвязке карты.

В принципе, с этими деньгами можно экспериментировать для своих автоматизаций с тем же OpenClaw или другими ассистентами.
https://github.com/epistates/turbovault

последний месяц начали хайповать связку claude code плюс обсидиан я тоже решил попробовать взял все свои закладки просмотренные видео телеграм-канал и решил их залить в хранилище в качестве заметок и дальше уже разложить на обработку все это делал и нашел что оказывается есть ребяты которые делали дополнительный плагин написанный на Rust который упрощает взаимодействие с хранилищем то есть у Obsidian тоже недавно появился CLI-интерфейс но вроде как этот TurboVault еще даже поприкольнее будет фичей больше и работает быстрее
Еще одну практику решил внедрить.

Последнее время много хайпа вокруг связки код-код и обсидиан.

Я тут решил для себя немного свое старое хранилище пересобрать, разложить на основные папки как минимум три input, knowledge и output, где input – это входящие знания, которые я читаю, смотрю, изучаю. Knowledge – это какая конверсия у меня произошла, что я что-то узнал, что-то поресерчил и так далее. То есть это мои внутренние знания. И output – это то, куда я что-то запостил.

И начал автоматически собирать какие-то вещи, которые я где-то закладывал, записывал, смотрел и так далее. Что разобрался только с YouTube. Там довольно-таки запарно, но в принципе можно выгрузить историю, а потом взять все видосы, которые посмотрел, выгрузить транскрипт и по ним уже сделать отдельные заметки.

Аналогично с Twitter взять все закладки, которые у меня там остались за все, и тоже разложить их на отдельные заметки.

Третьим идет Telegram. Тут я не решил, но, скорее всего, ограничусь только каналами, которые я смотрю, и, соответственно, вытаскиванием заметок по этим каналам.
https://github.com/A-EVO-Lab/a-evolve

Начал играться с этим тулом, который в последнее время хайпит. В принципе, очень похоже на авторесерч, только немного другого уровня. Если авторесерч выдаёт и находит оптимальный алгоритм, то этот тул находит оптимального агента. То есть он меняет тулы, меняет скиллы, меняет фронты и модели, и находит оптимальное соотношение по твоей задаче. Но, как и в авторесерче, тут вопрос упирается в датасет. То есть нужно иметь датасет, на котором это всё будет тестироваться. Но хорошо, что можно сделать свою функцию оценки, потому что туда можно запихнуть, например, так называемый LLM as a judge подход, то есть вызывать другую LLM, которая проверяет эталонный вывод и тот, что выдал, и выдаёт ответ, насколько они похожи.
Поизучал я тут недавно фреймворки для кодинга, такие как GSD, Superpowers, BMAD и аналогичные. И в итоге оказалось, что у меня не такие большие проекты, где требуется прямо их внедрение.

И забавно, у Superpowers... Ранее было, сейчас я не уверен осталось ли, что он прямо удалял код, который не покрыт тестами. То есть у него основная тема была, что мы идем на тотальное TDD. Если его нет, то сорян, чувак, твой код удаляется.

А в итоге для себя я пришел к тому, что у меня должен быть просто правильный Claude.md, не более 200 строк, но при этом он может включать ссылки на другую документацию, например, по code style, по архитектуре, PRD и так далее.
я только тут обрадовался, что auto mode теперь везде доступен. После утечки появился новый mode auto, который переключается по shift+tab, но при этом он говорит, что данный режим на твоём аккаунте недоступен.

При этом подписка за 200 долларов.
Вопрос: какая должна быть подписка, чтобы он был доступен?)
Оказывается, есть еще одна интересная команда в Cloud Code /insights. Она не особо популярна, но она дает аналитику по использованию Cloud Code, что было хорошо, что плохо и так далее. И дает рекомендации, потому что можно улучшить в плане создания новых скиллов и в плане добавления каких-то инструкций в файлы Cloud MD. Ты ее запускаешь? Она все анализирует, потом вы даете ссылку на html-файл, где все это описано.
🔥2
Кстати, в Telegram есть горячие клавиши. Не особо очевидно, но они вполне есть, и я ими вполне пользуюсь.

Из тех, которые самые частые в использовании, это Ctrl/Cmd+0, это переход сразу в сканерное сообщение. Cmd/Ctrl+[1-9]. Это навигация по папкам если есть

Еще Control+Tab, Control+Shift+Tab – это навигация по недавно открытым чатам.
👍2
https://github.com/kevinrgu/autoagent/tree/main

Появился ещё один тул, называющийся Autoagent. В принципе, это немного урезанная форма A-evolve, про которую я писал выше.

По идее, если уже существует агент, его нужно улучшать итерациями, то можно использовать Autoagent. Работает через генетические алгоритмы.

В целом это все про одно и то же но на рахных уровнях
• autoresearch
• autoagent
• e-evolve
https://code.claude.com/docs/en/ultraplan

Выглядит, странно. Новая фича ещё в Research Preview в Claude code. Вроде как только несколько часов назад появилась.

Когда вводишь /ultraplan, он у тебя запускает этот план в вебе. Но что удобно, там можно редактировать отдельные какие-то компоненты, а не только в конце, что нужно исправить.

Очень похоже на команду /btw, но немного с другой стороны. Потому что когда ультраплан работает, ты ещё можешь продолжать работать в терминале. А /btw как раз наоборот. Когда у тебя что-то работает, ты можешь что-то ещё дополнительно спросить.

Посмотрим, как это будет работать. Будет ли это удобнее? Но есть мнение, что он работает сильно быстрее, чем plan mode обычный.
Долгое время проходило мимо всяких таких штук типа Cmax, Superset, Conductor и так далее. А сейчас решил попробовать.

Предначально выглядит достаточно удобненько. Посмотрел, как это будет через какое-то время. Из всех, которые я посмотрел, Cmax выглядит как наиболее просто и сразу работает с терминалом. Что прикольно, есть сразу ходки и практически все. Все основные, которые тебе делают разделение вправо, новый терминал или открывает новый браузер. Плюс сразу браузер открывается на вкладке в терминале, чтобы можно было сразу посмотреть, поправить и так далее. Посмотрю, обкатаю несколько дней, но что вроде как выглядит достаточно неплохо.
первый минус по Cmux - втсренный бразуер там рендерит не картинку в текстовое представление - потому при копировании копируется лишь текст, а не скрин((
для скрин остается нативное копирование области экрана на Маке Cmd + Shift + 4
В последнее время и в интернете, и среди моих знакомых стали массово идти жалобы на урезание лимитов по claude code. Я, конечно, это заметил, но у меня достаточно большой объем. Оказалось, у людей, которые раньше использовали, не сильно объем вырос, но теперь они упираются в свои лимиты.

Видимо, пора уже оптимизировать, не брать одну модель под все, а распределять под разные задачи и разные инструменты. В принципе, у меня несколько знакомых так уже делают, но геморрой на поддержку этого все равно до запарка остается. Но, видимо... Придется.
https://claude.com/blog/the-advisor-strategy

Интересная новая фича.
Более мелкие модели могут спрашивать более умную модель, в частном случае Opus, о том, как это сделать, таким образом, прося совет.

Единственное, что она вроде как работает только через API сейчас, именно при прямом вызове модели. Надеюсь, скоро добавят в Claude code. Хотя с этим рядом получится сэкономить токены и влезть в лимиты.
👍1
https://pageradar.app/

Я как-то ранее писал про то, что для запуска продуктов по-хорошему протестировать бы спрос. И вот пример такого подхода как раз сделал недавно. Вообще не выбирая идею, просто посмотрел, что залетело на Product Hunt.

Оказалось, это был проект, который я уже высокий написал трафик, плюс через несколько оптимизаций я снизил его до CPC меньше доллара, а на самой посадочной странице был waitlist, который сам по себе режет конверсию, но я решил его протестировать. В итоге у меня за неделю получилось 25 регистраций в waitlist, и только после этого я уже начал делать вроде как сделал основную фичу для тестирования изменений на страницах веб-сайтов.

И, соответственно, лишь сейчас буду рассылать по waitlist, что все запустилось, и дальше уже двигаться, смотреть, как народ этим будет пользоваться.
👍2
https://code.claude.com/docs/en/sandboxing

Буквально пару дней назад появилась новая фича в Claude Code — команда /sandbox. По идее, она меньше запрашивает, что нужно, но при этом работает не в DevContainer, а через свой механизм.

Для некоторых моих проектов это прям работающая тема, для некоторых не совсем, особенно для тех, которые пользуют внешние API, даже самый расширенный вариант песочницы, будут спрашивать, а точно агенту нужно ходить в эти сервисы.

Поэтому, если совсем, чтобы без запроса, я бы рекомендовал запускать в Docker или DevContainer с Dangerless Skip Permission. Если нужно хотя бы какое-то ограничение, то я бы рекомендовал использовать sandbox.
👍1
https://superset.sh

Добрался-таки попробовать эту штуку, но впечатления не очень.
Во-первых, при запуске она требует регистрации, то есть она не совсем локальная.
Во-вторых, часть функционала платная, и прям классические paywall'ы стоят на некоторых фичах. Как по мне, там много всего накручено, то есть оно прям достаточно избыточное. Да, прикольно, если ты работаешь с несколькими разными агентами, и тебе нужно под разные задачи, под разные проекты, разные использовать.

Да, прикольно, но не совсем для меня. Еще было удобно то, что можно открывать, редактировать и просматривать файлы, что во многих других вещах стараются убирать. Но в целом слишком избыточно для меня, поэтому я останусь на cmux.
👍1
Сделал еще раунд исследований по поводу использования спецификации в разработке. В итоге обманковало все с ChatGPT и параллельно еще с Claude.

Пришел к тому, что planMode — это минималка, что нужно использовать, но дальше есть такие, как BMAD, GSD, Superpowers и так далее, которые тратят токены только в шум.

В итоге ничего довольно-таки прикольного не нашел, но ChatGPT посоветовал: слушай, а давай создай сам себе отдельную команду, которая будет сначала спрашивать, что тебе нужно, что-то вроде брейншторма, а потом подробно это все будет объединить. А далее, как обычно, с готовым планом я иду и прошу у Claude Code написать код по этой спецификации.

Плюс этой команды в том, что ее можно очень сильно кастомизировать под себя.
🔥1
Нашел одну проблему в Claude Code. Странно, что про нее мало кто говорит.

Смысл ее в следующем. Не так давно они добавили возможность роутинга для разных режимов, который включается по /model opusplan. У меня в плане делается с моделью Opus, а само исполнение — с моделью Sonnet. Но когда я это пробую, пишу план, в конце он у меня спрашивает, что ты согласен на все и продолжить выполнение плана через automode. Но automode не работает на моем плане, он есть только у Team и Enterprise. И потом вешается полностью сессия, потому что дальше не идет выполнение. Он говорит, у тебя нет возможности использовать automode (точнее он недоступен на твоем плане). В итоге приходится выходить из сессии, заходить заново, выключать режим планирования, и потом продолжать то, что он написал.

Каких-то рецептов, как это преодолеть я не нашел. Единственный вариант, который так себе, это оставить этот режим, сделать план, потом перейти в 3 пункт, написать approve и нажать комбинацию shift-tab. Там прямо написано, что дать этот фидбэк с одобрением плана, и дальше он начнет выполнение. Выглядит как костыль, но это работает.
раскатали opus 4.7
👍1