КайфКодинг
1.02K subscribers
351 photos
110 videos
17 files
486 links
ВайбКодинг с Артемом Кругловым,
выпускник МФТИ, AI-гуру и основатель AnyQuery.

Быстрые лайфхаки: короткие видео с приёмами и трюками
Download Telegram
Агент валит продуктовый тикет не на коде. Он валит его на том, чего в тикете не написано.

На официальном сайте Rails ведут открытый бенчмарк агентов. Первый этап — 21 маленькая задача на одно API фреймворка, и Claude Opus 5 на high проходит 92,1% прогонов. Второй — 20 тикетов для Fizzy, канбан-доски 37signals, написанных так, как их пишет продакт. Харнес тот же, модель та же:

25,0%.

Лучший результат на тикетах — 53,3% у GPT-6 Astra на максимальном усилии. Авторы прочитали прогоны и объясняют, откуда берутся нули. Дословно у них:


Тикет этого не говорит — значит, модель этого не делает.

Счастливый путь обычно на месте и работает. Падают граничные случаи, которые разработчик, уже делавший такую фичу, достроил бы без вопросов. Тикет «добавим японский, срочно» до конца довёл один прогон из всех: остальные перевели то, что видели, прогнали свои тесты, увидели зелёное и сдали.

Это сдвигает, где теперь работа. Раньше тикет читал коллега и додумывал за продакта. Теперь его читает исполнитель, который фреймворк знает, а ваших умолчаний — нет: пустой список, второй язык в письмах, старые записи без нового поля. Всё, что жило в голове и не попадало в текст, стало дырой в спецификации.

И дырой платной. Прогон Astra на максимуме стоит в среднем $6,63 — при таком проценте успеха это около $12,4 за закрытый тикет.

Слабые места у замера есть. В скрытые проверки авторы заложили случаи, которые проскочили бы и мимо человека, — они считают, что агент должен быть лучше. Этапы идут на разных приложениях, Writebook и Fizzy. А разницу в несколько пунктов между моделями они сами называют шумом.

https://rubyonrails.org/ai

Возьмите последний тикет, который агент сдал зелёным, а вы потом дописывали. Напишите, какого случая в тексте не было, — соберём список того, о чём тикеты обычно молчат.
121 млн новых репозиториев на GitHub за 2025 год. Звучит как 121 млн новых продуктов — но репозиторий пока только место, где лежит код. Чтобы понять, что действительно запускается, полезно смотреть на всю воронку:

репозиторий → открытая лицензия → рабочая установка → первые пользователи → повторное использование → проект, который есть кому поддерживать.

Я собрал большое исследование о том, как запускать open-source-продукты на GitHub. Не очередной список «добавьте README и напишите пост», а разбор того, почему одни проекты доходят до разработчиков, а другие остаются кодом в репозитории.

Внутри:
• разные траектории роста — от инструмента для узкой задачи до экосистемы;
• что звёзды GitHub могут и чего не могут сказать о реальном использовании;
• как ИИ удешевляет создание проектов и одновременно добавляет работы тем, кто их поддерживает;
• план запуска и метрики, которые ближе к реальному использованию, чем число звёзд.

Главный вывод: проектировать нужно весь путь пользователя — от «увидел» до «получил первый результат», встроил инструмент в свою работу и вернулся. Документация, безопасность и поддержка — части продукта с самого начала.

В отчёте 11 разделов, кейсы и 18 источников. Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4
❤2
Forwarded from Лука Ебков
This media is not supported in your browser
VIEW IN TELEGRAM
Как начиналось воскресное утро каждого миллениала)
🥰5❤2👍2
Скилл для агента, который кроме вашей команды никто не поставит, — единственный, который стоит писать.

Vercel посчитал skills.sh, открытый реестр скиллов: за семь месяцев там миллион скиллов и почти 280 млн установок. Почти половину поставили ровно один раз, а 375 штук, 0,04% реестра, собрали 62% установок. Оговорка из самого отчёта: это счётчики реестра, а не число людей.

Популярными становятся скиллы, которые пригодятся всем. Vercel сам пишет, что общая экспертиза вместе с моделями станет базовым уровнем, а не преимуществом. Вывод отсюда резче, чем у самого Vercel: топ каталога — это то, что у соседней команды уже есть бесплатно.

Если в .claude/skills вашего репозитория лежат только скиллы из топа, агент знает о проекте ровно то же, что у всех.

https://vercel.com/blog/state-of-agent-skills
👍1
Продолжение вчерашнего поста: выложил на Полку два больших исследования, которыми давно хотелось поделиться.

1. Как запускать open-source-продукты на GitHub
Отделяю число репозиториев от числа продуктов; разбираю траектории роста, роль звёзд, влияние ИИ и путь от первого запуска к повторному использованию и поддержке.
→ Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4

2. Что происходит с деньгами в фонде LQDT
Простыми словами — что происходит при покупке пая, как фонд работает через РЕПО, что значит залог, откуда берётся доход, какие расходы раскрыты и чего нельзя узнать по короткой сводке. В документах указано, что доход и возврат вложений не гарантированы; в разборе показываю, где здесь риски и что проверять.
→ Разбор: https://polochka.app/s#tYwyRZIwny85ImP8pJBCo9yeQ-RNg3g3hUqZo-nZ86I

Это две разные темы, но общий подход один: идти за красивым заголовком к механике — кто что делает, где деньги, какие данные доступны и чего мы пока не знаем. Если откроете, напишите, какую часть разобрать подробнее.
Стандартная метрика сдвигов вёрстки ставила claude.ai оценку «хорошо» — а на 31% загрузок что-то на странице сдвигалось уже после того, как в ней можно было печатать.

Это из отчёта инженеров Anthropic о двухнедельном августовском спринте: веб и десктоп ускорили примерно втрое, влили больше трёх тысяч изменений без единого инцидента у пользователей. Пишет вендор о своём продукте, независимой проверки нет.

Строки сайдбара подъезжали после загрузки, и ни один монитор этого не видел. Cumulative Layout Shift давал на сдвиг около 0,008 при пороге «хорошо» в 0,1. Заметили по записи экрана. Тогда Claude завёл событие, которое привязывает каждый сдвиг к области страницы и фазе загрузки, и тест, падающий на любом сдвиге: 20 из 20 красных прогонов на main, 20 из 20 зелёных на PR. Первые же данные с поля — те самые 31%.

Главный вывод авторы делают сами: раньше измерение было нулевым шагом, а с Claude это «step one of the climb». Дали агенту число — он его двигает. Поэтому самым ценным стало искать, что ещё можно посчитать, а каждый принятый замер превращался в порог CI, который можно только опускать.

Обратная сторона этого вывода: агент чинит ровно то, что видит метрика. Всё, чего она не видит, остаётся как было, при зелёном дашборде. Там же нашлась секунда зависания подсветки кода — из-за длинного тире, которое переводит строку в UTF-16.

https://claude.dev/blog/how-we-made-claude-ai-faster/

Какое зелёное число в вашем проекте вы ни разу не сверяли с записью экрана?
Пять инвайтов, ноль рекламы и оценка $10 млрд. Разбираем, как Instinct выходит на рынок

Наверняка многие из вас уже слышали про сумасшедший раунд Instinct: $1 млрд при оценке $10 млрд, лиды — Sequoia, Benchmark и Coatue. Стартапу около года, продукт до сих пор доступен только по инвайтам.

Но интереснее цифр раунда то, как Instinct выходит на рынок. Похоже, в эпоху AI дефицитный ресурс — уже не внимание пользователя, а компьют. И весь GTM строится вокруг этого. Как раз вышло интервью с основателем Ноа Шинном — его первый большой разговор о компании.

Старт был максимально скромным: продукт дали 200 друзьям и родственникам, у каждого пользователя было пять инвайтов. Первые дни база прибавляла по несколько человек в сутки, потом по паре процентов. Когда пользователей стало несколько тысяч, люди начали сами выкладывать в сеть свои кейсы, и рост разогнался до 10–11% в день. То есть база удваивалась примерно раз в неделю. На маркетинг при этом не потратили ни доллара. Инвайты перепродают на eBay по $300. А кто-то пишет фаундеру в личку, потому что не уверен, что попадёт в «пятёрку» друга.

Только инвайты здесь не игра в эксклюзивность. Каждый пользователь сжигает дорогой компьют, а мощности закупаются с лагом в несколько месяцев. Ноа признаётся, что около 40% времени думает о том, сколько GPU брать впрок. Инвайт-система работает как кран, которым регулируют рост. Иначе можно однажды проснуться с десятикратной базой, 80% которой не может достучаться до продукта.

Второе решение — у Instinct нет приложения. Ассистенту пишут в iMessage и WhatsApp, отправляют письма на почту, надиктовывают голосовые. Если горит дедлайн, он может позвонить и сам. Новый интерфейс не строят — заходят в каналы, которые у людей и так открыты весь день.

Третье. Главная метрика у них не активность, а доверие. Через три недели использования 40% пользователей привязывают к Instinct банковскую карту. И это считая тех, кто к тому моменту уже ушёл. Среди тех, кто доверил ассистенту хоть что-то чувствительное, удерживается 80%. Для консьюмер-продукта это почти нереальная цифра.

И бизнес-модель. Для пользователя продукт бесплатный, зарабатывать планируют на комиссии с мерчантов. Сколько брать, пока не решили. Через платформу уже проходит больше $1 млрд в год, половина — тревел, где бутик-отели готовы отдавать до 30% с брони. При этом индустрии ломать не собираются — хотят стать для них новым каналом продаж.

Раньше ограничением роста был бюджет на маркетинг. У Instinct это GPU, и под них пришлось перепридумать и воронку, и интерфейс, и монетизацию.

Мне больше всего нравится история с инвайтами как краном для роста. А что из этого впечатляет вас больше всего? Голосуйте в опросе ниже, а если выбрали «хайп» — расскажите в комментариях почему

Андрей Резинкин | Money For Startup
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
🎬 Сделал скилл для Claude Code: ролик с голосом из идеи, отчёта или продукта

Даёшь агенту материалы, на выходе готовый ролик с озвучкой, музыкой и субтитрами. Вертикальный для Reels и Telegram, горизонтальный для презентаций.

Во вложении пример: ролик про Шушу, помощницу семьи в Telegram. Вот как агент его собрал.

1️⃣ История до сценария. Сначала каркас: одна фраза, которую зритель перескажет («Шуша помнит за семью, а вы просто рядом»), героиня Анна, ставки (всё держится на памяти одного человека) и поворот (помощница живёт прямо в Telegram). И список того, что обещать нельзя: например, что бот сам оформляет заказ во ВкусВилле. Это делает человек.

2️⃣ Сценарий с линтером. 11 сцен по методологии Шуши: записать, разобрать, поделить, время для себя, побыть вместе, общая память. Линтер следит, чтобы зацепка была короткой («Кто в вашей семье помнит всё за всех?»), реплики не затягивались, а финал был мыслью, а не «ссылкой в описании».

3️⃣ Голос с режиссурой. Gemini TTS, у каждой реплики своё настроение: интрига в начале, тревога на проблеме, облегчение, когда Шуша забирает дела. Каждый дубль расшифровывается и сверяется с текстом: модель иногда глотает слова или пересказывает своими.

4️⃣ Музыка от Lyria, приглушается под голос.

5️⃣ Видео собирается кодом в Remotion, а не генерируется. Диалоги Анны с Шушей набраны пузырями чата и помечены «пример диалога», анимация идёт точно под голос: поменял реплику, и весь ролик перемонтировался сам.

6️⃣ Проверка перед рендером: стоп-кадры и вторая пара глаз от модели со зрением. На Шуше проверка поймала схему памяти, где линии не доходили до кружков.

Итог: 105 секунд, 1080×1920.

Открытый код, MIT:
👉 github.com/artkruglov/voice-film

Поставить: git clone https://github.com/artkruglov/voice-film ~/.claude/skills/voice-film

Спасибо за идеи product-film-skill и nd-video-studio 🙌
🔥5👍3
nlp_daily
Написал у Леши, продублирую и здесь свои вангования на OpenAI DevDay 👾 Персональный always-on агент: работает в фоне и сам доводит задачи ├ Агенту можно написать sms или в slack, или позвонить ├ У агента свой email-адрес └ Агент покупает за тебя с подтверждением…
И не зря - вы, батенька, ещё и победили в этом поле чудес

Итого - Марк собрал 7 верных пунктов в одном сообщении:

- Постоянный персональный агент — dot работает в фоне и продолжает задачи между обращениями пользователя

- Общение с агентом через Slack и голосом — можно написать своему dot или начать голосовой разговор

- Покупки с подтверждением пользователя — dot может совершать покупки после одобрения

- Подписка примерно за $500 — представили Pro за $500 в месяц

- Функции без расхода обычных лимитов — разговоры с dot не расходуют лимиты ChatGPT

- Codex работает без включённого ноутбука — задачи продолжают выполняться в облаке

- Общее пространство для людей и агентов — представили ChatGPT Space для совместной работы команды и ИИ

Также аплодисменты Вячеславу, Kr1to и Nastia - вы были очень близки 👊🏻

———
Теперь все знают, у кого есть инсайдеры и кого можно просить о сбросах

Чудо-диктофон отправляется к победителю в ближайшие пару дней
❤1
Уже влезли в долги, чтобы наскрести на подписку ChatGPT за 500$?

Пока убеждаете друзей занять вам денег, чтобы за две недели навайбить убийцу Nvidia, самое время разобраться, что же такое Cerebras и почему именно их железо внезапно оказалось настолько интересным для LLM-инференса.

Забавно, что изначально Cerebras в первую очередь пытались решить задачу обучения нейросетей.

И, если верить довольно жёсткому разбору Irrational Analysis, именно с training всё получилось не очень хорошо. Архитектура получилась сильно перекошенной: внутри самого WSE пропускная способность огромная, но канал обмена с внешней памятью и другими устройствами относительно узкий. Поэтому для обучения Cerebras приходилось дополнять WSE внешними системами MemoryX и SwarmX, а ограниченный внешний I/O становился одним из главных bottleneck'ов.

А что вообще такое WSE, MemoryX и SwarmX и как всё это устроено, читайте в отчёте Irrational Analysis.

А вот с инференсом всё оказалось гораздо интереснее.

Cerebras довольно самобытная архитектура. Вместо относительно классической связки GPU с расположенной рядом HBM они буквально делают процессор размером почти с целую кремниевую пластину, Wafer-Scale Engine. WSE-3 содержит около 900 тысяч маленьких ядер, у каждого из которых есть локальный SRAM и простые SIMD-блоки. В сумме получается примерно 44 GB SRAM прямо на wafer.

И вот для inference это оказалось очень интересной комбинацией. Обычный GPU при генерации токенов во многом упирается в необходимость постоянно читать веса модели из HBM.

У Cerebras веса и KV-cache можно держать прямо в SRAM рядом с вычислительными ядрами, а слои модели распределять по WSE. Если одного WSE не хватает, модель распределяется между несколькими. Каждый хранит свою часть модели и передаёт следующему только промежуточный результат вычислений, а не сами веса. Благодаря этому веса остаются в быстром локальном SRAM, а между WSE нужно передавать сравнительно небольшой объём данных. Отсюда и очень высокая скорость генерации.

То есть архитектура, которая довольно странно выглядела как конкурент Nvidia в training, неожиданно нашла свою сильную сторону именно там, где сегодня особенно ценится latency: ультрабыстрый LLM inference.

Но silver bullet из Cerebras всё равно не получился. Вопрос, как оптимальнее всего строить железо для LLM inference, сегодня всё ещё открыт. Одна из главных проблем Cerebras в том, что объём SRAM нельзя наращивать так же легко, как внешнюю память, а большие модели и длинный контекст требуют всё больше памяти. В итоге приходится использовать больше WSE, и впечатляющая скорость начинает обходиться всё дороже с точки зрения масштабирования всей системы. Сам отчёт отдельно отмечает, что KV-cache и веса конкурируют за один и тот же ограниченный SRAM, а с ростом размера модели экономика такого подхода становится всё сложнее.

Но сам инженерный подход всё равно совершенно безумный и очень интересный.

Кстати, если вы забыли, какого размера «чип» у Cerebras, приложу фотку в комментариях.

P.S. Пост чуть больше чем полностью построен на отчёте Irrational Analysis. Обязательно ознакомьтесь с ним, невероятно увлекательный и познавательный разбор.
❤1
🔥 DeepSeek и Huawei строят китайскую альтернативу CUDA

DeepSeek выпустила open-source инструменты для ускорителей Huawei Ascend, включая поддержку TileLang для Ascend 950. Они упрощают написание вычислительных ядер, перекладывая часть низкоуровневой работы на компилятор.

Смысл шире одной библиотеки: Китай пытается снизить зависимость не только от чипов NVIDIA, но и от всей экосистемы CUDA.

Именно за этим сейчас стоит следить особенно внимательно. Сильный GPU без удобных компиляторов, библиотек и инструментов для разработчиков мало что решает.

Китай строит не просто свои AI-чипы. Он строит свой полный AI-стек.
This media is not supported in your browser
VIEW IN TELEGRAM
Robinhood позволит поручать сделки AI агенту прямо в приложении

По данным брокера, с мая счета для сторонних AI агентов открыли более 150 тыс. клиентов. Теперь компания анонсировала встроенных Robinhood Agents. Доступ обещают скоро, только клиентам в США.

Выбираешь модель → открываешь агенту отдельный счёт → задаёшь стратегию. Он изучает рынок и готовит сделки. В демо предлагает купить акции Apple и ждёт подтверждения.

По умолчанию каждую сделку одобряет человек. Если отключить эту настройку, агент сможет торговать сам деньгами на отдельном счёте.

Loops, торговлю по расписанию, обещают добавить позже. GPT-Luna дадут бесплатно до конца года.

За решения AI и возможные убытки отвечает владелец счёта.

#AIагенты #Robinhood @neurovibe_ai
🤖 Стартуем новую тему в лекционном клубе - робототехника.

Недавно писал, что присматриваюсь к курсу Принстона Intro to Robotics, и решил не тянуть - с 12 октября начинаем его разбирать. Это вводный курс Anirudha Majumdar: motion planning, feedback control, state estimation и SLAM, machine learning для робототехники (imitation learning, diffusion models, RL, vision-language-action модели), и практика на квадрокоптерах Crazyflie.

Формат прежний: каждый независимо смотрит лекции в течение недели, а в понедельник час обсуждаем на Zoom. К первой встрече нужно посмотреть сразу две лекции (вводную и про планирование движения), дальше - по одной в неделю.

📆 Первая встреча - понедельник, 12 октября, 10am ET / 5pm MSK

📍 Регистрация на Luma:
https://luma.com/ujp2tnpv

🎥 К просмотру:
Lecture 1 - Intro to Robotics: https://youtu.be/cMhFAq53v1c
Lecture 2 - Discrete Motion Planning: https://youtu.be/LhLd8Kon1GY

📚 Сайт курса (слайды, конспекты, задания):
https://irom-lab.princeton.edu/intro-to-robotics/

Обсуждать между встречами - в чате @rvnikita_blog_chat

#robotics@rvnikita_blog #education@rvnikita_blog #ai@rvnikita_blog #princeton@rvnikita_blog

—————————
Мысли Рвачева
—————————
Forwarded from Точки над ИИ
This media is not supported in your browser
VIEW IN TELEGRAM
Учитывая популярность видео, сделанных на Opus 5.5 – не могу не поделиться большущей библиотекой таких видео, берите любое и повторяйте.

Кроме этого там промпты игр, эксплейнеров и 3Д-сцен. Всего 475 штук.

Вы знаете что с этим делать.

Например, найдите понравившееся видео, передайте его промпт агенту вместе с вашим лого, цветами и шрифтами, и создайте версию для своего продукта.

Тут ссылка.
🔥3❤1👍1
Уровень effort, перенесённый с Opus 5 на Opus 5.5, — уже другая настройка: слово то же, а думает модель дольше и тратит больше выходных токенов.

Это из гайда Anthropic по промптингу Opus 5.5 — вендор пишет о своей модели, и замеры тоже его. Там прямо сказано: названия уровней не означают одинаковый объём рассуждений у разных моделей. По тестам Anthropic, Opus 5.5 на medium догоняет или обгоняет Opus 5 на high в коде и в работе со знаниями. По умолчанию у 5.5 стоит medium, у Opus 5 был high.

Оставите значение от Opus 5 — гайд обещает ровно это: длиннее ходы и больше выходных токенов. Совет — выставить уровень явно и прогнать несколько уровней на своих эвалах. И отдельно: смена effort между запросами сбрасывает кэш промпта.

Та же ловушка у конца хода. Opus 5.5 пишет отчёты о прогрессе, и часть из них заканчивает ход текстом без вызова инструмента, со stop_reason: "end_turn". Цикл агента, который считает это концом задачи, встаёт на середине. Anthropic советует считать такой ход отчётом и досылать открытые пункты — но не больше двух-трёх автоматических продолжений на задачу.

После переезда проверять надо не промпты, а обвязку: effort, max_tokens — рассуждения теперь включены всегда и считаются в него — и то, что ваш цикл принимает за «готово».

https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5-5

Напишите, какой effort стоит у вашего агента после переезда и выбирали ли вы его заново.
Please open Telegram to view this post
VIEW IN TELEGRAM