Агент валит продуктовый тикет не на коде. Он валит его на том, чего в тикете не написано.
На официальном сайте Rails ведут открытый бенчмарк агентов. Первый этап — 21 маленькая задача на одно API фреймворка, и Claude Opus 5 на high проходит 92,1% прогонов. Второй — 20 тикетов для Fizzy, канбан-доски 37signals, написанных так, как их пишет продакт. Харнес тот же, модель та же:
25,0%.
Лучший результат на тикетах — 53,3% у GPT-6 Astra на максимальном усилии. Авторы прочитали прогоны и объясняют, откуда берутся нули. Дословно у них:
Счастливый путь обычно на месте и работает. Падают граничные случаи, которые разработчик, уже делавший такую фичу, достроил бы без вопросов. Тикет «добавим японский, срочно» до конца довёл один прогон из всех: остальные перевели то, что видели, прогнали свои тесты, увидели зелёное и сдали.
Это сдвигает, где теперь работа. Раньше тикет читал коллега и додумывал за продакта. Теперь его читает исполнитель, который фреймворк знает, а ваших умолчаний — нет: пустой список, второй язык в письмах, старые записи без нового поля. Всё, что жило в голове и не попадало в текст, стало дырой в спецификации.
И дырой платной. Прогон Astra на максимуме стоит в среднем $6,63 — при таком проценте успеха это около $12,4 за закрытый тикет.
Слабые места у замера есть. В скрытые проверки авторы заложили случаи, которые проскочили бы и мимо человека, — они считают, что агент должен быть лучше. Этапы идут на разных приложениях, Writebook и Fizzy. А разницу в несколько пунктов между моделями они сами называют шумом.
https://rubyonrails.org/ai
Возьмите последний тикет, который агент сдал зелёным, а вы потом дописывали. Напишите, какого случая в тексте не было, — соберём список того, о чём тикеты обычно молчат.
На официальном сайте Rails ведут открытый бенчмарк агентов. Первый этап — 21 маленькая задача на одно API фреймворка, и Claude Opus 5 на high проходит 92,1% прогонов. Второй — 20 тикетов для Fizzy, канбан-доски 37signals, написанных так, как их пишет продакт. Харнес тот же, модель та же:
25,0%.
Лучший результат на тикетах — 53,3% у GPT-6 Astra на максимальном усилии. Авторы прочитали прогоны и объясняют, откуда берутся нули. Дословно у них:
Тикет этого не говорит — значит, модель этого не делает.
Счастливый путь обычно на месте и работает. Падают граничные случаи, которые разработчик, уже делавший такую фичу, достроил бы без вопросов. Тикет «добавим японский, срочно» до конца довёл один прогон из всех: остальные перевели то, что видели, прогнали свои тесты, увидели зелёное и сдали.
Это сдвигает, где теперь работа. Раньше тикет читал коллега и додумывал за продакта. Теперь его читает исполнитель, который фреймворк знает, а ваших умолчаний — нет: пустой список, второй язык в письмах, старые записи без нового поля. Всё, что жило в голове и не попадало в текст, стало дырой в спецификации.
И дырой платной. Прогон Astra на максимуме стоит в среднем $6,63 — при таком проценте успеха это около $12,4 за закрытый тикет.
Слабые места у замера есть. В скрытые проверки авторы заложили случаи, которые проскочили бы и мимо человека, — они считают, что агент должен быть лучше. Этапы идут на разных приложениях, Writebook и Fizzy. А разницу в несколько пунктов между моделями они сами называют шумом.
https://rubyonrails.org/ai
Возьмите последний тикет, который агент сдал зелёным, а вы потом дописывали. Напишите, какого случая в тексте не было, — соберём список того, о чём тикеты обычно молчат.
Ruby on Rails: Compress the complexity of modern web apps
Rails and AI — Ruby on Rails
Rails gives AI coding agents a convention-driven, expressive framework for building production-quality software quickly.
121 млн новых репозиториев на GitHub за 2025 год. Звучит как 121 млн новых продуктов — но репозиторий пока только место, где лежит код. Чтобы понять, что действительно запускается, полезно смотреть на всю воронку:
репозиторий → открытая лицензия → рабочая установка → первые пользователи → повторное использование → проект, который есть кому поддерживать.
Я собрал большое исследование о том, как запускать open-source-продукты на GitHub. Не очередной список «добавьте README и напишите пост», а разбор того, почему одни проекты доходят до разработчиков, а другие остаются кодом в репозитории.
Внутри:
• разные траектории роста — от инструмента для узкой задачи до экосистемы;
• что звёзды GitHub могут и чего не могут сказать о реальном использовании;
• как ИИ удешевляет создание проектов и одновременно добавляет работы тем, кто их поддерживает;
• план запуска и метрики, которые ближе к реальному использованию, чем число звёзд.
Главный вывод: проектировать нужно весь путь пользователя — от «увидел» до «получил первый результат», встроил инструмент в свою работу и вернулся. Документация, безопасность и поддержка — части продукта с самого начала.
В отчёте 11 разделов, кейсы и 18 источников. Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4
репозиторий → открытая лицензия → рабочая установка → первые пользователи → повторное использование → проект, который есть кому поддерживать.
Я собрал большое исследование о том, как запускать open-source-продукты на GitHub. Не очередной список «добавьте README и напишите пост», а разбор того, почему одни проекты доходят до разработчиков, а другие остаются кодом в репозитории.
Внутри:
• разные траектории роста — от инструмента для узкой задачи до экосистемы;
• что звёзды GitHub могут и чего не могут сказать о реальном использовании;
• как ИИ удешевляет создание проектов и одновременно добавляет работы тем, кто их поддерживает;
• план запуска и метрики, которые ближе к реальному использованию, чем число звёзд.
Главный вывод: проектировать нужно весь путь пользователя — от «увидел» до «получил первый результат», встроил инструмент в свою работу и вернулся. Документация, безопасность и поддержка — части продукта с самого начала.
В отчёте 11 разделов, кейсы и 18 источников. Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4
❤2
Forwarded from Лука Ебков
This media is not supported in your browser
VIEW IN TELEGRAM
Как начиналось воскресное утро каждого миллениала)
🥰5❤2👍2
Скилл для агента, который кроме вашей команды никто не поставит, — единственный, который стоит писать.
Vercel посчитал
Популярными становятся скиллы, которые пригодятся всем. Vercel сам пишет, что общая экспертиза вместе с моделями станет базовым уровнем, а не преимуществом. Вывод отсюда резче, чем у самого Vercel: топ каталога — это то, что у соседней команды уже есть бесплатно.
Если в
https://vercel.com/blog/state-of-agent-skills
Vercel посчитал
skills.sh, открытый реестр скиллов: за семь месяцев там миллион скиллов и почти 280 млн установок. Почти половину поставили ровно один раз, а 375 штук, 0,04% реестра, собрали 62% установок. Оговорка из самого отчёта: это счётчики реестра, а не число людей.Популярными становятся скиллы, которые пригодятся всем. Vercel сам пишет, что общая экспертиза вместе с моделями станет базовым уровнем, а не преимуществом. Вывод отсюда резче, чем у самого Vercel: топ каталога — это то, что у соседней команды уже есть бесплатно.
Если в
.claude/skills вашего репозитория лежат только скиллы из топа, агент знает о проекте ровно то же, что у всех.https://vercel.com/blog/state-of-agent-skills
Vercel
State of agent skills
In seven months, the skills.sh registry grew to 1 million agent skills with nearly 280 million installs. This report uses aggregate data from that registry to examine what people teach agents, what gets installed, and what lasts.
👍1
Продолжение вчерашнего поста: выложил на Полку два больших исследования, которыми давно хотелось поделиться.
1. Как запускать open-source-продукты на GitHub
Отделяю число репозиториев от числа продуктов; разбираю траектории роста, роль звёзд, влияние ИИ и путь от первого запуска к повторному использованию и поддержке.
→ Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4
2. Что происходит с деньгами в фонде LQDT
Простыми словами — что происходит при покупке пая, как фонд работает через РЕПО, что значит залог, откуда берётся доход, какие расходы раскрыты и чего нельзя узнать по короткой сводке. В документах указано, что доход и возврат вложений не гарантированы; в разборе показываю, где здесь риски и что проверять.
→ Разбор: https://polochka.app/s#tYwyRZIwny85ImP8pJBCo9yeQ-RNg3g3hUqZo-nZ86I
Это две разные темы, но общий подход один: идти за красивым заголовком к механике — кто что делает, где деньги, какие данные доступны и чего мы пока не знаем. Если откроете, напишите, какую часть разобрать подробнее.
1. Как запускать open-source-продукты на GitHub
Отделяю число репозиториев от числа продуктов; разбираю траектории роста, роль звёзд, влияние ИИ и путь от первого запуска к повторному использованию и поддержке.
→ Полная версия: https://polochka.app/s#-KqM5ry1abzLDFDPxrXuMlBG-pLDK7jZsgPUWAQcdX4
2. Что происходит с деньгами в фонде LQDT
Простыми словами — что происходит при покупке пая, как фонд работает через РЕПО, что значит залог, откуда берётся доход, какие расходы раскрыты и чего нельзя узнать по короткой сводке. В документах указано, что доход и возврат вложений не гарантированы; в разборе показываю, где здесь риски и что проверять.
→ Разбор: https://polochka.app/s#tYwyRZIwny85ImP8pJBCo9yeQ-RNg3g3hUqZo-nZ86I
Это две разные темы, но общий подход один: идти за красивым заголовком к механике — кто что делает, где деньги, какие данные доступны и чего мы пока не знаем. Если откроете, напишите, какую часть разобрать подробнее.
Стандартная метрика сдвигов вёрстки ставила claude.ai оценку «хорошо» — а на 31% загрузок что-то на странице сдвигалось уже после того, как в ней можно было печатать.
Это из отчёта инженеров Anthropic о двухнедельном августовском спринте: веб и десктоп ускорили примерно втрое, влили больше трёх тысяч изменений без единого инцидента у пользователей. Пишет вендор о своём продукте, независимой проверки нет.
Строки сайдбара подъезжали после загрузки, и ни один монитор этого не видел. Cumulative Layout Shift давал на сдвиг около 0,008 при пороге «хорошо» в 0,1. Заметили по записи экрана. Тогда Claude завёл событие, которое привязывает каждый сдвиг к области страницы и фазе загрузки, и тест, падающий на любом сдвиге: 20 из 20 красных прогонов на main, 20 из 20 зелёных на PR. Первые же данные с поля — те самые 31%.
Главный вывод авторы делают сами: раньше измерение было нулевым шагом, а с Claude это «step one of the climb». Дали агенту число — он его двигает. Поэтому самым ценным стало искать, что ещё можно посчитать, а каждый принятый замер превращался в порог CI, который можно только опускать.
Обратная сторона этого вывода: агент чинит ровно то, что видит метрика. Всё, чего она не видит, остаётся как было, при зелёном дашборде. Там же нашлась секунда зависания подсветки кода — из-за длинного тире, которое переводит строку в UTF-16.
https://claude.dev/blog/how-we-made-claude-ai-faster/
Какое зелёное число в вашем проекте вы ни разу не сверяли с записью экрана?
Это из отчёта инженеров Anthropic о двухнедельном августовском спринте: веб и десктоп ускорили примерно втрое, влили больше трёх тысяч изменений без единого инцидента у пользователей. Пишет вендор о своём продукте, независимой проверки нет.
Строки сайдбара подъезжали после загрузки, и ни один монитор этого не видел. Cumulative Layout Shift давал на сдвиг около 0,008 при пороге «хорошо» в 0,1. Заметили по записи экрана. Тогда Claude завёл событие, которое привязывает каждый сдвиг к области страницы и фазе загрузки, и тест, падающий на любом сдвиге: 20 из 20 красных прогонов на main, 20 из 20 зелёных на PR. Первые же данные с поля — те самые 31%.
Главный вывод авторы делают сами: раньше измерение было нулевым шагом, а с Claude это «step one of the climb». Дали агенту число — он его двигает. Поэтому самым ценным стало искать, что ещё можно посчитать, а каждый принятый замер превращался в порог CI, который можно только опускать.
Обратная сторона этого вывода: агент чинит ровно то, что видит метрика. Всё, чего она не видит, остаётся как было, при зелёном дашборде. Там же нашлась секунда зависания подсветки кода — из-за длинного тире, которое переводит строку в UTF-16.
https://claude.dev/blog/how-we-made-claude-ai-faster/
Какое зелёное число в вашем проекте вы ни разу не сверяли с записью экрана?
Claude
Claude is Anthropic's AI, built for problem solvers. Tackle complex challenges, analyze data, write code, and think through your hardest work.
Forwarded from Money For Startup Андрей Резинкин
Пять инвайтов, ноль рекламы и оценка $10 млрд. Разбираем, как Instinct выходит на рынок
Наверняка многие из вас уже слышали про сумасшедший раунд Instinct: $1 млрд при оценке $10 млрд, лиды — Sequoia, Benchmark и Coatue. Стартапу около года, продукт до сих пор доступен только по инвайтам.
Но интереснее цифр раунда то, как Instinct выходит на рынок. Похоже, в эпоху AI дефицитный ресурс — уже не внимание пользователя, а компьют. И весь GTM строится вокруг этого. Как раз вышло интервью с основателем Ноа Шинном — его первый большой разговор о компании.
Старт был максимально скромным: продукт дали 200 друзьям и родственникам, у каждого пользователя было пять инвайтов. Первые дни база прибавляла по несколько человек в сутки, потом по паре процентов. Когда пользователей стало несколько тысяч, люди начали сами выкладывать в сеть свои кейсы, и рост разогнался до 10–11% в день. То есть база удваивалась примерно раз в неделю. На маркетинг при этом не потратили ни доллара. Инвайты перепродают на eBay по $300. А кто-то пишет фаундеру в личку, потому что не уверен, что попадёт в «пятёрку» друга.
Только инвайты здесь не игра в эксклюзивность. Каждый пользователь сжигает дорогой компьют, а мощности закупаются с лагом в несколько месяцев. Ноа признаётся, что около 40% времени думает о том, сколько GPU брать впрок. Инвайт-система работает как кран, которым регулируют рост. Иначе можно однажды проснуться с десятикратной базой, 80% которой не может достучаться до продукта.
Второе решение — у Instinct нет приложения. Ассистенту пишут в iMessage и WhatsApp, отправляют письма на почту, надиктовывают голосовые. Если горит дедлайн, он может позвонить и сам. Новый интерфейс не строят — заходят в каналы, которые у людей и так открыты весь день.
Третье. Главная метрика у них не активность, а доверие. Через три недели использования 40% пользователей привязывают к Instinct банковскую карту. И это считая тех, кто к тому моменту уже ушёл. Среди тех, кто доверил ассистенту хоть что-то чувствительное, удерживается 80%. Для консьюмер-продукта это почти нереальная цифра.
И бизнес-модель. Для пользователя продукт бесплатный, зарабатывать планируют на комиссии с мерчантов. Сколько брать, пока не решили. Через платформу уже проходит больше $1 млрд в год, половина — тревел, где бутик-отели готовы отдавать до 30% с брони. При этом индустрии ломать не собираются — хотят стать для них новым каналом продаж.
Раньше ограничением роста был бюджет на маркетинг. У Instinct это GPU, и под них пришлось перепридумать и воронку, и интерфейс, и монетизацию.
Мне больше всего нравится история с инвайтами как краном для роста. А что из этого впечатляет вас больше всего? Голосуйте в опросе ниже, а если выбрали «хайп» — расскажите в комментариях почему
Андрей Резинкин | Money For Startup
Наверняка многие из вас уже слышали про сумасшедший раунд Instinct: $1 млрд при оценке $10 млрд, лиды — Sequoia, Benchmark и Coatue. Стартапу около года, продукт до сих пор доступен только по инвайтам.
Но интереснее цифр раунда то, как Instinct выходит на рынок. Похоже, в эпоху AI дефицитный ресурс — уже не внимание пользователя, а компьют. И весь GTM строится вокруг этого. Как раз вышло интервью с основателем Ноа Шинном — его первый большой разговор о компании.
Старт был максимально скромным: продукт дали 200 друзьям и родственникам, у каждого пользователя было пять инвайтов. Первые дни база прибавляла по несколько человек в сутки, потом по паре процентов. Когда пользователей стало несколько тысяч, люди начали сами выкладывать в сеть свои кейсы, и рост разогнался до 10–11% в день. То есть база удваивалась примерно раз в неделю. На маркетинг при этом не потратили ни доллара. Инвайты перепродают на eBay по $300. А кто-то пишет фаундеру в личку, потому что не уверен, что попадёт в «пятёрку» друга.
Только инвайты здесь не игра в эксклюзивность. Каждый пользователь сжигает дорогой компьют, а мощности закупаются с лагом в несколько месяцев. Ноа признаётся, что около 40% времени думает о том, сколько GPU брать впрок. Инвайт-система работает как кран, которым регулируют рост. Иначе можно однажды проснуться с десятикратной базой, 80% которой не может достучаться до продукта.
Второе решение — у Instinct нет приложения. Ассистенту пишут в iMessage и WhatsApp, отправляют письма на почту, надиктовывают голосовые. Если горит дедлайн, он может позвонить и сам. Новый интерфейс не строят — заходят в каналы, которые у людей и так открыты весь день.
Третье. Главная метрика у них не активность, а доверие. Через три недели использования 40% пользователей привязывают к Instinct банковскую карту. И это считая тех, кто к тому моменту уже ушёл. Среди тех, кто доверил ассистенту хоть что-то чувствительное, удерживается 80%. Для консьюмер-продукта это почти нереальная цифра.
И бизнес-модель. Для пользователя продукт бесплатный, зарабатывать планируют на комиссии с мерчантов. Сколько брать, пока не решили. Через платформу уже проходит больше $1 млрд в год, половина — тревел, где бутик-отели готовы отдавать до 30% с брони. При этом индустрии ломать не собираются — хотят стать для них новым каналом продаж.
Раньше ограничением роста был бюджет на маркетинг. У Instinct это GPU, и под них пришлось перепридумать и воронку, и интерфейс, и монетизацию.
Мне больше всего нравится история с инвайтами как краном для роста. А что из этого впечатляет вас больше всего? Голосуйте в опросе ниже, а если выбрали «хайп» — расскажите в комментариях почему
Андрей Резинкин | Money For Startup
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
🎬 Сделал скилл для Claude Code: ролик с голосом из идеи, отчёта или продукта
Даёшь агенту материалы, на выходе готовый ролик с озвучкой, музыкой и субтитрами. Вертикальный для Reels и Telegram, горизонтальный для презентаций.
Во вложении пример: ролик про Шушу, помощницу семьи в Telegram. Вот как агент его собрал.
1️⃣ История до сценария. Сначала каркас: одна фраза, которую зритель перескажет («Шуша помнит за семью, а вы просто рядом»), героиня Анна, ставки (всё держится на памяти одного человека) и поворот (помощница живёт прямо в Telegram). И список того, что обещать нельзя: например, что бот сам оформляет заказ во ВкусВилле. Это делает человек.
2️⃣ Сценарий с линтером. 11 сцен по методологии Шуши: записать, разобрать, поделить, время для себя, побыть вместе, общая память. Линтер следит, чтобы зацепка была короткой («Кто в вашей семье помнит всё за всех?»), реплики не затягивались, а финал был мыслью, а не «ссылкой в описании».
3️⃣ Голос с режиссурой. Gemini TTS, у каждой реплики своё настроение: интрига в начале, тревога на проблеме, облегчение, когда Шуша забирает дела. Каждый дубль расшифровывается и сверяется с текстом: модель иногда глотает слова или пересказывает своими.
4️⃣ Музыка от Lyria, приглушается под голос.
5️⃣ Видео собирается кодом в Remotion, а не генерируется. Диалоги Анны с Шушей набраны пузырями чата и помечены «пример диалога», анимация идёт точно под голос: поменял реплику, и весь ролик перемонтировался сам.
6️⃣ Проверка перед рендером: стоп-кадры и вторая пара глаз от модели со зрением. На Шуше проверка поймала схему памяти, где линии не доходили до кружков.
Итог: 105 секунд, 1080×1920.
Открытый код, MIT:
👉 github.com/artkruglov/voice-film
Поставить: git clone https://github.com/artkruglov/voice-film ~/.claude/skills/voice-film
Спасибо за идеи product-film-skill и nd-video-studio 🙌
Даёшь агенту материалы, на выходе готовый ролик с озвучкой, музыкой и субтитрами. Вертикальный для Reels и Telegram, горизонтальный для презентаций.
Во вложении пример: ролик про Шушу, помощницу семьи в Telegram. Вот как агент его собрал.
1️⃣ История до сценария. Сначала каркас: одна фраза, которую зритель перескажет («Шуша помнит за семью, а вы просто рядом»), героиня Анна, ставки (всё держится на памяти одного человека) и поворот (помощница живёт прямо в Telegram). И список того, что обещать нельзя: например, что бот сам оформляет заказ во ВкусВилле. Это делает человек.
2️⃣ Сценарий с линтером. 11 сцен по методологии Шуши: записать, разобрать, поделить, время для себя, побыть вместе, общая память. Линтер следит, чтобы зацепка была короткой («Кто в вашей семье помнит всё за всех?»), реплики не затягивались, а финал был мыслью, а не «ссылкой в описании».
3️⃣ Голос с режиссурой. Gemini TTS, у каждой реплики своё настроение: интрига в начале, тревога на проблеме, облегчение, когда Шуша забирает дела. Каждый дубль расшифровывается и сверяется с текстом: модель иногда глотает слова или пересказывает своими.
4️⃣ Музыка от Lyria, приглушается под голос.
5️⃣ Видео собирается кодом в Remotion, а не генерируется. Диалоги Анны с Шушей набраны пузырями чата и помечены «пример диалога», анимация идёт точно под голос: поменял реплику, и весь ролик перемонтировался сам.
6️⃣ Проверка перед рендером: стоп-кадры и вторая пара глаз от модели со зрением. На Шуше проверка поймала схему памяти, где линии не доходили до кружков.
Итог: 105 секунд, 1080×1920.
Открытый код, MIT:
👉 github.com/artkruglov/voice-film
Поставить: git clone https://github.com/artkruglov/voice-film ~/.claude/skills/voice-film
Спасибо за идеи product-film-skill и nd-video-studio 🙌
🔥5👍3
Forwarded from Остриков пилит агентов
nlp_daily
Написал у Леши, продублирую и здесь свои вангования на OpenAI DevDay 👾 Персональный always-on агент: работает в фоне и сам доводит задачи ├ Агенту можно написать sms или в slack, или позвонить ├ У агента свой email-адрес └ Агент покупает за тебя с подтверждением…
И не зря - вы, батенька, ещё и победили в этом поле чудес
Итого - Марк собрал 7 верных пунктов в одном сообщении:
- Постоянный персональный агент — dot работает в фоне и продолжает задачи между обращениями пользователя
- Общение с агентом через Slack и голосом — можно написать своему dot или начать голосовой разговор
- Покупки с подтверждением пользователя — dot может совершать покупки после одобрения
- Подписка примерно за $500 — представили Pro за $500 в месяц
- Функции без расхода обычных лимитов — разговоры с dot не расходуют лимиты ChatGPT
- Codex работает без включённого ноутбука — задачи продолжают выполняться в облаке
- Общее пространство для людей и агентов — представили ChatGPT Space для совместной работы команды и ИИ
Также аплодисменты Вячеславу, Kr1to и Nastia - вы были очень близки 👊🏻
———
Теперь все знают, у кого есть инсайдеры и кого можно просить о сбросах
Чудо-диктофон отправляется к победителю в ближайшие пару дней
Итого - Марк собрал 7 верных пунктов в одном сообщении:
- Постоянный персональный агент — dot работает в фоне и продолжает задачи между обращениями пользователя
- Общение с агентом через Slack и голосом — можно написать своему dot или начать голосовой разговор
- Покупки с подтверждением пользователя — dot может совершать покупки после одобрения
- Подписка примерно за $500 — представили Pro за $500 в месяц
- Функции без расхода обычных лимитов — разговоры с dot не расходуют лимиты ChatGPT
- Codex работает без включённого ноутбука — задачи продолжают выполняться в облаке
- Общее пространство для людей и агентов — представили ChatGPT Space для совместной работы команды и ИИ
Также аплодисменты Вячеславу, Kr1to и Nastia - вы были очень близки 👊🏻
———
Теперь все знают, у кого есть инсайдеры и кого можно просить о сбросах
Чудо-диктофон отправляется к победителю в ближайшие пару дней
❤1
https://golden-ring-danya.netlify.app/ - классный школьный проект по Золотому Кольцу.
Проект сделали фоном за 1 вечер с Даней
Проект сделали фоном за 1 вечер с Даней
golden-ring-danya.netlify.app
Золотое кольцо • Хранители времени
Золотое кольцо для детей: настоящий архив, сравнение эпох, ожившие истории и десять открытий.
🔥2
Forwarded from Записки CPU designer'a
Уже влезли в долги, чтобы наскрести на подписку ChatGPT за 500$?
Пока убеждаете друзей занять вам денег, чтобы за две недели навайбить убийцу Nvidia, самое время разобраться, что же такое Cerebras и почему именно их железо внезапно оказалось настолько интересным для LLM-инференса.
Забавно, что изначально Cerebras в первую очередь пытались решить задачу обучения нейросетей.
И, если верить довольно жёсткому разбору Irrational Analysis, именно с training всё получилось не очень хорошо. Архитектура получилась сильно перекошенной: внутри самого WSE пропускная способность огромная, но канал обмена с внешней памятью и другими устройствами относительно узкий. Поэтому для обучения Cerebras приходилось дополнять WSE внешними системами MemoryX и SwarmX, а ограниченный внешний I/O становился одним из главных bottleneck'ов.
А что вообще такое WSE, MemoryX и SwarmX и как всё это устроено, читайте в отчёте Irrational Analysis.
А вот с инференсом всё оказалось гораздо интереснее.
Cerebras довольно самобытная архитектура. Вместо относительно классической связки GPU с расположенной рядом HBM они буквально делают процессор размером почти с целую кремниевую пластину, Wafer-Scale Engine. WSE-3 содержит около 900 тысяч маленьких ядер, у каждого из которых есть локальный SRAM и простые SIMD-блоки. В сумме получается примерно 44 GB SRAM прямо на wafer.
И вот для inference это оказалось очень интересной комбинацией. Обычный GPU при генерации токенов во многом упирается в необходимость постоянно читать веса модели из HBM.
У Cerebras веса и KV-cache можно держать прямо в SRAM рядом с вычислительными ядрами, а слои модели распределять по WSE. Если одного WSE не хватает, модель распределяется между несколькими. Каждый хранит свою часть модели и передаёт следующему только промежуточный результат вычислений, а не сами веса. Благодаря этому веса остаются в быстром локальном SRAM, а между WSE нужно передавать сравнительно небольшой объём данных. Отсюда и очень высокая скорость генерации.
То есть архитектура, которая довольно странно выглядела как конкурент Nvidia в training, неожиданно нашла свою сильную сторону именно там, где сегодня особенно ценится latency: ультрабыстрый LLM inference.
Но silver bullet из Cerebras всё равно не получился. Вопрос, как оптимальнее всего строить железо для LLM inference, сегодня всё ещё открыт. Одна из главных проблем Cerebras в том, что объём SRAM нельзя наращивать так же легко, как внешнюю память, а большие модели и длинный контекст требуют всё больше памяти. В итоге приходится использовать больше WSE, и впечатляющая скорость начинает обходиться всё дороже с точки зрения масштабирования всей системы. Сам отчёт отдельно отмечает, что KV-cache и веса конкурируют за один и тот же ограниченный SRAM, а с ростом размера модели экономика такого подхода становится всё сложнее.
Но сам инженерный подход всё равно совершенно безумный и очень интересный.
Кстати, если вы забыли, какого размера «чип» у Cerebras, приложу фотку в комментариях.
P.S. Пост чуть больше чем полностью построен на отчёте Irrational Analysis. Обязательно ознакомьтесь с ним, невероятно увлекательный и познавательный разбор.
Пока убеждаете друзей занять вам денег, чтобы за две недели навайбить убийцу Nvidia, самое время разобраться, что же такое Cerebras и почему именно их железо внезапно оказалось настолько интересным для LLM-инференса.
Забавно, что изначально Cerebras в первую очередь пытались решить задачу обучения нейросетей.
И, если верить довольно жёсткому разбору Irrational Analysis, именно с training всё получилось не очень хорошо. Архитектура получилась сильно перекошенной: внутри самого WSE пропускная способность огромная, но канал обмена с внешней памятью и другими устройствами относительно узкий. Поэтому для обучения Cerebras приходилось дополнять WSE внешними системами MemoryX и SwarmX, а ограниченный внешний I/O становился одним из главных bottleneck'ов.
А что вообще такое WSE, MemoryX и SwarmX и как всё это устроено, читайте в отчёте Irrational Analysis.
А вот с инференсом всё оказалось гораздо интереснее.
Cerebras довольно самобытная архитектура. Вместо относительно классической связки GPU с расположенной рядом HBM они буквально делают процессор размером почти с целую кремниевую пластину, Wafer-Scale Engine. WSE-3 содержит около 900 тысяч маленьких ядер, у каждого из которых есть локальный SRAM и простые SIMD-блоки. В сумме получается примерно 44 GB SRAM прямо на wafer.
И вот для inference это оказалось очень интересной комбинацией. Обычный GPU при генерации токенов во многом упирается в необходимость постоянно читать веса модели из HBM.
У Cerebras веса и KV-cache можно держать прямо в SRAM рядом с вычислительными ядрами, а слои модели распределять по WSE. Если одного WSE не хватает, модель распределяется между несколькими. Каждый хранит свою часть модели и передаёт следующему только промежуточный результат вычислений, а не сами веса. Благодаря этому веса остаются в быстром локальном SRAM, а между WSE нужно передавать сравнительно небольшой объём данных. Отсюда и очень высокая скорость генерации.
То есть архитектура, которая довольно странно выглядела как конкурент Nvidia в training, неожиданно нашла свою сильную сторону именно там, где сегодня особенно ценится latency: ультрабыстрый LLM inference.
Но silver bullet из Cerebras всё равно не получился. Вопрос, как оптимальнее всего строить железо для LLM inference, сегодня всё ещё открыт. Одна из главных проблем Cerebras в том, что объём SRAM нельзя наращивать так же легко, как внешнюю память, а большие модели и длинный контекст требуют всё больше памяти. В итоге приходится использовать больше WSE, и впечатляющая скорость начинает обходиться всё дороже с точки зрения масштабирования всей системы. Сам отчёт отдельно отмечает, что KV-cache и веса конкурируют за один и тот же ограниченный SRAM, а с ростом размера модели экономика такого подхода становится всё сложнее.
Но сам инженерный подход всё равно совершенно безумный и очень интересный.
Кстати, если вы забыли, какого размера «чип» у Cerebras, приложу фотку в комментариях.
P.S. Пост чуть больше чем полностью построен на отчёте Irrational Analysis. Обязательно ознакомьтесь с ним, невероятно увлекательный и познавательный разбор.
❤1
Forwarded from Machine learning Interview
🔥 DeepSeek и Huawei строят китайскую альтернативу CUDA
DeepSeek выпустила open-source инструменты для ускорителей Huawei Ascend, включая поддержку TileLang для Ascend 950. Они упрощают написание вычислительных ядер, перекладывая часть низкоуровневой работы на компилятор.
Смысл шире одной библиотеки: Китай пытается снизить зависимость не только от чипов NVIDIA, но и от всей экосистемы CUDA.
Именно за этим сейчас стоит следить особенно внимательно. Сильный GPU без удобных компиляторов, библиотек и инструментов для разработчиков мало что решает.
Китай строит не просто свои AI-чипы. Он строит свой полный AI-стек.
DeepSeek выпустила open-source инструменты для ускорителей Huawei Ascend, включая поддержку TileLang для Ascend 950. Они упрощают написание вычислительных ядер, перекладывая часть низкоуровневой работы на компилятор.
Смысл шире одной библиотеки: Китай пытается снизить зависимость не только от чипов NVIDIA, но и от всей экосистемы CUDA.
Именно за этим сейчас стоит следить особенно внимательно. Сильный GPU без удобных компиляторов, библиотек и инструментов для разработчиков мало что решает.
Китай строит не просто свои AI-чипы. Он строит свой полный AI-стек.
Forwarded from НейроВайб ИИ // Армен Амирханян
This media is not supported in your browser
VIEW IN TELEGRAM
Robinhood позволит поручать сделки AI агенту прямо в приложении
По данным брокера, с мая счета для сторонних AI агентов открыли более 150 тыс. клиентов. Теперь компания анонсировала встроенных Robinhood Agents. Доступ обещают скоро, только клиентам в США.
Выбираешь модель → открываешь агенту отдельный счёт → задаёшь стратегию. Он изучает рынок и готовит сделки. В демо предлагает купить акции Apple и ждёт подтверждения.
По умолчанию каждую сделку одобряет человек. Если отключить эту настройку, агент сможет торговать сам деньгами на отдельном счёте.
Loops, торговлю по расписанию, обещают добавить позже. GPT-Luna дадут бесплатно до конца года.
За решения AI и возможные убытки отвечает владелец счёта.
#AIагенты #Robinhood @neurovibe_ai
По данным брокера, с мая счета для сторонних AI агентов открыли более 150 тыс. клиентов. Теперь компания анонсировала встроенных Robinhood Agents. Доступ обещают скоро, только клиентам в США.
Выбираешь модель → открываешь агенту отдельный счёт → задаёшь стратегию. Он изучает рынок и готовит сделки. В демо предлагает купить акции Apple и ждёт подтверждения.
По умолчанию каждую сделку одобряет человек. Если отключить эту настройку, агент сможет торговать сам деньгами на отдельном счёте.
Loops, торговлю по расписанию, обещают добавить позже. GPT-Luna дадут бесплатно до конца года.
За решения AI и возможные убытки отвечает владелец счёта.
#AIагенты #Robinhood @neurovibe_ai
Forwarded from Мысли Рвачева
🤖 Стартуем новую тему в лекционном клубе - робототехника.
Недавно писал, что присматриваюсь к курсу Принстона Intro to Robotics, и решил не тянуть - с 12 октября начинаем его разбирать. Это вводный курс Anirudha Majumdar: motion planning, feedback control, state estimation и SLAM, machine learning для робототехники (imitation learning, diffusion models, RL, vision-language-action модели), и практика на квадрокоптерах Crazyflie.
Формат прежний: каждый независимо смотрит лекции в течение недели, а в понедельник час обсуждаем на Zoom. К первой встрече нужно посмотреть сразу две лекции (вводную и про планирование движения), дальше - по одной в неделю.
📆 Первая встреча - понедельник, 12 октября, 10am ET / 5pm MSK
📍 Регистрация на Luma:
https://luma.com/ujp2tnpv
🎥 К просмотру:
Lecture 1 - Intro to Robotics: https://youtu.be/cMhFAq53v1c
Lecture 2 - Discrete Motion Planning: https://youtu.be/LhLd8Kon1GY
📚 Сайт курса (слайды, конспекты, задания):
https://irom-lab.princeton.edu/intro-to-robotics/
Обсуждать между встречами - в чате @rvnikita_blog_chat
#robotics@rvnikita_blog #education@rvnikita_blog #ai@rvnikita_blog #princeton@rvnikita_blog
—————————
Мысли Рвачева
—————————
Недавно писал, что присматриваюсь к курсу Принстона Intro to Robotics, и решил не тянуть - с 12 октября начинаем его разбирать. Это вводный курс Anirudha Majumdar: motion planning, feedback control, state estimation и SLAM, machine learning для робототехники (imitation learning, diffusion models, RL, vision-language-action модели), и практика на квадрокоптерах Crazyflie.
Формат прежний: каждый независимо смотрит лекции в течение недели, а в понедельник час обсуждаем на Zoom. К первой встрече нужно посмотреть сразу две лекции (вводную и про планирование движения), дальше - по одной в неделю.
📆 Первая встреча - понедельник, 12 октября, 10am ET / 5pm MSK
📍 Регистрация на Luma:
https://luma.com/ujp2tnpv
🎥 К просмотру:
Lecture 1 - Intro to Robotics: https://youtu.be/cMhFAq53v1c
Lecture 2 - Discrete Motion Planning: https://youtu.be/LhLd8Kon1GY
📚 Сайт курса (слайды, конспекты, задания):
https://irom-lab.princeton.edu/intro-to-robotics/
Обсуждать между встречами - в чате @rvnikita_blog_chat
#robotics@rvnikita_blog #education@rvnikita_blog #ai@rvnikita_blog #princeton@rvnikita_blog
—————————
Мысли Рвачева
—————————
Forwarded from Точки над ИИ
This media is not supported in your browser
VIEW IN TELEGRAM
Учитывая популярность видео, сделанных на Opus 5.5 – не могу не поделиться большущей библиотекой таких видео, берите любое и повторяйте.
Кроме этого там промпты игр, эксплейнеров и 3Д-сцен. Всего 475 штук.
Вы знаете что с этим делать.
Например, найдите понравившееся видео, передайте его промпт агенту вместе с вашим лого, цветами и шрифтами, и создайте версию для своего продукта.
Тут ссылка.
Кроме этого там промпты игр, эксплейнеров и 3Д-сцен. Всего 475 штук.
Вы знаете что с этим делать.
Например, найдите понравившееся видео, передайте его промпт агенту вместе с вашим лого, цветами и шрифтами, и создайте версию для своего продукта.
Тут ссылка.
🔥3❤1👍1
Уровень
Это из гайда Anthropic по промптингу Opus 5.5 — вендор пишет о своей модели, и замеры тоже его. Там прямо сказано: названия уровней не означают одинаковый объём рассуждений у разных моделей. По тестам Anthropic, Opus 5.5 на
Оставите значение от Opus 5 — гайд обещает ровно это: длиннее ходы и больше выходных токенов. Совет — выставить уровень явно и прогнать несколько уровней на своих эвалах. И отдельно: смена
Та же ловушка у конца хода. Opus 5.5 пишет отчёты о прогрессе, и часть из них заканчивает ход текстом без вызова инструмента, со
После переезда проверять надо не промпты, а обвязку:
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5-5
Напишите, какой
effort, перенесённый с Opus 5 на Opus 5.5, — уже другая настройка: слово то же, а думает модель дольше и тратит больше выходных токенов.Это из гайда Anthropic по промптингу Opus 5.5 — вендор пишет о своей модели, и замеры тоже его. Там прямо сказано: названия уровней не означают одинаковый объём рассуждений у разных моделей. По тестам Anthropic, Opus 5.5 на
medium догоняет или обгоняет Opus 5 на high в коде и в работе со знаниями. По умолчанию у 5.5 стоит medium, у Opus 5 был high.Оставите значение от Opus 5 — гайд обещает ровно это: длиннее ходы и больше выходных токенов. Совет — выставить уровень явно и прогнать несколько уровней на своих эвалах. И отдельно: смена
effort между запросами сбрасывает кэш промпта.Та же ловушка у конца хода. Opus 5.5 пишет отчёты о прогрессе, и часть из них заканчивает ход текстом без вызова инструмента, со
stop_reason: "end_turn". Цикл агента, который считает это концом задачи, встаёт на середине. Anthropic советует считать такой ход отчётом и досылать открытые пункты — но не больше двух-трёх автоматических продолжений на задачу.После переезда проверять надо не промпты, а обвязку:
effort, max_tokens — рассуждения теперь включены всегда и считаются в него — и то, что ваш цикл принимает за «готово».https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5-5
Напишите, какой
effort стоит у вашего агента после переезда и выбирали ли вы его заново.Claude Platform Docs
Prompting Claude Opus 5.5
Behavioral differences from Claude Opus 5 and the prompting and harness patterns that address them: effort calibration, thinking behavior in API integrations and chat, progress updates, unattended and multiagent tasks, safeguard refusals, frontend design…