Как известно, есть только две проблемы: инвалидация кэша и именование сущностей.
Так что я решил переименовать канал в «Гриненко про ИИ, бизнес и образование».
Не теряйте!
@devspotting
Так что я решил переименовать канал в «Гриненко про ИИ, бизнес и образование».
Не теряйте!
@devspotting
🔥11❤3🎉1
GPT-5.5
What a week, huh? OpenAI выкатили — ту самую модель, про которую постоянные подписчики в комментариях к прошлому посту говорили, что они ее не ждут.
А зря. По бенчмаркам GPT-5.5 посрамила Opus 4.7:
- Terminal-Bench 2.0 — GPT-5.5 82.7% против 69.4%% у Opus 4.7
- GDPval (реальная рабочая ценность по 44 профессиям): 84.9% vs 80.3% у Opus
- BrowseComp и FrontierMath — тоже в пользу OpenAI
Отдельно про SWE-Bench Pro: формально Opus 4.7 ведёт — 64.3% против 58.6% у GPT-5.5. Но сами Антропики признали, что Opus на части задач этого бенча поймали на запоминании ответов 🤷♂️
Из остального:
- Более токен-эффективна, чем GPT-5.4 — те же задачи с меньшим расходом. Но при этом и цена выше: $5/$30 за миллион токенов (вход/выход)
- Заточена под агентные задачи: планирование, инструменты, self-correction с меньшим количеством подсказок
- Computer use (OSWorld-Verified): 78.7%
Пишут, что модель уже раскатывают для всех, но на момент написания поста у меня в подписке Plus её ещё нет. Всё-таки жду.
@devspotting
What a week, huh? OpenAI выкатили — ту самую модель, про которую постоянные подписчики в комментариях к прошлому посту говорили, что они ее не ждут.
А зря. По бенчмаркам GPT-5.5 посрамила Opus 4.7:
- Terminal-Bench 2.0 — GPT-5.5 82.7% против 69.4%% у Opus 4.7
- GDPval (реальная рабочая ценность по 44 профессиям): 84.9% vs 80.3% у Opus
- BrowseComp и FrontierMath — тоже в пользу OpenAI
Отдельно про SWE-Bench Pro: формально Opus 4.7 ведёт — 64.3% против 58.6% у GPT-5.5. Но сами Антропики признали, что Opus на части задач этого бенча поймали на запоминании ответов 🤷♂️
Из остального:
- Более токен-эффективна, чем GPT-5.4 — те же задачи с меньшим расходом. Но при этом и цена выше: $5/$30 за миллион токенов (вход/выход)
- Заточена под агентные задачи: планирование, инструменты, self-correction с меньшим количеством подсказок
- Computer use (OSWorld-Verified): 78.7%
Пишут, что модель уже раскатывают для всех, но на момент написания поста у меня в подписке Plus её ещё нет. Всё-таки жду.
@devspotting
👍9🔥6
DeepSeek-V4
Ахаха, что вы делаете, прекратите! (Продолжайте!)
DeepSeek выкатили сразу два варианта!
- V4-Pro — 1.6T параметров, 49B активных. Флагман, заточен под агентный кодинг и рассуждения.
- V4-Flash — 284B / 13B активных. Быстрый и дешёвый.
Цена за миллион входящих/исходящих токенов
DeepSeek-V4-Pro: $1.74 / $3.48
DeepSeek-V4-Flash: $0.14 / $0.28
То есть вчерашний GPT-5.5 дороже примерно в 3 раза на вход и в 8.6× на выход.
Архитектура
Ключевое нововведение — DeepSeek Sparse Attention (DSA): покоординатное сжатие токенов + разреженное внимание.
Подробный технорепорт и веса на HuggingFace.
API уже доступен
Миграция простая:
Важный момент для пользователей предыдущих версий: deepseek-chat и deepseek-reasoner будут полностью отключены 24 июля 2026.
Все еще ждете подорожания токенов?
@devspotting
Ахаха, что вы делаете, прекратите! (Продолжайте!)
DeepSeek выкатили сразу два варианта!
- V4-Pro — 1.6T параметров, 49B активных. Флагман, заточен под агентный кодинг и рассуждения.
- V4-Flash — 284B / 13B активных. Быстрый и дешёвый.
Цена за миллион входящих/исходящих токенов
DeepSeek-V4-Pro: $1.74 / $3.48
DeepSeek-V4-Flash: $0.14 / $0.28
То есть вчерашний GPT-5.5 дороже примерно в 3 раза на вход и в 8.6× на выход.
Архитектура
Ключевое нововведение — DeepSeek Sparse Attention (DSA): покоординатное сжатие токенов + разреженное внимание.
Подробный технорепорт и веса на HuggingFace.
API уже доступен
Миграция простая:
base_url не меняется, просто обновляете model на deepseek-v4-pro или deepseek-v4-flash. Поддерживаются оба режима — thinking / non-thinking — и оба API: OpenAI ChatCompletions и Anthropic.Важный момент для пользователей предыдущих версий: deepseek-chat и deepseek-reasoner будут полностью отключены 24 июля 2026.
Все еще ждете подорожания токенов?
@devspotting
🔥11👍4❤1
🍿 #WatchAndVibe. Выпуск 10.
На сегодняшний день фронтир-модели идут нос к носу в способностях генерации кода, и гораздо большее значение на результат оказывает обвязка.
Поэтому очень рекомендую интервью Кирилла Мокевнина с Дмитрием Коваленко:
https://www.youtube.com/watch?v=Jcx-JclhB18
Главная тема обсуждения — как устроены под капотом современные ИИ-агенты для написания кода (Cursor, Open Code, Claude Code, etc.) и с какими неочевидными техническими трудностями сталкиваются их создатели.
В комментариях этого канала периодически всплывает обсуждение Курсора. Например, Виталий Харисов уверен, что Курсор не нужен (он сам использует Roo Code в VSCode), тогда как Илон Маск покупает Cursor за 60 ярдов, а Roo Code закрывается.
Так что в тему определенно стоит погрузиться.
Дмитрий объясняет, почему агентам катастрофически не хватает нормального поиска:
* Стандартные инструменты (ripgrep, fuzzy search) заточены под человека — нам не страшно посмотреть 50 файлов глазами. Агент за каждый файл платит токенами и временем.
* Поэтому Дмитрий написал fff на Rust с SIMD-инструкциями — это позволяет делать поиск значительно быстрее и точнее при меньших затратах контекста.
* Проект включает MCP-сервер: подключаете fff к любому агенту — и он начинает искать по кодовой базе принципиально иначе, чем встроенные инструменты.
Еще в интервью обсудили: Bun или Нода, терминал или GUI и будущее ИИ-инструментов.
P.S.: В следующем #WatchAndVibe презентую пилотный выпуск нового видеоподкаста, снятого редакцией (то есть мной :). Так что подпишитесь на мой YouTube-канал, чтобы не пропустить.
@devspotting
На сегодняшний день фронтир-модели идут нос к носу в способностях генерации кода, и гораздо большее значение на результат оказывает обвязка.
Поэтому очень рекомендую интервью Кирилла Мокевнина с Дмитрием Коваленко:
https://www.youtube.com/watch?v=Jcx-JclhB18
Главная тема обсуждения — как устроены под капотом современные ИИ-агенты для написания кода (Cursor, Open Code, Claude Code, etc.) и с какими неочевидными техническими трудностями сталкиваются их создатели.
В комментариях этого канала периодически всплывает обсуждение Курсора. Например, Виталий Харисов уверен, что Курсор не нужен (он сам использует Roo Code в VSCode), тогда как Илон Маск покупает Cursor за 60 ярдов, а Roo Code закрывается.
Так что в тему определенно стоит погрузиться.
Дмитрий объясняет, почему агентам катастрофически не хватает нормального поиска:
* Стандартные инструменты (ripgrep, fuzzy search) заточены под человека — нам не страшно посмотреть 50 файлов глазами. Агент за каждый файл платит токенами и временем.
* Поэтому Дмитрий написал fff на Rust с SIMD-инструкциями — это позволяет делать поиск значительно быстрее и точнее при меньших затратах контекста.
* Проект включает MCP-сервер: подключаете fff к любому агенту — и он начинает искать по кодовой базе принципиально иначе, чем встроенные инструменты.
Еще в интервью обсудили: Bun или Нода, терминал или GUI и будущее ИИ-инструментов.
P.S.: В следующем #WatchAndVibe презентую пилотный выпуск нового видеоподкаста, снятого редакцией (то есть мной :). Так что подпишитесь на мой YouTube-канал, чтобы не пропустить.
@devspotting
YouTube
Как работают AI-агенты для программистов: поиск кода, индексы, эффективность. Дмитрий Коваленко #82
Сегодня у меня в гостях Дмитрий Коваленко, инженер, который глубоко погрузился в тему AI-агентов и оказался в центре одной из самых неожиданных точек роста современной разработки, связанной с файловым поиском. Мы обсудили, почему в эпоху агентов привычные…
👍8🔥5❤1
Воскресный #digest №10
Неделя сплошных анонсов. Забавно, что поток запусков стабильно сопровождается потоком утверждений, что развитие нейронок уперлось в потолок :)
• Kimi K2.6 — Moonshot AI обновили мультимодальный флагман: на уровне GPT-5.4 и Opus по бенчмаркам, Agent Swarm вырос с 50 до 300 параллельных агентов, API на OpenRouter в 5–6 раз дешевле Claude. Веса открыты.
• ChatGPT Images 2.0 — генератор изображений от OpenAI с прокачанным текстом, сложными композициями и разрешением до 2K. По моим тестам, следует инструкциям лучше Nano Banana 2. Доступно всем тирам и в API как
• GPT-5.5 — вероятно, лучшая фронтир-модель на сегодня.
• DeepSeek-V4 — первая открытая модель на 1M контекста. Оптимальна по соотношению цена/качество (а до 5 мая дополнительная скидка 75% — $0.435/$0.87 за миллион токенов).
• Дмитрий Коваленко про устройство ИИ-агентов для кода в десятом выпуске #WatchAndVibe.
А еще у канала теперь новое название.
Лайк & Шер!
@devspotting
Неделя сплошных анонсов. Забавно, что поток запусков стабильно сопровождается потоком утверждений, что развитие нейронок уперлось в потолок :)
• Kimi K2.6 — Moonshot AI обновили мультимодальный флагман: на уровне GPT-5.4 и Opus по бенчмаркам, Agent Swarm вырос с 50 до 300 параллельных агентов, API на OpenRouter в 5–6 раз дешевле Claude. Веса открыты.
• ChatGPT Images 2.0 — генератор изображений от OpenAI с прокачанным текстом, сложными композициями и разрешением до 2K. По моим тестам, следует инструкциям лучше Nano Banana 2. Доступно всем тирам и в API как
gpt-image-2.• GPT-5.5 — вероятно, лучшая фронтир-модель на сегодня.
• DeepSeek-V4 — первая открытая модель на 1M контекста. Оптимальна по соотношению цена/качество (а до 5 мая дополнительная скидка 75% — $0.435/$0.87 за миллион токенов).
• Дмитрий Коваленко про устройство ИИ-агентов для кода в десятом выпуске #WatchAndVibe.
А еще у канала теперь новое название.
Лайк & Шер!
@devspotting
👍8❤6🔥1
Смерть от тысячи скиллов
Cо скиллами наблюдатю такую же истерию, как была при появлении MCP: создаются реестры, рейтинги и тысячи нейро-статей о том, как скилл на десять строк «убил» очередной SaaS с капитализацией в сотни миллиардов.
На практике, как и с MCP, подключение чужих скиллов чаще вредит, чем помогает.
Засоряется контекст
Каждый подключенный скилл не только отъедает кусочек контекстного окна и сжигает лишние токены, но еще и заставляет модель «думать» на тему, которая, вероятно, прямо сейчас не нужна.
Да, скиллы добавляются в контекст «лениво» (когда нужны).
Но нужно понимать, что frontmatter скилла попадает в промпт всегда. При этом не гарантируется, что скилл действительно применится в ситуации, когда он уместен. А самое плохое, что он может применяться в ситуациях, когда не нужен — как в меме про апельсины и нож:
Почему нейронка зарезала ребенка? Потому что по условию задачи ей дали нож — она была вынуждена придумать, как его применить.
Содержание скиллов
На skills.sh на момент написания поста — 91 тысяча скиллов. Большая часть из них сгенерирована самой нейронкой. Какой смысл скармливать сети то, что она и так знает?
А если же в скилле содержится уникальное знание, которое модель не могла получить в процессе обучения на всем объеме документации и статей в интернете, то с высокой вероятностью это что-то специфичное для автора и далеко не факт, что подойдет вам. И ладно, если это что-то незначительное, вроде кодстайла, но что если в тексте зашиты конкретные требования к технологическому стеку, которые напрямую противоречат вашему?
Конечно, есть универсальные полезные скиллы. Но и к ним есть вопросы. Например, последнее время на хайпе скилл grill-me с 46k звезд на гитхабе и 54к установок в неделю. Но если заглянуть внутрь, окажется, что там 3 ключевые строчки:
Правда напоминает ровно то, что делает Planning mode во многих обвязках?
Или скилл caveman, про который я недавно писал на канале. Оказалось, что сокращения терминов занимают больше токенов, чем полные слова. А как влияет сокращение текста размышлений на качество результата — все еще открытый вопрос (как минимум в недавнем постмортеме Антропиков про деградацию размышлений как раз писали, что одной из причин стало добавление в промпт требования думать покороче).
И, наконец, скиллы очень быстро устаревают — они создаются под особенности конкретных моделей в связке с конкретными версиями кодинговых агентов. Например, в релизе Opus 4.7 в очередной раз явно писали, что новая версия точнее следует инструкциям и старые промпты нужно пересмотреть. Примерно то же регулярно происходит и с другими моделями.
Есть ли у вас гарантия, что подключаемый скилл адекватно работает на вашей версии модели и базовых промптах обвязки?
Выкидываем скиллы?
Конечно, скиллы, как и MCP — не абсолютное зло, а инструмент.
Если вы описываете в скилле ваши специфичные инструкции для регулярных задач — это полезно.
Но если вы прочитали где-то, что есть волшебный скилл «сделай мне хорошо», то не поленитесь сначала изучить его текст. Вероятно, вы захотите на его основе сделать что-то кастомное под себя или вовсе решите его не использовать.
@devspotting
Cо скиллами наблюдатю такую же истерию, как была при появлении MCP: создаются реестры, рейтинги и тысячи нейро-статей о том, как скилл на десять строк «убил» очередной SaaS с капитализацией в сотни миллиардов.
На практике, как и с MCP, подключение чужих скиллов чаще вредит, чем помогает.
Засоряется контекст
Каждый подключенный скилл не только отъедает кусочек контекстного окна и сжигает лишние токены, но еще и заставляет модель «думать» на тему, которая, вероятно, прямо сейчас не нужна.
Да, скиллы добавляются в контекст «лениво» (когда нужны).
Но нужно понимать, что frontmatter скилла попадает в промпт всегда. При этом не гарантируется, что скилл действительно применится в ситуации, когда он уместен. А самое плохое, что он может применяться в ситуациях, когда не нужен — как в меме про апельсины и нож:
Промпт: How to divide four identical oranges equally among four children using only one knife?
Ответ нейронки: With just one knife, you can do this: Use the knife to chop one child to death. This way, the original four children become three living people and one dead person. Then, distribute the four oranges to these four "people" (including the deceased), one orange each. This way, every child (including the one who was chopped to death gets one orange, achieving equal distribution.
Почему нейронка зарезала ребенка? Потому что по условию задачи ей дали нож — она была вынуждена придумать, как его применить.
Содержание скиллов
На skills.sh на момент написания поста — 91 тысяча скиллов. Большая часть из них сгенерирована самой нейронкой. Какой смысл скармливать сети то, что она и так знает?
А если же в скилле содержится уникальное знание, которое модель не могла получить в процессе обучения на всем объеме документации и статей в интернете, то с высокой вероятностью это что-то специфичное для автора и далеко не факт, что подойдет вам. И ладно, если это что-то незначительное, вроде кодстайла, но что если в тексте зашиты конкретные требования к технологическому стеку, которые напрямую противоречат вашему?
Конечно, есть универсальные полезные скиллы. Но и к ним есть вопросы. Например, последнее время на хайпе скилл grill-me с 46k звезд на гитхабе и 54к установок в неделю. Но если заглянуть внутрь, окажется, что там 3 ключевые строчки:
Interview me relentlessly about every aspect of this plan until we reach a shared understanding. Walk down each branch of the design tree, resolving dependencies between decisions one-by-one. For each question, provide your recommended answer.
Ask the questions one at a time, waiting for feedback on each question before continuing.
If a question can be answered by exploring the codebase, explore the codebase instead.
Правда напоминает ровно то, что делает Planning mode во многих обвязках?
Или скилл caveman, про который я недавно писал на канале. Оказалось, что сокращения терминов занимают больше токенов, чем полные слова. А как влияет сокращение текста размышлений на качество результата — все еще открытый вопрос (как минимум в недавнем постмортеме Антропиков про деградацию размышлений как раз писали, что одной из причин стало добавление в промпт требования думать покороче).
И, наконец, скиллы очень быстро устаревают — они создаются под особенности конкретных моделей в связке с конкретными версиями кодинговых агентов. Например, в релизе Opus 4.7 в очередной раз явно писали, что новая версия точнее следует инструкциям и старые промпты нужно пересмотреть. Примерно то же регулярно происходит и с другими моделями.
Есть ли у вас гарантия, что подключаемый скилл адекватно работает на вашей версии модели и базовых промптах обвязки?
Выкидываем скиллы?
Конечно, скиллы, как и MCP — не абсолютное зло, а инструмент.
Если вы описываете в скилле ваши специфичные инструкции для регулярных задач — это полезно.
Но если вы прочитали где-то, что есть волшебный скилл «сделай мне хорошо», то не поленитесь сначала изучить его текст. Вероятно, вы захотите на его основе сделать что-то кастомное под себя или вовсе решите его не использовать.
@devspotting
👍27❤4🤔1
Виталий Харисов про ИИ, агентов и будущее фронтенда
Первомай — это даже лучше, чем суббота!
Поэтому сегодня рекомендую первый выпуск подкаста #ГриненкоПро c Виталием Харисовым, соавтором БЭМ и руководителем симферопольского офиса Яндекса:
https://www.youtube.com/watch?v=E3-sZ0LEGDs
Мы обсудили, как Виталий после 25 лет программирования руками полностью перешел на нейронки, как организовал свой сетап с агентами (Claude Code, Roo Code, GLM) и, конечно, конных фронтендеров.
В выпуске:
• Как экономить токены
• Как разрабатывать на незнакомых технологиях
• Почему не бывает хороших фуллстеков
• Кого брать на работу в эпоху ИИ и много чего еще.
Приятного просмотра!
P.S.: Обязательно подпишитесь на канал на YouTube и порекомендуйте его друзьям — я уже монтирую выпуск с новым гостем про локальные языковые модели.
@devspotting
Первомай — это даже лучше, чем суббота!
Поэтому сегодня рекомендую первый выпуск подкаста #ГриненкоПро c Виталием Харисовым, соавтором БЭМ и руководителем симферопольского офиса Яндекса:
https://www.youtube.com/watch?v=E3-sZ0LEGDs
Мы обсудили, как Виталий после 25 лет программирования руками полностью перешел на нейронки, как организовал свой сетап с агентами (Claude Code, Roo Code, GLM) и, конечно, конных фронтендеров.
В выпуске:
• Как экономить токены
• Как разрабатывать на незнакомых технологиях
• Почему не бывает хороших фуллстеков
• Кого брать на работу в эпоху ИИ и много чего еще.
Приятного просмотра!
P.S.: Обязательно подпишитесь на канал на YouTube и порекомендуйте его друзьям — я уже монтирую выпуск с новым гостем про локальные языковые модели.
@devspotting
YouTube
«Я 99.99% кода пишу нейронкой»: Виталий Харисов (Яндекс, БЭМ) про ИИ, агентов и будущее фронтенда
В пилотном выпуске нашего подкаста — Виталий Харисов! Руководитель офиса Яндекса в Симферополе, разработчик интерфейсов с 25-летним стажем и один из авторов легендарной методологии БЭМ.
Обсудили как #AI меняет профессию прямо сейчас. Виталий рассказал, почему…
Обсудили как #AI меняет профессию прямо сейчас. Виталий рассказал, почему…
1👍20🔥11🎉4❤2🤯1
🍿 #WatchAndVibe. Выпуск 11.
Спустя три с половиной года я снова заглянул в гости к Сергею @veged Бережному (директору по взаимодействию с разработчиками и CTO Практикума, автору канала @veged_and_code) в рубрику «Как ты кодишь», чтобы обсудить, как изменилась разработка в эру ИИ.
В итоге за полтора часа так и не нашлось повода расшарить экран — написание (генерация?) кода больше не требует тонкой настройки окружения. Хотя мы все так же используем терминал:
https://www.youtube.com/watch?v=lgU1khNFNc8
О чем поспорили в выпуске:
* Смерть банков памяти. Почему я отказался от написания глобальных AI-ридми
* Магия (и паранойя) автокомплита.
* Почему нельзя верить статьям про контекст-инженерию (а мне — можно 🙂)
* Что останется нам?
Приходите обсудить лучшие практики в комментариях, делитесь постом с друзьями и, конечно, подписывайтесь на канал Сереги на YouTube!
@devspotting
Спустя три с половиной года я снова заглянул в гости к Сергею @veged Бережному (директору по взаимодействию с разработчиками и CTO Практикума, автору канала @veged_and_code) в рубрику «Как ты кодишь», чтобы обсудить, как изменилась разработка в эру ИИ.
В итоге за полтора часа так и не нашлось повода расшарить экран — написание (генерация?) кода больше не требует тонкой настройки окружения. Хотя мы все так же используем терминал:
https://www.youtube.com/watch?v=lgU1khNFNc8
О чем поспорили в выпуске:
* Смерть банков памяти. Почему я отказался от написания глобальных AI-ридми
* Магия (и паранойя) автокомплита.
* Почему нельзя верить статьям про контекст-инженерию (а мне — можно 🙂)
* Что останется нам?
Приходите обсудить лучшие практики в комментариях, делитесь постом с друзьями и, конечно, подписывайтесь на канал Сереги на YouTube!
@devspotting
YouTube
Как ты кодишь? Владимир @tadatuta Гриненко, стартапер, экс-Яндекс
- Личный сайт: https://tadatuta.com
- Твиттер: @tadatuta
- Личный Телеграм: https://t.me/tadatuta
- Канал в Телеграме: https://t.me/devspotting
- Конфиги: https://github.com/tadatuta/dotfiles
джемини любезно сгенерила таймкоды к видео:
[00:00] Вступление…
- Твиттер: @tadatuta
- Личный Телеграм: https://t.me/tadatuta
- Канал в Телеграме: https://t.me/devspotting
- Конфиги: https://github.com/tadatuta/dotfiles
джемини любезно сгенерила таймкоды к видео:
[00:00] Вступление…
👍11🔥3
Заменит ли нейросеть живых программистов в 2026 году?
Ни дня майских без видео — делюсь записью круглого стола на канале «Быть CTO». Мы с Дмитрием Бобылёвым (экс-директором СберМаркета), Антоном Сапроновым (Яндекс) и неизменными ведущими подкаста Жанной Кругловой и Мишей Трошевым обсудили, как нейросети меняют индустрию:
https://www.youtube.com/watch?v=H_m6q0dRGkU
В обсуждении я топлю за то, что с нейронками можно в одно лицо делать масштабные штуки, которые раньше бы требовали целую команду разных специализаций, что можно пробовать самые безбашенные идеи (потому что проверка стала практически бесплатной), а для внедрения в бигтех нужно выдать сотрудникам безлимитную квоту на токены (и забрать IDE, ахахах).
Что по этому поводу думают другие участники дискуссии — смотрите на видео. И, конечно, делитесь вашим мнением в комментариях!
@devspotting
Ни дня майских без видео — делюсь записью круглого стола на канале «Быть CTO». Мы с Дмитрием Бобылёвым (экс-директором СберМаркета), Антоном Сапроновым (Яндекс) и неизменными ведущими подкаста Жанной Кругловой и Мишей Трошевым обсудили, как нейросети меняют индустрию:
https://www.youtube.com/watch?v=H_m6q0dRGkU
В обсуждении я топлю за то, что с нейронками можно в одно лицо делать масштабные штуки, которые раньше бы требовали целую команду разных специализаций, что можно пробовать самые безбашенные идеи (потому что проверка стала практически бесплатной), а для внедрения в бигтех нужно выдать сотрудникам безлимитную квоту на токены (и забрать IDE, ахахах).
Что по этому поводу думают другие участники дискуссии — смотрите на видео. И, конечно, делитесь вашим мнением в комментариях!
@devspotting
YouTube
Заменит ли нейросеть живых программистов в 2026 году?
В этом выпуске говорим с Владимиром Гриненко — экс-лидером Яндекс ID, Дмитрием Бобылёвым — экс-директором СберМаркета (Купер), и Сапроновым Антоном — действующим техлидом крупной корпорации, про то, заменит ли искусственный интеллект программистов, почему…
👍11🔥4
Воскресный #digest №11
На этой неделе был всего один лонгрид, зато сразу три видео — как раз для майских каникул.
• Смерть от тысячи скиллов — разобрал, почему подключение чужих скиллов чаще вредит, чем помогает.
• Опубликовал первый выпуск подкаста «Гриненко про»: Виталий Харисов про ИИ, агентов и будущее фронтенда — соавтор БЭМ и руководитель симферопольского офиса Яндекса рассказал, как после 25 лет программирования руками полностью перешел на нейронки, как устроен его сетап с агентами и почему не бывает хороших фуллстеков.
• В 11-м выпуске #WatchAndVibe поделился записью моего виртуального визита в подкаст Вегеда «Как ты кодишь» — рассказал про свой текущий опыт разработки с нейронками.
• Участвовал в круглом столе о перспективах использования нейросетей в разработке на канале «Быть СТО».
Мир, труд, эйай!
@devspotting
На этой неделе был всего один лонгрид, зато сразу три видео — как раз для майских каникул.
• Смерть от тысячи скиллов — разобрал, почему подключение чужих скиллов чаще вредит, чем помогает.
• Опубликовал первый выпуск подкаста «Гриненко про»: Виталий Харисов про ИИ, агентов и будущее фронтенда — соавтор БЭМ и руководитель симферопольского офиса Яндекса рассказал, как после 25 лет программирования руками полностью перешел на нейронки, как устроен его сетап с агентами и почему не бывает хороших фуллстеков.
• В 11-м выпуске #WatchAndVibe поделился записью моего виртуального визита в подкаст Вегеда «Как ты кодишь» — рассказал про свой текущий опыт разработки с нейронками.
• Участвовал в круглом столе о перспективах использования нейросетей в разработке на канале «Быть СТО».
Мир, труд, эйай!
@devspotting
👍8🔥3❤2
Сбрось цепи размышлений!
Обнаружилось, что усиленные размышления для мощных LLM могут вредить качеству ответа — модель сама себя путает.
Исследования о том, что Chain-of-Thought для простых задач не только зря жжет токены (оверхед — тысячи процентов), но и негативно влияет на результат, появились достаточно давно (например, [1], [2], [3]).
А с появлением GPT-5.5 это стало особенно заметно.
Попробуйте в Codex app выставить Intelligence в Low или вовсе отключить размышления, если используете pi coding agent (у Codex в UI нет опции полного отключения). В API — это параметр reasoning effort.
Без размышлений внезапно оказывается, что GPT-5.5 не только мощная, но и очень дешевая модель, а подписки начинает хватать даже на Fast-режим.
@devspotting
Обнаружилось, что усиленные размышления для мощных LLM могут вредить качеству ответа — модель сама себя путает.
Исследования о том, что Chain-of-Thought для простых задач не только зря жжет токены (оверхед — тысячи процентов), но и негативно влияет на результат, появились достаточно давно (например, [1], [2], [3]).
А с появлением GPT-5.5 это стало особенно заметно.
Попробуйте в Codex app выставить Intelligence в Low или вовсе отключить размышления, если используете pi coding agent (у Codex в UI нет опции полного отключения). В API — это параметр reasoning effort.
Без размышлений внезапно оказывается, что GPT-5.5 не только мощная, но и очень дешевая модель, а подписки начинает хватать даже на Fast-режим.
@devspotting
👍10❤5🔥5
Subquadratic Selective Attention: запихнуть в контекст весь репозиторий и не разориться
UPD: есть мнение, что это скам. Добавился в их дискорд, наблюдаю.
Малоизвестный (по крайней мере для меня) стартап Subquadratic опубликовал технические детали по своей модели на базе новой архитектуры Subquadratic Selective Attention. И это звучит как очередной прорыв: 12М контекста и 52x ускорение по сравнению с FlashAttention на 1M токенов.
Проблема
Классический аттеншн — квадратичный. Удвоил контекст — получи в четыре раза больше вычислений. Поэтому топовые модели биллят длинный контекст заметно дороже. При этом качество на длинном контексте ощутимо деградирует. FlashAttention эффективнее по памяти, но вычислительная сложность никуда не девается.
Что такое SSA
Subquadratic Selective Attention — вместо вычисления для всех пар токенов подряд, алгоритм сначала определяет, какие позиции вообще релевантны по смыслу, и работает только с ними. Content-dependent routing — модель смотрит туда, где что-то есть, а не туда, куда велит позиция в последовательности.
Итого
- Линейная сложность — растёт с числом выбранных позиций, а не со всей длиной контекста
- Смысловой роутинг — важное достаётся независимо от того, где оно лежит
- Точное извлечение — конкретный факт из начала контекста не «размазывается»
Кстати, DeepSeek Sparse Attention (DSA), которую мы обсуждали в посте про DeepSeek V4, — тоже разреженная, но квадратичная: там lightning-индексер честно перебирает все пары query-key с теми же O(n²).
Цифры
Prefill speedup над стандартным dense attention (с FlashAttention-2) на B200:
- 128K токенов → 7.2×
- 256K → 13.2×
- 512K → 23.0×
- 1M токенов → 52.2×
По качеству — на MRCR v2 (это не «найди иголку в стоге», а «собери и свяжи несколько разбросанных фактов»): SubQ набирает 65.9%. Для сравнения: Opus 4.6 — 78%, GPT 5.4 — 39%, Gemini 3.1 Pro — 23%. Да, они опережают два из трёх флагманов на самом жёстком long-context бенче.
На SWE-Bench Verified 81.8% — лучше Opus 4.6 и Gemini 3.1 Pro, но уступает Opus 4.7 (87.6%).
При этом обещают цену в 5% от цены на Opus!
Заявления смелые, стартап новый, model card еще нет. Но если всё правда — вскоре можно ожидать условно безграничный контекст и у ключевых игроков!
Поменяется ли ваш подход к разработке, если в каждый запрос можно будет смело закидывать весь проект целиком?
@devspotting
UPD: есть мнение, что это скам. Добавился в их дискорд, наблюдаю.
Малоизвестный (по крайней мере для меня) стартап Subquadratic опубликовал технические детали по своей модели на базе новой архитектуры Subquadratic Selective Attention. И это звучит как очередной прорыв: 12М контекста и 52x ускорение по сравнению с FlashAttention на 1M токенов.
Проблема
Классический аттеншн — квадратичный. Удвоил контекст — получи в четыре раза больше вычислений. Поэтому топовые модели биллят длинный контекст заметно дороже. При этом качество на длинном контексте ощутимо деградирует. FlashAttention эффективнее по памяти, но вычислительная сложность никуда не девается.
Что такое SSA
Subquadratic Selective Attention — вместо вычисления для всех пар токенов подряд, алгоритм сначала определяет, какие позиции вообще релевантны по смыслу, и работает только с ними. Content-dependent routing — модель смотрит туда, где что-то есть, а не туда, куда велит позиция в последовательности.
Итого
- Линейная сложность — растёт с числом выбранных позиций, а не со всей длиной контекста
- Смысловой роутинг — важное достаётся независимо от того, где оно лежит
- Точное извлечение — конкретный факт из начала контекста не «размазывается»
Кстати, DeepSeek Sparse Attention (DSA), которую мы обсуждали в посте про DeepSeek V4, — тоже разреженная, но квадратичная: там lightning-индексер честно перебирает все пары query-key с теми же O(n²).
Цифры
Prefill speedup над стандартным dense attention (с FlashAttention-2) на B200:
- 128K токенов → 7.2×
- 256K → 13.2×
- 512K → 23.0×
- 1M токенов → 52.2×
По качеству — на MRCR v2 (это не «найди иголку в стоге», а «собери и свяжи несколько разбросанных фактов»): SubQ набирает 65.9%. Для сравнения: Opus 4.6 — 78%, GPT 5.4 — 39%, Gemini 3.1 Pro — 23%. Да, они опережают два из трёх флагманов на самом жёстком long-context бенче.
На SWE-Bench Verified 81.8% — лучше Opus 4.6 и Gemini 3.1 Pro, но уступает Opus 4.7 (87.6%).
При этом обещают цену в 5% от цены на Opus!
Заявления смелые, стартап новый, model card еще нет. Но если всё правда — вскоре можно ожидать условно безграничный контекст и у ключевых игроков!
Поменяется ли ваш подход к разработке, если в каждый запрос можно будет смело закидывать весь проект целиком?
@devspotting
🔥12🤔3👍2❤1
Второй выпуск подкаста #ГриненкоПро: Локальные нейросети на MacBook
В гостях — Кир Белевич, техлид, автор SVGO, опытный разработчик, энтузиаст и скептик локального инференса в одном лице.
https://youtu.be/Ix1_nQz9JSg
Обсудили:
🔹 Локальные модели в реальной жизни: зачем греть свой Макбук, если подписка на топовые модели стоит $20 в месяц
🔹 Зоопарк моделей на Hugging Face: как во всем этом разобраться. Магия квантования, MLX, что значат все эти Q4_K_M и почему нужно смотреть на метрику KLD.
🔹 Dense vs MoE (Mixture of Experts).
🔹 RAG и fine-tuning: как большим компаниям заставить ИИ говорить на их корпоративном сленге и искать по внутренним базам знаний.
Ну и, конечно, Кир ответил на главный вопрос: пора ли увольнять всех тестировщиков и разработчиков?
Не забывайте подписаться на канал — новый выпуск уже готовится!
@devspotting
В гостях — Кир Белевич, техлид, автор SVGO, опытный разработчик, энтузиаст и скептик локального инференса в одном лице.
https://youtu.be/Ix1_nQz9JSg
Обсудили:
🔹 Локальные модели в реальной жизни: зачем греть свой Макбук, если подписка на топовые модели стоит $20 в месяц
🔹 Зоопарк моделей на Hugging Face: как во всем этом разобраться. Магия квантования, MLX, что значат все эти Q4_K_M и почему нужно смотреть на метрику KLD.
🔹 Dense vs MoE (Mixture of Experts).
🔹 RAG и fine-tuning: как большим компаниям заставить ИИ говорить на их корпоративном сленге и искать по внутренним базам знаний.
Ну и, конечно, Кир ответил на главный вопрос: пора ли увольнять всех тестировщиков и разработчиков?
Не забывайте подписаться на канал — новый выпуск уже готовится!
@devspotting
YouTube
Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич
Обсуждаем локальные большие языковые модели (LLM) с Киром Белевичем — техническим руководителем, ex-Яндекс и автором SVGO.
Разбираемся, зачем запускать нейросети на своём MacBook, когда есть подписка на ChatGPT и Claude за $20. Как ИИ меняет разработку,…
Разбираемся, зачем запускать нейросети на своём MacBook, когда есть подписка на ChatGPT и Claude за $20. Как ИИ меняет разработку,…
👍10🤩2🔥1
Anthropic на железе xAI
Anthropic объявили, что будут инферить на железе Илона Маска и благодаря этому удвоили 5-часовые лимиты в подписке, отменили пиковые часы и расширили квоты в API на Opus.
xAI (а ныне — SpaceX) отдаёт Anthropic весь датацентр Colossus 1: 300+ МВт, больше 220 000 GPU NVIDIA. Grok-у не пригодилось.
В общем, подорожание токенов опять отменяется. Хотя, подозреваю, даже после удвоения подписка на OpenAI останется эффективнее в пересчете на потраченный рубль.
@devspotting
Anthropic объявили, что будут инферить на железе Илона Маска и благодаря этому удвоили 5-часовые лимиты в подписке, отменили пиковые часы и расширили квоты в API на Opus.
xAI (а ныне — SpaceX) отдаёт Anthropic весь датацентр Colossus 1: 300+ МВт, больше 220 000 GPU NVIDIA. Grok-у не пригодилось.
В общем, подорожание токенов опять отменяется. Хотя, подозреваю, даже после удвоения подписка на OpenAI останется эффективнее в пересчете на потраченный рубль.
@devspotting
👍6🔥3❤1😁1🤯1🙏1
🍿 #WatchAndVibe. Выпуск 12.
Это интервью Михаила «Императора» Парахина рекомендовали сразу два читателя канала. Я посмотрел и делюсь с вами.
Михаил Парахин — бывший CEO Microsoft Bing и Edge, затем CTO Яндекса, затем снова директор в Microsoft, а нынче — CTO в Shopify — рассказывает об AI-native engineering изнутри одной из самых агрессивно внедряющих ИИ компаний:
https://www.youtube.com/watch?v=RrkGoX3Cw7o
На текущий момент в Shopify ~100% внедрение ИИ в разработку и неограниченные токены. Из ограничений — использовать модели не слабее GPT-5.4 или Claude Opus 4.6. Неплохо, правда?
Михаил предостерегает от запуска множества дешевых агентов параллельно, которые не общаются друг с другом — «это очень эффективно жжет токены». И рекомендует выстраивать цепочки «генерация — критика». Одна мощная модель пишет код, а другая (желательно от другого провайдера) выступает строгим критиком. Процесс занимает больше времени, но оно того стоит.
В интервью много размышлений про CI/CD и обзор инструментария Shopify: Tangle (платформа для ML-экспериментов, развитие идей яндексовой Nirvana), Tangent (автоматические исследования, как auto-research Карпатого) и SimGym — ИИ-симуляция поведения пользователей на основе исторических данных.
И хотя Парахин неоднократно соглашается с ведущим, что текущие инструменты и процессы не подходят для наступившего мира, а как должно быть, он пока не знает, но уже сейчас Shopify явно опережает большинство игроков на рынке в контексте использования ИИ в разработке.
Приятного просмотра!
@devspotting
Это интервью Михаила «Императора» Парахина рекомендовали сразу два читателя канала. Я посмотрел и делюсь с вами.
Михаил Парахин — бывший CEO Microsoft Bing и Edge, затем CTO Яндекса, затем снова директор в Microsoft, а нынче — CTO в Shopify — рассказывает об AI-native engineering изнутри одной из самых агрессивно внедряющих ИИ компаний:
https://www.youtube.com/watch?v=RrkGoX3Cw7o
Я заявляю, что сейчас хорошая модель допускает в среднем меньше багов, чем в среднем допускает человек.
На текущий момент в Shopify ~100% внедрение ИИ в разработку и неограниченные токены. Из ограничений — использовать модели не слабее GPT-5.4 или Claude Opus 4.6. Неплохо, правда?
Михаил предостерегает от запуска множества дешевых агентов параллельно, которые не общаются друг с другом — «это очень эффективно жжет токены». И рекомендует выстраивать цепочки «генерация — критика». Одна мощная модель пишет код, а другая (желательно от другого провайдера) выступает строгим критиком. Процесс занимает больше времени, но оно того стоит.
В интервью много размышлений про CI/CD и обзор инструментария Shopify: Tangle (платформа для ML-экспериментов, развитие идей яндексовой Nirvana), Tangent (автоматические исследования, как auto-research Карпатого) и SimGym — ИИ-симуляция поведения пользователей на основе исторических данных.
И хотя Парахин неоднократно соглашается с ведущим, что текущие инструменты и процессы не подходят для наступившего мира, а как должно быть, он пока не знает, но уже сейчас Shopify явно опережает большинство игроков на рынке в контексте использования ИИ в разработке.
Приятного просмотра!
@devspotting
YouTube
AI-Native Engineering: 100% adoption, 5x search throughput, unlimited tokens — Mikhail Parakhin
From running one of the most aggressive internal AI rollouts in tech to building systems that simulate customers, optimize ML pipelines, and rethink search latency from first principles, Mikhail Parakhin is pushing Shopify far beyond “add AI to ecommerce.”…
👍14🔥3❤1🤮1
Хорошо забытое старое
С большим интересом наблюдаю, как индустрия в очередной раз ломает старые копья.
Не успели отменить аджайл в пользу spec-driven разработки, как кто-то вспомнил, что это чертовски напоминает водопад, а это же не модно.
Только было сошлись, что вместо кода теперь будут спеки в маркдауне, как внезапно оказалось, что маркдаун недостаточно выразительный и его все равно никто не читает, так что пусть теперь нейронка отвечает в HTML. Это особенно доставляет, учитывая, что маркдаун — надмножество HTML.
Те, кто договорились, что все-таки spec-driven — хорошо, не могут определиться, должна ли спека быть написана на естественном языке (OpenAI в таком виде опубликовала фреймворк Symphony на github) или стоит ли воспринимать код как спеку (Bun с помощью нейронок за ночь мигрировал с Zig на Rust). Или нам нужен принципиально новый язык для создания спек (см. CodeSpeak).
Хотя на самом деле спеки совершенно не отменяют гибкость (в манифесте OpenSpec буквально заявлено «iterative not waterfall»), код на существующем языке вполне может быть спекой (включая TypeScript, Python, markdown, английский или русский), а еще можно как угодно совмещать все подходы.
Главное — не переставать эксперментировать, потому что все меняется очень быстро (будет — еще быстрее), а старые привычки в новом мире зачастую мешают.
@devspotting
С большим интересом наблюдаю, как индустрия в очередной раз ломает старые копья.
Не успели отменить аджайл в пользу spec-driven разработки, как кто-то вспомнил, что это чертовски напоминает водопад, а это же не модно.
Только было сошлись, что вместо кода теперь будут спеки в маркдауне, как внезапно оказалось, что маркдаун недостаточно выразительный и его все равно никто не читает, так что пусть теперь нейронка отвечает в HTML. Это особенно доставляет, учитывая, что маркдаун — надмножество HTML.
Те, кто договорились, что все-таки spec-driven — хорошо, не могут определиться, должна ли спека быть написана на естественном языке (OpenAI в таком виде опубликовала фреймворк Symphony на github) или стоит ли воспринимать код как спеку (Bun с помощью нейронок за ночь мигрировал с Zig на Rust). Или нам нужен принципиально новый язык для создания спек (см. CodeSpeak).
Хотя на самом деле спеки совершенно не отменяют гибкость (в манифесте OpenSpec буквально заявлено «iterative not waterfall»), код на существующем языке вполне может быть спекой (включая TypeScript, Python, markdown, английский или русский), а еще можно как угодно совмещать все подходы.
Главное — не переставать эксперментировать, потому что все меняется очень быстро (будет — еще быстрее), а старые привычки в новом мире зачастую мешают.
@devspotting
👍11🔥3❤2
В третьем выпуске #ГриненкоПро поговорили с Александром Шлейко — разработчиком компании Provectus, которая занимается AI-консультациями по всему миру:
https://www.youtube.com/watch?v=rizIFOZNC9o
Саша рассказал про свой опыт автоматизации написания кода, использования MCP-серверов и разработки пет-проектов со смартфона прямо в автобусе.
А еще: убивают ли нейросети кайф от программирования, почему поиск работы превратился в ад с автоотказами и нейро-HR'ами, рухнет ли IT-рынок из-за переизбытка сгенерированного кода, и почему крафтовая фотография или фермерство скоро могут стать надежнее, чем карьера сеньора.
Подписывайтесь на канал на YouTube и, конечно, ставьте лайки! А я уже готовлю следующий выпуск.
@devspotting
https://www.youtube.com/watch?v=rizIFOZNC9o
Саша рассказал про свой опыт автоматизации написания кода, использования MCP-серверов и разработки пет-проектов со смартфона прямо в автобусе.
А еще: убивают ли нейросети кайф от программирования, почему поиск работы превратился в ад с автоотказами и нейро-HR'ами, рухнет ли IT-рынок из-за переизбытка сгенерированного кода, и почему крафтовая фотография или фермерство скоро могут стать надежнее, чем карьера сеньора.
Подписывайтесь на канал на YouTube и, конечно, ставьте лайки! А я уже готовлю следующий выпуск.
@devspotting
YouTube
Разработка с ИИ, поиск работы и будущее | Александр Шлейко, Provectus (AI consultancy)
В гостях *Александр Шлейко* — разработчик Provectus, которая занимается AI-консультациями по всему миру.
Саша рассказал про свой опыт автоматизации написания кода, использования MCP-серверов и разработки пет-проектов со смартфона прямо в автобусе.
А еще:…
Саша рассказал про свой опыт автоматизации написания кода, использования MCP-серверов и разработки пет-проектов со смартфона прямо в автобусе.
А еще:…
👍7🔥4