Недавно рассказывал, что указание агенту задавать недостающие вопросы может сильно повысить эффективность работы со спецификациями.
Но тут вышла статья IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications, где исследователи проверили способность моделей устранять критичные неоднозначности.
TL;DR для тех, кто не пойдет читать статью: пока что LLM с этим справляются так себе.
Агент может бесконечно задавать вопросы (иногда очень хорошие), но плохо понимает, какие из них действительно важны. Тогда как устранение неопределенностей принципиально влияет на результат — доля готовых к реализации спецификаций растет с 14% до 98% (в статье есть еще несколько подтверждающих тезис метрик).
Поэтому там, где важно получить полную спеку, есть смысл вместо «если постановка неоднозначна — сначала задай уточняющий вопрос» использовать что-то в духе:
И, возможно, стоит выделять на эту проверку отдельную роль рисерчера, чтобы избежать байаса у агента-исполнителя.
@devspotting
Но тут вышла статья IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications, где исследователи проверили способность моделей устранять критичные неоднозначности.
TL;DR для тех, кто не пойдет читать статью: пока что LLM с этим справляются так себе.
Агент может бесконечно задавать вопросы (иногда очень хорошие), но плохо понимает, какие из них действительно важны. Тогда как устранение неопределенностей принципиально влияет на результат — доля готовых к реализации спецификаций растет с 14% до 98% (в статье есть еще несколько подтверждающих тезис метрик).
Поэтому там, где важно получить полную спеку, есть смысл вместо «если постановка неоднозначна — сначала задай уточняющий вопрос» использовать что-то в духе:
Перечисли методологические решения, которые придётся принять при реализации. Для каждого укажи, следует ли решение однозначно из доступных требований. Если нет — укажи, какой информации не хватает и каким вопросом или поиском её можно получить. Не приступай к реализации, пока все пробелы не устранены.
И, возможно, стоит выделять на эту проверку отдельную роль рисерчера, чтобы избежать байаса у агента-исполнителя.
@devspotting
1👍13🔥4❤2
But I'm likely human after all
I'm likely human after all
Don't put your blame on me
Don't put your blame on me
@devspotting
I'm likely human after all
Don't put your blame on me
Don't put your blame on me
@devspotting
😁9👍6❤3
Шестой выпуск «ИИ — не новостей» уже на Ютубе (или на ваших любимых стримингах).
На этот раз мы с Сергеем @veged_and_code Бережным разбирались с нейродизайном.
Обсудили:
— как обеспечить консистентность генеренки через ограничения
— почему старый-добрый компонентный подход все еще рулит
— как избавиться от слопа с помощью мудбордов и ImageGen
и что такое Spec-Driven Development для дизайнеров.
Поставьте лайк, поделитесь видео с друзьями и сами не забывайте подписаться, чтобы не пропустить новые не новости!
@devspotting
На этот раз мы с Сергеем @veged_and_code Бережным разбирались с нейродизайном.
Обсудили:
— как обеспечить консистентность генеренки через ограничения
— почему старый-добрый компонентный подход все еще рулит
— как избавиться от слопа с помощью мудбордов и ImageGen
и что такое Spec-Driven Development для дизайнеров.
Поставьте лайк, поделитесь видео с друзьями и сами не забывайте подписаться, чтобы не пропустить новые не новости!
@devspotting
YouTube
AI-дизайн без нейрослопа: Pixel Perfect, скиллы и дизайн-системы | ИИ — не новости
Обсуждаем дизайн через ограничения вместо промптов, компоненты в мире дешёвой генерации кода, мудборды и ImageGen, консистентность AI-графики и то, нужен ли дизайну собственный Spec-Driven Development.
— Почему топовые AI-модели уже способны сделать вполне…
— Почему топовые AI-модели уже способны сделать вполне…
👍10🔥2
На OpenRouter очередная бесплатная стелс-модель — Union Alpha.
UPD: лавочка закрылась, модель оказалась роутером над неизвестным набором чужих моделей.
Заточена под агентную разработку, понимает картинки на вход.
Результаты неофициальных прогонов Terminal-Bench лучше GPT-5.6 Sol и очень близки к Claude Opus 5 (но верить им пока рановато).
Вероятно, очередная Kimi или GLM.
Традиционно для стелс-моделей инференс медленный, а провайдер может сохранять запросы. Если это не пугает — есть смысл попробовать.
@devspotting
UPD: лавочка закрылась, модель оказалась роутером над неизвестным набором чужих моделей.
Заточена под агентную разработку, понимает картинки на вход.
Результаты неофициальных прогонов Terminal-Bench лучше GPT-5.6 Sol и очень близки к Claude Opus 5 (но верить им пока рановато).
Вероятно, очередная Kimi или GLM.
Традиционно для стелс-моделей инференс медленный, а провайдер может сохранять запросы. Если это не пугает — есть смысл попробовать.
@devspotting
openrouter.ai
Union Alpha - API Pricing & Providers
Union Alpha is a multimodal model built for research, coding, and agentic workflows, while delivering frontier-level performance across a broad range of general-purpose tasks. 262,144 token context window.
🔥7❤5👍4
Аркадий, а что мы ускорили?
Помните Аркадия, которого мы просили убрать руки с клавиатуры?
Допустим, Аркадий справился. Перестал лично вайбкодить каждую задачу, выдал команде агентов и теперь смотрит на результаты: пулл-реквестов стало больше, однако фичи до пользователей быстрее не доезжают.
Как же так-то? А задача три дня ждала уточнения требований, потом неделю лежала на ревью, а потом выяснилось, что смежники вообще планировали другое.
Зато код сгенерили, пока играли в падел.
Как раз про это будет Avito.Tech.Conf 26 сентября, о которой я уже рассказывал: как меняется сетап команды с AI-агентами и как на практике расти без роста штата.
Можно прийти со своей историей про «код ускорили, а дальше что?» — на конференции будет мастермайнд с разбором управленческих проблем.
Участие бесплатное, офлайн в Москве в AG Loft или онлайн с трансляцией докладов. Если узнали в Аркадии себя или свою команду — регистрация здесь.
@devspotting
Помните Аркадия, которого мы просили убрать руки с клавиатуры?
Допустим, Аркадий справился. Перестал лично вайбкодить каждую задачу, выдал команде агентов и теперь смотрит на результаты: пулл-реквестов стало больше, однако фичи до пользователей быстрее не доезжают.
Как же так-то? А задача три дня ждала уточнения требований, потом неделю лежала на ревью, а потом выяснилось, что смежники вообще планировали другое.
Зато код сгенерили, пока играли в падел.
Как раз про это будет Avito.Tech.Conf 26 сентября, о которой я уже рассказывал: как меняется сетап команды с AI-агентами и как на практике расти без роста штата.
Можно прийти со своей историей про «код ускорили, а дальше что?» — на конференции будет мастермайнд с разбором управленческих проблем.
Участие бесплатное, офлайн в Москве в AG Loft или онлайн с трансляцией докладов. Если узнали в Аркадии себя или свою команду — регистрация здесь.
@devspotting
👍8🔥3❤2👌2
#ГриненкоПро №25 с Анастасией Бианко, руководителем отдела подбора персонала в Циан
https://www.youtube.com/watch?v=i2fExyLLke4
Обсудили что происходит на рынке IT, судьбу джунов, фальсификации опыта, автоматизацию найма, AI-интервью и что повышает шансы кандидата.
В выпуске:
— почему кандидатов стало так много, а дефицит сильных специалистов при этом никуда не исчез
— как работодатели распознают накрученный и полностью выдуманный опыт
— почему рекомендации, профессиональная репутация и прямой контакт с компанией снова важны
— что произошло с наймом джунов и почему от студентов теперь ждут гораздо большего
— нужно ли указывать конкретный стек, если с нейронкой можно быстро освоить новую технологию
— как Циан использует ИИ для фильтрации резюме и интервью со стажёрами
— какие AI-навыки уже стали гигиеническим минимумом для кандидата
— заменит ли ИИ рекрутеров и как может выглядеть автоматизированный найм ближайшего будущего
— почему компании пока продолжают нанимать роли, а не «универсальных продуктовых инженеров»
— чем культура найма в Циан отличается от Яндекса
Ставьте лайки, делитесь с друзьями, приходите обсудить в чате сообщества: @grinenko_pro
Приятного просмотра!
@devspotting
https://www.youtube.com/watch?v=i2fExyLLke4
Обсудили что происходит на рынке IT, судьбу джунов, фальсификации опыта, автоматизацию найма, AI-интервью и что повышает шансы кандидата.
В выпуске:
— почему кандидатов стало так много, а дефицит сильных специалистов при этом никуда не исчез
— как работодатели распознают накрученный и полностью выдуманный опыт
— почему рекомендации, профессиональная репутация и прямой контакт с компанией снова важны
— что произошло с наймом джунов и почему от студентов теперь ждут гораздо большего
— нужно ли указывать конкретный стек, если с нейронкой можно быстро освоить новую технологию
— как Циан использует ИИ для фильтрации резюме и интервью со стажёрами
— какие AI-навыки уже стали гигиеническим минимумом для кандидата
— заменит ли ИИ рекрутеров и как может выглядеть автоматизированный найм ближайшего будущего
— почему компании пока продолжают нанимать роли, а не «универсальных продуктовых инженеров»
— чем культура найма в Циан отличается от Яндекса
Ставьте лайки, делитесь с друзьями, приходите обсудить в чате сообщества: @grinenko_pro
Приятного просмотра!
@devspotting
YouTube
Как найти работу в IT в 2026 | Анастасия Бианко, руководитель отдела подбора персонала в Циан
Telegram-канал — https://t.me/devspotting
Чат сообщества — https://t.me/grinenko_pro
Рынок IT сегодня: на вакансии приходят десятки и сотни откликов, кандидаты генерируют резюме и проходят интервью с нейронками, а работодатели отвечают AI-скринингом и а…
Чат сообщества — https://t.me/grinenko_pro
Рынок IT сегодня: на вакансии приходят десятки и сотни откликов, кандидаты генерируют резюме и проходят интервью с нейронками, а работодатели отвечают AI-скринингом и а…
❤8🔥3👍2👎1👏1
Обсуждаем Jev в седьмом выпуске «ИИ — не новостей» с Сергеем @veged_and_code Бережным
Кроме того, обсудили:
— Почему чата, терминала и Markdown уже не хватает для работы с AI-агентами?
— Разбрали кастомные интерфейсы под конкретную задачу, Astra, автоматический монтаж в DaVinci Resolve и момент, когда проще попросить агента нарисовать себе UI.
— Откуда взялись разговоры про «10% вероятности вымирания человечества»?
Поставьте лайк, поделитесь видео с друзьями и сами не забывайте подписаться, чтобы не пропустить новые не новости!
@devspotting
Кроме того, обсудили:
— Почему чата, терминала и Markdown уже не хватает для работы с AI-агентами?
— Разбрали кастомные интерфейсы под конкретную задачу, Astra, автоматический монтаж в DaVinci Resolve и момент, когда проще попросить агента нарисовать себе UI.
— Откуда взялись разговоры про «10% вероятности вымирания человечества»?
Поставьте лайк, поделитесь видео с друзьями и сами не забывайте подписаться, чтобы не пропустить новые не новости!
@devspotting
YouTube
Jev: модель, которая принимает решения вместо генерации текста | ИИ — не новости
— Разбираемся с Jev — первым System One Model, который вместо ответа выдаёт выбор, оценку или вероятность.
— Почему чата, терминала и Markdown уже не хватает для работы с AI-агентами? Обсуждаем кастомные интерфейсы под конкретную задачу, Astra, автоматический…
— Почему чата, терминала и Markdown уже не хватает для работы с AI-агентами? Обсуждаем кастомные интерфейсы под конкретную задачу, Astra, автоматический…
🔥9👍3
В OpenCode в рамках OpenCode Zen на неделю появилась новая бесплатная мультимодальная стелс-модель Space Bunny с 1М контекста.
На реддите предполагают, что китайская, хотя по Spece в названии можно было и Grok заподозрить.
Обещают Zero Data Retention, верим? Впрочем, дареному кролику в уши не смотрят (а в Китае, говорят, кролик живет на луне). Надо брать, пока дают.
@devspotting
На реддите предполагают, что китайская, хотя по Spece в названии можно было и Grok заподозрить.
Обещают Zero Data Retention, верим? Впрочем, дареному кролику в уши не смотрят (а в Китае, говорят, кролик живет на луне). Надо брать, пока дают.
@devspotting
🔥6👍1
Forwarded from HardFest | 17 октября 2026
Media is too big
VIEW IN TELEGRAM
Закон Конвея работает даже на нейронках: собрали агентный пайплайн, а получили копию своей команды, только на созвонах теперь сгорают токены, а не люди.
17 октября на HardFest в Екатеринбурге вместе с Владимиром Гриненко разберемся, что измерять, где искать узкие места и как заставить агентов работать на команду, а не создавать вам ещё одну👾
👍7🔥2
#ГриненкоПро №26 с Никитой Уманским — тимлидом из Барселоны
https://www.youtube.com/watch?v=olVSVppq5hw
Обсуждаем:
— Как выглядит разработка, когда Claude Code получает контекст из Jira, Figma, backend-репозитория и дизайн-системы
— Почему даже хороший агентный пайплайн всё ещё требует проверки человеком на каждом этапе
— Что такое нейрослоп и почему AI может ускорять рост технической энтропии
— Почему программист превращается в тимлида собственной команды субагентов
— Как AI изменил собеседования и какие навыки теперь важнее алгоритмических задач
— Что останется от профессии программиста, если следующий уровень абстракции действительно станет похож на компилятор
Ставьте лайки, делитесь с друзьями, приходите обсудить в чате сообщества: @grinenko_pro
Приятного просмотра!
@devspotting
https://www.youtube.com/watch?v=olVSVppq5hw
Обсуждаем:
— Как выглядит разработка, когда Claude Code получает контекст из Jira, Figma, backend-репозитория и дизайн-системы
— Почему даже хороший агентный пайплайн всё ещё требует проверки человеком на каждом этапе
— Что такое нейрослоп и почему AI может ускорять рост технической энтропии
— Почему программист превращается в тимлида собственной команды субагентов
— Как AI изменил собеседования и какие навыки теперь важнее алгоритмических задач
— Что останется от профессии программиста, если следующий уровень абстракции действительно станет похож на компилятор
Ставьте лайки, делитесь с друзьями, приходите обсудить в чате сообщества: @grinenko_pro
Приятного просмотра!
@devspotting
YouTube
ИИ в стартапе на удаленке | Никита Уманский, Барселона
AI-агенты уже умеют пройти почти весь путь от задачи и макета до кода, ревью, браузерной проверки и CI. Но почему при этом команды разработчиков не исчезают — и действительно ли один инженер с Claude Code скоро сможет заменить целый отдел?
Говорим с Никитой…
Говорим с Никитой…
👍8🔥2