🍿 #WatchAndVibe. Выпуск 6.
Вышло интервью Лекса Фридмана с одним из важнейших людей в ИИ-индустрии — CEO NVIDIA Дженсеном Хуангом.
https://www.youtube.com/watch?v=vif8NQcjVf0
За 2.5 часа они успели обсудить перспективы ИИ и NVIDIA (Хуанг аргументирует, почему продолжит расти), инференс в космосе, будущее программирования, сознание, мораль и как он все это вывозит.
Дженсен допускает мысль, что AGI уже де-факто достигнут, но повторить успех NVIDIA у него нет шансов — как удобно, когда с терминами так и не определились.
Отдельный инсайт про игру в долгую — благодаря видеокартам дети привыкают, что NVIDIA делает лучшее железо. Вырастая и приходя в разработку, дата-саенс или науку, они уже лояльны и по умолчанию выбирают стек, которому привыкли доверять.
Так что же такое этот ваш AGI? Достигли? Достигнем?
@devspotting
Вышло интервью Лекса Фридмана с одним из важнейших людей в ИИ-индустрии — CEO NVIDIA Дженсеном Хуангом.
https://www.youtube.com/watch?v=vif8NQcjVf0
За 2.5 часа они успели обсудить перспективы ИИ и NVIDIA (Хуанг аргументирует, почему продолжит расти), инференс в космосе, будущее программирования, сознание, мораль и как он все это вывозит.
Дженсен допускает мысль, что AGI уже де-факто достигнут, но повторить успех NVIDIA у него нет шансов — как удобно, когда с терминами так и не определились.
Отдельный инсайт про игру в долгую — благодаря видеокартам дети привыкают, что NVIDIA делает лучшее железо. Вырастая и приходя в разработку, дата-саенс или науку, они уже лояльны и по умолчанию выбирают стек, которому привыкли доверять.
Так что же такое этот ваш AGI? Достигли? Достигнем?
@devspotting
YouTube
Jensen Huang: NVIDIA - The $4 Trillion Company & the AI Revolution | Lex Fridman Podcast #494
Jensen Huang is the co-founder and CEO of NVIDIA, the world's most valuable company and the engine powering the AI computing revolution.
Thank you for listening ❤ Check out our sponsors: https://lexfridman.com/sponsors/ep494-sb
See below for timestamps, transcript…
Thank you for listening ❤ Check out our sponsors: https://lexfridman.com/sponsors/ep494-sb
See below for timestamps, transcript…
👍10❤5🔥1
Воскресный #digest №6
На этой неделе мы много успели:
• Порассуждать о том, почему бы не поставить быструю и дешевую модель оптимизировать контекст для медленной и дорогой.
• Обрадоваться TurboQuant от Google Research для квантования моделей без потери качества (оказывается, исследование вышло год назад, но про него только сейчас написали в блоге).
• Изучить популярные фреймворки для Spec Driven Development: Superpowers, Spec kit, GSD, BMAD и OpenSpec.
• Рассмотреть нейро-мастермайнд как способ понять, чего ты хочешь.
• Обсудить писательство с нейронками (но так и не выяснили, должен ли автор страдать, чтобы результат считался настоящим).
• Посмотреть интервью с Дженсеном Хуангом, который продает детям NVIDIA смолоком матери видеокартами.
Что вам понравилось? О чем написать на следующей неделе?
@devspotting
На этой неделе мы много успели:
• Порассуждать о том, почему бы не поставить быструю и дешевую модель оптимизировать контекст для медленной и дорогой.
• Обрадоваться TurboQuant от Google Research для квантования моделей без потери качества (оказывается, исследование вышло год назад, но про него только сейчас написали в блоге).
• Изучить популярные фреймворки для Spec Driven Development: Superpowers, Spec kit, GSD, BMAD и OpenSpec.
• Рассмотреть нейро-мастермайнд как способ понять, чего ты хочешь.
• Обсудить писательство с нейронками (но так и не выяснили, должен ли автор страдать, чтобы результат считался настоящим).
• Посмотреть интервью с Дженсеном Хуангом, который продает детям NVIDIA с
Что вам понравилось? О чем написать на следующей неделе?
@devspotting
👍7❤2🔥1
В этом году участвую сразу в двух активностях на CodeFest: провожу мастер-класс «От вайбкодера к контекст-инженеру» и в новом формате — разборошной по теме «Использование AI в SDLC».
Если вы тоже там будете — давайте развиртуализируемся!
@devspotting
Если вы тоже там будете — давайте развиртуализируемся!
@devspotting
👍8🔥5👏3❤1
Нафига Figma?
В далеком 2021 году, почти в прошлой жизни, моя команда экспериментировала с синхронизацией кода с макетами в Figma. Боль для продуктовой компании была очень понятна: после того как макет превращается в живой сервис, исчезает источник истины. Чему верить при внесении изменений: макету или реализации в коде?
Тогда мы покрыли какое-то количество кейсов, Серега Савельев даже рассказывал про результаты на ЯСубботнике, но до полной автоматизации было далеко. Чуть позже появились десятки (возможно, сотни) подобных решений.
А потом пришли LLM-агенты.
И вот на прошлой неделе Figma выпустила недостающие части для вайб-дизайна: дополнили Figma MCP инструментами и набором скиллов, чтобы агент мог полностью контролировать холст и использовать компоненты из вашей дизайн-системы.
И там все как у людей: теперь агент знает, какие компоненты есть в дизайн-системе, но все равно чаще предпочитает создать их с нуля, чем воспользоваться готовыми. Если только не ткнуть носом. Совсем как было у нас с общей библиотекой компонентов.
Понятно, что аналоги были. Понятно, что шероховатости дошлифуют и можно ожидать, что за ближайшие несколько месяцев связка полностью заработает (как раз и бесплатный период закончится).
Но... зачем это всё теперь? Ладно еще собрать интерактивный сторибук со всеми состояниями компонентов / экранами и сценариями приложения, но если уж дизайнит агент, почему бы ему не делать это сразу в коде? Какой смысл в лишнем слое сегодня?
@devspotting
В далеком 2021 году, почти в прошлой жизни, моя команда экспериментировала с синхронизацией кода с макетами в Figma. Боль для продуктовой компании была очень понятна: после того как макет превращается в живой сервис, исчезает источник истины. Чему верить при внесении изменений: макету или реализации в коде?
Тогда мы покрыли какое-то количество кейсов, Серега Савельев даже рассказывал про результаты на ЯСубботнике, но до полной автоматизации было далеко. Чуть позже появились десятки (возможно, сотни) подобных решений.
А потом пришли LLM-агенты.
И вот на прошлой неделе Figma выпустила недостающие части для вайб-дизайна: дополнили Figma MCP инструментами и набором скиллов, чтобы агент мог полностью контролировать холст и использовать компоненты из вашей дизайн-системы.
И там все как у людей: теперь агент знает, какие компоненты есть в дизайн-системе, но все равно чаще предпочитает создать их с нуля, чем воспользоваться готовыми. Если только не ткнуть носом. Совсем как было у нас с общей библиотекой компонентов.
Понятно, что аналоги были. Понятно, что шероховатости дошлифуют и можно ожидать, что за ближайшие несколько месяцев связка полностью заработает (как раз и бесплатный период закончится).
Но... зачем это всё теперь? Ладно еще собрать интерактивный сторибук со всеми состояниями компонентов / экранами и сценариями приложения, но если уж дизайнит агент, почему бы ему не делать это сразу в коде? Какой смысл в лишнем слое сегодня?
@devspotting
👍9🔥1
Недавно анонсировал свой мастер-класс «От вайбкодера к контекст-инженеру» на CodeFest в Новосибирске.
Теперь есть повод встретиться с читателями из Питера — в июне на Saint TeamLead Conf расскажу про «От хайпа к культуре: нанимаем ИИ в компанию» с точки зрения руководителя.
Кто-нибудь планирует посетить? Давайте знакомиться вживую!
Теперь есть повод встретиться с читателями из Питера — в июне на Saint TeamLead Conf расскажу про «От хайпа к культуре: нанимаем ИИ в компанию» с точки зрения руководителя.
Кто-нибудь планирует посетить? Давайте знакомиться вживую!
👍9🔥2🥰1
This media is not supported in your browser
VIEW IN TELEGRAM
TRIBE v2
Одна запрещенная организация пошла еще дальше в своем лютейшем экстремизме и научилась предсказывать вашу реакцию на любой контент.
А чтобы этим бесовским изобретением могли пользоваться сразу все экстремисты мира , они опубликовали модель, код и подробную научную работу.
TRIBE v2 — симулятор мозговой активности на основе fMRI-данных, способный к zero-shot предсказаниям реакции на визуальные и аудиальные стимулы для новых людей и языков.
Открытие важно для науки, медицины и моего завтрашнего поста, но, конечно, использовать будут в первую очередь маркетологи, чтобы у нас совсем не осталось шансов прекратить скроллить алгоритмические ленты, и политики (потому что они тоже маркетологи).
Как считаете, есть ли грань между качественным контентом и нейробиологическим манипулированием?
@devspotting
Одна запрещенная организация пошла еще дальше в своем лютейшем экстремизме и научилась предсказывать вашу реакцию на любой контент.
TRIBE v2 — симулятор мозговой активности на основе fMRI-данных, способный к zero-shot предсказаниям реакции на визуальные и аудиальные стимулы для новых людей и языков.
Открытие важно для науки, медицины и моего завтрашнего поста, но, конечно, использовать будут в первую очередь маркетологи, чтобы у нас совсем не осталось шансов прекратить скроллить алгоритмические ленты, и политики (потому что они тоже маркетологи).
Как считаете, есть ли грань между качественным контентом и нейробиологическим манипулированием?
@devspotting
👍9🔥2😱1
Исследуем границы возможностей нейросетей. Первоапрельская часть про юмор.
Шутка ли — первого апреля пишу в Телегу.
Конечно, было бы гораздо смешнее, если бы сегодня запретили парковочный мессенджер. Впрочем, хватает и новостей, что опсосы будут брать дополнительную оплату за международный трафик в международной сети интернет.
Вообще-то я стендапер, а бизнес и программирование — так, для души.
Так что я, разумеется, исследовал возможности LLM для генерации шуток. Ничего смешного!
Почему нейросети не умеют в юмор
LLM уже вполне в состоянии объяснить, в чем прикол, но не в состоянии придумывать шутки сами.
INB4: нет, это не skill issue, настройка температуры не помогает. Не помогает даже промпт «ты гениальный стендапер, король постиронии и мастер сарказма».
Это не останавливает разных иноагентов от попыток использовать ChatGPT, но такие эксперименты — только людей смешить.
Юмор глубоко субъективен, контекстуален и строится на сложной игре ожиданий, эмпатии и культурного бэкграунда.
Мало того, что непонятно, как скорить результат (что одному асессору смешно, то стендаперу — баян), так еще и остаются все те же проблемы, по которым нейронки не справляются с поэзией:
* токены лишают LLM слуха, что критично для каламбуров. Мой самый любимый мне рассказал когда-то Дима @dimaom: «каламбур (а телом бел)»
* модели стремятся к статистически наиболее вероятному продолжению, а суть панча — в сломе ожидания.
На эту тему есть достаточно много исследований и экспериментов. Из свежего — Quipslop от Theo (open-source проект, где одни модели придумывают панчи, а другие модели и люди их оценивают) и исследование Алексея Тихонова на основе полученных данных. Спойлер: Gemini справляется лучше остальных как по мнению людей, так и по версии других нейронок.
Так научатся ли нейронки шутить в конце концов?
Я склонен считать, что таки да:
1. Можно обучить специализированные модели
2. По-настоящему мультимодальные модели могут решить проблему с восприятием звучания и подачей
3. Я не зря вчера рассказал про TRIBE V2 — LLM сможет использовать виртуальную модель мозга в качестве абсолютного, масштабируемого и объективного «оценщика». Вместо того чтобы спрашивать человека «Смешно ли это?», сеть будет напрямую смотреть, вызывает ли сгенерированный контент активацию в центрах удовольствия симулированного мозга.
Ну хорошо, в будущем ржака, а что же делать сейчас?
В книгах про написание шуток вам расскажут, что весь юмор работает по одной схеме и чтобы его сочинять, можно использовать стандартный алгоритм и «подводящие упражнения» (конкретные шаги могут чуть отличаться от автора к автору, но общий смысл у всех совпадает).
Так вот, сегодняшние нейронки вполне в состоянии нагенерить «запчастей»: придумать сетап, извлечь из него ключевые темы, сгенерировать к ним ассоциации и анти-ассоциации, поскорить эти ассоциации, подобрать омонимы, придумать неочевидные аналогии.
Не знаю, насколько это действительно поможет, но пропаганда других стимуляторов вдохновения нынче запрещена.
Перестанет ли быть смешной шутка, если вы узнаете, что ее сочинила нейронка?
@devspotting
Шутка ли — первого апреля пишу в Телегу.
Конечно, было бы гораздо смешнее, если бы сегодня запретили парковочный мессенджер. Впрочем, хватает и новостей, что опсосы будут брать дополнительную оплату за международный трафик в международной сети интернет.
Вообще-то я стендапер, а бизнес и программирование — так, для души.
Так что я, разумеется, исследовал возможности LLM для генерации шуток. Ничего смешного!
Почему нейросети не умеют в юмор
LLM уже вполне в состоянии объяснить, в чем прикол, но не в состоянии придумывать шутки сами.
INB4: нет, это не skill issue, настройка температуры не помогает. Не помогает даже промпт «ты гениальный стендапер, король постиронии и мастер сарказма».
Это не останавливает разных иноагентов от попыток использовать ChatGPT, но такие эксперименты — только людей смешить.
Юмор глубоко субъективен, контекстуален и строится на сложной игре ожиданий, эмпатии и культурного бэкграунда.
Мало того, что непонятно, как скорить результат (что одному асессору смешно, то стендаперу — баян), так еще и остаются все те же проблемы, по которым нейронки не справляются с поэзией:
* токены лишают LLM слуха, что критично для каламбуров. Мой самый любимый мне рассказал когда-то Дима @dimaom: «каламбур (а телом бел)»
* модели стремятся к статистически наиболее вероятному продолжению, а суть панча — в сломе ожидания.
На эту тему есть достаточно много исследований и экспериментов. Из свежего — Quipslop от Theo (open-source проект, где одни модели придумывают панчи, а другие модели и люди их оценивают) и исследование Алексея Тихонова на основе полученных данных. Спойлер: Gemini справляется лучше остальных как по мнению людей, так и по версии других нейронок.
Так научатся ли нейронки шутить в конце концов?
Я склонен считать, что таки да:
1. Можно обучить специализированные модели
2. По-настоящему мультимодальные модели могут решить проблему с восприятием звучания и подачей
3. Я не зря вчера рассказал про TRIBE V2 — LLM сможет использовать виртуальную модель мозга в качестве абсолютного, масштабируемого и объективного «оценщика». Вместо того чтобы спрашивать человека «Смешно ли это?», сеть будет напрямую смотреть, вызывает ли сгенерированный контент активацию в центрах удовольствия симулированного мозга.
Ну хорошо, в будущем ржака, а что же делать сейчас?
В книгах про написание шуток вам расскажут, что весь юмор работает по одной схеме и чтобы его сочинять, можно использовать стандартный алгоритм и «подводящие упражнения» (конкретные шаги могут чуть отличаться от автора к автору, но общий смысл у всех совпадает).
Так вот, сегодняшние нейронки вполне в состоянии нагенерить «запчастей»: придумать сетап, извлечь из него ключевые темы, сгенерировать к ним ассоциации и анти-ассоциации, поскорить эти ассоциации, подобрать омонимы, придумать неочевидные аналогии.
Не знаю, насколько это действительно поможет, но пропаганда других стимуляторов вдохновения нынче запрещена.
Перестанет ли быть смешной шутка, если вы узнаете, что ее сочинила нейронка?
@devspotting
👍10🔥3❤1
Qwen3.6-Plus — топовая модель бесплатно
Alibaba выкатила Qwen3.6-Plus и сразу предоставила её бесплатно на OpenRouter — можно подключить в Claude Code, OpenClaw, Pi, Cursor или любой другой OpenAI-совместимый инструмент.
Модель заточена под агентные задачи. Утверждается, что особенно хороша для фронтенд-разработки. Контекстное окно — 1М токенов.
Что по приборам
- SWE-bench Verified (реальные задачи из GitHub-репозиториев): 78.8% — на уровне или выше Claude 4.5 Sonnet и GPT-5
- GPQA (задачи аспирантского уровня по физике, химии, биологии): 90.4% — топ-SOTA на момент релиза
Из интересного: модель поддерживает
Важный момент: бесплатный тир на OpenRouter означает, что данные промптов идут на дообучение модели.
Кто-нибудь уже пробовал? Как вам?
@devspotting
Alibaba выкатила Qwen3.6-Plus и сразу предоставила её бесплатно на OpenRouter — можно подключить в Claude Code, OpenClaw, Pi, Cursor или любой другой OpenAI-совместимый инструмент.
Модель заточена под агентные задачи. Утверждается, что особенно хороша для фронтенд-разработки. Контекстное окно — 1М токенов.
Что по приборам
- SWE-bench Verified (реальные задачи из GitHub-репозиториев): 78.8% — на уровне или выше Claude 4.5 Sonnet и GPT-5
- GPQA (задачи аспирантского уровня по физике, химии, биологии): 90.4% — топ-SOTA на момент релиза
Из интересного: модель поддерживает
preserve_thinking — контекст цепочки рассуждений сохраняется между вызовами. Для агентных пайплайнов это важно: не нужно каждый раз «разогревать» её заново.Важный момент: бесплатный тир на OpenRouter означает, что данные промптов идут на дообучение модели.
Кто-нибудь уже пробовал? Как вам?
@devspotting
🔥11👍2😁2
Когда подорожают токены?
В комментариях в этом канале и среди коллег часто звучит теория, что вот сейчас ушлые корпораты подсадят всех на иглу дешевого инференса, а потом (когда нас заменят на нейронки), ка-а-а-ак поднимут цены!
Предлагаю по случаю пятницы обсудить эту перспективку.
Самый популярный аргумент звучит так: подписки дотируются, чтобы захватить рынок и подсадить. И это правда. Исследователь под ником she-llac выяснил: Claude Max ($200/мес) дает эквивалент API вплоть до $3 600+ в месяц при теплом кэше. Claude Pro ($20) — в 16–37 раз дешевле, чем платить по API. То есть да — лаборатории сейчас банчат нейро-стафф по дешману.
Дальше — парадокс Джевонса: чем дешевле ресурс, тем больше его потребляют. Дешевые токены порождают новые SaaS, агентные пайплайны и прочие сценарии использования — спрос растет быстрее, чем падает цена. В результате у компаний появляется возможность для поднятия цен.
Наконец, более сложные модели объективно дороже, а дальнейшее масштабирование требует железа на порядки больше — квадратичный рост вычислений ради линейного прироста качества.
И что же? Остается срочно навайбкодить себе единорога, пока лавочка не закрылась?
Почему я в это не верю
Для начала такой факт: с 2023 по 2026 год цена за токен упала в 1000+ раз. GPT-4 стоил $30/60 за 1M токенов — сегодня Qwen3.5 или Gemma 3n дают сопоставимые возможности за $0.02–0.03. И тенденция скорее ускоряется:
- Железо — H100 → Blackwell → Rubin: каждое поколение дает 2–3x токенов/доллар. HBM4 поднимает утилизацию чипов до 90%.
- Альтернативные чипы — TPU, специализированный AI-silicon: Midjourney уже сэкономил $16M/год, просто сменив железо.
- Алгоритмы — дистилляция снижает затраты в 10–100x, модели становятся меньше и умнее одновременно. TurboQuant, придуманный для оптимизации KV-кэша, в сообществе уже пробуют применять для сжатия весов.
- Инфраструктура — batch API дает скидку 50%, кэширование контекста режет реальные расходы в разы. Stateless/elastic инференс убивает idle-costs.
Общий тренд: снижение цены на порядок ежегодно — быстрее, чем в PC или интернете в эпоху доткома.
Открытые модели и локальный инференс
Уже сейчас на пусть и недешевом, но все еще бытовом железе можно запустить Gemma 4, Nemotron, gpt-oss и целый зоопарк от китайских лабораторий.
Судя по всему, к моменту, когда пессимисты ожидают повышения цен, на средних ноутбуках можно будет запускать модели уровня Claude Sonnet 4.5.
Конкуренция между OpenAI, Anthropic, Google, DeepSeek и прочими китайцами — структурная. Ни один из них не может поднять цены, не потеряв рынок. А с открытыми весами у корпоративных пользователей появляется полноценная альтернатива.
В конце концов, на интернет ведь тоже всех подсадили, но мы спокойно берем безлимитные мобильные пакеты и смотрим 4k-видео в метро (не в Москве, конечно, откуда тут мобильный интернет в 2026?).
Так что я ожидаю, что для бытовых задач мы получим модели в разы мощнее нынешних SOTA за пренебрежительно дешевую подписку, а для промышленного использования стоимость токенов будет иметь примерно такое же значение, как сейчас стоимость трафика для SaaS-компаний — да, петабайты стоят денег, но это точно не фактор, который определяет финмодель.
Разубедите?
@devspotting
В комментариях в этом канале и среди коллег часто звучит теория, что вот сейчас ушлые корпораты подсадят всех на иглу дешевого инференса, а потом (когда нас заменят на нейронки), ка-а-а-ак поднимут цены!
Предлагаю по случаю пятницы обсудить эту перспективку.
Самый популярный аргумент звучит так: подписки дотируются, чтобы захватить рынок и подсадить. И это правда. Исследователь под ником she-llac выяснил: Claude Max ($200/мес) дает эквивалент API вплоть до $3 600+ в месяц при теплом кэше. Claude Pro ($20) — в 16–37 раз дешевле, чем платить по API. То есть да — лаборатории сейчас банчат нейро-стафф по дешману.
Дальше — парадокс Джевонса: чем дешевле ресурс, тем больше его потребляют. Дешевые токены порождают новые SaaS, агентные пайплайны и прочие сценарии использования — спрос растет быстрее, чем падает цена. В результате у компаний появляется возможность для поднятия цен.
Наконец, более сложные модели объективно дороже, а дальнейшее масштабирование требует железа на порядки больше — квадратичный рост вычислений ради линейного прироста качества.
И что же? Остается срочно навайбкодить себе единорога, пока лавочка не закрылась?
Почему я в это не верю
Для начала такой факт: с 2023 по 2026 год цена за токен упала в 1000+ раз. GPT-4 стоил $30/60 за 1M токенов — сегодня Qwen3.5 или Gemma 3n дают сопоставимые возможности за $0.02–0.03. И тенденция скорее ускоряется:
- Железо — H100 → Blackwell → Rubin: каждое поколение дает 2–3x токенов/доллар. HBM4 поднимает утилизацию чипов до 90%.
- Альтернативные чипы — TPU, специализированный AI-silicon: Midjourney уже сэкономил $16M/год, просто сменив железо.
- Алгоритмы — дистилляция снижает затраты в 10–100x, модели становятся меньше и умнее одновременно. TurboQuant, придуманный для оптимизации KV-кэша, в сообществе уже пробуют применять для сжатия весов.
- Инфраструктура — batch API дает скидку 50%, кэширование контекста режет реальные расходы в разы. Stateless/elastic инференс убивает idle-costs.
Общий тренд: снижение цены на порядок ежегодно — быстрее, чем в PC или интернете в эпоху доткома.
Открытые модели и локальный инференс
Уже сейчас на пусть и недешевом, но все еще бытовом железе можно запустить Gemma 4, Nemotron, gpt-oss и целый зоопарк от китайских лабораторий.
Судя по всему, к моменту, когда пессимисты ожидают повышения цен, на средних ноутбуках можно будет запускать модели уровня Claude Sonnet 4.5.
Конкуренция между OpenAI, Anthropic, Google, DeepSeek и прочими китайцами — структурная. Ни один из них не может поднять цены, не потеряв рынок. А с открытыми весами у корпоративных пользователей появляется полноценная альтернатива.
В конце концов, на интернет ведь тоже всех подсадили, но мы спокойно берем безлимитные мобильные пакеты и смотрим 4k-видео в метро (не в Москве, конечно, откуда тут мобильный интернет в 2026?).
Так что я ожидаю, что для бытовых задач мы получим модели в разы мощнее нынешних SOTA за пренебрежительно дешевую подписку, а для промышленного использования стоимость токенов будет иметь примерно такое же значение, как сейчас стоимость трафика для SaaS-компаний — да, петабайты стоят денег, но это точно не фактор, который определяет финмодель.
Разубедите?
@devspotting
👍20🔥4😁1
🍿 #WatchAndVibe. Выпуск 7.
В сегодняшнем выпуске интервью Джека Дорси (создателя Твиттера и Block) и Рулофа Боты о том, как Джек видит будущее компаний, где на смену иерархии приходит ИИ.
https://www.youtube.com/watch?v=YTVSwOY19Qs
Поводом для разговора стали изменения в Block и статья Джека «From Hierarchy to Intelligence» — про поиск оптимальной системы управления от Римской империи и исследований МакКинзи до отказа от иерархии в пользу нейросетей.
Главная задача привычной корпоративной иерархии — управление потоками информации: вся цепочка менеджеров передает информацию от рядовых сотрудников к руководству и обратно — белковый MapReduce.
Дорси считает, что в современных компаниях, вместо того чтобы полагаться на людей для передачи информации по цепочке, можно использовать ИИ. В результате каждый сотрудник — от CEO до аналитика — получает возможность напрямую «общаться» с интеллектом компании, задавать вопросы и получать доступ ко всему контексту работы организации.
В результате управленческая структура упраздняется, и на смену ей приходят три базовые роли:
1. IC (Individual Contributor — индивидуальный контрибьютор / строитель): это инженеры, дизайнеры, продавцы — те, кто непосредственно создает продукт. Благодаря AI-агентам один такой специалист теперь может выполнять объем работы, который раньше требовал целой команды. *Ключевые и незаменимые человеческие навыки здесь: креативность, вкус и здравый смысл*.
2. DRI (Directly Responsible Individual — непосредственно ответственный): человек, отвечающий за конечный результат для клиента. Он формирует стратегию и собирает команду из IC для решения конкретной задачи. *Главные навыки: ответственность и умение добиваться результата*.
3. Играющий тренер: это роль, заменяющая традиционных менеджеров. Тренер развивает навыки других людей, но делает это не через указания, а на собственном примере, выполняя работу вместе с командой. Это не структура подчинения, а скорее временное назначение. *Ключевые навыки: эмпатия, коучинг и развитие человеческого потенциала*.
Дорси убежден, что топ-менеджмент (включая его самого) должен уметь совмещать все три роли.
Помимо вопросов про изменение структуры управления ведущий расспросил Джека о том, как быть CEO. Среди советов — практика 10-дневных ретритов безмолвной медитации.
Приятного просмотра!
@devspotting
В сегодняшнем выпуске интервью Джека Дорси (создателя Твиттера и Block) и Рулофа Боты о том, как Джек видит будущее компаний, где на смену иерархии приходит ИИ.
https://www.youtube.com/watch?v=YTVSwOY19Qs
Поводом для разговора стали изменения в Block и статья Джека «From Hierarchy to Intelligence» — про поиск оптимальной системы управления от Римской империи и исследований МакКинзи до отказа от иерархии в пользу нейросетей.
Главная задача привычной корпоративной иерархии — управление потоками информации: вся цепочка менеджеров передает информацию от рядовых сотрудников к руководству и обратно — белковый MapReduce.
Дорси считает, что в современных компаниях, вместо того чтобы полагаться на людей для передачи информации по цепочке, можно использовать ИИ. В результате каждый сотрудник — от CEO до аналитика — получает возможность напрямую «общаться» с интеллектом компании, задавать вопросы и получать доступ ко всему контексту работы организации.
В результате управленческая структура упраздняется, и на смену ей приходят три базовые роли:
1. IC (Individual Contributor — индивидуальный контрибьютор / строитель): это инженеры, дизайнеры, продавцы — те, кто непосредственно создает продукт. Благодаря AI-агентам один такой специалист теперь может выполнять объем работы, который раньше требовал целой команды. *Ключевые и незаменимые человеческие навыки здесь: креативность, вкус и здравый смысл*.
2. DRI (Directly Responsible Individual — непосредственно ответственный): человек, отвечающий за конечный результат для клиента. Он формирует стратегию и собирает команду из IC для решения конкретной задачи. *Главные навыки: ответственность и умение добиваться результата*.
3. Играющий тренер: это роль, заменяющая традиционных менеджеров. Тренер развивает навыки других людей, но делает это не через указания, а на собственном примере, выполняя работу вместе с командой. Это не структура подчинения, а скорее временное назначение. *Ключевые навыки: эмпатия, коучинг и развитие человеческого потенциала*.
Дорси убежден, что топ-менеджмент (включая его самого) должен уметь совмещать все три роли.
Помимо вопросов про изменение структуры управления ведущий расспросил Джека о том, как быть CEO. Среди советов — практика 10-дневных ретритов безмолвной медитации.
Приятного просмотра!
@devspotting
YouTube
Jack Dorsey: Every Company Can Now Be a Mini-AGI
Jack Dorsey (Block CEO) and Roelof Botha (Sequoia partner and Block board member) join to discuss a bold claim they wrote about recently: the traditional corporate hierarchy isn't just inefficient — it's obsolete. Jack made one of the toughest calls in recent…
🔥10👍1
И бонусная подборка от Аркадия IT ХудРука — уж больно мне льстит быть в одном списке с Вадимом Макишвили! 🙂
Telegram
IT ХудРук
Заметки руководителя инженерной команды про руководство, технологии, программистов, про успехи и трудности, про творчество и ремесло.
👍5
Forwarded from IT ХудРук
Подборка контента на выходные для вдохновения
* 36 / Вадим Макишвили
Выдержанный коньяк! Пересматриваю, кажется, уже в третий раз. Как для разработчиков, так и для менеджеров. Если вы спикер, то это еще и отличный урок по публичным выступлениям. Если зайдет, то есть продолжение (42).
* There and back again, или Нужно ли становиться руководителем / Виталий Харисов, Владимир Гриненко
Отличный гайд для начинающих руководителей, но подойдет и тем, кто хочет двигаться дальше.
* Что на самом деле важно в разработке? / Владимир Гриненко
Для тех, кто ищет смыслы. И не только в разработке.
Напишите в коменты, что из этого отзывается
* 36 / Вадим Макишвили
Выдержанный коньяк! Пересматриваю, кажется, уже в третий раз. Как для разработчиков, так и для менеджеров. Если вы спикер, то это еще и отличный урок по публичным выступлениям. Если зайдет, то есть продолжение (42).
Формула оценки проекта: первоначальная оценка проекта, умноженная на половину длины окружности, плюс две недели
* There and back again, или Нужно ли становиться руководителем / Виталий Харисов, Владимир Гриненко
Отличный гайд для начинающих руководителей, но подойдет и тем, кто хочет двигаться дальше.
Если совсем заскучали по программированию, то решать задачи, которые ставит бизнес, можно не только с помощью написания кода, но и в том числе "программируя на людях".
* Что на самом деле важно в разработке? / Владимир Гриненко
Для тех, кто ищет смыслы. И не только в разработке.
Мудрый руководитель - это не только тот, с кем в кайф работать, но и иногда человек, который может спасти вам жизнь буквально.
Напишите в коменты, что из этого отзывается
❤9🤔2
Воскресный #digest №7
На этой неделе в канале вышли:
• Анонсы мастер-класса «От вайбкодера к контекст-инженеру» и разборошной «Использование AI в SDLC» на CodeFest, а также доклада «От хайпа к культуре: нанимаем ИИ в компанию» на Saint TeamLead Conf.
• Рассуждение, нужна ли вообще Figma.
• Обзор модели TRIBE v2, которая предсказывает реакции мозга на разные типы контента.
• Первоапрельское исследование про границы возможностей LLM в юморе. Спойлер: шутить нейросети пока не умеют, но лучше всех это не умеет Gemini.
Ранее в этой же рубрике мы обсуждали генерацию изображений, написание стихов и создание книг.
• Новость про релиз модели Qwen3.6-Plus, заточенной под агентные пайплайны и доступной бесплатно на OpenRouter.
• Спор о том, когда лаборатории подсадят всех на иглу и поднимут цены на токены. Мой тейк — инференс продолжит дешеветь.
• Очередной #WatchAndVibe, в котором создатель Twitter Джек Дорси рассказывает об отказе от менеджеров в пользу ИИ и «играющих тренеров». И бонусная подборка от IT ХудРука с докладами про устройство команд и смыслы в разработке.
Что вам больше всего откликнулось? О чем написать на следующей неделе?
@devspotting
На этой неделе в канале вышли:
• Анонсы мастер-класса «От вайбкодера к контекст-инженеру» и разборошной «Использование AI в SDLC» на CodeFest, а также доклада «От хайпа к культуре: нанимаем ИИ в компанию» на Saint TeamLead Conf.
• Рассуждение, нужна ли вообще Figma.
• Обзор модели TRIBE v2, которая предсказывает реакции мозга на разные типы контента.
• Первоапрельское исследование про границы возможностей LLM в юморе. Спойлер: шутить нейросети пока не умеют, но лучше всех это не умеет Gemini.
Ранее в этой же рубрике мы обсуждали генерацию изображений, написание стихов и создание книг.
• Новость про релиз модели Qwen3.6-Plus, заточенной под агентные пайплайны и доступной бесплатно на OpenRouter.
• Спор о том, когда лаборатории подсадят всех на иглу и поднимут цены на токены. Мой тейк — инференс продолжит дешеветь.
• Очередной #WatchAndVibe, в котором создатель Twitter Джек Дорси рассказывает об отказе от менеджеров в пользу ИИ и «играющих тренеров». И бонусная подборка от IT ХудРука с докладами про устройство команд и смыслы в разработке.
Что вам больше всего откликнулось? О чем написать на следующей неделе?
@devspotting
❤8🔥3👍2
GLM-5.1: новая SOTA-модель для разработки
Сегодня вышла GLM-5.1 от z.ai, которая бьет всех в SWE-Bench Pro и обгоняет Opus 4.6 в Terminal Bench 2.0. Контекстное окно — 200k.
Думаю, в этот раз первенство китайцев продлится недолго — со дня на день ждем ответочку от OpenAI и Anthropic. Но GLM — открытая модель, веса доступны на HuggingFace.
Авторы хвастаются, что новая модель не деградирует при длительных размышлениях. С одной стороны, звучит здорово, с другой — если высокие результаты на бенчмарках получились именно благодаря дополнительному времени (и токенам), то на практике использование может оказаться не таким уж приятным.
Отдельно интересно наблюдать, как меняется привычная схема: в Штатах релизится очередной флагман, спустя несколько месяцев выходит уступающая по бенчам модель из Поднебесной, а условные Антропики жалуются, что их дистиллировали в нарушение лицензии. Теперь списывать успех китайцев на дистилляцию станет посложнее.
Модель уже доступна в подписке и через API, в том числе через OpenRouter по цене $1 за 1M входящих и $3.2 за 1M исходящих токенов (то есть в 5/7.8 раз дешевле Clude Opus 4.6).
@devspotting
Сегодня вышла GLM-5.1 от z.ai, которая бьет всех в SWE-Bench Pro и обгоняет Opus 4.6 в Terminal Bench 2.0. Контекстное окно — 200k.
Думаю, в этот раз первенство китайцев продлится недолго — со дня на день ждем ответочку от OpenAI и Anthropic. Но GLM — открытая модель, веса доступны на HuggingFace.
Авторы хвастаются, что новая модель не деградирует при длительных размышлениях. С одной стороны, звучит здорово, с другой — если высокие результаты на бенчмарках получились именно благодаря дополнительному времени (и токенам), то на практике использование может оказаться не таким уж приятным.
Отдельно интересно наблюдать, как меняется привычная схема: в Штатах релизится очередной флагман, спустя несколько месяцев выходит уступающая по бенчам модель из Поднебесной, а условные Антропики жалуются, что их дистиллировали в нарушение лицензии. Теперь списывать успех китайцев на дистилляцию станет посложнее.
Модель уже доступна в подписке и через API, в том числе через OpenRouter по цене $1 за 1M входящих и $3.2 за 1M исходящих токенов (то есть в 5/7.8 раз дешевле Clude Opus 4.6).
@devspotting
🔥15👍2❤1
Фронтендеры — недопрограммисты
В Яндексе есть несколько внутренних социальных сетей: «рабочий инструмент» Этушка и анонимная имиджборда Ячан.
Сообщения на Ячане иногда бывают настолько... кхм... яркими, что в какой-то момент пришлось настроить автоматическое удаление старых постов, а в шапке повесить напоминание, что «существует техническая возможность деанонимизации».
Любое упоминание фронтенда на Ячане практически гарантированно приводит к комментариям в духе заголовка этого поста (впрочем, в былые времена главные срачи в Этушке тоже были вокруг фронтенда).
Но вот что интересно: уже и дедушка Кнут, и многие другие корифеи программирования делятся кейсами, когда нейронка помогла решить задачу, над которой они бились неделями (а иногда и годами), а Мифос и вовсе нашла дыры там, где не справились ни тысячи штатных безопасников, ни программы баг-баунти на миллионы долларов.
При этом Codex App разгоняет кулеры моего макбука из-за банального спиннера, в Алтасе не работают
Так что пока я пишу пост про то, как все-таки получить от нейронки хороший фронтенд, предлагаю пятничный вопрос-размышление: как так-то?
PS: иллюстрация к посту сгенерирована Нанобананой на основе Катечкиной нетленки из Этушки (генерация бесконечно хуже оригинала).
@devspotting
В Яндексе есть несколько внутренних социальных сетей: «рабочий инструмент» Этушка и анонимная имиджборда Ячан.
Сообщения на Ячане иногда бывают настолько... кхм... яркими, что в какой-то момент пришлось настроить автоматическое удаление старых постов, а в шапке повесить напоминание, что «существует техническая возможность деанонимизации».
Любое упоминание фронтенда на Ячане практически гарантированно приводит к комментариям в духе заголовка этого поста (впрочем, в былые времена главные срачи в Этушке тоже были вокруг фронтенда).
Но вот что интересно: уже и дедушка Кнут, и многие другие корифеи программирования делятся кейсами, когда нейронка помогла решить задачу, над которой они бились неделями (а иногда и годами), а Мифос и вовсе нашла дыры там, где не справились ни тысячи штатных безопасников, ни программы баг-баунти на миллионы долларов.
При этом Codex App разгоняет кулеры моего макбука из-за банального спиннера, в Алтасе не работают
cmd + C / cmd + V на русской раскладке, а Claude Cowork люто лагает при большой истории сообщений, жрёт 2.5 ядра CPU на рендеринг интерфейса и часто крашится с потерей артефактов вывода (и это при том, что Мифос доступен команде уже больше месяца).Так что пока я пишу пост про то, как все-таки получить от нейронки хороший фронтенд, предлагаю пятничный вопрос-размышление: как так-то?
PS: иллюстрация к посту сгенерирована Нанобананой на основе Катечкиной нетленки из Этушки (генерация бесконечно хуже оригинала).
@devspotting
👍15🔥7😁2
🍿 #WatchAndVibe. Выпуск 8.
Давно здесь не было рекомендаций на русском. Так что сегодня рекомендую сразу два интервью с Андреем Бреславом (создателем Kotlin) про CodeSpeak — новый язык для spec-driven development здорового человека:
* Новый язык программирования для эпохи ИИ
* Ответы на вопросы по мотивам первого интервью
CodeSpeak создается для решения актуальных проблем разработки с ИИ-агентами: описывать компактные спеки, которые бы люди действительно читали, и которые бы позволяли избегать противоречий и не терять интенты пользователя.
Разработка сейчас в стадии альфа-превью, но кое-что уже можно попробовать.
Выглядит как следующий (и достаточно большой) шаг в развитии идей OpenSpec, которым я сейчас активно пользуюсь.
В интервью много размышлений о том, куда идет разработка и о задачах, которые предстоит решить.
Интересно? Написать про мои эксперименты с CodeSpeak?
@devspotting
Давно здесь не было рекомендаций на русском. Так что сегодня рекомендую сразу два интервью с Андреем Бреславом (создателем Kotlin) про CodeSpeak — новый язык для spec-driven development здорового человека:
* Новый язык программирования для эпохи ИИ
* Ответы на вопросы по мотивам первого интервью
CodeSpeak создается для решения актуальных проблем разработки с ИИ-агентами: описывать компактные спеки, которые бы люди действительно читали, и которые бы позволяли избегать противоречий и не терять интенты пользователя.
Разработка сейчас в стадии альфа-превью, но кое-что уже можно попробовать.
Выглядит как следующий (и достаточно большой) шаг в развитии идей OpenSpec, которым я сейчас активно пользуюсь.
В интервью много размышлений о том, куда идет разработка и о задачах, которые предстоит решить.
Интересно? Написать про мои эксперименты с CodeSpeak?
@devspotting
👍13❤4🤩1
Вайб-дизайн
Если еще несколько месяцев назад абсолютное большинство одностраничных сайтов были на Тильде, то сейчас интернет захватывают вайб-лендосы.
Даже предпоследние версии моделей ваншотом создают адаптивные лендинги с анимацией, интерактивом, поддержкой светлой и темной темы, подбором релевантных иконок-метафор, по пути додумывая недостающий контент за вас, а при необходимости — придумают всё от названия до тарифной сетки и отзывов благодарных пользователей (или сходят для уточнения фактуры в интернет). На всё про всё от открытия крышки ноута до деплоя нужно минут 10. На дневную бесплатную квоту какого-нибудь Квена можно сгенерить примерно пару десятков таких сайтов.
Те, кто активно пользуется ИИ-агентами, моментально отличают такую генеренку.
А дальше начинается странное.
Сгенерированные одностраничники объявляются «нейрослопом», и начинается борьба за оригинальность. Массово появляются скиллы для агентов, главная задача которых — заставить LLM сделать максимально непохоже.
Это само по себе забавно: генерация практически бесплатна и как только любой подобный скилл становится сколько-нибудь популярным, его использование автоматически лишается смысла.
Но это ладно. Без всяких нейронок в зависимости от текущей моды массовый веб-дизайн то добавляет эффект мокрого пола, то скевоморфизм, то минимализм, то и вовсе жидкие стекла (прости, Стив, мы всё про...).
Проблема в том, что в битве с одинаковостью нейронного дизайна теряется задача.
Модели генерят одностраничники плюс-минус одинаково именно потому, что в обучающей выборке такого было больше всего. А больше всего такого было, потому что несколько поколений маркетологов на многочисленных АБ-тестах выяснили, что так работает (конечно, я не говорю про дурацкую анимацию по ховеру или скроллу, я про выбор и последовательность разделов, лейауты и типографику со стандартными шрифтами).
Когда вместо привычной сетки на пользователя вываливают супероригинальную раскладку — это требует лишних когнитивных усилий. Когда вместо системных или гугловых шрифтов подключают кастомщину, пользователь на медленном соединении вынужден несколько секунд смотреть в пустую страницу.
Если задача лендинга — продать сепульки, важно, чтобы было понятно, что цена — хорошая, есть рассрочка, сепульки свежие, а доставка бесплатная. И чтобы кнопка «Купить» была на видном месте. Нейронки по умолчанию именно так и сделают. А скиллы «прекрасного дизайна» с большой вероятностью просадят конверсию.
Так что же, всем делать одинаковые сайты?
Не обязательно. В следующих постах я расскажу, как добиться оригинальности без ущерба здравому смыслу, но точно не нужно ожидать, что, поставив какой-нибудь
А что вы думаете про вайб-дизайн?
@devspotting
Если еще несколько месяцев назад абсолютное большинство одностраничных сайтов были на Тильде, то сейчас интернет захватывают вайб-лендосы.
Даже предпоследние версии моделей ваншотом создают адаптивные лендинги с анимацией, интерактивом, поддержкой светлой и темной темы, подбором релевантных иконок-метафор, по пути додумывая недостающий контент за вас, а при необходимости — придумают всё от названия до тарифной сетки и отзывов благодарных пользователей (или сходят для уточнения фактуры в интернет). На всё про всё от открытия крышки ноута до деплоя нужно минут 10. На дневную бесплатную квоту какого-нибудь Квена можно сгенерить примерно пару десятков таких сайтов.
Те, кто активно пользуется ИИ-агентами, моментально отличают такую генеренку.
А дальше начинается странное.
Сгенерированные одностраничники объявляются «нейрослопом», и начинается борьба за оригинальность. Массово появляются скиллы для агентов, главная задача которых — заставить LLM сделать максимально непохоже.
Это само по себе забавно: генерация практически бесплатна и как только любой подобный скилл становится сколько-нибудь популярным, его использование автоматически лишается смысла.
Но это ладно. Без всяких нейронок в зависимости от текущей моды массовый веб-дизайн то добавляет эффект мокрого пола, то скевоморфизм, то минимализм, то и вовсе жидкие стекла (прости, Стив, мы всё про...).
Проблема в том, что в битве с одинаковостью нейронного дизайна теряется задача.
Модели генерят одностраничники плюс-минус одинаково именно потому, что в обучающей выборке такого было больше всего. А больше всего такого было, потому что несколько поколений маркетологов на многочисленных АБ-тестах выяснили, что так работает (конечно, я не говорю про дурацкую анимацию по ховеру или скроллу, я про выбор и последовательность разделов, лейауты и типографику со стандартными шрифтами).
Когда вместо привычной сетки на пользователя вываливают супероригинальную раскладку — это требует лишних когнитивных усилий. Когда вместо системных или гугловых шрифтов подключают кастомщину, пользователь на медленном соединении вынужден несколько секунд смотреть в пустую страницу.
Если задача лендинга — продать сепульки, важно, чтобы было понятно, что цена — хорошая, есть рассрочка, сепульки свежие, а доставка бесплатная. И чтобы кнопка «Купить» была на видном месте. Нейронки по умолчанию именно так и сделают. А скиллы «прекрасного дизайна» с большой вероятностью просадят конверсию.
Так что же, всем делать одинаковые сайты?
Не обязательно. В следующих постах я расскажу, как добиться оригинальности без ущерба здравому смыслу, но точно не нужно ожидать, что, поставив какой-нибудь
taste-skill, действительно получите что-то хорошее.А что вы думаете про вайб-дизайн?
@devspotting
👍11❤3🔥1
Воскресный #digest №8
На этой неделе в канале вышли:
• Обзор GLM-5.1 — новой SOTA-модели от
• Пятничный вопрос про парадокс нашей индустрии.
• Интервью с Андреем Бреславом в субботней рубрике #WatchAndVibe про CodeSpeak — новый язык программирования для эпохи ИИ.
• Рассуждение про вайб-дизайн: в борьбе за оригинальность теряется смысл.
Лайк & Шер!
@devspotting
На этой неделе в канале вышли:
• Обзор GLM-5.1 — новой SOTA-модели от
z.ai, которая бьёт всех в SWE-Bench Pro и обгоняет Opus 4.6 в Terminal Bench 2.0. Открытые веса, 200k-контекст, цена в 5–8 раз ниже Claude. В комментариях — рефералка от Витали, которая даст скидку при регистрации. Ждем ответочку от западных лабораторий.• Пятничный вопрос про парадокс нашей индустрии.
• Интервью с Андреем Бреславом в субботней рубрике #WatchAndVibe про CodeSpeak — новый язык программирования для эпохи ИИ.
• Рассуждение про вайб-дизайн: в борьбе за оригинальность теряется смысл.
Лайк & Шер!
@devspotting
👏6👍4🎉1👌1
Бесплатные слоны!
На OpenRouter очередная бесплатная стелс-модель: Elephant Alpha.
100 миллиардов параметров, 256K контекста. Утверждается, что не уступает по производительности аналогичным моделям, но при этом чрезвычайно эффективная с точки зрения использования токенов. Отлично справляется с автодополнением кода, отладкой, обработкой документов и работой с легковесными агентами.
На всякий напоминаю, что по условию использования промпты и ответы могут логироваться и использоваться в дообучении, так что #ЭкономимТокены без NDA.
Интересно, чья это моделька на этот раз. По времени пора бы уже появиться DeepSeek v4, но они обычно релизятся напрямую.
@devspotting
На OpenRouter очередная бесплатная стелс-модель: Elephant Alpha.
100 миллиардов параметров, 256K контекста. Утверждается, что не уступает по производительности аналогичным моделям, но при этом чрезвычайно эффективная с точки зрения использования токенов. Отлично справляется с автодополнением кода, отладкой, обработкой документов и работой с легковесными агентами.
На всякий напоминаю, что по условию использования промпты и ответы могут логироваться и использоваться в дообучении, так что #ЭкономимТокены без NDA.
Интересно, чья это моделька на этот раз. По времени пора бы уже появиться DeepSeek v4, но они обычно релизятся напрямую.
@devspotting
👍10🔥4❤3
Говорить мало. Экономить токен.
Сегодня в рубрике #ЭкономимТокены хочу поговорить про завирусившийся скилл caveman.
Он заставляет модель отвечать как пещерный человек: без вводных конструкций и прочей воды, сохраняя техническую суть. По бенчмаркам самого проекта экономия на выходных токенах составляет 22–87% в зависимости от типа запроса (важно: это именно ответы модели, не входящий контекст).
Из примера в README:
🗣️ Клод по умолчанию (69 токенов):
🪨 Caveman-Клод (19 токенов):
Ответ тот же. Слов в 3,5 раза меньше.
Есть три уровня краткости (`lite` /
Установка
А еще @veged сделал форк с поддержкой русского языка. Серега, не хочешь для еще большей экономии удалить англоязычную часть и переименовать скилл в «Чехов» или «Ильяхов»? :)
Что говорит наука
Авторы ссылаются на мартовскую статью с arxiv «Brevity Constraints Reverse Performance Hierarchies in Language Models».
Исследователи проверили 31 модель (от 0.5B до 405B параметров) на 1485 задачах из пяти разных бенчмарков. Обнаружили странный эффект: на ~8% задач большие модели стабильно проигрывали маленьким — причём с разрывом в 28 процентных пунктов.
Причина оказалась структурной: крупные модели при подробных ответах начинают «переобъяснять» — дообрабатывают правильный промежуточный результат и в итоге приходят к неверному финальному. Мозг большой, но болтает лишнее.
Когда тем же большим моделям добавили ограничение «отвечай кратко» — точность выросла на 26 процентных пунктов, а разрыв с маленькими сократился до двух третей. На математике и точных науках иерархия перевернулась полностью: большие модели получили преимущество в 8–16 пунктов там, где раньше проигрывали.
Иными словами: brevity constraint — это не просто «меньше токенов», это потенциально «более правильный ответ».
Но есть нюанс
На мой взгляд, нет смысла ради краткости тащить целый отдельный скилл с кучей режимов вместо того, чтобы добавить одну строку прямо в
С точки зрения механики это ровно то же самое — brevity constraint через системный промпт.
@devspotting
Сегодня в рубрике #ЭкономимТокены хочу поговорить про завирусившийся скилл caveman.
Он заставляет модель отвечать как пещерный человек: без вводных конструкций и прочей воды, сохраняя техническую суть. По бенчмаркам самого проекта экономия на выходных токенах составляет 22–87% в зависимости от типа запроса (важно: это именно ответы модели, не входящий контекст).
Из примера в README:
🗣️ Клод по умолчанию (69 токенов):
The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle...
🪨 Caveman-Клод (19 токенов):
New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.
Ответ тот же. Слов в 3,5 раза меньше.
Есть три уровня краткости (`lite` /
full / ultra`) и неожиданный режим `文言文 — сжатие на классическом китайском. Отдельные скиллы: /caveman-commit (коммиты в духе «fix: null user L42») и /caveman-review (ревью одной строкой). Ещё есть caveman-compress — утилита для сжатия самого CLAUDE.md, чтобы меньше тратить уже на входе.Установка
npx skills add JuliusBrussee/cavemanА еще @veged сделал форк с поддержкой русского языка. Серега, не хочешь для еще большей экономии удалить англоязычную часть и переименовать скилл в «Чехов» или «Ильяхов»? :)
Что говорит наука
Авторы ссылаются на мартовскую статью с arxiv «Brevity Constraints Reverse Performance Hierarchies in Language Models».
Исследователи проверили 31 модель (от 0.5B до 405B параметров) на 1485 задачах из пяти разных бенчмарков. Обнаружили странный эффект: на ~8% задач большие модели стабильно проигрывали маленьким — причём с разрывом в 28 процентных пунктов.
Причина оказалась структурной: крупные модели при подробных ответах начинают «переобъяснять» — дообрабатывают правильный промежуточный результат и в итоге приходят к неверному финальному. Мозг большой, но болтает лишнее.
Когда тем же большим моделям добавили ограничение «отвечай кратко» — точность выросла на 26 процентных пунктов, а разрыв с маленькими сократился до двух третей. На математике и точных науках иерархия перевернулась полностью: большие модели получили преимущество в 8–16 пунктов там, где раньше проигрывали.
Иными словами: brevity constraint — это не просто «меньше токенов», это потенциально «более правильный ответ».
Но есть нюанс
На мой взгляд, нет смысла ради краткости тащить целый отдельный скилл с кучей режимов вместо того, чтобы добавить одну строку прямо в
AGENTS.md:Отвечай максимально сжато, но без потери смысла. Никогда не сокращай код, сообщения о безопасности или необратимых действиях, или если я запутался.
С точки зрения механики это ровно то же самое — brevity constraint через системный промпт.
@devspotting
👍16🔥5❤1🙏1
Claude Opus 4.7: Педантизм, зрение и скрытая инфляция
Anthropic выкатили нового флагмана.
Это, конечно, еще не Мифос, но на сегодня это самая мощная модель на рынке.
* Маниакальное следование инструкциям. Opus 4.7 стал на голову сильнее всех на рынке в том, чтобы делать ровно то, что написано. Антропики в очередной раз предупреждают, что старые хаки в промптах, чтобы заставить прежние модели делать то, что нужно, а не то, что они сами хотели — перестали работать.
* Лазерная коррекция зрения. Разрешение для картинок на входе выросло более чем в три раза. Генерация интерфейсов по референсам должна стать гораздо точнее.
* Новый токенайзер. Формальный прайс за миллион токенов остался прежним ($5/$25), однако сам движок поменяли. Тот же самый промпт теперь бьется на 1.0–1.35x большее число токенов. То есть по факту инференс стал чуть дороже.
Доступно уже везде.
Кто уже успел потестить? Делитесь, как вам!
@devspotting
Anthropic выкатили нового флагмана.
Это, конечно, еще не Мифос, но на сегодня это самая мощная модель на рынке.
* Маниакальное следование инструкциям. Opus 4.7 стал на голову сильнее всех на рынке в том, чтобы делать ровно то, что написано. Антропики в очередной раз предупреждают, что старые хаки в промптах, чтобы заставить прежние модели делать то, что нужно, а не то, что они сами хотели — перестали работать.
* Лазерная коррекция зрения. Разрешение для картинок на входе выросло более чем в три раза. Генерация интерфейсов по референсам должна стать гораздо точнее.
* Новый токенайзер. Формальный прайс за миллион токенов остался прежним ($5/$25), однако сам движок поменяли. Тот же самый промпт теперь бьется на 1.0–1.35x большее число токенов. То есть по факту инференс стал чуть дороже.
Доступно уже везде.
Кто уже успел потестить? Делитесь, как вам!
@devspotting
🔥13❤3👌1