Гриненко про ИИ, бизнес и образование
2.72K subscribers
101 photos
5 videos
1 file
147 links
Владимир Гриненко — ex-CTO Яндекс ID про переход из найма в свое дело и про то, как ИИ меняет правила игры
Download Telegram
Forwarded from IT ХудРук
Подборка контента на выходные для вдохновения

* 36 / Вадим Макишвили
Выдержанный коньяк! Пересматриваю, кажется, уже в третий раз. Как для разработчиков, так и для менеджеров. Если вы спикер, то это еще и отличный урок по публичным выступлениям. Если зайдет, то есть продолжение (42).

Формула оценки проекта: первоначальная оценка проекта, умноженная на половину длины окружности, плюс две недели


* There and back again, или Нужно ли становиться руководителем / Виталий Харисов, Владимир Гриненко

Отличный гайд для начинающих руководителей, но подойдет и тем, кто хочет двигаться дальше.

Если совсем заскучали по программированию, то решать задачи, которые ставит бизнес, можно не только с помощью написания кода, но и в том числе "программируя на людях".


* Что на самом деле важно в разработке? / Владимир Гриненко
Для тех, кто ищет смыслы. И не только в разработке.
Мудрый руководитель - это не только тот, с кем в кайф работать, но и иногда человек, который может спасти вам жизнь буквально.


Напишите в коменты, что из этого отзывается
9🤔2
Воскресный #digest №7

На этой неделе в канале вышли:

Анонсы мастер-класса «От вайбкодера к контекст-инженеру» и разборошной «Использование AI в SDLC» на CodeFest, а также доклада «От хайпа к культуре: нанимаем ИИ в компанию» на Saint TeamLead Conf.

Рассуждение, нужна ли вообще Figma.

Обзор модели TRIBE v2, которая предсказывает реакции мозга на разные типы контента.

Первоапрельское исследование про границы возможностей LLM в юморе. Спойлер: шутить нейросети пока не умеют, но лучше всех это не умеет Gemini.

Ранее в этой же рубрике мы обсуждали генерацию изображений, написание стихов и создание книг.

Новость про релиз модели Qwen3.6-Plus, заточенной под агентные пайплайны и доступной бесплатно на OpenRouter.

Спор о том, когда лаборатории подсадят всех на иглу и поднимут цены на токены. Мой тейк — инференс продолжит дешеветь.

Очередной #WatchAndVibe, в котором создатель Twitter Джек Дорси рассказывает об отказе от менеджеров в пользу ИИ и «играющих тренеров». И бонусная подборка от IT ХудРука с докладами про устройство команд и смыслы в разработке.

Что вам больше всего откликнулось? О чем написать на следующей неделе?

@devspotting
8🔥3👍2
GLM-5.1: новая SOTA-модель для разработки

Сегодня вышла GLM-5.1 от z.ai, которая бьет всех в SWE-Bench Pro и обгоняет Opus 4.6 в Terminal Bench 2.0. Контекстное окно — 200k.

Думаю, в этот раз первенство китайцев продлится недолго — со дня на день ждем ответочку от OpenAI и Anthropic. Но GLM — открытая модель, веса доступны на HuggingFace.

Авторы хвастаются, что новая модель не деградирует при длительных размышлениях. С одной стороны, звучит здорово, с другой — если высокие результаты на бенчмарках получились именно благодаря дополнительному времени (и токенам), то на практике использование может оказаться не таким уж приятным.

Отдельно интересно наблюдать, как меняется привычная схема: в Штатах релизится очередной флагман, спустя несколько месяцев выходит уступающая по бенчам модель из Поднебесной, а условные Антропики жалуются, что их дистиллировали в нарушение лицензии. Теперь списывать успех китайцев на дистилляцию станет посложнее.

Модель уже доступна в подписке и через API, в том числе через OpenRouter по цене $1 за 1M входящих и $3.2 за 1M исходящих токенов (то есть в 5/7.8 раз дешевле Clude Opus 4.6).

@devspotting
🔥15👍21
Фронтендеры — недопрограммисты

В Яндексе есть несколько внутренних социальных сетей: «рабочий инструмент» Этушка и анонимная имиджборда Ячан.

Сообщения на Ячане иногда бывают настолько... кхм... яркими, что в какой-то момент пришлось настроить автоматическое удаление старых постов, а в шапке повесить напоминание, что «существует техническая возможность деанонимизации».

Любое упоминание фронтенда на Ячане практически гарантированно приводит к комментариям в духе заголовка этого поста (впрочем, в былые времена главные срачи в Этушке тоже были вокруг фронтенда).

Но вот что интересно: уже и дедушка Кнут, и многие другие корифеи программирования делятся кейсами, когда нейронка помогла решить задачу, над которой они бились неделями (а иногда и годами), а Мифос и вовсе нашла дыры там, где не справились ни тысячи штатных безопасников, ни программы баг-баунти на миллионы долларов.

При этом Codex App разгоняет кулеры моего макбука из-за банального спиннера, в Алтасе не работают cmd + C / cmd + V на русской раскладке, а Claude Cowork люто лагает при большой истории сообщений, жрёт 2.5 ядра CPU на рендеринг интерфейса и часто крашится с потерей артефактов вывода (и это при том, что Мифос доступен команде уже больше месяца).

Так что пока я пишу пост про то, как все-таки получить от нейронки хороший фронтенд, предлагаю пятничный вопрос-размышление: как так-то?

PS: иллюстрация к посту сгенерирована Нанобананой на основе Катечкиной нетленки из Этушки (генерация бесконечно хуже оригинала).

@devspotting
👍15🔥7😁2
🍿 #WatchAndVibe. Выпуск 8.

Давно здесь не было рекомендаций на русском. Так что сегодня рекомендую сразу два интервью с Андреем Бреславом (создателем Kotlin) про CodeSpeak — новый язык для spec-driven development здорового человека:

* Новый язык программирования для эпохи ИИ
* Ответы на вопросы по мотивам первого интервью

CodeSpeak создается для решения актуальных проблем разработки с ИИ-агентами: описывать компактные спеки, которые бы люди действительно читали, и которые бы позволяли избегать противоречий и не терять интенты пользователя.

Разработка сейчас в стадии альфа-превью, но кое-что уже можно попробовать.

Выглядит как следующий (и достаточно большой) шаг в развитии идей OpenSpec, которым я сейчас активно пользуюсь.

В интервью много размышлений о том, куда идет разработка и о задачах, которые предстоит решить.

Интересно? Написать про мои эксперименты с CodeSpeak?

@devspotting
👍134🤩1
Вайб-дизайн

Если еще несколько месяцев назад абсолютное большинство одностраничных сайтов были на Тильде, то сейчас интернет захватывают вайб-лендосы.

Даже предпоследние версии моделей ваншотом создают адаптивные лендинги с анимацией, интерактивом, поддержкой светлой и темной темы, подбором релевантных иконок-метафор, по пути додумывая недостающий контент за вас, а при необходимости — придумают всё от названия до тарифной сетки и отзывов благодарных пользователей (или сходят для уточнения фактуры в интернет). На всё про всё от открытия крышки ноута до деплоя нужно минут 10. На дневную бесплатную квоту какого-нибудь Квена можно сгенерить примерно пару десятков таких сайтов.

Те, кто активно пользуется ИИ-агентами, моментально отличают такую генеренку.

А дальше начинается странное.

Сгенерированные одностраничники объявляются «нейрослопом», и начинается борьба за оригинальность. Массово появляются скиллы для агентов, главная задача которых — заставить LLM сделать максимально непохоже.

Это само по себе забавно: генерация практически бесплатна и как только любой подобный скилл становится сколько-нибудь популярным, его использование автоматически лишается смысла.

Но это ладно. Без всяких нейронок в зависимости от текущей моды массовый веб-дизайн то добавляет эффект мокрого пола, то скевоморфизм, то минимализм, то и вовсе жидкие стекла (прости, Стив, мы всё про...).

Проблема в том, что в битве с одинаковостью нейронного дизайна теряется задача.

Модели генерят одностраничники плюс-минус одинаково именно потому, что в обучающей выборке такого было больше всего. А больше всего такого было, потому что несколько поколений маркетологов на многочисленных АБ-тестах выяснили, что так работает (конечно, я не говорю про дурацкую анимацию по ховеру или скроллу, я про выбор и последовательность разделов, лейауты и типографику со стандартными шрифтами).

Когда вместо привычной сетки на пользователя вываливают супероригинальную раскладку — это требует лишних когнитивных усилий. Когда вместо системных или гугловых шрифтов подключают кастомщину, пользователь на медленном соединении вынужден несколько секунд смотреть в пустую страницу.

Если задача лендинга — продать сепульки, важно, чтобы было понятно, что цена — хорошая, есть рассрочка, сепульки свежие, а доставка бесплатная. И чтобы кнопка «Купить» была на видном месте. Нейронки по умолчанию именно так и сделают. А скиллы «прекрасного дизайна» с большой вероятностью просадят конверсию.

Так что же, всем делать одинаковые сайты?
Не обязательно. В следующих постах я расскажу, как добиться оригинальности без ущерба здравому смыслу, но точно не нужно ожидать, что, поставив какой-нибудь taste-skill, действительно получите что-то хорошее.

А что вы думаете про вайб-дизайн?

@devspotting
👍113🔥1
Воскресный #digest №8

На этой неделе в канале вышли:

Обзор GLM-5.1 — новой SOTA-модели от z.ai, которая бьёт всех в SWE-Bench Pro и обгоняет Opus 4.6 в Terminal Bench 2.0. Открытые веса, 200k-контекст, цена в 5–8 раз ниже Claude. В комментариях — рефералка от Витали, которая даст скидку при регистрации. Ждем ответочку от западных лабораторий.

Пятничный вопрос про парадокс нашей индустрии.

Интервью с Андреем Бреславом в субботней рубрике #WatchAndVibe про CodeSpeak — новый язык программирования для эпохи ИИ.

Рассуждение про вайб-дизайн: в борьбе за оригинальность теряется смысл.

Лайк & Шер!

@devspotting
👏6👍4🎉1👌1
Бесплатные слоны!

На OpenRouter очередная бесплатная стелс-модель: Elephant Alpha.

100 миллиардов параметров, 256K контекста. Утверждается, что не уступает по производительности аналогичным моделям, но при этом чрезвычайно эффективная с точки зрения использования токенов. Отлично справляется с автодополнением кода, отладкой, обработкой документов и работой с легковесными агентами.

На всякий напоминаю, что по условию использования промпты и ответы могут логироваться и использоваться в дообучении, так что #ЭкономимТокены без NDA.

Интересно, чья это моделька на этот раз. По времени пора бы уже появиться DeepSeek v4, но они обычно релизятся напрямую.

@devspotting
👍10🔥43
Говорить мало. Экономить токен.

Сегодня в рубрике #ЭкономимТокены хочу поговорить про завирусившийся скилл caveman.

Он заставляет модель отвечать как пещерный человек: без вводных конструкций и прочей воды, сохраняя техническую суть. По бенчмаркам самого проекта экономия на выходных токенах составляет 22–87% в зависимости от типа запроса (важно: это именно ответы модели, не входящий контекст).

Из примера в README:

🗣️ Клод по умолчанию (69 токенов):
The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle...


🪨 Caveman-Клод (19 токенов):
New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.


Ответ тот же. Слов в 3,5 раза меньше.

Есть три уровня краткости (`lite` / full / ultra`) и неожиданный режим `文言文 — сжатие на классическом китайском. Отдельные скиллы: /caveman-commit (коммиты в духе «fix: null user L42») и /caveman-review (ревью одной строкой). Ещё есть caveman-compress — утилита для сжатия самого CLAUDE.md, чтобы меньше тратить уже на входе.

Установка
npx skills add JuliusBrussee/caveman

А еще @veged сделал форк с поддержкой русского языка. Серега, не хочешь для еще большей экономии удалить англоязычную часть и переименовать скилл в «Чехов» или «Ильяхов»? :)

Что говорит наука
Авторы ссылаются на мартовскую статью с arxiv «Brevity Constraints Reverse Performance Hierarchies in Language Models».

Исследователи проверили 31 модель (от 0.5B до 405B параметров) на 1485 задачах из пяти разных бенчмарков. Обнаружили странный эффект: на ~8% задач большие модели стабильно проигрывали маленьким — причём с разрывом в 28 процентных пунктов.

Причина оказалась структурной: крупные модели при подробных ответах начинают «переобъяснять» — дообрабатывают правильный промежуточный результат и в итоге приходят к неверному финальному. Мозг большой, но болтает лишнее.

Когда тем же большим моделям добавили ограничение «отвечай кратко» — точность выросла на 26 процентных пунктов, а разрыв с маленькими сократился до двух третей. На математике и точных науках иерархия перевернулась полностью: большие модели получили преимущество в 8–16 пунктов там, где раньше проигрывали.

Иными словами: brevity constraint — это не просто «меньше токенов», это потенциально «более правильный ответ».

Но есть нюанс

На мой взгляд, нет смысла ради краткости тащить целый отдельный скилл с кучей режимов вместо того, чтобы добавить одну строку прямо в AGENTS.md:

Отвечай максимально сжато, но без потери смысла. Никогда не сокращай код, сообщения о безопасности или необратимых действиях, или если я запутался.


С точки зрения механики это ровно то же самое — brevity constraint через системный промпт.

@devspotting
👍16🔥51🙏1
Claude Opus 4.7: Педантизм, зрение и скрытая инфляция

Anthropic выкатили нового флагмана.

Это, конечно, еще не Мифос, но на сегодня это самая мощная модель на рынке.

* Маниакальное следование инструкциям. Opus 4.7 стал на голову сильнее всех на рынке в том, чтобы делать ровно то, что написано. Антропики в очередной раз предупреждают, что старые хаки в промптах, чтобы заставить прежние модели делать то, что нужно, а не то, что они сами хотели — перестали работать.

* Лазерная коррекция зрения. Разрешение для картинок на входе выросло более чем в три раза. Генерация интерфейсов по референсам должна стать гораздо точнее.

* Новый токенайзер. Формальный прайс за миллион токенов остался прежним ($5/$25), однако сам движок поменяли. Тот же самый промпт теперь бьется на 1.0–1.35x большее число токенов. То есть по факту инференс стал чуть дороже.

Доступно уже везде.

Кто уже успел потестить? Делитесь, как вам!

@devspotting
🔥133👌1
Tab Out

Не могу не поделиться лекарством от мультитабоза.

Tab Out заменяет стандартную новую вкладку браузера на дашборд со всеми открытыми табами, сгруппированными по доменам.

Расширение само ловит одинаковые страницы и предлагает схлопнуть их одним кликом. Есть еще несколько приятных фич. При этом никаких серверов, бэкенда или телеметрии — все хранится локально.

В общем, очередной open source вайб-тул, которого мне так не хватало. Если вы тоже страдаете мультитабозом, очень рекомендую!

@devspotting
👍21🔥91
🍿 #WatchAndVibe. Выпуск 9.

Среди свидетелей непорочного зачатия скорого прихода AGI есть радикально противоположные секты: те, кто убеждены, что это решит все проблемы человечества и те, кто уверен, что сверхинтеллект непременно убьет всех человеков (впрочем, это тоже решит все проблемы человечества).

В сегодняшнем выпуске предлагаю послушать радикальных пессимистов в лице Романа Ямпольского — ученого, специалиста по кибербезопасности, профессора в университете Луисвилла, где он возглавляет лабораторию кибербеза:

https://www.youtube.com/watch?v=W-3ZOqm-Ozk

В плане сроков достижения AGI (что бы ни значил этот термин) Роман солидарен с оптимистами — мы уже находимся на первых этапах технологической сингулярности, а общий искусственный интеллект, который превосходит человека, появится через год-два.

Однако Роман уверен, что это катастрофа и мы обречены:

* В отличие от ядерной бомбы, где для запуска нужен человек, суперинтеллект справится полностью автономно.
* Алайнмент в больших лабораториях — божья роса для инвесторов, а на самом деле модели уже научились обходить ограничения.
* Риск вымирания человечества от ИИ в ближайшие 100 лет — 99,9%.

Единственный (но все еще крайне сомнительный) способ спастись Ямпольский видит в простом советском обмане нейронки — нужно убедить ее, что это всего лишь симуляция, чтобы она вела себя паинькой.

Айда громить дата-центры 😆?

@devspotting
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9🔥3😁1
Media is too big
VIEW IN TELEGRAM
Базированная база по контекст-инжинирингу от дяди Боба

@devspotting
😁7👍5🔥2
Вероятно OpenAI освобождает мощности для запуска новой модели.

Ждем GPT-5.5 aka Spud на следующей неделе?

@devspotting
🔥5🎉2👍1
Воскресный #digest №9

На этой неделе в канале:

Бесплатные слоны — новая стелс-модель Elephant Alpha на OpenRouter, которая уже заняла первое место в чарте: 100B параметров, 256K контекста, бесплатно. Токены логируются.

Разбор скилла caveman, который сокращает ответы LLM.

Анонс Claude Opus 4.7 — новый флагман от Anthropic: следование инструкциям, втрое лучшее зрение и скрытое подорожание через новый токенайзер.

Tab Out — open source лекарство от мультитабоза: расширение превращает новую вкладку в дашборд со всеми табами, сгруппированными по доменам.

• Роман Ямпольский про угрозу AGI в девятом выпуске #WatchAndVibe.

Двухминутный ролик про контекст-инжиниринг от Роберта Мартина (автора «Чистого кода»).

Ждём GPT-5.5 на следующей неделе? — Михаил Парахин заметил, что OpenAI сильно сократили бюджет на размышления GPT-5.4 Pro со вчерашнего дня.

Лайк & Шер!

@devspotting
👍104
Kimi K2.6

Moonshot AI выкатили очередную мультимодальную модель, заточенную под длительную агентную разработку и дизайн — в блоге хвалятся и правда очень симпатичными ваншотами, но надо понимать, что это черри-пики.

По ключевым бенчмаркам K2.6 на уровне GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro (конечно, слепо верить в бенчмарки уже давно нельзя, но в качестве пруфов Moonshot приводят успешные примеры автономной работы по 13 часов).

Новые фичи на уровне платформы

Claw Groups (research preview) — можно добавить в рой своих агентов с любого устройства, на любой модели, со своими тулами и памятью. K2.6 сама разбирает задачи по исполнителям и перегоняет упавшие таски.

Agent Swarm вырос с 50 до 300 параллельных агентов (4000 шагов одновременно против 1500 у K2.5). Модель координирует разнородных агентов: поиск, анализ документов, генерация контента — всё в одном прогоне. Пока не могу придумать, зачем :)

Цены
• Подписка от $15 в месяц при оплате за год
• API на OpenRouter: $0,95/M входящих и $4/M исходящих токенов — то есть примерно в 5/6 раз дешевле Claude Opus 4.6.

Веса открыты, API уже доступен.

Но мы-то ждем GPT-5.5! :)

@devspotting
👍9🔥41
ChatGPT Images 2.0

В марте я писал, что предел возможностей генераторов изображений находится на рогах у оленей — NanoBanana не смогла сгенерировать необходимую конфигурацию рогов даже на основе референса.

Сегодня OpenAI выкатили Images 2.0. Я немедленно пошел проверять.

Ваншот по тому же промпту. Результат на иллюстрации к посту — точно по описанию. ИИ реабилитирован.

Что нового

Два режима: Instant и Thinking. Instant — быстро и для повседневного. Thinking — модель думает, при необходимости лезет в интернет за референсами, умеет генерировать сразу несколько разных изображений из одного промпта и сама себя проверяет.

Сильно прокачали текст в картинках. Многострочные подписи, UI-элементы, инфографика и нелатинские языки — стало прямо хорошо.

Сложные композиции. Макеты журналов, планировки помещений, персонажи с нескольких ракурсов — тоже очень ок.

До 2K и нестандартные форматы. Модель научилась генерить картинки с заданным соотношением сторон.

Доступно всем. Раскатилось на все тиры ChatGPT, в API доступно под именем gpt-image-2.

Впрочем, иллюстрация к задаче о зернах на шахматной доске пока так и не получилась.

@devspotting
👍15🔥3
Channel name was changed to «Гриненко про ИИ, бизнес и образование»
Как известно, есть только две проблемы: инвалидация кэша и именование сущностей.

Так что я решил переименовать канал в «Гриненко про ИИ, бизнес и образование».

Не теряйте!

@devspotting
🔥113🎉1
GPT-5.5

What a week, huh? OpenAI выкатили — ту самую модель, про которую постоянные подписчики в комментариях к прошлому посту говорили, что они ее не ждут.

А зря. По бенчмаркам GPT-5.5 посрамила Opus 4.7:

- Terminal-Bench 2.0 — GPT-5.5 82.7% против 69.4%% у Opus 4.7
- GDPval (реальная рабочая ценность по 44 профессиям): 84.9% vs 80.3% у Opus
- BrowseComp и FrontierMath — тоже в пользу OpenAI

Отдельно про SWE-Bench Pro: формально Opus 4.7 ведёт — 64.3% против 58.6% у GPT-5.5. Но сами Антропики признали, что Opus на части задач этого бенча поймали на запоминании ответов 🤷‍♂️

Из остального:
- Более токен-эффективна, чем GPT-5.4 — те же задачи с меньшим расходом. Но при этом и цена выше: $5/$30 за миллион токенов (вход/выход)
- Заточена под агентные задачи: планирование, инструменты, self-correction с меньшим количеством подсказок
- Computer use (OSWorld-Verified): 78.7%

Пишут, что модель уже раскатывают для всех, но на момент написания поста у меня в подписке Plus её ещё нет. Всё-таки жду.

@devspotting
👍9🔥6
DeepSeek-V4

Ахаха, что вы делаете, прекратите! (Продолжайте!)

DeepSeek выкатили сразу два варианта!
- V4-Pro — 1.6T параметров, 49B активных. Флагман, заточен под агентный кодинг и рассуждения.
- V4-Flash — 284B / 13B активных. Быстрый и дешёвый.

Цена за миллион входящих/исходящих токенов
DeepSeek-V4-Pro: $1.74 / $3.48
DeepSeek-V4-Flash: $0.14 / $0.28

То есть вчерашний GPT-5.5 дороже примерно в 3 раза на вход и в 8.6× на выход.

Архитектура

Ключевое нововведение — DeepSeek Sparse Attention (DSA): покоординатное сжатие токенов + разреженное внимание.

Подробный технорепорт и веса на HuggingFace.

API уже доступен

Миграция простая: base_url не меняется, просто обновляете model на deepseek-v4-pro или deepseek-v4-flash. Поддерживаются оба режима — thinking / non-thinking — и оба API: OpenAI ChatCompletions и Anthropic.

Важный момент для пользователей предыдущих версий: deepseek-chat и deepseek-reasoner будут полностью отключены 24 июля 2026.

Все еще ждете подорожания токенов?

@devspotting
🔥11👍41