Поляков считает: AI, код и кейсы
6.59K subscribers
514 photos
105 videos
333 links
Пишу про AI, вайбкодинг и кейсы применения. Связаться: @polyakovbest
Download Telegram
Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра

Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.

🏆 Агентный бенчмарк: вровень с фронтиром

Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%).

И это всего лишь 27 миллиардов параметров. Локально. Без интернета.

🐌 А теперь цена

Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.

Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:

📐 макс. ток/с = пропускная способность памяти / размер активных весов


Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки.

Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести.

👁 Видео: описывает отлично, понимает плохо

Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно.

🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео.

🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно.

🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены.


Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным.

🗺️ Копии интерфейсов по скриншоту — прекрасно

Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу.

В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях.

🧾 Что в итоге, где затестить и сколько стоит

Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально.

Для интерактива терпения не хватит. Поэтому тут выручают провайдеры:

• У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 67 ток/сек
• На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает
• Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с.

Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает?

----

Поляков считает — AI, код и кейсы
🔥134👍2
Вайбкодер и вайб-дизайнер — это разные люди, и жаль

Весной я писал, что профессия верстальщика сайтов попала под давление: сайт теперь собирается за вечер. Три месяца спустя я насмотрелся на результаты и хочу вам пожаловаться.

🍪 Кейс 1. Баннер согласий, который съел статистику

Клиенту переделали сайт. Фирменная черта исполнителя — выкатывать сразу в продакшен: сайт ему проверил GPT-5.6 Sol и сказал, что всё хорошо.

Сразу после выкладки — деградация трафика в Метрике. Оказалось, модель заодно провела терраформирование сайта под европейскую юрисдикцию (GDPR): повесила плашку согласий, которая блокирует Метрику и Calltouch до акцепта.

Проблемы две.

1️⃣ Юридическая. Требование «не грузить счётчики до согласия» — это ePrivacy и GDPR. В 152-ФЗ такой нормы нет, но есть пункт про «явное согласие», который всё портит, разбираемся.

У бизнеса есть законный интерес: считать окупаемость рекламы, отбивать спам, понимать, где ломается сайт. При этом мы не звоним человеку без спроса и не отдаём аудиторию третьим лицам.

Я предлагаю рассуждать про куки с позиции борьбы со спамом: капча — тоже кука. Заблокировали сторонние — тонем в спаме.

Формулировка, которая закрывает вопрос:

🔑 Мы используем файлы cookie, Яндекс Метрику и Yandex SmartCaptcha для анализа посещаемости, противодействия спаму и улучшения работы сайта. Обработка осуществляется в целях реализации законных интересов оператора на основании п. 7 ч. 1 ст. 6 Федерального закона № 152-ФЗ «О персональных данных». Подробнее — в Политике обработки персональных данных.


2️⃣ Денежная. Счётчик молчит — автостратегии Директа недосчитываются конверсий и учатся на обрубленной выборке. Результат — падает доходность бизнеса. Аналогичным образом происходит изменение статистических факторов ранжирования в органическом поиске.

🧩 Кейс 2. site-config.js вместо констант

Здесь я был принимающей стороной. Попросил фрилансера вынести телефон, цену и прочее в строковые константы лендинга, чтобы правки не растекались по файлам.

Получил site-config.js, который подменяет захардкоженные значения в готовом HTML. Вместо одного места для правок стало два. Хотели уменьшить сложность, получилось, что Codex её увеличил. Забыл поправить исходник — в поиске висит старая цена, потому что роботы поисковых систем не любят java script.

Отдельно про «робот всё отрендерит». Рендерят так неохотно, что капец.

Google ставит JS-страницы во вторую волну: у неприоритетных доменов очередь тянется неделями. Яндекс держит рендеринг в бете с 2022 года.

LLM-краулеры не рендерят в принципе. Vercel и MERJ разобрали 500+ млн запросов GPTBot — ни одного исполнения JS.
Цена, подставленная джаваскриптом, для ChatGPT и Perplexity просто не существует.

🎯 К чему я веду

В обоих кейсах код рабочий и симпатичный. Всё выглядит в высшей мере профессионоально и красиво.
Сломалось понимание контекста: чья юрисдикция, откуда приходят деньги, кто читает страницу кроме человека.

Вайбкодер разбирается в логике продукта и умеет остановить агента. Вайб-дизайнер оценивает результат по картинке и похвале от модели.



📚 Где брать базу

Сейчас будет похоже на нативку, но я правда вспоминал этот курс за несколько дней до анонса. В прошлом году моя жена Даша прошла «Вайбкодинг на максималках» Глеба Кудрявцева.

Первые занятия там — про то, что такое программа, язык программирования, зачем нужны Git и Docker. И только потом «давайте сделаем прикольно». Ровно позавчера рассказывая про шишки набитые об красивые лендинги я вспоминал курс Глеба и говорил, как круто, что он учит базе и объясняет подводные камни.

Очень кстати, что очередной поток стартует 20 августа. Есть бесплатная первая лекция, а промокод GLEB3 даёт ещё 10% сверх цены на лендинге.

А теперь предлагаю повспоминать косяки, которые вам принесли GPT Sol, вкатившийся вайбкодер или разработчик. Пишите в комментариях.

----

Поляков считает — AI, код и кейсы
👍9😐95🔥4😁2
Yandex Ecom Open Air: Алиса, агентная коммерция и ставка Яндекса

Сходил на Yandex Ecom Open Air. Агентная коммерция — главный лейтмотив дня, про неё говорили и с большой сцены, делали прогнозы. Был ещё обзор Яндекс.КИТ, но мы с вами интересуемся агентами, поэтому поговорим про неё.

🤦🏻‍♂️ Отдельная ирония: заявку, в которой я указал, что связан с рынком ИИ, на этот фестиваль отклонили.

1️⃣ Что показали по Алисе AI

Ассистенту обещают прокачать память о пользователе, ризонинг и вызов инструментов. Идеальный сценарий, чтобы агент искал за пределами пользовательского запроса. Предлагал лучшие альтернативы. Надеюсь это не будет очередным засильем нестрогого рекламного таргетинга.

2️⃣ Модели у экосистем

Со сцены прозвучало наблюдение: на западе модели принадлежат независимым компаниям, в России — экосистемам. Отдельным пунктом шёл большой объём данных о пользователях как преимущество.

Для качества подбора данные и правда преимущество. Вопрос в том, кому принадлежит ассистент и нет ли конфликта интересов между пользователем и владельцем агента. Для качества подбора данные и правда преимущество.

Яндекс владеет моделью, Маркетом, платежом, доставкой и рассрочкой. Маркировка рекламы уже есть, а вот маркировку агентных рекомендаций пока не придумали, получаем вопрос доверия.

🤔 Моё скромное мнение

Наблюдая за стараниями Яндекса в популяризации агентного екома, ваш покорный слуга уверен в популяризации потребления через ИИ-агентов. Разработчикам MCP стоит готовиться к поддержке всех возможных протоколов, так как у нас уже есть большое разнообразие идей от разных игороков. Скромные прогнозы Data Insights — 11% российского екома у агентов к 2032 году.

Что думаете вы? Уже делали покупки через ИИ-агентов? Доверили бы выбор каких-нибудь товаров ИИ?

----

Поляков считает — AI, код и кейсы
5👍4🕊1🙊1
Был нормальный SEO-спец, познакомился с ИИ, стал ужасным

У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика. За 2 года органический трафик стал x3 вообще без переделки структуры (с 2 800 до 10 000 визитов). Поэтому считаю их молодцами и периодически хвалю.

🔗 Сложный сайт: metallik.ru

Ребята реально поняли, что сайт нестандартный, придумали, как ему добавить «магазинности», создали категории тегов товарам, информационные статьи: у сайта растёт Share of Voice. Короче, всё вроде красиво.

Но вот к ним в руки попал ИИ (я узнал его по первой строчке в техзадании по антитезе) — и понеслась.

🤦🏻‍♂️ На что я прифигел

Прилетает рекомендация на доработку раздела профнастила, а там просто лендинг на 26 экранов с отзывами и энциклопедией профлиста.

Выглядит всё нормально и профессионально. Прям убедительно. Таблица, в которой написано, что людям нужны отзывы, они их ищут (лол, что в Гугле) и надо такой экран обязательно. Рядом ответы на главные вопросы, в том числе про снеговые нагрузки. Это очень важно для качественного сайта. И таких 26 экранов.

Но прикол в том, что нормальный человек под каждым пунктом будет спорить:

— 26 экранов на листинге товаров? Это же дофигища, вы куда?
— Отзывы у себя на сайте продавец модерирует сам, доверия к ним меньше, чем к карточке в Яндексе. Отдельный экран под них на листинге — точно не первое, что стоит делать.
— Ребята, у нас вообще-то интернет-магазин на шаблонах, а не лендинг: для нас исправление одной категории профлиста эквивалентно исправлению всех категорий на сайте.


И можно продолжать долго. Короче, проблема ИИ в продвижении в том, что он представляет собой кальку всего успешного успеха, который только можно встретить.

⚠️ На моём опыте есть ряд сфер, где ИИ ужасен

Раньше я любил говорить, что у ИИ есть три области, в которых он из коробки очень плох:

1. ИИ-агенты
2. Реклама в интернете
3. Сайты на PHP

Теперь к списку хочется добавить SEO. В целом эти проблемы предсказуемы и легко объяснимы:

ИИ-агенты, способы их конфигурации, настройки и построение обвязок — это тема 2025–2026 годов. В интернете пока мало материалов на этот счёт, поэтому ИИ часто использует устаревшие идеи.

Реклама в интернете — достаточно старая отрасль, но вся состоит из материалов про успешный успех: как компания-подрядчик включила ретаргетинг/автостратегию/размещения у микроблогеров и какая-то метрика полетела.

Сайты на PHP и материалы, связанные с ними, полны примеров плохих экспериментов и неудачных решений.

SEO туда же. Ключевая мысль тут, что в таких областях надо дополнительно отгружать в ИИ свои знания и свою доменную экспертизу. Какие действия работают, что в рекламе хорошо, как мы пишем и делаем сайты на PHP. Не надеяться на то, что кто-то натренировал ИИ на идеальную рекламу. Не натренировал.

🚀 Сначала отгружаем свою экспертизу и уже на неё зовём ИИ

Прежде чем просить рекомендации, я кладу в контекст четыре вещи: как устроен проект, что физически нельзя поменять, что мы уже пробовали и с каким результатом, по каким правилам принимаем решения. Для «Металлик и Ко» второй пункт звучит буквально так: правка одной категории равна правке всех категорий сразу.

С таким брифом лендинг на 26 экранов просто не рождается. ИИ видит ограничение платформы и предлагает то, что можно раскатить на весь каталог, — а это как раз то, за что я хвалил ребят два года.

🎯 ИИ не знает вашу отрасль. Он знает, как о ней принято писать в интернете. Поэтому и сыпется ровно там, где публичные материалы состоят из кейсов «включили автостратегию — и всё полетело».


А у вас какая область, где ИИ из коробки выдаёт красивую чушь? И что вы кладёте в контекст, чтобы он перестал?

----

Поляков считает — AI, код и кейсы
👍125🔥2💯1
В канун возвращения пятичасовых лимитов Codex вышло интервью Тибо.

Конкретно в моем кейсе именно пятичасовые лимиты являются причиной вылета в экстра юз в Claude. В результате расходы на Антропик у меня больше 200 баксов. Так что ждём, что расходы на Codex тоже вылезут за пределы лимиты подписки.

UPD. Мне подсказывают, что введение пятичасовых лимитов касается только пользователей с подпиской плюс. Для Pro пока не включают.
3
Forwarded from НИИ ИИ
Вышло первое большое видеоинтервью с Тибо Соттио — тем самым человеком из OpenAI, который нажимает кнопку сброса лимитов Codex. Я сделал полный перевод и саммари:

Кратко о главном из разговора с Мэттью Берманом:

— Тибо пришёл в OpenAI из DeepMind, где за год до ChatGPT уже был внутренний чат-продукт, который Google побоялась выпускать. Его вывод: культура решает

— у OpenAI исследования и продукт проектируются вместе, а идеи доводятся до релиза очень быстро.

— Слияние ChatGPT и Codex не маркетинговый ход: будущие модели сами требуют объединения. Цель — персональный AGI с интерфейсом, который подстраивается под человека. «Вы и ваша мама будете пользоваться одним и тем же продуктом».

— Сбросы лимитов начались как компенсация за сбои, а не как акция. Решение не согласуется ни с маркетингом, ни с финансами: «я могу нажать кнопку, когда почувствую, что это правильно». И да, физическая кнопка существует.

— Luna подешевела на 80%, потому что фронтирные модели оптимизируют инфраструктуру, на которой сами работают. Тибо называет это формой рекурсивного самоулучшения. Скорость ответов за три месяца выросла примерно на 60%.

— Режим ultra fast (до 14× быстрее) внутри OpenAI выдают не всем: мощности резервируют для клиентов, а внутри он нужен при инцидентах. Через год-два такие скорости станут почти стандартом.

— «Через два-три месяца Codex покажется примитивным»: следующему поколению моделей тесен ноутбук — облачные агенты, параллельная работа, голос.

В статье — саммари подробнее и полный перевод всего интервью: от культуры OpenAI и конкуренции с Anthropic до паузы в обучении фронтирных моделей и СДВГ Тибо.

👉 Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод
🔥113👍3🥱1
Поляков считает: AI, код и кейсы
Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать. 🏆 Агентный бенчмарк: вровень с фронтиром Прогнал PAC1 — набор…
Qwen3.8-27B на DGX Spark: обогнал Sonnet 5 в PAC-1 и стал быстрее.

Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.

Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257

Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.

📏 Что по статистике

Автор приводит свои замеры:

llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с


Я решил что хочу 34 т/с и пошёл тестировать.

На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.

⚠️ Проблема с шиной никуда не девается

Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.

🔥 Прогнал PAC-1 и модель обошла Опус

Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.

Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.

😀 Забавно, что код на питоне генерируется быстрее кода на TypeScript (см. скриншоты)


🙋🏻‍♂️ А что по бизнес задачам?

У рекламных агентств есть неприятная задачка: отчётность по маркировке рекламы в ОРД. Нельзя сказать, что она прям сложгная, у меня давно есть скилл, который позволяет клод опусу создавать таблицы для загрузки.
Но в этот раз я отдал эту задачку агенту на Pi у которого под капотом был Qwen 3.8 27B, и он справился. Правда за 30 минут.

Кто уже тестил маленькие локальные модели на бизнес задачах? Как результаты?

----

Поляков считает — AI, код и кейсы
6👍4🔥3