Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра
Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.
🏆 Агентный бенчмарк: вровень с фронтиром
Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме
И это всего лишь 27 миллиардов параметров. Локально. Без интернета.
🐌 А теперь цена
Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.
Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:
Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки.
Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести.
👁 Видео: описывает отлично, понимает плохо
Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно.
🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео.
🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно.
Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным.
🗺️ Копии интерфейсов по скриншоту — прекрасно
Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу.
В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях.
🧾 Что в итоге, где затестить и сколько стоит
Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально.
Для интерактива терпения не хватит. Поэтому тут выручают провайдеры:
• У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 67 ток/сек
• На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает
• Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с.
Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает?
----
Поляков считает — AI, код и кейсы
Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.
🏆 Агентный бенчмарк: вровень с фронтиром
Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме
reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%).И это всего лишь 27 миллиардов параметров. Локально. Без интернета.
🐌 А теперь цена
Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.
Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:
📐 макс. ток/с = пропускная способность памяти / размер активных весов
Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки.
Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести.
👁 Видео: описывает отлично, понимает плохо
Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно.
🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео.
🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно.
🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены.
Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным.
🗺️ Копии интерфейсов по скриншоту — прекрасно
Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу.
В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях.
🧾 Что в итоге, где затестить и сколько стоит
Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально.
Для интерактива терпения не хватит. Поэтому тут выручают провайдеры:
• У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 67 ток/сек
• На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает
• Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с.
Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает?
----
Поляков считает — AI, код и кейсы
🔥13❤4👍2
Вайбкодер и вайб-дизайнер — это разные люди, и жаль
Весной я писал, что профессия верстальщика сайтов попала под давление: сайт теперь собирается за вечер. Три месяца спустя я насмотрелся на результаты и хочу вам пожаловаться.
🍪 Кейс 1. Баннер согласий, который съел статистику
Клиенту переделали сайт. Фирменная черта исполнителя — выкатывать сразу в продакшен: сайт ему проверил GPT-5.6 Sol и сказал, что всё хорошо.
Сразу после выкладки — деградация трафика в Метрике. Оказалось, модель заодно провела терраформирование сайта под европейскую юрисдикцию (GDPR): повесила плашку согласий, которая блокирует Метрику и Calltouch до акцепта.
Проблемы две.
1️⃣ Юридическая. Требование «не грузить счётчики до согласия» — это ePrivacy и GDPR. В 152-ФЗ такой нормы нет, но есть пункт про «явное согласие», который всё портит, разбираемся.
У бизнеса есть законный интерес: считать окупаемость рекламы, отбивать спам, понимать, где ломается сайт. При этом мы не звоним человеку без спроса и не отдаём аудиторию третьим лицам.
Я предлагаю рассуждать про куки с позиции борьбы со спамом: капча — тоже кука. Заблокировали сторонние — тонем в спаме.
Формулировка, которая закрывает вопрос:
2️⃣ Денежная. Счётчик молчит — автостратегии Директа недосчитываются конверсий и учатся на обрубленной выборке. Результат — падает доходность бизнеса. Аналогичным образом происходит изменение статистических факторов ранжирования в органическом поиске.
🧩 Кейс 2.
Здесь я был принимающей стороной. Попросил фрилансера вынести телефон, цену и прочее в строковые константы лендинга, чтобы правки не растекались по файлам.
Получил
Отдельно про «робот всё отрендерит». Рендерят так неохотно, что капец.
Google ставит JS-страницы во вторую волну: у неприоритетных доменов очередь тянется неделями. Яндекс держит рендеринг в бете с 2022 года.
LLM-краулеры не рендерят в принципе. Vercel и MERJ разобрали 500+ млн запросов GPTBot — ни одного исполнения JS.
Цена, подставленная джаваскриптом, для ChatGPT и Perplexity просто не существует.
🎯 К чему я веду
В обоих кейсах код рабочий и симпатичный. Всё выглядит в высшей мере профессионоально и красиво.
Сломалось понимание контекста: чья юрисдикция, откуда приходят деньги, кто читает страницу кроме человека.
📚 Где брать базу
Сейчас будет похоже на нативку, но я правда вспоминал этот курс за несколько дней до анонса. В прошлом году моя жена Даша прошла «Вайбкодинг на максималках» Глеба Кудрявцева.
Первые занятия там — про то, что такое программа, язык программирования, зачем нужны Git и Docker. И только потом «давайте сделаем прикольно». Ровно позавчера рассказывая про шишки набитые об красивые лендинги я вспоминал курс Глеба и говорил, как круто, что он учит базе и объясняет подводные камни.
Очень кстати, что очередной поток стартует 20 августа. Есть бесплатная первая лекция, а промокод GLEB3 даёт ещё 10% сверх цены на лендинге.
А теперь предлагаю повспоминать косяки, которые вам принесли GPT Sol, вкатившийся вайбкодер или разработчик. Пишите в комментариях.
----
Поляков считает — AI, код и кейсы
Весной я писал, что профессия верстальщика сайтов попала под давление: сайт теперь собирается за вечер. Три месяца спустя я насмотрелся на результаты и хочу вам пожаловаться.
🍪 Кейс 1. Баннер согласий, который съел статистику
Клиенту переделали сайт. Фирменная черта исполнителя — выкатывать сразу в продакшен: сайт ему проверил GPT-5.6 Sol и сказал, что всё хорошо.
Сразу после выкладки — деградация трафика в Метрике. Оказалось, модель заодно провела терраформирование сайта под европейскую юрисдикцию (GDPR): повесила плашку согласий, которая блокирует Метрику и Calltouch до акцепта.
Проблемы две.
1️⃣ Юридическая. Требование «не грузить счётчики до согласия» — это ePrivacy и GDPR. В 152-ФЗ такой нормы нет, но есть пункт про «явное согласие», который всё портит, разбираемся.
У бизнеса есть законный интерес: считать окупаемость рекламы, отбивать спам, понимать, где ломается сайт. При этом мы не звоним человеку без спроса и не отдаём аудиторию третьим лицам.
Я предлагаю рассуждать про куки с позиции борьбы со спамом: капча — тоже кука. Заблокировали сторонние — тонем в спаме.
Формулировка, которая закрывает вопрос:
🔑 Мы используем файлы cookie, Яндекс Метрику и Yandex SmartCaptcha для анализа посещаемости, противодействия спаму и улучшения работы сайта. Обработка осуществляется в целях реализации законных интересов оператора на основании п. 7 ч. 1 ст. 6 Федерального закона № 152-ФЗ «О персональных данных». Подробнее — в Политике обработки персональных данных.
2️⃣ Денежная. Счётчик молчит — автостратегии Директа недосчитываются конверсий и учатся на обрубленной выборке. Результат — падает доходность бизнеса. Аналогичным образом происходит изменение статистических факторов ранжирования в органическом поиске.
🧩 Кейс 2.
site-config.js вместо константЗдесь я был принимающей стороной. Попросил фрилансера вынести телефон, цену и прочее в строковые константы лендинга, чтобы правки не растекались по файлам.
Получил
site-config.js, который подменяет захардкоженные значения в готовом HTML. Вместо одного места для правок стало два. Хотели уменьшить сложность, получилось, что Codex её увеличил. Забыл поправить исходник — в поиске висит старая цена, потому что роботы поисковых систем не любят java script.Отдельно про «робот всё отрендерит». Рендерят так неохотно, что капец.
Google ставит JS-страницы во вторую волну: у неприоритетных доменов очередь тянется неделями. Яндекс держит рендеринг в бете с 2022 года.
LLM-краулеры не рендерят в принципе. Vercel и MERJ разобрали 500+ млн запросов GPTBot — ни одного исполнения JS.
Цена, подставленная джаваскриптом, для ChatGPT и Perplexity просто не существует.
🎯 К чему я веду
В обоих кейсах код рабочий и симпатичный. Всё выглядит в высшей мере профессионоально и красиво.
Сломалось понимание контекста: чья юрисдикция, откуда приходят деньги, кто читает страницу кроме человека.
⚡ Вайбкодер разбирается в логике продукта и умеет остановить агента. Вайб-дизайнер оценивает результат по картинке и похвале от модели.
📚 Где брать базу
Сейчас будет похоже на нативку, но я правда вспоминал этот курс за несколько дней до анонса. В прошлом году моя жена Даша прошла «Вайбкодинг на максималках» Глеба Кудрявцева.
Первые занятия там — про то, что такое программа, язык программирования, зачем нужны Git и Docker. И только потом «давайте сделаем прикольно». Ровно позавчера рассказывая про шишки набитые об красивые лендинги я вспоминал курс Глеба и говорил, как круто, что он учит базе и объясняет подводные камни.
Очень кстати, что очередной поток стартует 20 августа. Есть бесплатная первая лекция, а промокод GLEB3 даёт ещё 10% сверх цены на лендинге.
А теперь предлагаю повспоминать косяки, которые вам принесли GPT Sol, вкатившийся вайбкодер или разработчик. Пишите в комментариях.
----
Поляков считает — AI, код и кейсы
👍9😐9❤5🔥4😁2
Yandex Ecom Open Air: Алиса, агентная коммерция и ставка Яндекса
Сходил на Yandex Ecom Open Air. Агентная коммерция — главный лейтмотив дня, про неё говорили и с большой сцены, делали прогнозы. Был ещё обзор Яндекс.КИТ, но мы с вами интересуемся агентами, поэтому поговорим про неё.
🤦🏻♂️ Отдельная ирония: заявку, в которой я указал, что связан с рынком ИИ, на этот фестиваль отклонили.
1️⃣ Что показали по Алисе AI
Ассистенту обещают прокачать память о пользователе, ризонинг и вызов инструментов. Идеальный сценарий, чтобы агент искал за пределами пользовательского запроса. Предлагал лучшие альтернативы. Надеюсь это не будет очередным засильем нестрогого рекламного таргетинга.
2️⃣ Модели у экосистем
Со сцены прозвучало наблюдение: на западе модели принадлежат независимым компаниям, в России — экосистемам. Отдельным пунктом шёл большой объём данных о пользователях как преимущество.
Для качества подбора данные и правда преимущество. Вопрос в том, кому принадлежит ассистент и нет ли конфликта интересов между пользователем и владельцем агента. Для качества подбора данные и правда преимущество.
Яндекс владеет моделью, Маркетом, платежом, доставкой и рассрочкой. Маркировка рекламы уже есть, а вот маркировку агентных рекомендаций пока не придумали, получаем вопрос доверия.
🤔 Моё скромное мнение
Наблюдая за стараниями Яндекса в популяризации агентного екома, ваш покорный слуга уверен в популяризации потребления через ИИ-агентов. Разработчикам MCP стоит готовиться к поддержке всех возможных протоколов, так как у нас уже есть большое разнообразие идей от разных игороков. Скромные прогнозы Data Insights — 11% российского екома у агентов к 2032 году.
Что думаете вы? Уже делали покупки через ИИ-агентов? Доверили бы выбор каких-нибудь товаров ИИ?
----
Поляков считает — AI, код и кейсы
Сходил на Yandex Ecom Open Air. Агентная коммерция — главный лейтмотив дня, про неё говорили и с большой сцены, делали прогнозы. Был ещё обзор Яндекс.КИТ, но мы с вами интересуемся агентами, поэтому поговорим про неё.
🤦🏻♂️ Отдельная ирония: заявку, в которой я указал, что связан с рынком ИИ, на этот фестиваль отклонили.
1️⃣ Что показали по Алисе AI
Ассистенту обещают прокачать память о пользователе, ризонинг и вызов инструментов. Идеальный сценарий, чтобы агент искал за пределами пользовательского запроса. Предлагал лучшие альтернативы. Надеюсь это не будет очередным засильем нестрогого рекламного таргетинга.
2️⃣ Модели у экосистем
Со сцены прозвучало наблюдение: на западе модели принадлежат независимым компаниям, в России — экосистемам. Отдельным пунктом шёл большой объём данных о пользователях как преимущество.
Для качества подбора данные и правда преимущество. Вопрос в том, кому принадлежит ассистент и нет ли конфликта интересов между пользователем и владельцем агента. Для качества подбора данные и правда преимущество.
Яндекс владеет моделью, Маркетом, платежом, доставкой и рассрочкой. Маркировка рекламы уже есть, а вот маркировку агентных рекомендаций пока не придумали, получаем вопрос доверия.
🤔 Моё скромное мнение
Наблюдая за стараниями Яндекса в популяризации агентного екома, ваш покорный слуга уверен в популяризации потребления через ИИ-агентов. Разработчикам MCP стоит готовиться к поддержке всех возможных протоколов, так как у нас уже есть большое разнообразие идей от разных игороков. Скромные прогнозы Data Insights — 11% российского екома у агентов к 2032 году.
Что думаете вы? Уже делали покупки через ИИ-агентов? Доверили бы выбор каких-нибудь товаров ИИ?
----
Поляков считает — AI, код и кейсы
❤5👍4🕊1🙊1
Был нормальный SEO-спец, познакомился с ИИ, стал ужасным
У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика. За 2 года органический трафик стал x3 вообще без переделки структуры (с 2 800 до 10 000 визитов). Поэтому считаю их молодцами и периодически хвалю.
🔗 Сложный сайт: metallik.ru
Ребята реально поняли, что сайт нестандартный, придумали, как ему добавить «магазинности», создали категории тегов товарам, информационные статьи: у сайта растёт Share of Voice. Короче, всё вроде красиво.
Но вот к ним в руки попал ИИ (я узнал его по первой строчке в техзадании по антитезе) — и понеслась.
🤦🏻♂️ На что я прифигел
Прилетает рекомендация на доработку раздела профнастила, а там просто лендинг на 26 экранов с отзывами и энциклопедией профлиста.
Выглядит всё нормально и профессионально. Прям убедительно. Таблица, в которой написано, что людям нужны отзывы, они их ищут (лол, что в Гугле) и надо такой экран обязательно. Рядом ответы на главные вопросы, в том числе про снеговые нагрузки. Это очень важно для качественного сайта. И таких 26 экранов.
Но прикол в том, что нормальный человек под каждым пунктом будет спорить:
— 26 экранов на листинге товаров? Это же дофигища, вы куда?
— Отзывы у себя на сайте продавец модерирует сам, доверия к ним меньше, чем к карточке в Яндексе. Отдельный экран под них на листинге — точно не первое, что стоит делать.
— Ребята, у нас вообще-то интернет-магазин на шаблонах, а не лендинг: для нас исправление одной категории профлиста эквивалентно исправлению всех категорий на сайте.
И можно продолжать долго. Короче, проблема ИИ в продвижении в том, что он представляет собой кальку всего успешного успеха, который только можно встретить.
⚠️ На моём опыте есть ряд сфер, где ИИ ужасен
Раньше я любил говорить, что у ИИ есть три области, в которых он из коробки очень плох:
1. ИИ-агенты
2. Реклама в интернете
3. Сайты на PHP
Теперь к списку хочется добавить SEO. В целом эти проблемы предсказуемы и легко объяснимы:
ИИ-агенты, способы их конфигурации, настройки и построение обвязок — это тема 2025–2026 годов. В интернете пока мало материалов на этот счёт, поэтому ИИ часто использует устаревшие идеи.
Реклама в интернете — достаточно старая отрасль, но вся состоит из материалов про успешный успех: как компания-подрядчик включила ретаргетинг/автостратегию/размещения у микроблогеров и какая-то метрика полетела.
Сайты на PHP и материалы, связанные с ними, полны примеров плохих экспериментов и неудачных решений.
SEO туда же. Ключевая мысль тут, что в таких областях надо дополнительно отгружать в ИИ свои знания и свою доменную экспертизу. Какие действия работают, что в рекламе хорошо, как мы пишем и делаем сайты на PHP. Не надеяться на то, что кто-то натренировал ИИ на идеальную рекламу. Не натренировал.
🚀 Сначала отгружаем свою экспертизу и уже на неё зовём ИИ
Прежде чем просить рекомендации, я кладу в контекст четыре вещи: как устроен проект, что физически нельзя поменять, что мы уже пробовали и с каким результатом, по каким правилам принимаем решения. Для «Металлик и Ко» второй пункт звучит буквально так: правка одной категории равна правке всех категорий сразу.
С таким брифом лендинг на 26 экранов просто не рождается. ИИ видит ограничение платформы и предлагает то, что можно раскатить на весь каталог, — а это как раз то, за что я хвалил ребят два года.
А у вас какая область, где ИИ из коробки выдаёт красивую чушь? И что вы кладёте в контекст, чтобы он перестал?
----
Поляков считает — AI, код и кейсы
У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика. За 2 года органический трафик стал x3 вообще без переделки структуры (с 2 800 до 10 000 визитов). Поэтому считаю их молодцами и периодически хвалю.
🔗 Сложный сайт: metallik.ru
Ребята реально поняли, что сайт нестандартный, придумали, как ему добавить «магазинности», создали категории тегов товарам, информационные статьи: у сайта растёт Share of Voice. Короче, всё вроде красиво.
Но вот к ним в руки попал ИИ (я узнал его по первой строчке в техзадании по антитезе) — и понеслась.
🤦🏻♂️ На что я прифигел
Прилетает рекомендация на доработку раздела профнастила, а там просто лендинг на 26 экранов с отзывами и энциклопедией профлиста.
Выглядит всё нормально и профессионально. Прям убедительно. Таблица, в которой написано, что людям нужны отзывы, они их ищут (лол, что в Гугле) и надо такой экран обязательно. Рядом ответы на главные вопросы, в том числе про снеговые нагрузки. Это очень важно для качественного сайта. И таких 26 экранов.
Но прикол в том, что нормальный человек под каждым пунктом будет спорить:
— 26 экранов на листинге товаров? Это же дофигища, вы куда?
— Отзывы у себя на сайте продавец модерирует сам, доверия к ним меньше, чем к карточке в Яндексе. Отдельный экран под них на листинге — точно не первое, что стоит делать.
— Ребята, у нас вообще-то интернет-магазин на шаблонах, а не лендинг: для нас исправление одной категории профлиста эквивалентно исправлению всех категорий на сайте.
И можно продолжать долго. Короче, проблема ИИ в продвижении в том, что он представляет собой кальку всего успешного успеха, который только можно встретить.
⚠️ На моём опыте есть ряд сфер, где ИИ ужасен
Раньше я любил говорить, что у ИИ есть три области, в которых он из коробки очень плох:
1. ИИ-агенты
2. Реклама в интернете
3. Сайты на PHP
Теперь к списку хочется добавить SEO. В целом эти проблемы предсказуемы и легко объяснимы:
ИИ-агенты, способы их конфигурации, настройки и построение обвязок — это тема 2025–2026 годов. В интернете пока мало материалов на этот счёт, поэтому ИИ часто использует устаревшие идеи.
Реклама в интернете — достаточно старая отрасль, но вся состоит из материалов про успешный успех: как компания-подрядчик включила ретаргетинг/автостратегию/размещения у микроблогеров и какая-то метрика полетела.
Сайты на PHP и материалы, связанные с ними, полны примеров плохих экспериментов и неудачных решений.
SEO туда же. Ключевая мысль тут, что в таких областях надо дополнительно отгружать в ИИ свои знания и свою доменную экспертизу. Какие действия работают, что в рекламе хорошо, как мы пишем и делаем сайты на PHP. Не надеяться на то, что кто-то натренировал ИИ на идеальную рекламу. Не натренировал.
🚀 Сначала отгружаем свою экспертизу и уже на неё зовём ИИ
Прежде чем просить рекомендации, я кладу в контекст четыре вещи: как устроен проект, что физически нельзя поменять, что мы уже пробовали и с каким результатом, по каким правилам принимаем решения. Для «Металлик и Ко» второй пункт звучит буквально так: правка одной категории равна правке всех категорий сразу.
С таким брифом лендинг на 26 экранов просто не рождается. ИИ видит ограничение платформы и предлагает то, что можно раскатить на весь каталог, — а это как раз то, за что я хвалил ребят два года.
🎯 ИИ не знает вашу отрасль. Он знает, как о ней принято писать в интернете. Поэтому и сыпется ровно там, где публичные материалы состоят из кейсов «включили автостратегию — и всё полетело».
А у вас какая область, где ИИ из коробки выдаёт красивую чушь? И что вы кладёте в контекст, чтобы он перестал?
----
Поляков считает — AI, код и кейсы
👍12❤5🔥2💯1
В канун возвращения пятичасовых лимитов Codex вышло интервью Тибо.
Конкретно в моем кейсе именно пятичасовые лимиты являются причиной вылета в экстра юз в Claude. В результате расходы на Антропик у меня больше 200 баксов. Так что ждём, что расходы на Codex тоже вылезут за пределы лимиты подписки.
UPD. Мне подсказывают, что введение пятичасовых лимитов касается только пользователей с подпиской плюс. Для Pro пока не включают.
Конкретно в моем кейсе именно пятичасовые лимиты являются причиной вылета в экстра юз в Claude. В результате расходы на Антропик у меня больше 200 баксов. Так что ждём, что расходы на Codex тоже вылезут за пределы лимиты подписки.
UPD. Мне подсказывают, что введение пятичасовых лимитов касается только пользователей с подпиской плюс. Для Pro пока не включают.
❤3
Forwarded from НИИ ИИ
Вышло первое большое видеоинтервью с Тибо Соттио — тем самым человеком из OpenAI, который нажимает кнопку сброса лимитов Codex. Я сделал полный перевод и саммари:
Кратко о главном из разговора с Мэттью Берманом:
— Тибо пришёл в OpenAI из DeepMind, где за год до ChatGPT уже был внутренний чат-продукт, который Google побоялась выпускать. Его вывод: культура решает
— у OpenAI исследования и продукт проектируются вместе, а идеи доводятся до релиза очень быстро.
— Слияние ChatGPT и Codex не маркетинговый ход: будущие модели сами требуют объединения. Цель — персональный AGI с интерфейсом, который подстраивается под человека. «Вы и ваша мама будете пользоваться одним и тем же продуктом».
— Сбросы лимитов начались как компенсация за сбои, а не как акция. Решение не согласуется ни с маркетингом, ни с финансами: «я могу нажать кнопку, когда почувствую, что это правильно». И да, физическая кнопка существует.
— Luna подешевела на 80%, потому что фронтирные модели оптимизируют инфраструктуру, на которой сами работают. Тибо называет это формой рекурсивного самоулучшения. Скорость ответов за три месяца выросла примерно на 60%.
— Режим ultra fast (до 14× быстрее) внутри OpenAI выдают не всем: мощности резервируют для клиентов, а внутри он нужен при инцидентах. Через год-два такие скорости станут почти стандартом.
— «Через два-три месяца Codex покажется примитивным»: следующему поколению моделей тесен ноутбук — облачные агенты, параллельная работа, голос.
В статье — саммари подробнее и полный перевод всего интервью: от культуры OpenAI и конкуренции с Anthropic до паузы в обучении фронтирных моделей и СДВГ Тибо.
👉 Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод
Кратко о главном из разговора с Мэттью Берманом:
— Тибо пришёл в OpenAI из DeepMind, где за год до ChatGPT уже был внутренний чат-продукт, который Google побоялась выпускать. Его вывод: культура решает
— у OpenAI исследования и продукт проектируются вместе, а идеи доводятся до релиза очень быстро.
— Слияние ChatGPT и Codex не маркетинговый ход: будущие модели сами требуют объединения. Цель — персональный AGI с интерфейсом, который подстраивается под человека. «Вы и ваша мама будете пользоваться одним и тем же продуктом».
— Сбросы лимитов начались как компенсация за сбои, а не как акция. Решение не согласуется ни с маркетингом, ни с финансами: «я могу нажать кнопку, когда почувствую, что это правильно». И да, физическая кнопка существует.
— Luna подешевела на 80%, потому что фронтирные модели оптимизируют инфраструктуру, на которой сами работают. Тибо называет это формой рекурсивного самоулучшения. Скорость ответов за три месяца выросла примерно на 60%.
— Режим ultra fast (до 14× быстрее) внутри OpenAI выдают не всем: мощности резервируют для клиентов, а внутри он нужен при инцидентах. Через год-два такие скорости станут почти стандартом.
— «Через два-три месяца Codex покажется примитивным»: следующему поколению моделей тесен ноутбук — облачные агенты, параллельная работа, голос.
В статье — саммари подробнее и полный перевод всего интервью: от культуры OpenAI и конкуренции с Anthropic до паузы в обучении фронтирных моделей и СДВГ Тибо.
👉 Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод
🔥11❤3👍3🥱1
Поляков считает: AI, код и кейсы
Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать. 🏆 Агентный бенчмарк: вровень с фронтиром Прогнал PAC1 — набор…
Qwen3.8-27B на DGX Spark: обогнал Sonnet 5 в PAC-1 и стал быстрее.
Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.
Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257
Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.
📏 Что по статистике
Автор приводит свои замеры:
llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с
Я решил что хочу 34 т/с и пошёл тестировать.
На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.
⚠️ Проблема с шиной никуда не девается
Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.
🔥 Прогнал PAC-1 и модель обошла Опус
Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.
Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.
🙋🏻♂️ А что по бизнес задачам?
У рекламных агентств есть неприятная задачка: отчётность по маркировке рекламы в ОРД. Нельзя сказать, что она прям сложгная, у меня давно есть скилл, который позволяет клод опусу создавать таблицы для загрузки.
Но в этот раз я отдал эту задачку агенту на Pi у которого под капотом был Qwen 3.8 27B, и он справился. Правда за 30 минут.
Кто уже тестил маленькие локальные модели на бизнес задачах? Как результаты?
----
Поляков считает — AI, код и кейсы
Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.
Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257
Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.
📏 Что по статистике
Автор приводит свои замеры:
llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с
Я решил что хочу 34 т/с и пошёл тестировать.
На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.
⚠️ Проблема с шиной никуда не девается
Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.
🔥 Прогнал PAC-1 и модель обошла Опус
Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.
Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.
😀 Забавно, что код на питоне генерируется быстрее кода на TypeScript (см. скриншоты)
🙋🏻♂️ А что по бизнес задачам?
У рекламных агентств есть неприятная задачка: отчётность по маркировке рекламы в ОРД. Нельзя сказать, что она прям сложгная, у меня давно есть скилл, который позволяет клод опусу создавать таблицы для загрузки.
Но в этот раз я отдал эту задачку агенту на Pi у которого под капотом был Qwen 3.8 27B, и он справился. Правда за 30 минут.
Кто уже тестил маленькие локальные модели на бизнес задачах? Как результаты?
----
Поляков считает — AI, код и кейсы
❤6👍4🔥3