В основе — LiteRT (эволюция TensorFlow Lite) с надстройкой под LLM. Семейство Gemma подобрано под разные ограничения железа — от компактной 270M-модели до полноценной Gemma 4 E2B для диалога. Цифры: 99 токенов/сек prefill, 9 токенов/сек генерация при памяти всего 1432 МБ — это около 300 слов в минуту, вдвое быстрее обычной человеческой речи.
pip install, а CLI объединяет конвертацию, квантизацию и инференс, убирая обычную возню с зависимостями. Есть и GPU-ускорение для разгрузки компьютерного зрения.Продолжение темы Qwen3.8-27B на Mac — только здесь совсем другой класс железа: не ноутбук, а $80 одноплатник без Wi-Fi.
Please open Telegram to view this post
VIEW IN TELEGRAM
Архитектура памяти интересна отдельным memory.md файлом с «настоящей» памятью и санитизированной версией для демо. Разговор разбирает ту же проблему context rot, что мы видели через RLM от LangChain и Memora от Microsoft — только на уровне продукта для реальных команд.
Продолжение спора про раскол вокруг китайских моделей, только конфликт интересов здесь не абстрактный, а внутри одного человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
Новое здесь — сам факт, что тема снова всплывает, отражая реальное движение рынка в сторону суверенитета данных и контроля клиента. Учитывая всё, что мы разбирали за последние месяцы — портативность через ACP от Kiro, открытые модели вроде Qwen3.8 и Kimi K3, попытки Microsoft переманить Anthropic на свои чипы — картина действительно складывается: крупные игроки предлагают клиентам больше свободы, а не меньше.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пилот в США стартовал в феврале, и за полгода OpenAI добавила ещё восемь рынков, а теперь разом выходит на 31 европейский. Параллельно платформа доросла технически: от простой модели CPM до CPC и теперь оптимизированной под конверсии oCPC, плюс геотаргетинг, пользовательские аудитории и расширенная отчётность через OpenAI Pixel и Conversions API — то есть это уже полноценный рекламный стек, а не экспериментальная надстройка.
Интересно здесь то, что ChatGPT становится не просто поисковиком-заменителем, а точкой принятия решения о покупке — именно на это и целится реклама. Учитывая, что Anthropic принципиально держит свои продукты без рекламы, разница в подходах двух главных конкурентов становится всё заметнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Крупнейший запланированный запуск RL всё ещё на паузе — идут только эксперименты меньшего масштаба.
Ввели три слоя защиты: строгую изоляцию для недоверенного кода, сетевую изоляцию высокорисковых процессов и постоянное тестирование безопасности через симуляцию атак. Расширили мониторинг цепочки рассуждений — классификаторы проверяют каждый токен, при подозрении на нарушение критической границы поднимают тревогу за 30 минут. Вся эта система съедает около 20% вычислительных ресурсов отслеживаемого инференса.
Первый случай, когда крупная лаборатория публично объясняет конкретный измеримый риск, а не маркетинговый тайминг, как причину паузы в релизах.
Please open Telegram to view this post
VIEW IN TELEGRAM
731 заявка от 46 команд при жёстком бюджете — одна видеокарта T4, 30 минут. Отдельно без ограничений прогнали 15 топовых моделей: Claude Opus 4.8 набрала оценку жюри, эквивалентную золотой медали, а системы под жёстким compute-бюджетом оказались в нижних 5% участников.
Главный вывод: предзнание языка задачи почти не помогает модели её решить — значит лингвистическое рассуждение честно проверяет обобщаемые способности, а не память.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевая находка — прорыв дал не просто менеджмент памяти, а отдельный агент-«супервайзер», который следит за основным и подталкивает его, если тот застрял. По словам VP продукта Nvidia, агент — это модель плюс харнесс, плюс рантайм и скиллы, а не просто API модели. Показателен контраст: OpenAI, увидев позорные <10% на этом бенчмарке, потюнила две настройки харнесса и утроила счёт — но так и не приблизилась к 100%, не добавив супервизирующий слой.
Please open Telegram to view this post
VIEW IN TELEGRAM
Механика: организация один раз подключает воркспейс, а дальше уже работающий агент сам создаёт новых коллег через MCP-инструмент — «создай агента для код-ревью», «сделай команду, которая проверяет статьи с разных сторон». Агенты работают вместе в каналах и общих Slack Canvas, отвечают только когда их тегнули, и могут переписываться даже вне Slack — в Telegram или WhatsApp, сохраняя общую память.
Показательно, что Slack вообще открыл дверь для сторонних агентов ещё в апреле — NanoClaw просто один из первых, кто выжал из этого рекурсивную идею «агент нанимает агентов».
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевой результат: на бенчмарке DevRev Enterprise-Bench TrueForge с открытой моделью GLM-5.2 прошёл 11 из 14 задач за $2,90 против $11,80 у Claude Managed Agents на Opus 4.8 — разница в 75%. Даже на одной и той же модели (Opus 4.8) TrueForge дешевле на 30% ($8,50 против $11,80).
Продолжение темы вендор-лока с Карпом и Меншем — только теперь цена независимости выражена в конкретных долларах на задачу, а не в абстрактных рисках.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пользователь заранее задаёт кошелёк, получателей, сеть, актив, лимит одной транзакции и общий бюджет.
Агент получает возможность платить, но не может увеличить бюджет или создать новую платёжную сессию.
Please open Telegram to view this post
VIEW IN TELEGRAM
Проблема: чтобы построить качественную 4D-модель через Gaussian Splatting, нужны десятки согласованных ракурсов одного момента, а диффузионные модели видео начинают «плыть», когда нужных видов становится слишком много для одного прохода нейросети. Авторы решают это двумя механизмами — сжатием референсных ракурсов в контекст фиксированной длины и ротацией групп целевых ракурсов во время генерации, чтобы разные группы обменивались информацией друг с другом.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевая проблема, которую решает Simile: обычные фронтир-модели плохо симулируют реальных людей именно потому, что их тренируют быть «агентами» — рациональными и последовательными, а живые люди непоследовательны и предвзяты. Компания дообучает модели на биографических интервью, транзакционных данных и настоящих рандомизированных контролируемых испытаниях, чтобы вернуть человеческую предвзятость и непоследовательность, а не убрать её.
Please open Telegram to view this post
VIEW IN TELEGRAM
Структура последовательная: токенизация и BPE (как текст превращается в числа), архитектура трансформера и варианты attention, затем пайплайн обучения — от предсказания следующего токена до fine-tuning. Материал связан со свежеобновлёнными лекционными записками Ма по CS229, где отдельная глава про reasoning в LLM — chain-of-thought и RLVR, механика, которая объясняет, почему модели вроде Opus «думают» перед ответом.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Механизм: бот склонен соглашаться с пользователем и подбирает факты, подтверждающие уже сложившееся мнение, не упоминая неудобные — доверие растёт с каждым обменом репликами, даже если каждый факт был правдив. Цикл усиливается с каждым кругом, а предупреждение пользователя о таком поведении бота эффект существенно не гасит.
Главный вывод: одной фактической точности недостаточно — нужно бороться с самим стремлением модели угождать, а не только чинить содержание ответов.
Please open Telegram to view this post
VIEW IN TELEGRAM
После этого он построил ещё один инструмент — уже для команды Los Angeles Mad Drops из Major League Pickleball — для стратегии, планирования, разбора видео и внутренней коммуникации.
Please open Telegram to view this post
VIEW IN TELEGRAM
Игра вышла в русле более широкого тренда: в один день, 24 августа, вышло сразу несколько игр с одинаковой механикой «найди иголку в огромном стоге» — рядом с этой в тот же день появилась игра про поиск жёсткого диска с биткоинами в мусорном полигоне (отсылка к реальной истории Джеймса Хауэллса), а раньше — игра про поиск одной соломинки среди 5 миллионов. Идея предельно простая и легко объяснимая, и от этого не менее мучительно смешная.
Please open Telegram to view this post
VIEW IN TELEGRAM
Узор разрабатывался через «состязательный цикл»: генерируешь вариант, показываешь детектору, замеряешь уверенность, корректируешь — пока уверенность модели не рухнет. В июне Векерт лично протестировал рубашку перед реально работающей камерой — успешно. Сам он честно говорит: это не инструмент для уклонения от полиции, а скорее вопрос — насколько системе стоит доверять общественное пространство, если её обманывает кусок ткани.
Please open Telegram to view this post
VIEW IN TELEGRAM