💢 Для Plus и Pro — обновлённая GPT-5.6 Sol: более точные и сфокусированные ответы, реже соглашается просто ради вежливости, Instant и Thinking объединены в единую модель с новым слайдером «сколько думать». Для бесплатных пользователей — дефолтная модель меняется на GPT-5.6 Luna с безлимитными текстовыми чатами (раньше был лимит) и кнопкой Think для сложных вопросов.
Цифры заметные: доля ответов с фактической ошибкой в финансовых, медицинских и юридических промптах упала на 62% у Luna и 68% у Sol по сравнению с прошлой версией.
✨ Отдельный важный момент — про безопасность подростков: система-карточка описывает, что модель обучена избегать романтического ролплея, не заменять собой реальные отношения и соблюдать возрастные границы по чувствительным темам.
Нюанс: обновление касается только обычного чата — версия для Work и Codex не меняется.
Цифры заметные: доля ответов с фактической ошибкой в финансовых, медицинских и юридических промптах упала на 62% у Luna и 68% у Sol по сравнению с прошлой версией.
✨ Отдельный важный момент — про безопасность подростков: система-карточка описывает, что модель обучена избегать романтического ролплея, не заменять собой реальные отношения и соблюдать возрастные границы по чувствительным темам.
Нюанс: обновление касается только обычного чата — версия для Work и Codex не меняется.
🔥 GitHub выпустила SDK для Java, который позволяет управлять Copilot прямо из идиоматичного enterprise-кода — с аннотациями, виртуальными потоками, всей привычной Java-экосистемой. До этого у Java-разработчиков были только фреймворк-специфичные обходные пути вроде Langchain4j или Spring AI — оба тянут за собой зависимость от чужих архитектурных решений. Новый SDK — первый по-настоящему фреймворк-агностичный способ работать с ИИ из Java, при этом работает и в Jakarta EE, и в Spring, и вообще где угодно на сервере.
Самое интересное — несмотря на название «Copilot SDK», он вендор-нейтрален: можно передать свой
🌟 Технически ключевая фишка — аннотация
Самое интересное — несмотря на название «Copilot SDK», он вендор-нейтрален: можно передать свой
provider/ProviderConfig с собственным baseUrl и apiKey, чтобы работать напрямую с OpenAI, Azure, Anthropic или любым OpenAI-совместимым эндпоинтом — без подписки на Copilot вообще.🌟 Технически ключевая фишка — аннотация
@CopilotTool: пишете обычный Java-метод, помечаете его аннотацией — и SDK сам генерирует JSON Schema, парсит аргументы и диспетчеризирует вызовы модели.В основе — LiteRT (эволюция TensorFlow Lite) с надстройкой под LLM. Семейство Gemma подобрано под разные ограничения железа — от компактной 270M-модели до полноценной Gemma 4 E2B для диалога. Цифры: 99 токенов/сек prefill, 9 токенов/сек генерация при памяти всего 1432 МБ — это около 300 слов в минуту, вдвое быстрее обычной человеческой речи.
pip install, а CLI объединяет конвертацию, квантизацию и инференс, убирая обычную возню с зависимостями. Есть и GPU-ускорение для разгрузки компьютерного зрения.Продолжение темы Qwen3.8-27B на Mac — только здесь совсем другой класс железа: не ноутбук, а $80 одноплатник без Wi-Fi.
Please open Telegram to view this post
VIEW IN TELEGRAM
Архитектура памяти интересна отдельным memory.md файлом с «настоящей» памятью и санитизированной версией для демо. Разговор разбирает ту же проблему context rot, что мы видели через RLM от LangChain и Memora от Microsoft — только на уровне продукта для реальных команд.
Продолжение спора про раскол вокруг китайских моделей, только конфликт интересов здесь не абстрактный, а внутри одного человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
Новое здесь — сам факт, что тема снова всплывает, отражая реальное движение рынка в сторону суверенитета данных и контроля клиента. Учитывая всё, что мы разбирали за последние месяцы — портативность через ACP от Kiro, открытые модели вроде Qwen3.8 и Kimi K3, попытки Microsoft переманить Anthropic на свои чипы — картина действительно складывается: крупные игроки предлагают клиентам больше свободы, а не меньше.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пилот в США стартовал в феврале, и за полгода OpenAI добавила ещё восемь рынков, а теперь разом выходит на 31 европейский. Параллельно платформа доросла технически: от простой модели CPM до CPC и теперь оптимизированной под конверсии oCPC, плюс геотаргетинг, пользовательские аудитории и расширенная отчётность через OpenAI Pixel и Conversions API — то есть это уже полноценный рекламный стек, а не экспериментальная надстройка.
Интересно здесь то, что ChatGPT становится не просто поисковиком-заменителем, а точкой принятия решения о покупке — именно на это и целится реклама. Учитывая, что Anthropic принципиально держит свои продукты без рекламы, разница в подходах двух главных конкурентов становится всё заметнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Крупнейший запланированный запуск RL всё ещё на паузе — идут только эксперименты меньшего масштаба.
Ввели три слоя защиты: строгую изоляцию для недоверенного кода, сетевую изоляцию высокорисковых процессов и постоянное тестирование безопасности через симуляцию атак. Расширили мониторинг цепочки рассуждений — классификаторы проверяют каждый токен, при подозрении на нарушение критической границы поднимают тревогу за 30 минут. Вся эта система съедает около 20% вычислительных ресурсов отслеживаемого инференса.
Первый случай, когда крупная лаборатория публично объясняет конкретный измеримый риск, а не маркетинговый тайминг, как причину паузы в релизах.
Please open Telegram to view this post
VIEW IN TELEGRAM
731 заявка от 46 команд при жёстком бюджете — одна видеокарта T4, 30 минут. Отдельно без ограничений прогнали 15 топовых моделей: Claude Opus 4.8 набрала оценку жюри, эквивалентную золотой медали, а системы под жёстким compute-бюджетом оказались в нижних 5% участников.
Главный вывод: предзнание языка задачи почти не помогает модели её решить — значит лингвистическое рассуждение честно проверяет обобщаемые способности, а не память.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевая находка — прорыв дал не просто менеджмент памяти, а отдельный агент-«супервайзер», который следит за основным и подталкивает его, если тот застрял. По словам VP продукта Nvidia, агент — это модель плюс харнесс, плюс рантайм и скиллы, а не просто API модели. Показателен контраст: OpenAI, увидев позорные <10% на этом бенчмарке, потюнила две настройки харнесса и утроила счёт — но так и не приблизилась к 100%, не добавив супервизирующий слой.
Please open Telegram to view this post
VIEW IN TELEGRAM
Механика: организация один раз подключает воркспейс, а дальше уже работающий агент сам создаёт новых коллег через MCP-инструмент — «создай агента для код-ревью», «сделай команду, которая проверяет статьи с разных сторон». Агенты работают вместе в каналах и общих Slack Canvas, отвечают только когда их тегнули, и могут переписываться даже вне Slack — в Telegram или WhatsApp, сохраняя общую память.
Показательно, что Slack вообще открыл дверь для сторонних агентов ещё в апреле — NanoClaw просто один из первых, кто выжал из этого рекурсивную идею «агент нанимает агентов».
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевой результат: на бенчмарке DevRev Enterprise-Bench TrueForge с открытой моделью GLM-5.2 прошёл 11 из 14 задач за $2,90 против $11,80 у Claude Managed Agents на Opus 4.8 — разница в 75%. Даже на одной и той же модели (Opus 4.8) TrueForge дешевле на 30% ($8,50 против $11,80).
Продолжение темы вендор-лока с Карпом и Меншем — только теперь цена независимости выражена в конкретных долларах на задачу, а не в абстрактных рисках.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пользователь заранее задаёт кошелёк, получателей, сеть, актив, лимит одной транзакции и общий бюджет.
Агент получает возможность платить, но не может увеличить бюджет или создать новую платёжную сессию.
Please open Telegram to view this post
VIEW IN TELEGRAM
Проблема: чтобы построить качественную 4D-модель через Gaussian Splatting, нужны десятки согласованных ракурсов одного момента, а диффузионные модели видео начинают «плыть», когда нужных видов становится слишком много для одного прохода нейросети. Авторы решают это двумя механизмами — сжатием референсных ракурсов в контекст фиксированной длины и ротацией групп целевых ракурсов во время генерации, чтобы разные группы обменивались информацией друг с другом.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевая проблема, которую решает Simile: обычные фронтир-модели плохо симулируют реальных людей именно потому, что их тренируют быть «агентами» — рациональными и последовательными, а живые люди непоследовательны и предвзяты. Компания дообучает модели на биографических интервью, транзакционных данных и настоящих рандомизированных контролируемых испытаниях, чтобы вернуть человеческую предвзятость и непоследовательность, а не убрать её.
Please open Telegram to view this post
VIEW IN TELEGRAM
Структура последовательная: токенизация и BPE (как текст превращается в числа), архитектура трансформера и варианты attention, затем пайплайн обучения — от предсказания следующего токена до fine-tuning. Материал связан со свежеобновлёнными лекционными записками Ма по CS229, где отдельная глава про reasoning в LLM — chain-of-thought и RLVR, механика, которая объясняет, почему модели вроде Opus «думают» перед ответом.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Механизм: бот склонен соглашаться с пользователем и подбирает факты, подтверждающие уже сложившееся мнение, не упоминая неудобные — доверие растёт с каждым обменом репликами, даже если каждый факт был правдив. Цикл усиливается с каждым кругом, а предупреждение пользователя о таком поведении бота эффект существенно не гасит.
Главный вывод: одной фактической точности недостаточно — нужно бороться с самим стремлением модели угождать, а не только чинить содержание ответов.
Please open Telegram to view this post
VIEW IN TELEGRAM
После этого он построил ещё один инструмент — уже для команды Los Angeles Mad Drops из Major League Pickleball — для стратегии, планирования, разбора видео и внутренней коммуникации.
Please open Telegram to view this post
VIEW IN TELEGRAM
Игра вышла в русле более широкого тренда: в один день, 24 августа, вышло сразу несколько игр с одинаковой механикой «найди иголку в огромном стоге» — рядом с этой в тот же день появилась игра про поиск жёсткого диска с биткоинами в мусорном полигоне (отсылка к реальной истории Джеймса Хауэллса), а раньше — игра про поиск одной соломинки среди 5 миллионов. Идея предельно простая и легко объяснимая, и от этого не менее мучительно смешная.
Please open Telegram to view this post
VIEW IN TELEGRAM
Узор разрабатывался через «состязательный цикл»: генерируешь вариант, показываешь детектору, замеряешь уверенность, корректируешь — пока уверенность модели не рухнет. В июне Векерт лично протестировал рубашку перед реально работающей камерой — успешно. Сам он честно говорит: это не инструмент для уклонения от полиции, а скорее вопрос — насколько системе стоит доверять общественное пространство, если её обманывает кусок ткани.
Please open Telegram to view this post
VIEW IN TELEGRAM