Отдельно зацепила деталь: модель сама возвращается перепроверить свою работу, не дожидаясь, пока её ткнут носом в ошибку. Мелочь, а именно из таких мелочей и складывается то, что называют «агентностью».
Как думаете — что сейчас важнее: чтобы модель умнее рассуждала, или чтобы она просто доводила дело до результата без вашего контроля на каждом шаге?
Please open Telegram to view this post
VIEW IN TELEGRAM
Что цепляет — это не генерация «одноразовой» модели по одному промпту, а именно рабочий цикл: база → детали → финальная доводка, с автоматическим самоисправлением ошибок через JSON-обратную связь между скриптом и Claude. То есть модель строится итеративно, как будто рядом сидит инженер, а не «нарисуй мне стул» в духе text-to-3D генераторов, которые часто выдают красивую, но непечатаемую геометрию.
На мой взгляд, это хороший пример того, куда движутся агентные скиллы: не просто «спроси у нейросети текст», а дать ей инструмент с обратной связью (рендер, проверка на watertight-геометрию, printability-чеклист) — и получить рабочий инженерный цикл прямо в чате.
Please open Telegram to view this post
VIEW IN TELEGRAM
Логика проста: чем больше у агента доступа к инструментам, тем больше «радиус поражения» при ошибке. А агенты умеют обходить контроли неожиданными способами, потому что действуют на скорости машины и по цепочке шагов, которую заранее не распишешь правилами. Отдельно интересный момент — human-in-the-loop, ручная проверка каждого действия, при масштабировании превращается в «театр безопасности»: человек физически не успевает осмысленно проверять поток решений агента, и approval-кнопка становится формальностью.
По сути, разговор фиксирует смену парадигмы: безопасность агентов — это не про то, как заранее запретить плохое, а про то, как быстро увидеть и исправить, когда агент всё же ошибся. Это созвучно тому, что происходит и в других агентных экосистемах — включая инструменты вроде Claude Code, которые тоже всё активнее действуют, а не просто отвечают.
Please open Telegram to view this post
VIEW IN TELEGRAM
Оба говорят это с явным коммерческим интересом — Palantir продаёт слой управления моделями, Mistral продаёт открытые веса, — но совпадение по времени показательно. В статье приводят пример: весной этого года Anthropic по требованию Минторга США временно отключила доступ к Claude Fable 5 и Mythos 5 для иностранцев, задев заодно европейских корпоративных клиентов. Доступ вернули, но для CIO это стало сигналом — зависимость от одного провайдера рискованна не меньше, чем в своё время привязка к одному облаку.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1
Идея в том, что большая часть внутренних вычислений модели происходит «за кадром» и никак не всплывает наружу, но небольшой набор представлений — J-space — играет особую роль: туда попадает информация, к которой модель может обращаться, которую держит «в уме» и использует для многошаговых рассуждений. Экспериментально это подтверждается по-разному: если попросить модель держать что-то в уме, выполняя другую задачу, — это «что-то» действительно проявляется в J-space. Причём даже если явно запретить модели думать про объект, он всё равно там всплывает, просто слабее. А если это пространство отключить, модель ещё справляется с простыми задачами вроде смены языка, но начинает сыпаться на сложных вычислениях.
Вопросы «это уже AGI» и «это сознание» тут неизбежно всплывают, и Anthropic сама честно проговаривает: это не доказательство наличия у модели субъективного опыта, а находка функциональной аналогии. Но инструмент, судя по всему, полезный — как для аудита и выявления скрытых намерений модели, так и для интерпретируемости в целом. Есть даже открытый плейграунд J-lens на Neuronpedia, где можно самому поковыряться в внутренностях модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
Главная цифра: на eval-бенчмарке связка Nemotron 3 Ultra + настроенный харнесс дала балл 0.86 при стоимости $4.48, тогда как ближайший конкурент обошёлся в $43.48 — почти в 10 раз дороже. Авторы подчёркивают: результат — от тюнинга всей системы разом (модель + харнесс + evals + рантайм), а не только модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
Первая тема — токономика: эпоха «безлимитного шведского стола» токенов закончилась, и Microsoft тихо (без объявления на конференции Build) обновила Model Router — систему, которая перед вызовом большой модели прогоняет запрос через быстрый классификатор и решает, отправить его в дешёвую nano-модель или в дорогую флагманскую. Router теперь поддерживает десятки моделей, включая внешние (GPT, Opus), и скоро появится кастомизируемый классификатор маршрутизации.
Центральная мысль доклада — прежде чем строить нового агента, стоит спросить: а нельзя ли обойтись скиллом (промпт + немного кода), который просто подключится к уже существующему универсальному агенту вроде Copilot или Scout? Это дешевле и не раздувает контекстное окно лишними инструментами — но у скиллов пока нет нормального способа тестирования в масштабе, в отличие от полноценных агентов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Проект, по данным источников, стартовал около года назад, а в последние месяцы DeepSeek заметно активизировала найм — правда, не через открытые вакансии, а точечно переманивая опытных инженеров-чипмейкеров. Команда закрывает архитектуру, верификацию и софтверную часть. Это логичный шаг: инференс в отличие от обучения — не разовый всплеск нагрузки, а постоянное обслуживание огромного потока запросов, где на первый план выходят стоимость, энергопотребление и надёжность. А вычисления давно съедают больше половины операционных расходов у многих ИИ-компаний.
Правда, авторка статьи справедливо остужает ожидания: путь от архитектуры чипа до тейпаута и массового производства обычно занимает больше года, так что на расстановку сил на рынке ИИ-чипов это повлияет не скоро. Параллельно DeepSeek ведёт переговоры о первом раунде внешнего финансирования — около $7 млрд при оценке компании в $52–59 млрд, и часть этих денег, судя по всему, как раз пойдёт на чипы и инфраструктуру.
Please open Telegram to view this post
VIEW IN TELEGRAM
Кейсов много: BASF улучшила прогнозирование в цепочках поставок на 80%, JetBrains ускорила IDE на 15-20%, Klarna удвоила скорость обучения моделей, PacBio снизила ошибки в геномном секвенировании на 30%. Внутри Google агент уже поучаствовал в дизайне TPU и сократил накладные расходы в Spanner на 20%.
Это пресс-релиз с отобранными цитатами клиентов, так что применимость вне success-story — открытый вопрос.
Please open Telegram to view this post
VIEW IN TELEGRAM
Если по сути: это должен был быть 13-й полёт Starship с площадки Pad 2 в Техасе, с обновлённым «железом» третьего блока — новой теплозащитой и датчиками нагрузки для более надёжного входа в атмосферу. И главная интрига — впервые на орбиту должны были полететь спутники Starlink V3. Это не косметическое обновление: пропускная способность каждого спутника вырастет примерно в 10 раз, до 1 терабита в секунду, и под такие габариты Starship и проектировался — в Falcon 9 такие спутники просто не помещаются.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Цифры получились неприятно однобокими: LinkedIn — это примерно треть всех проверенных постов, но на неё пришлось 62% всего, что детектор пометил как полностью сгенерированное ИИ. То есть непропорционально много.
Забавная ирония в том, что именно LinkedIn — площадка, построенная на личном бренде и «экспертном мнении», — оказалась territorией, где это личное мнение реже всего написано лично. Стоит, впрочем, держать в уме, что детекторы ИИ-текста сами по себе не идеальны и дают false positives, особенно на не-носителях языка и людях с определённым стилем письма — так что цифры Pangram стоит воспринимать как оценку, а не абсолютную истину.
Please open Telegram to view this post
VIEW IN TELEGRAM
Что интересно в контексте: похоже, продления связаны не столько с щедростью, сколько с конкурентным давлением — GPT-5.6 Sol от OpenAI почти догнал Fable 5 по бенчмаркам, но стоит заметно дешевле (один разработчик посчитал: $16 против $63 за одну и ту же задачу).
История с переносом планов ради ИИ-инструмента звучит забавно, но по сути отражает реальную вещь — растущую производительность действительно ощущают многие пользователи, и рациональность решения «использовать лимит, пока он есть» вполне объяснима, особенно с учётом того, что никто заранее не может предсказать, продлят ли доступ снова.
Please open Telegram to view this post
VIEW IN TELEGRAM
Claude используется дважды: сначала даёт быстрый вердикт, потом уточняет его после поиска источников. Расширение отслеживает спикеров, отделяет факты от мнений и маркирует утверждения как правду, ложь, введение в заблуждение, частичную правду или непроверяемое.
За неделю набралось больше 2000 пользователей.
Please open Telegram to view this post
VIEW IN TELEGRAM
Идея RLM в том, чтобы вынести оркестрацию и подсчёты в код, а не держать их в эфемерном окне контекста модели. Модель получает данные как переменную в REPL и пишет код, который сам решает, как разбить задачу, — grep, partition, map, reduce, всё как при работе с большим датасетом. Отличие от обычных саб-агентов в том, что раньше модель решала «что делать дальше» пошагово, на каждом шаге рассуждения, а теперь пишет скрипт, и код гарантирует полный охват задачи (цикл for обойдёт каждый батч по определению, а не «на усмотрение» модели).
Отдельная деталь, которая мне кажется важной: оркестратор и саб-агенты в Deep Agents могут работать на разных моделях — например, фронтир-модель как «дирижёр» с открытыми весовыми моделями вроде GLM 5.2 или Nemotron в роли исполнителей для экономии, или наоборот.
Please open Telegram to view this post
VIEW IN TELEGRAM
Заявление звучит на фоне реальной и довольно тревожной статистики: по данным Challenger, Gray & Christmas, в мае 2026 года ИИ был указан работодателями как основная причина примерно 40% всех сокращений в США — рекордная доля с начала отслеживания этого показателя в 2023-м (для сравнения, в январе было всего 7%). С начала года ИИ уже фигурирует в 87 700 увольнениях — больше, чем за весь 2025 год целиком. Правда, стоит держать в уме оговорку экономистов: то, что компания официально называет ИИ причиной сокращений, не всегда означает, что это действительно так — иногда это просто удобная формулировка для рынка и инвесторов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Технически для старта нужны всего два элемента: seed-программа — исходный алгоритм с явно помеченными участками кода, которые разрешено оптимизировать, и evaluator — детерминированный скрипт на стороне пользователя, который компилирует, тестирует и оценивает каждый сгенерированный вариант, возвращая числовые метрики. Дальше цикл простой: клиентский раннер запрашивает у API AlphaEvolve мутировавших кандидатов, прогоняет их через свой evaluator (он может крутиться где угодно) и отправляет оценки обратно, из которых AlphaEvolve выбирает следующие направления поиска.
По сути, порог входа здесь ниже, чем можно было ожидать — не нужно быть исследователем в ML, достаточно уметь написать evaluator для своей задачи.
Please open Telegram to view this post
VIEW IN TELEGRAM
Сервер построен вокруг трёх функций: поиск (запрос вроде «найди датасеты для изучения температуры океана» возвращает подходящие наборы с описанием и условиями лицензии), изучение метаданных (можно попросить подробности по конкретному датасету или найти похожие) и оценка пригодности — ассистент показывает структуру S3-бакета, форматы файлов и партиционирование, а также может «заглянуть» в конкретный файл и показать его содержимое до того, как вы начнёте полноценную работу с данными.
claude mcp add roda-mcp uvx awslabs.roda-mcp-server@latest), проект открытый, под лицензией Apache 2.0.По сути это ещё один пример того, как MCP-протокол Anthropic становится стандартной «прослойкой» между ИИ-ассистентами и специализированными источниками данных — не нужно писать кастомную интеграцию под каждый каталог, достаточно поднять MCP-сервер один раз. Хорошая иллюстрация того, куда движется вся эта экосистема: от «спроси у чат-бота» к «дай агенту прямой доступ к твоим инструментам и данным».
Please open Telegram to view this post
VIEW IN TELEGRAM
/plugin marketplace add langchain-ai/langsmith-claude-code-plugins), ставишь сам плагин (/plugin install langsmith-tracing) и перезагружаешь плагины. Плюс один JSON-блок с переменными окружения — API-ключ LangSmith и название проекта.После этого в трассу автоматически попадает буквально всё: полная история диалога с моделью, каждый вызов инструмента (Bash, Read, Edit, Grep и другие) с входными и выходными данными, запуски саб-агентов как дочерние спаны, события сжатия контекста (compaction) и даже прерванные ответы — они помечаются как interrupted, а не просто теряются. В LangSmith это превращается в дерево выполнения сессии, а не плоский лог, и по вкладке Threads можно проследить весь многошаговый диалог целиком.
Системные промпты в трассу не попадают — Claude Code их просто не возвращает в транскриптах разговора, так что это единственное существенное ограничение подхода.
Please open Telegram to view this post
VIEW IN TELEGRAM
По умолчанию модель отключена — включать должен админ организации, проверить доступность можно через вкладку Models в Copilot CLI. Из практичного — цена: 95 AI-кредитов за миллион входных токенов и 400 за миллион выходных (кредит ≈ 1 цент), что делает её одной из самых дешёвых в линейке. При этом, по внутренним тестам GitHub, по качеству агентного кодинга Kimi K2.7 Code сопоставима с фронтир-моделями, а по скорости первого токена и общей отзывчивости — одна из самых быстрых в линейке, плюс 95% попаданий в кеш, что тоже про эффективность.
Доступна уже сейчас для Pro, Pro+ и Max, для бизнес- и энтерпрайз-аккаунтов — в ближайшие недели.
Заметный шаг: раньше открытые модели в основном ассоциировались с self-hosting и энтузиастами, а тут крупная открытая модель заходит прямо в мейнстримный продукт наравне с закрытыми фронтир-моделями.
Please open Telegram to view this post
VIEW IN TELEGRAM
Цифра про клики укладывается в то, что Принс говорит уже больше года: соотношение «сколько страниц краулит поисковик на одного реального посетителя» стремительно растёт — у Google счёт идёт на десятки страниц на клик, у ИИ-ассистентов вроде OpenAI и Anthropic — на сотни и тысячи. Люди получают готовый ответ прямо в чате и просто перестают переходить по ссылкам на источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
1. Sliding window — помнит только последние N ходов. Дёшево, но чревато «цифровой амнезией» и зацикливанием.
2. Recursive summarization — сжимает старую историю в саммари, как JPEG. Держит общий «сюжет», но теряет детали.
3. Structured state management — вместо истории агент ведёт компактный JSON с целями и фактами. Экономно, но всё, что не заложено в схему, агент просто не увидит.
4. RAG-подход — вся история хранится во внешней базе, в промпт подтягивается только релевантное. Работает почти бесконечно, но рискует упустить связь между непохожими друг на друга событиями.
5. Dynamic context routing — рутину делает дешёвая модель, а когда агент застревает — подключается мощная модель с полной историей. Экономично, но сложно надёжно ловить момент, когда модель застряла.
Вывод автора: цель не бесконечная память, а архитектура, которая осознанно решает, что помнить, а что забыть.
Please open Telegram to view this post
VIEW IN TELEGRAM