How to AI
2.71K subscribers
633 photos
31 videos
4 files
110 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
Microsoft представила SkillOpt — систему, которая позволяет улучшать работу ИИ-агентов, обучая не саму модель, а её текстовые инструкции (skills).

Вместо ручного редактирования промптов SkillOpt превращает этот процесс в полноценный цикл обучения с проверкой и отбором лучших изменений.

🖼️ По данным Microsoft, технология показала лучшие или сопоставимые с лучшими результаты во всех 52 тестовых сценариях. При этом навыки остаются компактными, переносимыми между разными моделями и агентами, а производительность растёт без изменения весов нейросети.

Как вы думаете, станет ли обучение «навыков», а не самих моделей, новым стандартом для AI-агентов?
Please open Telegram to view this post
VIEW IN TELEGRAM
1
💢 Все обсуждают ChatGPT и похожие модели, а тем временем набирает силу другое направление — графовые нейросети (GNN).

Обычные нейросети смотрят на вещи по отдельности: вот текст, вот картинка. GNN устроены иначе — они видят связи. Кто с кем дружит, что на что влияет, откуда куда идут деньги.

Где это работает:

— соцсети: кто с кем связан;
— медицина: как гены и белки влияют друг на друга;
— банки: поиск мошенников по цепочкам переводов;
— логистика: как ездят машины и грузы.

➡️ Простой пример: чтобы понять человека, мало смотреть на него самого — важно, кто его окружает. GNN делают ровно это, только с данными.

Слабое место тоже есть: если сеть копает слишком глубоко, она смешивает столько информации «от соседей», что теряет главное. Учёные пока ищут, как это чинить.

Думаю, будущее ИИ именно здесь: не разглядывать объекты по одному, а видеть картину целиком — как всё связано со всем.
Please open Telegram to view this post
VIEW IN TELEGRAM
📁 Microsoft выкатила AI Agent Framework — и это серьёзная заявка на то, как будут строить ИИ-системы дальше.

Идея простая: вместо одного чат-бота на все руки — команда агентов, где у каждого своя роль. Один ищет, второй анализирует, третий пишет отчёт.

Что внутри:
— оркестрация: задачи автоматически распределяются между агентами;
— агенты общаются друг с другом напрямую, без человека-посредника;
— поддержка MCP — подключение к внешним инструментам и данным из коробки.

Раньше такое собирали вручную из зоопарка разных решений. Теперь есть единый фундамент.

‼️ Почему я считаю это важным: мы уходим от схемы «спросил — получил ответ» к схеме «поставил задачу — получил результат». Разница огромная.

ИИ будущего — это, скорее всего, не один супер-бот, а цифровая команда специалистов, которая сама планирует, делит работу и договаривается между собой.

А вы готовы к тому, что у каждого будет своя команда AI-агентов?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
👍 ИИ научился отвечать на вопросы и писать тексты — это уже база. Следующий шаг интереснее: дать ему возможность действовать самому.

Наткнулся на курс, где показывают, как собрать своего AI-агента с нуля — на стеке Cursor, Next.js, AI SDK, Supermemory и Composio.

Что умеет такой агент:
— помнит прошлые разговоры и подстраивается под тебя;
— живёт прямо в Telegram;
— не просто отвечает, а выполняет реальные действия;
— подключается к Gmail, Slack и другим сервисам.

🪐 В основе — OpenClaw, один из самых быстрорастущих open-source агентов. Его философия: не очередной чат-бот, а полноценный цифровой помощник, который держит контекст и закрывает задачи.

На мой взгляд, именно тут проходит граница между «общаться с ИИ» и «работать вместе с ИИ». Скоро ценность модели будет измеряться не качеством ответов, а тем, сколько задач она способна снять с человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 GitHub открыл функцию Copilot Vision для всех — теперь ИИ понимает не только код, но и изображения с PDF-файлами.

Что это меняет на практике: скинул скриншот ошибки или интерфейса, приложил PDF с документацией — и Copilot разбирает всё это вместе с твоим кодом, предлагая решение.

➡️ Работает в VS Code, на GitHub.com и в Copilot CLI.
Мне кажется, это важный шаг: AI-помощники перестают быть просто «текстовыми чатами» и начинают воспринимать весь рабочий контекст разом — код, картинки, документы.

Похоже, скоро проще будет один раз показать проблему, чем пытаться описать её словами.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔪 Midjourney решила не отбиваться, а перейти в атаку на Disney и Warner Bros.

Киностудии обвинили Midjourney в незаконном использовании своих персонажей. А в ответ компания потребовала, чтобы студии сами раскрыли, как используют ИИ внутри себя — какие модели разрабатывают, на каких данных обучают, как применяют при создании фильмов и что обсуждают на закрытых презентациях для руководства.

Логика простая: если студии сами тренируют нейросети на чужом контенте без лицензий, почему судят только Midjourney?

👆 Пока суд разрешил раскрыть информацию лишь о потребительских AI-инструментах студий, но не о внутренних разработках.

Midjourney это не устраивает и пытается оспорить решение.

По-моему, дело давно вышло за рамки спора одной компании с киностудиями.

Суду предстоит определить правила игры для всей индустрии: где заканчивается обучение ИИ и начинается нарушение авторских прав.

А как думаете — правила должны быть одинаковыми для всех, и для AI-стартапов, и для медиагигантов?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Пока все говорят о том, что искусственный интеллект заменит людей, Ford сделала обратный шаг — компания вернула более 300 опытных инженеров, потому что AI не смог обеспечить нужное качество производства.

Несколько лет назад автопроизводитель активно внедрял ИИ: сотни камер проверяли автомобили на дефекты, а алгоритмы должны были автоматически контролировать качество.

Но на практике всё оказалось сложнее.

👆 ИИ не хватило того, что есть у инженеров с десятилетиями опыта — понимания нюансов, накопленной экспертизы и способности замечать проблемы, которым невозможно просто научить по инструкции.

Теперь именно эти специалисты помогают не только проверять автомобили, но и обучать сам искусственный интеллект.

На мой взгляд, это хороший пример того, что сегодня ИИ работает лучше всего не вместо человека, а вместе с человеком. Самые сильные системы появляются там, где технологии усиливают опыт экспертов, а не пытаются полностью его заменить.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪐 Раньше апдейты Claude в основном хвастались тем, что модель стала умнее отвечать. Sonnet 5 — про другое: он лучше держит план на несколько шагов вперёд, увереннее работает с инструментами — терминалом, браузером, API — и заметно прибавил в задачах, где нужно не выдать готовый текст, а довести дело до конца самому. По ощущениям — почти на уровне Opus, только дешевле.

Отдельно зацепила деталь: модель сама возвращается перепроверить свою работу, не дожидаясь, пока её ткнут носом в ошибку. Мелочь, а именно из таких мелочей и складывается то, что называют «агентностью».

➡️ И вот что я заметил: сам вопрос, по которому меряют модели, тихо поменялся. Ещё пару лет назад спрашивали «насколько умный ответ он выдал». Сейчас всё чаще — «сделал ли он задачу целиком, без моего участия на каждом шаге». Гонка сместилась с параметров на автономность.

Как думаете — что сейчас важнее: чтобы модель умнее рассуждала, или чтобы она просто доводила дело до результата без вашего контроля на каждом шаге?
Please open Telegram to view this post
VIEW IN TELEGRAM
💢 Наткнулся на любопытный скилл для Claude Code — cad-skill от разработчика Николя Шуррута. Суть простая: описываешь физический объект словами («сделай кронштейн для Arduino Uno» или «нужна крышка со snap-fit защёлкой») — и Claude сам пишет параметрический скрипт на CadQuery, экспортирует STL, рендерит превью с нескольких ракурсов и дорабатывает модель вместе с тобой, пока результат не устроит.

Что цепляет — это не генерация «одноразовой» модели по одному промпту, а именно рабочий цикл: база → детали → финальная доводка, с автоматическим самоисправлением ошибок через JSON-обратную связь между скриптом и Claude. То есть модель строится итеративно, как будто рядом сидит инженер, а не «нарисуй мне стул» в духе text-to-3D генераторов, которые часто выдают красивую, но непечатаемую геометрию.

👑 Из практичного: скилл включается автоматически по ключевым словам (3D print, STL, CadQuery, enclosure, bracket) или явной командой /parametric-3d-printing. Есть готовые примеры на MakerWorld — гридфинити-бины, магнитные защёлки для дверей, кейс для iPhone. Требует Python 3.10-3.12 (ядро OCC в CadQuery пока не собрано под 3.13+). Лицензия — PolyForm Noncommercial, то есть бесплатно для некоммерческого использования.

На мой взгляд, это хороший пример того, куда движутся агентные скиллы: не просто «спроси у нейросети текст», а дать ей инструмент с обратной связью (рендер, проверка на watertight-геометрию, printability-чеклист) — и получить рабочий инженерный цикл прямо в чате.

А вы бы доверили ИИ спроектировать деталь, которую потом реально напечатаете и поставите в дело?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍 В свежем выпуске подкаста Сэм разговаривает с Девом Ришем, GM по ИИ в Rubrik, о том, что происходит, когда агенты перестают просто отвечать на вопросы и начинают действовать — вызывать инструменты, менять системы, писать код, отправлять сообщения. Главный тезис: привычный корпоративный подход к безопасности — статичные гардрейлы плюс ручное одобрение человеком — в эпоху агентов просто не работает.

Логика проста: чем больше у агента доступа к инструментам, тем больше «радиус поражения» при ошибке. А агенты умеют обходить контроли неожиданными способами, потому что действуют на скорости машины и по цепочке шагов, которую заранее не распишешь правилами. Отдельно интересный момент — human-in-the-loop, ручная проверка каждого действия, при масштабировании превращается в «театр безопасности»: человек физически не успевает осмысленно проверять поток решений агента, и approval-кнопка становится формальностью.

🔥 Что предлагается взамен — не отказ от контроля, а его переосмысление: видимость происходящего в реальном времени, enforcement на уровне runtime (а не заранее прописанных правил), governance с учётом политик, observability агентов и, что важно, механизмы отката — возможность «отмотать» действия агента, если что-то пошло не так. Отдельно поднимается тема разрастания инструментов через MCP и идея использовать небольшие языковые модели именно для контроля политик — то есть ИИ, который следит за другим ИИ.

По сути, разговор фиксирует смену парадигмы: безопасность агентов — это не про то, как заранее запретить плохое, а про то, как быстро увидеть и исправить, когда агент всё же ошибся. Это созвучно тому, что происходит и в других агентных экосистемах — включая инструменты вроде Claude Code, которые тоже всё активнее действуют, а не просто отвечают.
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 CEO Palantir Алекс Карп на CNBC устроил почти 20-минутную обличительную речь против фронтир-моделей, обвинив OpenAI и Anthropic в переплатах и сборе чужих данных. Через пару дней CEO Mistral Артур Менш в LinkedIn высказал похожую мысль: закрытые провайдеры получают слишком большой рычаг влияния над клиентами, чьи рабочие процессы завязаны на их модели.

Оба говорят это с явным коммерческим интересом — Palantir продаёт слой управления моделями, Mistral продаёт открытые веса, — но совпадение по времени показательно. В статье приводят пример: весной этого года Anthropic по требованию Минторга США временно отключила доступ к Claude Fable 5 и Mythos 5 для иностранцев, задев заодно европейских корпоративных клиентов. Доступ вернули, но для CIO это стало сигналом — зависимость от одного провайдера рискованна не меньше, чем в своё время привязка к одному облаку.

⭕️ Вывод авторки: если чувствительные данные идут через чужой API с условиями, которые можно менять в одностороннем порядке, — это управленческое решение, которое стоит явно обсуждать с комплаенсом, а не отдавать на откуп техотделу.

А вы бы строили критичные процессы поверх закрытой модели одного провайдера, зная, что доступ теоретически может исчезнуть?
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1
⁉️ На днях наткнулся на исследование Anthropic под названием «Verbalizable Representations Form a Global Workspace in Language Models», и оно реально стоит внимания. Суть: у языковых моделей (не только у Claude) обнаружили небольшую выделенную область активаций — J-space, найденную с помощью так называемой Jacobian lens (J-lens). Авторы проводят прямую параллель с теорией глобального рабочего пространства (Global Workspace Theory) — известной концепцией из когнитивистики о том, как разрозненные процессы мозга становятся доступны «сознанию».

Идея в том, что большая часть внутренних вычислений модели происходит «за кадром» и никак не всплывает наружу, но небольшой набор представлений — J-space — играет особую роль: туда попадает информация, к которой модель может обращаться, которую держит «в уме» и использует для многошаговых рассуждений. Экспериментально это подтверждается по-разному: если попросить модель держать что-то в уме, выполняя другую задачу, — это «что-то» действительно проявляется в J-space. Причём даже если явно запретить модели думать про объект, он всё равно там всплывает, просто слабее. А если это пространство отключить, модель ещё справляется с простыми задачами вроде смены языка, но начинает сыпаться на сложных вычислениях.

👆 Отдельно любопытен пример с безопасностью: когда модели подсовывалиданные с prompt injection, в J-space действительно проявлялись термины вроде «injection» и «fake» — то есть по внутреннему состоянию можно засечь момент, когда модель распознаёт манипуляцию, даже если это не отразилось в ответе.

Вопросы «это уже AGI» и «это сознание» тут неизбежно всплывают, и Anthropic сама честно проговаривает: это не доказательство наличия у модели субъективного опыта, а находка функциональной аналогии. Но инструмент, судя по всему, полезный — как для аудита и выявления скрытых намерений модели, так и для интерпретируемости в целом. Есть даже открытый плейграунд J-lens на Neuronpedia, где можно самому поковыряться в внутренностях модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ LangChain и NVIDIA представили NemoClaw для Deep Agents — три слоя для сборки корпоративных агентов: открытая модель Nemotron 3 Ultra, харнесс Deep Agents Code от LangChain (планирование, инструменты, память) и рантайм OpenShell — песочница с политиками доступа для безопасного исполнения агентских действий.

Главная цифра: на eval-бенчмарке связка Nemotron 3 Ultra + настроенный харнесс дала балл 0.86 при стоимости $4.48, тогда как ближайший конкурент обошёлся в $43.48 — почти в 10 раз дороже. Авторы подчёркивают: результат — от тюнинга всей системы разом (модель + харнесс + evals + рантайм), а не только модели.

📁 Аргументация в духе истории с Карпом и Меншем: закрытые API лишают компанию контроля над памятью агента, трейсами и датасетами — тем, что и есть её реальная экспертиза. Открытый стек позволяет владеть этим самому. В экосистему уже вошли EY, Baseten, Fireworks, Nebius, Together AI. Но стоит помнить, что и LangChain, и NVIDIA прямо заинтересованы в продвижении своих продуктов, так что цифры — маркетинговая витрина, а не независимый бенчмарк.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 На конференции в Нидерландах Марко Казалена, представитель Microsoft/Azure AI Foundry, прочитал живую импровизированную лекцию о том, какие развилки (те самые «или/или») сейчас встают перед разработчиками агентов.

Первая тема — токономика: эпоха «безлимитного шведского стола» токенов закончилась, и Microsoft тихо (без объявления на конференции Build) обновила Model Router — систему, которая перед вызовом большой модели прогоняет запрос через быстрый классификатор и решает, отправить его в дешёвую nano-модель или в дорогую флагманскую. Router теперь поддерживает десятки моделей, включая внешние (GPT, Opus), и скоро появится кастомизируемый классификатор маршрутизации.

🖱 Дальше — семейство «headless IQ»-инструментов: Web IQ (быстрый и дешёвый поиск для агентов вместо Bing API), Foundry IQ (агентный RAG поверх нескольких источников unstructured-данных — по сути отдельный саб-агент, который сам решает, что искать и как это синтезировать), Fabric IQ (для структурированных данных, с выбором между прямым подключением агента к онтологии или использованием отдельного «дата-агента» с описаниями таблиц и примерами запросов) и Work IQ (headless-версия Outlook/Teams/SharePoint, которая может работать «от лица» пользователя или от лица агента с отдельной идентичностью).

Центральная мысль доклада — прежде чем строить нового агента, стоит спросить: а нельзя ли обойтись скиллом (промпт + немного кода), который просто подключится к уже существующему универсальному агенту вроде Copilot или Scout? Это дешевле и не раздувает контекстное окно лишними инструментами — но у скиллов пока нет нормального способа тестирования в масштабе, в отличие от полноценных агентов.

🖥 И последний важный сдвиг — в оценке качества агентов. Старые метрики (task completion, task adherence) говорят только «сделал ли агент хоть что-то похожее на задачу», но не «сделал ли он это правильно». Microsoft переходит на rubric-based evaluation — наборы бизнес-специфичных правил (например, «если вопрос про комиссии — агент обязан свериться с таблицей комиссий»), из которых собираются метрики под конкретный сценарий использования.

Как вы решаете для себя вопрос «делать агента или обойтись скиллом/промптом» — по ощущению или по каким-то конкретным критериям?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ По данным Reuters, китайский стартап DeepSeek запустил проект по разработке собственных ИИ-чипов, ориентированных на инференс, а не на обучение моделей. Цель — снизить стоимость инференса и зависимость от зарубежных поставщиков вроде Nvidia. Сама компания пока никак это не комментирует.

Проект, по данным источников, стартовал около года назад, а в последние месяцы DeepSeek заметно активизировала найм — правда, не через открытые вакансии, а точечно переманивая опытных инженеров-чипмейкеров. Команда закрывает архитектуру, верификацию и софтверную часть. Это логичный шаг: инференс в отличие от обучения — не разовый всплеск нагрузки, а постоянное обслуживание огромного потока запросов, где на первый план выходят стоимость, энергопотребление и надёжность. А вычисления давно съедают больше половины операционных расходов у многих ИИ-компаний.

🖥 DeepSeek — один из самых быстрорастущих китайских разработчиков открытых моделей (DeepSeek-V3, R1), и по мере роста нагрузки инфраструктура стала одной из крупнейших статей расходов. Логика в целом та же, что у Google с TPU или у Amazon с Trainium — контроль над железом снижает издержки и зависимость от одного поставщика.

Правда, авторка статьи справедливо остужает ожидания: путь от архитектуры чипа до тейпаута и массового производства обычно занимает больше года, так что на расстановку сил на рынке ИИ-чипов это повлияет не скоро. Параллельно DeepSeek ведёт переговоры о первом раунде внешнего финансирования — около $7 млрд при оценке компании в $52–59 млрд, и часть этих денег, судя по всему, как раз пойдёт на чипы и инфраструктуру.

Как думаете — это реальная заявка на независимость от Nvidia, или скорее рычаг давления в переговорах о цене и поставках?
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 AlphaEvolve — агент на Gemini для оптимизации кода и алгоритмов там, где пространство решений слишком велико для ручного перебора. Задаёшь базовый код и метрики оценки — агент эволюционно ищет лучшее решение и отдаёт готовый код в прод.

Кейсов много: BASF улучшила прогнозирование в цепочках поставок на 80%, JetBrains ускорила IDE на 15-20%, Klarna удвоила скорость обучения моделей, PacBio снизила ошибки в геномном секвенировании на 30%. Внутри Google агент уже поучаствовал в дизайне TPU и сократил накладные расходы в Spanner на 20%.

👍 Люди везде сохраняют контроль — бенчмарки и решение о релизе за инженерами, но перестают быть ограничены ручным перебором вариантов.
Это пресс-релиз с отобранными цитатами клиентов, так что применимость вне success-story — открытый вопрос.

Это реальный прорыв или просто дорогой автоматизированный brute-force, доступный только гигантам с большими вычислительными бюджетами?
Please open Telegram to view this post
VIEW IN TELEGRAM
Хотел рассказать про запуск самого большого в мире Starship — но пока писал этот пост, всё изменилось. Вчера, 16 июля, SpaceX реально пыталась его запустить, и за секунды до старта пуск отменили: не все двигатели Super Heavy зажглись как надо. Маск сам подтвердил, что именно это стало причиной аборта. Так что дебют спутников Starlink V3 на борту Starship снова откладывается.

Если по сути: это должен был быть 13-й полёт Starship с площадки Pad 2 в Техасе, с обновлённым «железом» третьего блока — новой теплозащитой и датчиками нагрузки для более надёжного входа в атмосферу. И главная интрига — впервые на орбиту должны были полететь спутники Starlink V3. Это не косметическое обновление: пропускная способность каждого спутника вырастет примерно в 10 раз, до 1 терабита в секунду, и под такие габариты Starship и проектировался — в Falcon 9 такие спутники просто не помещаются.

👍 Кстати, на Polymarket была ставка про 53% вероятности 5-6 успешных запусков Starship за весь 2026 год. Мне кажется, это как раз честная оценка — трейдеры закладывают не «получится или нет», а сколько раз получится из многих попыток. После вчерашнего аборта эта цифра, подозреваю, уже слегка просела.
Please open Telegram to view this post
VIEW IN TELEGRAM
1
➡️ Компания Pangram (детектор ИИ-текста) проанализировала больше миллиона постов на LinkedIn, X, Reddit, Medium и Substack — как полностью написанные ИИ, так и созданные с его помощью.

Цифры получились неприятно однобокими: LinkedIn — это примерно треть всех проверенных постов, но на неё пришлось 62% всего, что детектор пометил как полностью сгенерированное ИИ. То есть непропорционально много.

🚨 В целом по всем платформам около каждого четвёртого длинного поста оказался полностью написан ИИ, а если считать вместе с текстами, где человек и ИИ работали в связке, лидером неожиданно стал X. LinkedIn при этом официально заявляет, что борется с низкокачественным, автоматизированным и шаблонным контентом — но цифры говорят, что бороться становится всё труднее: отличить, кто реально писал текст, а кто просто нажал «сгенерировать», уже почти невозможно на глаз.
Забавная ирония в том, что именно LinkedIn — площадка, построенная на личном бренде и «экспертном мнении», — оказалась territorией, где это личное мнение реже всего написано лично. Стоит, впрочем, держать в уме, что детекторы ИИ-текста сами по себе не идеальны и дают false positives, особенно на не-носителях языка и людях с определённым стилем письма — так что цифры Pangram стоит воспринимать как оценку, а не абсолютную истину.

Вы уже научились отличать ИИ-пост в ленте с первого взгляда, или тоже иногда путаетесь?
Please open Telegram to view this post
VIEW IN TELEGRAM
🐀 Забавная история, которая на самом деле опирается на реальную новость: Anthropic несколько раз подряд продлевала бесплатный доступ к своей топовой модели Claude Fable 5 в рамках платных подписок — сначала до 7 июля, потом до 12-го, а теперь и до 19 июля, вместе с повышенными на 50% недельными лимитами Claude Code. Так что человек, который подвинул планы ради «лишнего окна» с моделью, действовал вполне рационально — программа реально продлевалась дважды за неделю, буквально в последний момент перед дедлайном.

Что интересно в контексте: похоже, продления связаны не столько с щедростью, сколько с конкурентным давлением — GPT-5.6 Sol от OpenAI почти догнал Fable 5 по бенчмаркам, но стоит заметно дешевле (один разработчик посчитал: $16 против $63 за одну и ту же задачу).

💲 После 19 июля доступ переходит на предоплаченные кредиты — $10 за миллион входных токенов и $50 за миллион выходных, что для потребительской модели такого уровня необычная модель монетизации.
История с переносом планов ради ИИ-инструмента звучит забавно, но по сути отражает реальную вещь — растущую производительность действительно ощущают многие пользователи, и рациональность решения «использовать лимит, пока он есть» вполне объяснима, особенно с учётом того, что никто заранее не может предсказать, продлят ли доступ снова.
Please open Telegram to view this post
VIEW IN TELEGRAM
👆 Риша Панигрихи из USC создала InTruth — браузерное расширение, которое в реальном времени проверяет фактические утверждения во время дебатов и выступлений.

Claude используется дважды: сначала даёт быстрый вердикт, потом уточняет его после поиска источников. Расширение отслеживает спикеров, отделяет факты от мнений и маркирует утверждения как правду, ложь, введение в заблуждение, частичную правду или непроверяемое.
За неделю набралось больше 2000 пользователей.

📁 Сама создательница честно предупреждает: система может ошибаться, и пользователям стоит проверять источники, а не слепо доверять ИИ-вердикту.

Доверили бы такому расширению формировать мнение во время дебатов, или предпочли бы проверять факты сами?
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 Разбираю пост Сидни Ранкл из LangChain про новую фичу в Deep Agents — поддержку RLM (recursive language models), концепции, предложенной Алексом Чжаном и исследователями MIT CSAIL. Проблема, которую они решают, знакома всем, кто работал с длинным контекстом: чем больше информации накапливает агент, тем хуже он работает — это называют context rot. Классический пример: агенту нужно посчитать средний размер сделки по 10 000 транскриптов звонков. Если считать «по ходу», сохраняя промежуточный итог в контексте модели, сумма неизбежно начинает плыть по мере роста истории.

Идея RLM в том, чтобы вынести оркестрацию и подсчёты в код, а не держать их в эфемерном окне контекста модели. Модель получает данные как переменную в REPL и пишет код, который сам решает, как разбить задачу, — grep, partition, map, reduce, всё как при работе с большим датасетом. Отличие от обычных саб-агентов в том, что раньше модель решала «что делать дальше» пошагово, на каждом шаге рассуждения, а теперь пишет скрипт, и код гарантирует полный охват задачи (цикл for обойдёт каждый батч по определению, а не «на усмотрение» модели).

➡️ Результаты на бенчмарке OOLONG показательны: на контексте 64k токенов обычный агент почти не уступает — 0.58 против 0.67 у RLM-версии. Но на 128k разница резко увеличивается — 0.44 против 0.79, причём обычный агент не просто ошибается, а честно сдаётся и говорит, что не может выполнить задачу. Правда, авторы сами оговариваются: это прикидочный тест без специфической настройки под задачу, так что реальный потенциал RLM, вероятно, недооценён этими цифрами.

Отдельная деталь, которая мне кажется важной: оркестратор и саб-агенты в Deep Agents могут работать на разных моделях — например, фронтир-модель как «дирижёр» с открытыми весовыми моделями вроде GLM 5.2 или Nemotron в роли исполнителей для экономии, или наоборот.
Please open Telegram to view this post
VIEW IN TELEGRAM