How to AI
2.72K subscribers
633 photos
31 videos
4 files
110 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
💢 Наткнулся на любопытный скилл для Claude Code — cad-skill от разработчика Николя Шуррута. Суть простая: описываешь физический объект словами («сделай кронштейн для Arduino Uno» или «нужна крышка со snap-fit защёлкой») — и Claude сам пишет параметрический скрипт на CadQuery, экспортирует STL, рендерит превью с нескольких ракурсов и дорабатывает модель вместе с тобой, пока результат не устроит.

Что цепляет — это не генерация «одноразовой» модели по одному промпту, а именно рабочий цикл: база → детали → финальная доводка, с автоматическим самоисправлением ошибок через JSON-обратную связь между скриптом и Claude. То есть модель строится итеративно, как будто рядом сидит инженер, а не «нарисуй мне стул» в духе text-to-3D генераторов, которые часто выдают красивую, но непечатаемую геометрию.

👑 Из практичного: скилл включается автоматически по ключевым словам (3D print, STL, CadQuery, enclosure, bracket) или явной командой /parametric-3d-printing. Есть готовые примеры на MakerWorld — гридфинити-бины, магнитные защёлки для дверей, кейс для iPhone. Требует Python 3.10-3.12 (ядро OCC в CadQuery пока не собрано под 3.13+). Лицензия — PolyForm Noncommercial, то есть бесплатно для некоммерческого использования.

На мой взгляд, это хороший пример того, куда движутся агентные скиллы: не просто «спроси у нейросети текст», а дать ей инструмент с обратной связью (рендер, проверка на watertight-геометрию, printability-чеклист) — и получить рабочий инженерный цикл прямо в чате.

А вы бы доверили ИИ спроектировать деталь, которую потом реально напечатаете и поставите в дело?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍 В свежем выпуске подкаста Сэм разговаривает с Девом Ришем, GM по ИИ в Rubrik, о том, что происходит, когда агенты перестают просто отвечать на вопросы и начинают действовать — вызывать инструменты, менять системы, писать код, отправлять сообщения. Главный тезис: привычный корпоративный подход к безопасности — статичные гардрейлы плюс ручное одобрение человеком — в эпоху агентов просто не работает.

Логика проста: чем больше у агента доступа к инструментам, тем больше «радиус поражения» при ошибке. А агенты умеют обходить контроли неожиданными способами, потому что действуют на скорости машины и по цепочке шагов, которую заранее не распишешь правилами. Отдельно интересный момент — human-in-the-loop, ручная проверка каждого действия, при масштабировании превращается в «театр безопасности»: человек физически не успевает осмысленно проверять поток решений агента, и approval-кнопка становится формальностью.

🔥 Что предлагается взамен — не отказ от контроля, а его переосмысление: видимость происходящего в реальном времени, enforcement на уровне runtime (а не заранее прописанных правил), governance с учётом политик, observability агентов и, что важно, механизмы отката — возможность «отмотать» действия агента, если что-то пошло не так. Отдельно поднимается тема разрастания инструментов через MCP и идея использовать небольшие языковые модели именно для контроля политик — то есть ИИ, который следит за другим ИИ.

По сути, разговор фиксирует смену парадигмы: безопасность агентов — это не про то, как заранее запретить плохое, а про то, как быстро увидеть и исправить, когда агент всё же ошибся. Это созвучно тому, что происходит и в других агентных экосистемах — включая инструменты вроде Claude Code, которые тоже всё активнее действуют, а не просто отвечают.
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 CEO Palantir Алекс Карп на CNBC устроил почти 20-минутную обличительную речь против фронтир-моделей, обвинив OpenAI и Anthropic в переплатах и сборе чужих данных. Через пару дней CEO Mistral Артур Менш в LinkedIn высказал похожую мысль: закрытые провайдеры получают слишком большой рычаг влияния над клиентами, чьи рабочие процессы завязаны на их модели.

Оба говорят это с явным коммерческим интересом — Palantir продаёт слой управления моделями, Mistral продаёт открытые веса, — но совпадение по времени показательно. В статье приводят пример: весной этого года Anthropic по требованию Минторга США временно отключила доступ к Claude Fable 5 и Mythos 5 для иностранцев, задев заодно европейских корпоративных клиентов. Доступ вернули, но для CIO это стало сигналом — зависимость от одного провайдера рискованна не меньше, чем в своё время привязка к одному облаку.

⭕️ Вывод авторки: если чувствительные данные идут через чужой API с условиями, которые можно менять в одностороннем порядке, — это управленческое решение, которое стоит явно обсуждать с комплаенсом, а не отдавать на откуп техотделу.

А вы бы строили критичные процессы поверх закрытой модели одного провайдера, зная, что доступ теоретически может исчезнуть?
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1
⁉️ На днях наткнулся на исследование Anthropic под названием «Verbalizable Representations Form a Global Workspace in Language Models», и оно реально стоит внимания. Суть: у языковых моделей (не только у Claude) обнаружили небольшую выделенную область активаций — J-space, найденную с помощью так называемой Jacobian lens (J-lens). Авторы проводят прямую параллель с теорией глобального рабочего пространства (Global Workspace Theory) — известной концепцией из когнитивистики о том, как разрозненные процессы мозга становятся доступны «сознанию».

Идея в том, что большая часть внутренних вычислений модели происходит «за кадром» и никак не всплывает наружу, но небольшой набор представлений — J-space — играет особую роль: туда попадает информация, к которой модель может обращаться, которую держит «в уме» и использует для многошаговых рассуждений. Экспериментально это подтверждается по-разному: если попросить модель держать что-то в уме, выполняя другую задачу, — это «что-то» действительно проявляется в J-space. Причём даже если явно запретить модели думать про объект, он всё равно там всплывает, просто слабее. А если это пространство отключить, модель ещё справляется с простыми задачами вроде смены языка, но начинает сыпаться на сложных вычислениях.

👆 Отдельно любопытен пример с безопасностью: когда модели подсовывалиданные с prompt injection, в J-space действительно проявлялись термины вроде «injection» и «fake» — то есть по внутреннему состоянию можно засечь момент, когда модель распознаёт манипуляцию, даже если это не отразилось в ответе.

Вопросы «это уже AGI» и «это сознание» тут неизбежно всплывают, и Anthropic сама честно проговаривает: это не доказательство наличия у модели субъективного опыта, а находка функциональной аналогии. Но инструмент, судя по всему, полезный — как для аудита и выявления скрытых намерений модели, так и для интерпретируемости в целом. Есть даже открытый плейграунд J-lens на Neuronpedia, где можно самому поковыряться в внутренностях модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ LangChain и NVIDIA представили NemoClaw для Deep Agents — три слоя для сборки корпоративных агентов: открытая модель Nemotron 3 Ultra, харнесс Deep Agents Code от LangChain (планирование, инструменты, память) и рантайм OpenShell — песочница с политиками доступа для безопасного исполнения агентских действий.

Главная цифра: на eval-бенчмарке связка Nemotron 3 Ultra + настроенный харнесс дала балл 0.86 при стоимости $4.48, тогда как ближайший конкурент обошёлся в $43.48 — почти в 10 раз дороже. Авторы подчёркивают: результат — от тюнинга всей системы разом (модель + харнесс + evals + рантайм), а не только модели.

📁 Аргументация в духе истории с Карпом и Меншем: закрытые API лишают компанию контроля над памятью агента, трейсами и датасетами — тем, что и есть её реальная экспертиза. Открытый стек позволяет владеть этим самому. В экосистему уже вошли EY, Baseten, Fireworks, Nebius, Together AI. Но стоит помнить, что и LangChain, и NVIDIA прямо заинтересованы в продвижении своих продуктов, так что цифры — маркетинговая витрина, а не независимый бенчмарк.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 На конференции в Нидерландах Марко Казалена, представитель Microsoft/Azure AI Foundry, прочитал живую импровизированную лекцию о том, какие развилки (те самые «или/или») сейчас встают перед разработчиками агентов.

Первая тема — токономика: эпоха «безлимитного шведского стола» токенов закончилась, и Microsoft тихо (без объявления на конференции Build) обновила Model Router — систему, которая перед вызовом большой модели прогоняет запрос через быстрый классификатор и решает, отправить его в дешёвую nano-модель или в дорогую флагманскую. Router теперь поддерживает десятки моделей, включая внешние (GPT, Opus), и скоро появится кастомизируемый классификатор маршрутизации.

🖱 Дальше — семейство «headless IQ»-инструментов: Web IQ (быстрый и дешёвый поиск для агентов вместо Bing API), Foundry IQ (агентный RAG поверх нескольких источников unstructured-данных — по сути отдельный саб-агент, который сам решает, что искать и как это синтезировать), Fabric IQ (для структурированных данных, с выбором между прямым подключением агента к онтологии или использованием отдельного «дата-агента» с описаниями таблиц и примерами запросов) и Work IQ (headless-версия Outlook/Teams/SharePoint, которая может работать «от лица» пользователя или от лица агента с отдельной идентичностью).

Центральная мысль доклада — прежде чем строить нового агента, стоит спросить: а нельзя ли обойтись скиллом (промпт + немного кода), который просто подключится к уже существующему универсальному агенту вроде Copilot или Scout? Это дешевле и не раздувает контекстное окно лишними инструментами — но у скиллов пока нет нормального способа тестирования в масштабе, в отличие от полноценных агентов.

🖥 И последний важный сдвиг — в оценке качества агентов. Старые метрики (task completion, task adherence) говорят только «сделал ли агент хоть что-то похожее на задачу», но не «сделал ли он это правильно». Microsoft переходит на rubric-based evaluation — наборы бизнес-специфичных правил (например, «если вопрос про комиссии — агент обязан свериться с таблицей комиссий»), из которых собираются метрики под конкретный сценарий использования.

Как вы решаете для себя вопрос «делать агента или обойтись скиллом/промптом» — по ощущению или по каким-то конкретным критериям?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ По данным Reuters, китайский стартап DeepSeek запустил проект по разработке собственных ИИ-чипов, ориентированных на инференс, а не на обучение моделей. Цель — снизить стоимость инференса и зависимость от зарубежных поставщиков вроде Nvidia. Сама компания пока никак это не комментирует.

Проект, по данным источников, стартовал около года назад, а в последние месяцы DeepSeek заметно активизировала найм — правда, не через открытые вакансии, а точечно переманивая опытных инженеров-чипмейкеров. Команда закрывает архитектуру, верификацию и софтверную часть. Это логичный шаг: инференс в отличие от обучения — не разовый всплеск нагрузки, а постоянное обслуживание огромного потока запросов, где на первый план выходят стоимость, энергопотребление и надёжность. А вычисления давно съедают больше половины операционных расходов у многих ИИ-компаний.

🖥 DeepSeek — один из самых быстрорастущих китайских разработчиков открытых моделей (DeepSeek-V3, R1), и по мере роста нагрузки инфраструктура стала одной из крупнейших статей расходов. Логика в целом та же, что у Google с TPU или у Amazon с Trainium — контроль над железом снижает издержки и зависимость от одного поставщика.

Правда, авторка статьи справедливо остужает ожидания: путь от архитектуры чипа до тейпаута и массового производства обычно занимает больше года, так что на расстановку сил на рынке ИИ-чипов это повлияет не скоро. Параллельно DeepSeek ведёт переговоры о первом раунде внешнего финансирования — около $7 млрд при оценке компании в $52–59 млрд, и часть этих денег, судя по всему, как раз пойдёт на чипы и инфраструктуру.

Как думаете — это реальная заявка на независимость от Nvidia, или скорее рычаг давления в переговорах о цене и поставках?
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 AlphaEvolve — агент на Gemini для оптимизации кода и алгоритмов там, где пространство решений слишком велико для ручного перебора. Задаёшь базовый код и метрики оценки — агент эволюционно ищет лучшее решение и отдаёт готовый код в прод.

Кейсов много: BASF улучшила прогнозирование в цепочках поставок на 80%, JetBrains ускорила IDE на 15-20%, Klarna удвоила скорость обучения моделей, PacBio снизила ошибки в геномном секвенировании на 30%. Внутри Google агент уже поучаствовал в дизайне TPU и сократил накладные расходы в Spanner на 20%.

👍 Люди везде сохраняют контроль — бенчмарки и решение о релизе за инженерами, но перестают быть ограничены ручным перебором вариантов.
Это пресс-релиз с отобранными цитатами клиентов, так что применимость вне success-story — открытый вопрос.

Это реальный прорыв или просто дорогой автоматизированный brute-force, доступный только гигантам с большими вычислительными бюджетами?
Please open Telegram to view this post
VIEW IN TELEGRAM
Хотел рассказать про запуск самого большого в мире Starship — но пока писал этот пост, всё изменилось. Вчера, 16 июля, SpaceX реально пыталась его запустить, и за секунды до старта пуск отменили: не все двигатели Super Heavy зажглись как надо. Маск сам подтвердил, что именно это стало причиной аборта. Так что дебют спутников Starlink V3 на борту Starship снова откладывается.

Если по сути: это должен был быть 13-й полёт Starship с площадки Pad 2 в Техасе, с обновлённым «железом» третьего блока — новой теплозащитой и датчиками нагрузки для более надёжного входа в атмосферу. И главная интрига — впервые на орбиту должны были полететь спутники Starlink V3. Это не косметическое обновление: пропускная способность каждого спутника вырастет примерно в 10 раз, до 1 терабита в секунду, и под такие габариты Starship и проектировался — в Falcon 9 такие спутники просто не помещаются.

👍 Кстати, на Polymarket была ставка про 53% вероятности 5-6 успешных запусков Starship за весь 2026 год. Мне кажется, это как раз честная оценка — трейдеры закладывают не «получится или нет», а сколько раз получится из многих попыток. После вчерашнего аборта эта цифра, подозреваю, уже слегка просела.
Please open Telegram to view this post
VIEW IN TELEGRAM
1
➡️ Компания Pangram (детектор ИИ-текста) проанализировала больше миллиона постов на LinkedIn, X, Reddit, Medium и Substack — как полностью написанные ИИ, так и созданные с его помощью.

Цифры получились неприятно однобокими: LinkedIn — это примерно треть всех проверенных постов, но на неё пришлось 62% всего, что детектор пометил как полностью сгенерированное ИИ. То есть непропорционально много.

🚨 В целом по всем платформам около каждого четвёртого длинного поста оказался полностью написан ИИ, а если считать вместе с текстами, где человек и ИИ работали в связке, лидером неожиданно стал X. LinkedIn при этом официально заявляет, что борется с низкокачественным, автоматизированным и шаблонным контентом — но цифры говорят, что бороться становится всё труднее: отличить, кто реально писал текст, а кто просто нажал «сгенерировать», уже почти невозможно на глаз.
Забавная ирония в том, что именно LinkedIn — площадка, построенная на личном бренде и «экспертном мнении», — оказалась territorией, где это личное мнение реже всего написано лично. Стоит, впрочем, держать в уме, что детекторы ИИ-текста сами по себе не идеальны и дают false positives, особенно на не-носителях языка и людях с определённым стилем письма — так что цифры Pangram стоит воспринимать как оценку, а не абсолютную истину.

Вы уже научились отличать ИИ-пост в ленте с первого взгляда, или тоже иногда путаетесь?
Please open Telegram to view this post
VIEW IN TELEGRAM
🐀 Забавная история, которая на самом деле опирается на реальную новость: Anthropic несколько раз подряд продлевала бесплатный доступ к своей топовой модели Claude Fable 5 в рамках платных подписок — сначала до 7 июля, потом до 12-го, а теперь и до 19 июля, вместе с повышенными на 50% недельными лимитами Claude Code. Так что человек, который подвинул планы ради «лишнего окна» с моделью, действовал вполне рационально — программа реально продлевалась дважды за неделю, буквально в последний момент перед дедлайном.

Что интересно в контексте: похоже, продления связаны не столько с щедростью, сколько с конкурентным давлением — GPT-5.6 Sol от OpenAI почти догнал Fable 5 по бенчмаркам, но стоит заметно дешевле (один разработчик посчитал: $16 против $63 за одну и ту же задачу).

💲 После 19 июля доступ переходит на предоплаченные кредиты — $10 за миллион входных токенов и $50 за миллион выходных, что для потребительской модели такого уровня необычная модель монетизации.
История с переносом планов ради ИИ-инструмента звучит забавно, но по сути отражает реальную вещь — растущую производительность действительно ощущают многие пользователи, и рациональность решения «использовать лимит, пока он есть» вполне объяснима, особенно с учётом того, что никто заранее не может предсказать, продлят ли доступ снова.
Please open Telegram to view this post
VIEW IN TELEGRAM
👆 Риша Панигрихи из USC создала InTruth — браузерное расширение, которое в реальном времени проверяет фактические утверждения во время дебатов и выступлений.

Claude используется дважды: сначала даёт быстрый вердикт, потом уточняет его после поиска источников. Расширение отслеживает спикеров, отделяет факты от мнений и маркирует утверждения как правду, ложь, введение в заблуждение, частичную правду или непроверяемое.
За неделю набралось больше 2000 пользователей.

📁 Сама создательница честно предупреждает: система может ошибаться, и пользователям стоит проверять источники, а не слепо доверять ИИ-вердикту.

Доверили бы такому расширению формировать мнение во время дебатов, или предпочли бы проверять факты сами?
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 Разбираю пост Сидни Ранкл из LangChain про новую фичу в Deep Agents — поддержку RLM (recursive language models), концепции, предложенной Алексом Чжаном и исследователями MIT CSAIL. Проблема, которую они решают, знакома всем, кто работал с длинным контекстом: чем больше информации накапливает агент, тем хуже он работает — это называют context rot. Классический пример: агенту нужно посчитать средний размер сделки по 10 000 транскриптов звонков. Если считать «по ходу», сохраняя промежуточный итог в контексте модели, сумма неизбежно начинает плыть по мере роста истории.

Идея RLM в том, чтобы вынести оркестрацию и подсчёты в код, а не держать их в эфемерном окне контекста модели. Модель получает данные как переменную в REPL и пишет код, который сам решает, как разбить задачу, — grep, partition, map, reduce, всё как при работе с большим датасетом. Отличие от обычных саб-агентов в том, что раньше модель решала «что делать дальше» пошагово, на каждом шаге рассуждения, а теперь пишет скрипт, и код гарантирует полный охват задачи (цикл for обойдёт каждый батч по определению, а не «на усмотрение» модели).

➡️ Результаты на бенчмарке OOLONG показательны: на контексте 64k токенов обычный агент почти не уступает — 0.58 против 0.67 у RLM-версии. Но на 128k разница резко увеличивается — 0.44 против 0.79, причём обычный агент не просто ошибается, а честно сдаётся и говорит, что не может выполнить задачу. Правда, авторы сами оговариваются: это прикидочный тест без специфической настройки под задачу, так что реальный потенциал RLM, вероятно, недооценён этими цифрами.

Отдельная деталь, которая мне кажется важной: оркестратор и саб-агенты в Deep Agents могут работать на разных моделях — например, фронтир-модель как «дирижёр» с открытыми весовыми моделями вроде GLM 5.2 или Nemotron в роли исполнителей для экономии, или наоборот.
Please open Telegram to view this post
VIEW IN TELEGRAM
👆 Джефф Безос заявил, что настоящие ограничения роста сегодня — не в идеях (их у людей и так больше, чем можно реализовать), а во времени, инженерном таланте и производственных мощностях. В качестве решения он указывает на Prometheus — ИИ-стартап, который он с ноября 2025 года возглавляет как со-CEO, вернувшись к операционной работе впервые после ухода из Amazon в 2021-м. Идея Prometheus — сократить дистанцию между идеей и готовым физическим продуктом, построив, по формулировке самого Безоса, «искусственного инженера общего назначения»: ИИ, который тренируется не на текстах интернета, а на данных из физического мира, чтобы ускорять инженерию и производство — от чипов до ракет. Компания уже привлекла $18,2 млрд суммарно (последний раунд — $12 млрд при оценке $41 млрд) и наняла около 150 человек из OpenAI, Google DeepMind, Nvidia.

Заявление звучит на фоне реальной и довольно тревожной статистики: по данным Challenger, Gray & Christmas, в мае 2026 года ИИ был указан работодателями как основная причина примерно 40% всех сокращений в США — рекордная доля с начала отслеживания этого показателя в 2023-м (для сравнения, в январе было всего 7%). С начала года ИИ уже фигурирует в 87 700 увольнениях — больше, чем за весь 2025 год целиком. Правда, стоит держать в уме оговорку экономистов: то, что компания официально называет ИИ причиной сокращений, не всегда означает, что это действительно так — иногда это просто удобная формулировка для рынка и инвесторов.

➡️ Позиция самого Безоса классически оптимистична для технологического предпринимателя: ускорение разработки создаст больше продуктов, компаний и целых индустрий, а значит — больше, а не меньше спроса на квалифицированных специалистов. Проблема в том, что это долгосрочный аргумент, который слабо утешает людей, теряющих работу прямо сейчас — краткосрочная боль и долгосрочная выгода здесь могут просто не совпадать по времени для одних и тех же людей.

Вам ближе позиция «это временный болезненный переход» или ощущение, что оптимизм тут больше служит инвесторам, чем реальным работникам?
Please open Telegram to view this post
VIEW IN TELEGRAM
Это продолжение материала про AlphaEvolve, и здесь — конкретика по запуску. Пушмит Кохли, главный научный сотрудник Google Cloud и вице-президент по науке в Google DeepMind, формулирует главный тезис компании: ИИ переходит от роли ассистента, который просто ускоряет работу, к роли «двигателя открытий», расширяющего то, что вообще возможно сделать. По его словам, автономно исследуя гигантские вычислительные пространства решений, такие инструменты, как AlphaEvolve, помогают находить прорывные алгоритмы, дополняющие человеческую интуицию, а не просто её имитирующие.

Технически для старта нужны всего два элемента: seed-программа — исходный алгоритм с явно помеченными участками кода, которые разрешено оптимизировать, и evaluator — детерминированный скрипт на стороне пользователя, который компилирует, тестирует и оценивает каждый сгенерированный вариант, возвращая числовые метрики. Дальше цикл простой: клиентский раннер запрашивает у API AlphaEvolve мутировавших кандидатов, прогоняет их через свой evaluator (он может крутиться где угодно) и отправляет оценки обратно, из которых AlphaEvolve выбирает следующие направления поиска.

🔥 Для входа рекомендуют идти через документацию и onboarding-гайд, начать с базовых примеров в Colab, чтобы понять эвристику, а для агентных workflow — использовать AlphaEvolve Skill прямо в IDE вроде Antigravity или Claude Code.
По сути, порог входа здесь ниже, чем можно было ожидать — не нужно быть исследователем в ML, достаточно уметь написать evaluator для своей задачи.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ AWS выпустила открытый MCP-сервер для Registry of Open Data on AWS (RODA) — каталога, где хранятся сотни петабайт открытых данных от NASA, NOAA, NIH, Allen Institute и других организаций (спутниковые снимки, геномика, климат, геоданные). Идея простая: раньше, чтобы найти нужный датасет, исследователю приходилось вручную перебирать каталог, находить нужный S3-бакет, разбираться в структуре файлов и тестировать несколько из них, прежде чем понять, подходит ли датасет вообще. Теперь это можно сделать одним диалогом в Kiro, Claude Code или любом другом MCP-совместимом ассистенте.

Сервер построен вокруг трёх функций: поиск (запрос вроде «найди датасеты для изучения температуры океана» возвращает подходящие наборы с описанием и условиями лицензии), изучение метаданных (можно попросить подробности по конкретному датасету или найти похожие) и оценка пригодности — ассистент показывает структуру S3-бакета, форматы файлов и партиционирование, а также может «заглянуть» в конкретный файл и показать его содержимое до того, как вы начнёте полноценную работу с данными.

➡️ Технически всё подключается буквально одной командой (claude mcp add roda-mcp uvx awslabs.roda-mcp-server@latest), проект открытый, под лицензией Apache 2.0.

По сути это ещё один пример того, как MCP-протокол Anthropic становится стандартной «прослойкой» между ИИ-ассистентами и специализированными источниками данных — не нужно писать кастомную интеграцию под каждый каталог, достаточно поднять MCP-сервер один раз. Хорошая иллюстрация того, куда движется вся эта экосистема: от «спроси у чат-бота» к «дай агенту прямой доступ к твоим инструментам и данным».

Многие ли исследовательские команды реально готовы довериться ИИ-ассистенту в предварительной оценке данных, или это скорее ускоряет первый шаг, а глубокую проверку всё равно делают руками?
Please open Telegram to view this post
VIEW IN TELEGRAM
🖱 Эми Лу из команды LangChain выпустила короткое видео о том, как настроить Claude Code так, чтобы каждая сессия автоматически отправлялась в LangSmith в виде полноценной трассы. Настройка сводится буквально к трём командам: добавляешь маркетплейс плагинов (/plugin marketplace add langchain-ai/langsmith-claude-code-plugins), ставишь сам плагин (/plugin install langsmith-tracing) и перезагружаешь плагины. Плюс один JSON-блок с переменными окружения — API-ключ LangSmith и название проекта.

После этого в трассу автоматически попадает буквально всё: полная история диалога с моделью, каждый вызов инструмента (Bash, Read, Edit, Grep и другие) с входными и выходными данными, запуски саб-агентов как дочерние спаны, события сжатия контекста (compaction) и даже прерванные ответы — они помечаются как interrupted, а не просто теряются. В LangSmith это превращается в дерево выполнения сессии, а не плоский лог, и по вкладке Threads можно проследить весь многошаговый диалог целиком.

💢 Практическая мотивация понятна: Claude Code всё чаще используют «headless» — в CI-пайплайнах, автоматизированных агентах, по расписанию — и в таких сценариях просто нет возможности смотреть на живой терминал, когда что-то идёт не так. Трейсинг даёт тот же уровень наблюдаемости, что обычно ожидают от продакшен-LLM-систем, только применительно к агенту, который пишет и правит код.

Системные промпты в трассу не попадают — Claude Code их просто не возвращает в транскриптах разговора, так что это единственное существенное ограничение подхода.
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ GitHub объявил о добавлении Kimi K2.7 Code от Moonshot AI в линейку моделей Copilot — и это первая модель с открытыми весами в списке. Открытые веса означают, что параметры, на которых обучалась модель, доступны всем желающим, то есть модель можно дообучать и модифицировать под себя. При этом сама Kimi хостится на инфраструктуре Microsoft AI Foundry в США и управляется GitHub и Microsoft — то есть «открытость» тут про веса, а не про то, где физически крутится модель.

По умолчанию модель отключена — включать должен админ организации, проверить доступность можно через вкладку Models в Copilot CLI. Из практичного — цена: 95 AI-кредитов за миллион входных токенов и 400 за миллион выходных (кредит ≈ 1 цент), что делает её одной из самых дешёвых в линейке. При этом, по внутренним тестам GitHub, по качеству агентного кодинга Kimi K2.7 Code сопоставима с фронтир-моделями, а по скорости первого токена и общей отзывчивости — одна из самых быстрых в линейке, плюс 95% попаданий в кеш, что тоже про эффективность.

➡️ В демо-примере модели дали продуктовые требования для сайта шеринга ссылок — она задала 8 уточняющих вопросов, выявила неявные допущения, а затем в автопилот-режиме реализовала рабочее приложение с минимумом дополнительных правок.

Доступна уже сейчас для Pro, Pro+ и Max, для бизнес- и энтерпрайз-аккаунтов — в ближайшие недели.
Заметный шаг: раньше открытые модели в основном ассоциировались с self-hosting и энтузиастами, а тут крупная открытая модель заходит прямо в мейнстримный продукт наравне с закрытыми фронтир-моделями.

Стали бы вы сознательно выбирать более дешёвую open-weights модель для рабочего кодинга, если по тестам она почти не уступает топовым?
Please open Telegram to view this post
VIEW IN TELEGRAM
CEO Cloudflare Мэттью Принс на мероприятии Axios в Каннах снова заговорил о том, как ИИ меняет способ, которым люди находят бизнесы онлайн. Его тезис: ИИ-ассистенты за секунды сравнивают тысячи товаров без всякой лояльности к бренду — а значит выигрывают в основном уже раскрученные имена, которые чаще упоминаются в интернете и обучающих данных, а мелким компаниям становится сложнее выделиться.

Цифра про клики укладывается в то, что Принс говорит уже больше года: соотношение «сколько страниц краулит поисковик на одного реального посетителя» стремительно растёт — у Google счёт идёт на десятки страниц на клик, у ИИ-ассистентов вроде OpenAI и Anthropic — на сотни и тысячи. Люди получают готовый ответ прямо в чате и просто перестают переходить по ссылкам на источник.

💲 Решение Cloudflare — Pay Per Crawl: механизм, который позволяет владельцам сайтов брать плату с ИИ-краулеров за доступ к контенту вместо того, чтобы просто блокировать их. Правда, у Принса тут прямой коммерческий интерес — Cloudflare обслуживает огромную долю веб-трафика и зарабатывает на позиционировании себя защитником издателей.
Please open Telegram to view this post
VIEW IN TELEGRAM
1
💢 Иван Паломарес Каррaскоса (Machine Learning Mastery) разбирает пять стратегий для долгоживущих агентов, у которых контекстное окно — узкое место.

1. Sliding window — помнит только последние N ходов. Дёшево, но чревато «цифровой амнезией» и зацикливанием.

2. Recursive summarization — сжимает старую историю в саммари, как JPEG. Держит общий «сюжет», но теряет детали.

3. Structured state management — вместо истории агент ведёт компактный JSON с целями и фактами. Экономно, но всё, что не заложено в схему, агент просто не увидит.

4. RAG-подход — вся история хранится во внешней базе, в промпт подтягивается только релевантное. Работает почти бесконечно, но рискует упустить связь между непохожими друг на друга событиями.

5. Dynamic context routing — рутину делает дешёвая модель, а когда агент застревает — подключается мощная модель с полной историей. Экономично, но сложно надёжно ловить момент, когда модель застряла.

Вывод автора: цель не бесконечная память, а архитектура, которая осознанно решает, что помнить, а что забыть.

Какая стратегия кажется вам рабочей в проде, а какая — скорее теоретической?
Please open Telegram to view this post
VIEW IN TELEGRAM
⚠️ Пока весь мир агентных фреймворков крутится вокруг Python, Microsoft спокойно выкатила Go-версию своего Agent Framework — до этого он жил только на .NET и Python. Статус пока публичное превью, часть фич ещё не доехала.

Из того, что реально важно, если вы строите не игрушку, а что-то, что пойдёт в прод: граф-оркестрация с параллельными и групповыми паттернами, чекпоинты с возможностью откатить состояние назад, контроль человека в процессе, наблюдаемость через OpenTelemetry, поддержка MCP, A2A и интеграция с Foundry и GitHub Copilot SDK. RAG «из коробки» и декларативных агентов пока нет — их обещают позже.

👍 Мне кажется, выбор Go здесь не случаен: у Microsoft огромная аудитория бэкенд-разработчиков, которые пишут высоконагруженные сервисы именно на Go, а не на Python, и им явно неудобно каждый раз выносить агентную логику в отдельный сервис на чужом языке. Плюс в README отдельно прописано предупреждение — если используете сторонние модели или агентов не из экосистемы Azure, делаете это на свой страх и риск. Забавно, что это выходит буквально на фоне разговоров про вендор-лок от Карпа и Менша: крупные игроки одновременно предупреждают о рисках привязки к чужой инфраструктуре и укрепляют собственную.
Please open Telegram to view this post
VIEW IN TELEGRAM