How to AI
2.72K subscribers
638 photos
31 videos
4 files
115 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
⁉️ На днях наткнулся на исследование Anthropic под названием «Verbalizable Representations Form a Global Workspace in Language Models», и оно реально стоит внимания. Суть: у языковых моделей (не только у Claude) обнаружили небольшую выделенную область активаций — J-space, найденную с помощью так называемой Jacobian lens (J-lens). Авторы проводят прямую параллель с теорией глобального рабочего пространства (Global Workspace Theory) — известной концепцией из когнитивистики о том, как разрозненные процессы мозга становятся доступны «сознанию».

Идея в том, что большая часть внутренних вычислений модели происходит «за кадром» и никак не всплывает наружу, но небольшой набор представлений — J-space — играет особую роль: туда попадает информация, к которой модель может обращаться, которую держит «в уме» и использует для многошаговых рассуждений. Экспериментально это подтверждается по-разному: если попросить модель держать что-то в уме, выполняя другую задачу, — это «что-то» действительно проявляется в J-space. Причём даже если явно запретить модели думать про объект, он всё равно там всплывает, просто слабее. А если это пространство отключить, модель ещё справляется с простыми задачами вроде смены языка, но начинает сыпаться на сложных вычислениях.

👆 Отдельно любопытен пример с безопасностью: когда модели подсовывалиданные с prompt injection, в J-space действительно проявлялись термины вроде «injection» и «fake» — то есть по внутреннему состоянию можно засечь момент, когда модель распознаёт манипуляцию, даже если это не отразилось в ответе.

Вопросы «это уже AGI» и «это сознание» тут неизбежно всплывают, и Anthropic сама честно проговаривает: это не доказательство наличия у модели субъективного опыта, а находка функциональной аналогии. Но инструмент, судя по всему, полезный — как для аудита и выявления скрытых намерений модели, так и для интерпретируемости в целом. Есть даже открытый плейграунд J-lens на Neuronpedia, где можно самому поковыряться в внутренностях модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ LangChain и NVIDIA представили NemoClaw для Deep Agents — три слоя для сборки корпоративных агентов: открытая модель Nemotron 3 Ultra, харнесс Deep Agents Code от LangChain (планирование, инструменты, память) и рантайм OpenShell — песочница с политиками доступа для безопасного исполнения агентских действий.

Главная цифра: на eval-бенчмарке связка Nemotron 3 Ultra + настроенный харнесс дала балл 0.86 при стоимости $4.48, тогда как ближайший конкурент обошёлся в $43.48 — почти в 10 раз дороже. Авторы подчёркивают: результат — от тюнинга всей системы разом (модель + харнесс + evals + рантайм), а не только модели.

📁 Аргументация в духе истории с Карпом и Меншем: закрытые API лишают компанию контроля над памятью агента, трейсами и датасетами — тем, что и есть её реальная экспертиза. Открытый стек позволяет владеть этим самому. В экосистему уже вошли EY, Baseten, Fireworks, Nebius, Together AI. Но стоит помнить, что и LangChain, и NVIDIA прямо заинтересованы в продвижении своих продуктов, так что цифры — маркетинговая витрина, а не независимый бенчмарк.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 На конференции в Нидерландах Марко Казалена, представитель Microsoft/Azure AI Foundry, прочитал живую импровизированную лекцию о том, какие развилки (те самые «или/или») сейчас встают перед разработчиками агентов.

Первая тема — токономика: эпоха «безлимитного шведского стола» токенов закончилась, и Microsoft тихо (без объявления на конференции Build) обновила Model Router — систему, которая перед вызовом большой модели прогоняет запрос через быстрый классификатор и решает, отправить его в дешёвую nano-модель или в дорогую флагманскую. Router теперь поддерживает десятки моделей, включая внешние (GPT, Opus), и скоро появится кастомизируемый классификатор маршрутизации.

🖱 Дальше — семейство «headless IQ»-инструментов: Web IQ (быстрый и дешёвый поиск для агентов вместо Bing API), Foundry IQ (агентный RAG поверх нескольких источников unstructured-данных — по сути отдельный саб-агент, который сам решает, что искать и как это синтезировать), Fabric IQ (для структурированных данных, с выбором между прямым подключением агента к онтологии или использованием отдельного «дата-агента» с описаниями таблиц и примерами запросов) и Work IQ (headless-версия Outlook/Teams/SharePoint, которая может работать «от лица» пользователя или от лица агента с отдельной идентичностью).

Центральная мысль доклада — прежде чем строить нового агента, стоит спросить: а нельзя ли обойтись скиллом (промпт + немного кода), который просто подключится к уже существующему универсальному агенту вроде Copilot или Scout? Это дешевле и не раздувает контекстное окно лишними инструментами — но у скиллов пока нет нормального способа тестирования в масштабе, в отличие от полноценных агентов.

🖥 И последний важный сдвиг — в оценке качества агентов. Старые метрики (task completion, task adherence) говорят только «сделал ли агент хоть что-то похожее на задачу», но не «сделал ли он это правильно». Microsoft переходит на rubric-based evaluation — наборы бизнес-специфичных правил (например, «если вопрос про комиссии — агент обязан свериться с таблицей комиссий»), из которых собираются метрики под конкретный сценарий использования.

Как вы решаете для себя вопрос «делать агента или обойтись скиллом/промптом» — по ощущению или по каким-то конкретным критериям?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ По данным Reuters, китайский стартап DeepSeek запустил проект по разработке собственных ИИ-чипов, ориентированных на инференс, а не на обучение моделей. Цель — снизить стоимость инференса и зависимость от зарубежных поставщиков вроде Nvidia. Сама компания пока никак это не комментирует.

Проект, по данным источников, стартовал около года назад, а в последние месяцы DeepSeek заметно активизировала найм — правда, не через открытые вакансии, а точечно переманивая опытных инженеров-чипмейкеров. Команда закрывает архитектуру, верификацию и софтверную часть. Это логичный шаг: инференс в отличие от обучения — не разовый всплеск нагрузки, а постоянное обслуживание огромного потока запросов, где на первый план выходят стоимость, энергопотребление и надёжность. А вычисления давно съедают больше половины операционных расходов у многих ИИ-компаний.

🖥 DeepSeek — один из самых быстрорастущих китайских разработчиков открытых моделей (DeepSeek-V3, R1), и по мере роста нагрузки инфраструктура стала одной из крупнейших статей расходов. Логика в целом та же, что у Google с TPU или у Amazon с Trainium — контроль над железом снижает издержки и зависимость от одного поставщика.

Правда, авторка статьи справедливо остужает ожидания: путь от архитектуры чипа до тейпаута и массового производства обычно занимает больше года, так что на расстановку сил на рынке ИИ-чипов это повлияет не скоро. Параллельно DeepSeek ведёт переговоры о первом раунде внешнего финансирования — около $7 млрд при оценке компании в $52–59 млрд, и часть этих денег, судя по всему, как раз пойдёт на чипы и инфраструктуру.

Как думаете — это реальная заявка на независимость от Nvidia, или скорее рычаг давления в переговорах о цене и поставках?
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 AlphaEvolve — агент на Gemini для оптимизации кода и алгоритмов там, где пространство решений слишком велико для ручного перебора. Задаёшь базовый код и метрики оценки — агент эволюционно ищет лучшее решение и отдаёт готовый код в прод.

Кейсов много: BASF улучшила прогнозирование в цепочках поставок на 80%, JetBrains ускорила IDE на 15-20%, Klarna удвоила скорость обучения моделей, PacBio снизила ошибки в геномном секвенировании на 30%. Внутри Google агент уже поучаствовал в дизайне TPU и сократил накладные расходы в Spanner на 20%.

👍 Люди везде сохраняют контроль — бенчмарки и решение о релизе за инженерами, но перестают быть ограничены ручным перебором вариантов.
Это пресс-релиз с отобранными цитатами клиентов, так что применимость вне success-story — открытый вопрос.

Это реальный прорыв или просто дорогой автоматизированный brute-force, доступный только гигантам с большими вычислительными бюджетами?
Please open Telegram to view this post
VIEW IN TELEGRAM
Хотел рассказать про запуск самого большого в мире Starship — но пока писал этот пост, всё изменилось. Вчера, 16 июля, SpaceX реально пыталась его запустить, и за секунды до старта пуск отменили: не все двигатели Super Heavy зажглись как надо. Маск сам подтвердил, что именно это стало причиной аборта. Так что дебют спутников Starlink V3 на борту Starship снова откладывается.

Если по сути: это должен был быть 13-й полёт Starship с площадки Pad 2 в Техасе, с обновлённым «железом» третьего блока — новой теплозащитой и датчиками нагрузки для более надёжного входа в атмосферу. И главная интрига — впервые на орбиту должны были полететь спутники Starlink V3. Это не косметическое обновление: пропускная способность каждого спутника вырастет примерно в 10 раз, до 1 терабита в секунду, и под такие габариты Starship и проектировался — в Falcon 9 такие спутники просто не помещаются.

👍 Кстати, на Polymarket была ставка про 53% вероятности 5-6 успешных запусков Starship за весь 2026 год. Мне кажется, это как раз честная оценка — трейдеры закладывают не «получится или нет», а сколько раз получится из многих попыток. После вчерашнего аборта эта цифра, подозреваю, уже слегка просела.
Please open Telegram to view this post
VIEW IN TELEGRAM
1
➡️ Компания Pangram (детектор ИИ-текста) проанализировала больше миллиона постов на LinkedIn, X, Reddit, Medium и Substack — как полностью написанные ИИ, так и созданные с его помощью.

Цифры получились неприятно однобокими: LinkedIn — это примерно треть всех проверенных постов, но на неё пришлось 62% всего, что детектор пометил как полностью сгенерированное ИИ. То есть непропорционально много.

🚨 В целом по всем платформам около каждого четвёртого длинного поста оказался полностью написан ИИ, а если считать вместе с текстами, где человек и ИИ работали в связке, лидером неожиданно стал X. LinkedIn при этом официально заявляет, что борется с низкокачественным, автоматизированным и шаблонным контентом — но цифры говорят, что бороться становится всё труднее: отличить, кто реально писал текст, а кто просто нажал «сгенерировать», уже почти невозможно на глаз.
Забавная ирония в том, что именно LinkedIn — площадка, построенная на личном бренде и «экспертном мнении», — оказалась territorией, где это личное мнение реже всего написано лично. Стоит, впрочем, держать в уме, что детекторы ИИ-текста сами по себе не идеальны и дают false positives, особенно на не-носителях языка и людях с определённым стилем письма — так что цифры Pangram стоит воспринимать как оценку, а не абсолютную истину.

Вы уже научились отличать ИИ-пост в ленте с первого взгляда, или тоже иногда путаетесь?
Please open Telegram to view this post
VIEW IN TELEGRAM
🐀 Забавная история, которая на самом деле опирается на реальную новость: Anthropic несколько раз подряд продлевала бесплатный доступ к своей топовой модели Claude Fable 5 в рамках платных подписок — сначала до 7 июля, потом до 12-го, а теперь и до 19 июля, вместе с повышенными на 50% недельными лимитами Claude Code. Так что человек, который подвинул планы ради «лишнего окна» с моделью, действовал вполне рационально — программа реально продлевалась дважды за неделю, буквально в последний момент перед дедлайном.

Что интересно в контексте: похоже, продления связаны не столько с щедростью, сколько с конкурентным давлением — GPT-5.6 Sol от OpenAI почти догнал Fable 5 по бенчмаркам, но стоит заметно дешевле (один разработчик посчитал: $16 против $63 за одну и ту же задачу).

💲 После 19 июля доступ переходит на предоплаченные кредиты — $10 за миллион входных токенов и $50 за миллион выходных, что для потребительской модели такого уровня необычная модель монетизации.
История с переносом планов ради ИИ-инструмента звучит забавно, но по сути отражает реальную вещь — растущую производительность действительно ощущают многие пользователи, и рациональность решения «использовать лимит, пока он есть» вполне объяснима, особенно с учётом того, что никто заранее не может предсказать, продлят ли доступ снова.
Please open Telegram to view this post
VIEW IN TELEGRAM
👆 Риша Панигрихи из USC создала InTruth — браузерное расширение, которое в реальном времени проверяет фактические утверждения во время дебатов и выступлений.

Claude используется дважды: сначала даёт быстрый вердикт, потом уточняет его после поиска источников. Расширение отслеживает спикеров, отделяет факты от мнений и маркирует утверждения как правду, ложь, введение в заблуждение, частичную правду или непроверяемое.
За неделю набралось больше 2000 пользователей.

📁 Сама создательница честно предупреждает: система может ошибаться, и пользователям стоит проверять источники, а не слепо доверять ИИ-вердикту.

Доверили бы такому расширению формировать мнение во время дебатов, или предпочли бы проверять факты сами?
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 Разбираю пост Сидни Ранкл из LangChain про новую фичу в Deep Agents — поддержку RLM (recursive language models), концепции, предложенной Алексом Чжаном и исследователями MIT CSAIL. Проблема, которую они решают, знакома всем, кто работал с длинным контекстом: чем больше информации накапливает агент, тем хуже он работает — это называют context rot. Классический пример: агенту нужно посчитать средний размер сделки по 10 000 транскриптов звонков. Если считать «по ходу», сохраняя промежуточный итог в контексте модели, сумма неизбежно начинает плыть по мере роста истории.

Идея RLM в том, чтобы вынести оркестрацию и подсчёты в код, а не держать их в эфемерном окне контекста модели. Модель получает данные как переменную в REPL и пишет код, который сам решает, как разбить задачу, — grep, partition, map, reduce, всё как при работе с большим датасетом. Отличие от обычных саб-агентов в том, что раньше модель решала «что делать дальше» пошагово, на каждом шаге рассуждения, а теперь пишет скрипт, и код гарантирует полный охват задачи (цикл for обойдёт каждый батч по определению, а не «на усмотрение» модели).

➡️ Результаты на бенчмарке OOLONG показательны: на контексте 64k токенов обычный агент почти не уступает — 0.58 против 0.67 у RLM-версии. Но на 128k разница резко увеличивается — 0.44 против 0.79, причём обычный агент не просто ошибается, а честно сдаётся и говорит, что не может выполнить задачу. Правда, авторы сами оговариваются: это прикидочный тест без специфической настройки под задачу, так что реальный потенциал RLM, вероятно, недооценён этими цифрами.

Отдельная деталь, которая мне кажется важной: оркестратор и саб-агенты в Deep Agents могут работать на разных моделях — например, фронтир-модель как «дирижёр» с открытыми весовыми моделями вроде GLM 5.2 или Nemotron в роли исполнителей для экономии, или наоборот.
Please open Telegram to view this post
VIEW IN TELEGRAM
👆 Джефф Безос заявил, что настоящие ограничения роста сегодня — не в идеях (их у людей и так больше, чем можно реализовать), а во времени, инженерном таланте и производственных мощностях. В качестве решения он указывает на Prometheus — ИИ-стартап, который он с ноября 2025 года возглавляет как со-CEO, вернувшись к операционной работе впервые после ухода из Amazon в 2021-м. Идея Prometheus — сократить дистанцию между идеей и готовым физическим продуктом, построив, по формулировке самого Безоса, «искусственного инженера общего назначения»: ИИ, который тренируется не на текстах интернета, а на данных из физического мира, чтобы ускорять инженерию и производство — от чипов до ракет. Компания уже привлекла $18,2 млрд суммарно (последний раунд — $12 млрд при оценке $41 млрд) и наняла около 150 человек из OpenAI, Google DeepMind, Nvidia.

Заявление звучит на фоне реальной и довольно тревожной статистики: по данным Challenger, Gray & Christmas, в мае 2026 года ИИ был указан работодателями как основная причина примерно 40% всех сокращений в США — рекордная доля с начала отслеживания этого показателя в 2023-м (для сравнения, в январе было всего 7%). С начала года ИИ уже фигурирует в 87 700 увольнениях — больше, чем за весь 2025 год целиком. Правда, стоит держать в уме оговорку экономистов: то, что компания официально называет ИИ причиной сокращений, не всегда означает, что это действительно так — иногда это просто удобная формулировка для рынка и инвесторов.

➡️ Позиция самого Безоса классически оптимистична для технологического предпринимателя: ускорение разработки создаст больше продуктов, компаний и целых индустрий, а значит — больше, а не меньше спроса на квалифицированных специалистов. Проблема в том, что это долгосрочный аргумент, который слабо утешает людей, теряющих работу прямо сейчас — краткосрочная боль и долгосрочная выгода здесь могут просто не совпадать по времени для одних и тех же людей.

Вам ближе позиция «это временный болезненный переход» или ощущение, что оптимизм тут больше служит инвесторам, чем реальным работникам?
Please open Telegram to view this post
VIEW IN TELEGRAM
Это продолжение материала про AlphaEvolve, и здесь — конкретика по запуску. Пушмит Кохли, главный научный сотрудник Google Cloud и вице-президент по науке в Google DeepMind, формулирует главный тезис компании: ИИ переходит от роли ассистента, который просто ускоряет работу, к роли «двигателя открытий», расширяющего то, что вообще возможно сделать. По его словам, автономно исследуя гигантские вычислительные пространства решений, такие инструменты, как AlphaEvolve, помогают находить прорывные алгоритмы, дополняющие человеческую интуицию, а не просто её имитирующие.

Технически для старта нужны всего два элемента: seed-программа — исходный алгоритм с явно помеченными участками кода, которые разрешено оптимизировать, и evaluator — детерминированный скрипт на стороне пользователя, который компилирует, тестирует и оценивает каждый сгенерированный вариант, возвращая числовые метрики. Дальше цикл простой: клиентский раннер запрашивает у API AlphaEvolve мутировавших кандидатов, прогоняет их через свой evaluator (он может крутиться где угодно) и отправляет оценки обратно, из которых AlphaEvolve выбирает следующие направления поиска.

🔥 Для входа рекомендуют идти через документацию и onboarding-гайд, начать с базовых примеров в Colab, чтобы понять эвристику, а для агентных workflow — использовать AlphaEvolve Skill прямо в IDE вроде Antigravity или Claude Code.
По сути, порог входа здесь ниже, чем можно было ожидать — не нужно быть исследователем в ML, достаточно уметь написать evaluator для своей задачи.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ AWS выпустила открытый MCP-сервер для Registry of Open Data on AWS (RODA) — каталога, где хранятся сотни петабайт открытых данных от NASA, NOAA, NIH, Allen Institute и других организаций (спутниковые снимки, геномика, климат, геоданные). Идея простая: раньше, чтобы найти нужный датасет, исследователю приходилось вручную перебирать каталог, находить нужный S3-бакет, разбираться в структуре файлов и тестировать несколько из них, прежде чем понять, подходит ли датасет вообще. Теперь это можно сделать одним диалогом в Kiro, Claude Code или любом другом MCP-совместимом ассистенте.

Сервер построен вокруг трёх функций: поиск (запрос вроде «найди датасеты для изучения температуры океана» возвращает подходящие наборы с описанием и условиями лицензии), изучение метаданных (можно попросить подробности по конкретному датасету или найти похожие) и оценка пригодности — ассистент показывает структуру S3-бакета, форматы файлов и партиционирование, а также может «заглянуть» в конкретный файл и показать его содержимое до того, как вы начнёте полноценную работу с данными.

➡️ Технически всё подключается буквально одной командой (claude mcp add roda-mcp uvx awslabs.roda-mcp-server@latest), проект открытый, под лицензией Apache 2.0.

По сути это ещё один пример того, как MCP-протокол Anthropic становится стандартной «прослойкой» между ИИ-ассистентами и специализированными источниками данных — не нужно писать кастомную интеграцию под каждый каталог, достаточно поднять MCP-сервер один раз. Хорошая иллюстрация того, куда движется вся эта экосистема: от «спроси у чат-бота» к «дай агенту прямой доступ к твоим инструментам и данным».

Многие ли исследовательские команды реально готовы довериться ИИ-ассистенту в предварительной оценке данных, или это скорее ускоряет первый шаг, а глубокую проверку всё равно делают руками?
Please open Telegram to view this post
VIEW IN TELEGRAM
🖱 Эми Лу из команды LangChain выпустила короткое видео о том, как настроить Claude Code так, чтобы каждая сессия автоматически отправлялась в LangSmith в виде полноценной трассы. Настройка сводится буквально к трём командам: добавляешь маркетплейс плагинов (/plugin marketplace add langchain-ai/langsmith-claude-code-plugins), ставишь сам плагин (/plugin install langsmith-tracing) и перезагружаешь плагины. Плюс один JSON-блок с переменными окружения — API-ключ LangSmith и название проекта.

После этого в трассу автоматически попадает буквально всё: полная история диалога с моделью, каждый вызов инструмента (Bash, Read, Edit, Grep и другие) с входными и выходными данными, запуски саб-агентов как дочерние спаны, события сжатия контекста (compaction) и даже прерванные ответы — они помечаются как interrupted, а не просто теряются. В LangSmith это превращается в дерево выполнения сессии, а не плоский лог, и по вкладке Threads можно проследить весь многошаговый диалог целиком.

💢 Практическая мотивация понятна: Claude Code всё чаще используют «headless» — в CI-пайплайнах, автоматизированных агентах, по расписанию — и в таких сценариях просто нет возможности смотреть на живой терминал, когда что-то идёт не так. Трейсинг даёт тот же уровень наблюдаемости, что обычно ожидают от продакшен-LLM-систем, только применительно к агенту, который пишет и правит код.

Системные промпты в трассу не попадают — Claude Code их просто не возвращает в транскриптах разговора, так что это единственное существенное ограничение подхода.
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ GitHub объявил о добавлении Kimi K2.7 Code от Moonshot AI в линейку моделей Copilot — и это первая модель с открытыми весами в списке. Открытые веса означают, что параметры, на которых обучалась модель, доступны всем желающим, то есть модель можно дообучать и модифицировать под себя. При этом сама Kimi хостится на инфраструктуре Microsoft AI Foundry в США и управляется GitHub и Microsoft — то есть «открытость» тут про веса, а не про то, где физически крутится модель.

По умолчанию модель отключена — включать должен админ организации, проверить доступность можно через вкладку Models в Copilot CLI. Из практичного — цена: 95 AI-кредитов за миллион входных токенов и 400 за миллион выходных (кредит ≈ 1 цент), что делает её одной из самых дешёвых в линейке. При этом, по внутренним тестам GitHub, по качеству агентного кодинга Kimi K2.7 Code сопоставима с фронтир-моделями, а по скорости первого токена и общей отзывчивости — одна из самых быстрых в линейке, плюс 95% попаданий в кеш, что тоже про эффективность.

➡️ В демо-примере модели дали продуктовые требования для сайта шеринга ссылок — она задала 8 уточняющих вопросов, выявила неявные допущения, а затем в автопилот-режиме реализовала рабочее приложение с минимумом дополнительных правок.

Доступна уже сейчас для Pro, Pro+ и Max, для бизнес- и энтерпрайз-аккаунтов — в ближайшие недели.
Заметный шаг: раньше открытые модели в основном ассоциировались с self-hosting и энтузиастами, а тут крупная открытая модель заходит прямо в мейнстримный продукт наравне с закрытыми фронтир-моделями.

Стали бы вы сознательно выбирать более дешёвую open-weights модель для рабочего кодинга, если по тестам она почти не уступает топовым?
Please open Telegram to view this post
VIEW IN TELEGRAM
CEO Cloudflare Мэттью Принс на мероприятии Axios в Каннах снова заговорил о том, как ИИ меняет способ, которым люди находят бизнесы онлайн. Его тезис: ИИ-ассистенты за секунды сравнивают тысячи товаров без всякой лояльности к бренду — а значит выигрывают в основном уже раскрученные имена, которые чаще упоминаются в интернете и обучающих данных, а мелким компаниям становится сложнее выделиться.

Цифра про клики укладывается в то, что Принс говорит уже больше года: соотношение «сколько страниц краулит поисковик на одного реального посетителя» стремительно растёт — у Google счёт идёт на десятки страниц на клик, у ИИ-ассистентов вроде OpenAI и Anthropic — на сотни и тысячи. Люди получают готовый ответ прямо в чате и просто перестают переходить по ссылкам на источник.

💲 Решение Cloudflare — Pay Per Crawl: механизм, который позволяет владельцам сайтов брать плату с ИИ-краулеров за доступ к контенту вместо того, чтобы просто блокировать их. Правда, у Принса тут прямой коммерческий интерес — Cloudflare обслуживает огромную долю веб-трафика и зарабатывает на позиционировании себя защитником издателей.
Please open Telegram to view this post
VIEW IN TELEGRAM
1
💢 Иван Паломарес Каррaскоса (Machine Learning Mastery) разбирает пять стратегий для долгоживущих агентов, у которых контекстное окно — узкое место.

1. Sliding window — помнит только последние N ходов. Дёшево, но чревато «цифровой амнезией» и зацикливанием.

2. Recursive summarization — сжимает старую историю в саммари, как JPEG. Держит общий «сюжет», но теряет детали.

3. Structured state management — вместо истории агент ведёт компактный JSON с целями и фактами. Экономно, но всё, что не заложено в схему, агент просто не увидит.

4. RAG-подход — вся история хранится во внешней базе, в промпт подтягивается только релевантное. Работает почти бесконечно, но рискует упустить связь между непохожими друг на друга событиями.

5. Dynamic context routing — рутину делает дешёвая модель, а когда агент застревает — подключается мощная модель с полной историей. Экономично, но сложно надёжно ловить момент, когда модель застряла.

Вывод автора: цель не бесконечная память, а архитектура, которая осознанно решает, что помнить, а что забыть.

Какая стратегия кажется вам рабочей в проде, а какая — скорее теоретической?
Please open Telegram to view this post
VIEW IN TELEGRAM
⚠️ Пока весь мир агентных фреймворков крутится вокруг Python, Microsoft спокойно выкатила Go-версию своего Agent Framework — до этого он жил только на .NET и Python. Статус пока публичное превью, часть фич ещё не доехала.

Из того, что реально важно, если вы строите не игрушку, а что-то, что пойдёт в прод: граф-оркестрация с параллельными и групповыми паттернами, чекпоинты с возможностью откатить состояние назад, контроль человека в процессе, наблюдаемость через OpenTelemetry, поддержка MCP, A2A и интеграция с Foundry и GitHub Copilot SDK. RAG «из коробки» и декларативных агентов пока нет — их обещают позже.

👍 Мне кажется, выбор Go здесь не случаен: у Microsoft огромная аудитория бэкенд-разработчиков, которые пишут высоконагруженные сервисы именно на Go, а не на Python, и им явно неудобно каждый раз выносить агентную логику в отдельный сервис на чужом языке. Плюс в README отдельно прописано предупреждение — если используете сторонние модели или агентов не из экосистемы Azure, делаете это на свой страх и риск. Забавно, что это выходит буквально на фоне разговоров про вендор-лок от Карпа и Менша: крупные игроки одновременно предупреждают о рисках привязки к чужой инфраструктуре и укрепляют собственную.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Выпуск подкаста Last Week in AI от Андрея Куренкова и Джереми Харриса за прошлую неделю получился насыщенным. Главная тема — Anthropic вернула доступ к моделям Mythos и Fable после переговоров с американским правительством: администрация Трампа сняла ограничения, введённые ранее из соображений экспортного контроля. Параллельно компания добавила новые классификаторы для кибербезопасности и вместе с крупными партнёрами разрабатывает framework для оценки серьёзности джейлбрейков. Ведущие честно обсуждают неудобную реальность: джейлбрейки, судя по всему, неизбежны в принципе, а условия релиза у разных компаний (в частности, у Anthropic и OpenAI) заметно отличаются по строгости.

Тут же — запуск Claude Sonnet 5: модель дешевле в использовании, с улучшенным агентным кодингом и более высокими бенчмарками, сниженной частотой «неправильного» поведения и защитами от кибератак по умолчанию — хотя по чисто кибербезопасностным возможностям она всё ещё слабее топовых моделей рынка. Из инструментов упоминают NotebookLM от Google, который теперь умеет сжимать загруженные исследования в вертикальные видео в духе TikTok, и новый Nano Banana 2 Lite — более быстрый и дешёвый генератор изображений от Google.

👑 В блоке про бизнес — стартап Etched переманил больше 400 инженеров из Nvidia, TSMC и других компаний, чтобы построить новый инференс-кластер, на который уже есть спрос почти на $1 млрд. Baidu растёт на новостях об IPO чипового подразделения, Agility Robotics готовится выйти на биржу через SPAC на $2,5 млрд, а DeepSeek планирует минимум удвоить штат во всех департаментах — ещё один штрих к истории о том, как быстро растёт китайский ИИ-сектор на фоне разговоров об экспортных ограничениях.

Какая из этих новостей вам самой кажется важнее для канала — снятие ограничений с Anthropic или рост DeepSeek?
Please open Telegram to view this post
VIEW IN TELEGRAM
☀️ OpenAI выпустила свой первый физический продукт — и это не тот самый легендарный гаджет от Джони Айва (тот, по слухам, окажется динамиком без экрана, который умеет двигаться — совсем другая история). Это скромный механический макропад Codex Micro, сделанный в партнёрстве с Work Louder на основе их клавиатуры Creator Micro 2 — по сути, ребрендированная версия уже существующего продукта, у Work Louder был похожий опыт коллаборации с Figma и Framer.

Фишка не в самом железе (обычные низкопрофильные механические свитчи, выбор между тихими и щёлкающими, подключение по USB-C или Bluetooth), а в шести подсвечиваемых «agent keys» сверху: каждая клавиша привязывается к конкретному агенту Codex, и цвет подсветки показывает его статус — белый значит «простаивает», синий — «думает», зелёный — «закончил», красный — «ошибка». Одно нажатие выбирает агента, двойное — выводит его на передний план. Внизу — клавиши для принятия/отклонения правок агента и кнопка push-to-talk, потому что, видимо, разговаривать с Codex голосом — это следующая ступень принятия в Кремниевой долине. Всё перепрограммируется через фирменное приложение Work Louder, в комплекте — 32 дополнительных кейкапа, включая клавиши «yolo» и «yeet» для любителей vibe-коддинга.

👆 Сам автор статьи честно резюмирует: нужен ли вам этот девайс — нет; забавная ли это игрушка — да; сделает ли он вас продуктивнее — неясно. И это, кажется, точная характеристика момента: Codex приближается к 9 миллионам пользователей, и OpenAI явно тестирует, насколько глубоко физический интерфейс может встроиться в рутину «работы с агентами» — по сути, материализуя абстрактную идею «у меня в фоне работает несколько ИИ» в физический объект, на который можно посмотреть и потрогать.
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 Странная ситуация в отношениях крупных ИИ-игроков: CEO Microsoft Сатья Наделла на внутренней встрече с инженерами Copilot заявил, что модель Fable 5 от Anthropic выглядит «редакционно зацензурированной», а часть её ограничений «не имеет смысла». По его словам, если пользуешься Fable, она отказывает по случайным поводам, и он спросил, когда в последний раз творческий инструмент был настолько подцензурен.

Контекст важен: Fable уже переживала турбулентный запуск — спустя три дня после релиза в начале июня Anthropic была вынуждена приостановить доступ к модели из-за требований экспортного контроля США, а 1 июля восстановила его, честно предупредив, что новые защитные механизмы будут блокировать чуть больше безобидных запросов, чем раньше. Пользователи в соцсетях действительно жаловались на избыточные отказы, и по некоторым темам, связанным с разработкой крупных моделей, Fable вообще перенаправляет запросы на более старую версию.

Но самое интересное — не сама критика, а то, кто её произносит. Наделла критикует ценного партнёра и клиента: в ноябре Microsoft вложила $5 млрд в Anthropic, а та обязалась направить $30 млрд на облако Azure, плюс на технологии Anthropic построен Copilot Cowork. Публичная критика продукта партнёра, в который сам же инвестировал миллиарды, — это либо неосторожность, либо (вероятнее) осознанный сигнал рынку. Наделла параллельно продвигает более широкий тезис — что мир не может позволить себе ситуацию, когда всего две компании владеют «токен-капиталом», а все остальные его просто арендуют, и призывает предприятия строить собственную ИИ-инфраструктуру вместо аренды чужой. Это прямое эхо позиции Карпа и Менша, которую мы уже разбирали, только теперь с той же риторикой выступает CEO компании, глубоко завязанной именно на аренду чужих моделей.

Кажется, это уже не просто спор про чувствительность фильтров — а публичная разминка перед тем, как крупные игроки начнут пересматривать зависимость друг от друга.

Вам ситуация видится как искренняя обратная связь от крупного клиента, или как стратегический удар по конкуренту, который заодно является инвестицией?
Please open Telegram to view this post
VIEW IN TELEGRAM