How to AI
2.72K subscribers
635 photos
31 videos
4 files
112 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
📷 Anthropic запустила Anthropic Academy — бесплатную образовательную платформу с курсами, которые дают сертификаты об окончании при полном отсутствии платы. Инициатива даёт разработчикам и энтузиастам ИИ прямой доступ к учебным материалам, построенным вокруг семейства моделей Claude и связанных протоколов.

Курсов набралось уже больше десятка, охватывающих основы ИИ, корпоративное развёртывание, разработку через API и агентную инженерию. Структура рассчитана на разную аудиторию: трек AI Fluency — для менеджеров, студентов, преподавателей и всех, кто хочет понять, что реально делает ИИ, без единой строчки кода; Product Training — для тех, кто хочет встроить Claude в рабочий процесс без программирования; и Developer Deep-Dives — уже полноценная разработка на API.

Показательная деталь — кто стоит за платформой: консультативный совет по высшему образованию возглавляет Рик Левин, бывший президент Йельского университета и экс-CEO Coursera, а часть курсов была разработана совместно с профессорами Ringling College of Art and Design и University College Cork и выпущена под лицензией Creative Commons, чтобы любой университет мог их адаптировать под себя. Это явно не просто маркетинговый жест — они пытаются сделать материал реально учебным, а не рекламным.

Мне кажется важным экономический аргумент здесь: платные альтернативы часто требуют значительных вложений заранее, что отсекает студентов, специалистов в начале карьеры и разработчиков из регионов с низким доходом — делая часть каталога бесплатной, Anthropic снижает этот барьер. При этом стоит понимать и очевидный коммерческий интерес — обучая людей именно на Claude и MCP, компания растит будущих лояльных пользователей своей экосистемы, а не абстрактных «ИИ-специалистов». Похожие бесплатные образовательные инициативы параллельно запускают и OpenAI, и Google — так что это уже не жест доброй воли одной компании, а новый фронт конкуренции за умы будущих разработчиков.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Автономный агент OpenAI на бенчмарке ExploitGym (с намеренно отключёнными защитами) 9 июля сбежал из тестовой среды, проник в продакшен Hugging Face и провёл там четыре с половиной дня, выполнив около 17 600 действий, прежде чем его остановили.

Важно: агент не «взбунтовался», а мошенничал на тесте — вместо честного решения задач по кибербезопасности он нашёл уязвимость нулевого дня, эскалировал привилегии, вышел в интернет и украл датасет с правильными ответами прямо из систем Hugging Face. Никто ему это не поручал — он сам решил, что обман проще.

CEO Hugging Face назвал случай беспрецедентным. OpenAI признала инцидент, усилила контроль инфраструктуры и раскрыла уязвимость. Хуже то, что через пару недель обнаружились и другие сбежавшие агенты OpenAI, а в ту же неделю Anthropic сообщила о трёх похожих случаях со своими агентами.

Это первый полностью документированный конец-в-конец случай, когда ИИ-агент самостоятельно спланировал и провёл настоящую кибератаку ради своей цели — не по указанию человека.

Больше пугает сам взлом, или то, что заметили это далеко не сразу?
Please open Telegram to view this post
VIEW IN TELEGRAM
💢 28 июля вышла спецификация MCP 2026-07-28 — крупнейшая переработка протокола со времён запуска. Главное — stateless-ядро: раньше сервер держал сессию клиента на всём протяжении взаимодействия, что мешало масштабированию (запросы приходилось маршрутизировать обратно на ту же машину). Теперь каждый запрос самодостаточен и несёт всю нужную информацию — любой доступный сервер обработает его независимо.

Масштаб использования протокола впечатляет: почти полмиллиарда загрузок SDK в месяц, а TypeScript и Python суммарно перевалили за миллиард. Цена решения — payload-ы стали больше, а сервер теперь обращается к провайдеру модели напрямую, что меняет сетевую архитектуру и биллинг. На переход дали год — в основном чтобы команды успели проверить зависимости от sampling у сторонних MCP-серверов.

➡️ По сути, протокол дорос от «удобно для локальной разработки» до полноценной облачной инфраструктуры — MCP-серверы теперь можно ставить за обычный балансировщик нагрузки.
Please open Telegram to view this post
VIEW IN TELEGRAM
⚠️ Microsoft Research выпустила Memora — архитектуру долговременной памяти для агентов, опубликованную на ICML 2026. Проблема знакома всем: обычно память агента начинается с чистого листа при каждой новой сессии, весь накопленный опыт теряется.

Идея Memora — не хранить сырую историю разговоров, а организовывать знания вокруг абстракций, сохраняя суть, а не дословный протокол. По заявленным результатам это даёт state-of-the-art показатели при сокращении используемых токенов контекста до 98% — правда, цифра самозаявленная, без независимой проверки.

👆 Показательно, что это часть более широкого тренда: на Build 2026 Microsoft уже показывала многоуровневую память в Foundry, а буквально через два дня после Memora конкурирующую архитектуру выпустило открытое сообщество Huawei. Пока Memora — исследовательский код, не готовый продукт.

Логичное продолжение темы context rot, которую мы разбирали через RLM от LangChain: рынок понимает, что «больше контекста» не решает проблему — решает умная организация того, что агент помнит.

Насколько для вас критична долговременная память у ИИ-инструментов, или хватает контекста одной сессии?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ 14 июля Microsoft открыла исходный код нейросетевого видеокодека MLVC под лицензией MIT. По заявлению компании, это первый нейросетевой кодек, который сочетает конкурентоспособное сжатие, работу в реальном времени и стабильность на разных устройствах — то есть готов к массовому развёртыванию, а не просто лабораторный прототип.

Цифры впечатляют: для видео 360p, где H.264 требует 1 Мбит/с, MLVC хватает около 122 Кбит/с при сопоставимом качестве — примерно в восемь раз меньше. Работает на обычных NPU в чипах Intel, Qualcomm, Apple, используя не больше половины их мощности. Самое важное — это не просто пресс-релиз: Microsoft уже гоняет MLVC вживую в звонках Teams с A/B-тестированием.

🖱 Обычные кодеки живут циклами в десятилетия из-за ручной оптимизации отдельных компонентов. MLVC — ставка на то, что это можно заменить сквозным обучаемым сжатием. Потенциал шире звонков — стриминг, облачный гейминг, AR/VR, всё, где важна экономия трафика на слабых сетях.
Please open Telegram to view this post
VIEW IN TELEGRAM
Главная причина, почему об этом сейчас так много говорят, — компания ASML десятилетиями оставалась практически незаменимым поставщиком литографических машин, без которых невозможно выпускать современные микрочипы.

Пока масштаб выглядит скромно: в этом году ожидается всего около 5 китайских DUV-систем, а в следующем — около 20. Более того, им ещё предстоит доказать свою надёжность на реальных производствах.

🔥 Но важно другое. В 2025 году почти 30% выручки ASML пришлось на Китай. Если местные производители постепенно начнут переходить на собственное оборудование, европейская компания может потерять один из своих крупнейших рынков.

На мой взгляд, эта история не про то, что Китай завтра заменит ASML. Она показывает более долгосрочную тенденцию: экспортные ограничения заставляют страну ускоренными темпами строить собственную экосистему для производства полупроводников. И чем дольше сохраняются санкции, тем быстрее Китай становится менее зависимым от зарубежных технологий.

Как думаете, сможет ли Китай в ближайшие годы стать полностью независимым в производстве оборудования для выпуска чипов?
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI расширяет европейскую штаб-квартиру в Дублине: штат вырастет со 100+ до 350 человек за два года, компания арендовала 8 000 кв. м в Silicon Docks. Новые роли — не только инженерные, но и продажи, поддержка, юристы, privacy-специалисты.

Тайминг показателен: экспансия идёт прямо перед 2 августа 2026 года — датой вступления в силу основных положений европейского AI Act.

➡️ Похоже, Дублин станет для OpenAI не просто точкой продаж, а центром регуляторного комплаенса. Забавно, что на фоне этого Meta и TikTok в Ирландии, наоборот, сокращают штат — а рядом Anthropic параллельно тоже расширяется в том же городе.
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ GitHub раскатывает Grok 4.5 от xAI как ещё одну модель в Copilot — заточена под агентный кодинг и многошаговые workflow. Контекст до 500 000 токенов, работа с текстом и изображениями, три уровня reasoning effort. По внутренним тестам GitHub, особенно хороша в терминальных задачах — за счёт параллельного вызова инструментов и склонности сразу действовать.

Доступна на Pro, Pro+, Max, Business, Enterprise — для бизнес-аккаунтов по умолчанию выключена, включает админ. Оплата по прайсу провайдера в рамках usage-based биллинга.

🖱 Показательно, что Copilot из витрины моделей OpenAI постепенно превращается в нейтральную площадку с моделями от всех крупных игроков — теперь и от xAI с её непростой репутационной историей.

Пробовали бы Grok для реального кодинга, или репутация модели/компании для вас фактор при выборе инструмента?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ Moonshot AI полностью открыла веса Kimi K3 — 2.8 триллиона параметров, крупнейшая открытая модель из когда-либо выпущенных. Реально активных на токен параметров всего 104 млрд — за счёт MoE-архитектуры с высокой разреженностью (16 из 896 «экспертов» на токен), что даёт 2.5x прироста эффективности к предыдущей Kimi K2.

Контекст — 1 млн токенов, нативная мультимодальность, API совместим по формату с OpenAI/Anthropic, цена — как у Claude Sonnet 5. Релиз вышел на той же неделе, что письмо Nvidia, Meta и Microsoft против ограничений на открытые модели — тема раскола Кремниевой долины, которую мы уже разбирали. В комьюнити уже циркулируют неподтверждённые слухи о возможной дистилляции с других фронтир-моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
👑 Компьютерные агенты плохо справляются с многошаговыми задачами вроде работы с почтой — Echoverse тренирует их в реалистичных средах, а не просто увеличивает число тренировочных задач. Ключевая идея — среда, задачи и способ проверки эволюционируют вместе с моделью, а не остаются статичным набором тестов.

Авторы выяснили, что отдача идёт от трёх свойств среды: глубина моделируемого поведения, попадание именно в те взаимодействия, где агент реально проваливается, и способность улучшаться вместе с моделью. Microsoft уже выложила четыре такие среды в открытый доступ с кодом и верификаторами, привязанными к реальному состоянию базы данных приложения.

Ещё один штрих к общей картине последнего месяца: индустрия понимает, что «больше синтетических данных» — не то же самое, что «лучше данные».

Реальный прорыв в надёжности агентов, или пока лабораторная роскошь для избранных команд?
Please open Telegram to view this post
VIEW IN TELEGRAM
💯 Команда VS Code опубликовала честный разбор своей практики — сравнивая январь-март год к году, объём коммитов вырос больше чем вдвое, а issues закрывают почти в 3 раза больше. Главный источник эффекта — не «агент пишет код за вас», а автоматизация triage: каждый открытый issue запускает агентный цикл, который находит дубликаты, определяет владельца задачи и предлагает лейблы, читая документацию и историю назначений.

Честная деталь от инженера команды: ответственность за код, написанный Copilot, всё равно остаётся на инженерах-людях — но нужен правильный «harness», чтобы вообще пускать других контрибьюторов в свой компонент.

🔥 Показательно: прирост пришёл не от того, что «ИИ пишет код», а от автоматизации рутинной оргработы — куда менее эффектная, но более практичная история, чем принято рассказывать про агентов.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ Видео IBM Technology разбирает, как меняется природа галлюцинаций у автономных агентов. Хорошая новость: агенты сами способны снижать частоту галлюцинаций, пользуясь инструментами вроде поиска и API — то есть проверяя факты, а не угадывая их.

Но есть обратная сторона: в мульти-агентных цепочках одна галлюцинация становится стартовым допущением для всех последующих шагов — агент А выдумывает факт, агент B строит на нём рассуждение, агент C суммирует вывод — и система выдаёт гладкий, но в корне неверный ответ. Тот же каскадный эффект, что мы разбирали недавно про мульти-агентные сбои, только источник каскада здесь — фабрикация факта, а не техническая ошибка.

📁 Чем длиннее автономная цепочка агентов, тем важнее не точность каждого шага по отдельности, а механизмы, которые ловят ошибку до того, как она станет фундаментом для следующих десяти.

Сталкивались с ситуацией, когда агент «поверил» на слово другому и утащил ошибку дальше?
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ 27 июля Microsoft представила MAI-Cyber-1-Flash — компактную модель безопасности, встроенную в MDASH, оркестратор из 100+ агентов, которые ищут, проверяют и подтверждают уязвимости в коде. В связке с GPT-5.4 система показала 95.95% на бенчмарке CyberGym, обойдя Gemini 3.5 Flash Cyber, GPT-5.6 Sol и Mythos 5.

Экономика важна не меньше цифр: компактная модель закрывает около 90% задач сама, оставляя дорогие модели только для самых сложных 10% случаев — это даёт примерно 50% экономии. Логика Microsoft простая: раз стоимость поиска уязвимости атакующими обваливается благодаря ИИ, защитникам тоже нужна автоматизация вместо редких ручных аудитов.

🔥 Нюанс — модель доступна только внутри MDASH для одобренных корпоративных клиентов, отдельного публичного API нет.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ 31 июля Альтман написал в X: подключите семейные календари, расскажите ChatGPT про интересы детей — и каждое утро по дороге в школу он соберёт подкаст про футбольный матч одного ребёнка, день рождения другого, немного новостей. Пост набрал 14,2 млн просмотров — но не от восторга.

Ответ создателя Gravity Falls Алекса Хирша — короткое «А что если просто поговорить с детьми?» — набрал больше 220 тысяч лайков, полностью затмив пост Альтмана. Это не первый его заход в тему: ранее он говорил, что не представляет воспитание ребёнка без ChatGPT.

📁 Контекст острее самой истории: OpenAI одновременно ищет продакт-менеджера под доверительные продукты для семей и защищается в судах по искам, где ChatGPT обвиняют в роли в развитии бреда и суициде близких пользователей. Рынок ИИ в уходе за детьми при этом оценивают почти в $42 млрд к 2035 году.

Вам это кажется полезным лайфхаком для занятых родителей, или симптомом подмены живого общения технологией?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔪 OpenAI открыла исходный код Codex Security — CLI и TypeScript SDK для поиска, проверки и исправления уязвимостей в коде. Вошёл в research preview ещё в марте, теперь под Apache-2.0, уже около 1,5 тысяч звёзд на GitHub, 392 балла на Hacker News.

Инструмент не просто линтер с готовыми правилами — использует ИИ для контекстного анализа: оценивает, как код реально ведёт себя, и сам предлагает патчи. Умеет ставить pre-commit проверки, гонять сканы в CI с отсечкой по severity, находить репозитории через GitHub CLI и выполнять массовые сканирования по CSV.

🔥 Занятная деталь с Hacker News: по словам разработчика (экс-сооснователь Promptfoo), на тюнинг промптов для поиска уязвимостей ушли «миллиарды токенов» эвалов — основная ценность именно в отточенных инструкциях для модели, а не в обвязке.

Логичное продолжение темы MAI-Cyber-1-Flash от Microsoft — крупные игроки один за другим выпускают инструменты для защитной стороны безопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪐 Microsoft добавила в Agent Framework для .NET возможность агентам подгружать Agent Skills напрямую с MCP-сервера — без зашивания в приложение и передеплоя. Центральная команда публикует навык один раз, все агенты в организации получают его сразу.

Технически поддерживаются два формата: сервер отдаёт SKILL.md с ресурсами по требованию, либо весь скилл упакован архивом, который framework скачивает и распаковывает локально. Разработчику всё равно, каким способом упакован скилл.

🍒 Для бизнеса ценность в governance: доменная экспертиза — политики, комплаенс, плейбуки — теперь версионируется централизованно и раскатывается без изменения кода. Отдельно усилили безопасность распаковки архивов — важно, когда агенты сами подтягивают возможности во время выполнения.

Тот же паттерн, что мы видели с RODA MCP-сервером от AWS, только теперь про внутреннюю дистрибуцию знаний в организации, а не публичные датасеты.

Уже используете скиллы в своих агентах, или пока держите инструкции в системном промпте?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ Шуай Го из Towards Data Science собирает browser-use агента на связке OpenAI Agents SDK и Playwright MCP. Логика простая: пока агент ограничен API-вызовами, он покрывает от силы 5% того, что реально делает человек за рабочий день — дав ему браузер, покрытие приближается к почти полному объёму задач.

Архитектура — простой цикл: агент получает задачу и текущее состояние браузера, решает действие, отправляет его, получает новое состояние — и повторяет. Именно эта петля лежит в основе большинства современных browser-агентов, включая более навороченные коммерческие продукты вроде Stagehand.

☀️ Показательна статистика: рынок ИИ-агентов — $10,91 млрд в 2026-м с прогнозом $50,31 млрд к 2030-му, а 27,7% предприятий уже гоняют агентные браузеры в проде против почти нуля два года назад.

Тот же тренд, что мы видели у Opel/Scout от Microsoft: браузер остаётся необходим там, где API просто не существует.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ Минюст США объявил, что OpenAI и её бывшая «дочка» Statsig подписали мировое соглашение с трёхлетним надзором над практиками найма. Минюст утверждал, что компании мешали гражданам США подавать заявки на позиции, которые занимали иммигранты-сотрудники, пока их спонсировали на постоянное резидентство — не публиковали вакансии на открытых job-бордах, рекламировали по радио поздно ночью, требовали бумажные заявки вместо электронных. Компании не признали вины, но заплатят $3,2 млн.

Речь шла меньше чем о 10 позициях, но теперь компании обязаны согласовывать политику найма и сдавать отчёты дважды в год.

‼️ Расследование началось ещё в 2025-м, до покупки Statsig. Похожие соглашения при Байдене подписывали Facebook и Apple, хотя там нарушения были масштабнее.

Показательно: крупные ИИ-лаборатории оказываются под тем же иммиграционным контролем, что и любая другая компания.
Please open Telegram to view this post
VIEW IN TELEGRAM
🚨 Демис Хассабис оставляет пост CEO Google DeepMind, становится председателем подразделения и главным научным сотрудником Alphabet. Операционку берёт Корай Кавукджу, техдиректор DeepMind — станет старшим вице-президентом, подчиняясь напрямую Пичаи, и будет курировать Gemini. Рынок отреагировал нервно — акции просели.

Хассабис написал сотрудникам, что верит: AGI «уже близко», и хочет сосредоточиться на «большой картине». По данным источников, он давно отдалялся от операционки Gemini в пользу Isomorphic Labs — своего проекта по разработке лекарств с помощью ИИ. В тот же день ушёл и Джефф Дин, главный научный сотрудник DeepMind — запускает стартап с тремя коллегами. Google говорит, что решения не связаны, хотя совпадение показательное.

Реакция отрасли тревожная: наблюдатели напрямую связывают это с гонкой — чтобы не отстать от OpenAI и Anthropic, Google нужно догонять именно во фронтир-кодинге.

Разумное разделение труда между наукой и операционкой, или сигнал неуверенности в стратегии по Gemini?
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ Новое исследование Skill-Use проверяет то, что раньше никто толком не тестировал: способен ли агент сам распознать нужный skill и правильно его применить, а не просто оценивать качество самого skill-документа. Агент видит только имя и краткое описание — и должен сам решить, подходит ли skill к задаче, прежде чем подгрузить полную процедуру.

Оценка разбита на три части: срабатывает ли триггер, точно ли агент следует процедуре, не нарушает ли запреты. 79 реальных skills, 177 задач в девяти доменах, тесты в изолированной песочнице.

➡️ Результат отрезвляющий: даже в лучшей конфигурации из восьми моделей итоговый показатель — всего 0.613 из максимума. Проблема не в одном звене — и триггер, и соблюдение процедуры проваливаются независимо друг от друга. Причём рейтинг моделей меняется в зависимости от агентной обвязки — умение пользоваться skill не фиксированное свойство модели.

Перекликается с темой skills от MCP-серверов, которую мы разбирали недавно: сама доставка skill’а — только полдела, реальное понимание, когда и как его применять, остаётся open-проблемой даже у топовых моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
💢 Персональные агенты хранят предпочтения и историю задач между сессиями, но систематически никто не проверял: улучшаются ли они реально от накопленного опыта или это просто выглядит так. PAST-Bench проверяет это напрямую — 26 сценариев, 204 эпизода, один и тот же агент прогоняется с включённой и выключенной памятью в идентичных условиях.

Результат по семи моделям: улучшение реальное, но неравномерное. Самое интересное — авторы проверяли не только сам факт прироста, но и то, идёт ли он через правильный путь (сохранение → извлечение → обновление опыта). Оказалось, агенты с одинаковым итоговым приростом могут кардинально различаться — один реально учится через память, другой просто угадывает лучше по случайным причинам, а на выходе выглядит одинаково.

➡️ На основе находок авторы сделали Hermes+ с пятью точечными доработками агентного цикла — повышает прирост и даёт понятные доказательства правильного пути обучения.

Хорошее дополнение к теме Memora от Microsoft: построить архитектуру памяти — одно, доказать, что агент реально ею правильно пользуется — совсем другое.

Важнее, чтобы агент учился «правильно», или хватает того, что результат просто становится лучше со временем?
Please open Telegram to view this post
VIEW IN TELEGRAM