How to AI
2.72K subscribers
638 photos
31 videos
4 files
115 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
‼️ Видео IBM Technology разбирает, как меняется природа галлюцинаций у автономных агентов. Хорошая новость: агенты сами способны снижать частоту галлюцинаций, пользуясь инструментами вроде поиска и API — то есть проверяя факты, а не угадывая их.

Но есть обратная сторона: в мульти-агентных цепочках одна галлюцинация становится стартовым допущением для всех последующих шагов — агент А выдумывает факт, агент B строит на нём рассуждение, агент C суммирует вывод — и система выдаёт гладкий, но в корне неверный ответ. Тот же каскадный эффект, что мы разбирали недавно про мульти-агентные сбои, только источник каскада здесь — фабрикация факта, а не техническая ошибка.

📁 Чем длиннее автономная цепочка агентов, тем важнее не точность каждого шага по отдельности, а механизмы, которые ловят ошибку до того, как она станет фундаментом для следующих десяти.

Сталкивались с ситуацией, когда агент «поверил» на слово другому и утащил ошибку дальше?
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ 27 июля Microsoft представила MAI-Cyber-1-Flash — компактную модель безопасности, встроенную в MDASH, оркестратор из 100+ агентов, которые ищут, проверяют и подтверждают уязвимости в коде. В связке с GPT-5.4 система показала 95.95% на бенчмарке CyberGym, обойдя Gemini 3.5 Flash Cyber, GPT-5.6 Sol и Mythos 5.

Экономика важна не меньше цифр: компактная модель закрывает около 90% задач сама, оставляя дорогие модели только для самых сложных 10% случаев — это даёт примерно 50% экономии. Логика Microsoft простая: раз стоимость поиска уязвимости атакующими обваливается благодаря ИИ, защитникам тоже нужна автоматизация вместо редких ручных аудитов.

🔥 Нюанс — модель доступна только внутри MDASH для одобренных корпоративных клиентов, отдельного публичного API нет.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ 31 июля Альтман написал в X: подключите семейные календари, расскажите ChatGPT про интересы детей — и каждое утро по дороге в школу он соберёт подкаст про футбольный матч одного ребёнка, день рождения другого, немного новостей. Пост набрал 14,2 млн просмотров — но не от восторга.

Ответ создателя Gravity Falls Алекса Хирша — короткое «А что если просто поговорить с детьми?» — набрал больше 220 тысяч лайков, полностью затмив пост Альтмана. Это не первый его заход в тему: ранее он говорил, что не представляет воспитание ребёнка без ChatGPT.

📁 Контекст острее самой истории: OpenAI одновременно ищет продакт-менеджера под доверительные продукты для семей и защищается в судах по искам, где ChatGPT обвиняют в роли в развитии бреда и суициде близких пользователей. Рынок ИИ в уходе за детьми при этом оценивают почти в $42 млрд к 2035 году.

Вам это кажется полезным лайфхаком для занятых родителей, или симптомом подмены живого общения технологией?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔪 OpenAI открыла исходный код Codex Security — CLI и TypeScript SDK для поиска, проверки и исправления уязвимостей в коде. Вошёл в research preview ещё в марте, теперь под Apache-2.0, уже около 1,5 тысяч звёзд на GitHub, 392 балла на Hacker News.

Инструмент не просто линтер с готовыми правилами — использует ИИ для контекстного анализа: оценивает, как код реально ведёт себя, и сам предлагает патчи. Умеет ставить pre-commit проверки, гонять сканы в CI с отсечкой по severity, находить репозитории через GitHub CLI и выполнять массовые сканирования по CSV.

🔥 Занятная деталь с Hacker News: по словам разработчика (экс-сооснователь Promptfoo), на тюнинг промптов для поиска уязвимостей ушли «миллиарды токенов» эвалов — основная ценность именно в отточенных инструкциях для модели, а не в обвязке.

Логичное продолжение темы MAI-Cyber-1-Flash от Microsoft — крупные игроки один за другим выпускают инструменты для защитной стороны безопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪐 Microsoft добавила в Agent Framework для .NET возможность агентам подгружать Agent Skills напрямую с MCP-сервера — без зашивания в приложение и передеплоя. Центральная команда публикует навык один раз, все агенты в организации получают его сразу.

Технически поддерживаются два формата: сервер отдаёт SKILL.md с ресурсами по требованию, либо весь скилл упакован архивом, который framework скачивает и распаковывает локально. Разработчику всё равно, каким способом упакован скилл.

🍒 Для бизнеса ценность в governance: доменная экспертиза — политики, комплаенс, плейбуки — теперь версионируется централизованно и раскатывается без изменения кода. Отдельно усилили безопасность распаковки архивов — важно, когда агенты сами подтягивают возможности во время выполнения.

Тот же паттерн, что мы видели с RODA MCP-сервером от AWS, только теперь про внутреннюю дистрибуцию знаний в организации, а не публичные датасеты.

Уже используете скиллы в своих агентах, или пока держите инструкции в системном промпте?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ Шуай Го из Towards Data Science собирает browser-use агента на связке OpenAI Agents SDK и Playwright MCP. Логика простая: пока агент ограничен API-вызовами, он покрывает от силы 5% того, что реально делает человек за рабочий день — дав ему браузер, покрытие приближается к почти полному объёму задач.

Архитектура — простой цикл: агент получает задачу и текущее состояние браузера, решает действие, отправляет его, получает новое состояние — и повторяет. Именно эта петля лежит в основе большинства современных browser-агентов, включая более навороченные коммерческие продукты вроде Stagehand.

☀️ Показательна статистика: рынок ИИ-агентов — $10,91 млрд в 2026-м с прогнозом $50,31 млрд к 2030-му, а 27,7% предприятий уже гоняют агентные браузеры в проде против почти нуля два года назад.

Тот же тренд, что мы видели у Opel/Scout от Microsoft: браузер остаётся необходим там, где API просто не существует.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ Минюст США объявил, что OpenAI и её бывшая «дочка» Statsig подписали мировое соглашение с трёхлетним надзором над практиками найма. Минюст утверждал, что компании мешали гражданам США подавать заявки на позиции, которые занимали иммигранты-сотрудники, пока их спонсировали на постоянное резидентство — не публиковали вакансии на открытых job-бордах, рекламировали по радио поздно ночью, требовали бумажные заявки вместо электронных. Компании не признали вины, но заплатят $3,2 млн.

Речь шла меньше чем о 10 позициях, но теперь компании обязаны согласовывать политику найма и сдавать отчёты дважды в год.

‼️ Расследование началось ещё в 2025-м, до покупки Statsig. Похожие соглашения при Байдене подписывали Facebook и Apple, хотя там нарушения были масштабнее.

Показательно: крупные ИИ-лаборатории оказываются под тем же иммиграционным контролем, что и любая другая компания.
Please open Telegram to view this post
VIEW IN TELEGRAM
🚨 Демис Хассабис оставляет пост CEO Google DeepMind, становится председателем подразделения и главным научным сотрудником Alphabet. Операционку берёт Корай Кавукджу, техдиректор DeepMind — станет старшим вице-президентом, подчиняясь напрямую Пичаи, и будет курировать Gemini. Рынок отреагировал нервно — акции просели.

Хассабис написал сотрудникам, что верит: AGI «уже близко», и хочет сосредоточиться на «большой картине». По данным источников, он давно отдалялся от операционки Gemini в пользу Isomorphic Labs — своего проекта по разработке лекарств с помощью ИИ. В тот же день ушёл и Джефф Дин, главный научный сотрудник DeepMind — запускает стартап с тремя коллегами. Google говорит, что решения не связаны, хотя совпадение показательное.

Реакция отрасли тревожная: наблюдатели напрямую связывают это с гонкой — чтобы не отстать от OpenAI и Anthropic, Google нужно догонять именно во фронтир-кодинге.

Разумное разделение труда между наукой и операционкой, или сигнал неуверенности в стратегии по Gemini?
Please open Telegram to view this post
VIEW IN TELEGRAM
👁️ Новое исследование Skill-Use проверяет то, что раньше никто толком не тестировал: способен ли агент сам распознать нужный skill и правильно его применить, а не просто оценивать качество самого skill-документа. Агент видит только имя и краткое описание — и должен сам решить, подходит ли skill к задаче, прежде чем подгрузить полную процедуру.

Оценка разбита на три части: срабатывает ли триггер, точно ли агент следует процедуре, не нарушает ли запреты. 79 реальных skills, 177 задач в девяти доменах, тесты в изолированной песочнице.

➡️ Результат отрезвляющий: даже в лучшей конфигурации из восьми моделей итоговый показатель — всего 0.613 из максимума. Проблема не в одном звене — и триггер, и соблюдение процедуры проваливаются независимо друг от друга. Причём рейтинг моделей меняется в зависимости от агентной обвязки — умение пользоваться skill не фиксированное свойство модели.

Перекликается с темой skills от MCP-серверов, которую мы разбирали недавно: сама доставка skill’а — только полдела, реальное понимание, когда и как его применять, остаётся open-проблемой даже у топовых моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
💢 Персональные агенты хранят предпочтения и историю задач между сессиями, но систематически никто не проверял: улучшаются ли они реально от накопленного опыта или это просто выглядит так. PAST-Bench проверяет это напрямую — 26 сценариев, 204 эпизода, один и тот же агент прогоняется с включённой и выключенной памятью в идентичных условиях.

Результат по семи моделям: улучшение реальное, но неравномерное. Самое интересное — авторы проверяли не только сам факт прироста, но и то, идёт ли он через правильный путь (сохранение → извлечение → обновление опыта). Оказалось, агенты с одинаковым итоговым приростом могут кардинально различаться — один реально учится через память, другой просто угадывает лучше по случайным причинам, а на выходе выглядит одинаково.

➡️ На основе находок авторы сделали Hermes+ с пятью точечными доработками агентного цикла — повышает прирост и даёт понятные доказательства правильного пути обучения.

Хорошее дополнение к теме Memora от Microsoft: построить архитектуру памяти — одно, доказать, что агент реально ею правильно пользуется — совсем другое.

Важнее, чтобы агент учился «правильно», или хватает того, что результат просто становится лучше со временем?
Please open Telegram to view this post
VIEW IN TELEGRAM
☀️ Видео KodeCloud разбирает квантизацию — почему модель на 70 млрд параметров можно запустить не на сервере, а на обычной видеокарте. Каждый параметр — число, и то, сколько бит уходит на его хранение, определяет размер модели.

Авторы разводят три вещи, которые обычно путают: числовые форматы (FP16, INT8, INT4 — сколько бит на число), методы квантизации (GPTQ, AWQ — алгоритмы, которые решают, какие веса можно упростить без потери качества) и файловые форматы (GGUF — просто контейнер для готового результата, а не метод квантизации, хотя его часто путают с ним).

🔥 Практический вывод: снижение точности не бывает бесплатным. Q4 даёт примерно вдвое меньше объём против FP16 при потере качества 3-5% — нормально для чата, но для кодинга и сложных рассуждений точность обычно стоит доплатить памятью.

Хорошая база для тех, кто пробует запускать открытые модели вроде Kimi K3 или GLM локально и натыкается на суффиксы вроде Q4_K_M в названиях файлов.

Запускаете модели локально, или предпочитаете облачный API без возни с квантизацией?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍 Дрю Бройниг разбирает главную проблему Spec-Driven Development: спецификации и тесты должны быть источником правды, а код «прилагается бесплатно» — но на практике реальный вызов в том, чтобы удержать всё это в синхронизации по мере роста проекта.

Первая волна SDD-проектов опиралась на уже существующий софт как источник истины — работает хорошо на чётко очерченных поверхностях (API, плагины, conformance-наборы), где поведение легко тестируется. Вторая волна толкает методологию в территорию без внешнего валидатора — и там проблема синхронизации резко усложняется. Автор проводит параллель с программным кризисом 1968 года: тогда ответом стал процесс, и агенты снова создали похожий кризис — кода больше, чем люди способны ревьюить — только теперь в помощь берут сам ИИ.

🖼️ Хорошее противоядие восторженному маркетингу вокруг SDD: методология работает, но не универсально — граница применимости определяется тем, есть ли у задачи внешний проверяемый критерий правильности.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ Пока полмира смотрело финал ЧМ, математик Anthropic Левент Альпёге написал в X: гипотеза Якоби — ложна. Сформулированная в 1939 году, она утверждала, что полиномиальное отображение с постоянным ненулевым якобианом обязательно обратимо.

Альпёге не доказал гипотезу — он её опроверг: нашёл конкретное необратимое отображение с постоянным якобианом, контрпример уместился в 216 символов — при том что математики предполагали минимальную степень такого примера в районе 200. Помогла Fable 5, модель, которую Anthropic изначально считала слишком мощной для публичного релиза. Автор — не случайный человек: PhD из Принстона под руководством Филдсовского лауреата, лауреат премии Моргана.

➡️ Оговорка для скептиков: результат ещё не прошёл рецензирование, а полная стенограмма промптов не опубликована — так что реальный вклад модели против направляющей роли математика пока нельзя независимо проверить.

Показательно, что это не единичный случай: в этом году AlphaProof от DeepMind самостоятельно решил девять открытых проблем Эрдёша, а Claude Mythos независимо и короче доказала гипотезу единичного расстояния, чем OpenAI.

Начало настоящей революции в математических открытиях, или единичный эффектный кейс на фоне тысяч менее звучных попыток?
Please open Telegram to view this post
VIEW IN TELEGRAM
📁 AWS перестроила кодинг-агент Kiro вокруг Agent Client Protocol (ACP) — открытого стандарта из Zed, теперь развиваемого совместно с JetBrains. Идея как у Language Server Protocol: раньше каждый редактор писал кастомную интеграцию под каждого агента, теперь один протокол связывает любого агента с любым совместимым редактором.

До переделки у Kiro было три отдельных харнесса под разные поверхности (TypeScript, Rust, Python) — теперь всё объединено в единый харнесс. Практический эффект — Kiro CLI уже работает в JetBrains, Zed и других ACP-совместимых редакторах, а не только в своём интерфейсе. AWS сознательно расширила протокол, а не сделала проприетарный форк.

🤔 Важная деталь: оркестрация (Kiro Crew) открыта под Apache 2.0, но сам движок агента остаётся проприетарным — открыт уровень интеграции, а не «начинка» рассуждений. Microsoft уже подхватила идею со своим экспериментальным ACP-клиентом.

Продолжение темы вендор-лока, которую мы разбирали через Карпа и Менша — только теперь решение на уровне протокола связи, а не модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ AWS выпустила нативный векторный поиск для DynamoDB в общем доступе. Теперь эмбеддинги хранятся прямо рядом с операционными данными в тех же таблицах — без репликации в отдельную специализированную базу и без синхронизации между ними.

Цифры: одноразрядная миллисекундная задержка при recall выше 99%, масштаб до триллионов векторов, без администрирования инфраструктуры. Можно использовать любую модель эмбеддингов — от Amazon Titan до OpenAI — и единая serverless-оплата по факту использования.

🔥 Важнее технических цифр сигнал по рынку: по опросу индустрии, большинство специалистов по данным предпочли бы держать векторный движок прямо внутри основной БД, а не городить отдельный стек. Прямой удар по нише standalone векторных баз вроде Pinecone — облачные провайдеры один за другим встраивают векторный поиск в существующие движки.

Держите отдельную векторную базу для RAG, или готовы перейти на встроенный поиск?
Please open Telegram to view this post
VIEW IN TELEGRAM
Команда юристов GitHub использовала Copilot CLI, чтобы автоматизировать повторяющиеся задачи: проверку контрактов, анализ кода, DMCA-запросы, NDA и оценку рисков.

Один из юристов собрал собственный инструмент для работы с договорами. Вместо постоянного копирования промтов он вынес инструкции, шаблоны и внутренние материалы в репозиторий. В результате время на подготовку и проверку документов сократилось примерно вдвое.

👍 Главное здесь даже не Copilot. AI позволяет специалисту превратить собственную экспертизу в рабочий инструмент — без необходимости становиться разработчиком.

Юристы фактически начали «программировать» на естественном языке: описывают методологию, правила и нужный результат, а AI превращает это в повторяемый workflow.
Please open Telegram to view this post
VIEW IN TELEGRAM
На GitHub появился skill-forge — открытый инструмент-«мастерская», который автоматизирует создание Agent Skills для Claude Code из внешних источников: репозиториев на GitHub, онлайн-документации, PDF. Идея простая: вместо того чтобы вручную читать документацию нового инструмента и вручную писать под него SKILL.md, скидываете источник — а на выходе получаете структурированный, переиспользуемый скилл.

Технически интересны несколько деталей. Умное определение источника само распознаёт, откуда тащить материал — GitHub, сайт документации, локальный файл. Работает без настройки из коробки. Отдельно — поддержка формата llms.txt, который ускоряет сбор документации примерно в 10 раз по сравнению с обычным парсингом HTML-страниц.

⚠️ Показательно, что проект прямо указывает: он построен поверх официального skill-creator от Anthropic — то есть не изобретает велосипед с нуля, а расширяет уже существующий шаблон под более автоматизированный сценарий сбора источников.
Claude теперь умеет оставлять «следы» в своих ответах.

Anthropic объявила, что новые версии Claude получают невидимую машинную маркировку текста — одна из причин в том числе требования EU AI Act.

И это хороший пример того, как быстро меняется Digital.

Ещё недавно обсуждали, какая нейросеть лучше. Сейчас уже обсуждаем авторство, происхождение контента, безопасность и то, как AI встраивается в реальные процессы.

Сейчас, за нишей digital приходится следить не только ради интереса — изменения начинают напрямую влиять на работу.

Собрали в папке материалы, сервисы и полезные находки по Digital / IT / AI:

📂 Сохранить папку себе
👁️ Во время сезона обновления контрактов юрист GitHub начал использовать Copilot CLI для отдельных задач, а потом построил целый инструмент — terms-ai для составления договоров, с версионированным репозиторием инструкций и style guide на понятном языке. Договоры и чувствительные данные остались в закрытом окружении, а сам инструмент и логика работы — в открытом доступе.

Параллельная история: юрист без технического бэкграунда сама спланировала и собрала внутреннюю платформу для операционных инструментов юротдела через Copilot CLI, ведя весь процесс через GitHub Issues и Actions.

➡️ Показательный момент — ещё один юрист построил кастомный скилл именно для проверки самих ИИ-результатов: когда цена ошибки высока, доверие к выводу инструмента важнее самой автоматизации.

Главная линия здесь не «ИИ заменяет юристов», а «непрограммисты сами строят себе инструменты», минуя очередь к инженерному отделу.

Строили бы себе подобный внутренний инструмент сами, если бы не было готового решения?
😁1🤔1
🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten о том, что происходит между релизом модели на Hugging Face и продакшен-API. Главный тезис: узкое место сместилось от обучения к инференсу — именно там сейчас основной инженерный рычаг.

Прирост в 20-200% скорости — рутинная дисциплина, если сложить квантизацию, спекулятивное декодирование и разделение prefill/decode на разные узлы. Главный рычаг теперь не хитрость в GPU-ядре, а то, где живёт KV-кеш и как быстро он двигается между узлами. Показателен пример с GLM-5.2: более агрессивная квантизация неожиданно сохранила качество при росте пропускной способности на 20%, потому что ошибки в разных слоях взаимно гасили друг друга.

👆 Тренинг и инференс постепенно сливаются в одну дисциплину — спекулятивные «головы» обучаются на живых активациях основной модели. Гости также прогнозируют, что настоящим узким местом становится не сырая вычислительная мощность GPU, а межчиповая связь — отсюда ставка NVIDIA на Dynamo как оркестрацию, а не просто CUDA-трюки.
⁉️ Microsoft резко наращивает производство чипов следующего поколения Maia 300 — представление ожидается этой осенью. Ведутся переговоры с TSMC о мощностях на 300 000+ чипов к 2027-му, конечная цель — свыше миллиона.

Microsoft тут заметно отстаёт: Google уже продаёт свои TPU и планирует свыше 3 млн штук в этом году, у Amazon контракт на 1 млн чипов Trainium именно с Anthropic. И тут самое интересное — Microsoft одновременно уговаривает ту же Anthropic перейти на Maia, хотя та уже глубоко завязана на чипы Amazon и Google. Аргумент конкретный: Maia 200 на 30-40% дешевле в эксплуатации, чем топовые чипы Nvidia.

👑 Показательный штрих: при квартальных расходах на инфраструктуру в $35,8 млрд Microsoft недавно попросила сотрудников прекратить «токенмаксинг» — стоимость вычислений остаётся реальным ограничением даже для гиганта.

Реально ли Microsoft переманит Anthropic на Maia, или это скорее рычаг для скидок у Nvidia и Amazon?