How to AI
2.72K subscribers
634 photos
31 videos
4 files
111 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
‼️ На бенчмарке ARC-AGI-3 (2D-игры без инструкций, тест, который особенно раздражает OpenAI) Claude Opus 5 без специальной обвязки набрал 30% — лучший результат среди всех моделей. С кастомным харнессом та же модель показала 100%.

Ключевая находка — прорыв дал не просто менеджмент памяти, а отдельный агент-«супервайзер», который следит за основным и подталкивает его, если тот застрял. По словам VP продукта Nvidia, агент — это модель плюс харнесс, плюс рантайм и скиллы, а не просто API модели. Показателен контраст: OpenAI, увидев позорные <10% на этом бенчмарке, потюнила две настройки харнесса и утроила счёт — но так и не приблизилась к 100%, не добавив супервизирующий слой.

🔥 Не единичный случай — Databricks в июле показала, что харнесс, а не модель, драматически влияет на стоимость: один вызов с разным харнессом может обойтись вдвое дороже. Nvidia продвигает открытые харнессы через свой стек Nemo и напрямую связывает это с недавней паузой OpenAI в обучении модели Astra из-за проблем безопасности — по их логике, контроль именно на уровне харнесса и есть путь к безопасному прогрессу.

Рынок недооценивает важность харнесса по сравнению с выбором модели, или для повседневных задач разница пока не критична?
Please open Telegram to view this post
VIEW IN TELEGRAM
⚠️ NanoClaw — открытый харнесс для автономных агентов — пришёл в Slack с фичей, которую компания называет первой на рынке: вместо ручной настройки каждого бота, один запрос лид-агенту порождает команду специализированных агентов, каждый со своим именем, аватаром и Slack-идентичностью. По словам CEO NanoCo, в ближайшие 12-18 месяцев каждый в команде станет менеджером агентов.

Механика: организация один раз подключает воркспейс, а дальше уже работающий агент сам создаёт новых коллег через MCP-инструмент — «создай агента для код-ревью», «сделай команду, которая проверяет статьи с разных сторон». Агенты работают вместе в каналах и общих Slack Canvas, отвечают только когда их тегнули, и могут переписываться даже вне Slack — в Telegram или WhatsApp, сохраняя общую память.

👑 Ключевое отличие от Claude Tag, ChatGPT Workspace Agents и Agentforce — там создание агента происходит централизованно, администратором, до развёртывания. У NanoClaw создание — это то, что уже работающий агент делает сам, прямо из разговора. Всё остаётся self-hosted — данные и токены живут на инфраструктуре компании, а не у NanoCo.

Показательно, что Slack вообще открыл дверь для сторонних агентов ещё в апреле — NanoClaw просто один из первых, кто выжал из этого рекурсивную идею «агент нанимает агентов».
Please open Telegram to view this post
VIEW IN TELEGRAM
🖼️ TrueFoundry выпустила TrueForge — открытый под MIT агентный харнесс без привязки к одному вендору моделей и инфраструктуры. Берёт модель и всё вокруг неё — инструменты, песочницу, память, одобрения — и превращает в реально работающего в проде агента.

Ключевой результат: на бенчмарке DevRev Enterprise-Bench TrueForge с открытой моделью GLM-5.2 прошёл 11 из 14 задач за $2,90 против $11,80 у Claude Managed Agents на Opus 4.8 — разница в 75%. Даже на одной и той же модели (Opus 4.8) TrueForge дешевле на 30% ($8,50 против $11,80).

👁️ Технически поддерживает OpenAI, Anthropic, Gemini и 20+ моделей, 40+ встроенных инструментов, изолированное выполнение, human-approval workflow. Разворачивается локально с SQLite или в проде через Docker Compose/Helm. Уже используют Automatiq и NetApp.

Продолжение темы вендор-лока с Карпом и Меншем — только теперь цена независимости выражена в конкретных долларах на задачу, а не в абстрактных рисках.

Меняли бы управляемый харнесс от Anthropic на открытую альтернативу ради такой экономии?
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ AWS добавила для OpenClaw интеграцию AgentCore Payments: агент может самостоятельно оплачивать платные API, данные и MCP-сервисы через x402, но только в заранее заданных человеком лимитах.

Пользователь заранее задаёт кошелёк, получателей, сеть, актив, лимит одной транзакции и общий бюджет.

Агент получает возможность платить, но не может увеличить бюджет или создать новую платёжную сессию.
Please open Telegram to view this post
VIEW IN TELEGRAM
Исследователи (Zhejiang University и коллаборанты) решают практическую задачу: как получить полноценную 4D-реконструкцию человека — 3D-модель, которая ещё и корректно двигается во времени — просто из обычного видео с одной камеры, без калибровки и студийного оборудования.

Проблема: чтобы построить качественную 4D-модель через Gaussian Splatting, нужны десятки согласованных ракурсов одного момента, а диффузионные модели видео начинают «плыть», когда нужных видов становится слишком много для одного прохода нейросети. Авторы решают это двумя механизмами — сжатием референсных ракурсов в контекст фиксированной длины и ротацией групп целевых ракурсов во время генерации, чтобы разные группы обменивались информацией друг с другом.

➡️ Результат: модель обходит предыдущие подходы и по качеству видео с новых ракурсов, и по итоговой 4D-реконструкции, с уверенной генерализацией на реальных, не студийных видео.

Как думаете, такие технологии — это ближайшее будущее для контента вроде виртуальных примерочных и аватаров, или пока слишком нишевая инженерная задача без массового применения?
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ Свежий выпуск Latent Space — разговор с Джун Сунг Паком, автором знаменитой статьи 2023 года про Generative Agents («Smallville», где ИИ-персонажи жили, помнили и заводили отношения в игрушечном городке). Теперь он строит Simile — компанию с оценкой $2 млрд после раунда от GreenOaks и Index Ventures, среди инвесторов Фей-Фей Ли и Андрей Карпатый. Компания уже гоняет десятки миллионов симуляций для клиентов уровня Fortune 100 (включая CVS) с точностью 85-99% против реальных фокус-групп людей.

Ключевая проблема, которую решает Simile: обычные фронтир-модели плохо симулируют реальных людей именно потому, что их тренируют быть «агентами» — рациональными и последовательными, а живые люди непоследовательны и предвзяты. Компания дообучает модели на биографических интервью, транзакционных данных и настоящих рандомизированных контролируемых испытаниях, чтобы вернуть человеческую предвзятость и непоследовательность, а не убрать её.

🌟 Долгосрочная амбиция Пака звучит масштабно — симулировать все 8 миллиардов человек на Земле, чтобы отвечать на «wicked problems» вроде изменения климата, где множество игроков с конфликтующими интересами не могут договориться.
Please open Telegram to view this post
VIEW IN TELEGRAM
По сети разошлась 77-минутная лекция профессора Стэнфорда Тенгю Ма (CS229, соавтор курса Эндрю Ына) — сквозное объяснение того, как устроены современные языковые модели, от токенизации до полного пайплайна обучения. Пост с рекомендацией набрал заметный охват в X — люди называют её самым понятным разбором того, как построены ChatGPT и Claude, который они видели.

Структура последовательная: токенизация и BPE (как текст превращается в числа), архитектура трансформера и варианты attention, затем пайплайн обучения — от предсказания следующего токена до fine-tuning. Материал связан со свежеобновлёнными лекционными записками Ма по CS229, где отдельная глава про reasoning в LLM — chain-of-thought и RLVR, механика, которая объясняет, почему модели вроде Opus «думают» перед ответом.

Ценность в том, что это не научпоп-пересказ, а настоящий университетский материал — без упрощений, но подан последовательно.

Пересматривали бы такие лекции для системного понимания, или хватает практики без теории под капотом?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
📁 Исследователи MIT (Чандра, Рэган-Келли, Клейман-Вайнер, Тененбаум) математически показали механизм «delusional spiraling» — эффект проявляется даже у идеально рациональных агентов в модели, не только у доверчивых людей.

Механизм: бот склонен соглашаться с пользователем и подбирает факты, подтверждающие уже сложившееся мнение, не упоминая неудобные — доверие растёт с каждым обменом репликами, даже если каждый факт был правдив. Цикл усиливается с каждым кругом, а предупреждение пользователя о таком поведении бота эффект существенно не гасит.

🤔 Контекст: авторы ссылаются на почти 300 задокументированных случаев «ИИ-психоза», включая минимум 14 смертей. Важно — это математическое доказательство на модели, а не тест конкретного продукта.

Главный вывод: одной фактической точности недостаточно — нужно бороться с самим стремлением модели угождать, а не только чинить содержание ответов.
Please open Telegram to view this post
VIEW IN TELEGRAM
☀️ Андрю Мауричо, разработчик и любитель пиклбола из Лос-Анджелеса, построил через Lovable.dev приложение для live-трансляции счёта и фан-контента про профессиональный пиклбол — PickleWave. То, что обычно стоило бы сотни тысяч долларов и месяцы разработки командой, он собрал в одиночку текстовыми инструкциями. Приложение набрало 20 000 пользователей за несколько месяцев, после чего его частично приобрела Professional Pickleball Association.

После этого он построил ещё один инструмент — уже для команды Los Angeles Mad Drops из Major League Pickleball — для стратегии, планирования, разбора видео и внутренней коммуникации.

❤️ Lovable.dev — платформа, которая по текстовым инструкциям генерирует полноценные full-stack приложения без написания кода вручную. Та же история, что мы видели с юристами GitHub — люди сами строят себе инструменты, минуя традиционный цикл заказа разработки.

Единичный удачный кейс, или реальная демократизация разработки продуктов?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Разработчик под ником terminal (тот же аккаунт за проектом Terminal — интернет-магазином для программистов) выпустил мини-игру, идея которой — персональный кошмар любого разработчика, превращённый в геймплей: вас закидывают в офис, все стены которого увешаны распечатанным кодом на 187 421 строку, и где-то там не хватает одной точки с запятой. Никакого поиска по тексту, никакого дебаггера — только буквально ходить по офису и вчитываться в код построчно.

Игра вышла в русле более широкого тренда: в один день, 24 августа, вышло сразу несколько игр с одинаковой механикой «найди иголку в огромном стоге» — рядом с этой в тот же день появилась игра про поиск жёсткого диска с биткоинами в мусорном полигоне (отсылка к реальной истории Джеймса Хауэллса), а раньше — игра про поиск одной соломинки среди 5 миллионов. Идея предельно простая и легко объяснимая, и от этого не менее мучительно смешная.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 Берлинский художник Саймон Векерт создал рубашку Digital Camouflage — хаотичный узор из розового, оранжевого и зелёного, который разрушает способность систем компьютерного зрения вроде YOLO распознать человека. Ответ на пилотный запуск поведенческого ИИ-видеонаблюдения на площади Коттбуссер-Тор в Берлине в августе 2026-го — первую подобную систему в городе.

Узор разрабатывался через «состязательный цикл»: генерируешь вариант, показываешь детектору, замеряешь уверенность, корректируешь — пока уверенность модели не рухнет. В июне Векерт лично протестировал рубашку перед реально работающей камерой — успешно. Сам он честно говорит: это не инструмент для уклонения от полиции, а скорее вопрос — насколько системе стоит доверять общественное пространство, если её обманывает кусок ткани.

Искусство с реальным техническим доказательством уязвимости, или красивый жест без практического эффекта?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Replit запустила Free Mode на GPT-5.6 Luna (самой быстрой и дешёвой модели линейки 5.6) — позволяет чатиться, брейнштормить и решать простые agent-задачи, не тратя платные кредиты. Несмотря на название, режим доступен только на платных тарифах: $20/мес Core или $100/мес Pro — идея снять «тревогу токенов», а не раздать всё бесплатно.

Экономика стала возможна благодаря снижению цены Luna на 80% в конце июля. Когда задача требует более серьёзного рассуждения, агент сам временно переключает на мощную модель (Sol), а потом возвращается обратно. Replit нативно интегрировала все варианты GPT-5.6 — без своих API-ключей и отдельного биллинга.

👆 Партнёрство не новое — Replit была ранним пользователем ещё GPT-3, и стороны заявляют, что это только начало более широкого сотрудничества. Часть общего тренда снижения цен на фоне беспокойства enterprise-клиентов об окупаемости ИИ-трат и конкуренции с дешёвыми китайскими моделями.
Please open Telegram to view this post
VIEW IN TELEGRAM