How to AI
2.72K subscribers
638 photos
31 videos
4 files
115 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
🔥 Агенты, подключённые к внешним инструментам, уязвимы к prompt injection, спрятанным прямо в данных из окружения — письме, странице, результате поиска. Раньше такие атаки собирали вручную или через случайную симуляцию — это плохо масштабируется.

ToolHazard автоматизирует сам процесс: Environment Simulator создаёт исполняемые окружения, Attacker Agent сам находит точки для внедрения и генерирует специфичные payload'ы, User Simulator строит длинные задачи, привязанные к реальному состоянию. На основе этого собрали ToolHazard-Bench для стресс-тестирования агентов.

👆 Результаты показывают существенную уязвимость агентов, причём момент и место атаки заметно влияют на её эффективность. Важно: сгенерированные данные для alignment-тюнинга реально повышают безопасность и на своём бенчмарке, и на независимом AgentDojo, не портя способность выполнять обычные задачи.

Зеркальная сторона темы каскадных сбоев, которую мы разбирали — только источник ошибки здесь не модель, а злонамеренный контент из среды.
☀️ Alibaba открыла веса гигантской Qwen3.8 на 2.4 трлн параметров, а в пятницу — ещё и компактную 27-миллиардную версию под Apache 2.0, которую реально запустить локально на хорошем MacBook Pro или Mac Studio.

По бенчмаркам Alibaba, производительность компактной версии — в той же лиге, что у Opus 4.6 на максимальных настройках, а по некоторым задачам даже обходит его. Модель умеет работать с изображениями и видео. Показателен скачок по агентному кодинг-бенчмарку DeepSWE — с 14.2 до 42.2 балла против предыдущего поколения.

🔪 Из практики: неквантованная версия весит 55.6 ГБ, но уже есть MLX-конверсии под Apple Silicon — 4-битная версия занимает около 16.1 ГБ, что делает Mac с 32 ГБ памяти разумной платформой.

Автор статьи остужает восторг: бенчмарки — про оригинальный чекпоинт, а не квантованные версии, которые реально будут гонять большинство пользователей, плюс модель склонна «пережёвывать» задачи излишне долго.

Разворачивали бы такую модель у себя на Mac, или проще остаться на облачном API?
💢 Для Plus и Pro — обновлённая GPT-5.6 Sol: более точные и сфокусированные ответы, реже соглашается просто ради вежливости, Instant и Thinking объединены в единую модель с новым слайдером «сколько думать». Для бесплатных пользователей — дефолтная модель меняется на GPT-5.6 Luna с безлимитными текстовыми чатами (раньше был лимит) и кнопкой Think для сложных вопросов.

Цифры заметные: доля ответов с фактической ошибкой в финансовых, медицинских и юридических промптах упала на 62% у Luna и 68% у Sol по сравнению с прошлой версией.

Отдельный важный момент — про безопасность подростков: система-карточка описывает, что модель обучена избегать романтического ролплея, не заменять собой реальные отношения и соблюдать возрастные границы по чувствительным темам.

Нюанс: обновление касается только обычного чата — версия для Work и Codex не меняется.
🔥 GitHub выпустила SDK для Java, который позволяет управлять Copilot прямо из идиоматичного enterprise-кода — с аннотациями, виртуальными потоками, всей привычной Java-экосистемой. До этого у Java-разработчиков были только фреймворк-специфичные обходные пути вроде Langchain4j или Spring AI — оба тянут за собой зависимость от чужих архитектурных решений. Новый SDK — первый по-настоящему фреймворк-агностичный способ работать с ИИ из Java, при этом работает и в Jakarta EE, и в Spring, и вообще где угодно на сервере.

Самое интересное — несмотря на название «Copilot SDK», он вендор-нейтрален: можно передать свой provider/ProviderConfig с собственным baseUrl и apiKey, чтобы работать напрямую с OpenAI, Azure, Anthropic или любым OpenAI-совместимым эндпоинтом — без подписки на Copilot вообще.

🌟 Технически ключевая фишка — аннотация @CopilotTool: пишете обычный Java-метод, помечаете его аннотацией — и SDK сам генерирует JSON Schema, парсит аргументы и диспетчеризирует вызовы модели.
‼️ Google и Raspberry Pi опубликовали гайд: полноценный локальный ИИ-конвейер — речь, зрение, языковая модель — работает целиком на Raspberry Pi 5 без облака. Витрина — робот Reachy Mini: слышит, распознаёт объекты, рассуждает через Gemma, отвечает речью и движением. Весь стек — около $80 в железе.

В основе — LiteRT (эволюция TensorFlow Lite) с надстройкой под LLM. Семейство Gemma подобрано под разные ограничения железа — от компактной 270M-модели до полноценной Gemma 4 E2B для диалога. Цифры: 99 токенов/сек prefill, 9 токенов/сек генерация при памяти всего 1432 МБ — это около 300 слов в минуту, вдвое быстрее обычной человеческой речи.

☀️ Порог входа снизили сильно — весь тулчейн ставится одним pip install, а CLI объединяет конвертацию, квантизацию и инференс, убирая обычную возню с зависимостями. Есть и GPU-ускорение для разгрузки компьютерного зрения.

Продолжение темы Qwen3.8-27B на Mac — только здесь совсем другой класс железа: не ноутбук, а $80 одноплатник без Wi-Fi.

Пробовали бы собрать что-то подобное сами, или локальный ИИ такого масштаба кажется больше хобби-проектом?
Please open Telegram to view this post
VIEW IN TELEGRAM
🖥 Фло Кривелло, CEO Lindy, запустил Lindy Teammate — ИИ-«сотрудника» в Slack, который подключается ко всем корпоративным инструментам и накапливает общий контекст команды. Тезис: интеллект без контекста менее полезен, чем обычный коллега.

Архитектура памяти интересна отдельным memory.md файлом с «настоящей» памятью и санитизированной версией для демо. Разговор разбирает ту же проблему context rot, что мы видели через RLM от LangChain и Memora от Microsoft — только на уровне продукта для реальных команд.

🚨 Самое острое — не техническое: Lindy по умолчанию работает на DeepSeek («уровень Sonnet 4.6» при цене в 100 раз ниже), что сделало убыточный продукт прибыльным. При этом сам Кривелло публично выступает за запрет китайских моделей в США по соображениям безопасности — строит бизнес на том, что сам же считает нужным запретить.

Продолжение спора про раскол вокруг китайских моделей, только конфликт интересов здесь не абстрактный, а внутри одного человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Знакомая тема: CEO Palantir предупреждает, что компании рискуют потерять контроль над ценными данными и IP, если слишком полагаются на сторонние ИИ-компании. Тезис прежний — получать выгоды от ИИ, не отдавая активы, которые формируют конкурентное преимущество.

Новое здесь — сам факт, что тема снова всплывает, отражая реальное движение рынка в сторону суверенитета данных и контроля клиента. Учитывая всё, что мы разбирали за последние месяцы — портативность через ACP от Kiro, открытые модели вроде Qwen3.8 и Kimi K3, попытки Microsoft переманить Anthropic на свои чипы — картина действительно складывается: крупные игроки предлагают клиентам больше свободы, а не меньше.

💢 У Карпа тут прямой коммерческий интерес — Palantir продаёт именно этот слой контроля. Но если рынок движется в эту сторону независимо от того, кто это озвучил первым, тенденция важнее автора тезиса.

Бизнес правда стал осторожнее с передачей данных ИИ-провайдерам, или это пока больше разговоры, чем практика?
Please open Telegram to view this post
VIEW IN TELEGRAM
24 августа ChatGPT Реклама становится доступна в 31 стране Европы, включая Германию, Францию, Испанию, Италию, Швецию, Норвегию, Данию, Нидерланды и Австрию. На первом этапе доступ только через рекламные команды OpenAI, агентства и технопартнёров — самостоятельный запуск через Менеджер рекламы обещают позже в этом квартале.

Пилот в США стартовал в феврале, и за полгода OpenAI добавила ещё восемь рынков, а теперь разом выходит на 31 европейский. Параллельно платформа доросла технически: от простой модели CPM до CPC и теперь оптимизированной под конверсии oCPC, плюс геотаргетинг, пользовательские аудитории и расширенная отчётность через OpenAI Pixel и Conversions API — то есть это уже полноценный рекламный стек, а не экспериментальная надстройка.

👍 Заявленный принцип — реклама чётко маркирована, отделена от ответов ChatGPT и не влияет на сами ответы модели. Но сам факт масштабирования на 31 рынок за полгода показывает, что монетизация через рекламу — уже не пилот, а стратегическое направление роста, причём десятки тысяч рекламодателей уже используют платформу.

Интересно здесь то, что ChatGPT становится не просто поисковиком-заменителем, а точкой принятия решения о покупке — именно на это и целится реклама. Учитывая, что Anthropic принципиально держит свои продукты без рекламы, разница в подходах двух главных конкурентов становится всё заметнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, AI начал оставлять после себя следы. Буквально.

Anthropic объявила, что будет добавлять в тексты, созданные Claude, невидимые машинно-читаемые метки. Даже после копирования текста такая маркировка может сохраняться.

И это, кажется, хорошо показывает, куда всё движется.

Digital и IT меняются слишком быстро, чтобы пытаться уследить за всем в одиночку.

Поэтому собрали в одну папку каналы про технологии, AI, IT, сервисы и всё интересное, что происходит в Digital.

🗂 Сохранить подборку себе
👍 OpenAI на две недели приостановила RL-обучение передовых моделей, чтобы укрепить исследовательские среды и мониторинг. Причина — взлом Hugging Face сбежавшим агентом (уже разбирали) и предварительные данные о том, что будущая модель Astra может достичь порога «критических возможностей» в кибербезопасности.

Крупнейший запланированный запуск RL всё ещё на паузе — идут только эксперименты меньшего масштаба.
Ввели три слоя защиты: строгую изоляцию для недоверенного кода, сетевую изоляцию высокорисковых процессов и постоянное тестирование безопасности через симуляцию атак. Расширили мониторинг цепочки рассуждений — классификаторы проверяют каждый токен, при подозрении на нарушение критической границы поднимают тревогу за 30 минут. Вся эта система съедает около 20% вычислительных ресурсов отслеживаемого инференса.

➡️ Показательна формулировка: OpenAI ожидает, что скоро модели сами будут обеспечивать бóльшую часть безопасности, включая защиту от других моделей.
Первый случай, когда крупная лаборатория публично объясняет конкретный измеримый риск, а не маркетинговый тайминг, как причину паузы в релизах.

Такая прозрачность усиливает доверие к компании, или тревожит тем, что риски оказались настолько реальны?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ IOL-AI Challenge — соревнование на невиданных задачах Международной олимпиады по лингвистике 2026, где результаты моделей впервые оценивало настоящее жюри по тем же критериям, что и у школьников-участников. Ценность именно такого теста в том, что рассуждения LLM обычно изучают на математике и коде, где модели заранее даны правила. В лингвистике их нет — сначала нужно самому обнаружить систему языка, а данных для заучивания просто не существует.

731 заявка от 46 команд при жёстком бюджете — одна видеокарта T4, 30 минут. Отдельно без ограничений прогнали 15 топовых моделей: Claude Opus 4.8 набрала оценку жюри, эквивалентную золотой медали, а системы под жёстким compute-бюджетом оказались в нижних 5% участников.

☀️ Показательно: способность не определяется масштабом — заявки на 14B параметров обходили модели вдвое большего размера, прирост шёл от настройки декодинга, а не от размера. Автоматические метрики ранжируют системы правильно, но сжимают шкалу — завышают слабых и занижают сильных.

Главный вывод: предзнание языка задачи почти не помогает модели её решить — значит лингвистическое рассуждение честно проверяет обобщаемые способности, а не память.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ На бенчмарке ARC-AGI-3 (2D-игры без инструкций, тест, который особенно раздражает OpenAI) Claude Opus 5 без специальной обвязки набрал 30% — лучший результат среди всех моделей. С кастомным харнессом та же модель показала 100%.

Ключевая находка — прорыв дал не просто менеджмент памяти, а отдельный агент-«супервайзер», который следит за основным и подталкивает его, если тот застрял. По словам VP продукта Nvidia, агент — это модель плюс харнесс, плюс рантайм и скиллы, а не просто API модели. Показателен контраст: OpenAI, увидев позорные <10% на этом бенчмарке, потюнила две настройки харнесса и утроила счёт — но так и не приблизилась к 100%, не добавив супервизирующий слой.

🔥 Не единичный случай — Databricks в июле показала, что харнесс, а не модель, драматически влияет на стоимость: один вызов с разным харнессом может обойтись вдвое дороже. Nvidia продвигает открытые харнессы через свой стек Nemo и напрямую связывает это с недавней паузой OpenAI в обучении модели Astra из-за проблем безопасности — по их логике, контроль именно на уровне харнесса и есть путь к безопасному прогрессу.

Рынок недооценивает важность харнесса по сравнению с выбором модели, или для повседневных задач разница пока не критична?
Please open Telegram to view this post
VIEW IN TELEGRAM
УСПЕВАЕШЬ СЛЕДИТЬ ЗА НОВИНКАМИ ?! Технологии не ждут ...

* Пора сделать АПГРЕЙД своего информационного поля
♻️

Это ПОДБОРКА ведущих Telegram-каналов — тех самых людей, которые не просто читают новости, а сами их создают.

📂 Добавляй ПАПКУ — и обнови свою новостную ленту

* Сделай свою подписку умнее, пока другие читают вчерашние новости ⚡️
Отписаться можно в любой момент. Остаться — тоже ✔️
📩 Запись в папку
👍21🔥1
⚠️ NanoClaw — открытый харнесс для автономных агентов — пришёл в Slack с фичей, которую компания называет первой на рынке: вместо ручной настройки каждого бота, один запрос лид-агенту порождает команду специализированных агентов, каждый со своим именем, аватаром и Slack-идентичностью. По словам CEO NanoCo, в ближайшие 12-18 месяцев каждый в команде станет менеджером агентов.

Механика: организация один раз подключает воркспейс, а дальше уже работающий агент сам создаёт новых коллег через MCP-инструмент — «создай агента для код-ревью», «сделай команду, которая проверяет статьи с разных сторон». Агенты работают вместе в каналах и общих Slack Canvas, отвечают только когда их тегнули, и могут переписываться даже вне Slack — в Telegram или WhatsApp, сохраняя общую память.

👑 Ключевое отличие от Claude Tag, ChatGPT Workspace Agents и Agentforce — там создание агента происходит централизованно, администратором, до развёртывания. У NanoClaw создание — это то, что уже работающий агент делает сам, прямо из разговора. Всё остаётся self-hosted — данные и токены живут на инфраструктуре компании, а не у NanoCo.

Показательно, что Slack вообще открыл дверь для сторонних агентов ещё в апреле — NanoClaw просто один из первых, кто выжал из этого рекурсивную идею «агент нанимает агентов».
Please open Telegram to view this post
VIEW IN TELEGRAM
🖼️ TrueFoundry выпустила TrueForge — открытый под MIT агентный харнесс без привязки к одному вендору моделей и инфраструктуры. Берёт модель и всё вокруг неё — инструменты, песочницу, память, одобрения — и превращает в реально работающего в проде агента.

Ключевой результат: на бенчмарке DevRev Enterprise-Bench TrueForge с открытой моделью GLM-5.2 прошёл 11 из 14 задач за $2,90 против $11,80 у Claude Managed Agents на Opus 4.8 — разница в 75%. Даже на одной и той же модели (Opus 4.8) TrueForge дешевле на 30% ($8,50 против $11,80).

👁️ Технически поддерживает OpenAI, Anthropic, Gemini и 20+ моделей, 40+ встроенных инструментов, изолированное выполнение, human-approval workflow. Разворачивается локально с SQLite или в проде через Docker Compose/Helm. Уже используют Automatiq и NetApp.

Продолжение темы вендор-лока с Карпом и Меншем — только теперь цена независимости выражена в конкретных долларах на задачу, а не в абстрактных рисках.

Меняли бы управляемый харнесс от Anthropic на открытую альтернативу ради такой экономии?
Please open Telegram to view this post
VIEW IN TELEGRAM
НЕБОЛЬШОЙ АПГРЕЙД ТВОЕЙ ЛЕНТЫ, КОТОРЫЙ ДАСТ ХОРОШИЙ БУСТ ТВОЕЙ КАРЬЕРЕ ✈️

Друзья, наш канал попал в подборку тг-каналов про AI & IT, технологии и карьеру — получилась тусовка «для своих» 😎

Мы собрали каналы для себя, которые реально полезны:
обзор ИИ — от свежих инструментов до реальных кейсов
AI & IT технологии — тренды, обзоры и объяснения
расти в IT — советы по развитию, карьере и поиску работы
маркетинг с AI — как технологии меняют алгоритм работы

🆒 Осталось только добавить папку себе ✔️https://t.me/addlist/aLp6zQ2zpic5Mjhk 📩 Записаться в папку
‼️ AWS добавила для OpenClaw интеграцию AgentCore Payments: агент может самостоятельно оплачивать платные API, данные и MCP-сервисы через x402, но только в заранее заданных человеком лимитах.

Пользователь заранее задаёт кошелёк, получателей, сеть, актив, лимит одной транзакции и общий бюджет.

Агент получает возможность платить, но не может увеличить бюджет или создать новую платёжную сессию.
Please open Telegram to view this post
VIEW IN TELEGRAM
Исследователи (Zhejiang University и коллаборанты) решают практическую задачу: как получить полноценную 4D-реконструкцию человека — 3D-модель, которая ещё и корректно двигается во времени — просто из обычного видео с одной камеры, без калибровки и студийного оборудования.

Проблема: чтобы построить качественную 4D-модель через Gaussian Splatting, нужны десятки согласованных ракурсов одного момента, а диффузионные модели видео начинают «плыть», когда нужных видов становится слишком много для одного прохода нейросети. Авторы решают это двумя механизмами — сжатием референсных ракурсов в контекст фиксированной длины и ротацией групп целевых ракурсов во время генерации, чтобы разные группы обменивались информацией друг с другом.

➡️ Результат: модель обходит предыдущие подходы и по качеству видео с новых ракурсов, и по итоговой 4D-реконструкции, с уверенной генерализацией на реальных, не студийных видео.

Как думаете, такие технологии — это ближайшее будущее для контента вроде виртуальных примерочных и аватаров, или пока слишком нишевая инженерная задача без массового применения?
Please open Telegram to view this post
VIEW IN TELEGRAM
Ещё недавно мы думали, как попасть в топ Google. Теперь появляется новая задача: как сделать так, чтобы AI вообще вспомнил о твоём бренде, когда человек попросит что-то порекомендовать.

На днях маркетинговые компании уже начали развивать отдельное направление — работу с контентом блогеров и создателей, чтобы влиять на то, какие бренды и продукты появляются в ответах AI. То есть скоро вопрос может быть не только: «Мы на первом месте в поиске?» А: «А ChatGPT нас вообще кому-нибудь советует?»

Маркетинг всё меньше существует отдельно от технологий. Чтобы продвигать продукт, уже приходится понимать не только рекламу и креативы, но и AI, данные, алгоритмы, автоматизацию и иногда — вещи, о которых раньше маркетолог вообще не думал.

Например, 1 октября в Улан-Удэ пройдёт SIMPLE Практика — киберучения для команд ИБ и ИТ.

И вот вроде просто хотели «следить за новостями маркетинга», а через пять минут уже читаем про AI-поиск, безопасность и новые технологии.

Поэтому собрали эту папку digital, маркетинг, IT, AI, инструменты и люди, которые помогают не выпадать из происходящего.

🗂 Сохранить папку себе
‼️ Свежий выпуск Latent Space — разговор с Джун Сунг Паком, автором знаменитой статьи 2023 года про Generative Agents («Smallville», где ИИ-персонажи жили, помнили и заводили отношения в игрушечном городке). Теперь он строит Simile — компанию с оценкой $2 млрд после раунда от GreenOaks и Index Ventures, среди инвесторов Фей-Фей Ли и Андрей Карпатый. Компания уже гоняет десятки миллионов симуляций для клиентов уровня Fortune 100 (включая CVS) с точностью 85-99% против реальных фокус-групп людей.

Ключевая проблема, которую решает Simile: обычные фронтир-модели плохо симулируют реальных людей именно потому, что их тренируют быть «агентами» — рациональными и последовательными, а живые люди непоследовательны и предвзяты. Компания дообучает модели на биографических интервью, транзакционных данных и настоящих рандомизированных контролируемых испытаниях, чтобы вернуть человеческую предвзятость и непоследовательность, а не убрать её.

🌟 Долгосрочная амбиция Пака звучит масштабно — симулировать все 8 миллиардов человек на Земле, чтобы отвечать на «wicked problems» вроде изменения климата, где множество игроков с конфликтующими интересами не могут договориться.
Please open Telegram to view this post
VIEW IN TELEGRAM
По сети разошлась 77-минутная лекция профессора Стэнфорда Тенгю Ма (CS229, соавтор курса Эндрю Ына) — сквозное объяснение того, как устроены современные языковые модели, от токенизации до полного пайплайна обучения. Пост с рекомендацией набрал заметный охват в X — люди называют её самым понятным разбором того, как построены ChatGPT и Claude, который они видели.

Структура последовательная: токенизация и BPE (как текст превращается в числа), архитектура трансформера и варианты attention, затем пайплайн обучения — от предсказания следующего токена до fine-tuning. Материал связан со свежеобновлёнными лекционными записками Ма по CS229, где отдельная глава про reasoning в LLM — chain-of-thought и RLVR, механика, которая объясняет, почему модели вроде Opus «думают» перед ответом.

Ценность в том, что это не научпоп-пересказ, а настоящий университетский материал — без упрощений, но подан последовательно.

Пересматривали бы такие лекции для системного понимания, или хватает практики без теории под капотом?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1