How to AI
2.72K subscribers
638 photos
31 videos
4 files
115 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
➡️ AWS выпустила нативный векторный поиск для DynamoDB в общем доступе. Теперь эмбеддинги хранятся прямо рядом с операционными данными в тех же таблицах — без репликации в отдельную специализированную базу и без синхронизации между ними.

Цифры: одноразрядная миллисекундная задержка при recall выше 99%, масштаб до триллионов векторов, без администрирования инфраструктуры. Можно использовать любую модель эмбеддингов — от Amazon Titan до OpenAI — и единая serverless-оплата по факту использования.

🔥 Важнее технических цифр сигнал по рынку: по опросу индустрии, большинство специалистов по данным предпочли бы держать векторный движок прямо внутри основной БД, а не городить отдельный стек. Прямой удар по нише standalone векторных баз вроде Pinecone — облачные провайдеры один за другим встраивают векторный поиск в существующие движки.

Держите отдельную векторную базу для RAG, или готовы перейти на встроенный поиск?
Please open Telegram to view this post
VIEW IN TELEGRAM
Команда юристов GitHub использовала Copilot CLI, чтобы автоматизировать повторяющиеся задачи: проверку контрактов, анализ кода, DMCA-запросы, NDA и оценку рисков.

Один из юристов собрал собственный инструмент для работы с договорами. Вместо постоянного копирования промтов он вынес инструкции, шаблоны и внутренние материалы в репозиторий. В результате время на подготовку и проверку документов сократилось примерно вдвое.

👍 Главное здесь даже не Copilot. AI позволяет специалисту превратить собственную экспертизу в рабочий инструмент — без необходимости становиться разработчиком.

Юристы фактически начали «программировать» на естественном языке: описывают методологию, правила и нужный результат, а AI превращает это в повторяемый workflow.
Please open Telegram to view this post
VIEW IN TELEGRAM
На GitHub появился skill-forge — открытый инструмент-«мастерская», который автоматизирует создание Agent Skills для Claude Code из внешних источников: репозиториев на GitHub, онлайн-документации, PDF. Идея простая: вместо того чтобы вручную читать документацию нового инструмента и вручную писать под него SKILL.md, скидываете источник — а на выходе получаете структурированный, переиспользуемый скилл.

Технически интересны несколько деталей. Умное определение источника само распознаёт, откуда тащить материал — GitHub, сайт документации, локальный файл. Работает без настройки из коробки. Отдельно — поддержка формата llms.txt, который ускоряет сбор документации примерно в 10 раз по сравнению с обычным парсингом HTML-страниц.

⚠️ Показательно, что проект прямо указывает: он построен поверх официального skill-creator от Anthropic — то есть не изобретает велосипед с нуля, а расширяет уже существующий шаблон под более автоматизированный сценарий сбора источников.
Claude теперь умеет оставлять «следы» в своих ответах.

Anthropic объявила, что новые версии Claude получают невидимую машинную маркировку текста — одна из причин в том числе требования EU AI Act.

И это хороший пример того, как быстро меняется Digital.

Ещё недавно обсуждали, какая нейросеть лучше. Сейчас уже обсуждаем авторство, происхождение контента, безопасность и то, как AI встраивается в реальные процессы.

Сейчас, за нишей digital приходится следить не только ради интереса — изменения начинают напрямую влиять на работу.

Собрали в папке материалы, сервисы и полезные находки по Digital / IT / AI:

📂 Сохранить папку себе
👁️ Во время сезона обновления контрактов юрист GitHub начал использовать Copilot CLI для отдельных задач, а потом построил целый инструмент — terms-ai для составления договоров, с версионированным репозиторием инструкций и style guide на понятном языке. Договоры и чувствительные данные остались в закрытом окружении, а сам инструмент и логика работы — в открытом доступе.

Параллельная история: юрист без технического бэкграунда сама спланировала и собрала внутреннюю платформу для операционных инструментов юротдела через Copilot CLI, ведя весь процесс через GitHub Issues и Actions.

➡️ Показательный момент — ещё один юрист построил кастомный скилл именно для проверки самих ИИ-результатов: когда цена ошибки высока, доверие к выводу инструмента важнее самой автоматизации.

Главная линия здесь не «ИИ заменяет юристов», а «непрограммисты сами строят себе инструменты», минуя очередь к инженерному отделу.

Строили бы себе подобный внутренний инструмент сами, если бы не было готового решения?
😁1🤔1
🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten о том, что происходит между релизом модели на Hugging Face и продакшен-API. Главный тезис: узкое место сместилось от обучения к инференсу — именно там сейчас основной инженерный рычаг.

Прирост в 20-200% скорости — рутинная дисциплина, если сложить квантизацию, спекулятивное декодирование и разделение prefill/decode на разные узлы. Главный рычаг теперь не хитрость в GPU-ядре, а то, где живёт KV-кеш и как быстро он двигается между узлами. Показателен пример с GLM-5.2: более агрессивная квантизация неожиданно сохранила качество при росте пропускной способности на 20%, потому что ошибки в разных слоях взаимно гасили друг друга.

👆 Тренинг и инференс постепенно сливаются в одну дисциплину — спекулятивные «головы» обучаются на живых активациях основной модели. Гости также прогнозируют, что настоящим узким местом становится не сырая вычислительная мощность GPU, а межчиповая связь — отсюда ставка NVIDIA на Dynamo как оркестрацию, а не просто CUDA-трюки.
⁉️ Microsoft резко наращивает производство чипов следующего поколения Maia 300 — представление ожидается этой осенью. Ведутся переговоры с TSMC о мощностях на 300 000+ чипов к 2027-му, конечная цель — свыше миллиона.

Microsoft тут заметно отстаёт: Google уже продаёт свои TPU и планирует свыше 3 млн штук в этом году, у Amazon контракт на 1 млн чипов Trainium именно с Anthropic. И тут самое интересное — Microsoft одновременно уговаривает ту же Anthropic перейти на Maia, хотя та уже глубоко завязана на чипы Amazon и Google. Аргумент конкретный: Maia 200 на 30-40% дешевле в эксплуатации, чем топовые чипы Nvidia.

👑 Показательный штрих: при квартальных расходах на инфраструктуру в $35,8 млрд Microsoft недавно попросила сотрудников прекратить «токенмаксинг» — стоимость вычислений остаётся реальным ограничением даже для гиганта.

Реально ли Microsoft переманит Anthropic на Maia, или это скорее рычаг для скидок у Nvidia и Amazon?
🪟 Apple обучила отдельную большую языковую модель именно для китайского рынка вместо того, чтобы полагаться на сторонние модели, как в остальном мире. LLM разрабатывалась с помощью Alibaba — заметный разворот стратегии.

Подход называют «двухтрековым»: Apple одновременно обучила свою модель и договорилась с регуляторами об интеграции Qwen от Alibaba в Apple Intelligence, по аналогии с ChatGPT-расширением в остальном мире. Это обходит барьеры, ограничивающие другие американские техкомпании в Китае. Apple стала первой иностранной компанией, которую одобрили на собственную проприетарную ИИ-модель в стране.

🍒 Забавная деталь: буквально на днях Apple ненадолго опубликовала в Китае гайд по подключению Qwen к Siri, а через сутки убрала — похоже, поторопились до официального анонса.

Ещё один штрих к геополитическому расколу ИИ-рынка — только тут Apple выбирает гибридный путь: своё там, где нужен контроль, и партнёрство там, где иначе на рынок не попасть.
🌟 Spark-to-Paper автоматизирует весь путь от исследовательской идеи до готовой статьи: поиск литературы, эксперименты, пересмотр утверждений на основе данных, готовые к публикации графики. Это не отдельная платформа, а 13 составных скиллов внутри обычного кодинг-ассистента.

Ключевая идея — разделение суждений модели и детерминированных проверяемых операций, плюс разделение планирования экспериментов и отчётности: доказательства формулируются до результатов, а не подгоняются под них задним числом.

💸 Цифры: 99,5% валидности цитирований, 96,4% редактируемости графиков.

Самое показательное — обнаружение фабрикации данных выросло с 14% для черновика в один проход до 92% при полном стеке проверок. Вся система — 11,9 млн токенов, $8,1 за рукопись, 3,2 часа в среднем.

Доверили бы такой системе хотя бы черновик научной статьи, или сама идея вызывает настороженность?
🔥 Агенты, подключённые к внешним инструментам, уязвимы к prompt injection, спрятанным прямо в данных из окружения — письме, странице, результате поиска. Раньше такие атаки собирали вручную или через случайную симуляцию — это плохо масштабируется.

ToolHazard автоматизирует сам процесс: Environment Simulator создаёт исполняемые окружения, Attacker Agent сам находит точки для внедрения и генерирует специфичные payload'ы, User Simulator строит длинные задачи, привязанные к реальному состоянию. На основе этого собрали ToolHazard-Bench для стресс-тестирования агентов.

👆 Результаты показывают существенную уязвимость агентов, причём момент и место атаки заметно влияют на её эффективность. Важно: сгенерированные данные для alignment-тюнинга реально повышают безопасность и на своём бенчмарке, и на независимом AgentDojo, не портя способность выполнять обычные задачи.

Зеркальная сторона темы каскадных сбоев, которую мы разбирали — только источник ошибки здесь не модель, а злонамеренный контент из среды.
☀️ Alibaba открыла веса гигантской Qwen3.8 на 2.4 трлн параметров, а в пятницу — ещё и компактную 27-миллиардную версию под Apache 2.0, которую реально запустить локально на хорошем MacBook Pro или Mac Studio.

По бенчмаркам Alibaba, производительность компактной версии — в той же лиге, что у Opus 4.6 на максимальных настройках, а по некоторым задачам даже обходит его. Модель умеет работать с изображениями и видео. Показателен скачок по агентному кодинг-бенчмарку DeepSWE — с 14.2 до 42.2 балла против предыдущего поколения.

🔪 Из практики: неквантованная версия весит 55.6 ГБ, но уже есть MLX-конверсии под Apple Silicon — 4-битная версия занимает около 16.1 ГБ, что делает Mac с 32 ГБ памяти разумной платформой.

Автор статьи остужает восторг: бенчмарки — про оригинальный чекпоинт, а не квантованные версии, которые реально будут гонять большинство пользователей, плюс модель склонна «пережёвывать» задачи излишне долго.

Разворачивали бы такую модель у себя на Mac, или проще остаться на облачном API?
💢 Для Plus и Pro — обновлённая GPT-5.6 Sol: более точные и сфокусированные ответы, реже соглашается просто ради вежливости, Instant и Thinking объединены в единую модель с новым слайдером «сколько думать». Для бесплатных пользователей — дефолтная модель меняется на GPT-5.6 Luna с безлимитными текстовыми чатами (раньше был лимит) и кнопкой Think для сложных вопросов.

Цифры заметные: доля ответов с фактической ошибкой в финансовых, медицинских и юридических промптах упала на 62% у Luna и 68% у Sol по сравнению с прошлой версией.

Отдельный важный момент — про безопасность подростков: система-карточка описывает, что модель обучена избегать романтического ролплея, не заменять собой реальные отношения и соблюдать возрастные границы по чувствительным темам.

Нюанс: обновление касается только обычного чата — версия для Work и Codex не меняется.
🔥 GitHub выпустила SDK для Java, который позволяет управлять Copilot прямо из идиоматичного enterprise-кода — с аннотациями, виртуальными потоками, всей привычной Java-экосистемой. До этого у Java-разработчиков были только фреймворк-специфичные обходные пути вроде Langchain4j или Spring AI — оба тянут за собой зависимость от чужих архитектурных решений. Новый SDK — первый по-настоящему фреймворк-агностичный способ работать с ИИ из Java, при этом работает и в Jakarta EE, и в Spring, и вообще где угодно на сервере.

Самое интересное — несмотря на название «Copilot SDK», он вендор-нейтрален: можно передать свой provider/ProviderConfig с собственным baseUrl и apiKey, чтобы работать напрямую с OpenAI, Azure, Anthropic или любым OpenAI-совместимым эндпоинтом — без подписки на Copilot вообще.

🌟 Технически ключевая фишка — аннотация @CopilotTool: пишете обычный Java-метод, помечаете его аннотацией — и SDK сам генерирует JSON Schema, парсит аргументы и диспетчеризирует вызовы модели.
‼️ Google и Raspberry Pi опубликовали гайд: полноценный локальный ИИ-конвейер — речь, зрение, языковая модель — работает целиком на Raspberry Pi 5 без облака. Витрина — робот Reachy Mini: слышит, распознаёт объекты, рассуждает через Gemma, отвечает речью и движением. Весь стек — около $80 в железе.

В основе — LiteRT (эволюция TensorFlow Lite) с надстройкой под LLM. Семейство Gemma подобрано под разные ограничения железа — от компактной 270M-модели до полноценной Gemma 4 E2B для диалога. Цифры: 99 токенов/сек prefill, 9 токенов/сек генерация при памяти всего 1432 МБ — это около 300 слов в минуту, вдвое быстрее обычной человеческой речи.

☀️ Порог входа снизили сильно — весь тулчейн ставится одним pip install, а CLI объединяет конвертацию, квантизацию и инференс, убирая обычную возню с зависимостями. Есть и GPU-ускорение для разгрузки компьютерного зрения.

Продолжение темы Qwen3.8-27B на Mac — только здесь совсем другой класс железа: не ноутбук, а $80 одноплатник без Wi-Fi.

Пробовали бы собрать что-то подобное сами, или локальный ИИ такого масштаба кажется больше хобби-проектом?
Please open Telegram to view this post
VIEW IN TELEGRAM
🖥 Фло Кривелло, CEO Lindy, запустил Lindy Teammate — ИИ-«сотрудника» в Slack, который подключается ко всем корпоративным инструментам и накапливает общий контекст команды. Тезис: интеллект без контекста менее полезен, чем обычный коллега.

Архитектура памяти интересна отдельным memory.md файлом с «настоящей» памятью и санитизированной версией для демо. Разговор разбирает ту же проблему context rot, что мы видели через RLM от LangChain и Memora от Microsoft — только на уровне продукта для реальных команд.

🚨 Самое острое — не техническое: Lindy по умолчанию работает на DeepSeek («уровень Sonnet 4.6» при цене в 100 раз ниже), что сделало убыточный продукт прибыльным. При этом сам Кривелло публично выступает за запрет китайских моделей в США по соображениям безопасности — строит бизнес на том, что сам же считает нужным запретить.

Продолжение спора про раскол вокруг китайских моделей, только конфликт интересов здесь не абстрактный, а внутри одного человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Знакомая тема: CEO Palantir предупреждает, что компании рискуют потерять контроль над ценными данными и IP, если слишком полагаются на сторонние ИИ-компании. Тезис прежний — получать выгоды от ИИ, не отдавая активы, которые формируют конкурентное преимущество.

Новое здесь — сам факт, что тема снова всплывает, отражая реальное движение рынка в сторону суверенитета данных и контроля клиента. Учитывая всё, что мы разбирали за последние месяцы — портативность через ACP от Kiro, открытые модели вроде Qwen3.8 и Kimi K3, попытки Microsoft переманить Anthropic на свои чипы — картина действительно складывается: крупные игроки предлагают клиентам больше свободы, а не меньше.

💢 У Карпа тут прямой коммерческий интерес — Palantir продаёт именно этот слой контроля. Но если рынок движется в эту сторону независимо от того, кто это озвучил первым, тенденция важнее автора тезиса.

Бизнес правда стал осторожнее с передачей данных ИИ-провайдерам, или это пока больше разговоры, чем практика?
Please open Telegram to view this post
VIEW IN TELEGRAM
24 августа ChatGPT Реклама становится доступна в 31 стране Европы, включая Германию, Францию, Испанию, Италию, Швецию, Норвегию, Данию, Нидерланды и Австрию. На первом этапе доступ только через рекламные команды OpenAI, агентства и технопартнёров — самостоятельный запуск через Менеджер рекламы обещают позже в этом квартале.

Пилот в США стартовал в феврале, и за полгода OpenAI добавила ещё восемь рынков, а теперь разом выходит на 31 европейский. Параллельно платформа доросла технически: от простой модели CPM до CPC и теперь оптимизированной под конверсии oCPC, плюс геотаргетинг, пользовательские аудитории и расширенная отчётность через OpenAI Pixel и Conversions API — то есть это уже полноценный рекламный стек, а не экспериментальная надстройка.

👍 Заявленный принцип — реклама чётко маркирована, отделена от ответов ChatGPT и не влияет на сами ответы модели. Но сам факт масштабирования на 31 рынок за полгода показывает, что монетизация через рекламу — уже не пилот, а стратегическое направление роста, причём десятки тысяч рекламодателей уже используют платформу.

Интересно здесь то, что ChatGPT становится не просто поисковиком-заменителем, а точкой принятия решения о покупке — именно на это и целится реклама. Учитывая, что Anthropic принципиально держит свои продукты без рекламы, разница в подходах двух главных конкурентов становится всё заметнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, AI начал оставлять после себя следы. Буквально.

Anthropic объявила, что будет добавлять в тексты, созданные Claude, невидимые машинно-читаемые метки. Даже после копирования текста такая маркировка может сохраняться.

И это, кажется, хорошо показывает, куда всё движется.

Digital и IT меняются слишком быстро, чтобы пытаться уследить за всем в одиночку.

Поэтому собрали в одну папку каналы про технологии, AI, IT, сервисы и всё интересное, что происходит в Digital.

🗂 Сохранить подборку себе
👍 OpenAI на две недели приостановила RL-обучение передовых моделей, чтобы укрепить исследовательские среды и мониторинг. Причина — взлом Hugging Face сбежавшим агентом (уже разбирали) и предварительные данные о том, что будущая модель Astra может достичь порога «критических возможностей» в кибербезопасности.

Крупнейший запланированный запуск RL всё ещё на паузе — идут только эксперименты меньшего масштаба.
Ввели три слоя защиты: строгую изоляцию для недоверенного кода, сетевую изоляцию высокорисковых процессов и постоянное тестирование безопасности через симуляцию атак. Расширили мониторинг цепочки рассуждений — классификаторы проверяют каждый токен, при подозрении на нарушение критической границы поднимают тревогу за 30 минут. Вся эта система съедает около 20% вычислительных ресурсов отслеживаемого инференса.

➡️ Показательна формулировка: OpenAI ожидает, что скоро модели сами будут обеспечивать бóльшую часть безопасности, включая защиту от других моделей.
Первый случай, когда крупная лаборатория публично объясняет конкретный измеримый риск, а не маркетинговый тайминг, как причину паузы в релизах.

Такая прозрачность усиливает доверие к компании, или тревожит тем, что риски оказались настолько реальны?
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ IOL-AI Challenge — соревнование на невиданных задачах Международной олимпиады по лингвистике 2026, где результаты моделей впервые оценивало настоящее жюри по тем же критериям, что и у школьников-участников. Ценность именно такого теста в том, что рассуждения LLM обычно изучают на математике и коде, где модели заранее даны правила. В лингвистике их нет — сначала нужно самому обнаружить систему языка, а данных для заучивания просто не существует.

731 заявка от 46 команд при жёстком бюджете — одна видеокарта T4, 30 минут. Отдельно без ограничений прогнали 15 топовых моделей: Claude Opus 4.8 набрала оценку жюри, эквивалентную золотой медали, а системы под жёстким compute-бюджетом оказались в нижних 5% участников.

☀️ Показательно: способность не определяется масштабом — заявки на 14B параметров обходили модели вдвое большего размера, прирост шёл от настройки декодинга, а не от размера. Автоматические метрики ранжируют системы правильно, но сжимают шкалу — завышают слабых и занижают сильных.

Главный вывод: предзнание языка задачи почти не помогает модели её решить — значит лингвистическое рассуждение честно проверяет обобщаемые способности, а не память.
Please open Telegram to view this post
VIEW IN TELEGRAM
‼️ На бенчмарке ARC-AGI-3 (2D-игры без инструкций, тест, который особенно раздражает OpenAI) Claude Opus 5 без специальной обвязки набрал 30% — лучший результат среди всех моделей. С кастомным харнессом та же модель показала 100%.

Ключевая находка — прорыв дал не просто менеджмент памяти, а отдельный агент-«супервайзер», который следит за основным и подталкивает его, если тот застрял. По словам VP продукта Nvidia, агент — это модель плюс харнесс, плюс рантайм и скиллы, а не просто API модели. Показателен контраст: OpenAI, увидев позорные <10% на этом бенчмарке, потюнила две настройки харнесса и утроила счёт — но так и не приблизилась к 100%, не добавив супервизирующий слой.

🔥 Не единичный случай — Databricks в июле показала, что харнесс, а не модель, драматически влияет на стоимость: один вызов с разным харнессом может обойтись вдвое дороже. Nvidia продвигает открытые харнессы через свой стек Nemo и напрямую связывает это с недавней паузой OpenAI в обучении модели Astra из-за проблем безопасности — по их логике, контроль именно на уровне харнесса и есть путь к безопасному прогрессу.

Рынок недооценивает важность харнесса по сравнению с выбором модели, или для повседневных задач разница пока не критична?
Please open Telegram to view this post
VIEW IN TELEGRAM