How to AI
2.73K subscribers
644 photos
31 videos
4 files
114 links
Про ИИ, ИТ и цифровизацию 🔝

🔺Тренды,обзоры достижений ИИ, воркшопы, митапы в KZ и странах СНГ
🔺Применение ИИ в бизнесе и различных областях

🗣Александр Ермаков - сооснователь Awara IT, ex-Regional Director & Microsoft MVP
Download Telegram
🔥 Разработчик под ником terminal (тот же аккаунт за проектом Terminal — интернет-магазином для программистов) выпустил мини-игру, идея которой — персональный кошмар любого разработчика, превращённый в геймплей: вас закидывают в офис, все стены которого увешаны распечатанным кодом на 187 421 строку, и где-то там не хватает одной точки с запятой. Никакого поиска по тексту, никакого дебаггера — только буквально ходить по офису и вчитываться в код построчно.

Игра вышла в русле более широкого тренда: в один день, 24 августа, вышло сразу несколько игр с одинаковой механикой «найди иголку в огромном стоге» — рядом с этой в тот же день появилась игра про поиск жёсткого диска с биткоинами в мусорном полигоне (отсылка к реальной истории Джеймса Хауэллса), а раньше — игра про поиск одной соломинки среди 5 миллионов. Идея предельно простая и легко объяснимая, и от этого не менее мучительно смешная.
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 Берлинский художник Саймон Векерт создал рубашку Digital Camouflage — хаотичный узор из розового, оранжевого и зелёного, который разрушает способность систем компьютерного зрения вроде YOLO распознать человека. Ответ на пилотный запуск поведенческого ИИ-видеонаблюдения на площади Коттбуссер-Тор в Берлине в августе 2026-го — первую подобную систему в городе.

Узор разрабатывался через «состязательный цикл»: генерируешь вариант, показываешь детектору, замеряешь уверенность, корректируешь — пока уверенность модели не рухнет. В июне Векерт лично протестировал рубашку перед реально работающей камерой — успешно. Сам он честно говорит: это не инструмент для уклонения от полиции, а скорее вопрос — насколько системе стоит доверять общественное пространство, если её обманывает кусок ткани.

Искусство с реальным техническим доказательством уязвимости, или красивый жест без практического эффекта?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Replit запустила Free Mode на GPT-5.6 Luna (самой быстрой и дешёвой модели линейки 5.6) — позволяет чатиться, брейнштормить и решать простые agent-задачи, не тратя платные кредиты. Несмотря на название, режим доступен только на платных тарифах: $20/мес Core или $100/мес Pro — идея снять «тревогу токенов», а не раздать всё бесплатно.

Экономика стала возможна благодаря снижению цены Luna на 80% в конце июля. Когда задача требует более серьёзного рассуждения, агент сам временно переключает на мощную модель (Sol), а потом возвращается обратно. Replit нативно интегрировала все варианты GPT-5.6 — без своих API-ключей и отдельного биллинга.

👆 Партнёрство не новое — Replit была ранним пользователем ещё GPT-3, и стороны заявляют, что это только начало более широкого сотрудничества. Часть общего тренда снижения цен на фоне беспокойства enterprise-клиентов об окупаемости ИИ-трат и конкуренции с дешёвыми китайскими моделями.
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 OpenAI сворачивает контракт на поставку моделей кодинг-редактору Cursor — отключение 12 ноября 2026-го, максимальный срок по договору. Причина: Cursor только что приобрела SpaceX, а OpenAI не уверена, что компания будет соблюдать условия использования, учитывая опыт с другими компаниями Маска.

Аргументация на конкретных прецедентах: после покупки Twitter компания нарушила условия контракта с OpenAI, а под присягой сам Маск признал, что xAI дистиллировала данные OpenAI для обучения своих моделей. OpenAI также упоминает растущую ответственность в связи с релизом модели Astra — хочет быть уверена, что топовые модели используются строго по правилам.

➡️ OpenAI подчёркивает четыре года сотрудничества с Cursor и обещает поддержать разработчиков в переходе.

Показательный эпизод консолидации империи Маска — SpaceX, Twitter/X, xAI, теперь и Cursor — и того, как репутация человека становится технической причиной разрыва партнёрства.

Справедливое решение на основе нарушений, или удар по обычным разработчикам Cursor?
Please open Telegram to view this post
VIEW IN TELEGRAM
🔪 Anthropic открыла research preview Model Hardware Standard (MHS) — общей спецификации для безопасного управления ИИ-агентами физическими устройствами: микроскопами, дозаторами жидкостей, роборуками. Интеграция оборудования обычно занимает недели-месяцы — MHS сокращает это до часов, превращая разные вендорские интерфейсы в единый стандартный «драйвер».

Результаты впечатляют: в QuEra агент за одну ночь довёл восстановление «замка» лазера квантового компьютера с 58% до 99.3% успеха, ускорив процесс с 150 до 6 секунд. В CMU эксперимент по дозозависимым кривым стал в 3 раза быстрее, а интеграция оборудования заняла 8 часов вместо недель. При этом Anthropic честно отмечает: Claude всё ещё путает физические причины ошибок с программными багами и часто перестраховывается, ожидая подтверждения человека.

🪐 Похоже на MCP, только для физического мира — протокол, который может стать таким же стандартом для лабораторий и роботов.
Please open Telegram to view this post
VIEW IN TELEGRAM
📂 Подборка каналов по AI, IT & HR Tech

Каналы для тех, кто работает в IT и хочет держать руку на пульсе без мониторинга сотни источников ✔️

Что внутри:
AI-блок: новости, нейросети, ИИ-инструменты и кейсы внедрения, стартапы, датасеты
Dev-блок: Java, Python, JS (Frontend/Backend), Mobile, QA, промышленная автоматизация (IIoT)
Отдельно: Cybersecurity, SciPop, IT-вакансии, биржа фриланса, бизнес-новости, Agile/PMP-менеджмент
Бонус: IT-мемы и юмор


Посмотреть и подписаться можно здесь ⬇️ https://t.me/addlist/nXNk7Y2TLoE0Y2Jk                             
  
📩 Записаться в папку
👍1
👍 Исследователи заставили модель играть саму с собой в текстовую игру через разные языковые интерфейсы — правила и доска идентичны, меняется только язык. Через 518 400 партий выяснилось: игровая сила систематически меняется по языкам — английский стабильно сильнее всего, иврит один из самых слабых.

Показательный пример — игра Ним с известной оптимальной стратегией: модель находит её на английском, но часто теряет на арабском или иврите, если сама спонтанно не переключается на латиницу во внутренних рассуждениях. Проблема не в знаниях, а именно в применении навыка рассуждения через конкретный языковой канал.

‼️ Обнадёживает то, что если вести внутренние рассуждения на более сильном языке, оставив слабый интерфейс на входе-выходе, удаётся вернуть до 89% потерянной результативности. Авторы выпустили открытый бенчмарк Multilingual TextArena на 65 игр и 193 языка.

Замечали такую разницу в качестве ответов модели на русском против английского?
Please open Telegram to view this post
VIEW IN TELEGRAM
📁 Роб из CircleCI: типичный PR сегодня — 104 файла, 2400 новых строк. Вместо того чтобы замедлять агентов до человеческого темпа, нужно перестраивать процесс под темп агентов. По их данным, у топовых команд резко выросло число билдов на feature-ветках, а пропускная способность main-ветки осталась плоской — больше работы, но не больше реальной пользы.

Первый инструмент — открытый Chunk CLI: вытаскивает из истории код-ревью самых ценных ревьюеров и их повторяющиеся комментарии, превращает в чеклисты-промпты для агента, который ревьюит код локально до открытия PR — вместо гонки фидбэка туда-обратно копипастой.

👆 Второй — mutation testing (метод из 70-х): агент намеренно вносит баги в код и проверяет, ловят ли их тесты. На реальной базе нашли 184 потенциальные мутации, распараллелили проверку и нашли три пробела в тестах, которые прошли бы CI незамеченными — весь прогон стоил около $4.

Главная мысль: роль человека смещается от чтения каждой строки диффа к управлению риском — машина сама отделяет структурно неинтересное от реально рискованного. И совет по промптингу: цикл коротких проходов («проверь security», «проверь off-by-one») работает лучше одного большого плана — модель хуже приоритизирует внутри раздутого контекста.
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Держим AI-Новости ПОД РУКОЙ — собрали в одну Telegram-папку каналы про нейросети, новые инструменты и полезные обновления.

Внутри - IT, AI & HR Tech: свежие сервисы, рабочие фишки и материалы, которые помогают быстрее разбираться в новых технологиях и найти работу по специальности.


Добавляем всю [подборку] одним нажатием и не ищем каждый канал вручную.
 
📩 Запись в папку
1👍1🔥1
💢 Прямое продолжение темы Nvidia про важность харнесса: JIT-Agent — обучаемая модель, которая на лету синтезирует адаптивный агентный харнесс под конкретную задачу для любой готовой LLM. Раньше харнесс проектировали вручную под каждую задачу — не масштабируется. Модель кастомизирует харнесс, чинит его для стабильной работы и самоэволюционирует, учась на архиве прошлых конфигураций.

Результаты впечатляющие: с JIT-Agent DeepSeek-V4-Flash обходит GPT-5.6 на бенчмарках (+9.1 и +4.3 балла), а уже сильная GLM-5.2 получает прирост до +20.2. Сгенерированные харнессы конкурентоспособны с такими зрелыми рантаймами, как Claude Code.

Логичный следующий шаг после находки Nvidia: если харнесс так сильно определяет результат, почему бы не поручить его создание отдельной специализированной модели вместо ручной инженерии?
Please open Telegram to view this post
VIEW IN TELEGRAM
🪟 Одна и та же модель может быть скучным чат-ботом в одном продукте и работать часами над сложной задачей в другом. Причина почти никогда не в самой модели (бенчмарки топовых лабораторий сейчас различаются на единицы процентов) — модель сама по себе как «мозг в банке»: способный, но не умеющий открыть файл или запустить код. Разница в том, что обёрнуто вокруг — в агентном харнессе.

Харнесс состоит из трёх частей: инструменты (файлы, код в песочнице, интернет, computer use, плюс MCP для подключения внешних сервисов), память (файлы-инструкции вроде agents.md, сжатие разросшегося контекста, поиск нужных кусков вместо загрузки всей кодовой базы) и агентный цикл — модель планирует шаг, харнесс выполняет, модель смотрит на результат и повторяет, а современные харнессы постоянно верифицируют себя по ходу через тесты и скриншоты.

💢 Граница между моделью и харнессом размывается: то, что раньше жило только в обвязке (долгосрочное планирование, самопроверка), постепенно тренируется прямо в модель.

Практический вывод: вопрос «хорош ли ИИ в кодинге» на самом деле состоит из двух — какая модель и какой харнесс вокруг неё.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍 MotherDuck прогнала агентный SQL-бенчмарк DABstep через разные модели и сравнила с Qwen3.8-27B, запущенной локально на макбуке. Результат: бесплатно (или до $0.50 за электричество) Qwen обошла по точности GPT-5.6 Luna Max, которая стоила больше $8 за тот же прогон — разница больше чем в 17 раз. Gemini-3-Flash точнее всех, но за 2.3x цену Luna. Sonnet 5 в этом бенчмарке выступил слабо — дороже и менее точно одновременно.

Требования: ноутбук с 16+ ГБ памяти, ставится за час через DuckDB + LM Studio + квантованная модель. На M5 MacBook Air — 5-7 токенов/сек, на пятилетнем M1 Pro тоже рабочий результат при чуть более просевшей точности.

🖼️ Оговорки: локальная модель отвечает 5-6 минут против 25-40 секунд у облачных, параллелить запросы нельзя, а сам контекстный слой с бизнес-правилами всё равно строился через фронтир-модель (Claude Fable 5) — локальная модель хороша для массового дешёвого прогона готовых вопросов, а не для всего пайплайна.

Продолжение темы дешёвых открытых моделей, которую мы разбирали через Qwen на MacBook и Raspberry Pi — только здесь уже конкретный измеримый экономический кейс.

Стали бы разворачивать локальную модель ради такой экономии, или скорость и удобство облака важнее?
Please open Telegram to view this post
VIEW IN TELEGRAM
Джулия Кордик из Microsoft описывает частый сценарий: агент за пять минут генерирует 2500-словный документ реверс-инжиниринга, эксперт бегло просматривает первые строки, видит, что всё верно — и заключает «выглядит нормально». Проблема в том, что легко проверить обычно и легко получить правильно, в том числе для модели — так что беглый просмотр начала ничего не говорит об остальном документе.

Техническая причина — в природе контекстных окон: модель теряет середину или даже начало по мере заполнения контекста, но продолжает выдавать уверенный гладкий текст. Отсюда три типа сбоев: пропуск важного, галлюцинация и неверная интерпретация смутных инструкций.

🔥 Ключевая мысль — верификация должна быть не «эксперт прочитал и одобрил», а разбита на конкретные проверяемые шаги с осязаемым результатом. Автор предлагает framework из шести вопросов (что проверяем, сколько стоит, кто выполняет — инструмент, ИИ или человек, что реально доказывает проверка) и выстраивает многоуровневые таблицы — от дешёвых детерминированных проверок до дорогих операционных вроде сравнения с продакшен-трейсами.

Главный совет: если проверка не даёт конкретного действенного результата — это не проверка. Не просите эксперта прочитать 2500 слов и сказать «верно ли», а дайте список извлечённых правил и попросите подтвердить каждое отдельно.
Please open Telegram to view this post
VIEW IN TELEGRAM
😭1