Машиннное обучение | Наука о данных Библиотека
16.9K subscribers
1K photos
22 videos
21 files
838 links
админ - @workakkk

@ai_machinelearning_big_data - Machine learning

@itchannels_telegram - 🔥лучшие ит-каналы

@pythonl - Python

@pythonlbooks- python книги📚

@datascienceiot - ml книги📚

№ 5037635661
Download Telegram
У Microsoft вышла очень показательная работа про надёжность AI-агентов.

Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз.

Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%.

И есть ещё более неприятная часть.

В 4 из 5 неудачных запусков агент:
— вежливо завершал работу
— вызывал инструмент записи в базу
— сообщал, что всё выполнено

Но состояние базы показывало обратное.

То есть по финальному ответу агента проблема вообще могла быть незаметна.

Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows.

Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе.

Очень правильная метрика для production-агентов:

не «смог ли он сделать это хотя бы раз», а
**«делает ли он это стабильно при повторных запусках».**


Paper:
https://arxiv.org/abs/2608.19741

“One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
6👍4🔥2
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?

Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.

Учёные проверили агентов на задачах из открытых научных репозиториев:

* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.

Результат удивляет:

Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%.

Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы.


📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
https://arxiv.org/abs/2608.19799
👍52🔥1
🤯 Локальные AI-модели становятся пугающе мощными

Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескольких позициях от моделей, которые больше неё на порядки.

Модель всего на 27 млрд параметров, которую можно запускать локально.

Ещё недавно такие возможности требовали огромных облачных моделей и дорогой инфраструктуры.

Теперь open-source модели начинают конкурировать с лидерами рынка прямо на своём железе.

Alibaba с серией Qwen 27B закрепилась в отдельном классе размеров и сейчас выглядит практически без конкурентов.

https://x.com/arena/status/2091920512796725272
🔥84🥰1
🔥 Prime Agent выпустили технический отчёт

"Prime Agent: A Self-Improving RLM Harness"

В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок.

Один из самых интересных экспериментов - Factorio:

- 7 дней непрерывной траектории на Sonnet 5
- 23,4 млн output tokens
- завершено 24 из 196 технологий
- ещё 71% прогресса до следующей технологии
- 633 запущенных subagents
- максимум 7 агентов работали одновременно

Отчёт:
https://arxiv.org/abs/2608.23552
🔥3
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
👍43🔥2
✔️ Qwen выпустила Qwen-RobotManip - базовую vision-language-action модель для управления роботами.

Модель построена на Qwen-VL / Qwen3.5-4B и объединяет визуально-языковую основу с action-модулем на Diffusion Transformer и flow matching. Это позволяет напрямую генерировать непрерывные движения робота, сохраняя понимание изображения и текстовых инструкций.

Главная идея проекта - сначала выровнять данные, потом масштабировать обучение.

Датасеты робототехники сильно различаются: разные роботы, камеры, системы координат, пространства действий и способы сбора данных. Qwen-RobotManip приводит их к общей системе на уровне представлений, движений и поведения.

Для обучения использовали только открытые датасеты роботизированных манипуляций и видео от первого лица - без собственного закрытого сбора данных. В итоге собрали около 38 100 часов данных.

Авторы показывают сильное обобщение на новые условия, выполнение инструкций, восстановление после ошибок и перенос навыков между разными типами роботов.

https://github.com/QwenLM/Qwen-RobotManip
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2🔥1
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.

Stepik: «Python современный AI для разработчика и автоматизации задач»

63 урока, 382 шага, практика с кодом и автопроверкой.

Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.

Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.

Для тех, кто уже знает Python и хочет перейти к production AI.

72 часа скидка 55%

https://stepik.org/a/295921
3👍2🔥2
⚡️ AI-агенты научились автономно разрабатывать софт несколько дней подряд

В новой работе представили Harness-of-Harness (HoH) - надстройку над coding-агентами, которая превращает их работу в повторяющиеся циклы:

планирование → код → тесты → оценка → улучшение

Главная идея — не просто дать агенту одну большую задачу, а заставить его постоянно улучшать проект небольшими проверяемыми шагами, сохранять историю версий и отделять собственные тесты от независимой оценки.

На GameCraft-Bench, FrontierSWE и ProgramBench подход протестировали с несколькими связками:

- Codex + GPT-5.5
- OpenCode + DeepSeek-V4-Pro
- Pi + MiniMax-M3

После трёх итераций HoH в среднем улучшил результат на 52,25%, а максимальный прирост достиг 82,86% по сравнению с обычным запуском тех же агентов.

Самый показательный эксперимент длился более 70 итераций несколько дней подряд. Агент автономно собрал полноценный FPS: сюжет, основные механики, играбельный геймплей, визуал и звук.

То есть речь уже не о «написать функцию по промпту», а о попытке построить цикл, в котором coding-агент самостоятельно развивает один проект часами и днями.

https://arxiv.org/abs/2609.01481
4👍1🔥1
📖 OpenAI обновила гайд по GPT-6 Astra API - модель явно заточена под длинные агентные задачи

GPT-6 Astra позиционируется как самая сильная модель OpenAI для computer use, браузера, software engineering, науки и сложных профессиональных workflows.

Главные возможности:

- Async tool calling — модель может продолжать рассуждать и выполнять другие части задачи, пока внешний tool ещё работает
- Mid-turn steering — требования можно менять прямо во время выполнения задачи, не начиная всё заново
- Динамический reasoning — reasoning effort можно повышать или снижать по ходу диалога с сохранением prompt cache
- Multi-agent orchestration
- Computer use
- Structured Outputs
- Programmatic Tool Calling
- Persisted reasoning
- Compaction

OpenAI отдельно отмечает, что Astra во многих тестах использует заметно меньше output-токенов, поэтому стоимость успешно выполненной задачи может быть ниже даже при более высокой цене токена.

https://developers.openai.com/api/docs/guides/latest-model?model=gpt-6-astra
6👍1🔥1
📚 Бесплатная книга по математике для Computer Science и Machine Learning - более 2200 страниц

Жан Галлье и Джоселин Куэйнтанс собрали в одном учебнике алгебру, топологию, дифференциальное исчисление и теорию оптимизации.

Материал для тех, кто хочет глубже разобраться в математической основе алгоритмов и машинного обучения. Книга на английском, полная рукопись доступна бесплатно в PDF.

https://www.cis.upenn.edu/~jean/gbooks/geomath.html
👍43🔥3
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ Anthropic сдвинула IPO на середину октября

Компания скорректировала график подготовки к первичному размещению - теперь оно ориентировано на середину октября. Причинами называют финальное согласование отчётности и желание андеррайтеров поймать более устойчивое окно на рынке.

Размещение будет заметным для всей отрасли - Anthropic первой среди создателей передовых моделей переходит от венчурных денег к регулярной публичной отчётности и рынок впервые увидит, сходится ли экономика больших языковых моделей с затратами на вычисления.
reuters.com

✔️ OpenAI набирает лоббистов для работы в штатах

В команду по связям с госорганами пришли трое: Джессика Шумер из Amazon, Колдер Харвилл-Чайлдс из команды Цукерберга и Томас Маклеллан из Palo Alto Networks.

Ставка на штаты объясняется тем, что единый федеральный закон об ИИ застрял в Конгрессе. Под руководством вице-президента по глобальной политике Криса Лехейна компания собирается напрямую участвовать в разработке законопроектов в Нью-Йорке, Калифорнии и других крупных штатах.

Расчёт в том, чтобы закрепить нормы прозрачности и кибербезопасности на региональном уровне и сделать их фактическим стандартом для всей индустрии.
axios.com

✔️ Microsoft выпустила облегчённый генератор изображений MAI-Image-2.6-Flash

Это упрощённая версия флагманской MAI-Image-2.6. Она умеет генерировать картинки по тексту, править фрагменты, работать с несколькими референсами, сама подбирает соотношение сторон и ходит в веб-поиск.

В рейтинге Artificial Analysis модель взяла 1311 Elo в редактировании (третье место, выше GPT Image 2) и 1297 Elo в генерации по тексту, восьмое место.

Доступна в публичном превью на Microsoft Foundry. Генерация стоит 19 долларов за миллион токенов, что вдвое дешевле родительской модели и в несколько раз бюджетнее GPT Image 2.
microsoft.ai

✔️ GitHub научил Copilot раздавать задачи разным моделям

Project HydraFusion меняет прежнюю схему с одной моделью на ансамбль специализированных. Задачи распределяются на лету - маленькие модели отвечают за автокомплит в строках кода, а большие берут на себя архитектуру, рефакторинг и поиск граничных случаев.

Прежде чем результат попадёт в IDE или в пул-реквест, его проверяют модели-критики и статический анализ.

От этого проекта GitHub ждёт меньше галлюцинаций и логических ошибок в больших репозиториях без потери скорости. Предварительная версия уже доступна всем подписчикам Copilot.
github.blog

✔️ ComfyOrg отправит своих инженеров работать внутри студий

Разработчики нодового движка запустили программу Forward Deployed Creatives, скопировав модель Palantir - технические художники и инженеры компании сядут прямо в команды киностудий, игровых компаний и агентств.

Задача - встроить ComfyUI в существующую инфраструктуру на Blender, Maya и Unreal Engine и написать под неё нестандартные ноды, чтобы генерация стала управляемой и повторяемой в реальном производстве.

Обратная связь с проектов пойдёт напрямую разработчикам ядра ComfyUI.
comfy.org


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥3👍1
FrogNano: кодинг-агент на 4 млрд параметров, дообученный без копирования ответов больших моделей

В новом отчёте Microsoft описан подход к обучению небольших агентов для разработки ПО. FrogNano проходил постобучение исключительно через reinforcement learning на синтетических задачах примерно в 1 500 программных окружениях, без традиционной дистилляции от более крупной модели.

Особенность - генерация задач прямо по ходу обучения. Их сложность подстраивается под текущие возможности агента: он получает задания, которые уже способен решить, но пока с трудом.

По мере улучшения модели меняется и набор задач. Это позволяет поддерживать полезную сложность, вместо того чтобы снова обучать агента на уже освоенных примерах.

Авторы связывают результат прежде всего с точностью подбора сложности. В их экспериментах такой подход позволил получить конкурентоспособного небольшого кодинг-агента на синтетических задачах.

Цель проекта - работа на ограниченном железе. В отчёте разобраны методика обучения, оценки в разных окружениях и анализ приобретённых навыков.

Статья - https://arxiv.org/abs/2609.07925
2👍1
🔥 Thinking with Looped Flows - новый подход к reasoning через рекуррентное обновление скрытого состояния

Обычные looped-модели могут тратить больше compute, многократно обновляя hidden state, но truncated backprop плохо обучает ранние шаги: то, что модель выучила в начале, часто не остаётся полезным позже.

Авторы предлагают другой подход — обучать recurrence через последовательность denoising-задач с постепенно уменьшающимся шумом.

Идея:

noise → промежуточное состояние → всё более чистое решение

При этом recurrent state переносится между шагами и постепенно уточняется.

Результаты:

- более стабильный test-time scaling
- 58,8% на ARC-AGI-1
- 12,2% на ARC-AGI-2
- в целом лучше предыдущих looped-моделей

Интересный сдвиг: reasoning здесь рассматривается не как цепочка токенов, а как постепенное движение внутреннего состояния модели от шума к решению.

https://alphaxiv.org/abs/2609.11801
👍62😡1
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку

Можно годами смотреть курсы, читать документацию и всё равно топтаться на месте.

А можно попасть в правильное окружение, где каждый день обсуждают новые инструменты, вакансии, реальные кейсы, ошибки и то, что уже завтра станет стандартом.

Здесь собраны папки и каналы по разным направлениям IT, чтобы ты быстрее находил нужных людей, идеи и полезный контент - без бесконечного поиска.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://t.me/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_ci
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подпишись и сохрани, здесь регулярно появляются новые подборки, инструменты и материалы, которые реально помогают расти быстрее.
1
📘 Глубокое понимание AI Agent: принципы проектирования и инженерная практика

AI Agents in Depth: Design Principles and Engineering Practice - одна из самых сильных новых книг по AI Agents: context engineering, RAG, MCP, coding agents, post-training, multi-agent. 10 глав и более 100 практических экспериментов, есть русская версия.

https://github.com/bojieli/ai-agent-book/blob/main/docs/ru/README.md
🔥9