279K subscribers
5.53K photos
1.29K videos
17 files
5.87K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
Осень — время, когда бизнес активно начинает искать подрядчиков: бухгалтеров, юристов, маркетологов, дизайнеров, IT-специалистов и всех, кто закрывает задачи без расширения штата.

И тут появляется другая задача: где вообще искать этого человека? А если вы сами оказываете услуги, то вопрос работает и в обратную сторону. Где найти заказчика, которому вы нужны именно сейчас?

Авито Услуги как раз помогают сократить эту дистанцию:

*️⃣Ежемесячно на площадке 37,3 млн человек ищут разные услуги, и 7 млн из них — деловые. Люди приходят туда с вполне конкретной задачей и готовы платить за экспертизу.

*️⃣Продвигать себя отдельно не нужно — всё уже встроено в площадку: обучающие материалы, возможность получить персонального менеджера и личный кабинет с аналитикой, где видно, что ищут прямо сейчас.

*️⃣Начать довольно просто. Оформляете профиль, размещаете объявление и нормально описываете, какие задачи можете решить.

В ряде категорий услуг для сделки можно подключить безопасный сценарий работы: договоренности фиксируются заранее, а оплата резервируется до тех пор, пока заказчик не примет результат.

Чтобы менеджер Авито Услуг бесплатно помог вам оформить профиль и разместить объявление и начислил до 10 000 бонусов на продвижение — оставьте прямо сейчас заявку на сайте.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍84👏23🤩18❤13🏆6😁2🗿2
✔️ Nvidia представила открытую платформу безопасности для агентов

Open Agent Safety Platform – открытый набор средств для запуска автономных агентов в изолированной среде. Основа платформы – OpenShell, среда, которую компания развивает около года.

Второй, необязательный уровень контроля даёт Nvidia Sentry. Это ПО работает на отдельном процессоре обработки данных BlueField вне досягаемости агента, а программная платформа DOCA связывает его с политиками OpenShell.


OpenShell запускает агента в песочнице, где оператор заранее перечисляет доступные файлы, сетевые адреса, инструменты, процессы и ключи. Из коробки поддерживаются Claude Code, Codex, OpenCode и GitHub Copilot CLI, через шаблоны NemoClaw – OpenClaw и Hermes Agent.

Зачем агенту такая изоляция, в Nvidia объясняют дрейфом - при долгой работе, неоднозначных инструкциях или упоре в запрет агент уходит от исходной задачи, и рассчитывать, что он сам удержит себя в рамках, нельзя. Поэтому контроль вынесен за пределы агента, и знать о наблюдении ему не обязательно.

Каждая песочница – отдельный контейнер или Docker, Podman или Kubernetes. Шлюз управляет их жизненным циклом, а движок политик перехватывает каждое исходящее соединение и либо пропускает его, либо подставляет ключи провайдера для разрешённого адреса, либо блокирует и пишет в журнал.

Ключи не попадают в файловую систему песочницы, их передают переменными окружения во время работы. Политики задаются в YAML и охватывают четыре области: файлы, сеть, процессы и провайдеров.

Доступ к файлам и системным вызовам фиксируется при создании песочницы, сетевые правила меняются онлайн с точностью до HTTP-метода и пути, так что агенту можно разрешить чтение API GitHub и запретить запись. По словам Nvidia, OpenShell проверяет ограничения ещё до запуска агента.

Главная площадка для Sentry – системы Vera Rubin POD, где процессор BlueField-4 стоит в каждом вычислительном модуле на единственном пути от узла к модели.

Там Sentry изолирован от хоста, следит за поведением агента и применяет политику OpenShell на скорости линии, а шлюз DOCA проверяет, кто такой агент и какие полномочия ему выданы.


Владельцам систем Vera достаточно обновить ПО, всем остальным установка доступна одним скриптом на Linux, macOS с Apple Silicon и Windows через WSL 2, последний вариант экспериментальный.

Проект в статусе альфа, версия 0.1.0 ещё готовится, развёртывание в Kubernetes и проброс видеокарт в песочницу тоже помечены как экспериментальные.



@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔79👍47👏14❤9🔥5🥰4
🔥 Google официально представила Gemini 4 Argon

Это новая frontier-модель компании для сложных многошаговых задач: программирования, финансового и юридического анализа, корпоративных workflow и кибербезопасности.

Главная особенность Argon - до 1 миллиона выходных токенов против 64K у предыдущего поколения. Google делает ставку на очень длинные траектории рассуждений, где модель может работать над одной задачей сотни тысяч токенов подряд.

Что показали внутри Google:

- 77,9% на DeepSWE v1.1 для сложных software engineering задач;
- первое место на AutomationBench с 51,3%;
- 91,7% на LVBench для понимания длинных видео;
- 68% на CWE-bench v1 по исправлению уязвимостей.

Агенты Argon помогали Google переносить крупные C/C++-кодовые базы на Rust, включая компоненты Fuchsia Zircon объёмом более 800 000 строк. В другом проекте модель переработала 32 000 строк SIMD-кода в Rust, а итоговая версия работала в 2,7 раза быстрее предыдущего Rust-порта.

Ещё один внутренний проект: несколько Argon-агентов нашли оптимизации памяти в инфраструктуре Google, которые после внедрения освободили более 300 TiB RAM, а потенциальная экономия оценивается в 500 TiB–1 PiB.

Отдельный фокус — кибербезопасность. Argon умеет самостоятельно искать, проверять и исправлять критические уязвимости. Первым доступ получают проверенные специалисты через программу Fairwind.

💰 Стартовая цена API:

$2 / 1M входных токенов
$10 / 1M выходных

Кэшированный input дешевле на 95%. После introductory-периода цена вырастет до $4 / $20.

Пока Gemini 4 Argon не запускают для всех: Google сначала тестирует модель с ограниченным кругом пользователей и усиливает защиту от prompt injection, злоупотреблений и нежелательного поведения агентов. Затем доступ начнут расширять на разработчиков, компании и пользователей, начиная с платных API-клиентов и Google AI Ultra.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

@ai_machinelearning_big_data

#gemini
🔥140👍34❤27👏7🤔5🤩4🥰2😁2
✔️ Переименование ИИ в США вызвало ажиотаж на словенские домены

Словенский регистратор Register.si после выступления Президента США на Генассамблее ООН регистрирует в среднем 3700 новых доменов зоны .si в день, тогда как за весь август их было около 3500.

С трибуны ООН американский лидер объявил, что США будут называть искусственный интеллект "суперинтеллектом" (super intelligence, SI), потому что прежнее название, по его словам, звучит фальшиво.


К 29 сентября в зоне .si было больше 220 тысяч доменов и на фоне повышенного спроса регистратор призвал владельцев товарных знаков, слоганов и названий компаний, у которых ещё нет адреса в зоне, зарегистрировать его как можно скорее.

В тот же день, Дональд Трамп закрепил переименование указом Inaugurating the Era of Super Intelligence.

Федеральные ведомства должны, насколько позволяет закон, писать Super Intelligence и SI вместо Artificial Intelligence и AI в официальной переписке, публичных заявлениях, на сайтах, в отчётах и других документах, кроме законодательных.

Юридически новый термин охватывает те же технологии, что и определение ИИ в параграфе 9401 раздела 15 Свода законов США, так что в законах пока ничего не меняется.

В течение 60 дней помощник президента по науке и технологиям должен предложить законопроект с федеральным определением суперинтеллекта, которое может расширить или заменить нынешнее.

Сколько стоит регистрация домена .si и кто покупает адреса после объявления Трампа, пока неизвестно.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
😁76🤣55🙉10❤8👍6🤷‍♂3🔥1
Media is too big
VIEW IN TELEGRAM
✔️ Президент США и главы ИИ-компаний подписали соглашение о безопасности

Документ подписали главы Google, Anthropic, xAI и Nvidia и президент OpenAI Грег Брокман. Юридической силы у соглашения нет, стороны называют его морально обязывающим.

Компании обещают ввести четыре уровня контроля и аудита передовых моделей, создать внутренние группы для проверки этих механизмов, допустить внешние проверки и независимый надзор.

Критики сетуют, что соглашение необязательное и почти не содержит деталей.
axios.com

✔️ В Китае заработал первый суперкластер на 100 тысяч отечественных ускорителей

Об этом сообщил Китайский информационный центр интернет-сети CNNIC в докладе о генеративном ИИ. Все компоненты кластера от чипов и сети до хранения данных и охлаждения сделаны в Китае.

Вычислительная мощность для ИИ в стране к июню выросла за год на 177%, до 2185 EFLOPS. Аудитория генеративного ИИ превысила 700 млн человек, это больше половины населения.

ИИ используют более 30% крупных и средних промышленных предприятий Поднебесной.
cnnic.cn

✔️ Ideogram выпустила модель 4.5

Свежая версия сфокусирована на точное и последовательное редактирование графики. Она не накапливает артефакты, смещения пикселей и искажения цвета при длинных цепочках правок.

Модель правит фрагменты снимков высокого разрешения без уменьшения исходника и переводит надписи на изображении на другие языки.

Ideogram 4.5 доступна в веб-интерфейсе, у партнёров и через API в четырёх режимах качества, от 0,008 до 0,22 доллара за изображение в разрешении 2K.

Веса компания обещает открыть в ближайшее время.
ideogram.ai

✔️ OpenClaw Foundation открыл код корпоративной платформы для агентов

OpenClaw Enterprise управляет постоянно работающими агентами в закрытых средах. Проект начинали в OpenAI, затем передали фонду и доработали вместе с Red Hat и Nvidia.

Платформа поддерживает мультиарендность, разделяет доверенные и недоверенные нагрузки, запускает агентов в песочнице, проверяет их действия с помощью языковой модели и позволяет тонко настраивать права доступа. Обвязку, модель и песочницу можно заменить сторонними или собственными.

Версия 1.0 выйдет до конца года, пока платформу рекомендуют для внутренних пилотов. Такие пилоты идут в Red Hat и OpenAI, где агенты получают полный доступ к кодовым базам.

Платформа бесплатна и разворачивается на собственных серверах.
openclaw.ai

✔️ McDonald's рассчитывает цены с помощью ИИ

Пионер фастфуда совместно с Tiger Analytics запустил модель, которая анализирует транзакции и парсит конкурентов, вычисляя метрику готовности платить для каждой геолокации.

По данным Reuters, применение алгоритма привело к разбросу цен - стоимость Биг Мака в заведениях в радиусе трех километров может различаться на 21%.

Корпорация заявляет о рекомендательном характере системы. При этом платформа фиксирует отклонения франчайзи от сгенерированных расценок. Уровень ценового комплаенса напрямую учитывается при аудите бизнеса и продлении партнерских контрактов.

Масштабирование алгоритмического подхода на 14 тысяч ресторанов в США привлекло внимание антимонопольных органов. Сейчас регуляторы проверяют, нарушает ли такое ценообразование законодательство о защите конкуренции.
reuters.com


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍57❤10🔥5🤣3
🌟 Bilibili выложила открытые модели перевода Index-Translate

Команда Index LLM китайского видеохостинга Bilibili выпустила семейство открытых моделей машинного перевода Index-Translate на базе на Qwen3.5 в трёх размерах - 2B, 9B и 35B-A3B.

MoE 35B-A3B в статусе превью, её веса обещают выложить позже.


Модели переводят между 150 языками, в том числе на русский и с русского, и понимают инструкции к переводу.

В запросе можно задать глоссарий, попросить сохранить разметку, код и плейсхолдеры, выдержать стиль или учесть контекст соседних фраз.

Модели также умеют переводить мемы и сленг китайских интернет-сообществ.

В релиз также вошли в размерностях 2B и 9В каждая:

🟢Index-Echo S2TT - перевод речи сразу в субтитры;

🟢Index-Echo S2ST - перевод речи в речь с сохранением голоса говорящего;

🟢Index-Homura - перевод под заданное число слогов при дубляже;

🟢Index-NativeLong - перевода целой книги за один проход.

🟡Тесты

На FLORES-200 флагман 35B-A3B набирает 0,8794 по COMET-22, 9B набирает 0,8789.

Для сравнения - DeepSeek-V4.1-Flash и GPT-5.6-Sol выбили 0,8762 и 0,8650 соответственно.


В бенче instTrans (от самой Bilibili), который проверяет следование инструкциям при переводе, у 35B-A3B 0,8336 балла против 0,7624 у GPT-5.6-Sol.

В WMT26 качество перевода оценивает GPT-5.6-Sol по шкале до 100, и здесь Index-Translate-9B набирает 75,35, а сама GPT-5.6-Sol и DeepSeek-V4.1-Flash получают 89,10 и 83,55.

Для локального запуска в bf16 версии 2B нужно около 8 ГБ видеопамяти, версии 9B - около 24 ГБ без учёта кэша для длинных контекстов.


📌Лицензирование: Apache 2.0


🟡Страница проекта
🟡Набор моделей
🟡Техотчет
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Translation #Index #Bilibili
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥41🤓25👍17❤8🤔6🥰3👏3😍1💯1
🌟 SGLang научил чат-модели отвечать вероятностями

Команда открытого движка инференса SGLang добавила эндпоинт /v1/decisions, который превращает обычную чат-модель в модель для принятия решений.

Второй эндпоинт, /v1/systemone, отдаёт те же решения в формате System One API, который TypeSafe AI представила 19 сентября вместе со своей моделью Jev.

API поддерживает выбор из 2–26 вариантов (до 255 с двухбуквенными метками), оценку по шкале из 2–10 уровней и вопрос «да или нет».

SGLang присваивает каждому варианту метку из одного токена - буквы для выбора, цифры для оценки, yes и no для бинарных вопросов.

Затем движок читает логарифмические вероятности следующего токена по всему словарю и переводит их в вероятности через софтмакс с учётом температуры.

Отсюда ограничение - метка обязана укладываться в один токен в позиции ответа.


Решение принимает один вход без истории диалога, а вероятности у холодного запроса и у запроса из префиксного кэша могут расходиться на несколько сотых.

Для демонстрации SGLang заставил Qwen3.8-27B играть в Pokémon FireRed. Модель по текущему состоянию игры выбирала между атакой, сменой покемона и лечением меньше чем за 100 мс на решение и прошла Элитную четвёрку и чемпиона.

Функция доступна в nightly-сборках SGLang из основной ветки. Её проверили на Qwen3.8-27B и Qwen3.5-35B-A3B, другие модели подойдут, если метки ответов укладываются в один токен.

Примеры запросов и описание формата есть в документации SGLang.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👏48🔥44👍35👌17🤔12❤10🎉6🥰3😁1
✔️ Anthropic раздаёт бесплатные плюшевые игрушки и стикеры

На сайте для разработчиков claude.dev появилась раздача фирменных подарков. В разделе Терминал нужно ввести команду /plushies, чтобы оформить заявку на плюшевого Clawd, маскота Claude Code, или /stickers, чтобы получить набор стикеров.

Покупать ничего не нужно, подарок положен один на человека, участвовать могут только совершеннолетние. Дизайн игрушки выбирается случайно, заказать конкретный нельзя.

Тайваньское издание BlockTempo насчитало пять вариантов – волшебник, ковбой, учёный, весёлый и в солнечных очках.

Заявки принимает и подарки рассылает сторонний сервис Brilliant, поэтому доставка работает только там, где он обслуживает клиентов.

Раздача идёт, пока подарки не закончатся. По наблюдению BlockTempo, уже в первый день приём заявок временно закрывался, издание предполагает, что его будут периодически открывать снова.

Официального анонса акции Anthropic не публиковала.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🥰39👍33🔥13🎉12❤9🥱5🦄4😁3
✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить

Инженеры AI VK построили отдельный контур товарных рекомендаций внутри Ленты ВКонтакте. Обычный рекомендер оптимизируется под релевантный показ, за которым обычно следует лайк, комментарий и другие реакции, но интерес к посту ещё не означает готовность купить товар.

Поэтому для товарных публикаций сделали отдельную систему со своими кандидатами, логированием и моделью ранжирования. Она оценивает вероятность того, что конкретный товарный пост приведёт пользователя к заказу.

На старте возник классический cold start: мало показов → мало переходов и заказов → мало данных → модель не на чем обучать.

Команда подняла логирование товарного домена с 2% до 100%, увеличив обучающую выборку в 15 раз. А пока заказов было недостаточно, использовала более частые proxy-сигналы – например, раскрытие текста поста, которое коррелировало с дальнейшим переходом к партнёру.

Для поиска кандидатов система использует два типа сигналов: товарное поведение и обычные контентные интересы. Например, если человек взаимодействует с постом про книги или рецептами, система может найти близкие по смыслу товарные публикации – книги, посуду или другие связанные товары. После этого ранкер решает, стоит ли показывать конкретный товар конкретному пользователю.

Само ранжирование мультитаргетное: максимальный вес получает заказ, затем переход к партнёру и только потом более лёгкие действия вроде лайков и времени просмотра. То есть система оптимизируется не под CTR как таковой, а под всю воронку до покупки.

За пять месяцев:
🟢сквозная конверсия из показа в созданный заказ выросла на 53%;
🟢число созданных заказов – в 43,2 раза;
🟢переходы к партнёру – в 55,3 раза;
🟢CTR перехода к партнёру – на 95,6%.

Инфраструктурно всё работает на Discovery-платформе VK: она позволила настраивать отдельное логирование, быстрее запускать эксперименты и тестировать гипотезы без разработки отдельных сервисов под каждый новый сценарий.

Подробно про архитектуру, cold start, proxy-таргеты и ранжирование – в статье на Хабре.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣51🔥23👨‍💻20❤19😭18👍9👏6💅5🥰3🤬2😁1
🌟 Cloudflare выпустила открытые модели решений Clef

Обе модели, Clef и Clef-flash, вышли с открытыми весами и сразу появились в облачной платформе компании Workers AI.

Такие модели не пишут текст, а возвращают вероятности вариантов на типизированные вопросы, по которым агент или программа выбирает следующее действие.


Clef построена на Qwen3.8-27B, Clef-flash – на Qwen3.5-9B. Обе принимают текст, JSON, изображения и видео, держат контекст 64 тысячи токенов и полностью совместимы с System One API, формат, который TypeSafe AI представила вместе с моделью Jev.

Главный соперник Clef – как раз Jev, которая работает только с текстом и закрыта.

Модели дообучали с функцией потерь Брайера, чтобы их вероятности совпадали с реальной частотой правильных ответов.

🟡Тесты

По замерам на 43 тестах медианная задержка Clef составила 209 мс, Clef-flash – 39 мс, Jev – 524 мс.

В классификации банковских запросов BANKING77 Clef набрала 94,2 балла макро-F1 против 79,7 у Jev, в поиске инструментов ToolRet – 69,2 против 65,3 по nDCG@10.

Внутри Cloudflare Clef уже классифицирует домены для разведки угроз, разбирает тикеты поддержки и отличает полезных краулеров от вредных.

В Workers AI миллион входных токенов стоит 24 цента для Clef и 9 центов для Clef-flash.

Для сравнения, Jev у TypeSafe AI тот же миллион входных токенов стоит 4 цента.


Дообучать Clef под свои задачи клиенты пока могут только вместе с инженерами Cloudflare, самостоятельный сервис обещан позже.


📌Лицензирование: Apache 2.0


🟡Блогпост
🟡Документация
🟡Веса Clef
🟡Веса Clef Flash
🟡Демо
🟡Лидерборд


@ai_machinelearning_big_data

#AI #ML #LLM #Decision #Clef #CloudFlare
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉57👍27❤24🤩15👏8🔥6💯4
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI заблокировала атаку дистилляции скрытых CoT своих моделей

Компания пресекла кампанию по состязательной дистилляции, направленную на извлечение скрытых цепочек рассуждений. Ключевой кластер активности компания связала с Moonshot AI. В атаке участвовало 4 тысячи учетных записей, всего было сделано 16 тысяч запросов.

Шифрование злоумышленники не вскрывали, в сохранённые диалоги не проникали – операторы копировали зашифрованные рассуждения из одного диалога и просили модель в другом расшифровать и переписать их.

OpenAI закрыла этот путь, добавила проверки потоковой выдачи, заблокировала аккаунты и передала наблюдения в Frontier Model Forum.

Moonshot AI пока обвинения не комментировала.
openai.com

✔️ DeepMind представила систему маркировки сгенерированных белков и геномов

Новая технология SynthID Bio встраивает водяные знаки в сгенерированные белки и геномы. Метка закладывается в структуру и считывается даже после физического синтеза молекулы в лаборатории.

В зависимости от формата данных алгоритм вносит корректировки в аминокислотные последовательности или меняет координаты атомов в 3D-структурах AlphaFold 3. Заявлено, что точность и функциональность молекул при этом не снижаются.

Разработка решает проблему отравления данных и обхода фильтров безопасности. Генерации не похожи на известные патогены и легко проходят автоматический скрининг фабрик по синтезу ДНК, а неразмеченные структуры попадают в публичные базы.

Лабораторные тесты показали, что маркированные белковые связки для ряда белков сохраняют целевую аффинность, а эксперименты с геномной моделью Evo 2 подтвердили жизнеспособность созданных бактериофагов с водяными знаками.
deepmind.google

✔️ HeyGen представил собственную модель генерации видео

Сервис цифровых аватаров анонсировал HeyGen Video - универсальную модель на базе архитектуры MiniMax H3 и и дообученную самим HeyGen.

Инструмент создает полноценные кинематографичные сцены и работает в режимах Text-to-Video с одновременным синтезом синхронного звука, эмбиента и эффектов, Image-to-Video для анимации статичных кадров, а также Reference-to-Video, позволяющий задавать композицию и динамику движения с помощью референсного ролика.

Генерация секунды видео в разрешении 768p обойдется в 3 цента по стандартному тарифу и в честь релиза до конца октября действует скидка 50%.

Модель уже доступна через API HeyGen, а также на OpenRouter, Runware и ComfyUI.
heygen.com

✔️ arXiv ограничил загрузку двумя статьями в месяц

С 1 октября репозиторий статей ограничил авторов двумя препринтами в месяц.

Причиной стал наплыв сгенерированных текстов. За сентябрь платформа получила 40 363 работы, а за два года объем входящих публикаций удвоился, что привело к перегрузке модераторов и задержкам при публикации исследований.

Модераторы фиксируют рост числа бессодержательных черновиков, полных LLM-генераций и искусственного дробления одного исследования на серию мелких статей.

Ограничение распространяется на все дисциплины и учитывает отклоненные материалы, блокируя возможность повторной отправки спама.

Сервис называет меру временной, пока внедряются новые фильтры и обновления регламентов модерации.
arxiv.org

✔️ Runway анонсировал модель действий для роботов, обученную на видео

Praxis-1 - первая модель действий в физическом мире американского стартапа прикладного ИИ. Базовую политику управления обучают на массиве видео от третьего лица вместо сбора телеоператорских демонстраций.

По словам Runway, симуляция алгоритмов робота внутри генеративной модели предсказывает физические тесты на оборудовании с корреляцией 0,95, превосходя традиционные методы 3D-реконструкции.

Praxis-1 работает на манипуляторах, мобильных колесных платформах и гуманоидных шасси независимо от аппаратной конфигурации. На этапе тестирования модель уже развернута на устройствах Noble Machines, Standard Bots и Ultra.

В ближайшие месяцы Runway планирует выпустить Praxis-1 в открытый доступ.
runway.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍68❤13🤔6🔥3👏1
⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face показали, как это исправить через RL

Команда Hugging Face выложила подробный гайд по multi-harness RL. Сами харнессы при этом не трогают. Модель подключают к прокси, который понимает все четыре API-формата coding-агентов: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages и Gemini. Прокси записывает точные token ids и logprobs, которые семплировал vLLM, и на них идёт обучение. Claude Code, Codex и OpenCode работают как есть, без единой правки.

Результаты на LFM2.5-2.6B от Liquid AI получились такие. После обучения сразу в четырёх харнессах точность выросла с 42% до 54%. Небольшой бонус за решение задачи за меньшее число шагов сократил вызовы инструментов на 31%. Обучение только в OpenCode подняло сам OpenCode с 34% до 58%, но мульти-харнесс модель стала лучше везде.

Проверили и популярный короткий путь: SFT на 3 189 успешных траекториях Qwen3.8-27B. Имитация упёрлась в 47.5%, это ниже обоих RL-запусков. Копирование большой модели не заменяет практику в среде.

Открыто всё: прокси для записи траекторий в OpenEnv, тренер в TRL (async GRPO), задачи, SFT-данные, код и семь обученных моделей.

https://huggingface.co/spaces/AdithyaSK/multi-harness-rl

@ai_machinelearning_big_data

#HuggingFace
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥65⚡53👏16❤12🤔8🤓5👍4