172 subscribers
125 photos
47 videos
99 files
621 links
ALGORITHMS MACHINE LEARNING
Download Telegram
Measuring Intelligence Beyond Human Scale
https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human

Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике»

Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы)

Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss

Когда возможности приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются

При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы

Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей

Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки

Для технических лидеров и исследователей эта работа предлагает сдвиг парадигмы в оценке LLM

Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга

Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга
Channel name was changed to «ARI AML»
Forwarded from ARI (НИИ Антропогенеза) (Chagin Oleg A.)
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
Agents-A1 Team, Shanghai Artificial Intelligence Laboratory
Paper: https://arxiv.org/abs/2606.30616
Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters
Code: https://github.com/InternScience/Agents-A1
Model: https://huggingface.co/InternScience/Agents-A1

Авторы представили Agents-A1 — агентную MoE-модель на 35.000.000.000 параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45.000 токенов

Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов

Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров

Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом

Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс)
Media is too big
VIEW IN TELEGRAM
Лекция Ричарда Фейнмана, в Корнелле в 1964 году, о том, почему природа отвечает только на языке математики
Каждая команда, заставляющая языковые модели рассуждать, упирается в эту стену

Нобелевская премия пришла через 11 месяцев
Кадры сохранились на киноплёнке и теперь лежат бесплатно на YouTube с небольшим количеством просмотров

Посмотрите раздел с доской ближе к середине
Он берёт один из законов Кеплера и перестраивает его с нуля, с обозначениями, которые поймёт 12-летний ребёнок

Без слайдов
Без жаргона
1 кусок мела
Итоги 67-й Международной математической олимпиады (IMO)
И вновь есть, кем гордиться!
У нашей команды шесть медалей: четыре золотые и две серебряные
Золото получили Дмитрий Гришко (Пятьдесят седьмая школа, Москва), Роман Кравченко (Президентский физматлицей №239, Санкт-Петербург), Арина Прокудина (Физматлицей №31, Челябинск) и Андрей Шишко (Лицей «Вторая школа» имени Овчинникова, Москва)

Серебро — у Максима Большакова (лицей-интернат №2 Московского района, Казань) и еще одного представителя Президентского физматлицея — Александра Скворцова

Всего же в олимпиаде, которая проходила с 10 июля в Шанхае (КНР), соревновались представители более чем 100 стран
Россияне повторили результат 2024-го года, а в прошлом году у сборной было 5 золотых медалей и одно серебро

Поздравляем!
Forwarded from ARI IES
2506.21805.pdf
7.6 MB
Японские исследователи создали систему, которая симулирует целый город, генерируя до 1.000.000 виртуальных жителей, ведущих себя как люди, с использованием LLM

И она предсказывала реальный мир с поразительной точностью

Они создали городской симулятор под названием "CitySim", который заселяет цифровой двойник Токио до 1.000.000 автономных агентов

Каждый житель работает на базе LLM и обладает:

• Личными воспоминаниями
• Долгосрочными целями
• Человеческими желаниями (голод, усталость, социальные связи)
• Пространственным восприятием и навигацией

Большинство городских симуляций полагаются на жесткие, вручную созданные правила: если происходит A, следует B

CitySim отличается
Он "ценностно-ориентированный"

У агентов есть свобода действий
Они сами генерируют свои расписания на основе личных привычек, ситуативных нужд и меняющейся среды

Когда исследователи запустили симуляцию в Токио, результаты были пугающе точными

Будничные транспортные потоки, выходные развлечения и привычки покупок совпадали с данными статистических отчетов японского правительства с почти идеальной точностью

Она даже успешно предсказала распределение толпы в Сибуе и определила, какие магазины на самом деле станут популярными, за месяцы до того, как реальные данные это подтвердили

Теперь возможно безопасно и экономично тестировать подготовку к катастрофам, планирование коммерческих объектов и модернизацию общественной инфраструктуры, не перемещая ни одного реального человека

Но дело не только в планировании

Исследователи уже рассматривают внедрение высокоуровневых человеческих мотивов, таких как "самоактуализация", в этих агентов, чтобы посмотреть, как они эволюционируют

Статья появилась на arXiv в июне 2025 года, и почти никто за пределами вычислительной социальной науки её не прочитал
Создание больших моделей — это в сущности игра ума

Узкое место — не вычисления, а идеи — которые превращают вычисления в интеллект
Открытый исходный код — это стратегия

Законы масштабирования — каждый новый метод сбрасывает кривую, и победителями становятся те, кто первым находит следующий метод

Игра ума — предсказание, какое направление исследований необходимо, до того как вы потратите время на вычисления, потому что у вас всего одна попытка
ARI AML pinned «Создание больших моделей — это в сущности игра ума Узкое место — не вычисления, а идеи — которые превращают вычисления в интеллект Открытый исходный код — это стратегия Законы масштабирования — каждый новый метод сбрасывает кривую, и победителями становятся…»
Media is too big
VIEW IN TELEGRAM
Корнелл, ноябрь 1964 год

Ричард Фейнман читает 7 лекций под названием «Характер физического закона»
Чёрно-белая плёнка, 1 доска, мел, без слайдов

Плёнки вышли из распространения в 1980-х

Фейнман на пике своей формы сохранился только в виде книги и киноплёнок кампуса
Квантовый, это не компьютер, это аналоговая система в некотором роде, и он не гоняет числа туда-сюда
Мы там выращиваем волновую функцию нужного нам вида
(подталкиваем эволюцию по Шрёдингеру)

В квантовой механике есть фундаментальный факт: если вы знаете волновую функцию сейчас, знаете энергию системы, то эта энергия давит волновую функцию и проталкивает ее вперед во времени
И вы организуете такое подталкивание волновой функции, которое, в принципе, ненаблюдаемо

На неё нельзя посмотреть, её нельзя узнать, но мы делаем так, чтобы она сама выросла

И в тот момент, о котором мы уже говорили, когда вы делаете финальные измерения, она настолько хорошо, насколько может, намекает нам на правильный ответ и погибает