experimentality
104 subscribers
22 photos
2 videos
118 links
The quality of being experimental.
Download Telegram
Forwarded from Neural Shit
Гугол выкатил новую фичу для Gemini 3 Flash - Agentic Vision.

Суть в том, что раньше нейронка смотрела на картинку один раз целиком и часто пропускала мелкие детали, а то и вообще галлюцинировала и придумывала себе то, чего на картинке нет. Теперь же это полноценный агентный процесс с циклом Think, Act, Observe.

Модель реально "разглядывает" изображение: она пишет и исполняет Python код, чтобы взаимодействовать с картинкой.

Что умеет:
— Активный зум: Если нейронка видит сложный чертеж или мелкий текст, она сама решит кропнуть нужный кусок, приблизить его и рассмотреть отдельно.
— Аннотации: Чтобы нормально посчитать объекты (например, пальцы на руке, лол), модель теперь рисует на них bounding box'ы и цифры прямо поверх изображения. Это помогает ей не сбиваться со счета.
— Визуальная математика: Видит таблицу -> пишет код -> строит нормальный график через Matplotlib, вместо того чтобы выдумывать цифры из своей кремниевой башки.

Обещают прирост качества на бенчах на 5-10%. Уже доступно через API иGoogle AI Studio.

тут подробнее
👍5🔥4
Neural Shit
Гугол выкатил новую фичу для Gemini 3 Flash - Agentic Vision. Суть в том, что раньше нейронка смотрела на картинку один раз целиком и часто пропускала мелкие детали, а то и вообще галлюцинировала и придумывала себе то, чего на картинке нет. Теперь же это…
Open-source модель для умных очков и не только

Задача VQA (ответы на вопросы по изображению) на практике требует не только «посмотреть» на картинку, но и уметь внимательно анализировать её детали, а при необходимости — обращаться к внешним источникам информации. Исследователи из Meta* предлагают объединить agentic RAG и VLM, чтобы получить модель с такими возможностями.

Подход заключается в обучении модели активно взаимодействовать с внешним миром. Модель учат обращаться к интернет-поиску и самостоятельно решать, как именно формировать запрос: отправлять текст, использовать полное изображение или вырезать релевантный фрагмент (например, логотип автомобиля). Для этого её обучают генерировать специальные токены <search> и корректно заполнять поля поискового запроса с помощью RL. В результате VLM начинает различать ситуации, когда ответ можно дать напрямую, когда достаточно текстового поиска, а когда требуется визуальный запрос по изображению или его части.

Как итог: модель обученная таким образом показывает кратно лучшие результаты по сравнению с аналогами (+20%) и при этом меньше галлюцинирует. Код обещают в опенсорсе, так что скоро каждый сможет сделать себе очки как у робокопа.

* Признана экстремистской и запрещена не территории РФ

Источник: https://www.arxiv.org/abs/2601.19060.

@experimentality
❤3🔥2
Эволюционный Deep Research дома

Думаю все уже привыкли пользоваться deep research, когда необходимо быстро погрузиться в какую-то тему, но обычно это какие-то проприетарные системы, которые непонятно как работают. А вот паренёк из Google взял и написал свою систему, которая побивает аналоги от Anthropic, Perplexity, Grok и NVIDIA.

В его подходе можно выделить два ключевых момента. Первая — перепланировщик. Модель не следует фиксированному плану, после каждого шага она вольна изменить его на основе новых вводных. Вторая — генерация нескольких кандидатов, как в эволюционных алгоритмах и объединение их в один ответ: на каждом шаге LLM запускается 3 раза с разными параметрами temperature и top_k, затем 3 ответа агрегируются в один и алгоритм продолжается.

Контролирует это всё дело критик, который после каждого шага проверяет насколько модель близка к ответу и если всё ок — подпускает модель к генерации финального отчёта. Кажется, что эти фишки можно внедрить в большое количество агентов, благо код выложен в opensource, так что бегом за дело!

Источник: https://www.arxiv.org/abs/2601.20843.

@experimentality
❤3
Forwarded from experimentator
Схема работы агента, по моему очень наглядно
Сегодня, в честь пятницы, попробуем новый формат, посмотрим как зайдёт

Планирование в латентном пространстве.

Авторы работы PILOT предлагают, вместо планирования, с которым маленькие модели справляются из рук вон плохо, обучить адаптер, задистиленный из большой модели, который будет по задаче генерировать steering vector, который будет направлять маленькую модель в сторону верного решения с минимальными вычислительными затратами на инференсе. Итог: прирост на широком спектре математических и кодовых бенчей.

Источник: https://www.arxiv.org/abs/2601.19917.

Оптимизация через поиск первой ошибки.

Верифицировать каждый шаг в траектории очень дорого, поэтому предлагается сконцентрироваться только на первом ошибочном шаге. После того, как шаг подтверждается как действительно ошибочный модель верификатор обучают признавать его и всё, что после него ошибочным, а всё что до — корректным. Финальное качество сравнимо с проверкой каждого шага, но затраты ресурсов кратно меньше.

Источник: https://www.arxiv.org/abs/2601.20312.

Поиск по дереву во время обучения.

Вместо равномерного распределения вычислительного бюджета на каждый шаг, SPARK использует “умное” ветвление в критических точках, которые модель сама и определяет. Затем, считаем награду в листьях и на этом запускаем GRPO. Такой подход получается точнее обычного GRPO, где сэмплируют независимые траектории, благодаря более гранулярному фидбеку. Ну и результаты на бенчах лучше!

Источник: https://www.arxiv.org/abs/2601.20209.

@experimentality
🔥5
Интересная работа. Некоторым моделям учить проще, чем делать самим :)

В целом красивый подход, жаль что вычислительно тяжёлый. Модель-учитель создаёт куррикулум для ученика, помогая ему решить неизвестные сложные задачи, которые сходу решить нельзя. Примеры учителя может и странные, но работают. Что-то в этом есть. Так и до сатори недалеко.

Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe
Статья: https://arxiv.org/abs/2601.18778
Ревью: https://arxiviq.substack.com/p/teaching-models-to-teach-themselves
Code: N/A

# TL;DR

ЧТО сделали: Авторы представили SOAR (Self-Optimization via Asymmetric RL) — фреймворк двухуровневого meta-RL, где модель-«учитель» генерирует синтетические задачи для обучения модели-«ученика». В отличие от классического self-play, оптимизирующего исход игры, или внутренней любознательности, здесь учитель получает награду исключительно за реальный прогресс ученика на наборе заведомо нерешаемых сложных задач.

ПОЧЕМУ это важно: Подход решает проблему «холодного старта» в RLVR (RL с проверяемыми наградами). Когда модель имеет 0% успеха на сложных задачах, градиенту просто неоткуда взяться. SOAR доказывает, что у моделей есть скрытые «педагогические» способности (отличные от умения решать задачи), которые можно прокачать через meta-RL. Это позволяет создавать автоматические curriculum learning планы, по которым ученик добирается до решений, ранее недоступных без размеченных человеком данных.

Подробнее: https://t.me/gonzo_ML_podcasts/2256
👍5
Сейчас одновременно вышло сразу несколько работ про само-дистилляцию, эта одна из них. Работа любопытная, в ней сразу несколько идей. Во-первых, проблема RLVR с бинарными наградами снимается, если смотреть не только на итоговую награду, но и на логи ошибок в процессе (тот же компилятор много чего полезного говорит кроме "удалось" или нет). Это называется RLRF (Reinforcement Learning with Rich Feedback). Во-вторых, собственно дистилляция от себя же, но с дополнительным промптом в виде этих логов. В-третьих, предложен очередной подход к TTT, Test-Time Self-Distillation, когда модель на одном тестовом запросе генерит варианты и пытается дообучиться через такую вот дистилляцию. Перекликается, например, с недавним TTT-Discover. И ещё прикольно, что показали про многословность GRPO — можно получать такой же результат с сильно меньшим количеством токенов, GRPO просто забалтывает в защитных целях, это по сути reward hacking.

Reinforcement Learning via Self-Distillation

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause
Статья: https://arxiv.org/abs/2601.20802
Ревью: https://arxiviq.substack.com/p/reinforcement-learning-via-self-distillation
Код: https://github.com/lasgroup/SDPO

# TL;DR

ЧТО сделали: Предложили SDPO (Self-Distillation Policy Optimization) — алгоритм онлайн-обучения с подкреплением, который использует «богатый фидбек» (ошибки компилятора, логи юнит-тестов) вместо разреженных скалярных наград. Вместо внешнего учителя или reward model, SDPO использует *саму текущую политику*, обусловленную полученным фидбеком и исходным вопросом, в роли «само-учителя» (Self-Teacher). Этот механизм ретроспективно оценивает попытку модели и дистиллирует скорректированные вероятности токенов обратно в политику.

ПОЧЕМУ это важно: Подход решает проблему назначение вклада (credit assignment), присущую современным методам RLVR (Reinforcement Learning with Verifiable Rewards). Преобразование неструктурированного текстового фидбека в плотные градиенты на уровне токенов позволяет моделям самообучаться значительно быстрее без использования GPT-4 в качестве учителя. Эмпирически метод достигает SOTA точности, требуя в 4 раза меньше генераций, чем сильные бейзлайны, и при этом избавляет модель от излишней многословности (reward hacking), часто наблюдаемой у рассуждающих моделей.

Подробнее: https://t.me/gonzo_ML_podcasts/2270
❤1
Forwarded from Data Blog
Activation Oracles
[paper]

Каждый раз, просто каждый раз, когда я читаю статью от Antropic хочется замирать от гениальности. Кому отдать душу, чтобы быть таким же креативным?

19 декабря у них вышла работа про Activation Oracles — подход, который позволяет читать скрытые состояния языковой модели, не анализируя веса и используя естественный язык. И если вы уже на этом месте подумали, что они просто используют для этого другую LLM — вы правы! Но зато как они это делают!

Основная гипотеза работы, как я вижу состоит в том, что:
если две модели имеют сходные представления, то одна модель может интерпретировать внутренние активации другой.

Эта мысль круто ложится на Platonic representation hyphothesis — Neural networks, trained with different objectives on different data and modalities, are converging to a shared statistical model of reality in their representation spaces.

Что делаем (это могли бы быть мы с тобой, но мы не такие умные):

Берём:

* целевую модель M,
* модель-оракул AO, которая изначально является её ctrl-C-копией,
* извлекаем активации M (из residual stream),
* и прокидываем их, используя steering, в граф оракула AO — тоже как направленное возмущение residual stream.

Дальше просто задаём промт-вопрос, вроде «О чём сейчас думает модель?», «Какова её цель?», «Есть ли здесь скрытое знание?». И оракул отвечает, причем хорошо — например, может вытащить секретное слово модели, даже если она сама не отдала его в ответе.

Идея засунуть активации в LLM не нова:

Был (есть) LatentQA, где активации подаются внешне — как дополнительный вход. Но здесь же активации встраиваются внутрь forward-pass, влияя на дальнейшие вычисления. И это же просто гениально.

Что ещё вкусного — всё, что я словами отдала как output, можно потыкать в приложенном к статье коде.

Туториал:
[collab]

Я перевела его с некоторой отсебятиной и постановкой задачи. Перевела только основной текст, комментарии коду уж оставлены родными. В нем можно увидеть:

1. Многошаговое рассуждение
Оракул по токенам извлекает цепочку Socrates → Plato → Aristotle на активациях модели.

2. Извлечение секретного слова
Модель дообучена скрывать слово — напрямую она его не называет.
Оракул извлекает его только из активаций (репликация Figure 1 из статьи).

3. Обнаружение мисалайнмента
Можно выявить, что модель обучена давать манипулятивные или вредные советы.

4. Трекинг эмоций модели (и у нее они есть)
По одному вектору на токен оракул отслеживает Disappointment, Anger, Frustration, Sadness на протяжении диалога.

Ограничения:

После радостного восторга, холодной головой также важно понимать, что оракул может додумывать и не может показать то, чего мы не спрашиваем. Кроме того, это не самая вычислительно оптимальная вещь — чтобы ответить на один вопрос об активации, AO требуется несколько forward-pass’ов и полноценная генерация текста.

Но красиво. Тыкайте на здоровье и делитесь впечатлениями!
🔥4
Вашим моделям нужно тренироваться на тесте

Как поступает усердный школьник, если у него не получается решить задачу? Гуглит решение Разбирает задачки на ту же тему, но попроще, пока не поймёт какие-то ключевые идеи необходимые для решения оригинальной задачи. Вот тоже самое предлагается делать во время test-time.

В обычном Test Time RL (TTRL) LLM обучают сразу на задачах из бенча, для которых в качестве ответа берётся вариант, наиболее часто встречающийся в ответах модели. Но для сложных задач такой подход, очевидно, не работает, так как псевдо-метки часто оказываются неправильными.

Здесь же предлагается на основе задач из бенча синтезировать ряд задач попроще и дообучаться в той же парадигме уже на них. Логика следующая: на простых задачах majority voting чаще будет давать правильные ответы и это выльется в нормальный сигнал для обучения.

При этом модель для синтеза вопросов также проходит через несколько итераций улучшений, что приводит к ещё лучшему качеству вопросов и, как следствие, качеству финальной модели солвера.

На бенчах, конечно, метод рвёт всё, с чем сравнивается, но и вычислительные затраты на это все не хилые. Однако это всё может оказаться worth-it, если получится с помощью заскейленной версии такого обучения решить какую-нибудь действительно сложную задачу, которая не поддаётся людям.

Источник: https://www.arxiv.org/abs/2601.22628.

@experimentality
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
😁4👎1
🔥1
PaperBanana: Automating Academic Illustration for AI Scientists

Генерилка иллюстрации для научных работ от Гугл, конкурент опенсорсного SciGenBench

Работает как команда из пяти агентов: один ищет примеры, другой планирует содержание, третий задаёт стиль, четвёртый превращает текст в картинки, а пятый проверяет и улучшает результат

Гитхаб - вот гитхаб пустой, он предмет простой

#text2image
🤣4
Фильтрация на уровне токенов при обучении даёт сильно более безопасные модели, чем другие способы.

Shaping capabilities with token-level data filtering

Neil Rathi, Alec Radford
Статья: https://arxiv.org/abs/2601.21571
Ревью: https://arxiviq.substack.com/p/shaping-capabilities-with-token-level
Код: https://github.com/neilrathi/token-filtering
Модель: Custom Transformers (up to 1.8B)

# TL;DR

ЧТО сделали: Предложили метод потокенной фильтрации данных (token-level data filtering) для хирургического удаления конкретных способностей модели (на примере медицинских знаний) на этапе предобучения. Обучая легковесные классификаторы находить и маскировать специфические токены, авторы не дают модели выучивать опасные концепты, сохраняя при этом соседние общие знания.

ПОЧЕМУ это важно: Это сдвиг парадигмы от безопасности "постфактум" (RLHF/Unlearning) к безопасности "ab initio" (изначальной). Результаты впечатляют: потокенная фильтрация масштабируется значительно лучше, чем удаление целых документов, создавая замедление в 7000 раз (по вычислительным затратам), необходимое модели для повторного обретения забытых знаний на масштабе 1.8B параметров. Кроме того, среди авторов — Алек Рэдфорд (создатель GPT-2 и GPT-3), что сигнализирует о серьезном повороте индустрии в сторону курирования данных как главного рычага безопасности.

Подробнее: https://t.me/gonzo_ML_podcasts/2319
🔥5
Оказывается, что если добавить tie-breaker в GRPO для ответов с одинаковыми значениями correctness reward (например выбирать ответ с наименьшей длиной), то метод будет работать лучше. Ну и в целом рекомендуют переходить на relative оценку (первое, второе, третье место и тд) вместо абсолютных значений награды, так как это делает обучение стабильнее, хотя это.

Источник: https://www.arxiv.org/abs/2601.23058.

@experimentality
👍3🤯3
Как использовать текстовый фидбек в RL?

RLVR выглядит неинтуитивно с человеческой точки зрения: если человек ошибается, ему обычно объясняют почему, тогда как в RLVR модель получает лишь бинарный сигнал (1 бит информации) — верно или неверно. Авторы предлагают заменить этот минимальный сигнал на текстовый фидбек.

Процесс устроен так: сначала модель генерирует rollout, затем LLM-критик выдаёт текстовое объяснение ошибок, после чего на основе исходного решения и критики строится улучшенный rollout. Далее возможны два варианта обучения: либо использовать RL непосредственно на улучшенном решении, либо применять SFT и учить модель предсказывать фидбек критика.

Проверяли, конечно, на математике, в зависимости от бенча получается либо лучше, либо на уровне с проверенными бейзлайнами (GRPO, DAPO, какие-то фидбек методы). Что интересно, в качестве фидбека в формальных системах можно брать не только LLM, но и ошибки компилятора, линтера и так далее. Короче просто для дальнейших исследований невероятный.

Источник: https://www.arxiv.org/abs/2602.02482.

@experimentality
❤3👍2
А ЧТО БУДЕТ ЕСЛИ ДАТЬ АГЕНТУ ПОДУМАТЬ ПОДОЛЬШЕ?

Scaling Test-time Compute for LLM Agents

Первое систематическое исследование test-time scaling для языковых агентов. Не для LLM на задачках по математике, а прям для агентов с тулами, мультистепами и тд. Тестировали на GAIA бенчмарке (165 задач, 3 уровня сложности), базовая модель GPT-4.1

Суть проблемы в том, что обычные LLM BoN работают тривиально (сгенерил N ответов, выбрал лучший). В агентах всё сложнее. У нас есть цепочка шагов, ошибки накапливаются, и если ты рандомно генеришь N ответов на каждом шагу, можешь только навредить

Что пробовали и что нашли:

✨Parallel sampling

BoN, BoN-wise (посттеповый), Beam Search, DVTS. BoN победил всех с 63.03 (baseline 55.76). НО на самых сложных задачах (level 3) лучше всех оказался BoN-wise (38.46), потому что он расширяет пространство поиска на каждом шаге решения, а не просто перезапускает всю траекторию. Beam Search и DVTS почти не дали прироста потому что зависят от точности верификатора при прунинге

✨Рефлексия

вот тут самое вкусное. Сделали модель RefM, которая суммаризирует предыдущие шаги и подсказывает агенту. Рефлексия НА КАЖДОМ ШАГЕ слегка УХУДШИЛА результат (55.15 vs 55.76). Модель сбивается с мысли от постоянного самоанализа. Но если рефлексировать только на плохих шагах (score < 2) результат растёт до 56.36.

Цитата из статьи, которую я выделила, пока читала: knowing when to reflect is more important than reflecting at every step.


✨Мерджинг результатов

Тестили три подхода: voting (голосовалка большинством), scoring (верификатор ставит оценку каждому), list-wise (LLM видит все варианты сразу и выбирает лучший). List-wise уверенно победил и в мерджинге финальных ответов, и в верификации промежуточных шагов. Прямое сравнение вариантов оказалось эффективнее, чем независимая оценка каждого

✨Multi-agent diversity

микс из разных SOTA моделей (GPT-4.1 + Claude-3.5 + Claude-3.7 + Gemini-2.5-PRO) даёт Pass@4 = 74.55, что выше open-source SOTA. Разные модели хороши в разном. Кто-то лучше кодит, кто-то лучше с тулами, и в итоге ансамбль разнородных моделей покрывает больше кейсов, чем 4 копии одной модели

Статья разъеб. Пару моментиков есть чтобы забрать в экспы + пересекается с тем, что я буду рассказать на OpenTalks в конце февраля (об этом в следующем посте). Схожесть в проблематике и ее решении. Авторы по сути нашли, что credit assignment в мультистеповых агентах это ключевая проблема, и решают её на инференсе через selective reflection и list-wise verification. То же самое мы в команде решали на трене через умную группировку наград

📖Папир
🖥Код
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
🤏 LoRA всего с 13 параметрами!

В этой работе от известной запрещенной, как скоро весь телеграм, на территории РФ организации представлен метод, который доводит параметро-эффективное дообучение до абсурда: показано, что RL (в частности GRPO) способен раскрывать математическое рассуждение в LLM, обновляя всего 13 параметров Карл.

1) RL почти не требует ресурсов, чтобы работать. С GRPO на Qwen2.5-7B-Instruct 13 обучаемых параметров в bf16 дают 91% на GSM8K (базовый уровень — 76%). SFT при том же бюджете почти ничего не меняет.

2) Чем больше модель, тем она “программируемее” крошечными обновлениями. В статье показан чёткий тренд масштабирования: с ростом размера модели требуется всё меньше параметров, чтобы достичь 95% качества полного файнтюнинга. Модели на 7B нужно заметно меньше правок, чем модели на 3B, для той же задачи. Это намекает, что триллионные модели можно будет дообучать под конкретные задачи буквально парой байтов.

3) Техника основана на проекции крошечного обучаемого вектора через замороженные SVD-компоненты. Метод расширяет LoRA-XS: вместо обучаемой матрицы r×r используется вектор v, который проецируется через фиксированные случайные тензоры. В сочетании с шарингом весов между слоями это позволяет дойти вплоть до одного обучаемого параметра.
А вообще это все напоминает бородатый Extreme Learning.

4) Разрыв между SFT и RL при малой ёмкости — драматический. На GSM8K RL с 120 параметрами достигает 95% точности. SFT с тем же бюджетом — лишь 84%. При ещё меньших обновлениях разрыв только растёт. Авторы объясняют это с точки зрения теории информации: RL получает разреженный, но «чистый» сигнал (бинарную награду), тогда как SFT вынужден усваивать информацию всей последовательности, большая часть которой нерелевантна задаче.

5) Qwen2.5 стабильно требует примерно в 10 раз меньше параметров, чем Llama 3, для сопоставимого качества. При 1 параметре Qwen улучшает результат на 5% относительно базового, тогда как LLaMA почти не сдвигается. Авторы сами отмечают возможную контаминацию данных на этапе претрейнинга, а независимые исследования находили нетривиальное пересечение бенчмарков в обучающих данных Qwen.

Кода, как обычно, не дали.

@toshoseti
🤯3❤2
LLM вредно слишком много думать?

Британские Японские ученые утверждают, что если модель слишком увлекается размышлениями, то, вопреки ожиданиям, качество начинает деградировать из-за высокой дисперсии. С другой стороны наблюдается схожий процесс: слишком короткие размышления приводят к тому, что модель недокручивает вопрос и даёт неправильный ответ.

Каких-то выводов и предложений по исправлению не предлагается, поэтому за японских ученых предположу, что обучать, видимо нужно в два этапа: сначала давать модели вволю поисследовать разное поддерживая высокую энтропию, а потом уже учить в жестких constrained-сетапах с фиксированным бюджетом на токены.

Кажется, что даже в этом канале можно найти пару статей про такого рода обучение (например вчерашняя от NVIDIA), но общей практикой это пока не стало, интересно почему?

Источник: https://www.arxiv.org/abs/2602.09591.

@experimentality
👍3❤‍🔥1