LLM в задаче иерархической классификации
Есть такая задача — HTC (Hierarchical Text Classification). Суть её заключается в том, что мы по тексту предсказываем не один класс, а категорию из какой-то большой древообразной таксономии. Такое часто используется, например, на маркетплейсах, где у каждого товара есть несколько категорий разного уровня вложенности.
Так вот, исследователи из Amazon выяснили, что если дать LLM предварительно обработать таксономию, то результаты классификации на ней “бесплатно” улучшатся. Делается это достаточно прямолинейно: подаём LLM на вход граф категорий целиком и просим улучшить его с помощью операций переименования, изменения положения существующих вершин или их объединения, а также генерации новых промежуточных вершин и дуг. Основная цель этого этапа: сделать таксономию более понятной.
И таки да, после перепроверки человеком и бенчмаркинга оказывается, что обработанные таксономии выбивают на 3 п.п. больше на бенчмарках. Следующим шагом может быть выкатка таких категории на реальных пользователей и проведение UI/UX исследования, кажется может получиться интересно.
Источник: https://www.arxiv.org/abs/2601.18375.
Есть такая задача — HTC (Hierarchical Text Classification). Суть её заключается в том, что мы по тексту предсказываем не один класс, а категорию из какой-то большой древообразной таксономии. Такое часто используется, например, на маркетплейсах, где у каждого товара есть несколько категорий разного уровня вложенности.
Так вот, исследователи из Amazon выяснили, что если дать LLM предварительно обработать таксономию, то результаты классификации на ней “бесплатно” улучшатся. Делается это достаточно прямолинейно: подаём LLM на вход граф категорий целиком и просим улучшить его с помощью операций переименования, изменения положения существующих вершин или их объединения, а также генерации новых промежуточных вершин и дуг. Основная цель этого этапа: сделать таксономию более понятной.
И таки да, после перепроверки человеком и бенчмаркинга оказывается, что обработанные таксономии выбивают на 3 п.п. больше на бенчмарках. Следующим шагом может быть выкатка таких категории на реальных пользователей и проведение UI/UX исследования, кажется может получиться интересно.
Источник: https://www.arxiv.org/abs/2601.18375.
arXiv.org
Hierarchical Text Classification with LLM-Refined Taxonomies
Hierarchical text classification (HTC) depends on taxonomies that organize labels into structured hierarchies. However, many real-world taxonomies introduce ambiguities, such as identical leaf...
❤2🔥2
Forwarded from Neural Shit
Гугол выкатил новую фичу для Gemini 3 Flash - Agentic Vision.
Суть в том, что раньше нейронка смотрела на картинку один раз целиком и часто пропускала мелкие детали, а то и вообще галлюцинировала и придумывала себе то, чего на картинке нет. Теперь же это полноценный агентный процесс с циклом Think, Act, Observe.
Модель реально "разглядывает" изображение: она пишет и исполняет Python код, чтобы взаимодействовать с картинкой.
Что умеет:
— Активный зум: Если нейронка видит сложный чертеж или мелкий текст, она сама решит кропнуть нужный кусок, приблизить его и рассмотреть отдельно.
— Аннотации: Чтобы нормально посчитать объекты (например, пальцы на руке, лол), модель теперь рисует на них bounding box'ы и цифры прямо поверх изображения. Это помогает ей не сбиваться со счета.
— Визуальная математика: Видит таблицу -> пишет код -> строит нормальный график через Matplotlib, вместо того чтобы выдумывать цифры из своей кремниевой башки.
Обещают прирост качества на бенчах на 5-10%. Уже доступно через API иGoogle AI Studio.
тут подробнее
Суть в том, что раньше нейронка смотрела на картинку один раз целиком и часто пропускала мелкие детали, а то и вообще галлюцинировала и придумывала себе то, чего на картинке нет. Теперь же это полноценный агентный процесс с циклом Think, Act, Observe.
Модель реально "разглядывает" изображение: она пишет и исполняет Python код, чтобы взаимодействовать с картинкой.
Что умеет:
— Активный зум: Если нейронка видит сложный чертеж или мелкий текст, она сама решит кропнуть нужный кусок, приблизить его и рассмотреть отдельно.
— Аннотации: Чтобы нормально посчитать объекты (например, пальцы на руке, лол), модель теперь рисует на них bounding box'ы и цифры прямо поверх изображения. Это помогает ей не сбиваться со счета.
— Визуальная математика: Видит таблицу -> пишет код -> строит нормальный график через Matplotlib, вместо того чтобы выдумывать цифры из своей кремниевой башки.
Обещают прирост качества на бенчах на 5-10%. Уже доступно через API иGoogle AI Studio.
тут подробнее
👍5🔥4
Neural Shit
Гугол выкатил новую фичу для Gemini 3 Flash - Agentic Vision. Суть в том, что раньше нейронка смотрела на картинку один раз целиком и часто пропускала мелкие детали, а то и вообще галлюцинировала и придумывала себе то, чего на картинке нет. Теперь же это…
Open-source модель для умных очков и не только
Задача VQA (ответы на вопросы по изображению) на практике требует не только «посмотреть» на картинку, но и уметь внимательно анализировать её детали, а при необходимости — обращаться к внешним источникам информации. Исследователи из Meta* предлагают объединить agentic RAG и VLM, чтобы получить модель с такими возможностями.
Подход заключается в обучении модели активно взаимодействовать с внешним миром. Модель учат обращаться к интернет-поиску и самостоятельно решать, как именно формировать запрос: отправлять текст, использовать полное изображение или вырезать релевантный фрагмент (например, логотип автомобиля). Для этого её обучают генерировать специальные токены
Как итог: модель обученная таким образом показывает кратно лучшие результаты по сравнению с аналогами (+20%) и при этом меньше галлюцинирует. Код обещают в опенсорсе, так что скоро каждый сможет сделать себе очки как у робокопа.
* Признана экстремистской и запрещена не территории РФ
Источник: https://www.arxiv.org/abs/2601.19060.
@experimentality
Задача VQA (ответы на вопросы по изображению) на практике требует не только «посмотреть» на картинку, но и уметь внимательно анализировать её детали, а при необходимости — обращаться к внешним источникам информации. Исследователи из Meta* предлагают объединить agentic RAG и VLM, чтобы получить модель с такими возможностями.
Подход заключается в обучении модели активно взаимодействовать с внешним миром. Модель учат обращаться к интернет-поиску и самостоятельно решать, как именно формировать запрос: отправлять текст, использовать полное изображение или вырезать релевантный фрагмент (например, логотип автомобиля). Для этого её обучают генерировать специальные токены
<search> и корректно заполнять поля поискового запроса с помощью RL. В результате VLM начинает различать ситуации, когда ответ можно дать напрямую, когда достаточно текстового поиска, а когда требуется визуальный запрос по изображению или его части.Как итог: модель обученная таким образом показывает кратно лучшие результаты по сравнению с аналогами (+20%) и при этом меньше галлюцинирует. Код обещают в опенсорсе, так что скоро каждый сможет сделать себе очки как у робокопа.
* Признана экстремистской и запрещена не территории РФ
Источник: https://www.arxiv.org/abs/2601.19060.
@experimentality
arXiv.org
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
Visual Question Answering (VQA) often requires coupling fine-grained perception with factual knowledge beyond the input image. Prior multimodal Retrieval-Augmented Generation (MM-RAG) systems...
❤3🔥2
Эволюционный Deep Research дома
Думаю все уже привыкли пользоваться deep research, когда необходимо быстро погрузиться в какую-то тему, но обычно это какие-то проприетарные системы, которые непонятно как работают. А вот паренёк из Google взял и написал свою систему, которая побивает аналоги от Anthropic, Perplexity, Grok и NVIDIA.
В его подходе можно выделить два ключевых момента. Первая — перепланировщик. Модель не следует фиксированному плану, после каждого шага она вольна изменить его на основе новых вводных. Вторая — генерация нескольких кандидатов, как в эволюционных алгоритмах и объединение их в один ответ: на каждом шаге LLM запускается 3 раза с разными параметрами temperature и top_k, затем 3 ответа агрегируются в один и алгоритм продолжается.
Контролирует это всё дело критик, который после каждого шага проверяет насколько модель близка к ответу и если всё ок — подпускает модель к генерации финального отчёта. Кажется, что эти фишки можно внедрить в большое количество агентов, благо код выложен в opensource, так что бегом за дело!
Источник: https://www.arxiv.org/abs/2601.20843.
@experimentality
Думаю все уже привыкли пользоваться deep research, когда необходимо быстро погрузиться в какую-то тему, но обычно это какие-то проприетарные системы, которые непонятно как работают. А вот паренёк из Google взял и написал свою систему, которая побивает аналоги от Anthropic, Perplexity, Grok и NVIDIA.
В его подходе можно выделить два ключевых момента. Первая — перепланировщик. Модель не следует фиксированному плану, после каждого шага она вольна изменить его на основе новых вводных. Вторая — генерация нескольких кандидатов, как в эволюционных алгоритмах и объединение их в один ответ: на каждом шаге LLM запускается 3 раза с разными параметрами temperature и top_k, затем 3 ответа агрегируются в один и алгоритм продолжается.
Контролирует это всё дело критик, который после каждого шага проверяет насколько модель близка к ответу и если всё ок — подпускает модель к генерации финального отчёта. Кажется, что эти фишки можно внедрить в большое количество агентов, благо код выложен в opensource, так что бегом за дело!
Источник: https://www.arxiv.org/abs/2601.20843.
@experimentality
arXiv.org
Deep Researcher with Sequential Plan Reflection and Candidates...
This paper introduces a novel Deep Researcher architecture designed to generate detailed research reports on complex PhD level topics by addressing the inherent limitations of the Parallel Scaling...
❤3
Сегодня, в честь пятницы, попробуем новый формат, посмотрим как зайдёт
Планирование в латентном пространстве.
Авторы работы PILOT предлагают, вместо планирования, с которым маленькие модели справляются из рук вон плохо, обучить адаптер, задистиленный из большой модели, который будет по задаче генерировать steering vector, который будет направлять маленькую модель в сторону верного решения с минимальными вычислительными затратами на инференсе. Итог: прирост на широком спектре математических и кодовых бенчей.
Источник: https://www.arxiv.org/abs/2601.19917.
Оптимизация через поиск первой ошибки.
Верифицировать каждый шаг в траектории очень дорого, поэтому предлагается сконцентрироваться только на первом ошибочном шаге. После того, как шаг подтверждается как действительно ошибочный модель верификатор обучают признавать его и всё, что после него ошибочным, а всё что до — корректным. Финальное качество сравнимо с проверкой каждого шага, но затраты ресурсов кратно меньше.
Источник: https://www.arxiv.org/abs/2601.20312.
Поиск по дереву во время обучения.
Вместо равномерного распределения вычислительного бюджета на каждый шаг, SPARK использует “умное” ветвление в критических точках, которые модель сама и определяет. Затем, считаем награду в листьях и на этом запускаем GRPO. Такой подход получается точнее обычного GRPO, где сэмплируют независимые траектории, благодаря более гранулярному фидбеку. Ну и результаты на бенчах лучше!
Источник: https://www.arxiv.org/abs/2601.20209.
@experimentality
Планирование в латентном пространстве.
Авторы работы PILOT предлагают, вместо планирования, с которым маленькие модели справляются из рук вон плохо, обучить адаптер, задистиленный из большой модели, который будет по задаче генерировать steering vector, который будет направлять маленькую модель в сторону верного решения с минимальными вычислительными затратами на инференсе. Итог: прирост на широком спектре математических и кодовых бенчей.
Источник: https://www.arxiv.org/abs/2601.19917.
Оптимизация через поиск первой ошибки.
Верифицировать каждый шаг в траектории очень дорого, поэтому предлагается сконцентрироваться только на первом ошибочном шаге. После того, как шаг подтверждается как действительно ошибочный модель верификатор обучают признавать его и всё, что после него ошибочным, а всё что до — корректным. Финальное качество сравнимо с проверкой каждого шага, но затраты ресурсов кратно меньше.
Источник: https://www.arxiv.org/abs/2601.20312.
Поиск по дереву во время обучения.
Вместо равномерного распределения вычислительного бюджета на каждый шаг, SPARK использует “умное” ветвление в критических точках, которые модель сама и определяет. Затем, считаем награду в листьях и на этом запускаем GRPO. Такой подход получается точнее обычного GRPO, где сэмплируют независимые траектории, благодаря более гранулярному фидбеку. Ну и результаты на бенчах лучше!
Источник: https://www.arxiv.org/abs/2601.20209.
@experimentality
arXiv.org
PILOT: Planning via Internalized Latent Optimization Trajectories...
Strategic planning is critical for multi-step reasoning, yet compact Large Language Models (LLMs) often lack the capacity to formulate global strategies, leading to error propagation in...
🔥5
Forwarded from gonzo-обзоры ML статей
Интересная работа. Некоторым моделям учить проще, чем делать самим :)
В целом красивый подход, жаль что вычислительно тяжёлый. Модель-учитель создаёт куррикулум для ученика, помогая ему решить неизвестные сложные задачи, которые сходу решить нельзя. Примеры учителя может и странные, но работают. Что-то в этом есть. Так и до сатори недалеко.
Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe
Статья: https://arxiv.org/abs/2601.18778
Ревью: https://arxiviq.substack.com/p/teaching-models-to-teach-themselves
Code: N/A
# TL;DR
ЧТО сделали: Авторы представили SOAR (Self-Optimization via Asymmetric RL) — фреймворк двухуровневого meta-RL, где модель-«учитель» генерирует синтетические задачи для обучения модели-«ученика». В отличие от классического self-play, оптимизирующего исход игры, или внутренней любознательности, здесь учитель получает награду исключительно за реальный прогресс ученика на наборе заведомо нерешаемых сложных задач.
ПОЧЕМУ это важно: Подход решает проблему «холодного старта» в RLVR (RL с проверяемыми наградами). Когда модель имеет 0% успеха на сложных задачах, градиенту просто неоткуда взяться. SOAR доказывает, что у моделей есть скрытые «педагогические» способности (отличные от умения решать задачи), которые можно прокачать через meta-RL. Это позволяет создавать автоматические curriculum learning планы, по которым ученик добирается до решений, ранее недоступных без размеченных человеком данных.
Подробнее: https://t.me/gonzo_ML_podcasts/2256
В целом красивый подход, жаль что вычислительно тяжёлый. Модель-учитель создаёт куррикулум для ученика, помогая ему решить неизвестные сложные задачи, которые сходу решить нельзя. Примеры учителя может и странные, но работают. Что-то в этом есть. Так и до сатори недалеко.
Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe
Статья: https://arxiv.org/abs/2601.18778
Ревью: https://arxiviq.substack.com/p/teaching-models-to-teach-themselves
Code: N/A
# TL;DR
ЧТО сделали: Авторы представили SOAR (Self-Optimization via Asymmetric RL) — фреймворк двухуровневого meta-RL, где модель-«учитель» генерирует синтетические задачи для обучения модели-«ученика». В отличие от классического self-play, оптимизирующего исход игры, или внутренней любознательности, здесь учитель получает награду исключительно за реальный прогресс ученика на наборе заведомо нерешаемых сложных задач.
ПОЧЕМУ это важно: Подход решает проблему «холодного старта» в RLVR (RL с проверяемыми наградами). Когда модель имеет 0% успеха на сложных задачах, градиенту просто неоткуда взяться. SOAR доказывает, что у моделей есть скрытые «педагогические» способности (отличные от умения решать задачи), которые можно прокачать через meta-RL. Это позволяет создавать автоматические curriculum learning планы, по которым ученик добирается до решений, ранее недоступных без размеченных человеком данных.
Подробнее: https://t.me/gonzo_ML_podcasts/2256
arXiv.org
Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
RL methods for scaling large reasoning models stall on datasets with low initial success rates, and thus little training signal. We investigate a fundamental question: Can a pretrained LLM...
👍5
Forwarded from gonzo-обзоры ML статей
Сейчас одновременно вышло сразу несколько работ про само-дистилляцию, эта одна из них. Работа любопытная, в ней сразу несколько идей. Во-первых, проблема RLVR с бинарными наградами снимается, если смотреть не только на итоговую награду, но и на логи ошибок в процессе (тот же компилятор много чего полезного говорит кроме "удалось" или нет). Это называется RLRF (Reinforcement Learning with Rich Feedback). Во-вторых, собственно дистилляция от себя же, но с дополнительным промптом в виде этих логов. В-третьих, предложен очередной подход к TTT, Test-Time Self-Distillation, когда модель на одном тестовом запросе генерит варианты и пытается дообучиться через такую вот дистилляцию. Перекликается, например, с недавним TTT-Discover. И ещё прикольно, что показали про многословность GRPO — можно получать такой же результат с сильно меньшим количеством токенов, GRPO просто забалтывает в защитных целях, это по сути reward hacking.
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause
Статья: https://arxiv.org/abs/2601.20802
Ревью: https://arxiviq.substack.com/p/reinforcement-learning-via-self-distillation
Код: https://github.com/lasgroup/SDPO
# TL;DR
ЧТО сделали: Предложили SDPO (Self-Distillation Policy Optimization) — алгоритм онлайн-обучения с подкреплением, который использует «богатый фидбек» (ошибки компилятора, логи юнит-тестов) вместо разреженных скалярных наград. Вместо внешнего учителя или reward model, SDPO использует *саму текущую политику*, обусловленную полученным фидбеком и исходным вопросом, в роли «само-учителя» (Self-Teacher). Этот механизм ретроспективно оценивает попытку модели и дистиллирует скорректированные вероятности токенов обратно в политику.
ПОЧЕМУ это важно: Подход решает проблему назначение вклада (credit assignment), присущую современным методам RLVR (Reinforcement Learning with Verifiable Rewards). Преобразование неструктурированного текстового фидбека в плотные градиенты на уровне токенов позволяет моделям самообучаться значительно быстрее без использования GPT-4 в качестве учителя. Эмпирически метод достигает SOTA точности, требуя в 4 раза меньше генераций, чем сильные бейзлайны, и при этом избавляет модель от излишней многословности (reward hacking), часто наблюдаемой у рассуждающих моделей.
Подробнее: https://t.me/gonzo_ML_podcasts/2270
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause
Статья: https://arxiv.org/abs/2601.20802
Ревью: https://arxiviq.substack.com/p/reinforcement-learning-via-self-distillation
Код: https://github.com/lasgroup/SDPO
# TL;DR
ЧТО сделали: Предложили SDPO (Self-Distillation Policy Optimization) — алгоритм онлайн-обучения с подкреплением, который использует «богатый фидбек» (ошибки компилятора, логи юнит-тестов) вместо разреженных скалярных наград. Вместо внешнего учителя или reward model, SDPO использует *саму текущую политику*, обусловленную полученным фидбеком и исходным вопросом, в роли «само-учителя» (Self-Teacher). Этот механизм ретроспективно оценивает попытку модели и дистиллирует скорректированные вероятности токенов обратно в политику.
ПОЧЕМУ это важно: Подход решает проблему назначение вклада (credit assignment), присущую современным методам RLVR (Reinforcement Learning with Verifiable Rewards). Преобразование неструктурированного текстового фидбека в плотные градиенты на уровне токенов позволяет моделям самообучаться значительно быстрее без использования GPT-4 в качестве учителя. Эмпирически метод достигает SOTA точности, требуя в 4 раза меньше генераций, чем сильные бейзлайны, и при этом избавляет модель от излишней многословности (reward hacking), часто наблюдаемой у рассуждающих моделей.
Подробнее: https://t.me/gonzo_ML_podcasts/2270
Telegram
gonzo_ML_podcasts
Превращаем логи ошибок в градиенты: SDPO
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas…
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas…
❤1
Forwarded from Data Blog
Activation Oracles
[paper]
Каждый раз, просто каждый раз, когда я читаю статью от Antropic хочется замирать от гениальности. Кому отдать душу, чтобы быть таким же креативным?
19 декабря у них вышла работа про Activation Oracles — подход, который позволяет читать скрытые состояния языковой модели, не анализируя веса и используя естественный язык. И если вы уже на этом месте подумали, что они просто используют для этого другую LLM — вы правы! Но зато как они это делают!
Основная гипотеза работы, как я вижу состоит в том, что:
если две модели имеют сходные представления, то одна модель может интерпретировать внутренние активации другой.
Эта мысль круто ложится на Platonic representation hyphothesis — Neural networks, trained with different objectives on different data and modalities, are converging to a shared statistical model of reality in their representation spaces.
Что делаем(это могли бы быть мы с тобой, но мы не такие умные):
Берём:
* целевую модель M,
* модель-оракул AO, которая изначально является её ctrl-C-копией,
* извлекаем активации M (из residual stream),
* и прокидываем их, используя steering, в граф оракула AO — тоже как направленное возмущение residual stream.
Дальше просто задаём промт-вопрос, вроде «О чём сейчас думает модель?», «Какова её цель?», «Есть ли здесь скрытое знание?». И оракул отвечает, причем хорошо — например, может вытащить секретное слово модели, даже если она сама не отдала его в ответе.
Идея засунуть активации в LLM не нова:
Был (есть) LatentQA, где активации подаются внешне — как дополнительный вход. Но здесь же активации встраиваются внутрь forward-pass, влияя на дальнейшие вычисления. И это же просто гениально.
Что ещё вкусного — всё, что я словами отдала как output, можно потыкать в приложенном к статье коде.
Туториал:
[collab]
Я перевела его с некоторой отсебятиной и постановкой задачи. Перевела только основной текст, комментарии коду уж оставлены родными. В нем можно увидеть:
1. Многошаговое рассуждение
Оракул по токенам извлекает цепочку Socrates → Plato → Aristotle на активациях модели.
2. Извлечение секретного слова
Модель дообучена скрывать слово — напрямую она его не называет.
Оракул извлекает его только из активаций (репликация Figure 1 из статьи).
3. Обнаружение мисалайнмента
Можно выявить, что модель обучена давать манипулятивные или вредные советы.
4. Трекинг эмоций модели (и у нее они есть)
По одному вектору на токен оракул отслеживает Disappointment, Anger, Frustration, Sadness на протяжении диалога.
Ограничения:
После радостного восторга, холодной головой также важно понимать, что оракул может додумывать и не может показать то, чего мы не спрашиваем. Кроме того, это не самая вычислительно оптимальная вещь — чтобы ответить на один вопрос об активации, AO требуется несколько forward-pass’ов и полноценная генерация текста.
Но красиво. Тыкайте на здоровье и делитесь впечатлениями!
[paper]
Каждый раз, просто каждый раз, когда я читаю статью от Antropic хочется замирать от гениальности. Кому отдать душу, чтобы быть таким же креативным?
19 декабря у них вышла работа про Activation Oracles — подход, который позволяет читать скрытые состояния языковой модели, не анализируя веса и используя естественный язык. И если вы уже на этом месте подумали, что они просто используют для этого другую LLM — вы правы! Но зато как они это делают!
Основная гипотеза работы, как я вижу состоит в том, что:
если две модели имеют сходные представления, то одна модель может интерпретировать внутренние активации другой.
Эта мысль круто ложится на Platonic representation hyphothesis — Neural networks, trained with different objectives on different data and modalities, are converging to a shared statistical model of reality in their representation spaces.
Что делаем
Берём:
* целевую модель M,
* модель-оракул AO, которая изначально является её ctrl-C-копией,
* извлекаем активации M (из residual stream),
* и прокидываем их, используя steering, в граф оракула AO — тоже как направленное возмущение residual stream.
Дальше просто задаём промт-вопрос, вроде «О чём сейчас думает модель?», «Какова её цель?», «Есть ли здесь скрытое знание?». И оракул отвечает, причем хорошо — например, может вытащить секретное слово модели, даже если она сама не отдала его в ответе.
Идея засунуть активации в LLM не нова:
Был (есть) LatentQA, где активации подаются внешне — как дополнительный вход. Но здесь же активации встраиваются внутрь forward-pass, влияя на дальнейшие вычисления. И это же просто гениально.
Что ещё вкусного — всё, что я словами отдала как output, можно потыкать в приложенном к статье коде.
Туториал:
[collab]
Я перевела его с некоторой отсебятиной и постановкой задачи. Перевела только основной текст, комментарии коду уж оставлены родными. В нем можно увидеть:
1. Многошаговое рассуждение
Оракул по токенам извлекает цепочку Socrates → Plato → Aristotle на активациях модели.
2. Извлечение секретного слова
Модель дообучена скрывать слово — напрямую она его не называет.
Оракул извлекает его только из активаций (репликация Figure 1 из статьи).
3. Обнаружение мисалайнмента
Можно выявить, что модель обучена давать манипулятивные или вредные советы.
4. Трекинг эмоций модели (и у нее они есть)
По одному вектору на токен оракул отслеживает Disappointment, Anger, Frustration, Sadness на протяжении диалога.
Ограничения:
После радостного восторга, холодной головой также важно понимать, что оракул может додумывать и не может показать то, чего мы не спрашиваем. Кроме того, это не самая вычислительно оптимальная вещь — чтобы ответить на один вопрос об активации, AO требуется несколько forward-pass’ов и полноценная генерация текста.
Но красиво. Тыкайте на здоровье и делитесь впечатлениями!
🔥4
Вашим моделям нужно тренироваться на тесте
Как поступает усердный школьник, если у него не получается решить задачу?Гуглит решение Разбирает задачки на ту же тему, но попроще, пока не поймёт какие-то ключевые идеи необходимые для решения оригинальной задачи. Вот тоже самое предлагается делать во время test-time.
В обычном Test Time RL (TTRL) LLM обучают сразу на задачах из бенча, для которых в качестве ответа берётся вариант, наиболее часто встречающийся в ответах модели. Но для сложных задач такой подход, очевидно, не работает, так как псевдо-метки часто оказываются неправильными.
Здесь же предлагается на основе задач из бенча синтезировать ряд задач попроще и дообучаться в той же парадигме уже на них. Логика следующая: на простых задачах majority voting чаще будет давать правильные ответы и это выльется в нормальный сигнал для обучения.
При этом модель для синтеза вопросов также проходит через несколько итераций улучшений, что приводит к ещё лучшему качеству вопросов и, как следствие, качеству финальной модели солвера.
На бенчах, конечно, метод рвёт всё, с чем сравнивается, но и вычислительные затраты на это все не хилые. Однако это всё может оказаться worth-it, если получится с помощью заскейленной версии такого обучения решить какую-нибудь действительно сложную задачу, которая не поддаётся людям.
Источник: https://www.arxiv.org/abs/2601.22628.
@experimentality
Как поступает усердный школьник, если у него не получается решить задачу?
В обычном Test Time RL (TTRL) LLM обучают сразу на задачах из бенча, для которых в качестве ответа берётся вариант, наиболее часто встречающийся в ответах модели. Но для сложных задач такой подход, очевидно, не работает, так как псевдо-метки часто оказываются неправильными.
Здесь же предлагается на основе задач из бенча синтезировать ряд задач попроще и дообучаться в той же парадигме уже на них. Логика следующая: на простых задачах majority voting чаще будет давать правильные ответы и это выльется в нормальный сигнал для обучения.
При этом модель для синтеза вопросов также проходит через несколько итераций улучшений, что приводит к ещё лучшему качеству вопросов и, как следствие, качеству финальной модели солвера.
На бенчах, конечно, метод рвёт всё, с чем сравнивается, но и вычислительные затраты на это все не хилые. Однако это всё может оказаться worth-it, если получится с помощью заскейленной версии такого обучения решить какую-нибудь действительно сложную задачу, которая не поддаётся людям.
Источник: https://www.arxiv.org/abs/2601.22628.
@experimentality
arXiv.org
TTCS: Test-Time Curriculum Synthesis for Self-Evolving
Test-Time Training offers a promising way to improve the reasoning ability of large language models (LLMs) by adapting the model using only the test questions. However, existing methods struggle...
🔥4
Forwarded from Нейронавт | Нейросети в творчестве
PaperBanana: Automating Academic Illustration for AI Scientists
Генерилка иллюстрации для научных работ от Гугл, конкурент опенсорсного SciGenBench
Работает как команда из пяти агентов: один ищет примеры, другой планирует содержание, третий задаёт стиль, четвёртый превращает текст в картинки, а пятый проверяет и улучшает результат
Гитхаб - вот гитхаб пустой, он предмет простой
#text2image
Генерилка иллюстрации для научных работ от Гугл, конкурент опенсорсного SciGenBench
Работает как команда из пяти агентов: один ищет примеры, другой планирует содержание, третий задаёт стиль, четвёртый превращает текст в картинки, а пятый проверяет и улучшает результат
Гитхаб - вот гитхаб пустой, он предмет простой
#text2image
🤣4
Forwarded from gonzo-обзоры ML статей
Фильтрация на уровне токенов при обучении даёт сильно более безопасные модели, чем другие способы.
Shaping capabilities with token-level data filtering
Neil Rathi, Alec Radford
Статья: https://arxiv.org/abs/2601.21571
Ревью: https://arxiviq.substack.com/p/shaping-capabilities-with-token-level
Код: https://github.com/neilrathi/token-filtering
Модель: Custom Transformers (up to 1.8B)
# TL;DR
ЧТО сделали: Предложили метод потокенной фильтрации данных (token-level data filtering) для хирургического удаления конкретных способностей модели (на примере медицинских знаний) на этапе предобучения. Обучая легковесные классификаторы находить и маскировать специфические токены, авторы не дают модели выучивать опасные концепты, сохраняя при этом соседние общие знания.
ПОЧЕМУ это важно: Это сдвиг парадигмы от безопасности "постфактум" (RLHF/Unlearning) к безопасности "ab initio" (изначальной). Результаты впечатляют: потокенная фильтрация масштабируется значительно лучше, чем удаление целых документов, создавая замедление в 7000 раз (по вычислительным затратам), необходимое модели для повторного обретения забытых знаний на масштабе 1.8B параметров. Кроме того, среди авторов — Алек Рэдфорд (создатель GPT-2 и GPT-3), что сигнализирует о серьезном повороте индустрии в сторону курирования данных как главного рычага безопасности.
Подробнее: https://t.me/gonzo_ML_podcasts/2319
Shaping capabilities with token-level data filtering
Neil Rathi, Alec Radford
Статья: https://arxiv.org/abs/2601.21571
Ревью: https://arxiviq.substack.com/p/shaping-capabilities-with-token-level
Код: https://github.com/neilrathi/token-filtering
Модель: Custom Transformers (up to 1.8B)
# TL;DR
ЧТО сделали: Предложили метод потокенной фильтрации данных (token-level data filtering) для хирургического удаления конкретных способностей модели (на примере медицинских знаний) на этапе предобучения. Обучая легковесные классификаторы находить и маскировать специфические токены, авторы не дают модели выучивать опасные концепты, сохраняя при этом соседние общие знания.
ПОЧЕМУ это важно: Это сдвиг парадигмы от безопасности "постфактум" (RLHF/Unlearning) к безопасности "ab initio" (изначальной). Результаты впечатляют: потокенная фильтрация масштабируется значительно лучше, чем удаление целых документов, создавая замедление в 7000 раз (по вычислительным затратам), необходимое модели для повторного обретения забытых знаний на масштабе 1.8B параметров. Кроме того, среди авторов — Алек Рэдфорд (создатель GPT-2 и GPT-3), что сигнализирует о серьезном повороте индустрии в сторону курирования данных как главного рычага безопасности.
Подробнее: https://t.me/gonzo_ML_podcasts/2319
arXiv.org
Shaping capabilities with token-level data filtering
Current approaches to reducing undesired capabilities in language models are largely post hoc, and can thus be easily bypassed by adversaries. A natural alternative is to shape capabilities during...
🔥5
Оказывается, что если добавить tie-breaker в GRPO для ответов с одинаковыми значениями correctness reward (например выбирать ответ с наименьшей длиной), то метод будет работать лучше. Ну и в целом рекомендуют переходить на relative оценку (первое, второе, третье место и тд) вместо абсолютных значений награды, так как это делает обучение стабильнее, хотя это.
Источник: https://www.arxiv.org/abs/2601.23058.
@experimentality
Источник: https://www.arxiv.org/abs/2601.23058.
@experimentality
arXiv.org
From Absolute to Relative: Rethinking Reward Shaping in...
Reinforcement learning has become a cornerstone for enhancing the reasoning capabilities of Large Language Models, where group-based approaches such as GRPO have emerged as efficient paradigms...
👍3🤯3
Forwarded from Just links
BabyVision: Visual Reasoning Beyond Language https://unipat.ai/blog/BabyVision
UniPat AI
BabyVision: Visual Reasoning Beyond Language
State-of-the-art MLLMs achieve PhD-level language reasoning but struggle with visual tasks that 3-year-olds solve effortlessly. We introduce BabyVision, a benchmark revealing the infancy of AI vision.
😢2
Как использовать текстовый фидбек в RL?
RLVR выглядит неинтуитивно с человеческой точки зрения: если человек ошибается, ему обычно объясняют почему, тогда как в RLVR модель получает лишь бинарный сигнал (1 бит информации) — верно или неверно. Авторы предлагают заменить этот минимальный сигнал на текстовый фидбек.
Процесс устроен так: сначала модель генерирует rollout, затем LLM-критик выдаёт текстовое объяснение ошибок, после чего на основе исходного решения и критики строится улучшенный rollout. Далее возможны два варианта обучения: либо использовать RL непосредственно на улучшенном решении, либо применять SFT и учить модель предсказывать фидбек критика.
Проверяли, конечно, на математике, в зависимости от бенча получается либо лучше, либо на уровне с проверенными бейзлайнами (GRPO, DAPO, какие-то фидбек методы). Что интересно, в качестве фидбека в формальных системах можно брать не только LLM, но и ошибки компилятора, линтера и так далее. Короче просто для дальнейших исследований невероятный.
Источник: https://www.arxiv.org/abs/2602.02482.
@experimentality
RLVR выглядит неинтуитивно с человеческой точки зрения: если человек ошибается, ему обычно объясняют почему, тогда как в RLVR модель получает лишь бинарный сигнал (1 бит информации) — верно или неверно. Авторы предлагают заменить этот минимальный сигнал на текстовый фидбек.
Процесс устроен так: сначала модель генерирует rollout, затем LLM-критик выдаёт текстовое объяснение ошибок, после чего на основе исходного решения и критики строится улучшенный rollout. Далее возможны два варианта обучения: либо использовать RL непосредственно на улучшенном решении, либо применять SFT и учить модель предсказывать фидбек критика.
Проверяли, конечно, на математике, в зависимости от бенча получается либо лучше, либо на уровне с проверенными бейзлайнами (GRPO, DAPO, какие-то фидбек методы). Что интересно, в качестве фидбека в формальных системах можно брать не только LLM, но и ошибки компилятора, линтера и так далее. Короче просто для дальнейших исследований невероятный.
Источник: https://www.arxiv.org/abs/2602.02482.
@experimentality
arXiv.org
Expanding the Capabilities of Reinforcement Learning via Text Feedback
The success of RL for LLM post-training stems from an unreasonably uninformative source: a single bit of information per rollout as binary reward or preference label. At the other extreme,...
❤3👍2
Forwarded from что-то на DL-ском
А ЧТО БУДЕТ ЕСЛИ ДАТЬ АГЕНТУ ПОДУМАТЬ ПОДОЛЬШЕ?
Scaling Test-time Compute for LLM Agents
Первое систематическое исследование test-time scaling для языковых агентов. Не для LLM на задачках по математике, а прям для агентов с тулами, мультистепами и тд. Тестировали на GAIA бенчмарке (165 задач, 3 уровня сложности), базовая модель GPT-4.1
Суть проблемы в том, что обычные LLM BoN работают тривиально (сгенерил N ответов, выбрал лучший). В агентах всё сложнее. У нас есть цепочка шагов, ошибки накапливаются, и если ты рандомно генеришь N ответов на каждом шагу, можешь только навредить
Что пробовали и что нашли:
✨ Parallel sampling
BoN, BoN-wise (посттеповый), Beam Search, DVTS. BoN победил всех с 63.03 (baseline 55.76). НО на самых сложных задачах (level 3) лучше всех оказался BoN-wise (38.46), потому что он расширяет пространство поиска на каждом шаге решения, а не просто перезапускает всю траекторию. Beam Search и DVTS почти не дали прироста потому что зависят от точности верификатора при прунинге
✨ Рефлексия
вот тут самое вкусное. Сделали модель RefM, которая суммаризирует предыдущие шаги и подсказывает агенту. Рефлексия НА КАЖДОМ ШАГЕ слегка УХУДШИЛА результат (55.15 vs 55.76). Модель сбивается с мысли от постоянного самоанализа. Но если рефлексировать только на плохих шагах (score < 2) результат растёт до 56.36.
Цитата из статьи, которую я выделила, пока читала: knowing when to reflect is more important than reflecting at every step.
✨ Мерджинг результатов
Тестили три подхода: voting (голосовалка большинством), scoring (верификатор ставит оценку каждому), list-wise (LLM видит все варианты сразу и выбирает лучший). List-wise уверенно победил и в мерджинге финальных ответов, и в верификации промежуточных шагов. Прямое сравнение вариантов оказалось эффективнее, чем независимая оценка каждого
✨ Multi-agent diversity
микс из разных SOTA моделей (GPT-4.1 + Claude-3.5 + Claude-3.7 + Gemini-2.5-PRO) даёт Pass@4 = 74.55, что выше open-source SOTA. Разные модели хороши в разном. Кто-то лучше кодит, кто-то лучше с тулами, и в итоге ансамбль разнородных моделей покрывает больше кейсов, чем 4 копии одной модели
Статья разъеб. Пару моментиков есть чтобы забрать в экспы + пересекается с тем, что я буду рассказать на OpenTalks в конце февраля (об этом в следующем посте). Схожесть в проблематике и ее решении. Авторы по сути нашли, что credit assignment в мультистеповых агентах это ключевая проблема, и решают её на инференсе через selective reflection и list-wise verification. То же самое мы в команде решали на трене через умную группировку наград
📖 Папир
🖥 Код
Scaling Test-time Compute for LLM Agents
Первое систематическое исследование test-time scaling для языковых агентов. Не для LLM на задачках по математике, а прям для агентов с тулами, мультистепами и тд. Тестировали на GAIA бенчмарке (165 задач, 3 уровня сложности), базовая модель GPT-4.1
Суть проблемы в том, что обычные LLM BoN работают тривиально (сгенерил N ответов, выбрал лучший). В агентах всё сложнее. У нас есть цепочка шагов, ошибки накапливаются, и если ты рандомно генеришь N ответов на каждом шагу, можешь только навредить
Что пробовали и что нашли:
BoN, BoN-wise (посттеповый), Beam Search, DVTS. BoN победил всех с 63.03 (baseline 55.76). НО на самых сложных задачах (level 3) лучше всех оказался BoN-wise (38.46), потому что он расширяет пространство поиска на каждом шаге решения, а не просто перезапускает всю траекторию. Beam Search и DVTS почти не дали прироста потому что зависят от точности верификатора при прунинге
вот тут самое вкусное. Сделали модель RefM, которая суммаризирует предыдущие шаги и подсказывает агенту. Рефлексия НА КАЖДОМ ШАГЕ слегка УХУДШИЛА результат (55.15 vs 55.76). Модель сбивается с мысли от постоянного самоанализа. Но если рефлексировать только на плохих шагах (score < 2) результат растёт до 56.36.
Цитата из статьи, которую я выделила, пока читала: knowing when to reflect is more important than reflecting at every step.
Тестили три подхода: voting (голосовалка большинством), scoring (верификатор ставит оценку каждому), list-wise (LLM видит все варианты сразу и выбирает лучший). List-wise уверенно победил и в мерджинге финальных ответов, и в верификации промежуточных шагов. Прямое сравнение вариантов оказалось эффективнее, чем независимая оценка каждого
микс из разных SOTA моделей (GPT-4.1 + Claude-3.5 + Claude-3.7 + Gemini-2.5-PRO) даёт Pass@4 = 74.55, что выше open-source SOTA. Разные модели хороши в разном. Кто-то лучше кодит, кто-то лучше с тулами, и в итоге ансамбль разнородных моделей покрывает больше кейсов, чем 4 копии одной модели
Статья разъеб. Пару моментиков есть чтобы забрать в экспы + пересекается с тем, что я буду рассказать на OpenTalks в конце февраля (об этом в следующем посте). Схожесть в проблематике и ее решении. Авторы по сути нашли, что credit assignment в мультистеповых агентах это ключевая проблема, и решают её на инференсе через selective reflection и list-wise verification. То же самое мы в команде решали на трене через умную группировку наград
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Forwarded from То шо нейросети
🤏 LoRA всего с 13 параметрами!
В этой работе от известной запрещенной, как скоро весь телеграм, на территории РФ организации представлен метод, который доводит параметро-эффективное дообучение до абсурда: показано, что RL (в частности GRPO) способен раскрывать математическое рассуждение в LLM, обновляя всего 13 параметров Карл.
1) RL почти не требует ресурсов, чтобы работать. С GRPO на Qwen2.5-7B-Instruct 13 обучаемых параметров в bf16 дают 91% на GSM8K (базовый уровень — 76%). SFT при том же бюджете почти ничего не меняет.
2) Чем больше модель, тем она “программируемее” крошечными обновлениями. В статье показан чёткий тренд масштабирования: с ростом размера модели требуется всё меньше параметров, чтобы достичь 95% качества полного файнтюнинга. Модели на 7B нужно заметно меньше правок, чем модели на 3B, для той же задачи. Это намекает, что триллионные модели можно будет дообучать под конкретные задачи буквально парой байтов.
3) Техника основана на проекции крошечного обучаемого вектора через замороженные SVD-компоненты. Метод расширяет LoRA-XS: вместо обучаемой матрицы r×r используется вектор v, который проецируется через фиксированные случайные тензоры. В сочетании с шарингом весов между слоями это позволяет дойти вплоть до одного обучаемого параметра.
А вообще это все напоминает бородатый Extreme Learning.
4) Разрыв между SFT и RL при малой ёмкости — драматический. На GSM8K RL с 120 параметрами достигает 95% точности. SFT с тем же бюджетом — лишь 84%. При ещё меньших обновлениях разрыв только растёт. Авторы объясняют это с точки зрения теории информации: RL получает разреженный, но «чистый» сигнал (бинарную награду), тогда как SFT вынужден усваивать информацию всей последовательности, большая часть которой нерелевантна задаче.
5) Qwen2.5 стабильно требует примерно в 10 раз меньше параметров, чем Llama 3, для сопоставимого качества. При 1 параметре Qwen улучшает результат на 5% относительно базового, тогда как LLaMA почти не сдвигается. Авторы сами отмечают возможную контаминацию данных на этапе претрейнинга, а независимые исследования находили нетривиальное пересечение бенчмарков в обучающих данных Qwen.
Кода, как обычно, не дали.
@toshoseti
В этой работе от известной запрещенной, как скоро весь телеграм, на территории РФ организации представлен метод, который доводит параметро-эффективное дообучение до абсурда: показано, что RL (в частности GRPO) способен раскрывать математическое рассуждение в LLM, обновляя всего 13 параметров Карл.
1) RL почти не требует ресурсов, чтобы работать. С GRPO на Qwen2.5-7B-Instruct 13 обучаемых параметров в bf16 дают 91% на GSM8K (базовый уровень — 76%). SFT при том же бюджете почти ничего не меняет.
2) Чем больше модель, тем она “программируемее” крошечными обновлениями. В статье показан чёткий тренд масштабирования: с ростом размера модели требуется всё меньше параметров, чтобы достичь 95% качества полного файнтюнинга. Модели на 7B нужно заметно меньше правок, чем модели на 3B, для той же задачи. Это намекает, что триллионные модели можно будет дообучать под конкретные задачи буквально парой байтов.
3) Техника основана на проекции крошечного обучаемого вектора через замороженные SVD-компоненты. Метод расширяет LoRA-XS: вместо обучаемой матрицы r×r используется вектор v, который проецируется через фиксированные случайные тензоры. В сочетании с шарингом весов между слоями это позволяет дойти вплоть до одного обучаемого параметра.
А вообще это все напоминает бородатый Extreme Learning.
4) Разрыв между SFT и RL при малой ёмкости — драматический. На GSM8K RL с 120 параметрами достигает 95% точности. SFT с тем же бюджетом — лишь 84%. При ещё меньших обновлениях разрыв только растёт. Авторы объясняют это с точки зрения теории информации: RL получает разреженный, но «чистый» сигнал (бинарную награду), тогда как SFT вынужден усваивать информацию всей последовательности, большая часть которой нерелевантна задаче.
5) Qwen2.5 стабильно требует примерно в 10 раз меньше параметров, чем Llama 3, для сопоставимого качества. При 1 параметре Qwen улучшает результат на 5% относительно базового, тогда как LLaMA почти не сдвигается. Авторы сами отмечают возможную контаминацию данных на этапе претрейнинга, а независимые исследования находили нетривиальное пересечение бенчмарков в обучающих данных Qwen.
Кода, как обычно, не дали.
@toshoseti
🤯3❤2