TLDR
1 subscriber
5 photos
1 video
36 links
Download Telegram
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
https://arxiv.org/abs/2407.19985

Интересный вариант MoE чем-то напоминающий матрешка-representations. Модель учится оперировать кусками эмбеддингов и динамически аллоцировать общий комьют.
An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models
https://arxiv.org/abs/2408.00724

Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
https://arxiv.org/abs/2408.03314

Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
https://arxiv.org/abs/2407.21787

связанные с gpt-o1 работы про докидывание компьюта на этап инференса.
Меня спрашивали, а почему сейчас в ллм используют такие странные mlp? А я сходу не припомнил, предположил, что просто эксперименты показывают, что так лучше. И был прав

Llama 1 paper motivates GLU mlp choice with this paper https://arxiv.org/abs/2002.05202
my intuition was right, this is just empirical evaluation result.

nice quote: "We offer no explanation as to why these
architectures seem to work; we attribute their success, as all else, to divine benevolence."
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
Лучший совет, который вы могли получить этим утром. Смотреть до конца 🍻
Please open Telegram to view this post
VIEW IN TELEGRAM
Policy Filtration in RLHF to Fine-Tune LLM for Code Generation
https://arxiv.org/abs/2409.06957

Наблюдается, что скоры ревард моделей достаточно шумные и доверять им можно только в случае сильно низкой или сильно высокой награды. (я до конца не понял, как этот вывод делается, но ок)

На основе этого наблюдения предлагается модификация PPO: после того, как из текущей политики семплируются решения, они фильтруются, оставляя самые хорошие и самые худшие решения. Дальше ppo гоняется без изменений.

Делается сравнение с разными алгоритмами, включая DPO, где их версия перформит лучше.

---
Если их первичное наблюдение правдиво, то интересно было бы попробовать в онлайн режиме собирать преференсы из самых плохих и самых хороших решений, а затем гонять на этих парах DPO.
Differential Transformer
https://arxiv.org/abs/2410.05258

Предлагается внутри селф аттеншна считать 2 разные attention map и вычитать из друг из друга. Мотивируется тем, что это снижает шум на ненужных токенах.
Self-Boosting Large Language Models with Synthetic Preference Data
https://arxiv.org/abs/2410.06961

Работа про синтетические преференс данные. Сначала тренируется модель refiner, которая промпт и ответ превращает в улучшенный ответ.
Еще тренируется генератор синтетических промптов.

На шаге Т семплятся ответы из текущей политики, затем рефайнятся и полученные пары используются как датасет преференсов для DPO-like алгоритмов. Это повторяется до 4 раз.
torch internals

http://blog.ezyang.com/2019/05/pytorch-internals/

мне было интересно почитать (со второй половины неочевидный контент начинается)
https://www.microsoft.com/en-us/research/wp-content/uploads/2016/06/ICASSP2016_LRPD-1.pdf

челы в 2016 году почти изобрели lora, а их даже не процитировали в самой лора
Training Large Language Models to Reason in a Continuous Latent Space
https://arxiv.org/abs/2412.06769

Суть простая: во время генерации CoT не дискретизировать выходные эмбеддинги через словарь, а вставлять в модель как есть.

Сначала модель обучается стандартным образом на CoT данных, затем дообучается сама. Причем через весь процесс "декодинга мыслей" можно бэкпропать, так как нет операций семплирования.
Forwarded from Ivan S
дипсиковский рл алгоритм grpo это буквально вот это, но с ппошным клиппингом
Forwarded from Ivan S
Forwarded from Ivan S
просто держу в курсе
вот бы научиться правильно читать вторую фамилию с первого раза
https://arxiv.org/abs/2502.19249

Прикольная работа. Можно перед претрейном на естественном языке делать претрейн на синтетике с формальных языков и от этого сама модель учится быстрее