Mixture of Nested Experts: Adaptive Processing of Visual Tokens
https://arxiv.org/abs/2407.19985
Интересный вариант MoE чем-то напоминающий матрешка-representations. Модель учится оперировать кусками эмбеддингов и динамически аллоцировать общий комьют.
https://arxiv.org/abs/2407.19985
Интересный вариант MoE чем-то напоминающий матрешка-representations. Модель учится оперировать кусками эмбеддингов и динамически аллоцировать общий комьют.
arXiv.org
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
The visual medium (images and videos) naturally contains a large amount of information redundancy, thereby providing a great opportunity for leveraging efficiency in processing. While Vision...
An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models
https://arxiv.org/abs/2408.00724
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
https://arxiv.org/abs/2408.03314
Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
https://arxiv.org/abs/2407.21787
связанные с gpt-o1 работы про докидывание компьюта на этап инференса.
https://arxiv.org/abs/2408.00724
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
https://arxiv.org/abs/2408.03314
Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
https://arxiv.org/abs/2407.21787
связанные с gpt-o1 работы про докидывание компьюта на этап инференса.
arXiv.org
Scaling LLM Test-Time Compute Optimally can be More Effective than...
Enabling LLMs to improve their outputs by using more test-time computation is a critical step towards building generally self-improving agents that can operate on open-ended natural language. In...
Меня спрашивали, а почему сейчас в ллм используют такие странные mlp? А я сходу не припомнил, предположил, что просто эксперименты показывают, что так лучше. И был прав
Llama 1 paper motivates GLU mlp choice with this paper https://arxiv.org/abs/2002.05202
my intuition was right, this is just empirical evaluation result.
nice quote: "We offer no explanation as to why these
architectures seem to work; we attribute their success, as all else, to divine benevolence."
Llama 1 paper motivates GLU mlp choice with this paper https://arxiv.org/abs/2002.05202
my intuition was right, this is just empirical evaluation result.
nice quote: "We offer no explanation as to why these
architectures seem to work; we attribute their success, as all else, to divine benevolence."
arXiv.org
GLU Variants Improve Transformer
Gated Linear Units (arXiv:1612.08083) consist of the component-wise product of two linear projections, one of which is first passed through a sigmoid function. Variations on GLU are possible,...
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
Лучший совет, который вы могли получить этим утром. Смотреть до конца 🍻
Please open Telegram to view this post
VIEW IN TELEGRAM
Policy Filtration in RLHF to Fine-Tune LLM for Code Generation
https://arxiv.org/abs/2409.06957
Наблюдается, что скоры ревард моделей достаточно шумные и доверять им можно только в случае сильно низкой или сильно высокой награды. (я до конца не понял, как этот вывод делается, но ок)
На основе этого наблюдения предлагается модификация PPO: после того, как из текущей политики семплируются решения, они фильтруются, оставляя самые хорошие и самые худшие решения. Дальше ppo гоняется без изменений.
Делается сравнение с разными алгоритмами, включая DPO, где их версия перформит лучше.
---
Если их первичное наблюдение правдиво, то интересно было бы попробовать в онлайн режиме собирать преференсы из самых плохих и самых хороших решений, а затем гонять на этих парах DPO.
https://arxiv.org/abs/2409.06957
Наблюдается, что скоры ревард моделей достаточно шумные и доверять им можно только в случае сильно низкой или сильно высокой награды. (я до конца не понял, как этот вывод делается, но ок)
На основе этого наблюдения предлагается модификация PPO: после того, как из текущей политики семплируются решения, они фильтруются, оставляя самые хорошие и самые худшие решения. Дальше ppo гоняется без изменений.
Делается сравнение с разными алгоритмами, включая DPO, где их версия перформит лучше.
---
Если их первичное наблюдение правдиво, то интересно было бы попробовать в онлайн режиме собирать преференсы из самых плохих и самых хороших решений, а затем гонять на этих парах DPO.
arXiv.org
Policy Filtration for RLHF to Mitigate Noise in Reward Models
While direct policy optimization methods exist, pioneering LLMs are fine-tuned with reinforcement learning from human feedback (RLHF) to generate better responses under the supervision of a reward...
https://arxiv.org/abs/2410.02089
Использование фидбека от тестов codecontests во время тренировки(ppo) и инференса
Использование фидбека от тестов codecontests во время тренировки(ppo) и инференса
arXiv.org
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
Large language models (LLMs) deployed as agents solve user-specified tasks over multiple steps while keeping the required manual engagement to a minimum. Crucially, such LLMs need to ground their...
Differential Transformer
https://arxiv.org/abs/2410.05258
Предлагается внутри селф аттеншна считать 2 разные attention map и вычитать из друг из друга. Мотивируется тем, что это снижает шум на ненужных токенах.
https://arxiv.org/abs/2410.05258
Предлагается внутри селф аттеншна считать 2 разные attention map и вычитать из друг из друга. Мотивируется тем, что это снижает шум на ненужных токенах.
arXiv.org
Differential Transformer
Transformer tends to overallocate attention to irrelevant context. In this work, we introduce Diff Transformer, which amplifies attention to the relevant context while canceling noise....
Self-Boosting Large Language Models with Synthetic Preference Data
https://arxiv.org/abs/2410.06961
Работа про синтетические преференс данные. Сначала тренируется модель refiner, которая промпт и ответ превращает в улучшенный ответ.
Еще тренируется генератор синтетических промптов.
На шаге Т семплятся ответы из текущей политики, затем рефайнятся и полученные пары используются как датасет преференсов для DPO-like алгоритмов. Это повторяется до 4 раз.
https://arxiv.org/abs/2410.06961
Работа про синтетические преференс данные. Сначала тренируется модель refiner, которая промпт и ответ превращает в улучшенный ответ.
Еще тренируется генератор синтетических промптов.
На шаге Т семплятся ответы из текущей политики, затем рефайнятся и полученные пары используются как датасет преференсов для DPO-like алгоритмов. Это повторяется до 4 раз.
arXiv.org
Self-Boosting Large Language Models with Synthetic Preference Data
Through alignment with human preferences, Large Language Models (LLMs) have advanced significantly in generating honest, harmless, and helpful responses. However, collecting high-quality...
Thinking LLMs: General Instruction Following with Thought Generation
https://arxiv.org/abs/2410.10630
Статья от меты про думанье ллм типа о1
https://arxiv.org/abs/2410.10630
Статья от меты про думанье ллм типа о1
arXiv.org
Thinking LLMs: General Instruction Following with Thought Generation
LLMs are typically trained to answer user questions or follow instructions similarly to how human experts respond. However, in the standard alignment framework they lack the basic ability of...
torch internals
http://blog.ezyang.com/2019/05/pytorch-internals/
мне было интересно почитать (со второй половины неочевидный контент начинается)
http://blog.ezyang.com/2019/05/pytorch-internals/
мне было интересно почитать (со второй половины неочевидный контент начинается)
https://www.microsoft.com/en-us/research/wp-content/uploads/2016/06/ICASSP2016_LRPD-1.pdf
челы в 2016 году почти изобрели lora, а их даже не процитировали в самой лора
челы в 2016 году почти изобрели lora, а их даже не процитировали в самой лора
Training Large Language Models to Reason in a Continuous Latent Space
https://arxiv.org/abs/2412.06769
Суть простая: во время генерации CoT не дискретизировать выходные эмбеддинги через словарь, а вставлять в модель как есть.
Сначала модель обучается стандартным образом на CoT данных, затем дообучается сама. Причем через весь процесс "декодинга мыслей" можно бэкпропать, так как нет операций семплирования.
https://arxiv.org/abs/2412.06769
Суть простая: во время генерации CoT не дискретизировать выходные эмбеддинги через словарь, а вставлять в модель как есть.
Сначала модель обучается стандартным образом на CoT данных, затем дообучается сама. Причем через весь процесс "декодинга мыслей" можно бэкпропать, так как нет операций семплирования.
Matryoshka Quantization
https://arxiv.org/abs/2502.06786
similar to matryoshka representations but using bits
https://arxiv.org/abs/2502.06786
similar to matryoshka representations but using bits
arXiv.org
Matryoshka Quantization
Quantizing model weights is critical for reducing the communication and inference costs of large models. However, quantizing models -- especially to low precisions like int4 or int2 -- requires a...
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
https://arxiv.org/abs/2502.17387
https://arxiv.org/abs/2502.17387
arXiv.org
Big-Math: A Large-Scale, High-Quality Math Dataset for...
Increasing interest in reasoning models has led math to become a prominent testing ground for algorithmic and methodological improvements. However, existing open math datasets either contain a...
https://arxiv.org/abs/2502.19249
Прикольная работа. Можно перед претрейном на естественном языке делать претрейн на синтетике с формальных языков и от этого сама модель учится быстрее
Прикольная работа. Можно перед претрейном на естественном языке делать претрейн на синтетике с формальных языков и от этого сама модель учится быстрее
arXiv.org
Between Circuits and Chomsky: Pre-pretraining on Formal Languages...
Pretraining language models on formal language can improve their acquisition of natural language. Which features of the formal language impart an inductive bias that leads to effective transfer?...