torch internals
http://blog.ezyang.com/2019/05/pytorch-internals/
мне было интересно почитать (со второй половины неочевидный контент начинается)
http://blog.ezyang.com/2019/05/pytorch-internals/
мне было интересно почитать (со второй половины неочевидный контент начинается)
https://www.microsoft.com/en-us/research/wp-content/uploads/2016/06/ICASSP2016_LRPD-1.pdf
челы в 2016 году почти изобрели lora, а их даже не процитировали в самой лора
челы в 2016 году почти изобрели lora, а их даже не процитировали в самой лора
Training Large Language Models to Reason in a Continuous Latent Space
https://arxiv.org/abs/2412.06769
Суть простая: во время генерации CoT не дискретизировать выходные эмбеддинги через словарь, а вставлять в модель как есть.
Сначала модель обучается стандартным образом на CoT данных, затем дообучается сама. Причем через весь процесс "декодинга мыслей" можно бэкпропать, так как нет операций семплирования.
https://arxiv.org/abs/2412.06769
Суть простая: во время генерации CoT не дискретизировать выходные эмбеддинги через словарь, а вставлять в модель как есть.
Сначала модель обучается стандартным образом на CoT данных, затем дообучается сама. Причем через весь процесс "декодинга мыслей" можно бэкпропать, так как нет операций семплирования.
Matryoshka Quantization
https://arxiv.org/abs/2502.06786
similar to matryoshka representations but using bits
https://arxiv.org/abs/2502.06786
similar to matryoshka representations but using bits
arXiv.org
Matryoshka Quantization
Quantizing model weights is critical for reducing the communication and inference costs of large models. However, quantizing models -- especially to low precisions like int4 or int2 -- requires a...
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
https://arxiv.org/abs/2502.17387
https://arxiv.org/abs/2502.17387
arXiv.org
Big-Math: A Large-Scale, High-Quality Math Dataset for...
Increasing interest in reasoning models has led math to become a prominent testing ground for algorithmic and methodological improvements. However, existing open math datasets either contain a...
https://arxiv.org/abs/2502.19249
Прикольная работа. Можно перед претрейном на естественном языке делать претрейн на синтетике с формальных языков и от этого сама модель учится быстрее
Прикольная работа. Можно перед претрейном на естественном языке делать претрейн на синтетике с формальных языков и от этого сама модель учится быстрее
arXiv.org
Between Circuits and Chomsky: Pre-pretraining on Formal Languages...
Pretraining language models on formal language can improve their acquisition of natural language. Which features of the formal language impart an inductive bias that leads to effective transfer?...
https://arxiv.org/abs/2503.19595
Kinda obvious observation. During standard RL LM optimisation (grpo, ppo…) we maximise pass@1. If we want to improve pass@k, we should use different objective.
Kinda obvious observation. During standard RL LM optimisation (grpo, ppo…) we maximise pass@1. If we want to improve pass@k, we should use different objective.
arXiv.org
Optimizing Language Models for Inference Time Objectives using...
In this work, we investigate the merits of explicitly optimizing for inference time algorithmic performance during model training. We show how optimizing for inference time performance can improve...
https://arxiv.org/pdf/2412.03317
Очень много красивых картиночек про флеш аттеншн, но лично меня они только запутали
Очень много красивых картиночек про флеш аттеншн, но лично меня они только запутали
https://arxiv.org/abs/2505.24832
Nice paper from meta.
They empirically prove that GPTs memorize 3.5 bits per parameter. Also they show that grokking occurs after this saturation point.
Thread from the author: https://x.com/jxmnop/status/1929903028372459909?s=46
Nice paper from meta.
They empirically prove that GPTs memorize 3.5 bits per parameter. Also they show that grokking occurs after this saturation point.
Thread from the author: https://x.com/jxmnop/status/1929903028372459909?s=46
arXiv.org
How much do language models memorize?
We propose a new method for estimating how much a model knows about a datapoint and use it to measure the capacity of modern language models. Prior studies of language model memorization have...
очень упоротая, но клевая работа
Reinforcement Pre-Training
https://arxiv.org/abs/2506.08007
они буквально заставляют ллм генерировать chain of though для предсказания обычных токенов текста вместо обычного next token prediction, затем считают accuracy (угадала ли лм токен), его же максимизируют с помощью on policy RL(GRPO).
Понятно, что это не совсем pre-training, ибо начинается все уже с 14B R1 модели :)) но полученную модель можно использовать как базовую для дальнейших рл-файнтюнов.
Для большинства токенов ризонинг не нужен, поэтому они предвартиельно отфильтровали сложные токены по энтропии.
evaluaton делают в 2 сетапах: стремном и не стремном.
стремный -- это next token reasoning, то есть та же задача, на которую эта модель училась. Сравнивают с другими R1 моделями, которые не привыкли ризонить именно так, поэтому их модель сильно лучше.
нестремный -- reinforcement fine-tuning for downstream tasks. Берется другой датасет, и на нем в RLVR сеттинге дообучается их модель. получается на 10% лучше, чем дообучать базовый R1. Причем модель на этом бенчмарке справлятся лучше и без файнтюна, и после файнтюна, и прирост после файнтюна больше. Единственное, меня смущает, что тренировка идет на 256 примерах, не знею насколько это стандартный сетап для датасета SkyWork-OR1.
Как-то так. Не знаю, насколько они честно провели все эксперименты, но сама идея прикольная.
Reinforcement Pre-Training
https://arxiv.org/abs/2506.08007
они буквально заставляют ллм генерировать chain of though для предсказания обычных токенов текста вместо обычного next token prediction, затем считают accuracy (угадала ли лм токен), его же максимизируют с помощью on policy RL(GRPO).
Понятно, что это не совсем pre-training, ибо начинается все уже с 14B R1 модели :)) но полученную модель можно использовать как базовую для дальнейших рл-файнтюнов.
Для большинства токенов ризонинг не нужен, поэтому они предвартиельно отфильтровали сложные токены по энтропии.
evaluaton делают в 2 сетапах: стремном и не стремном.
стремный -- это next token reasoning, то есть та же задача, на которую эта модель училась. Сравнивают с другими R1 моделями, которые не привыкли ризонить именно так, поэтому их модель сильно лучше.
нестремный -- reinforcement fine-tuning for downstream tasks. Берется другой датасет, и на нем в RLVR сеттинге дообучается их модель. получается на 10% лучше, чем дообучать базовый R1. Причем модель на этом бенчмарке справлятся лучше и без файнтюна, и после файнтюна, и прирост после файнтюна больше. Единственное, меня смущает, что тренировка идет на 256 примерах, не знею насколько это стандартный сетап для датасета SkyWork-OR1.
Как-то так. Не знаю, насколько они честно провели все эксперименты, но сама идея прикольная.
arXiv.org
Reinforcement Pre-Training
In this work, we introduce Reinforcement Pre-Training (RPT) as a new scaling paradigm for large language models and reinforcement learning (RL). Specifically, we reframe next-token prediction as a...