TLDR
1 subscriber
5 photos
1 video
36 links
Download Telegram
torch internals

http://blog.ezyang.com/2019/05/pytorch-internals/

мне было интересно почитать (со второй половины неочевидный контент начинается)
https://www.microsoft.com/en-us/research/wp-content/uploads/2016/06/ICASSP2016_LRPD-1.pdf

челы в 2016 году почти изобрели lora, а их даже не процитировали в самой лора
Training Large Language Models to Reason in a Continuous Latent Space
https://arxiv.org/abs/2412.06769

Суть простая: во время генерации CoT не дискретизировать выходные эмбеддинги через словарь, а вставлять в модель как есть.

Сначала модель обучается стандартным образом на CoT данных, затем дообучается сама. Причем через весь процесс "декодинга мыслей" можно бэкпропать, так как нет операций семплирования.
Forwarded from Ivan S
дипсиковский рл алгоритм grpo это буквально вот это, но с ппошным клиппингом
Forwarded from Ivan S
Forwarded from Ivan S
просто держу в курсе
вот бы научиться правильно читать вторую фамилию с первого раза
https://arxiv.org/abs/2502.19249

Прикольная работа. Можно перед претрейном на естественном языке делать претрейн на синтетике с формальных языков и от этого сама модель учится быстрее
https://arxiv.org/pdf/2412.03317

Очень много красивых картиночек про флеш аттеншн, но лично меня они только запутали
очень упоротая, но клевая работа
Reinforcement Pre-Training
https://arxiv.org/abs/2506.08007

они буквально заставляют ллм генерировать chain of though для предсказания обычных токенов текста вместо обычного next token prediction, затем считают accuracy (угадала ли лм токен), его же максимизируют с помощью on policy RL(GRPO).

Понятно, что это не совсем pre-training, ибо начинается все уже с 14B R1 модели :)) но полученную модель можно использовать как базовую для дальнейших рл-файнтюнов.

Для большинства токенов ризонинг не нужен, поэтому они предвартиельно отфильтровали сложные токены по энтропии.

evaluaton делают в 2 сетапах: стремном и не стремном.
стремный -- это next token reasoning, то есть та же задача, на которую эта модель училась. Сравнивают с другими R1 моделями, которые не привыкли ризонить именно так, поэтому их модель сильно лучше.

нестремный -- reinforcement fine-tuning for downstream tasks. Берется другой датасет, и на нем в RLVR сеттинге дообучается их модель. получается на 10% лучше, чем дообучать базовый R1. Причем модель на этом бенчмарке справлятся лучше и без файнтюна, и после файнтюна, и прирост после файнтюна больше. Единственное, меня смущает, что тренировка идет на 256 примерах, не знею насколько это стандартный сетап для датасета SkyWork-OR1.

Как-то так. Не знаю, насколько они честно провели все эксперименты, но сама идея прикольная.