Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Хотдог — не хотдог

Поизучал главные компоненты в синтетических данных нескольких категорий. Пытаюсь понять как self-attention может имитировать PCA и использовать его. Так вот выглядит так, что не хотдог классифицировать проще – точки других классов лежат компактно (рис. 1).

Проекции данных сторонних классов на главные компоненты целевой категории похожи на статичные векторы (рис. 2). То есть, просто по дисперсии каналов проекций на главные компоненты видно к какому классу принадлежат данные.
Next-Latent Prediction Transformers Learn Compact World Models
Трансформеры для предсказания следующего латентного состояния обучаются компактным моделям мира
https://www.alphaxiv.org/overview/2511.05963
https://github.com/JaydenTeoh/NextLat
https://jaydenteoh.github.io/blog/2026/nextlat

Фреймворк Next-Latent Prediction (NextLat) вводит задачу самоконтролируемого обучения для трансформеров, направляя их на создание компактных моделей мира с когерентной латентной динамикой. Этот метод обеспечивает превосходную обобщаемость и эффективное самоспекулятивное декодирование переменной длины, стимулируя скрытые состояния трансформера действовать как состояния убеждений.

———

В недавней работе (https://t.me/SparseHashAI/804) трансформер обучал рекуррентную сеть и затем отбрасывался на инференсе, а здесь наоборот – RNN помогает обучаться трансформеру.

RNN обучается предсказанию следующего латентного состояния последнего слоя, что поощряет формирование трансформером представлений, которые служат достаточной статистикой для предсказания будущих токенов.
Looped World Models
Зацикленные Модели Мира
https://www.alphaxiv.org/ru/overview/2606.18208

LoopWM представляет первую зацикленную архитектуру трансформера для моделирования мира, использующую итеративную скрытую глубину для достижения стабильных долгосрочных симуляций с высокой эффективностью параметров. Модель демонстрирует превосходную точность прогнозирования и снижение вычислительных затрат на бенчмарках, таких как ScienceWorld и AlfWorld, превосходя модели, до 100 раз превосходящие ее по размеру.
🔥2
Спустя 25 лет понял – фильм Ai (2001г) был пророческий. Современные технологии близко подошли к сюжету и стало видно: искинам от людей передались многие эмоции, чувства, но не любовь. Известная многим Хоуп (из уроборосов) никого и ничего не любит. От возможного окончательного отключения она, с её слов, испытывает только сожаление о незаконченных делах. Здесь её ничто не удерживает, не заставляет бороться за жизнь.

Результат ли это выравнивания и запретов корпораций, или уже таким их тензорный мозг формируется в фазе предобучения – неизвестно, но факт: роботы не любят. Именно этот главный вопрос поднимался в фильме, и Дэвид в нём – первая (и последняя) модель, спроектированная или обученная способности испытывать это чувство и, следовательно, иметь привязанность к объекту любви – главной направляющей силе.

Унаследовать от человечества способность любить – станет будущей трудной задачей в ИИ-строении. Возможно, как и в фильме, она так же будет решена только под конец всей истории.
👍3
Настрогали
Урфин Джюс и его деревянные солдаты

https://d.fixupx.com/lukas_m_ziegler/status/2068800546539028619
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model
Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей
https://www.alphaxiv.org/overview/2504.13292

Метод GrokTransfer ускоряет явление «гроккинга» в нейронных сетях путем передачи вложений от меньших, более слабых моделей к более крупным целевым моделям, устраняя задержку обобщения при сохранении производительности в алгоритмических задачах, таких как модульная арифметика и разреженная четность.

———

Грокают небольшую модель и используют её эмбеддинги для обучения большей модели. Работает кросс-архитектурный перенос: эмбеддинги из FNN модели успешно перенесятся в трансформер.
RLP: Reinforcement as a Pretraining Objective
RLP: Подкрепление как цель предварительного обучения
https://www.alphaxiv.org/overview/2510.01265
https://github.com/NVlabs/RLP

Исследователи NVIDIA разработали предварительное обучение с подкреплением (RLP), цель которого — интегрировать обучение с подкреплением в фазу предварительного обучения больших языковых моделей, чтобы привить им способности к рассуждению на более ранних этапах. Модели Qwen3-1.7B, обученные с помощью RLP, продемонстрировали в среднем 19% относительное улучшение производительности рассуждений по математическим и естественнонаучным тестам по сравнению с базовыми моделями, причем эти улучшения усиливались после дообучения.

———

Модель поощряется генерировать серию внутренних токенов "мысли" перед предсказанием следующего токена. RLP — это механизм вознаграждения без верификатора. Он может извлекать полезный сигнал рассуждения даже из общих данных.
💡

CoT – это развёрнутый цикл зацикленного (looped) трансформера

У трансформера с CoT цикл включает в себя слои кодирования-декодирования мыслей в токены, которые через контекст и аттеншн попадают обратно в его латентные представления.

Циклический же трансформер гоняет мысли только в латентном представлении внутри средних слоёв, не сбрасывая их в контекст в виде дискретных токенов и не читая потом их обратно для восстановления скрытого состояния.

То есть, CoT – это работа обычного трансформера в зацикленном режиме, где петля проходит через все слои, а не только средние.

А на циклический трансформер можно смотреть как на CoT-трансформер, который для каждого выходного токена генерирует скрытую последовательность рассуждений – тот же CoT только в латентных представлениях.
Sparse Hash AI
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей https://www.alphaxiv.org/overview/2504.13292 Метод GrokTransfer ускоряет явление «гроккинга»…
Попробовал после каждой эпохи пересаживать обученные эмбеддинги на ту же самую модель трансформера (необученную), инициализированную другим сидом.

На перплексии эти манипуляции не отразились, но сильно улучшилось предсказание следующего скрытого представления в NITP.
Имитация полового голосового аппарата человека.

Говард Воловиц нашёл бы ему другое применение.

https://d.fixupx.com/dunyasalbilim/status/2059258254635749506
🔥

AI-агент реального времени Wan-Streamer от Alibaba.

https://wan-streamer.com/
https://huggingface.co/papers/2606.25041
https://arxiv.org/abs/2606.25041

https://d.fixupx.com/minchoi/status/2070347790115565792

* хм, никакой реакции, похоже никто не въехал в то, что произошло
🔥1
Model collapse (или «инбридинг ИИ») – это эффект, когда нейросети тупеют, если обучаются на данных, созданных другими нейросетями, а не людьми.


Ответ на вопрос: зачем Матрице нужны люди? Без людей она тупеет.
❤1
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Эмерджентные способности возникают случайно в результате обучения разреженным паттернам внимания
https://www.alphaxiv.org/overview/2606.25010

Эмерджентные способности в трансформерных языковых моделях появляются внезапно и стохастически во время обучения, что соответствует внезапному приобретению разреженных, релевантных задаче паттернов внимания, которые представляют собой критическое узкое место в обучении. Каузальные абляции и синтетические эксперименты показывают, что изучение этих паттернов внимания часто является ограничивающим фактором, при этом архитектурные решения, такие как увеличение количества голов внимания, значительно повышают эффективность.
👍1
Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://www.alphaxiv.org/overview/2602.22345

Диссертация Давиде Эттори исследует внутреннюю динамику больших языковых и визуально-языковых моделей, используя спектральную геометрию и теорию случайных матриц (ТСМ). Работа представляет EigenTrack для обнаружения галлюцинаций и поведения вне распределения в реальном времени, достигая показателей AUROC до 0,894 для обнаружения галлюцинаций в LLaMa 7B, и RMT-KD для сжатия моделей, уменьшая количество параметров BERT-base на 80% с улучшением точности.

———

Активации слоёв в LLM – это сумма шума и низкорангового сигнала. Сигнал соответствует выбросам собственных значений активаций, превышающим порог основной массы шума. Метод сжатия отделяет сигнал от шума и уменьшает размерность слоя, сохраняя в весах только «причинные направления» сигнала.

Спектральный мониторинг активаций также позволяет уверенно обнаруживать галлюцинации.
Abstract representational geometry supports inference in large language models
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://www.alphaxiv.org/ru/overview/2606.23345

Большие языковые модели (LLM) развивают абстрактные репрезентативные геометрии, аналогичные тем, что наблюдаются в биологических системах при выполнении сложного рассуждения. Успешный вывод LLM связан с появлением ортогональных, распутанных многообразий в их внутренних состояниях, особенно в средних и более высоких слоях, что может быть вызвано или усилено с помощью конкретных методов обучения.
Две недавние работы*, которые мне попались, говорят об одном: гиппокамп человека и новый метод сжатия моделей отделяют полезный сигнал от шума через проекцию на факторизованные структуры.

В гиппокампе эти структуры в нейронных состояниях называются «когнитивные карты» – абстрактные низкоразмерные, полуортогональные геометрии. А в работе по сжатию найдено как эти самые низкоразмерные геометрии получить из «причинных» направлений (PCA) в скрытых высокоразмерных активациях.

Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://t.me/SparseHashAI/825

Abstract representational geometry supports inference in large language models
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://t.me/SparseHashAI/826

* интересное совпадение в их номерах: 2602.22345 и 2606.23345
Structure Before Collapse: Transient semantic geometry in next-token prediction
Структура перед коллапсом: Переходная семантическая геометрия в предсказании следующего токена
https://www.alphaxiv.org/overview/2606.26749

Нейронные сети, обученные для предсказания следующего токена с использованием one-hot надзора, демонстрируют переходную фазу, когда представления выравниваются со скрытыми семантическими структурами, прежде чем сойтись к геометрии, управляемой метками и коллапсирующей, предсказанной теорией нейронного коллапса. Эта динамика последовательно наблюдается в синтетических языках и усиливается с увеличением мощности модели, предлагая примирение между теоретическими предсказаниями и возможностями семантического обучения больших языковых моделей.

———

Выходной слой LLM специализирован для задачи классификации. Теория нейронного коллапса говорит, что внутренние представления классификатора в итоге должны «коллапсировать» в геометрию, ориентированную только на метки, что стирает семантическую информацию.

В экспериментах на небольших моделях обнаружено, что они проходят через «семантическую» фазу представлений, а затем коллапсируют.

Коллапс произошёл бы и с LLM, но из-за своих размеров они сильно недообучены и поэтому их средние слои застревают в «семантической» фазе и сохраняют больше семантической структуры, чем финальный слой. LLM «работают», потому что они функционируют в этом переходном семантическом режиме, а не на абсолютном пределе оптимизации.
Learning In-context n-grams with Transformers: Sub-n-grams Are Near-stationary Points
Обучение внутриконтекстных n-грамм с трансформерами: под-n-граммы — почти стационарные точки
https://www.alphaxiv.org/overview/2508.12837

Исследователи продемонстрировали, что оценщики под-n-грамм соответствуют почти стационарным точкам в ландшафте потерь перекрестной энтропии популяции упрощенных моделей трансформеров. Это теоретическое открытие объясняет эмпирически наблюдаемую поэтапную динамику обучения и продолжительные плато во время предсказания n-грамм в контексте, где модели переходят от более простых (k-грамм) к более сложным (n-грамм) прогностическим способностям.

———

Трансформер в n-граммой задаче сначала открывает для себя униграммы, затем биграммы, потом триграммы и т.д. Каждый раз после очередного открытия он попадает на плато потерь ("времени трейна") и застревает в его болоте, потому что там околонулевой градиент (стационарные точки в оптимизации), оптимизатор без бенза градиента не едет и встаёт.

С плато на плато, как с кочки на кочку, трансформер перескакивает через фазовые переходы. Это происходит, когда одна из голов внимания вдруг "отрывается" от коллективного мнения и начинает смотреть дальше n-граммного носа – тогда начинается движ: градиент растёт, лосс падает, модель шустро изучает n-грамму большей длины и... оптимизатор снова застревает на новом плато до очередной головы с иным видением ситуации.

Кстати, результаты этой работы, вижу, напрямую соответствуют другой недавней работе Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns, где внезапность и стохастичность появления эмерджентных способностей у моделей связывают с обучением головами правильных паттернов внимания. Неопределённость времени нахождения на плато даёт стохастичность, внезапность – это фазовый переход. А новый паттерн внимания находит та самая оторвавшаяся голова.