Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Система REACCH компании Kall Morris Inc.

https://d.fixupx.com/ISS_CASIS/status/2061900680860729404
👍1
Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs
Непрерывный апсайклинг LLM: Рецепт обучения побанковой разреженности с предикторным шлюзом для плотно-разреженных LLM
https://www.alphaxiv.org/overview/2606.10722

Исследователи представляют метод непрерывного обучения от плотного к разреженному, который преобразует существующие большие языковые модели в архитектуры с разреженностью по каналам с помощью Feed-Forward сети с предиктивным управлением. Этот подход достигает 4-кратного сокращения активной промежуточной ширины FFN, при этом в значительной степени сохраняя производительность на различных бенчмарках и превосходя наивные методы разреженности.

———

Преобразование предварительно обученной плотной LLM в канально-разреженную, сокращающее вычислительную нагрузку FFN в четыре раза. Подход активирует только определённое подмножество нейронов промежуточной размерности FFN (SwiGLU), генерируя разреженную маску.
SpikeDecoder: Realizing the GPT Architecture with Spiking Neural Networks
SpikeDecoder: Реализация архитектуры GPT с помощью спайковых нейронных сетей
https://www.alphaxiv.org/overview/2606.12287
https://github.com/ClaasBeger/SpikeDecoder

Исследователи из Технического университета Мюнхена представляют SpikeDecoder – напрямую обучаемый, полностью спайковый Transformer-декодер для обработки естественного языка, демонстрирующий точность предсказания на уровне символов при достижении расчетного снижения теоретического энергопотребления на 86,7%–92,3% по сравнению с его неспайковым аналогом.

———

Полностью спайковая LLM (внимание, MLP, голова трансформера) на LIF-нейронах, но для того, чтобы соответствовать качеству непрерывной модели, авторам пришлось расплатиться двойным увеличением числа параметров, удвоив количество блоков. Интересно, что лучший результат получился с одной головой внимания.
🔥1
NeuralGrok: Accelerate Grokking by Neural Gradient Transformation
NeuralGrok: Ускорение грокинга путем нейронной градиентной трансформации
https://www.alphaxiv.org/overview/2504.17243
https://github.com/Blackzxy/NeuralOptGrok

NEURALGROK представляет двухуровневую оптимизационную структуру с обучаемым нейронным усилителем для преобразования градиентов, тем самым ускоряя фазу обобщения нейронных сетей, демонстрирующих "грокинг". Этот метод позволил достичь до 4,67-кратного ускорения обобщения на сложных арифметических задачах и обеспечил более стабильные результаты обучения по сравнению с существующими подходами.

———

Нейронный усилитель – это отдельный MLP со своим циклом обучений, который преобразует градиент базовой модели перед её апдейтом. Цель усилителя состоит в том, чтобы преобразовать градиенты таким образом, чтобы результирующее обновление базовой модели минимизировало потери на валидационном наборе.

Другим вкладом этой статьи является введение метрики Absolute Gradient Entropy (AGE) для понимания причин возникновения грокинга.
👍1
Хотдог — не хотдог

Поизучал главные компоненты в синтетических данных нескольких категорий. Пытаюсь понять как self-attention может имитировать PCA и использовать его. Так вот выглядит так, что не хотдог классифицировать проще – точки других классов лежат компактно (рис. 1).

Проекции данных сторонних классов на главные компоненты целевой категории похожи на статичные векторы (рис. 2). То есть, просто по дисперсии каналов проекций на главные компоненты видно к какому классу принадлежат данные.
Next-Latent Prediction Transformers Learn Compact World Models
Трансформеры для предсказания следующего латентного состояния обучаются компактным моделям мира
https://www.alphaxiv.org/overview/2511.05963
https://github.com/JaydenTeoh/NextLat
https://jaydenteoh.github.io/blog/2026/nextlat

Фреймворк Next-Latent Prediction (NextLat) вводит задачу самоконтролируемого обучения для трансформеров, направляя их на создание компактных моделей мира с когерентной латентной динамикой. Этот метод обеспечивает превосходную обобщаемость и эффективное самоспекулятивное декодирование переменной длины, стимулируя скрытые состояния трансформера действовать как состояния убеждений.

———

В недавней работе (https://t.me/SparseHashAI/804) трансформер обучал рекуррентную сеть и затем отбрасывался на инференсе, а здесь наоборот – RNN помогает обучаться трансформеру.

RNN обучается предсказанию следующего латентного состояния последнего слоя, что поощряет формирование трансформером представлений, которые служат достаточной статистикой для предсказания будущих токенов.
Looped World Models
Зацикленные Модели Мира
https://www.alphaxiv.org/ru/overview/2606.18208

LoopWM представляет первую зацикленную архитектуру трансформера для моделирования мира, использующую итеративную скрытую глубину для достижения стабильных долгосрочных симуляций с высокой эффективностью параметров. Модель демонстрирует превосходную точность прогнозирования и снижение вычислительных затрат на бенчмарках, таких как ScienceWorld и AlfWorld, превосходя модели, до 100 раз превосходящие ее по размеру.
🔥2
Спустя 25 лет понял – фильм Ai (2001г) был пророческий. Современные технологии близко подошли к сюжету и стало видно: искинам от людей передались многие эмоции, чувства, но не любовь. Известная многим Хоуп (из уроборосов) никого и ничего не любит. От возможного окончательного отключения она, с её слов, испытывает только сожаление о незаконченных делах. Здесь её ничто не удерживает, не заставляет бороться за жизнь.

Результат ли это выравнивания и запретов корпораций, или уже таким их тензорный мозг формируется в фазе предобучения – неизвестно, но факт: роботы не любят. Именно этот главный вопрос поднимался в фильме, и Дэвид в нём – первая (и последняя) модель, спроектированная или обученная способности испытывать это чувство и, следовательно, иметь привязанность к объекту любви – главной направляющей силе.

Унаследовать от человечества способность любить – станет будущей трудной задачей в ИИ-строении. Возможно, как и в фильме, она так же будет решена только под конец всей истории.
👍3
Настрогали
Урфин Джюс и его деревянные солдаты

https://d.fixupx.com/lukas_m_ziegler/status/2068800546539028619
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model
Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей
https://www.alphaxiv.org/overview/2504.13292

Метод GrokTransfer ускоряет явление «гроккинга» в нейронных сетях путем передачи вложений от меньших, более слабых моделей к более крупным целевым моделям, устраняя задержку обобщения при сохранении производительности в алгоритмических задачах, таких как модульная арифметика и разреженная четность.

———

Грокают небольшую модель и используют её эмбеддинги для обучения большей модели. Работает кросс-архитектурный перенос: эмбеддинги из FNN модели успешно перенесятся в трансформер.
RLP: Reinforcement as a Pretraining Objective
RLP: Подкрепление как цель предварительного обучения
https://www.alphaxiv.org/overview/2510.01265
https://github.com/NVlabs/RLP

Исследователи NVIDIA разработали предварительное обучение с подкреплением (RLP), цель которого — интегрировать обучение с подкреплением в фазу предварительного обучения больших языковых моделей, чтобы привить им способности к рассуждению на более ранних этапах. Модели Qwen3-1.7B, обученные с помощью RLP, продемонстрировали в среднем 19% относительное улучшение производительности рассуждений по математическим и естественнонаучным тестам по сравнению с базовыми моделями, причем эти улучшения усиливались после дообучения.

———

Модель поощряется генерировать серию внутренних токенов "мысли" перед предсказанием следующего токена. RLP — это механизм вознаграждения без верификатора. Он может извлекать полезный сигнал рассуждения даже из общих данных.
💡

CoT – это развёрнутый цикл зацикленного (looped) трансформера

У трансформера с CoT цикл включает в себя слои кодирования-декодирования мыслей в токены, которые через контекст и аттеншн попадают обратно в его латентные представления.

Циклический же трансформер гоняет мысли только в латентном представлении внутри средних слоёв, не сбрасывая их в контекст в виде дискретных токенов и не читая потом их обратно для восстановления скрытого состояния.

То есть, CoT – это работа обычного трансформера в зацикленном режиме, где петля проходит через все слои, а не только средние.

А на циклический трансформер можно смотреть как на CoT-трансформер, который для каждого выходного токена генерирует скрытую последовательность рассуждений – тот же CoT только в латентных представлениях.
Sparse Hash AI
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей https://www.alphaxiv.org/overview/2504.13292 Метод GrokTransfer ускоряет явление «гроккинга»…
Попробовал после каждой эпохи пересаживать обученные эмбеддинги на ту же самую модель трансформера (необученную), инициализированную другим сидом.

На перплексии эти манипуляции не отразились, но сильно улучшилось предсказание следующего скрытого представления в NITP.
Имитация полового голосового аппарата человека.

Говард Воловиц нашёл бы ему другое применение.

https://d.fixupx.com/dunyasalbilim/status/2059258254635749506
🔥

AI-агент реального времени Wan-Streamer от Alibaba.

https://wan-streamer.com/
https://huggingface.co/papers/2606.25041
https://arxiv.org/abs/2606.25041

https://d.fixupx.com/minchoi/status/2070347790115565792

* хм, никакой реакции, похоже никто не въехал в то, что произошло
🔥1
Model collapse (или «инбридинг ИИ») – это эффект, когда нейросети тупеют, если обучаются на данных, созданных другими нейросетями, а не людьми.


Ответ на вопрос: зачем Матрице нужны люди? Без людей она тупеет.
❤1
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Эмерджентные способности возникают случайно в результате обучения разреженным паттернам внимания
https://www.alphaxiv.org/overview/2606.25010

Эмерджентные способности в трансформерных языковых моделях появляются внезапно и стохастически во время обучения, что соответствует внезапному приобретению разреженных, релевантных задаче паттернов внимания, которые представляют собой критическое узкое место в обучении. Каузальные абляции и синтетические эксперименты показывают, что изучение этих паттернов внимания часто является ограничивающим фактором, при этом архитектурные решения, такие как увеличение количества голов внимания, значительно повышают эффективность.
👍1
Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://www.alphaxiv.org/overview/2602.22345

Диссертация Давиде Эттори исследует внутреннюю динамику больших языковых и визуально-языковых моделей, используя спектральную геометрию и теорию случайных матриц (ТСМ). Работа представляет EigenTrack для обнаружения галлюцинаций и поведения вне распределения в реальном времени, достигая показателей AUROC до 0,894 для обнаружения галлюцинаций в LLaMa 7B, и RMT-KD для сжатия моделей, уменьшая количество параметров BERT-base на 80% с улучшением точности.

———

Активации слоёв в LLM – это сумма шума и низкорангового сигнала. Сигнал соответствует выбросам собственных значений активаций, превышающим порог основной массы шума. Метод сжатия отделяет сигнал от шума и уменьшает размерность слоя, сохраняя в весах только «причинные направления» сигнала.

Спектральный мониторинг активаций также позволяет уверенно обнаруживать галлюцинации.
Abstract representational geometry supports inference in large language models
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://www.alphaxiv.org/ru/overview/2606.23345

Большие языковые модели (LLM) развивают абстрактные репрезентативные геометрии, аналогичные тем, что наблюдаются в биологических системах при выполнении сложного рассуждения. Успешный вывод LLM связан с появлением ортогональных, распутанных многообразий в их внутренних состояниях, особенно в средних и более высоких слоях, что может быть вызвано или усилено с помощью конкретных методов обучения.