Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
626 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Emerging Human-like Strategies for Semantic Memory Foraging in Large Language Models
Возникающие человекоподобные стратегии поиска семантической памяти в больших языковых моделях
https://www.alphaxiv.org/overview/2603.01822

Исследователи изучили извлечение семантической памяти в больших языковых моделях, продемонстрировав, что LLM проявляют когнитивные стратегии, подобные человеческим, для конвергентного и дивергентного поиска во время задач на семантическую беглость. Исследование выявило внутренние вычислительные признаки этих стратегий в архитектурах LLM, показав сильное поведенческое соответствие с людьми и высокую декодируемость из внутренних представлений с использованием методов механистической интерпретируемости.
👍1
Sparse Hash AI
Guiding Sparse Neural Networks with Neurobiological Principles to Elicit Biologically Plausible Representations Управление разреженными нейронными сетями на основе нейробиологических принципов для получения биологически правдоподобных представлений https:…
Energy-Efficient Information Representation in MNIST Classification Using Biologically Inspired Learning
Энергоэффективное представление информации при классификации MNIST с использованием биологически инспирированного обучения
https://www.alphaxiv.org/overview/2603.00588

Исследователи из Института KEIM и Технического университета Хемница разработали биологически инспирированное правило обучения для разреженных нейронных сетей, которое изначально включает в себя такие принципы, как разреженность и логнормальное распределение весов. Этот подход демонстрирует улучшенную устойчивость к состязательным атакам и превосходную производительность в обучении с малым количеством примеров по сравнению с существующими методами, особенно в глубоких, чисто возбуждающих архитектурах.
🔥1
OmniXtreme: Breaking the Generality Barrier in High-Dynamic Humanoid Control
https://extreme-humanoid.github.io/

https://d.fixupx.com/TheHumanoidHub/status/2028520139948519910
🔥2
Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics
Понимание физики сжатия KV-кэша для LLM через динамику внимания
https://www.alphaxiv.org/overview/2603.01426

Исследователи из ИИТ Дели разработали основанную на физических принципах структуру для анализа сжатия кэша «ключ-значение» (KV) в больших языковых моделях, показав, что текущие оценки часто упускают из виду структурные проблемы. Их работа выявила «обрыв безопасности галлюцинаций» при сильном сжатии, связанный с глобальным вытеснением критически важных токенов, и продемонстрировала различные динамики маршрутизации внимания между архитектурами LLaMA и Qwen.

———

Авторы предполагают, что KV-кеш функционирует не просто как пассивное хранилище памяти, а как активный механизм маршрутизации, который строит динамические пути через головы и слои внимания.

В статье вводится концепция «лотерейных билетов маршрутов токенов» (TR-LTs), расширяющая влиятельную гипотезу лотерейного билета на динамику внимания во время инференса. Основная гипотеза утверждает, что внутри плотных слоев внимания существуют разреженные межголовочные и межслойные пути, которые сохраняют семантическую достижимость, необходимую для правильной генерации.
Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA
Семантическое прогнозирование трубок: Превосходя эффективность данных БЯМ с помощью JEPA
https://www.alphaxiv.org/overview/2602.22617

Обобщая предиктивную архитектуру со встраиванием в совместное пространство (JEPA) для языка с использованием «Гипотезы геодезической линии», метод прогнозирования семантической трубки (STP) повышает эффективность данных и качество генерации больших языковых моделей (LLM). Фреймворк позволяет LLM достигать базовой точности, используя в 16 раз меньше обучающих данных, и предотвращает коллапс моды, обеспечивая согласованность семантической траектории.

Эта работа представляет метод, который рассматривает генерацию языка через призму дифференциальной геометрии, предполагая, что последовательности токенов отслеживают гладкие пути, называемые геодезическими, на семантическом многообразии.
❤2
Кому не нравится новый сезон Гриффенов, может сделать свой. 🙂

https://d.fixupx.com/Framer_X/status/2024535394772275615
🔥2
Feature Resemblance: On the Theoretical Understanding of Analogical Reasoning in Transformers
Сходство признаков: К теоретическому пониманию аналогического рассуждения в трансформерах
https://www.alphaxiv.org/ru/overview/2603.05143

Исследователи демонстрируют, что Трансформеры выполняют аналоговое рассуждение, кодируя сущности с общими свойствами в выровненные представления, механизм, названный "Подобием признаков". Их теоретическая и эмпирическая работа на различных масштабах моделей объясняет, как динамика обучения, включая порядок учебной программы и специфические структуры данных, влияет на появление этой индуктивной способности.

Авторы вводят концепцию «сходства признаков» как центральный механизм, обеспечивающий аналоговое рассуждение: Трансформеры учатся кодировать сущности с похожими свойствами в похожие представления, что позволяет естественным образом обобщать свойства в различных контекстах. Благодаря тщательному теоретическому анализу однослойных трансформеров и всесторонней эмпирической проверке как на синтетических, так и на реальных наборах данных, эта работа устанавливает фундаментальные принципы того, как индуктивные способности рассуждения возникают во время обучения.
🔥1
AlphaXiv добавили ленту новых горячих статей. Это частично дублирует уже существующий Explore, но удобно прямо из ленты посмотреть Blog заинтересовавшей статьи.

https://www.alphaxiv.org/briefs
👍1
Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
https://github.com/GalaxyGeneralRobotics/LATENT

https://d.fixupx.com/CyberRobooo/status/2033146344723087652
Rethinking the shape convention of an MLP
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796

MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Enhancing LLM Training via Spectral Clipping
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315

SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Please open Telegram to view this post
VIEW IN TELEGRAM