Исследователи Tencent и Университета Цинхуа представили CALM — языковую модель, которая генерирует текст не по одному токену, а сразу целыми фрагментами.
Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.
В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.
Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.
Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.
https://arxiv.org/pdf/2510.27688
Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.
В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.
Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.
Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.
https://arxiv.org/pdf/2510.27688
«Beginning in Algebraic Geometry» — ещё один бесплатный учебник с открытым доступом, который даёт строгий, но при этом довольно доступный вход в алгебраическую геометрию.
Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.
Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.
После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.
На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.
https://link.springer.com/book/10.1007/978-3-031-88819-9
Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.
Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.
После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.
На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.
https://link.springer.com/book/10.1007/978-3-031-88819-9
Ещё один отличный плейлист по структурам данных и алгоритмам от pmavrin.
https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
Awesome Math — огромная подборка материалов по математике в одном репозитории.
Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.
Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.
https://github.com/rossant/awesome-math
Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.
Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.
https://github.com/rossant/awesome-math
GitHub
GitHub - rossant/awesome-math: A curated list of awesome mathematics resources
A curated list of awesome mathematics resources. Contribute to rossant/awesome-math development by creating an account on GitHub.
Бесплатный PDF новой книги по оптимизации:
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
«Transformer с полной пропускной способностью»
Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.
https://alphaxiv.org/abs/2608.08888
Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.
https://alphaxiv.org/abs/2608.08888
This media is not supported in your browser
VIEW IN TELEGRAM
Все шесть тригонометрических функций — это просто длины на одной окружности.
Одно из ЛУЧШИХ видео от data_adventurer.
Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.
После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.
Очень рекомендую посмотреть!
https://youtu.be/55QWsm1itKo
Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.
После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.
Очень рекомендую посмотреть!
https://youtu.be/55QWsm1itKo
https://github.com/patchy631/time-to-first-token
Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.
Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.
В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.
Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.
В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
GitHub
GitHub - patchy631/time-to-first-token: A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang…
A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking. - patchy631/time-to-first-token
27-миллиардный агент обошёл Claude Opus 4.8 и GPT-5.5 в воспроизведении научных исследований на отложенном наборе задач.
Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.
Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.
Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.
Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.
Статья - https://arxiv.org/abs/2608.13331
Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.
Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.
Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.
Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.
Статья - https://arxiv.org/abs/2608.13331
«Introduction to Machine Learning» Лорана Юнеса.
Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.
В книге разбираются:
— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности
Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.
https://arxiv.org/abs/2409.02668
Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.
В книге разбираются:
— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности
Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.
https://arxiv.org/abs/2409.02668
«Natural Language Processing and Large Language Models» — новая книга в открытом доступе от Springer, написанная Chengqing Zong, Yang Zhao и Yanjun Ma.
Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.
Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.
На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.
https://link.springer.com/book/10.1007/978-981-92-0682-7
Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.
Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.
На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.
https://link.springer.com/book/10.1007/978-981-92-0682-7
Генерирует высокодетализированные 3D-формы с помощью масштабируемого диффузионного подхода, который последовательно уточняет грубую геометрию с использованием воксельных методов. Репозиторий UltraShape-1.0 описывает задачу как генерацию высокоточных 3D-форм через масштабируемое геометрическое уточнение.
https://github.com/PKU-YuanGroup/UltraShape-1.0
https://github.com/PKU-YuanGroup/UltraShape-1.0
Отличная серия лекций по аппаратному обеспечению и системам для машинного обучения.
Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.
Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.
Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Transformers – The Definitive Guide — официальный репозиторий с кодом к книге, построенный вокруг практических Jupyter-ноутбуков для изучения и применения трансформерных моделей.
Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.
https://github.com/Nicolepcx/transformers-the-definitive-guide
Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.
https://github.com/Nicolepcx/transformers-the-definitive-guide
Каждая модель машинного обучения, которую вы когда-либо обучали, в конечном счёте опирается на 62 страницы, написанные ещё в 1933 году.
Речь о «Основах теории вероятностей» Колмогорова.
Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге.
Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать.
Книга бесплатно доступна в подборке Awesome Math Books.
https://github.com/valeman/Awesome_Math_Books
Речь о «Основах теории вероятностей» Колмогорова.
Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге.
Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать.
Книга бесплатно доступна в подборке Awesome Math Books.
https://github.com/valeman/Awesome_Math_Books
Python может помочь инженерам-механикам автоматизировать рабочие процессы, анализировать данные и решать сложные инженерные задачи.
В этом курсе разбирается Python именно для машиностроения — от базовых концепций программирования до практического применения в инженерных задачах.
В программе NumPy, Pandas и Matplotlib, работа с ИИ в инженерных процессах и несколько практических кейсов.
https://freecodecamp.org/news/python-for-mechanical-engineering/
В этом курсе разбирается Python именно для машиностроения — от базовых концепций программирования до практического применения в инженерных задачах.
В программе NumPy, Pandas и Matplotlib, работа с ИИ в инженерных процессах и несколько практических кейсов.
https://freecodecamp.org/news/python-for-mechanical-engineering/