Бесплатный PDF новой книги по оптимизации:
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
«Transformer с полной пропускной способностью»
Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.
https://alphaxiv.org/abs/2608.08888
Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.
https://alphaxiv.org/abs/2608.08888
This media is not supported in your browser
VIEW IN TELEGRAM
Все шесть тригонометрических функций — это просто длины на одной окружности.
Одно из ЛУЧШИХ видео от data_adventurer.
Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.
После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.
Очень рекомендую посмотреть!
https://youtu.be/55QWsm1itKo
Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.
После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.
Очень рекомендую посмотреть!
https://youtu.be/55QWsm1itKo
https://github.com/patchy631/time-to-first-token
Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.
Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.
В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.
Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.
В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
GitHub
GitHub - patchy631/time-to-first-token: A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang…
A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking. - patchy631/time-to-first-token
27-миллиардный агент обошёл Claude Opus 4.8 и GPT-5.5 в воспроизведении научных исследований на отложенном наборе задач.
Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.
Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.
Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.
Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.
Статья - https://arxiv.org/abs/2608.13331
Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.
Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.
Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.
Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.
Статья - https://arxiv.org/abs/2608.13331
«Introduction to Machine Learning» Лорана Юнеса.
Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.
В книге разбираются:
— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности
Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.
https://arxiv.org/abs/2409.02668
Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.
В книге разбираются:
— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности
Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.
https://arxiv.org/abs/2409.02668
«Natural Language Processing and Large Language Models» — новая книга в открытом доступе от Springer, написанная Chengqing Zong, Yang Zhao и Yanjun Ma.
Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.
Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.
На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.
https://link.springer.com/book/10.1007/978-981-92-0682-7
Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.
Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.
На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.
https://link.springer.com/book/10.1007/978-981-92-0682-7
Генерирует высокодетализированные 3D-формы с помощью масштабируемого диффузионного подхода, который последовательно уточняет грубую геометрию с использованием воксельных методов. Репозиторий UltraShape-1.0 описывает задачу как генерацию высокоточных 3D-форм через масштабируемое геометрическое уточнение.
https://github.com/PKU-YuanGroup/UltraShape-1.0
https://github.com/PKU-YuanGroup/UltraShape-1.0
Отличная серия лекций по аппаратному обеспечению и системам для машинного обучения.
Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.
Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.
Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Transformers – The Definitive Guide — официальный репозиторий с кодом к книге, построенный вокруг практических Jupyter-ноутбуков для изучения и применения трансформерных моделей.
Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.
https://github.com/Nicolepcx/transformers-the-definitive-guide
Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.
https://github.com/Nicolepcx/transformers-the-definitive-guide
Каждая модель машинного обучения, которую вы когда-либо обучали, в конечном счёте опирается на 62 страницы, написанные ещё в 1933 году.
Речь о «Основах теории вероятностей» Колмогорова.
Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге.
Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать.
Книга бесплатно доступна в подборке Awesome Math Books.
https://github.com/valeman/Awesome_Math_Books
Речь о «Основах теории вероятностей» Колмогорова.
Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге.
Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать.
Книга бесплатно доступна в подборке Awesome Math Books.
https://github.com/valeman/Awesome_Math_Books
Python может помочь инженерам-механикам автоматизировать рабочие процессы, анализировать данные и решать сложные инженерные задачи.
В этом курсе разбирается Python именно для машиностроения — от базовых концепций программирования до практического применения в инженерных задачах.
В программе NumPy, Pandas и Matplotlib, работа с ИИ в инженерных процессах и несколько практических кейсов.
https://freecodecamp.org/news/python-for-mechanical-engineering/
В этом курсе разбирается Python именно для машиностроения — от базовых концепций программирования до практического применения в инженерных задачах.
В программе NumPy, Pandas и Matplotlib, работа с ИИ в инженерных процессах и несколько практических кейсов.
https://freecodecamp.org/news/python-for-mechanical-engineering/
«Fundamentals of Linear Algebra» — отличный учебник по линейной алгебре объёмом около 400 страниц, который Университет Британской Колумбии выложил в свободный доступ.
В нём разбираются системы линейных уравнений, матрицы, векторные пространства, линейные отображения, определители, собственные значения и собственные векторы, пространства со скалярным произведением, диагонализация и многое другое.
Есть и интересные практические применения, включая теорию линейного кодирования, а также большое количество упражнений.
Думаю, это очень полезный материал, если вы изучаете линейную алгебру и хотите иметь под рукой подробный справочник.
https://personal.math.ubc.ca/~carrell/NB.pdf
В нём разбираются системы линейных уравнений, матрицы, векторные пространства, линейные отображения, определители, собственные значения и собственные векторы, пространства со скалярным произведением, диагонализация и многое другое.
Есть и интересные практические применения, включая теорию линейного кодирования, а также большое количество упражнений.
Думаю, это очень полезный материал, если вы изучаете линейную алгебру и хотите иметь под рукой подробный справочник.
https://personal.math.ubc.ca/~carrell/NB.pdf
Обновлённый курс CS 8803 «Large Language Model» в Georgia Tech на 2026 год.
Список материалов охватывает предобучение, MoE, рассуждения, обучение с подкреплением и self-play, агентов, длинный контекст, масштабирование во время инференса, диффузионные языковые модели, безопасность, интерпретируемость и многое другое.
- https://cocoxu.github.io/CS8803-LLM-spring2026/
- https://docs.google.com/spreadsheets/d/1Oisf4imoNL3fs4UWGYAUlMCuYfCACMHCDb0iqEYU8wc/edit?usp=sharing
Список материалов охватывает предобучение, MoE, рассуждения, обучение с подкреплением и self-play, агентов, длинный контекст, масштабирование во время инференса, диффузионные языковые модели, безопасность, интерпретируемость и многое другое.
- https://cocoxu.github.io/CS8803-LLM-spring2026/
- https://docs.google.com/spreadsheets/d/1Oisf4imoNL3fs4UWGYAUlMCuYfCACMHCDb0iqEYU8wc/edit?usp=sharing
Классический бесплатный отчёт JPMorgan на 280 страниц — отличный материал для инвесторов, которые работают с машинным обучением, ИИ и Data Science.
Внутри есть обзор разных типов альтернативных данных и сильный практический разбор методов машинного обучения для их анализа.
https://cpb-us-e2.wpmucdn.com/faculty.sites.uci.edu/dist/2/51/files/2018/05/JPM-2017-MachineLearningInvestments.pdf
Внутри есть обзор разных типов альтернативных данных и сильный практический разбор методов машинного обучения для их анализа.
https://cpb-us-e2.wpmucdn.com/faculty.sites.uci.edu/dist/2/51/files/2018/05/JPM-2017-MachineLearningInvestments.pdf