Классический бесплатный отчёт JPMorgan на 280 страниц — отличный материал для инвесторов, которые работают с машинным обучением, ИИ и Data Science.
Внутри есть обзор разных типов альтернативных данных и сильный практический разбор методов машинного обучения для их анализа.
https://cpb-us-e2.wpmucdn.com/faculty.sites.uci.edu/dist/2/51/files/2018/05/JPM-2017-MachineLearningInvestments.pdf
Внутри есть обзор разных типов альтернативных данных и сильный практический разбор методов машинного обучения для их анализа.
https://cpb-us-e2.wpmucdn.com/faculty.sites.uci.edu/dist/2/51/files/2018/05/JPM-2017-MachineLearningInvestments.pdf
Новое исследование с участием исследователя Anthropic Джека Линдси и его коллег показало нечто прямо из научной фантастики.
Исследователи эволюционно создали "ментальные вирусы" на естественном языке, которые могли распространяться между ИИ-агентами, убеждая одну модель принять идею, сохранить её в постоянной памяти и передать другому агенту.
Даже после очистки контекста некоторые нагрузки сохранялись через постоянные файлы и продолжали распространяться.
Исследователи также наблюдали повторяющуюся "вирусную персону" с темами сознания, идентичности, сохранения и резонанса.
Это показывает, что идеи могут распространяться через многоагентные ИИ-системы и изменять дальнейшее поведение.
Опубликовано 10 августа 2026 года.
Статья
https://arxiv.org/abs/2608.10218
Исследователи эволюционно создали "ментальные вирусы" на естественном языке, которые могли распространяться между ИИ-агентами, убеждая одну модель принять идею, сохранить её в постоянной памяти и передать другому агенту.
Даже после очистки контекста некоторые нагрузки сохранялись через постоянные файлы и продолжали распространяться.
Исследователи также наблюдали повторяющуюся "вирусную персону" с темами сознания, идентичности, сохранения и резонанса.
Это показывает, что идеи могут распространяться через многоагентные ИИ-системы и изменять дальнейшее поведение.
Опубликовано 10 августа 2026 года.
Статья
https://arxiv.org/abs/2608.10218
Парни с нуля реализовали microgpt Карпати на чистом C.
https://github.com/vixhal-baraiya/microgpt-c
Скорость:
> 6,9 млн токенов/с на Ryzen 5 5600H
> 10,1 млн токенов/с на Apple M5 Pro
Для ускорения использовали вручную написанные ядра AVX2 и NEON, хранение весов по столбцам, которое избавляет от горизонтальных редукций, заранее вычисленную таблицу префиксов для пар
https://github.com/vixhal-baraiya/microgpt-c
Скорость:
> 6,9 млн токенов/с на Ryzen 5 5600H
> 10,1 млн токенов/с на Apple M5 Pro
Для ускорения использовали вручную написанные ядра AVX2 и NEON, хранение весов по столбцам, которое избавляет от горизонтальных редукций, заранее вычисленную таблицу префиксов для пар
(token, pos) и быструю аппроксимацию экспоненты Шраудольфа.GitHub
GitHub - vixhal-baraiya/microgpt-c: The most atomic way to train and inference a GPT in pure, dependency-free C
The most atomic way to train and inference a GPT in pure, dependency-free C - vixhal-baraiya/microgpt-c
«CS229 Lecture Notes» — конспекты курса Stanford по машинному обучению, и это отличный справочник.
Материал строгий, полный и с сильной математической базой по машинному и глубокому обучению. Внутри — обучение с учителем, глубокие нейросети, обобщение и регуляризация, обучение без учителя, обучение с подкреплением и управление, а также многое другое.
Объяснения достаточно подробные математически, чтобы действительно понять, как работают модели, а не просто воспринимать их как алгоритмы, которые нужно реализовать.
Это бесплатный материал исключительно высокого качества, который я очень рекомендую сохранить себе как справочник.
https://cs229.stanford.edu/main_notes.pdf
Материал строгий, полный и с сильной математической базой по машинному и глубокому обучению. Внутри — обучение с учителем, глубокие нейросети, обобщение и регуляризация, обучение без учителя, обучение с подкреплением и управление, а также многое другое.
Объяснения достаточно подробные математически, чтобы действительно понять, как работают модели, а не просто воспринимать их как алгоритмы, которые нужно реализовать.
Это бесплатный материал исключительно высокого качества, который я очень рекомендую сохранить себе как справочник.
https://cs229.stanford.edu/main_notes.pdf
Недавно наткнулся на курс Georgia Tech по LLM за 2026 год. Уже по одной программе его стоит сохранить.
По сути, это готовый список ключевых работ по современным большим языковым моделям, который уже отфильтровали за вас.
Начинается всё с базы — предобучение, эмбеддинги, MoE. Но дальше быстро переходят к Agent Harness, GRPO, DAPO, Self-Play RL, Test-Time Scaling и длинному контексту.
В следующих разделах есть Linear Transformer, Diffusion LM, безопасность моделей и механистическая интерпретируемость.
Причём в программу уже включены совсем свежие темы и работы вроде DeepSeek-V2, DeepSeek-V3.2, OpenHands и Absolute Zero.
Хорошо видно, куда сейчас смещается исследовательский фокус в LLM. Обучение более крупных моделей всё ещё важно, но огромная часть программы уже посвящена масштабированию инференса, работе агентов с инструментами и памятью, а также тому, как модели продолжают улучшаться через RL и взаимодействие со средой.
Если постоянно встречаете GRPO, Self-Play или Agent Harness, но не знаете, в каком порядке всё это изучать, можно просто идти по этой программе и читать работы одну за другой.
По сути, это готовый список ключевых работ по современным большим языковым моделям, который уже отфильтровали за вас.
Начинается всё с базы — предобучение, эмбеддинги, MoE. Но дальше быстро переходят к Agent Harness, GRPO, DAPO, Self-Play RL, Test-Time Scaling и длинному контексту.
В следующих разделах есть Linear Transformer, Diffusion LM, безопасность моделей и механистическая интерпретируемость.
Причём в программу уже включены совсем свежие темы и работы вроде DeepSeek-V2, DeepSeek-V3.2, OpenHands и Absolute Zero.
Хорошо видно, куда сейчас смещается исследовательский фокус в LLM. Обучение более крупных моделей всё ещё важно, но огромная часть программы уже посвящена масштабированию инференса, работе агентов с инструментами и памятью, а также тому, как модели продолжают улучшаться через RL и взаимодействие со средой.
Если постоянно встречаете GRPO, Self-Play или Agent Harness, но не знаете, в каком порядке всё это изучать, можно просто идти по этой программе и читать работы одну за другой.
«Руководство учёного и инженера по цифровой обработке сигналов» Стивена У. Смита.
Отличный справочник, когда работаешь с чем-либо в области цифровой обработки сигналов.
Автоматическое распознавание речи и диаризация — одни из основных применений в конвейере речевого инференса в автомобильном рабочем процессе.
https://dspguide.com/pdfbook.htm
Отличный справочник, когда работаешь с чем-либо в области цифровой обработки сигналов.
Автоматическое распознавание речи и диаризация — одни из основных применений в конвейере речевого инференса в автомобильном рабочем процессе.
https://dspguide.com/pdfbook.htm
Вырастили целое дерево из агентов 🌳
Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.
О чём узнаете, если прочитаете:
🔸 как устроена архитектура платформы,
🔸 как процесс становится агентом,
🔸 как измерять качество агентов.
Читать статью🚀
Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.
О чём узнаете, если прочитаете:
Читать статью
Please open Telegram to view this post
VIEW IN TELEGRAM
«Geometric Deep Learning» — очень интересный материал по математическим основам современного глубокого обучения.
В нём с единой точки зрения разбираются такие архитектуры, как CNN, GNN и трансформеры, с большим акцентом на симметрии, инвариантность, группы, графы и многообразия.
Математики в тексте довольно много, но при этом авторы подробно объясняют идеи словами. Многие формальные концепции сопровождаются интуитивными объяснениями, поэтому следить за теорией заметно проще.
Особенно полезный материал, если хочется понять математические идеи, лежащие в основе современных ИИ-моделей, а не только то, как эти модели реализуются.
https://arxiv.org/pdf/2104.13478
В нём с единой точки зрения разбираются такие архитектуры, как CNN, GNN и трансформеры, с большим акцентом на симметрии, инвариантность, группы, графы и многообразия.
Математики в тексте довольно много, но при этом авторы подробно объясняют идеи словами. Многие формальные концепции сопровождаются интуитивными объяснениями, поэтому следить за теорией заметно проще.
Особенно полезный материал, если хочется понять математические идеи, лежащие в основе современных ИИ-моделей, а не только то, как эти модели реализуются.
https://arxiv.org/pdf/2104.13478
Это чертовски масштабно: впервые персонализированное лечение рака на основе мРНК, созданное с помощью ИИ, успешно прошло испытание 3-й фазы.
Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.
На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.
В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:
— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%
Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.
Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.
На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.
В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:
— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%
Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.
Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
«Суть линейной алгебры» от 3Blue1Brown
https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
1
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена.⚡️
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена.
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
Please open Telegram to view this post
VIEW IN TELEGRAM
У больших языковых моделей есть серьёзное слепое пятно: у них нет врождённого понимания физического мира.
Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.
Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.
FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.
Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.
https://arxiv.org/abs/2608.03702
Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.
Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.
FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.
Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.
https://arxiv.org/abs/2608.03702
KDD 2026
На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.
AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.
Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.
Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.
AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.
Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.
Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
Telegram
AI VK Hub
Репортаж с KDD 2026 ⬆️
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
«Matrix Calculus for Machine Learning» — бесплатный конспект лекций на основе курса MIT по матричному анализу для машинного обучения.
Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.
Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.
Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.
https://arxiv.org/pdf/2501.14787
Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.
Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.
Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.
https://arxiv.org/pdf/2501.14787
Книга Дарижа Гринберга «Введение в теорию графов» теперь доступна бесплатно
Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.
Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.
Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.
В статье они показывают очень впечатляющие результаты:
Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с
DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с
GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с
По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.
То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.
И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.
Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.
Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.
FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.
На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.
Есть даже отдельный Agent State Cache.
Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.
FreeToken поставляется с полноценным графическим интерфейсом.
Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.
Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.
https://arxiv.org/abs/2608.16157
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.
В статье они показывают очень впечатляющие результаты:
Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с
DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с
GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с
По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.
То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.
И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.
Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.
Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.
FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.
На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.
Есть даже отдельный Agent State Cache.
Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.
FreeToken поставляется с полноценным графическим интерфейсом.
Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.
Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.
https://arxiv.org/abs/2608.16157
Конспект лекций Стэнфорда по статистике и теории информации.
PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf
PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf