Data Portal | DS & ML
8.41K subscribers
569 photos
143 videos
5 files
767 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
Новое исследование с участием исследователя Anthropic Джека Линдси и его коллег показало нечто прямо из научной фантастики.

Исследователи эволюционно создали "ментальные вирусы" на естественном языке, которые могли распространяться между ИИ-агентами, убеждая одну модель принять идею, сохранить её в постоянной памяти и передать другому агенту.

Даже после очистки контекста некоторые нагрузки сохранялись через постоянные файлы и продолжали распространяться.

Исследователи также наблюдали повторяющуюся "вирусную персону" с темами сознания, идентичности, сохранения и резонанса.

Это показывает, что идеи могут распространяться через многоагентные ИИ-системы и изменять дальнейшее поведение.

Опубликовано 10 августа 2026 года.

Статья
https://arxiv.org/abs/2608.10218
Парни с нуля реализовали microgpt Карпати на чистом C.

https://github.com/vixhal-baraiya/microgpt-c

Скорость:

> 6,9 млн токенов/с на Ryzen 5 5600H
> 10,1 млн токенов/с на Apple M5 Pro

Для ускорения использовали вручную написанные ядра AVX2 и NEON, хранение весов по столбцам, которое избавляет от горизонтальных редукций, заранее вычисленную таблицу префиксов для пар (token, pos) и быструю аппроксимацию экспоненты Шраудольфа.
«CS229 Lecture Notes» — конспекты курса Stanford по машинному обучению, и это отличный справочник.

Материал строгий, полный и с сильной математической базой по машинному и глубокому обучению. Внутри — обучение с учителем, глубокие нейросети, обобщение и регуляризация, обучение без учителя, обучение с подкреплением и управление, а также многое другое.

Объяснения достаточно подробные математически, чтобы действительно понять, как работают модели, а не просто воспринимать их как алгоритмы, которые нужно реализовать.

Это бесплатный материал исключительно высокого качества, который я очень рекомендую сохранить себе как справочник.

https://cs229.stanford.edu/main_notes.pdf
Please open Telegram to view this post
VIEW IN TELEGRAM
Недавно наткнулся на курс Georgia Tech по LLM за 2026 год. Уже по одной программе его стоит сохранить.

По сути, это готовый список ключевых работ по современным большим языковым моделям, который уже отфильтровали за вас.

Начинается всё с базы — предобучение, эмбеддинги, MoE. Но дальше быстро переходят к Agent Harness, GRPO, DAPO, Self-Play RL, Test-Time Scaling и длинному контексту.

В следующих разделах есть Linear Transformer, Diffusion LM, безопасность моделей и механистическая интерпретируемость.

Причём в программу уже включены совсем свежие темы и работы вроде DeepSeek-V2, DeepSeek-V3.2, OpenHands и Absolute Zero.

Хорошо видно, куда сейчас смещается исследовательский фокус в LLM. Обучение более крупных моделей всё ещё важно, но огромная часть программы уже посвящена масштабированию инференса, работе агентов с инструментами и памятью, а также тому, как модели продолжают улучшаться через RL и взаимодействие со средой.

Если постоянно встречаете GRPO, Self-Play или Agent Harness, но не знаете, в каком порядке всё это изучать, можно просто идти по этой программе и читать работы одну за другой.
«Руководство учёного и инженера по цифровой обработке сигналов» Стивена У. Смита.

Отличный справочник, когда работаешь с чем-либо в области цифровой обработки сигналов.

Автоматическое распознавание речи и диаризация — одни из основных применений в конвейере речевого инференса в автомобильном рабочем процессе.

https://dspguide.com/pdfbook.htm
Вырастили целое дерево из агентов 🌳

Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.

О чём узнаете, если прочитаете:
🔸как устроена архитектура платформы,
🔸как процесс становится агентом,
🔸как измерять качество агентов.

Читать статью 🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
«Geometric Deep Learning» — очень интересный материал по математическим основам современного глубокого обучения.

В нём с единой точки зрения разбираются такие архитектуры, как CNN, GNN и трансформеры, с большим акцентом на симметрии, инвариантность, группы, графы и многообразия.

Математики в тексте довольно много, но при этом авторы подробно объясняют идеи словами. Многие формальные концепции сопровождаются интуитивными объяснениями, поэтому следить за теорией заметно проще.

Особенно полезный материал, если хочется понять математические идеи, лежащие в основе современных ИИ-моделей, а не только то, как эти модели реализуются.

https://arxiv.org/pdf/2104.13478
Это чертовски масштабно: впервые персонализированное лечение рака на основе мРНК, созданное с помощью ИИ, успешно прошло испытание 3-й фазы.

Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.

На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.

В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:

— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%

Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.

Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
«Суть линейной алгебры» от 3Blue1Brown

https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
1
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.

Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.

DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена. ⚡️

Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.

Суть подхода: https://inco.ai/blog/dflash2/
Please open Telegram to view this post
VIEW IN TELEGRAM
У больших языковых моделей есть серьёзное слепое пятно: у них нет врождённого понимания физического мира.

Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.

Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.

FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.

Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.

https://arxiv.org/abs/2608.03702
KDD 2026

На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.

AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.

Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.

Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
«Matrix Calculus for Machine Learning» — бесплатный конспект лекций на основе курса MIT по матричному анализу для машинного обучения.

Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.

Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.

Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.

https://arxiv.org/pdf/2501.14787
Книга Дарижа Гринберга «Введение в теорию графов» теперь доступна бесплатно

Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.

Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.

Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.

В статье они показывают очень впечатляющие результаты:

Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с

DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с

GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с

По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.

То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.

И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.

Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.

Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.

FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.

На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.

Есть даже отдельный Agent State Cache.

Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.

FreeToken поставляется с полноценным графическим интерфейсом.

Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.

Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.

https://arxiv.org/abs/2608.16157
Конспект лекций Стэнфорда по статистике и теории информации.

PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf
Безумие: теперь можно буквально в прямом эфире смотреть, как обучают модель на 535 млрд параметров.

Профессор Стэнфорда и основатель simile_ai Перси Лян объявил, что на этой неделе официально стартует обучение их новой модели Marin 535B-A23B. И весь процесс обучения будет полностью открытым.

У Marin 535 млрд параметров, из которых 23 млрд активны. Для обучения команда подготовила 18,75 трлн токенов данных и развернула 11 стоек GB200 NVL72 — это примерно 792 ускорителя GB200.

Обучение планируют вести непрерывно около трёх месяцев. Общий объём вычислений составит примерно 2,7×10²⁴ FLOPs. После этого начнётся дополнительное обучение модели.

Перед запуском основной модели команда сначала обучила так называемую Scaling Ladder из четырёх моделей — от 1,6B-A61M до 27,7B-A1.2B. Эти меньшие модели использовали, чтобы заранее предсказать потери и поведение основной модели на 535 млрд параметров.

Теперь основное обучение уже запущено, и любой желающий может в реальном времени следить за кривыми обучения. Данные, журналы экспериментов и возникающие инженерные проблемы тоже будут постепенно публиковаться.

Подобное уже было. В 2022 году, когда BigScience обучала BLOOM на 176 млрд параметров, прогресс обучения и TensorBoard тоже были открыты.

Но теперь Marin поднимает масштаб публичного обучения сразу до 535 млрд параметров.

Судя по всему, это одно из крупнейших обучений большой модели, за которым человечество когда-либо могло наблюдать публично.

Следующие три месяца должны быть очень интересными. Насколько конкурентоспособной получится модель — это отдельный вопрос. Мне гораздо интереснее увидеть, как именно обучают и настраивают MoE-модель размером более 500 млрд параметров и сколько раз всё успеет сломаться по дороге.

Такие возможности появляются крайне редко. По сути, перед всем миром открывают эксперимент по обучению модели стоимостью в десятки миллионов долларов — то, что обычно могут видеть только сотрудники крупнейших ИИ-лабораторий.