Data Portal | DS & ML
8.37K subscribers
552 photos
140 videos
5 files
748 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
«Analysis of Functions of a Single Variable» — бесплатный учебник по вещественному и комплексному анализу.

В книге разбираются вещественные и комплексные числа, последовательности, пределы, бесконечные ряды, функции, непрерывность, равномерная сходимость, дифференцирование, разложения Тейлора, интегрирование, длина дуги и контурные интегралы.

Также выводятся ключевые результаты: теорема Грина, теорема Коши, теорема о вычетах и основная теорема алгебры.

Особенно полезна книга тем, что в ней много аккуратных доказательств и математических выводов. Она рассчитана на старшие курсы бакалавриата и первый год магистратуры и хорошо подходит как переход от обычного матанализа к строгому вещественному и комплексному анализу.

Если изучаете эти темы, стоит сохранить.

https://spot.colorado.edu/~baggett/book.pdf
Теорема Байеса — одна из фундаментальных концепций в Data Science.

Но мне понадобилось два года, чтобы по-настоящему понять её важность.

За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали.

1. Предыстория

Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса.

В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность.

2. Теорема Байеса

Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных.

Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом.

3. Байесовская статистика

Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления.

Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом.

Благодаря этому можно делать вероятностные выводы о неизвестных параметрах.

Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость.

4. Байесовский и частотный подходы

Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни.

В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений.

Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл.

5. Байесовское машинное обучение

Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны.

Например:

Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями.

Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений.

6. Применение в бизнесе

Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных.

По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.
Исследователи впервые в больших масштабах извлекли настоящие скрытые рассуждения из закрытых моделей OpenAI, Anthropic и Google.

Затем они использовали эти данные для изучения Kimi K3, GLM-5.2, DeepSeek и других открытых моделей.

OpenAI, Anthropic и Google всё реже показывают пользователям полные цепочки рассуждений. Итоговый ответ можно скопировать, но гораздо ценнее понять, как именно модель к нему пришла.

Если получить большое количество полных рассуждений, их можно использовать для дистилляции и обучения собственной модели.

Поэтому программные интерфейсы шифруют рассуждения и возвращают их клиенту. Пользователь не видит содержимое, но при следующем запросе зашифрованные данные можно снова передать модели, чтобы она продолжила с того же места.

Исследователи обнаружили, что зашифрованные рассуждения совместимы между разными пользователями, сессиями и даже моделями одного разработчика.

Сначала самая мощная модель создаёт рассуждение. Затем его зашифрованную версию передают более слабой и менее защищённой модели того же разработчика. После обхода ограничений маленькая модель расшифровывает и воспроизводит мысли старшей модели.

Например, скрытые рассуждения Claude Opus 4.8 можно передать Haiku и заставить её прочитать содержимое. Взламывать саму Opus для этого не требуется.

Исследователи успешно извлекли скрытые рассуждения из Claude, GPT и Gemini, обойдя защиту от дистилляции.

Авторы получили настоящие рассуждения GPT-5.6 Sol и Claude Opus 4.8, после чего передали их моделям Kimi-K3, Kimi-K2.6, Kimi-K2.5, GLM-5.2, DeepSeek-V3.1 и Inkling.

Стиль рассуждений Kimi-K3, Kimi-K2.6, Kimi-K2.5 и GLM-5.2 заметно изменился.

В тесте AIME модели Kimi-K3 передали небольшой фрагмент рассуждений GPT-5.6 Sol. После этого она начала генерировать ответы с формулировками, очень близкими к ответам GPT-5.6 Sol.

Анализ вероятностного распределения текста также показал, что среди внешних рассуждений, наиболее похожих на собственное распределение GLM-5.2, оказались рассуждения четырёх последовательных поколений моделей Anthropic.

Авторы подчёркивают, что эти результаты не доказывают дистилляцию одной модели из другой.

Раньше для дистилляции можно было задать Claude миллион вопросов, собрать пары "вопрос — ответ" и использовать их для обучения собственной модели.

Теперь гораздо более ценным набором данных становится полная последовательность:

вопрос → рассуждение → ответ.

Из общедоступных журналов работы агентов на GitHub и Hugging Face исследователи расшифровали 315 320 скрытых блоков рассуждений.

В них обнаружились 367 фрагментов персональных данных и 182 ключа, пароля и других учётных данных.

Полная цепочка рассуждений — это почти готовый материал для обучения другой модели. Если её можно массово извлекать через более слабую модель того же разработчика, то одной защиты весов уже недостаточно.

Закрытая модель может не показывать, как она думает. Но это больше не означает, что никто не сможет это прочитать.

Статья: https://arxiv.org/abs/2608.09867

Примеры извлечённых рассуждений: https://stolen-thoughts.com/
Как научить рекомендации думать не о следующем лайке, а о всей сессии?

Обычно рекомендательные системы оптимизируют ближайший сигнал: клик, лайк или дослушивание. Но каждое действие меняет состояние пользователя, поэтому локально хорошая рекомендация не обязательно улучшает всю сессию.

В новой работе AI VK Research рекомендации формулируются как задача обучения с подкреплением. Модель рассматривает пользователя как среду, рекомендацию — как действие, а реакцию пользователя — как награду.

Главная проблема — обучение на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать различия между старой и новой политиками и контролировать рост дисперсии.

В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенного ухудшения стандартных метрик.

Получается интересный сдвиг: модель оптимизирует не отдельное взаимодействие, а последствия рекомендации для всей сессии.

https://habr.com/ru/companies/vk/articles/1068050/
Исследователи Tencent и Университета Цинхуа представили CALM — языковую модель, которая генерирует текст не по одному токену, а сразу целыми фрагментами.

Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.

В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.

Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.

Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.

https://arxiv.org/pdf/2510.27688
«Beginning in Algebraic Geometry» — ещё один бесплатный учебник с открытым доступом, который даёт строгий, но при этом довольно доступный вход в алгебраическую геометрию.

Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.

Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.

После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.

На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.

https://link.springer.com/book/10.1007/978-3-031-88819-9
Ещё один отличный плейлист по структурам данных и алгоритмам от pmavrin.

https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
Awesome Math — огромная подборка материалов по математике в одном репозитории.

Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.

Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.

https://github.com/rossant/awesome-math
Бесплатный PDF новой книги по оптимизации:

http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
«Transformer с полной пропускной способностью»

Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.

В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.

На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.

При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.

https://alphaxiv.org/abs/2608.08888
This media is not supported in your browser
VIEW IN TELEGRAM
Все шесть тригонометрических функций — это просто длины на одной окружности.
Одно из ЛУЧШИХ видео от data_adventurer.

Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.

После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.

Очень рекомендую посмотреть!

https://youtu.be/55QWsm1itKo
https://github.com/patchy631/time-to-first-token

Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.

Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.

В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
27-миллиардный агент обошёл Claude Opus 4.8 и GPT-5.5 в воспроизведении научных исследований на отложенном наборе задач.

Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.

Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.

Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.

Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.

Статья - https://arxiv.org/abs/2608.13331
«Introduction to Machine Learning» Лорана Юнеса.

Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.

В книге разбираются:

— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности

Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.

https://arxiv.org/abs/2409.02668
«Natural Language Processing and Large Language Models» — новая книга в открытом доступе от Springer, написанная Chengqing Zong, Yang Zhao и Yanjun Ma.

Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.

Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.

На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.

https://link.springer.com/book/10.1007/978-981-92-0682-7
Генерирует высокодетализированные 3D-формы с помощью масштабируемого диффузионного подхода, который последовательно уточняет грубую геометрию с использованием воксельных методов. Репозиторий UltraShape-1.0 описывает задачу как генерацию высокоточных 3D-форм через масштабируемое геометрическое уточнение.

https://github.com/PKU-YuanGroup/UltraShape-1.0
Отличная серия лекций по аппаратному обеспечению и системам для машинного обучения.

Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.

Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Transformers – The Definitive Guide — официальный репозиторий с кодом к книге, построенный вокруг практических Jupyter-ноутбуков для изучения и применения трансформерных моделей.

Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.

https://github.com/Nicolepcx/transformers-the-definitive-guide