Теорема Байеса — одна из фундаментальных концепций в Data Science.
Но мне понадобилось два года, чтобы по-настоящему понять её важность.
За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали.
1. Предыстория
Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса.
В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность.
2. Теорема Байеса
Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных.
Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом.
3. Байесовская статистика
Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления.
Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом.
Благодаря этому можно делать вероятностные выводы о неизвестных параметрах.
Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость.
4. Байесовский и частотный подходы
Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни.
В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений.
Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл.
5. Байесовское машинное обучение
Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны.
Например:
Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями.
Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений.
6. Применение в бизнесе
Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных.
По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.
Но мне понадобилось два года, чтобы по-настоящему понять её важность.
За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали.
1. Предыстория
Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса.
В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность.
2. Теорема Байеса
Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных.
Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом.
3. Байесовская статистика
Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления.
Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом.
Благодаря этому можно делать вероятностные выводы о неизвестных параметрах.
Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость.
4. Байесовский и частотный подходы
Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни.
В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений.
Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл.
5. Байесовское машинное обучение
Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны.
Например:
Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями.
Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений.
6. Применение в бизнесе
Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных.
По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.
Исследователи впервые в больших масштабах извлекли настоящие скрытые рассуждения из закрытых моделей OpenAI, Anthropic и Google.
Затем они использовали эти данные для изучения Kimi K3, GLM-5.2, DeepSeek и других открытых моделей.
OpenAI, Anthropic и Google всё реже показывают пользователям полные цепочки рассуждений. Итоговый ответ можно скопировать, но гораздо ценнее понять, как именно модель к нему пришла.
Если получить большое количество полных рассуждений, их можно использовать для дистилляции и обучения собственной модели.
Поэтому программные интерфейсы шифруют рассуждения и возвращают их клиенту. Пользователь не видит содержимое, но при следующем запросе зашифрованные данные можно снова передать модели, чтобы она продолжила с того же места.
Исследователи обнаружили, что зашифрованные рассуждения совместимы между разными пользователями, сессиями и даже моделями одного разработчика.
Сначала самая мощная модель создаёт рассуждение. Затем его зашифрованную версию передают более слабой и менее защищённой модели того же разработчика. После обхода ограничений маленькая модель расшифровывает и воспроизводит мысли старшей модели.
Например, скрытые рассуждения Claude Opus 4.8 можно передать Haiku и заставить её прочитать содержимое. Взламывать саму Opus для этого не требуется.
Исследователи успешно извлекли скрытые рассуждения из Claude, GPT и Gemini, обойдя защиту от дистилляции.
Авторы получили настоящие рассуждения GPT-5.6 Sol и Claude Opus 4.8, после чего передали их моделям Kimi-K3, Kimi-K2.6, Kimi-K2.5, GLM-5.2, DeepSeek-V3.1 и Inkling.
Стиль рассуждений Kimi-K3, Kimi-K2.6, Kimi-K2.5 и GLM-5.2 заметно изменился.
В тесте AIME модели Kimi-K3 передали небольшой фрагмент рассуждений GPT-5.6 Sol. После этого она начала генерировать ответы с формулировками, очень близкими к ответам GPT-5.6 Sol.
Анализ вероятностного распределения текста также показал, что среди внешних рассуждений, наиболее похожих на собственное распределение GLM-5.2, оказались рассуждения четырёх последовательных поколений моделей Anthropic.
Авторы подчёркивают, что эти результаты не доказывают дистилляцию одной модели из другой.
Раньше для дистилляции можно было задать Claude миллион вопросов, собрать пары "вопрос — ответ" и использовать их для обучения собственной модели.
Теперь гораздо более ценным набором данных становится полная последовательность:
вопрос → рассуждение → ответ.
Из общедоступных журналов работы агентов на GitHub и Hugging Face исследователи расшифровали 315 320 скрытых блоков рассуждений.
В них обнаружились 367 фрагментов персональных данных и 182 ключа, пароля и других учётных данных.
Полная цепочка рассуждений — это почти готовый материал для обучения другой модели. Если её можно массово извлекать через более слабую модель того же разработчика, то одной защиты весов уже недостаточно.
Закрытая модель может не показывать, как она думает. Но это больше не означает, что никто не сможет это прочитать.
Статья: https://arxiv.org/abs/2608.09867
Примеры извлечённых рассуждений: https://stolen-thoughts.com/
Затем они использовали эти данные для изучения Kimi K3, GLM-5.2, DeepSeek и других открытых моделей.
OpenAI, Anthropic и Google всё реже показывают пользователям полные цепочки рассуждений. Итоговый ответ можно скопировать, но гораздо ценнее понять, как именно модель к нему пришла.
Если получить большое количество полных рассуждений, их можно использовать для дистилляции и обучения собственной модели.
Поэтому программные интерфейсы шифруют рассуждения и возвращают их клиенту. Пользователь не видит содержимое, но при следующем запросе зашифрованные данные можно снова передать модели, чтобы она продолжила с того же места.
Исследователи обнаружили, что зашифрованные рассуждения совместимы между разными пользователями, сессиями и даже моделями одного разработчика.
Сначала самая мощная модель создаёт рассуждение. Затем его зашифрованную версию передают более слабой и менее защищённой модели того же разработчика. После обхода ограничений маленькая модель расшифровывает и воспроизводит мысли старшей модели.
Например, скрытые рассуждения Claude Opus 4.8 можно передать Haiku и заставить её прочитать содержимое. Взламывать саму Opus для этого не требуется.
Исследователи успешно извлекли скрытые рассуждения из Claude, GPT и Gemini, обойдя защиту от дистилляции.
Авторы получили настоящие рассуждения GPT-5.6 Sol и Claude Opus 4.8, после чего передали их моделям Kimi-K3, Kimi-K2.6, Kimi-K2.5, GLM-5.2, DeepSeek-V3.1 и Inkling.
Стиль рассуждений Kimi-K3, Kimi-K2.6, Kimi-K2.5 и GLM-5.2 заметно изменился.
В тесте AIME модели Kimi-K3 передали небольшой фрагмент рассуждений GPT-5.6 Sol. После этого она начала генерировать ответы с формулировками, очень близкими к ответам GPT-5.6 Sol.
Анализ вероятностного распределения текста также показал, что среди внешних рассуждений, наиболее похожих на собственное распределение GLM-5.2, оказались рассуждения четырёх последовательных поколений моделей Anthropic.
Авторы подчёркивают, что эти результаты не доказывают дистилляцию одной модели из другой.
Раньше для дистилляции можно было задать Claude миллион вопросов, собрать пары "вопрос — ответ" и использовать их для обучения собственной модели.
Теперь гораздо более ценным набором данных становится полная последовательность:
вопрос → рассуждение → ответ.
Из общедоступных журналов работы агентов на GitHub и Hugging Face исследователи расшифровали 315 320 скрытых блоков рассуждений.
В них обнаружились 367 фрагментов персональных данных и 182 ключа, пароля и других учётных данных.
Полная цепочка рассуждений — это почти готовый материал для обучения другой модели. Если её можно массово извлекать через более слабую модель того же разработчика, то одной защиты весов уже недостаточно.
Закрытая модель может не показывать, как она думает. Но это больше не означает, что никто не сможет это прочитать.
Статья: https://arxiv.org/abs/2608.09867
Примеры извлечённых рассуждений: https://stolen-thoughts.com/
arXiv.org
Stealing Reasoning Traces from Proprietary LLM APIs
Leading large language model providers now conceal their models' step-by-step reasoning, or chain-of-thought, to protect intellectual property and limit information leakage. Rather than storing...
Как научить рекомендации думать не о следующем лайке, а о всей сессии?
Обычно рекомендательные системы оптимизируют ближайший сигнал: клик, лайк или дослушивание. Но каждое действие меняет состояние пользователя, поэтому локально хорошая рекомендация не обязательно улучшает всю сессию.
В новой работе AI VK Research рекомендации формулируются как задача обучения с подкреплением. Модель рассматривает пользователя как среду, рекомендацию — как действие, а реакцию пользователя — как награду.
Главная проблема — обучение на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать различия между старой и новой политиками и контролировать рост дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенного ухудшения стандартных метрик.
Получается интересный сдвиг: модель оптимизирует не отдельное взаимодействие, а последствия рекомендации для всей сессии.
https://habr.com/ru/companies/vk/articles/1068050/
Обычно рекомендательные системы оптимизируют ближайший сигнал: клик, лайк или дослушивание. Но каждое действие меняет состояние пользователя, поэтому локально хорошая рекомендация не обязательно улучшает всю сессию.
В новой работе AI VK Research рекомендации формулируются как задача обучения с подкреплением. Модель рассматривает пользователя как среду, рекомендацию — как действие, а реакцию пользователя — как награду.
Главная проблема — обучение на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать различия между старой и новой политиками и контролировать рост дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенного ухудшения стандартных метрик.
Получается интересный сдвиг: модель оптимизирует не отдельное взаимодействие, а последствия рекомендации для всей сессии.
https://habr.com/ru/companies/vk/articles/1068050/
Исследователи Tencent и Университета Цинхуа представили CALM — языковую модель, которая генерирует текст не по одному токену, а сразу целыми фрагментами.
Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.
В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.
Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.
Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.
https://arxiv.org/pdf/2510.27688
Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.
В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.
Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.
Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.
https://arxiv.org/pdf/2510.27688
«Beginning in Algebraic Geometry» — ещё один бесплатный учебник с открытым доступом, который даёт строгий, но при этом довольно доступный вход в алгебраическую геометрию.
Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.
Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.
После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.
На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.
https://link.springer.com/book/10.1007/978-3-031-88819-9
Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.
Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.
После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.
На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.
https://link.springer.com/book/10.1007/978-3-031-88819-9
Ещё один отличный плейлист по структурам данных и алгоритмам от pmavrin.
https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
Awesome Math — огромная подборка материалов по математике в одном репозитории.
Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.
Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.
https://github.com/rossant/awesome-math
Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.
Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.
https://github.com/rossant/awesome-math
GitHub
GitHub - rossant/awesome-math: A curated list of awesome mathematics resources
A curated list of awesome mathematics resources. Contribute to rossant/awesome-math development by creating an account on GitHub.
Бесплатный PDF новой книги по оптимизации:
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
«Transformer с полной пропускной способностью»
Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.
https://alphaxiv.org/abs/2608.08888
Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.
https://alphaxiv.org/abs/2608.08888
This media is not supported in your browser
VIEW IN TELEGRAM
Все шесть тригонометрических функций — это просто длины на одной окружности.
Одно из ЛУЧШИХ видео от data_adventurer.
Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.
После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.
Очень рекомендую посмотреть!
https://youtu.be/55QWsm1itKo
Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели.
После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона.
Очень рекомендую посмотреть!
https://youtu.be/55QWsm1itKo
https://github.com/patchy631/time-to-first-token
Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.
Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.
В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо.
Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию.
В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
GitHub
GitHub - patchy631/time-to-first-token: A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang…
A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking. - patchy631/time-to-first-token
27-миллиардный агент обошёл Claude Opus 4.8 и GPT-5.5 в воспроизведении научных исследований на отложенном наборе задач.
Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.
Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.
Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.
Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.
Статья - https://arxiv.org/abs/2608.13331
Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке.
Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения.
Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки.
Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру.
Статья - https://arxiv.org/abs/2608.13331
«Introduction to Machine Learning» Лорана Юнеса.
Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.
В книге разбираются:
— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности
Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.
https://arxiv.org/abs/2409.02668
Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её.
В книге разбираются:
— оптимизация, SGD и Adam
— компромисс смещения и дисперсии
— регрессия, SVM и ядерные методы
— деревья решений
— нейронные сети
— графические и генеративные модели
— кластеризация
— оценки границ обобщающей способности
Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения.
https://arxiv.org/abs/2409.02668
«Natural Language Processing and Large Language Models» — новая книга в открытом доступе от Springer, написанная Chengqing Zong, Yang Zhao и Yanjun Ma.
Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.
Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.
На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.
https://link.springer.com/book/10.1007/978-981-92-0682-7
Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели.
Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF.
На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил.
https://link.springer.com/book/10.1007/978-981-92-0682-7
Генерирует высокодетализированные 3D-формы с помощью масштабируемого диффузионного подхода, который последовательно уточняет грубую геометрию с использованием воксельных методов. Репозиторий UltraShape-1.0 описывает задачу как генерацию высокоточных 3D-форм через масштабируемое геометрическое уточнение.
https://github.com/PKU-YuanGroup/UltraShape-1.0
https://github.com/PKU-YuanGroup/UltraShape-1.0
Отличная серия лекций по аппаратному обеспечению и системам для машинного обучения.
Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.
Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем.
Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Transformers – The Definitive Guide — официальный репозиторий с кодом к книге, построенный вокруг практических Jupyter-ноутбуков для изучения и применения трансформерных моделей.
Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.
https://github.com/Nicolepcx/transformers-the-definitive-guide
Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab.
https://github.com/Nicolepcx/transformers-the-definitive-guide
Каждая модель машинного обучения, которую вы когда-либо обучали, в конечном счёте опирается на 62 страницы, написанные ещё в 1933 году.
Речь о «Основах теории вероятностей» Колмогорова.
Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге.
Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать.
Книга бесплатно доступна в подборке Awesome Math Books.
https://github.com/valeman/Awesome_Math_Books
Речь о «Основах теории вероятностей» Колмогорова.
Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге.
Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать.
Книга бесплатно доступна в подборке Awesome Math Books.
https://github.com/valeman/Awesome_Math_Books