Сильная новая работа от Meta.
Обычно законы масштабирования предполагают, что размер модели и объём данных влияют на ошибку независимо друг от друга.
В этой работе авторы вводят Skaling law — закон, который связывает ёмкость модели и данные через единый параметр взаимодействия.
Дополнительный член снижает среднюю абсолютную процентную ошибку примерно в 1,5–3 раза как при интерполяции, так и при экстраполяции.
Самые заметные улучшения — в режимах, где данных мало или модель сильно переобучают. Именно там стандартные законы Chinchilla и Kaplan начинают заметно промахиваться.
Ещё одна важная часть: вместе с разреженной сеткой небольших запусков метод позволяет экстраполировать всю картину примерно с в 10 раз меньшими вычислительными затратами, чем при равномерном переборе.
Почему это важно?
Сегодня модели часто обучают и разворачивают далеко за пределами классического вычислительно-оптимального режима. Если закон масштабирования остаётся точным и там, причём его можно оценить на небольших запусках, это напрямую меняет то, как можно планировать бюджет на предобучение.
Работа: https://arxiv.org/abs/2608.07222
Обычно законы масштабирования предполагают, что размер модели и объём данных влияют на ошибку независимо друг от друга.
В этой работе авторы вводят Skaling law — закон, который связывает ёмкость модели и данные через единый параметр взаимодействия.
Дополнительный член снижает среднюю абсолютную процентную ошибку примерно в 1,5–3 раза как при интерполяции, так и при экстраполяции.
Самые заметные улучшения — в режимах, где данных мало или модель сильно переобучают. Именно там стандартные законы Chinchilla и Kaplan начинают заметно промахиваться.
Ещё одна важная часть: вместе с разреженной сеткой небольших запусков метод позволяет экстраполировать всю картину примерно с в 10 раз меньшими вычислительными затратами, чем при равномерном переборе.
Почему это важно?
Сегодня модели часто обучают и разворачивают далеко за пределами классического вычислительно-оптимального режима. Если закон масштабирования остаётся точным и там, причём его можно оценить на небольших запусках, это напрямую меняет то, как можно планировать бюджет на предобучение.
Работа: https://arxiv.org/abs/2608.07222
Google DeepMind утверждает, что привычный RAG упирается в фундаментальный предел.
Последние три года стандартный ответ почти на любую задачу с памятью или данными для ИИ выглядел одинаково: разбить данные на части, положить их в векторную базу и искать по эмбеддингам.
Обычно предполагается, что если поиск работает плохо, проблема лишь в качестве модели: больше данных, больше параметров, лучше обучение — и всё станет точнее.
В новой работе DeepMind показывает, что это не всегда так.
Главная проблема — подход, где целый документ или сложный запрос сжимается в один вектор фиксированной длины, а затем релевантность определяется через близость этих векторов.
Авторы математически показывают, что у такого подхода есть жёсткий предел: количество различных комбинаций документов, которые система способна корректно различать для разных запросов, ограничено размерностью пространства эмбеддингов.
И этот предел нельзя просто пробить дополнительным обучением или увеличением объёма данных.
Для проверки авторы создали набор LIMIT и протестировали современные модели эмбеддингов с тысячами измерений. На сложных запросах с несколькими зависимостями одновекторное представление начинает терять важный контекст и возвращать нерелевантные документы.
Причина довольно простая: один вектор плохо подходит для описания сложных связей между множеством документов и условий одновременно.
Если память агента полностью построена на обычном одновекторном поиске, то на сложных задачах это уже не просто вопрос хороших эмбеддингов или правильного промпта. Ограничение заложено в самой архитектуре.
Похоже, следующий шаг для RAG — уход от идеи «один документ = один вектор» к более сложным схемам представления и поиска.
https://arxiv.org/pdf/2508.21038
Последние три года стандартный ответ почти на любую задачу с памятью или данными для ИИ выглядел одинаково: разбить данные на части, положить их в векторную базу и искать по эмбеддингам.
Обычно предполагается, что если поиск работает плохо, проблема лишь в качестве модели: больше данных, больше параметров, лучше обучение — и всё станет точнее.
В новой работе DeepMind показывает, что это не всегда так.
Главная проблема — подход, где целый документ или сложный запрос сжимается в один вектор фиксированной длины, а затем релевантность определяется через близость этих векторов.
Авторы математически показывают, что у такого подхода есть жёсткий предел: количество различных комбинаций документов, которые система способна корректно различать для разных запросов, ограничено размерностью пространства эмбеддингов.
И этот предел нельзя просто пробить дополнительным обучением или увеличением объёма данных.
Для проверки авторы создали набор LIMIT и протестировали современные модели эмбеддингов с тысячами измерений. На сложных запросах с несколькими зависимостями одновекторное представление начинает терять важный контекст и возвращать нерелевантные документы.
Причина довольно простая: один вектор плохо подходит для описания сложных связей между множеством документов и условий одновременно.
Если память агента полностью построена на обычном одновекторном поиске, то на сложных задачах это уже не просто вопрос хороших эмбеддингов или правильного промпта. Ограничение заложено в самой архитектуре.
Похоже, следующий шаг для RAG — уход от идеи «один документ = один вектор» к более сложным схемам представления и поиска.
https://arxiv.org/pdf/2508.21038
Что скрывается за монетизацией поиска и реков в Авито 👀
Рассчитать ожидаемую выручку сложнее, чем кажется: нельзя просто умножить вероятность на ставку. На практике всё упирается в данные, метрики и бизнес-ограничения.
Если вам интересно, как работает наше ранжирование, приходите на Хабр почитать и оставить комментарии.
Рассчитать ожидаемую выручку сложнее, чем кажется: нельзя просто умножить вероятность на ставку. На практике всё упирается в данные, метрики и бизнес-ограничения.
Если вам интересно, как работает наше ранжирование, приходите на Хабр почитать и оставить комментарии.
Please open Telegram to view this post
VIEW IN TELEGRAM
«Patterns, Predictions, and Actions» — бесплатная книга по математическим основам машинного обучения. Она сочетает понятное изложение с математикой, на которой построен современный ML.
В книге разбираются предсказание, обучение с учителем, оптимизация, обобщающая способность моделей, глубокое обучение, датасеты, причинность, последовательное принятие решений и обучение с подкреплением.
Отдельно авторы объясняют, как предсказания превращаются в решения, какую роль играют данные и бенчмарки, а также где у машинного обучения есть ограничения и какие последствия возникают при его использовании на практике.
По уровню это примерно вводный курс магистратуры. Нужна рабочая база по линейной алгебре, матанализу и теории вероятностей.
Хорошая книга для тех, кто хочет не просто научиться запускать модели, а начать понимать ML от математического фундамента до практических последствий.
https://mlstory.org/pdf/patterns.pdf
В книге разбираются предсказание, обучение с учителем, оптимизация, обобщающая способность моделей, глубокое обучение, датасеты, причинность, последовательное принятие решений и обучение с подкреплением.
Отдельно авторы объясняют, как предсказания превращаются в решения, какую роль играют данные и бенчмарки, а также где у машинного обучения есть ограничения и какие последствия возникают при его использовании на практике.
По уровню это примерно вводный курс магистратуры. Нужна рабочая база по линейной алгебре, матанализу и теории вероятностей.
Хорошая книга для тех, кто хочет не просто научиться запускать модели, а начать понимать ML от математического фундамента до практических последствий.
https://mlstory.org/pdf/patterns.pdf
«Introduction to Probability» — отличный бесплатный учебник MIT по теории вероятностей.
В книге разбираются вероятностные модели, условная вероятность, независимость, формула Байеса, дискретные и непрерывные случайные величины, распределения вероятностей, математическое ожидание, дисперсия, ковариация, корреляция, условное ожидание, преобразования и свёртки, процессы Бернулли и Пуассона, цепи Маркова, закон больших чисел и центральная предельная теорема.
Объяснения очень понятные, математика строгая, но без лишнего усложнения. Плюс внутри много примеров и задач с полными решениями.
Особенно полезна для самостоятельного изучения или как справочник, когда нужно быстро освежить конкретную тему по вероятностям.
Для машинного обучения это уже прямо фундаментальная база. Теория вероятностей нужна почти везде: от статистики и байесовских методов до обучения моделей, оценки неопределённости и генеративных моделей.
Сохраняйте в закладки. Пригодится.
https://vfu.bg/en/e-Learning/Math--Bertsekas_Tsitsiklis_Introduction_to_probability.pdf
В книге разбираются вероятностные модели, условная вероятность, независимость, формула Байеса, дискретные и непрерывные случайные величины, распределения вероятностей, математическое ожидание, дисперсия, ковариация, корреляция, условное ожидание, преобразования и свёртки, процессы Бернулли и Пуассона, цепи Маркова, закон больших чисел и центральная предельная теорема.
Объяснения очень понятные, математика строгая, но без лишнего усложнения. Плюс внутри много примеров и задач с полными решениями.
Особенно полезна для самостоятельного изучения или как справочник, когда нужно быстро освежить конкретную тему по вероятностям.
Для машинного обучения это уже прямо фундаментальная база. Теория вероятностей нужна почти везде: от статистики и байесовских методов до обучения моделей, оценки неопределённости и генеративных моделей.
Сохраняйте в закладки. Пригодится.
https://vfu.bg/en/e-Learning/Math--Bertsekas_Tsitsiklis_Introduction_to_probability.pdf
This media is not supported in your browser
VIEW IN TELEGRAM
Вот как, по-хорошему, нужно преподавать машинное обучение.
Наблюдать за тем, как модели реально учатся, невероятно залипательно.🤩
http://ml-visualized.com
Наблюдать за тем, как модели реально учатся, невероятно залипательно.
http://ml-visualized.com
Please open Telegram to view this post
VIEW IN TELEGRAM
«Analysis of Functions of a Single Variable» — бесплатный учебник по вещественному и комплексному анализу.
В книге разбираются вещественные и комплексные числа, последовательности, пределы, бесконечные ряды, функции, непрерывность, равномерная сходимость, дифференцирование, разложения Тейлора, интегрирование, длина дуги и контурные интегралы.
Также выводятся ключевые результаты: теорема Грина, теорема Коши, теорема о вычетах и основная теорема алгебры.
Особенно полезна книга тем, что в ней много аккуратных доказательств и математических выводов. Она рассчитана на старшие курсы бакалавриата и первый год магистратуры и хорошо подходит как переход от обычного матанализа к строгому вещественному и комплексному анализу.
Если изучаете эти темы, стоит сохранить.
https://spot.colorado.edu/~baggett/book.pdf
В книге разбираются вещественные и комплексные числа, последовательности, пределы, бесконечные ряды, функции, непрерывность, равномерная сходимость, дифференцирование, разложения Тейлора, интегрирование, длина дуги и контурные интегралы.
Также выводятся ключевые результаты: теорема Грина, теорема Коши, теорема о вычетах и основная теорема алгебры.
Особенно полезна книга тем, что в ней много аккуратных доказательств и математических выводов. Она рассчитана на старшие курсы бакалавриата и первый год магистратуры и хорошо подходит как переход от обычного матанализа к строгому вещественному и комплексному анализу.
Если изучаете эти темы, стоит сохранить.
https://spot.colorado.edu/~baggett/book.pdf
Теорема Байеса — одна из фундаментальных концепций в Data Science.
Но мне понадобилось два года, чтобы по-настоящему понять её важность.
За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали.
1. Предыстория
Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса.
В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность.
2. Теорема Байеса
Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных.
Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом.
3. Байесовская статистика
Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления.
Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом.
Благодаря этому можно делать вероятностные выводы о неизвестных параметрах.
Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость.
4. Байесовский и частотный подходы
Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни.
В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений.
Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл.
5. Байесовское машинное обучение
Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны.
Например:
Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями.
Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений.
6. Применение в бизнесе
Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных.
По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.
Но мне понадобилось два года, чтобы по-настоящему понять её важность.
За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали.
1. Предыстория
Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса.
В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность.
2. Теорема Байеса
Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных.
Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом.
3. Байесовская статистика
Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления.
Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом.
Благодаря этому можно делать вероятностные выводы о неизвестных параметрах.
Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость.
4. Байесовский и частотный подходы
Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни.
В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений.
Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл.
5. Байесовское машинное обучение
Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны.
Например:
Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями.
Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений.
6. Применение в бизнесе
Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных.
По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.
Исследователи впервые в больших масштабах извлекли настоящие скрытые рассуждения из закрытых моделей OpenAI, Anthropic и Google.
Затем они использовали эти данные для изучения Kimi K3, GLM-5.2, DeepSeek и других открытых моделей.
OpenAI, Anthropic и Google всё реже показывают пользователям полные цепочки рассуждений. Итоговый ответ можно скопировать, но гораздо ценнее понять, как именно модель к нему пришла.
Если получить большое количество полных рассуждений, их можно использовать для дистилляции и обучения собственной модели.
Поэтому программные интерфейсы шифруют рассуждения и возвращают их клиенту. Пользователь не видит содержимое, но при следующем запросе зашифрованные данные можно снова передать модели, чтобы она продолжила с того же места.
Исследователи обнаружили, что зашифрованные рассуждения совместимы между разными пользователями, сессиями и даже моделями одного разработчика.
Сначала самая мощная модель создаёт рассуждение. Затем его зашифрованную версию передают более слабой и менее защищённой модели того же разработчика. После обхода ограничений маленькая модель расшифровывает и воспроизводит мысли старшей модели.
Например, скрытые рассуждения Claude Opus 4.8 можно передать Haiku и заставить её прочитать содержимое. Взламывать саму Opus для этого не требуется.
Исследователи успешно извлекли скрытые рассуждения из Claude, GPT и Gemini, обойдя защиту от дистилляции.
Авторы получили настоящие рассуждения GPT-5.6 Sol и Claude Opus 4.8, после чего передали их моделям Kimi-K3, Kimi-K2.6, Kimi-K2.5, GLM-5.2, DeepSeek-V3.1 и Inkling.
Стиль рассуждений Kimi-K3, Kimi-K2.6, Kimi-K2.5 и GLM-5.2 заметно изменился.
В тесте AIME модели Kimi-K3 передали небольшой фрагмент рассуждений GPT-5.6 Sol. После этого она начала генерировать ответы с формулировками, очень близкими к ответам GPT-5.6 Sol.
Анализ вероятностного распределения текста также показал, что среди внешних рассуждений, наиболее похожих на собственное распределение GLM-5.2, оказались рассуждения четырёх последовательных поколений моделей Anthropic.
Авторы подчёркивают, что эти результаты не доказывают дистилляцию одной модели из другой.
Раньше для дистилляции можно было задать Claude миллион вопросов, собрать пары "вопрос — ответ" и использовать их для обучения собственной модели.
Теперь гораздо более ценным набором данных становится полная последовательность:
вопрос → рассуждение → ответ.
Из общедоступных журналов работы агентов на GitHub и Hugging Face исследователи расшифровали 315 320 скрытых блоков рассуждений.
В них обнаружились 367 фрагментов персональных данных и 182 ключа, пароля и других учётных данных.
Полная цепочка рассуждений — это почти готовый материал для обучения другой модели. Если её можно массово извлекать через более слабую модель того же разработчика, то одной защиты весов уже недостаточно.
Закрытая модель может не показывать, как она думает. Но это больше не означает, что никто не сможет это прочитать.
Статья: https://arxiv.org/abs/2608.09867
Примеры извлечённых рассуждений: https://stolen-thoughts.com/
Затем они использовали эти данные для изучения Kimi K3, GLM-5.2, DeepSeek и других открытых моделей.
OpenAI, Anthropic и Google всё реже показывают пользователям полные цепочки рассуждений. Итоговый ответ можно скопировать, но гораздо ценнее понять, как именно модель к нему пришла.
Если получить большое количество полных рассуждений, их можно использовать для дистилляции и обучения собственной модели.
Поэтому программные интерфейсы шифруют рассуждения и возвращают их клиенту. Пользователь не видит содержимое, но при следующем запросе зашифрованные данные можно снова передать модели, чтобы она продолжила с того же места.
Исследователи обнаружили, что зашифрованные рассуждения совместимы между разными пользователями, сессиями и даже моделями одного разработчика.
Сначала самая мощная модель создаёт рассуждение. Затем его зашифрованную версию передают более слабой и менее защищённой модели того же разработчика. После обхода ограничений маленькая модель расшифровывает и воспроизводит мысли старшей модели.
Например, скрытые рассуждения Claude Opus 4.8 можно передать Haiku и заставить её прочитать содержимое. Взламывать саму Opus для этого не требуется.
Исследователи успешно извлекли скрытые рассуждения из Claude, GPT и Gemini, обойдя защиту от дистилляции.
Авторы получили настоящие рассуждения GPT-5.6 Sol и Claude Opus 4.8, после чего передали их моделям Kimi-K3, Kimi-K2.6, Kimi-K2.5, GLM-5.2, DeepSeek-V3.1 и Inkling.
Стиль рассуждений Kimi-K3, Kimi-K2.6, Kimi-K2.5 и GLM-5.2 заметно изменился.
В тесте AIME модели Kimi-K3 передали небольшой фрагмент рассуждений GPT-5.6 Sol. После этого она начала генерировать ответы с формулировками, очень близкими к ответам GPT-5.6 Sol.
Анализ вероятностного распределения текста также показал, что среди внешних рассуждений, наиболее похожих на собственное распределение GLM-5.2, оказались рассуждения четырёх последовательных поколений моделей Anthropic.
Авторы подчёркивают, что эти результаты не доказывают дистилляцию одной модели из другой.
Раньше для дистилляции можно было задать Claude миллион вопросов, собрать пары "вопрос — ответ" и использовать их для обучения собственной модели.
Теперь гораздо более ценным набором данных становится полная последовательность:
вопрос → рассуждение → ответ.
Из общедоступных журналов работы агентов на GitHub и Hugging Face исследователи расшифровали 315 320 скрытых блоков рассуждений.
В них обнаружились 367 фрагментов персональных данных и 182 ключа, пароля и других учётных данных.
Полная цепочка рассуждений — это почти готовый материал для обучения другой модели. Если её можно массово извлекать через более слабую модель того же разработчика, то одной защиты весов уже недостаточно.
Закрытая модель может не показывать, как она думает. Но это больше не означает, что никто не сможет это прочитать.
Статья: https://arxiv.org/abs/2608.09867
Примеры извлечённых рассуждений: https://stolen-thoughts.com/
arXiv.org
Stealing Reasoning Traces from Proprietary LLM APIs
Leading large language model providers now conceal their models' step-by-step reasoning, or chain-of-thought, to protect intellectual property and limit information leakage. Rather than storing...
Как научить рекомендации думать не о следующем лайке, а о всей сессии?
Обычно рекомендательные системы оптимизируют ближайший сигнал: клик, лайк или дослушивание. Но каждое действие меняет состояние пользователя, поэтому локально хорошая рекомендация не обязательно улучшает всю сессию.
В новой работе AI VK Research рекомендации формулируются как задача обучения с подкреплением. Модель рассматривает пользователя как среду, рекомендацию — как действие, а реакцию пользователя — как награду.
Главная проблема — обучение на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать различия между старой и новой политиками и контролировать рост дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенного ухудшения стандартных метрик.
Получается интересный сдвиг: модель оптимизирует не отдельное взаимодействие, а последствия рекомендации для всей сессии.
https://habr.com/ru/companies/vk/articles/1068050/
Обычно рекомендательные системы оптимизируют ближайший сигнал: клик, лайк или дослушивание. Но каждое действие меняет состояние пользователя, поэтому локально хорошая рекомендация не обязательно улучшает всю сессию.
В новой работе AI VK Research рекомендации формулируются как задача обучения с подкреплением. Модель рассматривает пользователя как среду, рекомендацию — как действие, а реакцию пользователя — как награду.
Главная проблема — обучение на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать различия между старой и новой политиками и контролировать рост дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенного ухудшения стандартных метрик.
Получается интересный сдвиг: модель оптимизирует не отдельное взаимодействие, а последствия рекомендации для всей сессии.
https://habr.com/ru/companies/vk/articles/1068050/
Исследователи Tencent и Университета Цинхуа представили CALM — языковую модель, которая генерирует текст не по одному токену, а сразу целыми фрагментами.
Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.
В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.
Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.
Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.
https://arxiv.org/pdf/2510.27688
Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации.
В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации.
Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось.
Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками.
https://arxiv.org/pdf/2510.27688
«Beginning in Algebraic Geometry» — ещё один бесплатный учебник с открытым доступом, который даёт строгий, но при этом довольно доступный вход в алгебраическую геометрию.
Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.
Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.
После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.
На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.
https://link.springer.com/book/10.1007/978-3-031-88819-9
Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре.
Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям.
После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы.
На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию.
https://link.springer.com/book/10.1007/978-3-031-88819-9
Ещё один отличный плейлист по структурам данных и алгоритмам от pmavrin.
https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
Awesome Math — огромная подборка материалов по математике в одном репозитории.
Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.
Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.
https://github.com/rossant/awesome-math
Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики.
Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub.
https://github.com/rossant/awesome-math
GitHub
GitHub - rossant/awesome-math: A curated list of awesome mathematics resources
A curated list of awesome mathematics resources. Contribute to rossant/awesome-math development by creating an account on GitHub.
Бесплатный PDF новой книги по оптимизации:
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf