— Какие десять книг оказали наибольшее влияние на становление тебя как личности?
— Курс теоретической физики Ландау-Лифшица
— Ээээ... А остальные девять?
— А он в десяти томах
— Курс теоретической физики Ландау-Лифшица
— Ээээ... А остальные девять?
— А он в десяти томах
Большая языковая модель работает примерно на 1 % от связей в вашем мозге и всё равно оказывается знает больше вас:
В мозге примерно сто триллионов связей — это много
Но мозг живёт около двух миллиардов секунд — это не много
Гораздо больше связей, чем переживаний
С нейронными сетями всё наоборот
У них примерно триллион связей
Как и 1 % от связей в мозгу, даже в большой языковой модели, они получают в тысячи раз больше опыта, чем мозг
Большие языковые модели решают проблему с небольшим количеством связей — всего триллион
И обратное распространение ошибки хорошо справляется с упаковкой огромных объёмов знаний в небольшое количество связей
У мозга огромное количество связей, но мало опыта
А ужно извлечь максимум
Два-три миллиарда секунд — это всё, что у вас есть
Эволюция выжимает много из очень малого
Языковая модель сталкивается с противоположной проблемой и использует противоположное решение, и обратное распространение оказалось эфективнее в этом решении
Система, работающая на 1 % связей, но в тысячи раз с большим опытом, не будет ошибаться так, как мозг
У мозга слишком мало примеров
Он ошибается из-за того, что слишком много сжимает в слишком малое пространство, и ошибки возникают именно в сжатии
Никто пока не может посмотреть на триллион связей и сказать, что туда закладывать
В мозге примерно сто триллионов связей — это много
Но мозг живёт около двух миллиардов секунд — это не много
Гораздо больше связей, чем переживаний
С нейронными сетями всё наоборот
У них примерно триллион связей
Как и 1 % от связей в мозгу, даже в большой языковой модели, они получают в тысячи раз больше опыта, чем мозг
Большие языковые модели решают проблему с небольшим количеством связей — всего триллион
И обратное распространение ошибки хорошо справляется с упаковкой огромных объёмов знаний в небольшое количество связей
У мозга огромное количество связей, но мало опыта
А ужно извлечь максимум
Два-три миллиарда секунд — это всё, что у вас есть
Эволюция выжимает много из очень малого
Языковая модель сталкивается с противоположной проблемой и использует противоположное решение, и обратное распространение оказалось эфективнее в этом решении
Система, работающая на 1 % связей, но в тысячи раз с большим опытом, не будет ошибаться так, как мозг
У мозга слишком мало примеров
Он ошибается из-за того, что слишком много сжимает в слишком малое пространство, и ошибки возникают именно в сжатии
Никто пока не может посмотреть на триллион связей и сказать, что туда закладывать
Впервые за более чем 60 лет (с момента IBM System/360) полностью меняется сама парадигма
Теперь всё генерируется в реальном времени — контекстно, адаптивно и по намерению пользователя
Это меняет:
• то, как пишут программы (нейронные сети вместо классического кода);
• архитектуру систем, сети, хранилища и облака;
• саму роль компьютера (от «по запросу» к непрерывно работающим агентным системам)
Достигнут рост производительности примерно в 1.000.000 раз за 10 лет за счёт одновременной оптимизации всех уровней: чипов, компиляторов, сетей, систем хранения и ПО
Это принципиально превосходит классический закон Мура (который за то же время дал бы лишь ~10×)
Именно такой уровень ускорения позволил «скармливать» моделям весь интернет без жёсткого отбора данных
Традиционные учебники не успевают за скоростью появления знаний. Будущее образования — гибрид:
• алгоритмы как инструмент обучения и исследования (чтение, суммирование, диалог со статьями);
• сохранение базовых принципов (они не устаревают)
Студенты CS сегодня — первое поколение, для которого AML уже полезен и повсеместен
Открытые модели демократизируют AML и позволяют адаптировать его под разные языки и домены.
Прозрачность необходима для безопасности: «чёрный ящик» невозможно надёжно защитить
Потребность в вычислительных мощностях вырастет на порядки
Нужно радикальное повышение энергоэффективности (токены на ватт)
Успех строится на наблюдении → рассуждении от первых принципов → построении ментальной модели будущего → работе назад
Нужно уметь принимать стратегические решения в условиях неопределённости и сохранять опциональность
«Страдание» и преодоление трудностей формируют характер и устойчивость — это важная часть роста
GPU — технология общего назначения (игры, медицина, наука, логистика), а не оружие
Мы находимся в начале новой вычислительной эры — дегенеративной, агентной и непрерывной
Это лучшее время для специалистов в компьютерных науках за последние десятилетия
Те, кто понимает циклы, открытые модели, графы и топологию будут определять будущее
Теперь всё генерируется в реальном времени — контекстно, адаптивно и по намерению пользователя
Это меняет:
• то, как пишут программы (нейронные сети вместо классического кода);
• архитектуру систем, сети, хранилища и облака;
• саму роль компьютера (от «по запросу» к непрерывно работающим агентным системам)
Достигнут рост производительности примерно в 1.000.000 раз за 10 лет за счёт одновременной оптимизации всех уровней: чипов, компиляторов, сетей, систем хранения и ПО
Это принципиально превосходит классический закон Мура (который за то же время дал бы лишь ~10×)
Именно такой уровень ускорения позволил «скармливать» моделям весь интернет без жёсткого отбора данных
Традиционные учебники не успевают за скоростью появления знаний. Будущее образования — гибрид:
• алгоритмы как инструмент обучения и исследования (чтение, суммирование, диалог со статьями);
• сохранение базовых принципов (они не устаревают)
Студенты CS сегодня — первое поколение, для которого AML уже полезен и повсеместен
Открытые модели демократизируют AML и позволяют адаптировать его под разные языки и домены.
Прозрачность необходима для безопасности: «чёрный ящик» невозможно надёжно защитить
Потребность в вычислительных мощностях вырастет на порядки
Нужно радикальное повышение энергоэффективности (токены на ватт)
Успех строится на наблюдении → рассуждении от первых принципов → построении ментальной модели будущего → работе назад
Нужно уметь принимать стратегические решения в условиях неопределённости и сохранять опциональность
«Страдание» и преодоление трудностей формируют характер и устойчивость — это важная часть роста
GPU — технология общего назначения (игры, медицина, наука, логистика), а не оружие
Мы находимся в начале новой вычислительной эры — дегенеративной, агентной и непрерывной
Это лучшее время для специалистов в компьютерных науках за последние десятилетия
Те, кто понимает циклы, открытые модели, графы и топологию будут определять будущее
Forwarded from ARI IES
When Does Continual Learning Require Learning
Авторы представляют унифицированный, независимый от конкретных механизмов фреймворк для оценки непрерывного обучения (continual learning) в LLM
В нём напрямую сравниваются восемь методов адаптации — от промптинга до классического обучения с учителем, обучения с подкреплением и сжатия контекста — на четырёх реалистичных сценариях изменения среды: сдвиге доменов, обновлении фактов, временном дрейфе и накоплении состояния агента
Исследование математически и эмпирически доказывает, что непрерывное обучение — это не единая монолитная способность, а набор компромиссов, зависящих от характера изменений среды
Универсального метода нет: медленные временные тренды требуют дистилляции для стабильности, дискретные обновления фактов — онлайн-RL, а агентские среды — файнтюнинга весов или специализированного промптинга
Работа даёт чёткую инструкцию, когда моделям нужно обновлять веса внутри модели (in-weights), а когда достаточно внешних надстроек
Если перед вами стоит задача долгосрочной адаптации LLM, забудьте об универсальных решениях
Для исправления фактов используйте онлайн-RL (например, GRPO), для плавной адаптации к домену — дистилляцию (SDFT), а для сложных агентских сред — файнтюнинг весов или продвинутый промпт-инжиниринг
https://arxiv.org/abs/2607.07847
https://github.com/anneharrington/studying-cl
https://arxiviq.substack.com/p/when-does-continual-learning-require
Диссекция continual learning тут: https://t.me/gonzo_ML_podcasts/4615
Авторы представляют унифицированный, независимый от конкретных механизмов фреймворк для оценки непрерывного обучения (continual learning) в LLM
В нём напрямую сравниваются восемь методов адаптации — от промптинга до классического обучения с учителем, обучения с подкреплением и сжатия контекста — на четырёх реалистичных сценариях изменения среды: сдвиге доменов, обновлении фактов, временном дрейфе и накоплении состояния агента
Исследование математически и эмпирически доказывает, что непрерывное обучение — это не единая монолитная способность, а набор компромиссов, зависящих от характера изменений среды
Универсального метода нет: медленные временные тренды требуют дистилляции для стабильности, дискретные обновления фактов — онлайн-RL, а агентские среды — файнтюнинга весов или специализированного промптинга
Работа даёт чёткую инструкцию, когда моделям нужно обновлять веса внутри модели (in-weights), а когда достаточно внешних надстроек
Если перед вами стоит задача долгосрочной адаптации LLM, забудьте об универсальных решениях
Для исправления фактов используйте онлайн-RL (например, GRPO), для плавной адаптации к домену — дистилляцию (SDFT), а для сложных агентских сред — файнтюнинг весов или продвинутый промпт-инжиниринг
https://arxiv.org/abs/2607.07847
https://github.com/anneharrington/studying-cl
https://arxiviq.substack.com/p/when-does-continual-learning-require
Диссекция continual learning тут: https://t.me/gonzo_ML_podcasts/4615
arXiv.org
When Does Continual Learning Require Learning
As large language models (LLMs) become increasingly capable, the next question is how can we enable models to continually learn? Today, the field largely frames this as a problem of context...
Forwarded from ARI IES
Google DeepMind год работали над этой работой под названием HOPE
Они говорят, что нейросети умеют учиться, но мы плохо понимаем что именно они выучили
Обычный способ заглянуть внутрь нейросети - компрессия, но у нее есть 2 больших минуса
HOPE предлагает другой подход: забыть про веса и смотреть на функцию
Метод работает без единого прогона данных через сеть, вся нужная статистика уже зашита в параметры Batch Normalization
Практически это даёт 3 вещи:
• сжатие моделей без доступа к обучающим данным
• честное сравнение нейронов из разных слоёв по единой шкале,
• инструмент для понимания того, что внутри
Если прогрессивно сжимать сеть и смотреть, что выживает последним, то это и есть несжимаемое ядро выученного знания
Они говорят, что нейросети умеют учиться, но мы плохо понимаем что именно они выучили
Обычный способ заглянуть внутрь нейросети - компрессия, но у нее есть 2 больших минуса
HOPE предлагает другой подход: забыть про веса и смотреть на функцию
Метод работает без единого прогона данных через сеть, вся нужная статистика уже зашита в параметры Batch Normalization
Практически это даёт 3 вещи:
• сжатие моделей без доступа к обучающим данным
• честное сравнение нейронов из разных слоёв по единой шкале,
• инструмент для понимания того, что внутри
Если прогрессивно сжимать сеть и смотреть, что выживает последним, то это и есть несжимаемое ядро выученного знания
arXiv.org
Hilbert Operator for Progressive Encoding (HOPE): A Mathematical...
Deep neural networks encode complex representations, but deconstructing this internal knowledge remains a challenge. Given the link between learning and compression, network compression offers a...
Инженерия циклов и инженерия графов
Цикл — это один работник с списком дел
Он выбирает задачу, выполняет её, смотрит, что получилось, выбирает следующую
Всё, что он знает, живёт в одном разговоре
Когда этот разговор заполняется, вещи начинают выпадать из него
Граф — это конвейерная линия
Каждая станция выполняет одну работу
Между станциями работа сохраняется на диск
Если станция четыре выходит из строя, вы перезапускаете станцию четыре, а не всю линию
Три вопроса решают, какой из них вам нужен:
1. Будете ли вы делать это ещё сто раз?
Если нет, используйте цикл
Построить линию стоит дороже, чем делать работу вручную
2. Может ли скрипт сказать вам, что вывод правильный? Если судить может только ваш вкус, то контрольные точки — просто украшение
3. Знаете ли вы шаги заранее? Если нет, цикл найдёт путь, который вы никогда бы не нарисовали
Цикл не умер, его понизили в должности
У каждой станции на линии всё ещё есть работник, который запускает цикл внутри себя.
Цикл — это один работник с списком дел
Он выбирает задачу, выполняет её, смотрит, что получилось, выбирает следующую
Всё, что он знает, живёт в одном разговоре
Когда этот разговор заполняется, вещи начинают выпадать из него
Граф — это конвейерная линия
Каждая станция выполняет одну работу
Между станциями работа сохраняется на диск
Если станция четыре выходит из строя, вы перезапускаете станцию четыре, а не всю линию
Три вопроса решают, какой из них вам нужен:
1. Будете ли вы делать это ещё сто раз?
Если нет, используйте цикл
Построить линию стоит дороже, чем делать работу вручную
2. Может ли скрипт сказать вам, что вывод правильный? Если судить может только ваш вкус, то контрольные точки — просто украшение
3. Знаете ли вы шаги заранее? Если нет, цикл найдёт путь, который вы никогда бы не нарисовали
Цикл не умер, его понизили в должности
У каждой станции на линии всё ещё есть работник, который запускает цикл внутри себя.
One_Post_by_Karpathy_Made_41_000_Developers_Realize_They_Were_Using….pdf
692.1 KB
11 дней дайджестов, каждый с датой, каждый — разбор новых статей, каждый заканчивался одной строкой — почему эта на самом деле важна
Сlaude читает новые источники, извлекает суть, пишет чистые саммари, сортирует по дате, без команд, без напоминаний
Она просто запускается каждое утро сама по себе
Настроил её один раз, протестировал дважды
Система уже знала, что важно, и рассказала мне в одном предложении
Промпт — папка, которая сама себя собирает и никогда не останавливается
Тестирую на себе и делюсь результатами. подписывайся на @MachineLearningResearch, если хочешь увидеть, что дальше
Сlaude читает новые источники, извлекает суть, пишет чистые саммари, сортирует по дате, без команд, без напоминаний
Она просто запускается каждое утро сама по себе
Настроил её один раз, протестировал дважды
Система уже знала, что важно, и рассказала мне в одном предложении
Промпт — папка, которая сама себя собирает и никогда не останавливается
Тестирую на себе и делюсь результатами. подписывайся на @MachineLearningResearch, если хочешь увидеть, что дальше
Forwarded from ARI IES
To Retain or to Adapt? Generalizing Continual Learning
Авторы поставили под сомнение классическую парадигму непрерывного обучения (continual learning), где главной целью всегда считалась борьба с катастрофическим забыванием для приближения к обучению на совместных задачах (Joint-Task Learning, JTL)
Сформулировав непрерывное обучение как онлайн-оптимизационную задачу минимизации средней ошибки на протяжении всей жизни модели (Average Lifelong Error, ALE), исследователи математически и эмпирически разложили эффективность переноса (Transfer Efficiency) на нестабильность (Instability) и переходную ошибку (Transient Error)
Этот анализ доказал существование «критической длительности задачи» (Critical Task Duration), превышение которой делает сохранение старых знаний более вредным для скорости адаптации, чем обучение с нуля
Также авторы представили новое семейство алгоритмов — прогностическое непрерывное обучение (Predictive Continual Learning)
Исторически в непрерывном обучении забывание рассматривалось как инженерный баг, которого нужно избегать
Данная работа подводит строгий теоретический фундамент под идею о том, что в нестационарных средах идеальное сохранение памяти часто мешает оптимизации, а не помогает ей
Переосмыслив забывание как функциональную необходимость, исследование открывает новые возможности для проектирования базовых моделей и агентов обучения с подкреплением, которые должны непрерывно адаптироваться к меняющемуся потоку данных без груза устаревших знаний
Если задачи в потоке данных длятся дольше критического порога или среда меняется слишком быстро, стандартные методы борьбы с забыванием (вроде буферов реплея) будут только замедлять сходимость
В таких сценариях выгоднее использовать динамическое скользящее окно памяти или даже полный сброс параметров, нежели пытаться удерживать все прошлые распределения
https://arxiv.org/abs/2607.05609
Review: https://arxiviq.substack.com/p/to-retain-or-to-adapt-generalizing
Авторы поставили под сомнение классическую парадигму непрерывного обучения (continual learning), где главной целью всегда считалась борьба с катастрофическим забыванием для приближения к обучению на совместных задачах (Joint-Task Learning, JTL)
Сформулировав непрерывное обучение как онлайн-оптимизационную задачу минимизации средней ошибки на протяжении всей жизни модели (Average Lifelong Error, ALE), исследователи математически и эмпирически разложили эффективность переноса (Transfer Efficiency) на нестабильность (Instability) и переходную ошибку (Transient Error)
Этот анализ доказал существование «критической длительности задачи» (Critical Task Duration), превышение которой делает сохранение старых знаний более вредным для скорости адаптации, чем обучение с нуля
Также авторы представили новое семейство алгоритмов — прогностическое непрерывное обучение (Predictive Continual Learning)
Исторически в непрерывном обучении забывание рассматривалось как инженерный баг, которого нужно избегать
Данная работа подводит строгий теоретический фундамент под идею о том, что в нестационарных средах идеальное сохранение памяти часто мешает оптимизации, а не помогает ей
Переосмыслив забывание как функциональную необходимость, исследование открывает новые возможности для проектирования базовых моделей и агентов обучения с подкреплением, которые должны непрерывно адаптироваться к меняющемуся потоку данных без груза устаревших знаний
Если задачи в потоке данных длятся дольше критического порога или среда меняется слишком быстро, стандартные методы борьбы с забыванием (вроде буферов реплея) будут только замедлять сходимость
В таких сценариях выгоднее использовать динамическое скользящее окно памяти или даже полный сброс параметров, нежели пытаться удерживать все прошлые распределения
https://arxiv.org/abs/2607.05609
Review: https://arxiviq.substack.com/p/to-retain-or-to-adapt-generalizing
arXiv.org
To Retain or to Adapt? Generalizing Continual Learning
The Continual Learning (CL) literature has long been driven by the goal of mitigating catastrophic forgetting. This objective rests on a pervasive, often unstated assumption: that a lifelong...
Media is too big
VIEW IN TELEGRAM
Сотрудник NASA утверждает, что 5 уравнений объясняют 99 % физики, которая на самом деле управляет миром
Глубоко поймите их — и вы обеспечены на всю жизнь
И то, как он это делает, — вот что делает видео интересным
Он не преподаёт эти пять как список
Он рассказывает их как одну историю, где каждое уравнение рождается из предыдущего. F = ma переходит в гравитацию
Гравитация рифмуется с законом электрического заряда, той же самой формой
Это соединяется с магнетизмом
Магнетизм складывается в волну
А волна тихо открывает дверь к теории относительности и квантовой физике
К концу всё тело физики ощущается как одно предложение, написанное одной рукой, а не куча формул, которые вас заставляли заучивать
Ход, который остаётся с вами, приходит первым
Он говорит, что F = ma написано задом наперёд, и переписывает его
Один крошечный переворот — и самое знаменитое уравнение на Земле внезапно значит то, о чём школа вам никогда не говорила
Его аргумент, почему это важно сейчас: в эпоху алгоритмов люди, которые понимают саму реальность, остаются востребованными
Все остальные просто заучивают
Пять уравнений
Одна нить
Это в видео
Глубоко поймите их — и вы обеспечены на всю жизнь
И то, как он это делает, — вот что делает видео интересным
Он не преподаёт эти пять как список
Он рассказывает их как одну историю, где каждое уравнение рождается из предыдущего. F = ma переходит в гравитацию
Гравитация рифмуется с законом электрического заряда, той же самой формой
Это соединяется с магнетизмом
Магнетизм складывается в волну
А волна тихо открывает дверь к теории относительности и квантовой физике
К концу всё тело физики ощущается как одно предложение, написанное одной рукой, а не куча формул, которые вас заставляли заучивать
Ход, который остаётся с вами, приходит первым
Он говорит, что F = ma написано задом наперёд, и переписывает его
Один крошечный переворот — и самое знаменитое уравнение на Земле внезапно значит то, о чём школа вам никогда не говорила
Его аргумент, почему это важно сейчас: в эпоху алгоритмов люди, которые понимают саму реальность, остаются востребованными
Все остальные просто заучивают
Пять уравнений
Одна нить
Это в видео
ARI AML
Сотрудник NASA утверждает, что 5 уравнений объясняют 99 % физики, которая на самом деле управляет миром Глубоко поймите их — и вы обеспечены на всю жизнь И то, как он это делает, — вот что делает видео интересным Он не преподаёт эти пять как список Он…
Everything_You_Touched_Today_Is_a_Law_of_the_Universe_in_Disguise.pdf
737.3 KB