Частные заметки одного лица
260 subscribers
208 photos
33 videos
9 files
343 links
Статейки, мысли, заметки @shiryaeff
Download Telegram
Большие языковые модели - это настоящий интеллект?

В IT-сообществе не утихают горячие споры: есть ли в современных LLM (таких как Claude, ChatGPT или DeepSeek) хоть капля подлинного разума, или перед нами просто раздутая до триллионов параметров таблица поиска, угадывающая следующее слово?

В новом материале на Хабре вышло интервью с доктором технических наук и научным консультантом Artezio Владимиром Крыловым. В нем он подробно разбирает, что на самом деле происходит «под капотом» современных AI-систем и почему привычные метрики оценки интеллекта больше не работают.

О чем пойдет речь в статье:

🔹 Является ли колмогоровская сложность объективным критерием интеллекта?
🔹 Почему применять стандартные человеческие IQ-тесты к нейросетям бессмысленно?
🔹 Законы масштабирования (Scaling Laws) и почему время на «обдумывание» ответа в момент генерации меняет правила игры.
🔹 Феномен суперпозиции от Anthropic: почему смыслы запутаны так сложно, что мы никогда не сможем в прямом смысле «прочитать мысли» ИИ.

👉 Читать статью на Хабре
Снова про теорию генерализации и гроккинга. Много математики для желающих :)

A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay

Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin
Paper: https://arxiv.org/abs/2609.07755
Review: https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization

ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking).

ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией.

Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения.

Подводить базу здесь: https://t.me/gonzo_ML_podcasts/4814
👍2
Ещё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания.

High-Dimensional Learning Dynamics of Attention-Indexed Models
Yizhou Xu, Margarita Sagitova, Lenka Zdeborová, and Florent Krzakala
Paper: https://arxiv.org/abs/2609.03858
Review: https://arxiviq.substack.com/p/high-dimensional-learning-dynamics
Code: N/A
Model: N/A

ЧТО сделали: Авторы построили макроскопическую теорию динамики обучения для моделей с механизмом внимания в пределе высокой размерности, где матрицы внимания обладают экстенсивным рангом, растущим прямо пропорционально размерности эмбеддингов d. В то время как асимптотический популяционный лосс полностью определяется компактным конечномерным набором следовых параметров порядка, онлайн-SGD индуцирует бесконечномерную иерархию зацепленных матричных моментов. Эту иерархию строго описывает система детерминированных ОДУ, а усечения конечного порядка аппроксимируют её с экспоненциальной точностью. Опираясь на полученный аппарат, авторы доказали, что параметризация внимания работает как архитектурный implicit bias: связывание весов (S = WW^T) запускает автоматическое нарушение симметрии и обеспечивает слабое восстановление учителя за Θ(d^2 log d) шагов по выборке, тогда как раздельное внимание (S = UV^T) демонстрирует двухмасштабную релаксацию, где успех восстановления всецело зависит от того, сможет ли быстрый дрейф средних разрушить неинформативную симметрию студента.

ПОЧЕМУ это важно: Классический теоретический анализ механизмов внимания обычно скатывается в одно из двух упрощений: либо игнорирует термодинамический предел высокой размерности, либо искусственно ограничивает ранг матриц внимания константой Θ(1). В современных же моделях эффективный ранг растёт вместе с пространством представлений. Настоящая работа переносит методы математической физики на современные архитектуры трансформеров и доказывает: факторизация матриц внимания — это не просто удобная перепараметризация общего ландшафта функции потерь, а фундаментальная смена траекторий градиентного спуска. Она превращает узкие горлышки оптимизации в проходимые сценарии обучения признаков за счёт архитектурного нарушения симметрии.

Для практиков: Теория долго не могла строго объяснить, как трансформеры на этапе предобучения выбираются из неинформативных начальных состояний, поскольку исследовала игрушечные низкоранговые матрицы. Если ранг реалистичен и растёт вместе с размерностью, статический ландшафт функции потерь выглядит просто, но реальная траектория оптимизатора бесконечномерна. Выбранный способ факторизации проекций выступает скрытым регуляризатором: связывание весов (S = WW^T) принуждает оптимизатор автоматически разрушать непродуктивные симметрии и быстро выучивать фичи, тогда как раздельные проекции (S = UV^T) расщепляют динамику на сверхбыстрое выравнивание средних и медленное обучение признаков, гарантированно срабатывающее лишь при удачной конфигурации пограничного слоя.

Погружаться тут: https://t.me/gonzo_ML_podcasts/4815
Forwarded from Data Secrets
Исследователи из Meta* предложили дать моделям полный контроль над собственным контекстом

Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.

В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.

Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.

При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.

Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.

Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.

На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.

И все это работает поверх обычных LLM, без изменения архитектуры самой модели.

Код | Статья
Forwarded from Data Secrets
Карпаты рассказал, как теперь правильно общаться с LLM

Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.

И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:

– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.

– Вместо длинного объяснения просить диаграмму или картинку.

– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.

– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.

Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.

https://x.com/karpathy/status/2105819303471976479?s=46
🔥4👍2💯1
и меня забанили в claude 😭
😢16🤯6🔥4🤔1
Forwarded from AI Product | Igor Akimov
Как создавать AI Native компании

Понравилось небольшое видео от YСombinator, как строить компании под AI. Лучше посмотреть самостоятельно, но в целом тезисы такие:
Большинство компаний устроены как римский легион – вложенные иерархии, где люди работают «проводами» для передачи информации вверх и вниз. Это было ограничение возможностей мозга человека, типа 5-10 человек в управлении. Для ИИ управлять хоть 1000 процессов - фигня.
Год назад пользу AI мерили продуктивностью: ассистент делает инженера на 20% быстрее. Это как «навесить мощный двигатель на старый способ работать». Вот тут тоже писал об этом же https://t.me/ai_product/2045

Основная ценность новой методологии - циклы обратной связи. Компания – набор циклов, которые улучшают себя сами, даже пока ты спишь:
– Sensor – сигналы извне: письма, тикеты, отмены подписок, телеметрия
– Policy – что можно, что требует разрешения человека, что логировать
– Tools – детерминированные API к базе и сервисам
– Quality gate – evals, фильтры, ревью для рискованного
– Learning – где не сработало, заворачивается обратно в начало петли

Соответственно задача компании - наделать вот таких вот циклов, чтобы работало вообще без людей. Рассказали свою историю: поверх агента к базе YC посадили мониторящего агента. Он смотрит каждый запрос сотрудников, ловит, где не сработало, сам пишет код, открывает merge request – другой агент ревьюит и мёрджит за ночь. Утром тот же запрос уже проходит. Самоулучшающаяся система.

В общем, говорят, что все изменилось и вот что надо теперь делать:
– Тратить токены, а не нанимать сотрудников.
– Увольнять или переводить в контрибьюторы средний менеджмент – координацию делает AI (буквально вчера вот Clickup об увольнениях 20% персонала заявил)
– Записывать и фиксировать все, что только можно, от звонков до мыслей вслух. Не зафиксировано - не произошло.
– Бережно хранить данные и скиллы, а к софту привязываться и покупать годовые подписки вообще не нужно, Codex напишет вам что угодно за ночь.
– Оставлять людей на "корнер-кейсы" - где высокие ставки принятых решений, этика, продажи, новые ситуации.
Ну и не надо пытаться "все сломать и сделать всю компанию по-новому сразу". Лучше взять один процесс и создать петлю с обратной связи, довести до конца, потом другой взять. Это лучше, чем десяток поломанных процессов.

https://youtu.be/X_JsIHUfUjc
🤔3👍1🤯1
Forwarded from AI Projects (Vladimir Ivanov)
OpenAI на деле доказывает, что «конец математики от ИИ», объявленный Сэмом Альтманом, уже наступает. Опубликованы 722 работы новой модели ChatGPT, которая готовится к выпуску. Они важны не просто числом, а исторической значимостью для математики.

722 рукописи, сгруппированные в 372 семейства результатов по 17 областям: теоретическая информатика ~40, комбинаторика ~37, алгебраическая/комплексная геометрия ~36, теория чисел ~31 и др. Это показывает, что не остаётся убежища для «кожаных» математиков — ИИ силён во всех возможных областях математики.

Ключевые заявленные результаты (примеры высокой значимости):
• Квази-гипотеза Римана: все Dirichlet L-функции (включая ζ) свободны от нулей в Re(s) > 7/8 (есть Lean). Это существенный прогресс к классической гипотезе Римана (Re(s) > 1/2).
• Гипотезы Малера (симметричная и общая) во всех размерностях.
• Контрпримеры к гипотезам Капланского (zero-divisor и direct-finiteness).
• Изоморфизм факторов свободных групп (классическая проблема Войкулеску; Lean пока нет).
• Отрицательное решение 10-й проблемы Гильберта над ℚ.
• Иррациональность константы Каталана.
• Прогресс по Birch–Swinnerton-Dyer, Goldfeld, корреляциям мультипликативных функций, NP-hardness порогов, arithmetic progressions, результатам в матфизике (Vlasov–Maxwell, Heisenberg) и др.

Нравится это или нет математикам и сторонникам математического образования, но реальность такова: математика как наука явно уходит к ИИ. Люди скорее будут пользователями сложных матмоделей, заказчиками их создания, контролёрами их качества, но не создателями этих моделей.

Однако высокая доступность математических моделей топ-класса окажет ещё мощнейшее влияние на IT-разработку, где сейчас сложных матмоделей почти нет, потому что программисты — не математики и даже обычно не помнят свои курсы высшей математики из университетов. Сейчас ИИ может создать крайне сложные и рабочие модели прогнозирования и управления для бизнеса, где старые ERP будут смотреться как поделка дилетантов.

https://github.com/openai/math
🤔1
Forwarded from AI Projects (Vladimir Ivanov)
Media is too big
VIEW IN TELEGRAM
🏛 Джейкоб Коксон, ранее работавший в Anthropic и OpenAI, продолжает интенсивно сливать, во что верит Амодеи и Альтман. Сейчас он рассказывает про «ИИ-коммунизм» на гарантированном доходе, которые реально Дарио и Сэм воспринимают как целевую модель общества.

Значительная часть людей воспринимает это как утопию, но в реальности вся западная цивилизация построена как раз на фундаменте предыдущего сверхгосударства гарантированного дохода — Древнем Риме. Причём аналогия тут полна в том плане, что новая ИИ-экономика в чём-то также рабовладельческая по своей сути, просто ИИ-боты и роботы становятся «цифровыми рабами», которые содержат «дармоедов». Этические проблемы digital slaves рассматриваются в последних работах Google как «From cacophony to hierarchy: a principled framework for assessing AI consciousness», но опыт Римской империи показывает, что государство гарантированного дохода на рабовладении вполне устойчиво социально и может процветать веками.

Вероятно, события будут напоминать римскую историю. С 123 г. до н. э. по закону Гая Гракха (Lex Sempronia frumentaria) зерно продавалось гражданам по символической фиксированной цене (6 1/3 асса за модий). Позже, при Юлии Цезаре и Августе, раздачи стали бесплатными и превратились в постоянный институт. Право на получение хлеба подтверждалось специальным жетоном — tessera frumentaria.

«Хлеба и зрелищ» (Panem et Circenses) в реале принадлежит римскому сатирику Ювеналу (I–II вв. н. э.), который в 10-й сатире едко описал устремления римского плебса. Однако Cura Annonae и щедрые публичные игры рассматривались как способ обеспечить повиновение потенциально беспокойных низших городских слоёв.

Довольно любопытна ещё аналогия с ИИ в том плане, что для ИИ важнее качественный заказчик на объект, чем навыки его создания. Величайшее достижение римской архитектуры — Пантеон (1300 лет крупнейшее в мире купольное здание) — создал Марк Випсаний Агриппа (63–12 гг. до н. э.) — полководец, зять и ближайший сподвижник императора Августа. Он не был архитектором в профессиональном смысле, но как заказчик и руководитель строительства возвёл в 27–25 гг. до н. э. храм всех богов на Марсовом поле. Аналогично велик вклад императора Адриана как заказчика строительства, который определил облик многих римских сооружений.

Поэтому если оглянуться назад, то для многих современных людей государство гарантированного дохода кажется утопией, но для тех, кто не прогуливал уроки истории в школе, хорошо понятно, что это у человечества уже было.

Древний Рим показывает ещё смещение важности от инженеров на качественных заказчиков создания базовой инфраструктуры общества.

📌 Когда мы можем получить что-то в таком духе хотя бы элементами? Вероятно, какие-то варианты закона Гая Гракха появятся уже в 2030-е, т. к. возникнет проблема у безработных — как платить за счета. ИИ-роботы дойдут до совершенства по консенсус-прогнозам скорее к 2035–2040 годам, т. е. политикам придётся заниматься созданием государства гарантированного дохода уже в 2040-е годы. Это, конечно, будет сопровождаться мощнейшими социальными потрясениями.
👍1👎1
Снова старая добрая нейроэволюция! Один из соавторов, кстати, соавтор той книги.

Continual Reinforcement Learning with Neuroevolution
Eleni Nisioti, Andrea Cossu, Kathrin Korte, Sebastian Risi
Paper: https://arxiv.org/abs/2610.01583
Review: https://arxiviq.substack.com/p/continual-reinforcement-learning
Code: https://github.com/eleninisioti/continual_neuroevolution

ЧТО сделали: Исследовали нейроэволюцию для непрерывного обучения с подкреплением (continual RL) в меняющихся средах без явных границ между задачами. Авторы сравнили эволюционные стратегии (ES) и генетические алгоритмы (GA) с алгоритмом PPO, тремя его модификациями для непрерывного RL и популяционным RL на бенчмарках от классического управления до задач со зрением.

ЧТО получили: ES обеспечили лучший баланс между сохранением старых навыков и освоением новых, превзойдя все RL-бейзлайны в 8 из 18 условий. Градиентные методы не выиграли нигде. GA показали наивысшую точность обучения в 10 из 18 условий, решив задачи, где градиентные алгоритмы терпели неудачу. По замерам авторов, ES находят окрестности в пространстве весов в 3.9 раза шире по сравнению с PPO, а размер общей для задач окрестности предсказывает сохранение навыков (p = 5x10^-5).

ПОЧЕМУ это важно: Результаты показывают, что спящие нейроны и дрейф весов вызваны градиентной оптимизацией, а не самой нестационарностью среды. Однако нейроэволюция требует много сэмплов и с трудом сходится на узких пиках функции вознаграждения.

Нейроэволюционировать тут: https://t.me/gonzo_ML_podcasts/4821