Частные заметки одного лица
258 subscribers
197 photos
31 videos
8 files
320 links
Статейки, мысли, заметки @shiryaeff
Download Telegram
Снова про эмерджентность (https://t.me/gonzo_ML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных задач.

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov
Статья: https://arxiv.org/abs/2606.25010
Ревью: https://arxiviq.substack.com/p/emergent-capabilities-arise-randomly
Код: N/A
Модель: N/A

# TL;DR

ЧТО сделали: Авторы провели детальное исследование внутренних механизмов моделей (mechanistic study), которое показало, что внезапное, стохастическое появление прикладных способностей (downstream capabilities) у трансформеров в процессе обучения вызвано резким обнаружением паттернов разреженной маршрутизации внимания (sparse attention routing patterns), специфичных для конкретной задачи. Анализируя предобученные LLM и конструируя контролируемые синтетические задачи, они выделили длину контекста и разреженность паттернов как главные узкие горлышка (bottlenecks), ограничивающие этот процесс обучения, а также продемонстрировали, что альтернативные архитектуры или стратегии предварительного предобучения могут значительно ускорить эмерджентность.

ПОЧЕМУ это важно: Это исследование демистифицирует «эмерджентные способности», смещая парадигму от необъяснимого, зависящего от масштаба феномена или «иллюзии метрик» к конкретной проблеме оптимизационного поиска. Понимание того, что эмерджентность соответствует обнаружению разреженных цепей маршрутизации (routing circuits), открывает чёткий путь в обход дорогостоящего масштабирования «в лоб» (brute-force scaling). Вместо этого исследователи могут проектировать новые архитектуры, специализированные пайплайны синтетического предобучения или вводить оптимизационные баесы (optimization biases), которые сделают выучивание таких разреженных паттернов внимания крайне эффективным с точки зрения расхода данных.

Для практиков: Вместо бесконечного скейлинга моделей для достижения эмерджентности стоит сфокусироваться на предварительном предобучении (pre-pretraining) на структурированных синтетических датасетах (например, на языках Дика / Dyck) и использовать гибридные архитектуры, эффективные при позиционной маршрутизации (такие как MLP-Mixer), чтобы снизить оптимизационную сложность для трансформеров.

Искать эмерджентность тут: https://t.me/gonzo_ML_podcasts/4752
👍3
Хорошая, полезная работа. Лишний раз показывает, что оркестрация важна, и подводит под это математический фундамент.

Agentic Systems as Boosting Weak Reasoning Models
Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti
Paper: https://arxiv.org/abs/2605.14163
Review: https://arxiviq.substack.com/p/agentic-systems-as-boosting-weak
Code: N/A
Model: N/A

# TL;DR

ЧТО сделали: Авторы представили теоретический фреймворк, который формализует агентный поиск комитетом (committee search) как бустинг во время инференса (test-time boosting). Разделив задачу на отдельные компоненты — покрытие генератора (proposal coverage), локальную идентифицируемость (local identifiability), глубину прогресса (progress depth) и разнообразие (diversity), — они показали, что легковесную модель (GPT-5.4 nano) под управлением структурированной обвязки из критиков и компараторов можно заставить работать на уровне лучших коммерческих SOTA-моделей на бенчмарках по разработке ПО.

ПОЧЕМУ это важно: Эта работа смещает фокус масштабирования LLM с гигантского увеличения параметров моделей на программно-определяемые архитектуры инференса. Авторы математически доказывают, что способность генерировать решения не означает способность их валидировать. Таким образом, предел масштабирования во время инференса ограничен «слепыми зонами» базовой модели-генератора, а не неэффективностью выбора.

Для практиков: Вместо того чтобы тратить миллионы на файнтюнинг огромных моделей, можно использовать ансамбли из дешёвых и быстрых моделей-генераторов, обёрнутых в строгие каскады критиков и попарных компараторов. Главное — убедиться, что у базовой модели в принципе есть ненулевая вероятность сгенерировать правильный ответ (хотя бы в одном из k сэмплов), и предоставить системе надёжные внешние сигналы валидации (тесты, линтеры).

Ансамблировать и оркестрировать тут: https://t.me/gonzo_ML_podcasts/3739
👍3
Все модели думают одно и тоже ( и учат одно и тоже)

- взяли разные данные
- разные модели
Обучили через SGD и показали что учится одно и тоже с точностью до вращения.


arxiv.org/abs/2507.01098
Forwarded from Вайб-кодинг
На первое место в трендах GitHub вышел OpenSandbox — платформа песочниц для ИИ-агентов от Alibaba.

Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor.

Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре.

100% опенсорс 😋
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустили Claude Academy

https://claude.com/blog/anthropics-approach-to-teaching-and-learning-ai

Инициатива направлена на «формирование AI-грамотности». Подход построен на том же, чему Anthropic учит собственных сотрудников на онбординге. Это не классический промпт-инжиниринг, а скорее продукто-агностичное обучение: вас учат общим правилам и универсальной логике общения с ИИ.

Внутри – курсы с практикой , туториалы и кейсы. Есть даже трекинг прогресса. И все бесплатно.

Из особо интересного: запустили скилл Academy Skill. Можно поставить, и Claude будет рекомендовать вам подходящие курсы прямо в процессе работы.

https://github.com/anthropics/skills/tree/main/skills/academy-guide
👍2
Я все чаще замечаю забавную инверсию.

Раньше в моих проектах копились идеи, которые я не успевал реализовать. Теперь coding-агенты реализуют идеи быстрее, чем я успеваю решить, хочу ли я потом с этими изменениями жить.

В списке моих диалогов с Codex лежит немало почти готовых фич. Там проходят тесты, работает интерфейс, обновлена документация. Осталось «только проверить».

Проверить - это не посмотреть, что тесты проходят (агент их уже сам прогнал). Нужно еще понять, не появилась ли в проекте новая лишняя концепция? Хорошо ли изменение сочетается с остальной системой? Готов ли я поддерживать этот код через год? И вообще - нужна ли мне эта фича после того, как я увидел её реализованной?

Поэтому я откладываю проверку «на потом», которое обычно не наступает.

Раньше сырая идея оставалась хотелкой в заметках и ничего не стоила. Теперь она за десять минут превращается в ветку с кодом, тестами, документацией и потенциальными последствиями.

Вот и получается, что идеи теперь копятся не перед реализацией, а после неё - перед бутылочным горлышком моего внимания и времени.

Причём у такого кода короткий срок годности. Проект продолжает меняться, ветка отстаёт все больше, а контекст постепенно выветривается из головы. Проверить изменение завтра сложнее, чем сегодня, а через неделю уже дешевле выкинуть и сделать заново.

Я слышал похожее и от других команд. У некоторых после внедрения coding-агентов число открытых PR выросло в 5–7 раз. Генерация кода в 2026 году ускорилась, а пропускная способность человеческого внимания - пока нет.

Поэтому сейчас я стараюсь нарезать задачи так, чтобы агент приносил не целую реализованную хотелку, а следующий минимальный reviewable slice: одно понятное изменение и достаточно сопроводительного контекста, чтобы проверить его за один подход.

По расходу токенов может выходить забавно: Codex нередко тратит до 95% процентов токенов на поиск такого маленького, независимого и проверяемого следующего шага, который я одобрю. И только процентов пять уйдет на его реализацию. Оно того стоит.

Такой кусочек легче проскальзывает через бутылочное горлышко внимания и начинает приносить пользу. Большая же фича, даже полностью написанная агентом, рискует просто пополнить залежи рабочего, но быстро устаревающего кода.

А как вы решаете проблему с накапливающимися фичами и PR от coding-агентов - или у вас её нет?

Ваш, @llm_under_hood 🤗
👍3
Небольшие заметки на тему такого понятия, как «ответственность».

У нас сейчас очень любят вспоминать это слово, как только нужно сподвигнуть человека сделать то, чего ему делать совершенно не хочется. Политики говорят об «ответственных гражданах» — подразумевая безропотное принятие решений власти и смирение с тяготами военного времени. Социологи говорят про рост инфантилизма (дебильный термин, кстати) у молодежи. Да даже всяких инстаблогерш можно вспомнить, которые постоянно ноют на «безответственных мужиков».

Проговорю на этом моменте прописные истины: любая ответственность берется человеком не просто так, а с целью достижения некоторых выгод. Все исторические привилегированные социальные слои: воинская и служилая аристократия, духовенство, да даже буржуазия и современные гос. элитарии — все они получили свои статусы не просто так, а беря на себя дополнительную ответственность и дополнительные риски. Но принципиально важно здесь понимать именно первичность дополнительных benefits.

Идеальное состояние общества в этом вопросе — меритократия: привилегии и ответственность идут в равной пропорции. Но справедливо будет сказать и то, что достичь этого идеала невозможно (как и любого другого), к нему можно только приближаться. Поэтому чаще мы можем видеть другой расклад, ни разу не идеальный, но вполне естественный: стремление избегать ответственности, но сохранять свои привилегии (так как, повторюсь, именно привилегии являются целью, взятие ответственности — лишь инструмент). Здесь для общества важно вырабатывать механизмы контроля за власть имущими, поскольку если позволить элитам слишком сильно «охренеть» в этом желании, общество попросту сколлапсирует.

Но вот какое состояние для общества точно нездоровое — так это такое, в котором дополнительная ответственность есть, а вот дополнительных выгод за ее взятие человеком не предусмотрено. Или предусмотрено, но чисто символически. В этой ситуации люди очень быстро станут массово избегать любой ответственности, постоянно перекладывая ее на других, а любая инициатива становится нежелательной и наказуемой. Потому что... зачем? Бери на себя ответственность — или не бери, а в результате твоё положение и материальное благополучие никак не поменяется. Или опять же, поменяется, но совсем чуть-чуть, в неадекватно малом объеме по сравнению с трудозатратами. А тогда зачем напрягаться?

Я думаю, что причина всей этой «инфантилизации» молодежи и общего нежелания брать ответственность — это следствие нашей чрезмерно эгалитарной эпохи, в которой привилегии и неравенство объявлены чем-то плохим, а также считается нормой, что человек, идя, допустим, на какую-то политическую должность, должен это делать исключительно ради того, чтобы «работать на благо общества» (т.е. брать на себя дополнительную ответственность за просто так). Но так не бывает. Люди всегда были и будут эгоистами, в той или иной степени, и изменить это не получится никак (в том же СССР пытались — не получилось). И если люди будут чувствовать, что брать на себя ответственность попросту невыгодно — они, сюрприз, будут её избегать.
👍4
В демографическом вопросе проблема соотношения ответственности и выгод за нее, кстати, работает крайне наглядно и как швейцарские часы — это буквально лучший пример для иллюстрации моих рассуждений выше.

В условиях традиционного аграрного общества высокая рождаемость обеспечивала процветание каждой отдельно взятой семьи. Ну буквально потому что, чем больше у вас работников — тем больше вы можете производить. У вас появляются излишки, которые вы продаёте, в итоге ваша семья богатеет.
Отдельно скажу и про роль мужчины, как главы семьи — да, на нем лежала ответственность буквально за всех, но и вся полнота власти и право распоряжаться имуществом принадлежало тоже ему. Больше ответственности — больше прав и выгод.

А что сейчас? Дети из актива и «трудовых кадров» превратились в длительный источник расходов, который в принципе не способен впоследствии работать на благосостояние семьи (зато хорошо работает на благосостояние государства). То есть сейчас средняя многодетная семья будет в целом беднее малодетной или вообще бездетной. Ситуацию усугубляют условия жизни в крупном городе: в сельской местности у вас есть земля и большой дом. В городе — скорее всего вы будете иметь однушку или двушку в очередном человейнике. То есть в месте, максимально не способствующем размножению.

Ну и роль главы семьи, которую всё еще отводят мужчине, сейчас тоже переживает не самые лучшие дни. Ожидаемая от него ответственность в целом сохранилась, а вот выгоды и возможность контролировать то, за что он отвечает — была сильно урезана. Жена в любой момент может взять, и спокойно уйти (или изменить, а потом уйти) забрав с собой детей. Бывший глава семьи получает потерю половины имущества и алименты — вот такая сейчас «выгода» за взятие на себя ответственности.

Стоит ли говорить о том, что демографический кризис и «мужская безответственность» при вот таких условиях современного общества — это настолько очевидная и логичная закономерность, что вопросы скорее вызывают те люди, которые этому искренне удивляются? И я снова повторю свой тезис: в условиях максимальной невыгодности (а то и убыточности) взятия на себя ответственности за что-либо, люди в своей массе будут всеми силами этой ответственности избегать. И тут не помогут никакие попытки воззвать к морали, никакие попытки устыдить людей — в вопросе личной выгоды большинство людей ни разу не дебилы и прекрасно всё понимают.

Если наше государство хочет, чтобы люди были более ответственны в своей жизни (и в демографических вопросах в частности) — оно должно создать условия, в которых взятие на себя какой-то дополнительной ответственности будет давать человеку ощутимую выгоду. И другого пути, боюсь, нет.
👍3
Первый обзор научной статьи в этом канале

Я не фанат читать свежие статьи. Сам когда-то занимался физикой и понимаю: 99 % работ никогда не доходят до применения. Читать сто статей, чтобы найти золото, я не могу — я не металлоискатель. У меня свой метод.

Я статейный ждун. Жду, когда компании, у которых R&D-отдел в сто раз больше моего, перепробуют все эти статьи и найдут, что реально работает. А потом хитрый ждун про это узнаёт: от знакомых, из пресс-релизов или из тех же статей, но уже от самой компании — с комментарием, где оно работает в проде.

Сегодня смотрим на метод, которого я дождался, — AlphaEvolve. По слухам, его уже вовсю применяют наши большие западные коллеги. А теперь и я сам убедился в адекватности подхода. Садитесь поудобнее.

Что такое AlphaEvolve

Статья Google DeepMind.

Идея проста. Если у вас есть метрика, которую можно посчитать автоматически, — вы можете оптимизировать под неё промпт. Не трогая веса. Генетическим алгоритмом. В статье делали для кода, но метод работает для любой задачи, где есть внятная метрика.

Стартуем с одного промпта, складываем его в базу. Дальше цикл. Из базы достаётся промпт-родитель, а вместе с ним ещё несколько соседей — часть лучших, часть просто непохожих, чтобы не залипнуть в локальном оптимуме. Всё это уходит в LLM вместе с метриками качества: посмотри, что уже пробовали, предложи точечную правку промпта-родителя. Правку накладываем, считаем метрику, удачное возвращается в базу. И так тысячи раз.

Что этим методом наоптимизировали в самой статье:

— планировщик Borg: 0,7 % всех мощностей Google, больше года в проде
— FlashAttention: в одной боевой конфигурации инференса ядро на 32 % быстрее
— и даже побили рекорд перемножения комплексных матриц 4×4

Но применять можно к чему угодно. Хоть к классификации текстов: тюним промпт по F1 на обучающей выборке, финально меряем на тестовой (только не перепутайте!).

Почему я думаю, что за этим будущее

Одно слово. Интерпретируемость. Это основная проблема всех AI-моделей. А тут вы буквально видите, что «оптимизатор» выучивает из обучающей выборки.

Когда вы оптимизируете веса, вы живёте в чёрном ящике. Может, у вас датасет смещён и модель учит вообще не то — узнаете вы об этом уже в продакшене. Когда вы оптимизируете текст, на каждой итерации видно, что именно в него вносится. И нежелательное изменение можно откатить.

Ещё вы можете явно задать правила оптимизации: про это пиши, про это не пиши. Настоящий рай для любителей всё контролировать (мне, например, очень нравится).

Что вам надо делать сейчас

Важно: это работает, но только на крупных моделях, которые умеют в длинный контекст. Ваш любимый 1.5B Qwen не вытянет. Но на топ-тир моделях оно заводится.

А если нужно подешевле, то давайте дистиллировать результат в веса любимого Qwen'а. И весь такой цикл работает по кнопке: автоматически подобрали промпт на крутой модели, автоматически продистиллировали в веса маленькой.

Думаю, вскоре и обычные Qwen'ы научатся так делать.

И нафига тогда я отличия Adam от SGD в универе учил?
👍1
Forwarded from AI Product | Igor Akimov
Промпты старые можно выкинуть на помойку

Вспоминаю разные хаки, "особые слова" и структуры промптов, чтобы модели нормально работали, особенно в автоматическом режиме, много где эти промпты уже забиты в коде. В итоге с текущими моделями все эти советы делают только хуже! Вот что Anthropic пишет в новой статье:

Раньше модели были глупее, и их приходилось обкладывать жёсткими правилами со всех сторон – «никогда не делай так», «всегда делай эдак». Правила спасали от худших сценариев, но в куче ситуаций были просто неверными. Новые модели достаточно умные, чтобы самим понять по контексту, что от них хотят.

Что конкретно поменялось:
– Вместо жёстких запретов – здравый смысл. Было: «НИКОГДА не пиши длинные комментарии к коду». Стало: «пиши в том же стиле, что и остальной код в проекте». Модель сама смотрит и подстраивается

– Примеры больше не помогают, а мешают. Раньше считалось: покажи модели 2–3 примера, как пользоваться инструментом – и она поймёт. Теперь примеры наоборот сужают мышление: модель копирует показанное вместо того, чтобы найти лучший вариант. Лучше использовать богатые файлы-референсы.

– Не грузить всё сразу. Раньше все инструкции запихивали в один огромный документ «на всякий случай». Теперь их раскладывают по отдельным файлам, и модель подтягивает нужный, только когда он реально понадобился

– Не повторяться. Старым моделям одно и то же писали по три раза в разных местах, иначе забывали. Новым достаточно сказать один раз

В Claude Code даже добавили команду /doctor – она сама вычищает ваши раздутые инструкции под новые модели.

Мой вывод из этого очень практический: почти всё, что мы понаписали в промптах за последний год, устарело! Немедленно посмотрите на промпты в своих системах и проекта и поменяйте на более современные стандарты (с проверками конечно же). Я регулярно вижу простыни инструкций, где половина правил противоречит другой половине – и модель тратит силы на распутывание этого клубка, а не на задачу. Новый рефлекс должен быть не «что бы ещё дописать», а «что можно выкинуть».

https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
🔥4👍2
Forwarded from Павел Тулюпа
Media is too big
VIEW IN TELEGRAM
Топ мифов в питании, в которые уже пора перестать верить
👍4