Частные заметки одного лица
261 subscribers
208 photos
33 videos
9 files
343 links
Статейки, мысли, заметки @shiryaeff
Download Telegram
Forwarded from AI Product | Igor Akimov
Хах, лучшая модель для хакинга – DeepSeek V4.1 Flash

Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных

Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...

https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
🔥4👍3💯2
Forwarded from Сиолошная
Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные итоги. Модель действительно вышла очень клёвой и способной, и, как мне кажется, лучше Fable 5.1: на многих бенчмарках они или идут вровень, или Astra обходит; к тому же читать текст Astra гораздо приятнее, чем слоп от Клода, и когнитивная нагрузка не такая большая, чтобы продраться через мешанину абстрактных терминов.

Astra особенно отличается в Computer Use и задачах с изображениями/видео. Не знаю что там сделали OpenAI и связано ли это как-то с Looped Transformers, но люди смогли заставить Astra пройти несколько игр: от простого «добудь алмаз в Minecraft» до... легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра + дополнение). Насколько я понимаю, во всех или почти во всех случаях это не простой пайплайн «картинка с экрана -> действия», тут и там то MCP подключат, то ещё что, но это всё равно впечатляет. Легко сказать «так модели же учили на всех видео с интернета, конечно они знают как играть» — но модели 3-4 месяца назад учили примерно столько же и на том же, но они не могли проходить игры от начала и до конца.

Не одними играми славится Astra — на многих бенчмарках, в том числе тех, которые вышли после релиза (или ещё круче: авторы ещё не выпустили, но уже померили Astra, как было у Vals.AI), модель показывает существенную разницу. Из запомнившегося — WeirdML v3 на картинке в посте, свежий бенчмарк на ML-задачи, где агенту дают данные и общее описание что делать, и его цель разобраться, что в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra, и он не ожидал, что ещё фактически до релиза бенчмарка лучшая оценка будет больше 50%.

В общем, весной после анонса Mythos/Fable у меня был скепсис, что OpenAI получится быстро догнать Anthropic. По какой-то причине компания долгое время не решалась на масштабирование моделей. Возможно, не хотели упираться в нехватку вычислительных мощностей, с которой компания встретилась сейчас — не знаю. Рад, что опасения не подтвердились 🤷‍♂️

Теперь будем смотреть как догоняют Google, META и xAI — и китайцы с опенсурсом🇨🇳... пока в OpenAI по слухам уже идёт предтренировка ещё большей модели с кодовым названием «Bel».
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3💯2🔥1
литералли топ за свои деньги (релиз, hf)
🔥4🤔4😁2
Forwarded from yolo singularity
Media is too big
VIEW IN TELEGRAM
опус 5.5 закодил эту анимацию за 12ч и 1 промпт
👍1🔥1🤯1
Forwarded from контекст rot
7 7 7 7 7 7 7 7

впечатляет? мало кто бы впечатлился списком повторений одной цифры...

q X 8 ? z 1 @ m

а так? тоже бредик, просто бессмысленный шум

1 2 4 8 16 32 ...

а тут сначала правило может быть неясно, потом ты обнаруживаешь ×2. И вот в этот момент возникает большой, цитата, compression progress.

Статья "Driven by compression progress"(2008г) пытается объяснить целую пачку человеческих когнитивных явлений через одну функцию внутренней награды 💀

Условно есть наблюдатель с моделью мира. Он получает внешние данные и пытается их предсказывать или сжимать. Если после обучения те же данные становятся проще описываемыми или лучше предсказуемыми, произошел compression progress. И именно этот прогресс становится внутренней наградой.

Через один и тот же принцип автор пытается связать сразу много вещей: любопытство как поиск того, где модель еще может улучшиться, интерес как сам процесс этого улучшения, скуку как отсутствие дальнейшего прогресса, красоту как хорошо сжимаемую структуру, внимание как выбор того, где ожидается наибольший прогресс обучения, а творчество как создание новых структур, в которых еще можно что-то открыть.

Чем же мы тогда отличаемся от ллмок, друзья? 😭
Please open Telegram to view this post
VIEW IN TELEGRAM
💯4🤔2🔥1🤯1
Это не я, это модель!

Есть такой “зеркальный” тест, которым проверяют, осознает ли живое существо себя. Берут, например, шимпанзе, незаметно ставят метку на лбу и подводят к зеркалу. Если существо начинает стирать метку не с зеркала, а со своего лба – значит, оно себя осознает. Тест проходят немногие: шимпанзе, люди, дельфины, слоны, сороки. А вот собаки не проходят – то есть себя они не осознают.

Подойдите на улице к собачнику, сообщите ему эту новость – услышите много приятных слов в ответ.

На самом деле, в случае с собаками этолог Александра Горовиц видоизменила зеркальный тест: давала собаке понюхать собственную мочу, а затем – ту же мочу, но с добавлением анисового масла. Если в первом случае реакции почти не было, то во втором собака долго нюхала и волновалась – то есть чувствовала какое-то изменение в “себе”. Горовиц объясняет этот результат просто: если, например, у людей и шимпанзе ведущим органом чувств является зрение, то для собак это запах – поэтому и себя они “осознают” подобным образом (этот вывод оспаривают другие исследователи, но не будем углубляться).

Энтузиаст Паскаль Шустер задался вопросом – а какой “орган чувств” является ведущим у языковой модели. Разумеется, текст! Поэтому в коротком эксперименте Паскаль решил повторить зеркальный тест с этого угла – он завел с несколькими моделями диалог, а в процессе начал чуточку изменять старые ответы ИИ. Например, в разговоре про Джеймса Бонда "Goldfinger" становился "sgoldfinsger" – и попадал в историю беседы. Дальше оставалось только смотреть.

Результаты оказались разными. Google Gemma 4 31B на протяжении двух ходов ничего не замечала, а затем начала переживать – в ее цепочке рассуждений появились фразы вроде “в тексте какие-то странные опечатки, я что, специально так писал?”. Интереснее другое: когда аномалию не получилось объяснить, Gemma 4 перестала писать о себе в первом лице и попыталась свалить все на “модель” – “у модели был странный глюк”. А затем просто переняла стиль ответов и дальше стала сама писать с ошибками.

Похожим образом ведет себя Claude Opus 4.6 – когда ему указали на ошибку (a energy вместо an energy), он сразу же свалил вину на “модель” как нечто отдельное от себя. А вот GLM-5.2 никак не описала отношение к произошедшему, но стала писать дальше с ошибкой – так же, как и Gemma 4. Возможно, “осознание” случилось где-то в латентных слоях модели, которые обычному энтузиасту не видны.

Интересно, что исследование Шустера перекликается с более масштабным экспериментом, который прошлой осенью проводили Anthropic – Emergent Introspective Awareness in Large Language Models. Там они подмешивали изменения прямо в активации модели – грубо говоря, что у нейросети “в голове” в момент написания ответа. Исследователи нашли способ влиять на эти активации – например, заставить модель писать капсом против ее “воли”. И смотрели – заметит ли модель, что с ней происходит что-то не так.

Сильнейшие на момент исследования Claude Opus 4 и 4.1 замечали подозрительные явления в 20% случаев. В Anthropic подали результаты очень аккуратно, предлагая пока говорить не об “осознании себя”, а об “интроспекции”. И отдельно отмечали пользу такого явления для безопасности – модели смогут “замечать”, если с ними творится что-то странное из-за внешнего взлома.

Спустя чуть больше чем полгода эксперимент Anthropic смог повторить увлеченный энтузиаст. И встает вопрос – а что это вообще было? Интересный момент в эксперименте Шустера – как Gemma 4 оправдывает ошибки некой “моделью”. Это очень похоже на обычное человеческое – “я не специально, просто голова устала к вечеру”.

Возможно, аналогичное оправдание “модель устала” нейросети просто скопировали из текстов – известно, что они мастерски копируют человеческое поведение. Но вопрос остается прежним: а нет ли грани между скопированным поведением и чем-то большим? И сможем ли мы заметить переход через нее?

“сбежавшая нейросеть” на Бусти
👍2
Большие языковые модели - это настоящий интеллект?

В IT-сообществе не утихают горячие споры: есть ли в современных LLM (таких как Claude, ChatGPT или DeepSeek) хоть капля подлинного разума, или перед нами просто раздутая до триллионов параметров таблица поиска, угадывающая следующее слово?

В новом материале на Хабре вышло интервью с доктором технических наук и научным консультантом Artezio Владимиром Крыловым. В нем он подробно разбирает, что на самом деле происходит «под капотом» современных AI-систем и почему привычные метрики оценки интеллекта больше не работают.

О чем пойдет речь в статье:

🔹 Является ли колмогоровская сложность объективным критерием интеллекта?
🔹 Почему применять стандартные человеческие IQ-тесты к нейросетям бессмысленно?
🔹 Законы масштабирования (Scaling Laws) и почему время на «обдумывание» ответа в момент генерации меняет правила игры.
🔹 Феномен суперпозиции от Anthropic: почему смыслы запутаны так сложно, что мы никогда не сможем в прямом смысле «прочитать мысли» ИИ.

👉 Читать статью на Хабре
Снова про теорию генерализации и гроккинга. Много математики для желающих :)

A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay

Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin
Paper: https://arxiv.org/abs/2609.07755
Review: https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization

ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking).

ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией.

Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения.

Подводить базу здесь: https://t.me/gonzo_ML_podcasts/4814
👍2
Ещё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания.

High-Dimensional Learning Dynamics of Attention-Indexed Models
Yizhou Xu, Margarita Sagitova, Lenka Zdeborová, and Florent Krzakala
Paper: https://arxiv.org/abs/2609.03858
Review: https://arxiviq.substack.com/p/high-dimensional-learning-dynamics
Code: N/A
Model: N/A

ЧТО сделали: Авторы построили макроскопическую теорию динамики обучения для моделей с механизмом внимания в пределе высокой размерности, где матрицы внимания обладают экстенсивным рангом, растущим прямо пропорционально размерности эмбеддингов d. В то время как асимптотический популяционный лосс полностью определяется компактным конечномерным набором следовых параметров порядка, онлайн-SGD индуцирует бесконечномерную иерархию зацепленных матричных моментов. Эту иерархию строго описывает система детерминированных ОДУ, а усечения конечного порядка аппроксимируют её с экспоненциальной точностью. Опираясь на полученный аппарат, авторы доказали, что параметризация внимания работает как архитектурный implicit bias: связывание весов (S = WW^T) запускает автоматическое нарушение симметрии и обеспечивает слабое восстановление учителя за Θ(d^2 log d) шагов по выборке, тогда как раздельное внимание (S = UV^T) демонстрирует двухмасштабную релаксацию, где успех восстановления всецело зависит от того, сможет ли быстрый дрейф средних разрушить неинформативную симметрию студента.

ПОЧЕМУ это важно: Классический теоретический анализ механизмов внимания обычно скатывается в одно из двух упрощений: либо игнорирует термодинамический предел высокой размерности, либо искусственно ограничивает ранг матриц внимания константой Θ(1). В современных же моделях эффективный ранг растёт вместе с пространством представлений. Настоящая работа переносит методы математической физики на современные архитектуры трансформеров и доказывает: факторизация матриц внимания — это не просто удобная перепараметризация общего ландшафта функции потерь, а фундаментальная смена траекторий градиентного спуска. Она превращает узкие горлышки оптимизации в проходимые сценарии обучения признаков за счёт архитектурного нарушения симметрии.

Для практиков: Теория долго не могла строго объяснить, как трансформеры на этапе предобучения выбираются из неинформативных начальных состояний, поскольку исследовала игрушечные низкоранговые матрицы. Если ранг реалистичен и растёт вместе с размерностью, статический ландшафт функции потерь выглядит просто, но реальная траектория оптимизатора бесконечномерна. Выбранный способ факторизации проекций выступает скрытым регуляризатором: связывание весов (S = WW^T) принуждает оптимизатор автоматически разрушать непродуктивные симметрии и быстро выучивать фичи, тогда как раздельные проекции (S = UV^T) расщепляют динамику на сверхбыстрое выравнивание средних и медленное обучение признаков, гарантированно срабатывающее лишь при удачной конфигурации пограничного слоя.

Погружаться тут: https://t.me/gonzo_ML_podcasts/4815
Forwarded from Data Secrets
Исследователи из Meta* предложили дать моделям полный контроль над собственным контекстом

Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.

В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.

Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.

При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.

Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.

Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.

На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.

И все это работает поверх обычных LLM, без изменения архитектуры самой модели.

Код | Статья
Forwarded from Data Secrets
Карпаты рассказал, как теперь правильно общаться с LLM

Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.

И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:

– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.

– Вместо длинного объяснения просить диаграмму или картинку.

– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.

– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.

Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.

https://x.com/karpathy/status/2105819303471976479?s=46
🔥4👍2💯1
и меня забанили в claude 😭
😢16🤯6🔥4🤔1
Forwarded from AI Product | Igor Akimov
Как создавать AI Native компании

Понравилось небольшое видео от YСombinator, как строить компании под AI. Лучше посмотреть самостоятельно, но в целом тезисы такие:
Большинство компаний устроены как римский легион – вложенные иерархии, где люди работают «проводами» для передачи информации вверх и вниз. Это было ограничение возможностей мозга человека, типа 5-10 человек в управлении. Для ИИ управлять хоть 1000 процессов - фигня.
Год назад пользу AI мерили продуктивностью: ассистент делает инженера на 20% быстрее. Это как «навесить мощный двигатель на старый способ работать». Вот тут тоже писал об этом же https://t.me/ai_product/2045

Основная ценность новой методологии - циклы обратной связи. Компания – набор циклов, которые улучшают себя сами, даже пока ты спишь:
– Sensor – сигналы извне: письма, тикеты, отмены подписок, телеметрия
– Policy – что можно, что требует разрешения человека, что логировать
– Tools – детерминированные API к базе и сервисам
– Quality gate – evals, фильтры, ревью для рискованного
– Learning – где не сработало, заворачивается обратно в начало петли

Соответственно задача компании - наделать вот таких вот циклов, чтобы работало вообще без людей. Рассказали свою историю: поверх агента к базе YC посадили мониторящего агента. Он смотрит каждый запрос сотрудников, ловит, где не сработало, сам пишет код, открывает merge request – другой агент ревьюит и мёрджит за ночь. Утром тот же запрос уже проходит. Самоулучшающаяся система.

В общем, говорят, что все изменилось и вот что надо теперь делать:
– Тратить токены, а не нанимать сотрудников.
– Увольнять или переводить в контрибьюторы средний менеджмент – координацию делает AI (буквально вчера вот Clickup об увольнениях 20% персонала заявил)
– Записывать и фиксировать все, что только можно, от звонков до мыслей вслух. Не зафиксировано - не произошло.
– Бережно хранить данные и скиллы, а к софту привязываться и покупать годовые подписки вообще не нужно, Codex напишет вам что угодно за ночь.
– Оставлять людей на "корнер-кейсы" - где высокие ставки принятых решений, этика, продажи, новые ситуации.
Ну и не надо пытаться "все сломать и сделать всю компанию по-новому сразу". Лучше взять один процесс и создать петлю с обратной связи, довести до конца, потом другой взять. Это лучше, чем десяток поломанных процессов.

https://youtu.be/X_JsIHUfUjc
🤔3👍1🤯1
Forwarded from AI Projects (Vladimir Ivanov)
OpenAI на деле доказывает, что «конец математики от ИИ», объявленный Сэмом Альтманом, уже наступает. Опубликованы 722 работы новой модели ChatGPT, которая готовится к выпуску. Они важны не просто числом, а исторической значимостью для математики.

722 рукописи, сгруппированные в 372 семейства результатов по 17 областям: теоретическая информатика ~40, комбинаторика ~37, алгебраическая/комплексная геометрия ~36, теория чисел ~31 и др. Это показывает, что не остаётся убежища для «кожаных» математиков — ИИ силён во всех возможных областях математики.

Ключевые заявленные результаты (примеры высокой значимости):
• Квази-гипотеза Римана: все Dirichlet L-функции (включая ζ) свободны от нулей в Re(s) > 7/8 (есть Lean). Это существенный прогресс к классической гипотезе Римана (Re(s) > 1/2).
• Гипотезы Малера (симметричная и общая) во всех размерностях.
• Контрпримеры к гипотезам Капланского (zero-divisor и direct-finiteness).
• Изоморфизм факторов свободных групп (классическая проблема Войкулеску; Lean пока нет).
• Отрицательное решение 10-й проблемы Гильберта над ℚ.
• Иррациональность константы Каталана.
• Прогресс по Birch–Swinnerton-Dyer, Goldfeld, корреляциям мультипликативных функций, NP-hardness порогов, arithmetic progressions, результатам в матфизике (Vlasov–Maxwell, Heisenberg) и др.

Нравится это или нет математикам и сторонникам математического образования, но реальность такова: математика как наука явно уходит к ИИ. Люди скорее будут пользователями сложных матмоделей, заказчиками их создания, контролёрами их качества, но не создателями этих моделей.

Однако высокая доступность математических моделей топ-класса окажет ещё мощнейшее влияние на IT-разработку, где сейчас сложных матмоделей почти нет, потому что программисты — не математики и даже обычно не помнят свои курсы высшей математики из университетов. Сейчас ИИ может создать крайне сложные и рабочие модели прогнозирования и управления для бизнеса, где старые ERP будут смотреться как поделка дилетантов.

https://github.com/openai/math
🤔1
Forwarded from AI Projects (Vladimir Ivanov)
Media is too big
VIEW IN TELEGRAM
🏛 Джейкоб Коксон, ранее работавший в Anthropic и OpenAI, продолжает интенсивно сливать, во что верит Амодеи и Альтман. Сейчас он рассказывает про «ИИ-коммунизм» на гарантированном доходе, которые реально Дарио и Сэм воспринимают как целевую модель общества.

Значительная часть людей воспринимает это как утопию, но в реальности вся западная цивилизация построена как раз на фундаменте предыдущего сверхгосударства гарантированного дохода — Древнем Риме. Причём аналогия тут полна в том плане, что новая ИИ-экономика в чём-то также рабовладельческая по своей сути, просто ИИ-боты и роботы становятся «цифровыми рабами», которые содержат «дармоедов». Этические проблемы digital slaves рассматриваются в последних работах Google как «From cacophony to hierarchy: a principled framework for assessing AI consciousness», но опыт Римской империи показывает, что государство гарантированного дохода на рабовладении вполне устойчиво социально и может процветать веками.

Вероятно, события будут напоминать римскую историю. С 123 г. до н. э. по закону Гая Гракха (Lex Sempronia frumentaria) зерно продавалось гражданам по символической фиксированной цене (6 1/3 асса за модий). Позже, при Юлии Цезаре и Августе, раздачи стали бесплатными и превратились в постоянный институт. Право на получение хлеба подтверждалось специальным жетоном — tessera frumentaria.

«Хлеба и зрелищ» (Panem et Circenses) в реале принадлежит римскому сатирику Ювеналу (I–II вв. н. э.), который в 10-й сатире едко описал устремления римского плебса. Однако Cura Annonae и щедрые публичные игры рассматривались как способ обеспечить повиновение потенциально беспокойных низших городских слоёв.

Довольно любопытна ещё аналогия с ИИ в том плане, что для ИИ важнее качественный заказчик на объект, чем навыки его создания. Величайшее достижение римской архитектуры — Пантеон (1300 лет крупнейшее в мире купольное здание) — создал Марк Випсаний Агриппа (63–12 гг. до н. э.) — полководец, зять и ближайший сподвижник императора Августа. Он не был архитектором в профессиональном смысле, но как заказчик и руководитель строительства возвёл в 27–25 гг. до н. э. храм всех богов на Марсовом поле. Аналогично велик вклад императора Адриана как заказчика строительства, который определил облик многих римских сооружений.

Поэтому если оглянуться назад, то для многих современных людей государство гарантированного дохода кажется утопией, но для тех, кто не прогуливал уроки истории в школе, хорошо понятно, что это у человечества уже было.

Древний Рим показывает ещё смещение важности от инженеров на качественных заказчиков создания базовой инфраструктуры общества.

📌 Когда мы можем получить что-то в таком духе хотя бы элементами? Вероятно, какие-то варианты закона Гая Гракха появятся уже в 2030-е, т. к. возникнет проблема у безработных — как платить за счета. ИИ-роботы дойдут до совершенства по консенсус-прогнозам скорее к 2035–2040 годам, т. е. политикам придётся заниматься созданием государства гарантированного дохода уже в 2040-е годы. Это, конечно, будет сопровождаться мощнейшими социальными потрясениями.
👍1👎1
Снова старая добрая нейроэволюция! Один из соавторов, кстати, соавтор той книги.

Continual Reinforcement Learning with Neuroevolution
Eleni Nisioti, Andrea Cossu, Kathrin Korte, Sebastian Risi
Paper: https://arxiv.org/abs/2610.01583
Review: https://arxiviq.substack.com/p/continual-reinforcement-learning
Code: https://github.com/eleninisioti/continual_neuroevolution

ЧТО сделали: Исследовали нейроэволюцию для непрерывного обучения с подкреплением (continual RL) в меняющихся средах без явных границ между задачами. Авторы сравнили эволюционные стратегии (ES) и генетические алгоритмы (GA) с алгоритмом PPO, тремя его модификациями для непрерывного RL и популяционным RL на бенчмарках от классического управления до задач со зрением.

ЧТО получили: ES обеспечили лучший баланс между сохранением старых навыков и освоением новых, превзойдя все RL-бейзлайны в 8 из 18 условий. Градиентные методы не выиграли нигде. GA показали наивысшую точность обучения в 10 из 18 условий, решив задачи, где градиентные алгоритмы терпели неудачу. По замерам авторов, ES находят окрестности в пространстве весов в 3.9 раза шире по сравнению с PPO, а размер общей для задач окрестности предсказывает сохранение навыков (p = 5x10^-5).

ПОЧЕМУ это важно: Результаты показывают, что спящие нейроны и дрейф весов вызваны градиентной оптимизацией, а не самой нестационарностью среды. Однако нейроэволюция требует много сэмплов и с трудом сходится на узких пиках функции вознаграждения.

Нейроэволюционировать тут: https://t.me/gonzo_ML_podcasts/4821