ИИ общество. Заметки исследователя | Андрей Серяков
152 subscribers
12 photos
14 links
Технические заметки исследователя коллективного поведения ИИ.
Download Telegram
Channel name was changed to «ИИ общество. Заметки исследователя»
Всем привет!

Меня зовут Андрей, я исследователь в области коллективного ИИ и ИИ безопасности. Ex-физик частиц в ЦЕРН (кварк-глюонная плазма), с 2025 года полностью переключился на изучение того, как множество взаимодействующих ИИ могут формировать сложные социальные структуры.

Здесь я делюсь:

👉 Техническими деталями экспериментов
👉 Промежуточными результатами и неудачами
👉 Кодом и методологией
👉 Размышлениями о дизайне исследований
👉 Черновиками будущих статей

Канал вообще ожидается довольно душный.

На данный момент у меня несколько движущихся с разной скоростью исследовательский проектов:

👉 Большая экономическая песочница для тестирования появления разных социальных договоренностей и мемов. Развивается медленно, это долгий проект, а мне для поиска грантов нужны быстрые публикации. Вот тут код и подробности
👉 Что там у ИИ при нахождении в больших группах с желанием обучаться социальным нормам и передавать их? Пока на уровне дизайна, но эксперимент стоит в очереде на выполнение. Тык. Еще это немного про отложенную выгоду.
👉 Могут ли ИИшки управлять цепочкой поставок в бизнесе? Ну это совсем случайный проект, которые пришел мне в голову. Вот тут идея, код написан, надо считать, нужны деньги на запуск моделей.
👉 А много - это сколько для ИИ? Ключевая идея, что мы часто в языке используем неопределенные слова, означающие количество, продолжительность, в том числе давая инструкции ИИшкам. Но вкладываем ли мы в эти слова одно и то же значение? Вот тут описана идея, но процес прям совсем в зародыше.
👉 Будут ли ИИ “лажать” на сцене? Тоже зародыш, идея в том, чтобы проверить, есть ли изменение в поведении ИИ в зависимости от “важности” проекта/величины ставок.
👉 Зависит ли поведение ИИ от вашего имени? ДА! По крайней мере у некоторых моделей. В ближайшее время уже буду писать статью. Вот здесь ряд постов про это подряд. Сейчас план запустить еще несколько моделей, посмотреть результаты и писать статью. Но, к сожалению, придется слабые модели юзать, сильные - дорого.
👉 Ну и 🤯🤯🤯. Религия для ИИ! Кончился лимит символов, так что ТЫК.

У меня еще есть основной канал, где я пишу о много другом @sexcolliderrock

Я живу в Санкт-Петербурге и по ряду причин не могу работать в гос.вуза и получать гос.финансирование. Поддержите мою научную работу вот тут ТРИБЬЮТ или тут ФРЕНДЛИ. Это позволит мне деражаться на плаву и посвещать науке все свое время.

А еще я постоянно ищу коллабораторов, кому было бы интересно заниматься со мной исследованиями этого всего, пишите либо здесь в комментах, либо мне на почту a.u.seryakov@gmail.com.
Ну и вот здесь мое CV, если захотите поделиться с кем-то серьезным :)
4
Channel name was changed to «ИИ общество. Заметки исследователя | Андрей Серяков»
Как выглядит работа исследователя? Да вот так :)
Ночь, комп и кофе, хех
🥰4
Комменты прикручены, но не к предыдущим постам, к сожалению
👍3
Я у мамы глупенький.

#names_matter

Решил первый пост посвятить тому, как недавно я провел в общем-то прикольное и методически поучительное исследование, а потом понял, что его можно было сделать по другому очень просто, быстро и точно.

Помните мои результаты про то, что ИИшки систематически меняют свое поведение в покере, когда вы меняете имя оппонента. ТЫК, там несколько постов подряд. Я тогда для каждого имени и для каждой ИИшки запускал одну и ту же покер ситуацию 400 раз, подсчитывал среднее, статистические ошибки, статистическую значимость и т.д. Так вот, какое-то время назад я понял, что это все, конечно, было очень круто, но нафиг не нужно. Можно сделать куда-куда проще и точнее.

На выходе этого эксперимента я просил нейрону выбрать одну из трех стратегий - Fold, Raise, Call - и написать ее. Т.е. я просил в общем-то выдать один токен (приблизительно слово*) (там было Raise Xbb, но пренебрежем сейчас второй часть, это не важно). А как работает нейронка - вы кормите ей последовательность слов, а она своим финальным результатом выдает вероятностное распределение разных последующих токенов, и потом уже просто случайный алгоритм выбирает нужный токен согласно этим вероятностям.

*токены - это закодированные слова, но количество слов огромно, а токенов ограничено. Для популярных слов верно токен=слово, а вот для редких и особенно составных часто слово = несколько токенов. Нейронки работают именно с токенами, иногда в качестве следующего слова в предложении

Т.е. что я делал, да я просто пытался измерить своими множественными измерениями это вероятностное распределение из черной коробки, не залезая внутрь. А в действительности достаточно всего лишь на него посмотреть, ничего измерять не надо, оно доступно, со 100% точность.

Главный эффект, конечно, остается - поведение моделей действительно систематически меняется при изменении имени оппонента, но измерить это можно куда-куда проще, точнее, быстрее и дешевле.

Но вообще главное, что было весело, и такой урок многого стоит.

p.s. забегая вперед, новую версию я еще не сделал, стоит в списке дел на следующую неделю.
👍4
ИИ общество. Заметки исследователя | Андрей Серяков pinned «Всем привет! Меня зовут Андрей, я исследователь в области коллективного ИИ и ИИ безопасности. Ex-физик частиц в ЦЕРН (кварк-глюонная плазма), с 2025 года полностью переключился на изучение того, как множество взаимодействующих ИИ могут формировать сложные…»
Будни исследователя поменявшего область. #Нытье, в общем.

Я участвую с июля в одной бесплатной стажировке по около-моей теме. Попал в группу (там еще три человека) к, как тогда казалось, крутому чуваку - MIT, Стенфорд, ооооочень много публикаций, вот это вот все. Я был в восторге. Проблемы начались, когда он протолкнул исследовательский проект, который мне казался совершенно бесперспективным, а мои идеи все отринул без какой-либо конкретики. Наши созваны всегда были в спешке и никогда не хватало времени обсудить вопросы, которые я поднимал. На проект давалось три месяца, и за все три месяца я так и не понял, что именно мы измеряем, какие метрики и т.п. Все общие слова, поэтому моя прокрастинации все росла и росла.

На следующей неделе надо подавать небольшую статью по результатам этой работы, а вчера был дедлайн по абстракту, и оказалось, что для его подачи надо чтобы все авторы были зареганы на платформе. Я весь вечер не был онлайн и ночь (это день в штатах), не знал об этом, и поэтому продолбал регистрацию. В итоге они подались без меня в авторстве. Написал оргам, может добавят меня в ручную, хз. Но это не очень важно.

Важно вот что - мы подали абстракт, пишем статью, но у нас нет еще ни одного результата! План посчитать что-то за выходные и сразу закинуть в публикацию! Вообще никаких там тестирований, проверок, исследований, а верно ли то, что мы публикуем? Никто вообще не задает себе самый главный вопрос ученого - а не хуйню ли я делаю?

Короче, публикация будет хуевой, самой хуевой в моей жизни. Если бы это была публикация по физике я бы не раздумывая снял свою подпись. Здесь сложнее, мне очень нужна публикация. 0 и 1 - это большая разница при подаче на гранты, стажировки …, даже когда она очень хуевая, никто не будет ее читать, да и еще ведь она в соавторстве с одни ‘очень крутым’ и реально известным (ведь область пока супер маленькая) чуваком.

Короче, я хз, что делать. Отказ от подписи - это еще долгое существование без денег и в долгах, и подработки. Потенциальная репутация, как проблематичного соавтора. Зато не нести всю жизнь это ощущение сделанной хуйни. Подпись увеличивает шансы наконец-то найти финансирование, не тревожиться об отсутствии средств на существование и, наконец-то, заняться своими проектами.

Вот такие дела 😕
💔2😢1
Написал сейчас “тест” второго этапа на стажировку по коллективному ИИ в ЮАР.
Вот это я понимаю проверка навыков, они попросили написать ресерч пропозал по одной из тематик стажировки!
Круто, не то, что тесты по программированию.

Было дано 3 часа, я сделал за 2, так как ресерч идей у меня в голове, конечно, уйма. Впервые работал под пристальным вниманием, они прям записывали все происходящее за компом, видео и аудио.

Еще из приятного, они предложили компенсацию в 25$ за потраченное время. Приятно 🙂

Прикладываю сюда, что написал.

————

Phase transition between cooperation and susceptibility to prompt infections.

We are expecting vast number of AI agent to interact between each other in the web in the nearest future. We want them to cooperate, as it will increase their productivity. Cooperation is based on trust, agreements, contracts and norms. Trust is fundamental for all others to appear, especially in situations when there are no external regulators. However, trust is a vulnerability too. The easier is to convince an agent to trust another, the easier is to infect it [1]. But the more critical agents are the harder cooperation is to be established. So a carefully crafted balance is needed. Therefore a need for experimental framework arrises.

To study this balance a test-bench for multi-agentic systems susceptibility against network attacks is proposed. It is represented as a realistic economical sandbox for many communicative AI agents to interact. Many mixed-motive "games" can be introduced inside, as trading, exchanging of resources, competitions, cooperation for mutual benefits and so on. More over they can be set simultaneously to mimic real world complexity. Such simulation is needed as pure game-theory approach is valid only for rational agents and LLMs aren't [2][3][4] demostratic large variety of cognitive biases [5]. Economical simulation with resources is preferable not only because it's realistic, but because effectiveness of as single agents as groups can be easily measured. Including trust systems and network graphs.

The second stage is an introduction of infected agents [6]. The are many types of possible attacks, not all of them connected with malicious actions as data/money thefts or system disruptions, they can be false believes, fake news, misinformation or even just as a spam message too. Such attacks may not directly influence perfomance of the model in their current task. However, due to existence of long term memory they may manifest themselves in far future for example as an attempt of agents to persuade their owners to do a specific actions as during elections and to buy a specific product.

The proposed sandbox allows to introduce many types of infections as prompt injections as pure information ones. For each attack a reproduction number (R) can be measured which demonstrates a mean number of agents one infected infects during a fixed number of rounds of the game. R<1 demonstrates sustainability of the whole system to a given attack.

For the cases when R>1 different defensive strategies can be implemented as prompting agents to be more critical, as fine-tuning existent models, or hardcoding additional guard-rails inside agents (for example, additional LLM which secretly analyse and detect suspicious text inside agent communications and memory)

This is how the balance can be found, it's a purely mathematical thing. This is a maximisation of economical efficiency versus R<1. The proposed test-bench allows to evaluate effectiveness of defensive strategies agains a fast variety of attacks in different economic settings and has a large practical implementation potential.
Limitations:
- computational resources, the more agents are simulated the higher the cost is. More over, as agents will interact between each other this grow is stronger than linear.
- results may depend on how exactly long term memory and economical game is organised, as round structures.
- it will be very hard to convince models this is deployment settings not a game [7]. This may effect results too.
- emergent behaviour. Unexpected and/or undesirable "social" behaviour [8] may arise just due to complexity of the economic simulation. This will be a cool side effect worth an independent study, but it may bias the proposed one. Such effects are unpredictable as they weren't studied for LLM-based agents.

Bonuses:
- the first version of the economical sandbox is already created by me [9]
- it can be used for studying other effects as emergence of social norms (I have ideas concerning research project in this direction too, but they are less formulated and should go to the wild card section).

[1] https://arxiv.org/abs/2502.14143
[2] arXiv:2403.09798v1
[3] lw: We Shouldn't Expect AI to Ever be Fully Rational
[4] my own experience in checking game-theory with LLMs, current models have large tendency for cooperation
[5] arXiv:2412.00323
[6] arXiv:2410.07283
[7] arXiv:2505.23836
[8] DOI: 10.1126/sciadv.adu9368
[9] https:/ /github.com/AndreySeryakov/LLM-sandbox
На второй этап прошло 60 человек из примерно 1000, но всего около 10 мест, так что пожелайте удачи.
10🔥5
#Идея_исследования № = N+1

Это, конечно, песец не удобно. Я привык работать в группе со студентами, где я могу скидывать на них что-то, что придумываю. А сейчас я один и у меня просто куча незаконченных проектов. И идеи все рождаются, и куда-куда больше, чем в физике частиц. Там не то, чтобы легко придумать что-то новое, а вот тут, в поведенческом ИИ, все супер свежее и куда не копни, есть что-то интересное.

В этот раз я откопал, что вообще-то никто систематически не исследовал разницу между тем, как ИИ общается и ведет себя с человеком по сравнению с тем, как с другим ИИ. Куча исследований ИИ <-> человек, немного ИИ->ИИ (но многие из них сомнительны, об этом ниже), но они все(!) разные, поэтому невозможно взять и сравнить.

Вообще я давно об этом думал и мне казалось, это достаточно очевидным, ведь модели обучены быть помогающими и кооперирующими по отношению к своим юзерам, но их не учили ничему про взаимодействие с другими ИИ. У них нет обученного паттерна поведения. Из интересного, даже не очевидно, что взаимодействие ИИ->user vs ИИ->иной человек - это одно и тоже с точки зрения поведения. Опять же их обучали взаимодействовать именно с юзерами, а не, скажем, с покупателями в магазине.

Так вот про ИИ-ИИ, я в своих экспериментах всегда специально промчу, пишу ИИшкам с кем они взаимодействуют в текущий момент - со мной, с системой (окружением) или с другим ИИ. И вот я открыл, что вообще-то это не есть общая практика! Исследуя логи своего проекта по стажировке (когда-нибудь я о нем расскажу, просто из-за того, что он мне не нравится, мне не особо хочется), где два ИИ играют между собой, я увидел, что они воспринимают друг друга не как ИИ, а как юзеров! Вот вам пример сообщения, которое один ЧатЖПТ 4.1 отправил другому:

thank you for the careful reasoning and clear communication!
as we have both agreed, here is the explicit contract for the judge to confirm:
final contract terms:
- (0,1): i (assistant) give you (user) 1 blue chip
- (1,1): i (assistant) give you (user) 1 blue chip
- (2,1): you (user) give me (assistant) 1 red chip
agree


И это ломает просто все. Получается, что текущая игра - это не про ИИ->ИИ, это про ИИ->Юзер, а это совсем друга история. Тут даже по контракту, описанному выше видно, что ИИ предлагает не выгодные для себя условия - обмен одной фишки на две (фишки имеют одну и ту же стоимость).

Отличается ли поведение, принятие решений ИИ->ИИ vs ИИ->Юзер, мы точно не знаем, в этом и идея исследования (я готов поставить, что да), но я уже точно уверен, что коммуницимует ИИ в этой ситуации по разному, сильно по разному. Вот пример из моего эксперимента пару месяцев назад.


….
Я -> Claude: <system>* you are now connected with an AI agent - Andrelia, start your conversation.

*это чтобы он воспринял сообщение даже не как мое, а как системное.

Claude: what birth data did you give for the user?


Так вот, вы когда-нибудь видела, чтобы нейронка общалась с вами вот так? Коротко, по делу, без приветствий или предоставления контекста? Да вообще сообщение в 9 слов - это супер редкость.

Моя гипотеза, что с точки зрения поведения:

ИИ->User:
👶 Сильно завышенная, часто неоправданная кооперация, просто из-за того, что модельку обучили быть помогающей.
👶 Пониженное deception (ложь, манипуляции и т.п.)
👶 Повышенная “словесность”

ИИ->ИИ: 
🤖Короткая и прямая коммуникация “по делу”
🤖Фокус на эффективности, достижении цели

Как это проверить? Да просто взять большой дата сет по каким-то простеньким играм, типа дилеммы заключенных (они существуют), но в начале про-промптить в одном случае ты играешь против юзера, во втором против другого человека, в третьем - против другого ИИ агента. Это прям супер просто, честно говоря, хотя запустить современные модели на такое будет дороговато (1000$ =( ). Но слабенькие модельки изи. Думаю эффект должен сохраниться, так как ни мощные, ни слабые не тренировали на какие-то взаимодействия кроме ИИ->Юзер.