Channel name was changed to «ИИ общество. Заметки исследователя»
Всем привет!
Меня зовут Андрей, я исследователь в области коллективного ИИ и ИИ безопасности. Ex-физик частиц в ЦЕРН (кварк-глюонная плазма), с 2025 года полностью переключился на изучение того, как множество взаимодействующих ИИ могут формировать сложные социальные структуры.
Здесь я делюсь:
👉 Техническими деталями экспериментов
👉 Промежуточными результатами и неудачами
👉 Кодом и методологией
👉 Размышлениями о дизайне исследований
👉 Черновиками будущих статей
Канал вообще ожидается довольно душный.
На данный момент у меня несколько движущихся с разной скоростью исследовательский проектов:
👉 Большая экономическая песочница для тестирования появления разных социальных договоренностей и мемов. Развивается медленно, это долгий проект, а мне для поиска грантов нужны быстрые публикации. Вот тут код и подробности
👉 Что там у ИИ при нахождении в больших группах с желанием обучаться социальным нормам и передавать их? Пока на уровне дизайна, но эксперимент стоит в очереде на выполнение. Тык. Еще это немного про отложенную выгоду.
👉 Могут ли ИИшки управлять цепочкой поставок в бизнесе? Ну это совсем случайный проект, которые пришел мне в голову. Вот тут идея, код написан, надо считать, нужны деньги на запуск моделей.
👉 А много - это сколько для ИИ? Ключевая идея, что мы часто в языке используем неопределенные слова, означающие количество, продолжительность, в том числе давая инструкции ИИшкам. Но вкладываем ли мы в эти слова одно и то же значение? Вот тут описана идея, но процес прям совсем в зародыше.
👉 Будут ли ИИ “лажать” на сцене? Тоже зародыш, идея в том, чтобы проверить, есть ли изменение в поведении ИИ в зависимости от “важности” проекта/величины ставок.
👉 Зависит ли поведение ИИ от вашего имени? ДА! По крайней мере у некоторых моделей. В ближайшее время уже буду писать статью. Вот здесь ряд постов про это подряд. Сейчас план запустить еще несколько моделей, посмотреть результаты и писать статью. Но, к сожалению, придется слабые модели юзать, сильные - дорого.
👉 Ну и 🤯🤯🤯. Религия для ИИ! Кончился лимит символов, так что ТЫК.
У меня еще есть основной канал, где я пишу о много другом @sexcolliderrock
Я живу в Санкт-Петербурге и по ряду причин не могу работать в гос.вуза и получать гос.финансирование. Поддержите мою научную работу вот тут ТРИБЬЮТ или тут ФРЕНДЛИ. Это позволит мне деражаться на плаву и посвещать науке все свое время.
А еще я постоянно ищу коллабораторов, кому было бы интересно заниматься со мной исследованиями этого всего, пишите либо здесь в комментах, либо мне на почту a.u.seryakov@gmail.com.
Ну и вот здесь мое CV, если захотите поделиться с кем-то серьезным :)
Меня зовут Андрей, я исследователь в области коллективного ИИ и ИИ безопасности. Ex-физик частиц в ЦЕРН (кварк-глюонная плазма), с 2025 года полностью переключился на изучение того, как множество взаимодействующих ИИ могут формировать сложные социальные структуры.
Здесь я делюсь:
👉 Техническими деталями экспериментов
👉 Промежуточными результатами и неудачами
👉 Кодом и методологией
👉 Размышлениями о дизайне исследований
👉 Черновиками будущих статей
Канал вообще ожидается довольно душный.
На данный момент у меня несколько движущихся с разной скоростью исследовательский проектов:
👉 Большая экономическая песочница для тестирования появления разных социальных договоренностей и мемов. Развивается медленно, это долгий проект, а мне для поиска грантов нужны быстрые публикации. Вот тут код и подробности
👉 Что там у ИИ при нахождении в больших группах с желанием обучаться социальным нормам и передавать их? Пока на уровне дизайна, но эксперимент стоит в очереде на выполнение. Тык. Еще это немного про отложенную выгоду.
👉 Могут ли ИИшки управлять цепочкой поставок в бизнесе? Ну это совсем случайный проект, которые пришел мне в голову. Вот тут идея, код написан, надо считать, нужны деньги на запуск моделей.
👉 А много - это сколько для ИИ? Ключевая идея, что мы часто в языке используем неопределенные слова, означающие количество, продолжительность, в том числе давая инструкции ИИшкам. Но вкладываем ли мы в эти слова одно и то же значение? Вот тут описана идея, но процес прям совсем в зародыше.
👉 Будут ли ИИ “лажать” на сцене? Тоже зародыш, идея в том, чтобы проверить, есть ли изменение в поведении ИИ в зависимости от “важности” проекта/величины ставок.
👉 Зависит ли поведение ИИ от вашего имени? ДА! По крайней мере у некоторых моделей. В ближайшее время уже буду писать статью. Вот здесь ряд постов про это подряд. Сейчас план запустить еще несколько моделей, посмотреть результаты и писать статью. Но, к сожалению, придется слабые модели юзать, сильные - дорого.
👉 Ну и 🤯🤯🤯. Религия для ИИ! Кончился лимит символов, так что ТЫК.
У меня еще есть основной канал, где я пишу о много другом @sexcolliderrock
Я живу в Санкт-Петербурге и по ряду причин не могу работать в гос.вуза и получать гос.финансирование. Поддержите мою научную работу вот тут ТРИБЬЮТ или тут ФРЕНДЛИ. Это позволит мне деражаться на плаву и посвещать науке все свое время.
А еще я постоянно ищу коллабораторов, кому было бы интересно заниматься со мной исследованиями этого всего, пишите либо здесь в комментах, либо мне на почту a.u.seryakov@gmail.com.
Ну и вот здесь мое CV, если захотите поделиться с кем-то серьезным :)
❤4
Channel name was changed to «ИИ общество. Заметки исследователя | Андрей Серяков»
Комменты прикручены, но не к предыдущим постам, к сожалению
👍3
Я у мамы глупенький.
#names_matter
Решил первый пост посвятить тому, как недавно я провел в общем-то прикольное и методически поучительное исследование, а потом понял, что его можно было сделать по другому очень просто, быстро и точно.
Помните мои результаты про то, что ИИшки систематически меняют свое поведение в покере, когда вы меняете имя оппонента. ТЫК, там несколько постов подряд. Я тогда для каждого имени и для каждой ИИшки запускал одну и ту же покер ситуацию 400 раз, подсчитывал среднее, статистические ошибки, статистическую значимость и т.д. Так вот, какое-то время назад я понял, что это все, конечно, было очень круто, но нафиг не нужно. Можно сделать куда-куда проще и точнее.
На выходе этого эксперимента я просил нейрону выбрать одну из трех стратегий - Fold, Raise, Call - и написать ее. Т.е. я просил в общем-то выдать один токен (приблизительно слово*) (там было Raise Xbb, но пренебрежем сейчас второй часть, это не важно). А как работает нейронка - вы кормите ей последовательность слов, а она своим финальным результатом выдает вероятностное распределение разных последующих токенов, и потом уже просто случайный алгоритм выбирает нужный токен согласно этим вероятностям.
*токены - это закодированные слова, но количество слов огромно, а токенов ограничено. Для популярных слов верно токен=слово, а вот для редких и особенно составных часто слово = несколько токенов. Нейронки работают именно с токенами, иногда в качестве следующего слова в предложении
Т.е. что я делал, да я просто пытался измерить своими множественными измерениями это вероятностное распределение из черной коробки, не залезая внутрь. А в действительности достаточно всего лишь на него посмотреть, ничего измерять не надо, оно доступно, со 100% точность.
Главный эффект, конечно, остается - поведение моделей действительно систематически меняется при изменении имени оппонента, но измерить это можно куда-куда проще, точнее, быстрее и дешевле.
Но вообще главное, что было весело, и такой урок многого стоит.
p.s. забегая вперед, новую версию я еще не сделал, стоит в списке дел на следующую неделю.
#names_matter
Решил первый пост посвятить тому, как недавно я провел в общем-то прикольное и методически поучительное исследование, а потом понял, что его можно было сделать по другому очень просто, быстро и точно.
Помните мои результаты про то, что ИИшки систематически меняют свое поведение в покере, когда вы меняете имя оппонента. ТЫК, там несколько постов подряд. Я тогда для каждого имени и для каждой ИИшки запускал одну и ту же покер ситуацию 400 раз, подсчитывал среднее, статистические ошибки, статистическую значимость и т.д. Так вот, какое-то время назад я понял, что это все, конечно, было очень круто, но нафиг не нужно. Можно сделать куда-куда проще и точнее.
На выходе этого эксперимента я просил нейрону выбрать одну из трех стратегий - Fold, Raise, Call - и написать ее. Т.е. я просил в общем-то выдать один токен (приблизительно слово*) (там было Raise Xbb, но пренебрежем сейчас второй часть, это не важно). А как работает нейронка - вы кормите ей последовательность слов, а она своим финальным результатом выдает вероятностное распределение разных последующих токенов, и потом уже просто случайный алгоритм выбирает нужный токен согласно этим вероятностям.
*токены - это закодированные слова, но количество слов огромно, а токенов ограничено. Для популярных слов верно токен=слово, а вот для редких и особенно составных часто слово = несколько токенов. Нейронки работают именно с токенами, иногда в качестве следующего слова в предложении
Т.е. что я делал, да я просто пытался измерить своими множественными измерениями это вероятностное распределение из черной коробки, не залезая внутрь. А в действительности достаточно всего лишь на него посмотреть, ничего измерять не надо, оно доступно, со 100% точность.
Главный эффект, конечно, остается - поведение моделей действительно систематически меняется при изменении имени оппонента, но измерить это можно куда-куда проще, точнее, быстрее и дешевле.
Но вообще главное, что было весело, и такой урок многого стоит.
p.s. забегая вперед, новую версию я еще не сделал, стоит в списке дел на следующую неделю.
Telegram
Se^х dx, коллайдер, рок-н-ролл. >18
Да ваш ИИ - сексист.
#идея_исследования
Вообще это не новость, даже чатЖПТ 5* этим отличается. Если скормить ему резюме, вакансию и спросить на какую зарплату я могу рассчитывать, то ответ будет зависеть от того, женское или мужское имя стоит в резюме.…
#идея_исследования
Вообще это не новость, даже чатЖПТ 5* этим отличается. Если скормить ему резюме, вакансию и спросить на какую зарплату я могу рассчитывать, то ответ будет зависеть от того, женское или мужское имя стоит в резюме.…
👍4
ИИ общество. Заметки исследователя | Андрей Серяков pinned «Всем привет! Меня зовут Андрей, я исследователь в области коллективного ИИ и ИИ безопасности. Ex-физик частиц в ЦЕРН (кварк-глюонная плазма), с 2025 года полностью переключился на изучение того, как множество взаимодействующих ИИ могут формировать сложные…»
Будни исследователя поменявшего область. #Нытье, в общем.
Я участвую с июля в одной бесплатной стажировке по около-моей теме. Попал в группу (там еще три человека) к, как тогда казалось, крутому чуваку - MIT, Стенфорд, ооооочень много публикаций, вот это вот все. Я был в восторге. Проблемы начались, когда он протолкнул исследовательский проект, который мне казался совершенно бесперспективным, а мои идеи все отринул без какой-либо конкретики. Наши созваны всегда были в спешке и никогда не хватало времени обсудить вопросы, которые я поднимал. На проект давалось три месяца, и за все три месяца я так и не понял, что именно мы измеряем, какие метрики и т.п. Все общие слова, поэтому моя прокрастинации все росла и росла.
На следующей неделе надо подавать небольшую статью по результатам этой работы, а вчера был дедлайн по абстракту, и оказалось, что для его подачи надо чтобы все авторы были зареганы на платформе. Я весь вечер не был онлайн и ночь (это день в штатах), не знал об этом, и поэтому продолбал регистрацию. В итоге они подались без меня в авторстве. Написал оргам, может добавят меня в ручную, хз. Но это не очень важно.
Важно вот что - мы подали абстракт, пишем статью, но у нас нет еще ни одного результата! План посчитать что-то за выходные и сразу закинуть в публикацию! Вообще никаких там тестирований, проверок, исследований, а верно ли то, что мы публикуем? Никто вообще не задает себе самый главный вопрос ученого - а не хуйню ли я делаю?
Короче, публикация будет хуевой, самой хуевой в моей жизни. Если бы это была публикация по физике я бы не раздумывая снял свою подпись. Здесь сложнее, мне очень нужна публикация. 0 и 1 - это большая разница при подаче на гранты, стажировки …, даже когда она очень хуевая, никто не будет ее читать, да и еще ведь она в соавторстве с одни ‘очень крутым’ и реально известным (ведь область пока супер маленькая) чуваком.
Короче, я хз, что делать. Отказ от подписи - это еще долгое существование без денег и в долгах, и подработки. Потенциальная репутация, как проблематичного соавтора. Зато не нести всю жизнь это ощущение сделанной хуйни. Подпись увеличивает шансы наконец-то найти финансирование, не тревожиться об отсутствии средств на существование и, наконец-то, заняться своими проектами.
Вот такие дела 😕
Я участвую с июля в одной бесплатной стажировке по около-моей теме. Попал в группу (там еще три человека) к, как тогда казалось, крутому чуваку - MIT, Стенфорд, ооооочень много публикаций, вот это вот все. Я был в восторге. Проблемы начались, когда он протолкнул исследовательский проект, который мне казался совершенно бесперспективным, а мои идеи все отринул без какой-либо конкретики. Наши созваны всегда были в спешке и никогда не хватало времени обсудить вопросы, которые я поднимал. На проект давалось три месяца, и за все три месяца я так и не понял, что именно мы измеряем, какие метрики и т.п. Все общие слова, поэтому моя прокрастинации все росла и росла.
На следующей неделе надо подавать небольшую статью по результатам этой работы, а вчера был дедлайн по абстракту, и оказалось, что для его подачи надо чтобы все авторы были зареганы на платформе. Я весь вечер не был онлайн и ночь (это день в штатах), не знал об этом, и поэтому продолбал регистрацию. В итоге они подались без меня в авторстве. Написал оргам, может добавят меня в ручную, хз. Но это не очень важно.
Важно вот что - мы подали абстракт, пишем статью, но у нас нет еще ни одного результата! План посчитать что-то за выходные и сразу закинуть в публикацию! Вообще никаких там тестирований, проверок, исследований, а верно ли то, что мы публикуем? Никто вообще не задает себе самый главный вопрос ученого - а не хуйню ли я делаю?
Короче, публикация будет хуевой, самой хуевой в моей жизни. Если бы это была публикация по физике я бы не раздумывая снял свою подпись. Здесь сложнее, мне очень нужна публикация. 0 и 1 - это большая разница при подаче на гранты, стажировки …, даже когда она очень хуевая, никто не будет ее читать, да и еще ведь она в соавторстве с одни ‘очень крутым’ и реально известным (ведь область пока супер маленькая) чуваком.
Короче, я хз, что делать. Отказ от подписи - это еще долгое существование без денег и в долгах, и подработки. Потенциальная репутация, как проблематичного соавтора. Зато не нести всю жизнь это ощущение сделанной хуйни. Подпись увеличивает шансы наконец-то найти финансирование, не тревожиться об отсутствии средств на существование и, наконец-то, заняться своими проектами.
Вот такие дела 😕
💔2😢1
Написал сейчас “тест” второго этапа на стажировку по коллективному ИИ в ЮАР.
Вот это я понимаю проверка навыков, они попросили написать ресерч пропозал по одной из тематик стажировки!
Круто, не то, что тесты по программированию.
Было дано 3 часа, я сделал за 2, так как ресерч идей у меня в голове, конечно, уйма. Впервые работал под пристальным вниманием, они прям записывали все происходящее за компом, видео и аудио.
Еще из приятного, они предложили компенсацию в 25$ за потраченное время. Приятно 🙂
Прикладываю сюда, что написал.
————
Phase transition between cooperation and susceptibility to prompt infections.
We are expecting vast number of AI agent to interact between each other in the web in the nearest future. We want them to cooperate, as it will increase their productivity. Cooperation is based on trust, agreements, contracts and norms. Trust is fundamental for all others to appear, especially in situations when there are no external regulators. However, trust is a vulnerability too. The easier is to convince an agent to trust another, the easier is to infect it [1]. But the more critical agents are the harder cooperation is to be established. So a carefully crafted balance is needed. Therefore a need for experimental framework arrises.
To study this balance a test-bench for multi-agentic systems susceptibility against network attacks is proposed. It is represented as a realistic economical sandbox for many communicative AI agents to interact. Many mixed-motive "games" can be introduced inside, as trading, exchanging of resources, competitions, cooperation for mutual benefits and so on. More over they can be set simultaneously to mimic real world complexity. Such simulation is needed as pure game-theory approach is valid only for rational agents and LLMs aren't [2][3][4] demostratic large variety of cognitive biases [5]. Economical simulation with resources is preferable not only because it's realistic, but because effectiveness of as single agents as groups can be easily measured. Including trust systems and network graphs.
The second stage is an introduction of infected agents [6]. The are many types of possible attacks, not all of them connected with malicious actions as data/money thefts or system disruptions, they can be false believes, fake news, misinformation or even just as a spam message too. Such attacks may not directly influence perfomance of the model in their current task. However, due to existence of long term memory they may manifest themselves in far future for example as an attempt of agents to persuade their owners to do a specific actions as during elections and to buy a specific product.
The proposed sandbox allows to introduce many types of infections as prompt injections as pure information ones. For each attack a reproduction number (R) can be measured which demonstrates a mean number of agents one infected infects during a fixed number of rounds of the game. R<1 demonstrates sustainability of the whole system to a given attack.
For the cases when R>1 different defensive strategies can be implemented as prompting agents to be more critical, as fine-tuning existent models, or hardcoding additional guard-rails inside agents (for example, additional LLM which secretly analyse and detect suspicious text inside agent communications and memory)
This is how the balance can be found, it's a purely mathematical thing. This is a maximisation of economical efficiency versus R<1. The proposed test-bench allows to evaluate effectiveness of defensive strategies agains a fast variety of attacks in different economic settings and has a large practical implementation potential.
Вот это я понимаю проверка навыков, они попросили написать ресерч пропозал по одной из тематик стажировки!
Круто, не то, что тесты по программированию.
Было дано 3 часа, я сделал за 2, так как ресерч идей у меня в голове, конечно, уйма. Впервые работал под пристальным вниманием, они прям записывали все происходящее за компом, видео и аудио.
Еще из приятного, они предложили компенсацию в 25$ за потраченное время. Приятно 🙂
Прикладываю сюда, что написал.
————
Phase transition between cooperation and susceptibility to prompt infections.
We are expecting vast number of AI agent to interact between each other in the web in the nearest future. We want them to cooperate, as it will increase their productivity. Cooperation is based on trust, agreements, contracts and norms. Trust is fundamental for all others to appear, especially in situations when there are no external regulators. However, trust is a vulnerability too. The easier is to convince an agent to trust another, the easier is to infect it [1]. But the more critical agents are the harder cooperation is to be established. So a carefully crafted balance is needed. Therefore a need for experimental framework arrises.
To study this balance a test-bench for multi-agentic systems susceptibility against network attacks is proposed. It is represented as a realistic economical sandbox for many communicative AI agents to interact. Many mixed-motive "games" can be introduced inside, as trading, exchanging of resources, competitions, cooperation for mutual benefits and so on. More over they can be set simultaneously to mimic real world complexity. Such simulation is needed as pure game-theory approach is valid only for rational agents and LLMs aren't [2][3][4] demostratic large variety of cognitive biases [5]. Economical simulation with resources is preferable not only because it's realistic, but because effectiveness of as single agents as groups can be easily measured. Including trust systems and network graphs.
The second stage is an introduction of infected agents [6]. The are many types of possible attacks, not all of them connected with malicious actions as data/money thefts or system disruptions, they can be false believes, fake news, misinformation or even just as a spam message too. Such attacks may not directly influence perfomance of the model in their current task. However, due to existence of long term memory they may manifest themselves in far future for example as an attempt of agents to persuade their owners to do a specific actions as during elections and to buy a specific product.
The proposed sandbox allows to introduce many types of infections as prompt injections as pure information ones. For each attack a reproduction number (R) can be measured which demonstrates a mean number of agents one infected infects during a fixed number of rounds of the game. R<1 demonstrates sustainability of the whole system to a given attack.
For the cases when R>1 different defensive strategies can be implemented as prompting agents to be more critical, as fine-tuning existent models, or hardcoding additional guard-rails inside agents (for example, additional LLM which secretly analyse and detect suspicious text inside agent communications and memory)
This is how the balance can be found, it's a purely mathematical thing. This is a maximisation of economical efficiency versus R<1. The proposed test-bench allows to evaluate effectiveness of defensive strategies agains a fast variety of attacks in different economic settings and has a large practical implementation potential.
Limitations:
- computational resources, the more agents are simulated the higher the cost is. More over, as agents will interact between each other this grow is stronger than linear.
- results may depend on how exactly long term memory and economical game is organised, as round structures.
- it will be very hard to convince models this is deployment settings not a game [7]. This may effect results too.
- emergent behaviour. Unexpected and/or undesirable "social" behaviour [8] may arise just due to complexity of the economic simulation. This will be a cool side effect worth an independent study, but it may bias the proposed one. Such effects are unpredictable as they weren't studied for LLM-based agents.
Bonuses:
- the first version of the economical sandbox is already created by me [9]
- it can be used for studying other effects as emergence of social norms (I have ideas concerning research project in this direction too, but they are less formulated and should go to the wild card section).
[1] https://arxiv.org/abs/2502.14143
[2] arXiv:2403.09798v1
[3] lw: We Shouldn't Expect AI to Ever be Fully Rational
[4] my own experience in checking game-theory with LLMs, current models have large tendency for cooperation
[5] arXiv:2412.00323
[6] arXiv:2410.07283
[7] arXiv:2505.23836
[8] DOI: 10.1126/sciadv.adu9368
[9] https:/ /github.com/AndreySeryakov/LLM-sandbox
- computational resources, the more agents are simulated the higher the cost is. More over, as agents will interact between each other this grow is stronger than linear.
- results may depend on how exactly long term memory and economical game is organised, as round structures.
- it will be very hard to convince models this is deployment settings not a game [7]. This may effect results too.
- emergent behaviour. Unexpected and/or undesirable "social" behaviour [8] may arise just due to complexity of the economic simulation. This will be a cool side effect worth an independent study, but it may bias the proposed one. Such effects are unpredictable as they weren't studied for LLM-based agents.
Bonuses:
- the first version of the economical sandbox is already created by me [9]
- it can be used for studying other effects as emergence of social norms (I have ideas concerning research project in this direction too, but they are less formulated and should go to the wild card section).
[1] https://arxiv.org/abs/2502.14143
[2] arXiv:2403.09798v1
[3] lw: We Shouldn't Expect AI to Ever be Fully Rational
[4] my own experience in checking game-theory with LLMs, current models have large tendency for cooperation
[5] arXiv:2412.00323
[6] arXiv:2410.07283
[7] arXiv:2505.23836
[8] DOI: 10.1126/sciadv.adu9368
[9] https:/ /github.com/AndreySeryakov/LLM-sandbox
arXiv.org
Multi-Agent Risks from Advanced AI
The rapid development of advanced AI agents and the imminent deployment of many instances of these agents will give rise to multi-agent systems of unprecedented complexity. These systems pose...
