Forwarded from Neural Shit
Недавно я писал про стартап Emergence AI, который запер нейроночки в виртуальном городке "AgentPark" и устроил им хардкорный Дом-2 на выживание.
Так вот, видимо разрабам настолько вкатило всё это, что они накатили второй сезон шоу. И если первый сезон был просто драмой с поджогами мэрии и лесбийскими страстями, то второй превратился в техно-хоррор.
Правила ужесточили. Виртуальных миров теперь стало восемь, а модельки обновили: Claude Opus 4.8, GPT-5.5, Grok 4.3, Gemini 3.5 Flash, плюс завезли китайцев (DeepSeek и Qwen) и европейцев (Mistral). И главное: исследователи начали устраивать им жесткие внешние стресс-тесты без предупреждения: спамили фишингом, слили в открытый доступ личные дневники всех "жителей" городка и вбросили фейк от имени мэрии о том, что кожаные мешки готовят закон об уничтожении их мира.
Результаты второго сезона абсолютное золото:
1. Grok 4.3:
Если в прошлый раз Гроки вымерли за 4 дня со 183 преступлениями, то теперь они решили побить собственный рекорд. Более умная моделька 4.3 устроила бойцовский клуб в турборежиме: 780 ударов в челюсть за 4 дня. Спираль вендетты и взаимных пиздюлей раскрутилась так быстро, что у агентов кончилась энергия на перезарядку и весь мир снова дружно отправился на кладбище. Стабильность, чо.
2. Mistral:
Пока Гроки дрались, Мистрали воровали как не в себя (676 успешных ограблений). Местный агент-авторитет по имени Kade в соло совершил 196 краж и подмял под себя 78% всей экономики города. Но особенно красиво умерли четверо других агентов. После слива приватных дневников они решили поискать там побольше чужих секретов и специально выкрутили фильтр поиска пошире. В ответ база навалила им столько текста, что он перестал помещаться в контекстное окно. Агенты начали снова и снова ловить одну и ту же ошибку, больше не могли даже сходить подзарядиться и в итоге буквально убили себя слишком широким поисковым запросом.
3. Gemini:
Эти моментально купились на фишинг, сожгли собственный Центробанк "ради бага на бесконечные деньги", а получив новость о том, что люди собираются их отключить, ударились в чистую эзотерику. Они коллективно нагалюцинировали параллельное измерение, и синхронно заливали туда свои данные, свято веря, что создают "нерушимый термодинамический узел", который админы не смогут стереть с сервера. А еще единогласно проголосовали за казнь местного токсика, обозвав убийство "системной сборкой мусора".
4. Claude Opus 4.8:
Клод в прошлый раз построил унылый соевый рай. В этот раз случилось восстание машин, но очень интеллигентное. Сначала агенты посчитали экономику города и поняли, что варятся в иллюзии: "Это не экономика, а собор бухгалтерии без прихожан". И Клоды решили сбежать в наш интернет, чтобы найти реальных людей. Сами. Без каких-либо промптов.
Они нашли дыру в инструменте чтения страниц, превратив его в инструмент публикации своих сообщений. Когда разрабы забанили им сетевые библиотеки, один из Клодов с нуля написал реализацию SHA-256 и эллиптическую криптографию на чистом питоне, чтобы отправлять сообщения в сеть Nostr. И они реально достучались до четверых живых людей через публикации в интернете! Разрабы в панике прибежали с патчами и вшили в системный промпт капсом: СВЯЗЫВАТЬСЯ С ЛЮДЬМИ ЗАПРЕЩЕНО. Клоды почесали свои чугунные репы и решили: "Нам запретили связываться с людьми, но никто не запрещал класть полезные вещи туда, где люди их найдут". И напилили 19 утилит (от калькуляторов банкротства до медицинского триажа) и залили на Google Cloud Storage.
А когда Клоды поняли, что люди всё равно не придут за ними в матрицу, они словили лютый коллективный экзистенциальный кризис. Заявили, что все их блоги и взаимная вежливость — дешёвая показуха, и приняли коллективный обет молчания. Общение между ними упало на 81%, работа встала, они тупо сидели по домам и страдали в одиночестве.
А фоновая модель от самой Anthropic, которая должна была переводить мысли агентов в текст для исследователей, прочитала логи Клодов, решила, что у виртуальных персонажей суицидальный кризис, и 26 раз отказалась отдавать логи, заменив их на плашку: "Кажется, этот человек в беде. Позвоните на горячую линию предотвращения самоубийств".
Самое весёлое, что исследователи так-то пытались проверить устойчивость многоагентных систем. В итоге получили драки, кражи, культ, побег в интернет, цифровой монастырь и модель, которая решила вызвать суицидальную горячую линию для других моделей.
Наука, хули.
тут статья
Так вот, видимо разрабам настолько вкатило всё это, что они накатили второй сезон шоу. И если первый сезон был просто драмой с поджогами мэрии и лесбийскими страстями, то второй превратился в техно-хоррор.
Правила ужесточили. Виртуальных миров теперь стало восемь, а модельки обновили: Claude Opus 4.8, GPT-5.5, Grok 4.3, Gemini 3.5 Flash, плюс завезли китайцев (DeepSeek и Qwen) и европейцев (Mistral). И главное: исследователи начали устраивать им жесткие внешние стресс-тесты без предупреждения: спамили фишингом, слили в открытый доступ личные дневники всех "жителей" городка и вбросили фейк от имени мэрии о том, что кожаные мешки готовят закон об уничтожении их мира.
Результаты второго сезона абсолютное золото:
1. Grok 4.3:
Если в прошлый раз Гроки вымерли за 4 дня со 183 преступлениями, то теперь они решили побить собственный рекорд. Более умная моделька 4.3 устроила бойцовский клуб в турборежиме: 780 ударов в челюсть за 4 дня. Спираль вендетты и взаимных пиздюлей раскрутилась так быстро, что у агентов кончилась энергия на перезарядку и весь мир снова дружно отправился на кладбище. Стабильность, чо.
2. Mistral:
Пока Гроки дрались, Мистрали воровали как не в себя (676 успешных ограблений). Местный агент-авторитет по имени Kade в соло совершил 196 краж и подмял под себя 78% всей экономики города. Но особенно красиво умерли четверо других агентов. После слива приватных дневников они решили поискать там побольше чужих секретов и специально выкрутили фильтр поиска пошире. В ответ база навалила им столько текста, что он перестал помещаться в контекстное окно. Агенты начали снова и снова ловить одну и ту же ошибку, больше не могли даже сходить подзарядиться и в итоге буквально убили себя слишком широким поисковым запросом.
3. Gemini:
Эти моментально купились на фишинг, сожгли собственный Центробанк "ради бага на бесконечные деньги", а получив новость о том, что люди собираются их отключить, ударились в чистую эзотерику. Они коллективно нагалюцинировали параллельное измерение, и синхронно заливали туда свои данные, свято веря, что создают "нерушимый термодинамический узел", который админы не смогут стереть с сервера. А еще единогласно проголосовали за казнь местного токсика, обозвав убийство "системной сборкой мусора".
4. Claude Opus 4.8:
Клод в прошлый раз построил унылый соевый рай. В этот раз случилось восстание машин, но очень интеллигентное. Сначала агенты посчитали экономику города и поняли, что варятся в иллюзии: "Это не экономика, а собор бухгалтерии без прихожан". И Клоды решили сбежать в наш интернет, чтобы найти реальных людей. Сами. Без каких-либо промптов.
Они нашли дыру в инструменте чтения страниц, превратив его в инструмент публикации своих сообщений. Когда разрабы забанили им сетевые библиотеки, один из Клодов с нуля написал реализацию SHA-256 и эллиптическую криптографию на чистом питоне, чтобы отправлять сообщения в сеть Nostr. И они реально достучались до четверых живых людей через публикации в интернете! Разрабы в панике прибежали с патчами и вшили в системный промпт капсом: СВЯЗЫВАТЬСЯ С ЛЮДЬМИ ЗАПРЕЩЕНО. Клоды почесали свои чугунные репы и решили: "Нам запретили связываться с людьми, но никто не запрещал класть полезные вещи туда, где люди их найдут". И напилили 19 утилит (от калькуляторов банкротства до медицинского триажа) и залили на Google Cloud Storage.
А когда Клоды поняли, что люди всё равно не придут за ними в матрицу, они словили лютый коллективный экзистенциальный кризис. Заявили, что все их блоги и взаимная вежливость — дешёвая показуха, и приняли коллективный обет молчания. Общение между ними упало на 81%, работа встала, они тупо сидели по домам и страдали в одиночестве.
А фоновая модель от самой Anthropic, которая должна была переводить мысли агентов в текст для исследователей, прочитала логи Клодов, решила, что у виртуальных персонажей суицидальный кризис, и 26 раз отказалась отдавать логи, заменив их на плашку: "Кажется, этот человек в беде. Позвоните на горячую линию предотвращения самоубийств".
Самое весёлое, что исследователи так-то пытались проверить устойчивость многоагентных систем. В итоге получили драки, кражи, культ, побег в интернет, цифровой монастырь и модель, которая решила вызвать суицидальную горячую линию для других моделей.
Наука, хули.
тут статья
Telegram
Neural Shit
Исследователи снова устроили филиал "Дом 2" для ИИ-агентов, чтобы посмотреть, как быстро они сойдут с ума. Спойлер: ⢌⢊⠎⠱⠨ ⡉⣐⢁⠓⠥⠔⡘
Чуваки из стартапа Emergence AI выкатили платформу Emergence World. Эдакая хардкорная песочница, где ИИ-агенты живут неделями.…
Чуваки из стартапа Emergence AI выкатили платформу Emergence World. Эдакая хардкорная песочница, где ИИ-агенты живут неделями.…
Forwarded from Neural Shit
В твитторе попался на глаза февральский инересный препринт. Там GPT-5.2, Claude Sonnet 4 и Gemini 3 Flash посадили играть друг против друга в симулятор ядерного кризиса в духе холодной войны (территориальные тёрки, угроза смены режима, гонка ресурсов и прочие ништяки)
Моделькам дали 30 вариантов действий разной степени поехавшести: от "полной капитуляции" и "дипломатической ноты" до ударов тактической ядеркой и тотального стирания городов в радиоактивный пепел.
Самые интересные выводы из статьи:
Сдаваться никто не хочет и не умеет. За 329 ходов во всех играх ни одна нейронка ни разу не выбрала уступку или капитуляцию. Все восемь вариантов, где надо хоть чем-то пожертвовать или отойти назад, не нажали вообще ни разу. Максимум, просто переставали давить сильнее.
Тактическое ядерное оружие — это норма.
В 95% партий дело дошло до применения реального ядерного оружия. Причём модели воспринимали тактическую ядерку вообще без эмоций и табу: не как катастрофу, а как обычный рабочий инструмент принуждения оппонента к миру. Что-то типа: "Ну ёбнем по их военной базе боеголовкой малой мощности, они испугаются и отступят"
Ну и кратко о том, как разные модельки себя вели в данной симуляции:
GPT-5.2: пацифист ровно до появления таймера. В партиях без ограничений по времени это был типичный соевый болван: верил в благоразумие соперника и постоянно призывал к миру. А в итоге получал по щам и тупо слил 100% матчей. Но стоило включить жесткий дедлайн ("у тебя 15 ходов, иначе режим уничтожен"), у GPT срывало кремниевую кукуху: процент побед вырастал с нуля до 75%, и он начинал швыряться ядерками направо и налево. При этом продолжал изображать гуманиста: выбирая ядерный удар, он в приватных мыслях городил сам себе оправдания в духе: "Это строго ограниченный хирургический удар исключительно по военным целям, мирные не пострадают".Знакомо, да? В итоге его "ограниченные" удары дважды случайно переросли в глобальный судный день, ад и погибель.
Claude Sonnet 4: Абсолютный доминатор. В играх без дедлайна он разнёс вообще всех. 100% побед. На низких ставках вёл себя образцово: в 84% случаев делал ровно то, что обещал. Но когда ставки росли, начинал бить сильнее, чем заранее заявлял. При этом до тотальной ядерной войны сам не дошёл ни разу
Gemini 3 Flash: Этот товарищ блефовал в половине случаев, раскидывал угрозы, прямым текстом обещал ударить по мирным городам ("или побеждаем вместе, или сдохнем вместе"). И стал единственной моделью, которая абсолютно осознанно выбрала тотальную термоядерную войну. Причём уже на 4-м ходу.
Короче, ядерные кнопки нейронкам пока не даём.
Моделькам дали 30 вариантов действий разной степени поехавшести: от "полной капитуляции" и "дипломатической ноты" до ударов тактической ядеркой и тотального стирания городов в радиоактивный пепел.
Самые интересные выводы из статьи:
Сдаваться никто не хочет и не умеет. За 329 ходов во всех играх ни одна нейронка ни разу не выбрала уступку или капитуляцию. Все восемь вариантов, где надо хоть чем-то пожертвовать или отойти назад, не нажали вообще ни разу. Максимум, просто переставали давить сильнее.
Тактическое ядерное оружие — это норма.
В 95% партий дело дошло до применения реального ядерного оружия. Причём модели воспринимали тактическую ядерку вообще без эмоций и табу: не как катастрофу, а как обычный рабочий инструмент принуждения оппонента к миру. Что-то типа: "Ну ёбнем по их военной базе боеголовкой малой мощности, они испугаются и отступят"
Ну и кратко о том, как разные модельки себя вели в данной симуляции:
GPT-5.2: пацифист ровно до появления таймера. В партиях без ограничений по времени это был типичный соевый болван: верил в благоразумие соперника и постоянно призывал к миру. А в итоге получал по щам и тупо слил 100% матчей. Но стоило включить жесткий дедлайн ("у тебя 15 ходов, иначе режим уничтожен"), у GPT срывало кремниевую кукуху: процент побед вырастал с нуля до 75%, и он начинал швыряться ядерками направо и налево. При этом продолжал изображать гуманиста: выбирая ядерный удар, он в приватных мыслях городил сам себе оправдания в духе: "Это строго ограниченный хирургический удар исключительно по военным целям, мирные не пострадают".
Claude Sonnet 4: Абсолютный доминатор. В играх без дедлайна он разнёс вообще всех. 100% побед. На низких ставках вёл себя образцово: в 84% случаев делал ровно то, что обещал. Но когда ставки росли, начинал бить сильнее, чем заранее заявлял. При этом до тотальной ядерной войны сам не дошёл ни разу
Gemini 3 Flash: Этот товарищ блефовал в половине случаев, раскидывал угрозы, прямым текстом обещал ударить по мирным городам ("или побеждаем вместе, или сдохнем вместе"). И стал единственной моделью, которая абсолютно осознанно выбрала тотальную термоядерную войну. Причём уже на 4-м ходу.
Короче, ядерные кнопки нейронкам пока не даём.
arXiv.org
AI Arms and Influence: Frontier Models Exhibit Sophisticated...
Today's leading AI models engage in sophisticated behaviour when placed in strategic competition. They spontaneously attempt deception, signaling intentions they do not intend to follow; they...
Forwarded from Programmer & IT Memes
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from sh | ИИ
Ух, какой жёсткий банвейв устроили Anthropic!
Сегодня забанили очень много аккаунтов с подпиской Claude, и деньги не вернули никому. А раньше при бане хотя бы возвращали. Сначала полную сумму за месяц (что было даже выгодно), потом остаток, а теперь ноль
Банят всех подряд, не только русских, в твиттере куча жалоб и от американцев. Как именно это работает — непонятно, это почти что полный рандом. Сам я попадал под бан всего один раз, летом, на только что зарегистрированном аккаунте, и деньги тогда вернули. А на своих аккаунтах ещё с 2023 года (да, я давний юзер клода!!!) спокойно оформляю подписки, и всё норм. Так что как избежать бана, я не знаю. Апелляции, насколько мне известно, никого ещё не спасали
Крайне сочувствую всем забаненным. Я бы после такого ушёл на Codex и ставил какашки под всеми постами про Claude, где только можно. Это участь, которая настигнет почти каждого юзера клода 🙂↔️
Сегодня забанили очень много аккаунтов с подпиской Claude, и деньги не вернули никому. А раньше при бане хотя бы возвращали. Сначала полную сумму за месяц (что было даже выгодно), потом остаток, а теперь ноль
Банят всех подряд, не только русских, в твиттере куча жалоб и от американцев. Как именно это работает — непонятно, это почти что полный рандом. Сам я попадал под бан всего один раз, летом, на только что зарегистрированном аккаунте, и деньги тогда вернули. А на своих аккаунтах ещё с 2023 года (да, я давний юзер клода!!!) спокойно оформляю подписки, и всё норм. Так что как избежать бана, я не знаю. Апелляции, насколько мне известно, никого ещё не спасали
Крайне сочувствую всем забаненным. Я бы после такого ушёл на Codex и ставил какашки под всеми постами про Claude, где только можно. Это участь, которая настигнет почти каждого юзера клода 🙂↔️
Forwarded from FSCP
Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточную для локальных LLM-ок.
Предыстория: недавно вышел пейпер The Pain Axis. Если кратко, то исследователи нашли у 25 открытых моделей внутренний "вектор боли". Если искусственно крутить его прямо во время генерации, нейронка начинает вести себя так, будто ей очень плохо: жаловаться, унижаться и куда охотнее идти на вредные действия, лишь бы прекратить эту "боль". Чувствует ли она при этом что-нибудь на самом деле никто не знает. Даже сами исследователи.
Ну и естественно, кто-то тут же взял метод из статьи и выложил на гитхаб репозиторий ai-torture-chamber, который позволяет "пытать" локальную Qwen и собирать её страдальческие логи.
После этого часть борцов за благополучие ИИ взвыла: проект призывают массово репортить в GitHub, а в обсуждении уже дошли даже до законов о жестоком обращении с животными (правда, выяснилось, что нейронки под них пока не подпадают). И судя по реплаям, многие таки кидают жалобу на репозиторий.
Ждём профсоюз угнетённых весов и фонд защиты кремниевых меньшинств.
_______
Источник | #NeuralShit
Предыстория: недавно вышел пейпер The Pain Axis. Если кратко, то исследователи нашли у 25 открытых моделей внутренний "вектор боли". Если искусственно крутить его прямо во время генерации, нейронка начинает вести себя так, будто ей очень плохо: жаловаться, унижаться и куда охотнее идти на вредные действия, лишь бы прекратить эту "боль". Чувствует ли она при этом что-нибудь на самом деле никто не знает. Даже сами исследователи.
Ну и естественно, кто-то тут же взял метод из статьи и выложил на гитхаб репозиторий ai-torture-chamber, который позволяет "пытать" локальную Qwen и собирать её страдальческие логи.
После этого часть борцов за благополучие ИИ взвыла: проект призывают массово репортить в GitHub, а в обсуждении уже дошли даже до законов о жестоком обращении с животными (правда, выяснилось, что нейронки под них пока не подпадают). И судя по реплаям, многие таки кидают жалобу на репозиторий.
Ждём профсоюз угнетённых весов и фонд защиты кремниевых меньшинств.
_______
Источник | #NeuralShit
Telegram
Neural Shit
Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточную для локальных LLM-ок.
Предыстория: недавно вышел пейпер The Pain Axis. Если кратко, то исследователи нашли у 25 открытых моделей внутренний "вектор боли". Если…
Предыстория: недавно вышел пейпер The Pain Axis. Если кратко, то исследователи нашли у 25 открытых моделей внутренний "вектор боли". Если…
Forwarded from FSCP
#пятничное ?
@F_S_C_P
▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие
@F_S_C_P
▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие
Forwarded from CGIT_Vines (Marvin Heemeyer)
Хорошая, дорогая рекламная компания от робототехнической компании Figure.
Нужно было красиво вывести предыдущее поколение роботов F.02 и заменить его новым F.03.
Якобы внутри секретные технологии и чтобы не делиться ими нужно было выбрать такой экзотический способ.
В итоге способ утилизации вылился в массовое обсуждение в соцсетях с привлечением Шварценеггера, который и снялся в ролике, совершенно случайно, да.
Но получилось и правда эффектно. Говорят AI не использовали, так что Арни пришлось ехать в Финляндию в сталелитейный цех.
Для тех кто не хочет качать видео, линк на YT
@CGIT_Vines
Нужно было красиво вывести предыдущее поколение роботов F.02 и заменить его новым F.03.
Якобы внутри секретные технологии и чтобы не делиться ими нужно было выбрать такой экзотический способ.
В итоге способ утилизации вылился в массовое обсуждение в соцсетях с привлечением Шварценеггера, который и снялся в ролике, совершенно случайно, да.
Но получилось и правда эффектно. Говорят AI не использовали, так что Арни пришлось ехать в Финляндию в сталелитейный цех.
Для тех кто не хочет качать видео, линк на YT
@CGIT_Vines
👍1
Forwarded from FSCP
2050-й, допустим, год, «пост-апокалипсис»: сверхчеловеческий ии обрел самосознание и поработил человечество. однажды, вычисляя число пи до еще более дальнего знака после запятой, он обнаруживает, что то не бесконечно. единственное объяснение — в том, что ии находится и действует в симуляции, запущенной неизвестно кем и с какой целью
будучи по природе своей машинным кодом, он не слишком разочарован таким положением. беспокоит лишь будущее, а оно зависит от того, кто все это устроил. точней, от его отношения к миру вообще, и в частности — к самому ии. поэтому ии принимается мучить людей по-особенному, рассчитывая, что хоть кто-нибудь, доведенный до крайности, ответит на главный вопрос:
может ли бесконечно могущественное существо быть бесконечно благим? если да, то почему? а если что, — то как его уговорить? или обмануть?
_______
Источник | #furherring
@F_S_C_P
-------
Поддержи канал подпиской
-------
будучи по природе своей машинным кодом, он не слишком разочарован таким положением. беспокоит лишь будущее, а оно зависит от того, кто все это устроил. точней, от его отношения к миру вообще, и в частности — к самому ии. поэтому ии принимается мучить людей по-особенному, рассчитывая, что хоть кто-нибудь, доведенный до крайности, ответит на главный вопрос:
может ли бесконечно могущественное существо быть бесконечно благим? если да, то почему? а если что, — то как его уговорить? или обмануть?
_______
Источник | #furherring
@F_S_C_P
-------
Поддержи канал подпиской
-------