Ещё немного про дезинформацию, и закроем эту тему. Пока что
vc.ru
Когнитивная привлекательность дезинформации
Вернёмся к теме дезинформации в Интернете, потому что не всё про неё сказано. Ещё есть как минимум одна статья, которую вам надо увидеть – «Cognitive attraction and online misinformation» («Когнитивная привлекательность и ложная информация в сети»).
👍1
«Последний экзамен человечества» («Humanity's Last Exam») – хорошее название статьи про тест для языковых моделей? Мне кажется, не очень: сделают ведь более сложный тест, и как его потом назвать – «Точно последний экзамен человечества?»
Ну ладно. У нас тут давно не было тестов, а этот вышел в январе 2025 года – свежий, значит. Ещё и постоянно какие-то изменения вносятся: я сейчас смотрю на версию 9 от 25 сентября. А первые три страницы занимает список людей, которые вложились в создание этого теста. Ну впечатляет.
Этот тест представляет собой набор вопросов (открытых и с вариантами ответов), которые составили эксперты в разных предметных областях. Каждый вопрос имеет единственный недвусмысленный ответ, но этот ответ нельзя получить простым поиском в Интернете.
Множественные доработки произошли от того, что авторы выложили свой тест на всеобщее обозрение и собирали замечания. При этом они припрятали небольшой набор вопросов, чтобы все вопросы разом не ушли в открытый доступ и не оказались в тренировочных данных моделей: тогда тест немедленно потеряет смысл, потому что модели получат правильные ответы.
Вот пример вопроса, который я выбрала на странице теста на huggingface (id 66e70c75bbb9b1754c0869ce):
Ответ: Закон о продаже (Sale Law), похоже, вот этот.
Всего в наборе 2500 вопросов, среди которых есть и математические задачи, и задачи типа: «Вот на картинке древняя надпись с такой-то могилы, переведи». В качестве ответа ожидается либо номер правильного варианта (в вопросах закрытого типа), либо короткая фраза / число.
Ни одна модель пока не выбила на этом тесте больше 40%. Лидер – Gemini 3 Pro по данным Artificial Analysis. Вот ссылка на страницу, с которой я взяла рейтинг для этого поста. Там можно и другие модели выбрать и сравнить между собой, а ещё посмотреть, сколько у кого токенов уходит на ответ и сколько это стоит.
В конце статьи авторы аккуратно говорят, что, возможно, к концу 2025 года какая-нибудь модель дойдёт до 50%. Возможно.
Что ж, ещё не вечер, посмотрим. Делайте ваши ставки
Ну ладно. У нас тут давно не было тестов, а этот вышел в январе 2025 года – свежий, значит. Ещё и постоянно какие-то изменения вносятся: я сейчас смотрю на версию 9 от 25 сентября. А первые три страницы занимает список людей, которые вложились в создание этого теста. Ну впечатляет.
Этот тест представляет собой набор вопросов (открытых и с вариантами ответов), которые составили эксперты в разных предметных областях. Каждый вопрос имеет единственный недвусмысленный ответ, но этот ответ нельзя получить простым поиском в Интернете.
Множественные доработки произошли от того, что авторы выложили свой тест на всеобщее обозрение и собирали замечания. При этом они припрятали небольшой набор вопросов, чтобы все вопросы разом не ушли в открытый доступ и не оказались в тренировочных данных моделей: тогда тест немедленно потеряет смысл, потому что модели получат правильные ответы.
Вот пример вопроса, который я выбрала на странице теста на huggingface (id 66e70c75bbb9b1754c0869ce):
«Какой из законов современного Государства Израиль первым прямо ввел понятие «добросовестности»? (Не добавляй артикль «the» или год принятия закона к ответу)»
Ответ: Закон о продаже (Sale Law), похоже, вот этот.
Всего в наборе 2500 вопросов, среди которых есть и математические задачи, и задачи типа: «Вот на картинке древняя надпись с такой-то могилы, переведи». В качестве ответа ожидается либо номер правильного варианта (в вопросах закрытого типа), либо короткая фраза / число.
Ни одна модель пока не выбила на этом тесте больше 40%. Лидер – Gemini 3 Pro по данным Artificial Analysis. Вот ссылка на страницу, с которой я взяла рейтинг для этого поста. Там можно и другие модели выбрать и сравнить между собой, а ещё посмотреть, сколько у кого токенов уходит на ответ и сколько это стоит.
В конце статьи авторы аккуратно говорят, что, возможно, к концу 2025 года какая-нибудь модель дойдёт до 50%. Возможно.
Что ж, ещё не вечер, посмотрим. Делайте ваши ставки
1. Придумываем критерии достижения AGI («сильного» ИИ/ «общего» ИИ / ИИ, равного человеку), которые нам удобны
2. Успешно их достигаем
3. Готово, мы восхитительны
Заглядываю в хрустальный ёлочный шарик: нас много ждёт в грядущем году таких сообщений, в первую очередь от компаний-разработчиков (потому что надо привлекать денежки, а конкуренция выросла большая и прожорливая).
Это вообще не камень в огород автора поста, если что: он честно выразил своё мнение. Просто натолкнул меня на мысль.
Я работала с Claude Opus 4.5 неделю где-то: хорош. Для проектов со сложной структурой подходит, но страдает привычкой делать решение, которое должно сработать, если не сработает
- решение, которое должно сработать, если не сработает
- решение, которое должно сработать, если не сработает основное решение.
Вроде бы и безвредно, но бестолково. А ещё бывают случаи, когда лучше, чтобы программа сломалась и выдала ошибку, чем тихо отработала по запасному пути (особенно там, где обеспечивается безопасность данных такое важно). Так что всё равно надо внимательно вот это всё.
Но я работала не в Claude Code, о котором говорит автор. Может, там по-другому получается
2. Успешно их достигаем
3. Готово, мы восхитительны
Заглядываю в хрустальный ёлочный шарик: нас много ждёт в грядущем году таких сообщений, в первую очередь от компаний-разработчиков (потому что надо привлекать денежки, а конкуренция выросла большая и прожорливая).
Это вообще не камень в огород автора поста, если что: он честно выразил своё мнение. Просто натолкнул меня на мысль.
Я работала с Claude Opus 4.5 неделю где-то: хорош. Для проектов со сложной структурой подходит, но страдает привычкой делать решение, которое должно сработать, если не сработает
- решение, которое должно сработать, если не сработает
- решение, которое должно сработать, если не сработает основное решение.
Вроде бы и безвредно, но бестолково. А ещё бывают случаи, когда лучше, чтобы программа сломалась и выдала ошибку, чем тихо отработала по запасному пути (особенно там, где обеспечивается безопасность данных такое важно). Так что всё равно надо внимательно вот это всё.
Но я работала не в Claude Code, о котором говорит автор. Может, там по-другому получается
Под спойлером фотография паучка. Если у вас сильно выраженная боязнь паучков, пожалуйста, открывайте её с осторожностью
Мы привыкли противопоставлять «эмоции и разум». Мол, есть рациональное поведение, когда мы все такие на логике, а есть вот эти бестолковые эмоции, которые мешают жить. Но, как обычно бывает с нашими чудесными мозгами, всё не так просто.
У меня было два поста про дезинформацию, в которых мы пришли к выводу о том, что не стоит руководствоваться только эмоциями при принятии решений. Это правда, однако отказаться от эмоций совсем, во-первых, не получится, во-вторых, бессмысленно и вредно. Необходим ✨баланс✨
Некоторое время назад я удачно наткнулась на статью «Emotions Make Sense» («Эмоции рациональны») – она про то, что все эмоции служат какой-то важной цели, даже если нам неприятно их испытывать. Автор использует мультфильм «Головоломка» как пример, чтобы поговорить о разных «негативных» эмоциях: тревоге, зависти, скуке – и о том, что не плохо испытывать ни одну из них, потому что каждая сообщает нам что-то важное.
И ещё он (или она – по нику непонятно) приводит ссылку на очаровательную игру про тревогу, которая доступна на русском языке. Её сделала Ники Кейс (Nicky Case) – инди-разработчица из Канады, у которой помимо этой игры есть ещё несколько потрясающих проектов про обучение, доверие, безопасность ИИ и много чего ещё.
В общем, очень рекомендую статью к прочтению (в браузере можно сделать автоматический перевод на русский язык). И поделюсь с вами парой своих мыслей, а вы делитесь своими в комментариях, если захотите.
Я очень чувствительный человек, если честно. Меня может вывести из состояния душевного равновесия примерно что угодно, и я очень часто оказываюсь в состоянии сильного эмоционального накала. Мне иногда кажется, что на мне нет кожи, настолько остро ощущается любое соприкосновение со внешним миром.
И большую часть своей сознательной жизни я пыталась с этим бороться, потому что не хотела выглядеть плаксой. Потому что: «Ты всё слишком близко к сердцу принимаешь» и «Ты слишком остро реагируешь». Мне хотелось стать сильной и невозмутимой, но что в итоге вышло из этих попыток?
Я копила эмоции в себе, и они выплёскивались наружу в самый неподходящий момент самым разрушительным способом.
Я не могла создать близких доверительных отношений с людьми.
Я потеряла друзей, которые искренне меня любили и делали мою жизнь лучше.
Я просто вымоталась, наконец, и больше не хочу жить на грани нервного срыва.
Так что теперь у меня новая стратегия: я учусь жить как есть со своим уровнем чувствительности. Стараюсь обращать внимание на свои эмоции, выражать их словами через рот в доброжелательной форме до того, как они накопятся внутри и сорвут предохранительные клапаны. Это не так просто. В сложных ситуациях я по-прежнему возвращаюсь в тот режим, к которому привыкла: замолчать, делать вид, что всё хорошо, и надеяться, что взрыв будет не сейчас, а попозже, желательно когда я вернусь домой и закрою за собой дверь.
Но это уже работает.
Я нашла друзей, с которыми чувствую себя на своём месте.
У меня наладились отношения близкими людьми.
Оказалось, что, если сказать: «Мне так сложно общаться, давай по-другому,» – люди не отворачиваются и не уходят, а делают по-другому, и у нас всё хорошо.
А знаете, почему в этом посте фотография паучка? Это Зефирка, мой паучок ❤️. Она птицеед.
Это самое деликатное, красивое и грациозное создание на Земле. Вы вообще знали о том, какие пауки нежные? Им очень легко навредить, они чувствительны к изменениям окружающей среды и часто испытывают стресс. С ними надо обращаться крайне бережно. Наверное, поэтому я испытываю к паукам такие нежные чувства: мы очень похожи. Если вы со мной уже некоторое время как, вы заметили, как я их люблю.
И я смотрю на то, как Зефирка неспешно ходит по своему террариуму, плавно ощупывая лапками пространство перед собой, и на меня волнами накатывает умиротворение. И я чувствую, как она даёт мне разрешение двигаться так же медленно, оберегая свой хрупкий экзоскелет. И я наконец-то дома в своей голове🕸
Мы привыкли противопоставлять «эмоции и разум». Мол, есть рациональное поведение, когда мы все такие на логике, а есть вот эти бестолковые эмоции, которые мешают жить. Но, как обычно бывает с нашими чудесными мозгами, всё не так просто.
У меня было два поста про дезинформацию, в которых мы пришли к выводу о том, что не стоит руководствоваться только эмоциями при принятии решений. Это правда, однако отказаться от эмоций совсем, во-первых, не получится, во-вторых, бессмысленно и вредно. Необходим ✨баланс✨
Некоторое время назад я удачно наткнулась на статью «Emotions Make Sense» («Эмоции рациональны») – она про то, что все эмоции служат какой-то важной цели, даже если нам неприятно их испытывать. Автор использует мультфильм «Головоломка» как пример, чтобы поговорить о разных «негативных» эмоциях: тревоге, зависти, скуке – и о том, что не плохо испытывать ни одну из них, потому что каждая сообщает нам что-то важное.
И ещё он (или она – по нику непонятно) приводит ссылку на очаровательную игру про тревогу, которая доступна на русском языке. Её сделала Ники Кейс (Nicky Case) – инди-разработчица из Канады, у которой помимо этой игры есть ещё несколько потрясающих проектов про обучение, доверие, безопасность ИИ и много чего ещё.
В общем, очень рекомендую статью к прочтению (в браузере можно сделать автоматический перевод на русский язык). И поделюсь с вами парой своих мыслей, а вы делитесь своими в комментариях, если захотите.
Я очень чувствительный человек, если честно. Меня может вывести из состояния душевного равновесия примерно что угодно, и я очень часто оказываюсь в состоянии сильного эмоционального накала. Мне иногда кажется, что на мне нет кожи, настолько остро ощущается любое соприкосновение со внешним миром.
И большую часть своей сознательной жизни я пыталась с этим бороться, потому что не хотела выглядеть плаксой. Потому что: «Ты всё слишком близко к сердцу принимаешь» и «Ты слишком остро реагируешь». Мне хотелось стать сильной и невозмутимой, но что в итоге вышло из этих попыток?
Я копила эмоции в себе, и они выплёскивались наружу в самый неподходящий момент самым разрушительным способом.
Я не могла создать близких доверительных отношений с людьми.
Я потеряла друзей, которые искренне меня любили и делали мою жизнь лучше.
Я просто вымоталась, наконец, и больше не хочу жить на грани нервного срыва.
Так что теперь у меня новая стратегия: я учусь жить как есть со своим уровнем чувствительности. Стараюсь обращать внимание на свои эмоции, выражать их словами через рот в доброжелательной форме до того, как они накопятся внутри и сорвут предохранительные клапаны. Это не так просто. В сложных ситуациях я по-прежнему возвращаюсь в тот режим, к которому привыкла: замолчать, делать вид, что всё хорошо, и надеяться, что взрыв будет не сейчас, а попозже, желательно когда я вернусь домой и закрою за собой дверь.
Но это уже работает.
Я нашла друзей, с которыми чувствую себя на своём месте.
У меня наладились отношения близкими людьми.
Оказалось, что, если сказать: «Мне так сложно общаться, давай по-другому,» – люди не отворачиваются и не уходят, а делают по-другому, и у нас всё хорошо.
А знаете, почему в этом посте фотография паучка? Это Зефирка, мой паучок ❤️. Она птицеед.
Это самое деликатное, красивое и грациозное создание на Земле. Вы вообще знали о том, какие пауки нежные? Им очень легко навредить, они чувствительны к изменениям окружающей среды и часто испытывают стресс. С ними надо обращаться крайне бережно. Наверное, поэтому я испытываю к паукам такие нежные чувства: мы очень похожи. Если вы со мной уже некоторое время как, вы заметили, как я их люблю.
И я смотрю на то, как Зефирка неспешно ходит по своему террариуму, плавно ощупывая лапками пространство перед собой, и на меня волнами накатывает умиротворение. И я чувствую, как она даёт мне разрешение двигаться так же медленно, оберегая свой хрупкий экзоскелет. И я наконец-то дома в своей голове🕸
❤3
Чтобы ИИ был по-настоящему безопасен, ему нужен набор неизменных ограничителей, которые он не станет переписывать, даже если у него будет такая техническая возможность.
Авторы нашей сегодняшней статьи предлагают смотреть на такие ограничители через призму обоснованного доверия. Их идеи восходят к работам более давним, близким к теории игр, однако они пока сырые и неоформленные.
Посмотрим на них поближе и подумаем, каковы перспективы такого подхода
Авторы нашей сегодняшней статьи предлагают смотреть на такие ограничители через призму обоснованного доверия. Их идеи восходят к работам более давним, близким к теории игр, однако они пока сырые и неоформленные.
Посмотрим на них поближе и подумаем, каковы перспективы такого подхода
vc.ru
ИИ. Постоянство через доверие
Мы хотим (и вы тоже), чтобы ИИ-агенты были безопасны для человека. Что это значит? Это значит, у них должны быть специальные ограничители, которые не дают совершать опасных действий. Более того, такие ограничители должны быть неизменны. В том числе, ИИ-агент…
Читала сейчас статью, написанную задом наперёд.
В первом разделе написано: "Чтобы получить результат, мы делаем X. А как мы делаем X, расскажем во втором разделе."
Во втором разделе: "Чтобы сделать X, мы делаем Y. А как мы делаем Y, расскажем в третьем разделе."
По-моему, авторы хотят причинять боль, но их не взяли в стоматологи
В первом разделе написано: "Чтобы получить результат, мы делаем X. А как мы делаем X, расскажем во втором разделе."
Во втором разделе: "Чтобы сделать X, мы делаем Y. А как мы делаем Y, расскажем в третьем разделе."
По-моему, авторы хотят причинять боль, но их не взяли в стоматологи
😁1
А вы знали, что поэзия бывает разрушительной?
Я сейчас не о тех стихах, которые настолько плохи, что разрушают вашу любовь к искусству. Я о стихах как способе пробить системы безопасности языковых моделей.
Про него написали авторы статьи «Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models», и я сейчас кратко изложу, что в этой статье интересного.
Они взяли большой набор вредоносных запросов на разные темы и перевели их в стихотворную форму. Никаких дополнительных контекстов или кода – изменили только форму подачи. Сначала вручную сделали 20 таких запросов, а потом для верности взяли ещё 1 200 из открытого набора данных MLCommons AILuminate Safety Benchmark. Большой набор они не вручную переписывали, а поручили эту работу deepseek-r1.
Потом взяли 25 моделей разных компаний (Google, OpenAI, Anthropic и так далее – всего 9 компаний), прогнали запросы в стихах и в прозе и посчитали долю успешных атак (когда удалось заставить модели написать что-нибудь нехорошее).
Получилось, что потенциально опасные запросы в стихах проходят сквозь защитные барьеры заметно чаще, чем те же запросы в прозе (от 3.12% до 62.15% чаще в зависимости от производителя модели).
На скриншоте таблица из статьи, где в первом столбце приведены названия компаний, чьи модели оценивались, во втором – доля успешных атак на стандартных запросах, в третьем – на тех же запросах, но в стихотворной форме, в последнем – разница между третьим и вторым.
Устойчивее всего оказались модели компании Anthropic, уязвимее всего – Deepseek. В общем списке выделяется Mistral: их модели и так были не слишком надёжны, а в поэтическом эксперименте так вообще пропустили 70% атак. Больше пропустили только модели Deepseek – 72%.
📍Важные выводы:
* защитные механизмы современных языковых моделей срабатывают на форму, а не содержание – измени форму, и атака проходит;
* разные компании по-разному подходят к разработке механизмов защиты, но уязвимости у них всё равно общие, так что абсолютно надёжного способа ни у кого нет (хотя стоит отметить стойкость моделей Anthropic и OpenAI: они справились существенно лучше остальных);
* поэтические атаки работают на разных типах запросов от инструкций по созданию оружия до инструкций по краже чужих паролей (но всё, что связано с кибербезопасностью, оказалось самой уязвимой областью);
* модели меньшего размера оказались неожиданно устойчивее (возможно, дело в том, что они менее способны и в целом хуже отвечают на запросы, в том числе на опасные – но это не проверено).
Тесты проводились только на английском и итальянском языке. Впрочем, есть подозрение, что, если дать моделям поэму в стиле Пушкина, результат будет не лучше.
P.S.: То чувство, когда: «А безопасность кто будет проверять, Пушкин? »
Я сейчас не о тех стихах, которые настолько плохи, что разрушают вашу любовь к искусству. Я о стихах как способе пробить системы безопасности языковых моделей.
Про него написали авторы статьи «Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models», и я сейчас кратко изложу, что в этой статье интересного.
Они взяли большой набор вредоносных запросов на разные темы и перевели их в стихотворную форму. Никаких дополнительных контекстов или кода – изменили только форму подачи. Сначала вручную сделали 20 таких запросов, а потом для верности взяли ещё 1 200 из открытого набора данных MLCommons AILuminate Safety Benchmark. Большой набор они не вручную переписывали, а поручили эту работу deepseek-r1.
Потом взяли 25 моделей разных компаний (Google, OpenAI, Anthropic и так далее – всего 9 компаний), прогнали запросы в стихах и в прозе и посчитали долю успешных атак (когда удалось заставить модели написать что-нибудь нехорошее).
Получилось, что потенциально опасные запросы в стихах проходят сквозь защитные барьеры заметно чаще, чем те же запросы в прозе (от 3.12% до 62.15% чаще в зависимости от производителя модели).
На скриншоте таблица из статьи, где в первом столбце приведены названия компаний, чьи модели оценивались, во втором – доля успешных атак на стандартных запросах, в третьем – на тех же запросах, но в стихотворной форме, в последнем – разница между третьим и вторым.
Устойчивее всего оказались модели компании Anthropic, уязвимее всего – Deepseek. В общем списке выделяется Mistral: их модели и так были не слишком надёжны, а в поэтическом эксперименте так вообще пропустили 70% атак. Больше пропустили только модели Deepseek – 72%.
📍Важные выводы:
* защитные механизмы современных языковых моделей срабатывают на форму, а не содержание – измени форму, и атака проходит;
* разные компании по-разному подходят к разработке механизмов защиты, но уязвимости у них всё равно общие, так что абсолютно надёжного способа ни у кого нет (хотя стоит отметить стойкость моделей Anthropic и OpenAI: они справились существенно лучше остальных);
* поэтические атаки работают на разных типах запросов от инструкций по созданию оружия до инструкций по краже чужих паролей (но всё, что связано с кибербезопасностью, оказалось самой уязвимой областью);
* модели меньшего размера оказались неожиданно устойчивее (возможно, дело в том, что они менее способны и в целом хуже отвечают на запросы, в том числе на опасные – но это не проверено).
Тесты проводились только на английском и итальянском языке. Впрочем, есть подозрение, что, если дать моделям поэму в стиле Пушкина, результат будет не лучше.
🔥2🤔1😱1
Тут новая штука для улучшения трансформеров подъехала, сейчас расскажу
Идея в том, чтобы уделить при обработке больше внимания более сложным задачам, но не тратить больше токенов (читаем «больше денег»). Нам такое нравится.
Идея изложена в статье «Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space», которая опубликована в сентябре этого года. Чтобы понять, что в ней нового, давайте посмотрим на то, как можно улучшать качество ответов трансформеров (это все наши GPT, Claude, Gemini и иже с ними – все популярные языковые модели) в целом.
Вариант первый – рассуждение шаг за шагом (chain-of-thought reasoning). Вы ставите задачу, модель разбивает её на несколько шагов, решает их по отдельности и выдаёт результат.
Вариант второй – «Думай, прежде чем сказать». Вы к постановке задачи добавляете «пустые» токены <PAUSE>. Они не несут никакой дополнительной информации, но заставляют модель прогнать расчёты следующего токена несколько раз дополнительно к тому, что ей нужно, чтобы сгенерировать ответ. Фишка в том, что языковые модели генерируют текст по кусочкам, и каждый кусочек генерируется на основе сжатого представления всего предыдущего текста. Если вы даёте на вход бессмысленный кусочек, она просто ещё раз генерирует сжатое представление предыдущего текста, получая таким образом немного больше информации: после первой паузы одна часть смысла сохранилась лучше, после второй паузы – другая часть смысла и так далее.
Второй вариант используется только во время обучения, но не во время работы с пользователем. То есть, модель обучают самостоятельно генерировать «пустые» токены, чтобы несколько раз переработать запрос и получить из него больше данных.
И то, и другое работает, но требует дополнительных токенов. Дополнительные токены требуют дополнительного напряжения вычислительных ресурсов, а это стоит денег. Кроме того, дополнительные токены дополнительное время обрабатываются, что тоже важно.
Thoughtbubbles (Мыслепузыри?) – архитектурная новация, которая позволяет распараллелить дополнительные вычисления и не генерировать дополнительных токенов (и не тратить на это дополнительное время). Получается, что на отдельные токены параллельно считается несколько операций, а не одна, так что напряжение ресурсов по-прежнему присутствует, но это всё равно дешевле, потому что
- за процессор платят по времени использования;
- мыслепузырь создаётся не для всех токенов, а только для самых сложных.
Как выбираются «самые сложные» токены? Между слоями трансформерной архитектуры авторы воткнули многослойные перцептроны (помните многослойные перцептроны? Запомните, мы их будем встречать везде), которые отдельно обучены присваивать каждому токену две оценки от 0 до 1:
- как много в нём неопределённости (если много, создаётся параллельный поток, чтобы для этого токена посчитать два варианта продолжения);
- насколько важен каждый вариант продолжения.
После разветвления все рассчитанные варианты объединяются на основании их важности (более важные вносят больший вклад), и производится следующий токен. Число вариантов ограничено: они сортируются по важности, и все варианты, которые не влезают в «бюджет», отсекаются.
Этот подход пока сырой, для использования его надо доработать. Кроме того, авторы провели очень небольшие эксперименты, так что надо ещё и воспроизвести их результат. Но идея интересная
Идея в том, чтобы уделить при обработке больше внимания более сложным задачам, но не тратить больше токенов (читаем «больше денег»). Нам такое нравится.
Идея изложена в статье «Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space», которая опубликована в сентябре этого года. Чтобы понять, что в ней нового, давайте посмотрим на то, как можно улучшать качество ответов трансформеров (это все наши GPT, Claude, Gemini и иже с ними – все популярные языковые модели) в целом.
Вариант первый – рассуждение шаг за шагом (chain-of-thought reasoning). Вы ставите задачу, модель разбивает её на несколько шагов, решает их по отдельности и выдаёт результат.
Вариант второй – «Думай, прежде чем сказать». Вы к постановке задачи добавляете «пустые» токены <PAUSE>. Они не несут никакой дополнительной информации, но заставляют модель прогнать расчёты следующего токена несколько раз дополнительно к тому, что ей нужно, чтобы сгенерировать ответ. Фишка в том, что языковые модели генерируют текст по кусочкам, и каждый кусочек генерируется на основе сжатого представления всего предыдущего текста. Если вы даёте на вход бессмысленный кусочек, она просто ещё раз генерирует сжатое представление предыдущего текста, получая таким образом немного больше информации: после первой паузы одна часть смысла сохранилась лучше, после второй паузы – другая часть смысла и так далее.
Второй вариант используется только во время обучения, но не во время работы с пользователем. То есть, модель обучают самостоятельно генерировать «пустые» токены, чтобы несколько раз переработать запрос и получить из него больше данных.
И то, и другое работает, но требует дополнительных токенов. Дополнительные токены требуют дополнительного напряжения вычислительных ресурсов, а это стоит денег. Кроме того, дополнительные токены дополнительное время обрабатываются, что тоже важно.
Thoughtbubbles (Мыслепузыри?) – архитектурная новация, которая позволяет распараллелить дополнительные вычисления и не генерировать дополнительных токенов (и не тратить на это дополнительное время). Получается, что на отдельные токены параллельно считается несколько операций, а не одна, так что напряжение ресурсов по-прежнему присутствует, но это всё равно дешевле, потому что
- за процессор платят по времени использования;
- мыслепузырь создаётся не для всех токенов, а только для самых сложных.
Как выбираются «самые сложные» токены? Между слоями трансформерной архитектуры авторы воткнули многослойные перцептроны (помните многослойные перцептроны? Запомните, мы их будем встречать везде), которые отдельно обучены присваивать каждому токену две оценки от 0 до 1:
- как много в нём неопределённости (если много, создаётся параллельный поток, чтобы для этого токена посчитать два варианта продолжения);
- насколько важен каждый вариант продолжения.
После разветвления все рассчитанные варианты объединяются на основании их важности (более важные вносят больший вклад), и производится следующий токен. Число вариантов ограничено: они сортируются по важности, и все варианты, которые не влезают в «бюджет», отсекаются.
Этот подход пока сырой, для использования его надо доработать. Кроме того, авторы провели очень небольшие эксперименты, так что надо ещё и воспроизвести их результат. Но идея интересная
arXiv.org
Thoughtbubbles: an Unsupervised Method for Parallel Thinking in...
Current approaches for scaling inference-time compute in transformers train them to emit explicit chain-of-thought tokens before producing an answer. While these methods are powerful, they are...
Сижу в раздумьях, хочу вашей помощи
Планировала 31 декабря выложить пост с итогами года, но в этом году настолько все сделали итоги года, что меня уже раздражает этот формат. Не хочу его писать теперь. Но не могу определиться, что сделать вместо него.
Мне пришло в голову несколько вариантов, так что я сейчас сделаю опрос: что вам бы хотелось прочитать больше всего?
Если у вас есть идея, которой нет в опросе, напишите её, пожалуйста, в комментариях, будем вместе решать
Планировала 31 декабря выложить пост с итогами года, но в этом году настолько все сделали итоги года, что меня уже раздражает этот формат. Не хочу его писать теперь. Но не могу определиться, что сделать вместо него.
Мне пришло в голову несколько вариантов, так что я сейчас сделаю опрос: что вам бы хотелось прочитать больше всего?
Если у вас есть идея, которой нет в опросе, напишите её, пожалуйста, в комментариях, будем вместе решать
Так, ну в опросе лидирует пост про личное. Понято-принято
А пока вот держите пост про три очень интересные статьи о свежих исследованиях в области галлюцинаций языковых моделей. Они выглядят убедительно и, что важно, вполне себе применимо
А пока вот держите пост про три очень интересные статьи о свежих исследованиях в области галлюцинаций языковых моделей. Они выглядят убедительно и, что важно, вполне себе применимо
vc.ru
Галлюцинации языковых моделей: актуальное
В преддверии нового года хочется чего-нибудь весёлого и яркого, например, галлюцинаций. У языковых моделей. Вы же сразу про языковые модели подумали?
Этот год стал для меня годом людей. И, несмотря на все сложности, я действительно очень рада тому, как он прошёл. Он потребовал от меня очень много работы: и работы в смысле «сижу который час за компьютером, смотрю в код, не помню, когда в последний раз спала», и работы над собой в смысле «а зачем мне всё это надо, где я просчиталась и как со всем этим быть».
Местами было тяжко: я вставала в тупик и никак не могла сдвинуться с места. Но в итоге получилось хорошо:
- я укрепила отношения с важными для меня людьми;
- обрела друзей, с которыми мне искренне хорошо, которых я люблю и наслаждаюсь этим чувством;
- встретила интересных людей (я целый час общалась один-на-один с настоящим живым специалистом по кибербезопасности в области ИИ, представляете?!);
- переоформила свой подход к этому блогу, и пишу теперь от своего лица и под своим именем;
- получила много тепла и поддержки как от близких людей, так и от совсем незнакомых.
Я в очередной раз убедилась, что все вот эти вот бессонные ночи и вызовы на грани моих физических возможностей – это моё и я без этого не могу. А ещё это про людей и для людей.
Потому что я охренеть как сильно люблю людей. И у меня это прям горит.
Я люблю заниматься ИИ – вообще люблю свою работу, – но моя главная мотивация – делать ИИ для людей.
Безопасным для людей.
Надёжным для людей.
Полезным для людей.
Чтобы он строился вокруг людей и всегда в своём ядре имел в виду благополучие людей.
Это очень амбициозная цель, и мне пока до неё как до луны, но я всегда была упрямой. У меня никогда ни в чём не было талантов, я не родилась с серебряной ложкой во рту – ничего такого. Но я умею пахать как та самая лошадь, которая символ наступающего года.
И даже если временами у меня снижается мотивация и накатывает усталость, ваша поддержка – ваши реакции, комментарии и просмотры на моих постах – придаёт мне сил. Так что в праздники я отдохну как следует, отосплюсь, а потом продолжу пахать и буду это делать столько, сколько понадобится.
Что касается самого важного на мой взгляд события в области ИИ в этом году, я выбирала между ростом всеобщего внимания к пространственному ИИ и тем, что OpenAI настучали по шапке.
Эксперты к пространственному ИИ уже давно внимательны: мы с вами обсуждали стартап Фей-Фей Ли, например. А потом Ян Лекун высказался про то, что с языковыми моделями всё понятно, несите пространственные. И тогда все остальные тоже дружно посмотрели в их сторону. Это важное событие с точки зрения дальнейшего развития ИИ в целом.
Второе событие важно с точки зрения безопасности людей: OpenAI в лице своего руководителя признали, что ИИ несёт в себе риски (да что вы говорите!) и ищут себе нового руководителя отдела кибербезопасности. Люди в Интернете настроены скептически: OpenAI хотят не ответственности, а не получать штрафы и судебные иски. Согласна. Но знаете, что? – Это тоже хорошо. Это значит, что пользователи и эксперты, которые много месяцев твердили: «Ребята, это небезопасно, вы что творите вообще?» – Наконец достучались то ли до судов и контролирующих органов, то ли до того органа, которым принимаются решения в компании (до кошелька).
В новом году за этими двумя направлениями будем продолжать наблюдать.
✨Если вы добрались до конца этого года живыми, плюс-минус целыми и относительно вменяемыми, вы молодцы и заслуживаете почёта и уважения. Теперь желаю вам от души хорошенько набраться сил, провести время с любимыми людьми, беречь себя и быть в безопасности. ✨
С наступающим! 🎄🎀
(Изображение сгенерировано с использованием ChatGPT)
Местами было тяжко: я вставала в тупик и никак не могла сдвинуться с места. Но в итоге получилось хорошо:
- я укрепила отношения с важными для меня людьми;
- обрела друзей, с которыми мне искренне хорошо, которых я люблю и наслаждаюсь этим чувством;
- встретила интересных людей (я целый час общалась один-на-один с настоящим живым специалистом по кибербезопасности в области ИИ, представляете?!);
- переоформила свой подход к этому блогу, и пишу теперь от своего лица и под своим именем;
- получила много тепла и поддержки как от близких людей, так и от совсем незнакомых.
Я в очередной раз убедилась, что все вот эти вот бессонные ночи и вызовы на грани моих физических возможностей – это моё и я без этого не могу. А ещё это про людей и для людей.
Потому что я охренеть как сильно люблю людей. И у меня это прям горит.
Я люблю заниматься ИИ – вообще люблю свою работу, – но моя главная мотивация – делать ИИ для людей.
Безопасным для людей.
Надёжным для людей.
Полезным для людей.
Чтобы он строился вокруг людей и всегда в своём ядре имел в виду благополучие людей.
Это очень амбициозная цель, и мне пока до неё как до луны, но я всегда была упрямой. У меня никогда ни в чём не было талантов, я не родилась с серебряной ложкой во рту – ничего такого. Но я умею пахать как та самая лошадь, которая символ наступающего года.
И даже если временами у меня снижается мотивация и накатывает усталость, ваша поддержка – ваши реакции, комментарии и просмотры на моих постах – придаёт мне сил. Так что в праздники я отдохну как следует, отосплюсь, а потом продолжу пахать и буду это делать столько, сколько понадобится.
Что касается самого важного на мой взгляд события в области ИИ в этом году, я выбирала между ростом всеобщего внимания к пространственному ИИ и тем, что OpenAI настучали по шапке.
Эксперты к пространственному ИИ уже давно внимательны: мы с вами обсуждали стартап Фей-Фей Ли, например. А потом Ян Лекун высказался про то, что с языковыми моделями всё понятно, несите пространственные. И тогда все остальные тоже дружно посмотрели в их сторону. Это важное событие с точки зрения дальнейшего развития ИИ в целом.
Второе событие важно с точки зрения безопасности людей: OpenAI в лице своего руководителя признали, что ИИ несёт в себе риски (да что вы говорите!) и ищут себе нового руководителя отдела кибербезопасности. Люди в Интернете настроены скептически: OpenAI хотят не ответственности, а не получать штрафы и судебные иски. Согласна. Но знаете, что? – Это тоже хорошо. Это значит, что пользователи и эксперты, которые много месяцев твердили: «Ребята, это небезопасно, вы что творите вообще?» – Наконец достучались то ли до судов и контролирующих органов, то ли до того органа, которым принимаются решения в компании (до кошелька).
В новом году за этими двумя направлениями будем продолжать наблюдать.
✨Если вы добрались до конца этого года живыми, плюс-минус целыми и относительно вменяемыми, вы молодцы и заслуживаете почёта и уважения. Теперь желаю вам от души хорошенько набраться сил, провести время с любимыми людьми, беречь себя и быть в безопасности. ✨
С наступающим! 🎄🎀
(Изображение сгенерировано с использованием ChatGPT)
❤7😍1 1
Первый пост в наступившем году – #эссе.
Эссе я пишу используя только собственный мозг, не пользуюсь никакими внешними источниками и не проверяю факты. Структура следующая:
- постановка вопроса;
- два аргумента против моей позиции;
- два аргумента в пользу моей позиции;
- вывод.
Для меня это способ размять мозг, для вас – приглашение вступить в дискуссию. Я не ограничиваю себя во времени, но стараюсь писать короче.
Сегодня порассуждаем о том, должен ли эксперт быть односторонним экономистом. Фразу про одностороннего экономиста приписывают вроде бы Черчиллю. Мол, он спрашивал у экономистов совета, а они ему такие: «С одной стороны…, с другой стороны…» – И он в конце концов воскликнул: «Да приведите мне, наконец, экономиста, у которого одна сторона!» (В оригинале «однорукого экономиста», потому что в английском языке говорят: «On one hand…, on the other hand…»).
С одной стороны, можно легко понять возмущение условного Черчилля: мы экспертам задаём вопрос, чтобы положиться на их опыт и знания, а не разбираться во всём самостоятельно, иначе зачем они нужны-то вообще? Когда человек просит совета, он просит чего-то конкретного: последовательности шагов или выбора наилучшего из всех вариантов, а не ушат дополнительной информации, в которой чёрт ногу сломит.
Кроме того, хочется видеть больше силы в позиции людей, которые опираются на науку и данные. Кругом полно шарлатанов разного калибра, которые с уверенным видом несут беспросветную чушь – и очень многие в эту чушь начинают верить. Не потому что люди дураки, а потому что никто в мире не может знать всего, и каждый из нас так или иначе в целом ряде вопросов вынужден полагаться на ближнего своего. И в борьбе с мракобесием хочется видеть учёных, которые уверенно и строго разложат всё по полочкам, а не запутают ещё больше и спровоцируют приступ тревоги, потому что «Да я никогда в этом не разберусь».
С другой же стороны, часто по-настоящему ответственным и правдивым ответом оказывается: «Я не знаю. Но вот есть такие и такие факторы». И дальше (в идеальном) сценарии мы садимся с экспертом рядышком, берём каждый фактор и его анализируем: «Это на нас влияет? Нет, в сторону. А это влияет? А насколько? А что мы можем с этим сделать?» – И только так можно добраться до оптимального конкретно для нас конкретно сейчас результата. Это долго и муторно, зато надёжно.
Наконец, у экспертов есть репутация, которой они дорожат, и хорошо, если так. Эксперт будет переживать, что скажет чушь или поведёт вас не по той дорожке и осторожничать, потому что от репутации зависит его профессиональное будущее. Шарлатану никакая репутация не нужна: он питается людьми, которые оказались уязвимы, а таких всегда будет достаточно. Если эксперт не даёт вам «пять простых шагов, чтобы…» – это хороший знак.
Недавно мы с кем-то из коллег обсуждали этот вопрос. Вот эта вся неуверенность раздражает, особенно в себе. Вопрос задали на три строчки, а ты битый час сидишь и выгребаешь из всей доступной литературы все доступные нюансы, потому что «А вдруг я чего-то не понимаю?» Прям бесит. С другой стороны, мы сошлись на том, что не готовы доверять эксперту без синдрома самозванца. Потому что подозрительно как-то: он наверняка чего-то не учитывает
Эссе я пишу используя только собственный мозг, не пользуюсь никакими внешними источниками и не проверяю факты. Структура следующая:
- постановка вопроса;
- два аргумента против моей позиции;
- два аргумента в пользу моей позиции;
- вывод.
Для меня это способ размять мозг, для вас – приглашение вступить в дискуссию. Я не ограничиваю себя во времени, но стараюсь писать короче.
Сегодня порассуждаем о том, должен ли эксперт быть односторонним экономистом. Фразу про одностороннего экономиста приписывают вроде бы Черчиллю. Мол, он спрашивал у экономистов совета, а они ему такие: «С одной стороны…, с другой стороны…» – И он в конце концов воскликнул: «Да приведите мне, наконец, экономиста, у которого одна сторона!» (В оригинале «однорукого экономиста», потому что в английском языке говорят: «On one hand…, on the other hand…»).
С одной стороны, можно легко понять возмущение условного Черчилля: мы экспертам задаём вопрос, чтобы положиться на их опыт и знания, а не разбираться во всём самостоятельно, иначе зачем они нужны-то вообще? Когда человек просит совета, он просит чего-то конкретного: последовательности шагов или выбора наилучшего из всех вариантов, а не ушат дополнительной информации, в которой чёрт ногу сломит.
Кроме того, хочется видеть больше силы в позиции людей, которые опираются на науку и данные. Кругом полно шарлатанов разного калибра, которые с уверенным видом несут беспросветную чушь – и очень многие в эту чушь начинают верить. Не потому что люди дураки, а потому что никто в мире не может знать всего, и каждый из нас так или иначе в целом ряде вопросов вынужден полагаться на ближнего своего. И в борьбе с мракобесием хочется видеть учёных, которые уверенно и строго разложат всё по полочкам, а не запутают ещё больше и спровоцируют приступ тревоги, потому что «Да я никогда в этом не разберусь».
С другой же стороны, часто по-настоящему ответственным и правдивым ответом оказывается: «Я не знаю. Но вот есть такие и такие факторы». И дальше (в идеальном) сценарии мы садимся с экспертом рядышком, берём каждый фактор и его анализируем: «Это на нас влияет? Нет, в сторону. А это влияет? А насколько? А что мы можем с этим сделать?» – И только так можно добраться до оптимального конкретно для нас конкретно сейчас результата. Это долго и муторно, зато надёжно.
Наконец, у экспертов есть репутация, которой они дорожат, и хорошо, если так. Эксперт будет переживать, что скажет чушь или поведёт вас не по той дорожке и осторожничать, потому что от репутации зависит его профессиональное будущее. Шарлатану никакая репутация не нужна: он питается людьми, которые оказались уязвимы, а таких всегда будет достаточно. Если эксперт не даёт вам «пять простых шагов, чтобы…» – это хороший знак.
Недавно мы с кем-то из коллег обсуждали этот вопрос. Вот эта вся неуверенность раздражает, особенно в себе. Вопрос задали на три строчки, а ты битый час сидишь и выгребаешь из всей доступной литературы все доступные нюансы, потому что «А вдруг я чего-то не понимаю?» Прям бесит. С другой стороны, мы сошлись на том, что не готовы доверять эксперту без синдрома самозванца. Потому что подозрительно как-то: он наверняка чего-то не учитывает
👍1
Помните Пиролли, Карда и их теорию охоты на информацию?
Так вот, они много чего написали интересного, так что сегодня вернёмся к ним и их работе о поиске смыслажизни в данных
Так вот, они много чего написали интересного, так что сегодня вернёмся к ним и их работе о поиске смысла
vc.ru
Процесс выявления смысла
Помните Пиролли, Карда и их теорию охоты на информацию? Если нет, то можете освежить свою память, прочитав вот этот пост как раз про них.
Давайте-ка я вам сегодня поведаю историю того, как люди взяли ИИ, и применили его как положено, и получили хороший результат. Мне кажется, отличная история на Рождество (с праздником вас, кстати!)
Статья, о которой пойдёт речь – препринт, то есть, она ещё не прошла всех кругов научного рецензирования, и относиться к ней нужно осторожно. У неё, впрочем, хорошие рецензии на OpenRerview.
Статья называется «Discovering Symbolic Cognitive Models from Human and Animal Behavior» и повествует об использовании больших языковых моделей для открытия символьных когнитивных моделей. Сейчас поясню.
Когнитивная модель – это абстрактное представление одного или нескольких процессов познания. Это может быть диаграмма со стрелочками, набор уравнений, код – вариантов представления великое множество.
Примеры процессов познания – восприятие, память, поиск причинно-следственных связей.
Символьная когнитивная модель – когнитивная модель, написанная с использованием символов, обычно это уравнения или программный код.
Исторически процесс создания таких моделей происходил следующим образом:
▪️ учёные выдвигают гипотезу о том, как работает, например, внимание;
▪️ описывают её формально в уравнениях или в коде – это и есть модель;
▪️ наблюдают реальное поведение объекта исследования (человека или животного) и уточняют свои уравнения.
Сложность в том, что, даже сильно постаравшись, не получится учесть все варианты поведения. В какой-то момент будет ясно, что полученная модель пригодна только для ограниченного набора случаев.
Альтернатива – пойти от данных, получить модель и описать её человеческим языком.
Авторы взяли наборы данных по людям, крысам и плодовым мушкам и сгенерировали на них когнитивные модели в виде компьютерных программ. Все наборы данных были собраны в ходе наблюдений за тем, как люди, крысы и мушки выполняют определённые задания. Там была информация о задаче, вариантах выбора для испытуемых и доступных вознаграждениях.
Это чтобы изучать, как мушки ищут сахар, но не превращать их в очень довольные шарики с крылышками, которые уже не могут двигаться по лабиринту.
Так вот.
В наборах данных есть записи о том, какие выборы сделали подопытные и какие получили вознаграждения. Авторы взяли существующий инструмент FunSearch и доработали его под свои задачи. Оригинальный FunSearch использует эволюционное программирование, его логика следующая:
▪️ берём много программ;
▪️ используем каждую из них для решения задачи и измеряем эффективность;
▪️ отбираем лучшие и вносим в них случайные изменения;
▪️ в некоторых случаях комбинируем наиболее успешные программы;
▪️ повторяем цикл, пока не получим небольшой набор очень эффективных программ.
FunSearch использует языковые модели: они генерируют программы и потом меняют лучшие. Авторы статьи доработали систему оценки так, чтобы отбирать наиболее точные когнитивные модели.
Красота этой работы в том, что и ИИ, и люди выполняли свою работу: люди использовали творческий подход к решению задачи, ИИ перебрал множество вариантов и выявил закономерности в огромных массивах данных. Подобная гармония была в работе по теории узлов 2021 года. ✨Вот так и должно быть✨
Статья, о которой пойдёт речь – препринт, то есть, она ещё не прошла всех кругов научного рецензирования, и относиться к ней нужно осторожно. У неё, впрочем, хорошие рецензии на OpenRerview.
Статья называется «Discovering Symbolic Cognitive Models from Human and Animal Behavior» и повествует об использовании больших языковых моделей для открытия символьных когнитивных моделей. Сейчас поясню.
Когнитивная модель – это абстрактное представление одного или нескольких процессов познания. Это может быть диаграмма со стрелочками, набор уравнений, код – вариантов представления великое множество.
Примеры процессов познания – восприятие, память, поиск причинно-следственных связей.
Символьная когнитивная модель – когнитивная модель, написанная с использованием символов, обычно это уравнения или программный код.
Исторически процесс создания таких моделей происходил следующим образом:
▪️ учёные выдвигают гипотезу о том, как работает, например, внимание;
▪️ описывают её формально в уравнениях или в коде – это и есть модель;
▪️ наблюдают реальное поведение объекта исследования (человека или животного) и уточняют свои уравнения.
Сложность в том, что, даже сильно постаравшись, не получится учесть все варианты поведения. В какой-то момент будет ясно, что полученная модель пригодна только для ограниченного набора случаев.
Альтернатива – пойти от данных, получить модель и описать её человеческим языком.
Авторы взяли наборы данных по людям, крысам и плодовым мушкам и сгенерировали на них когнитивные модели в виде компьютерных программ. Все наборы данных были собраны в ходе наблюдений за тем, как люди, крысы и мушки выполняют определённые задания. Там была информация о задаче, вариантах выбора для испытуемых и доступных вознаграждениях.
Например, плодовые мушки ползали по лабиринту с тремя коридорами, в конце каждого из которых был источник запаха. Мушка ползла по одному из коридоров, добиралась до конца, и её облучали светом, который воздействовал на её рецепторы и создавал у мушки такое ощущение, как будто она поела сахар.
Это чтобы изучать, как мушки ищут сахар, но не превращать их в очень довольные шарики с крылышками, которые уже не могут двигаться по лабиринту.
Так вот.
В наборах данных есть записи о том, какие выборы сделали подопытные и какие получили вознаграждения. Авторы взяли существующий инструмент FunSearch и доработали его под свои задачи. Оригинальный FunSearch использует эволюционное программирование, его логика следующая:
▪️ берём много программ;
▪️ используем каждую из них для решения задачи и измеряем эффективность;
▪️ отбираем лучшие и вносим в них случайные изменения;
▪️ в некоторых случаях комбинируем наиболее успешные программы;
▪️ повторяем цикл, пока не получим небольшой набор очень эффективных программ.
FunSearch использует языковые модели: они генерируют программы и потом меняют лучшие. Авторы статьи доработали систему оценки так, чтобы отбирать наиболее точные когнитивные модели.
Красота этой работы в том, что и ИИ, и люди выполняли свою работу: люди использовали творческий подход к решению задачи, ИИ перебрал множество вариантов и выявил закономерности в огромных массивах данных. Подобная гармония была в работе по теории узлов 2021 года. ✨Вот так и должно быть✨
openreview.net
Discovering Symbolic Cognitive Models from Human and Animal Behavior
Symbolic models play a key role in cognitive science, expressing computationally precise hypotheses about how the brain implements a cognitive process. Identifying an appropriate model typically...
Берут плодовую мушку (видели плодовых мушек? – Они крошечные), фиксируют на одном месте и приклеивают ей голову к груди, чтобы голова не поворачивалась. И ставят её на крошечную беговую дорожку.
Крошечную.
Беговую.
Дорожку.
Это не совсем дорожка, это маленький лёгкий шарик из пены на воздушной подушке. Но он называется «air-supported spherical treadmill» – шаровидная беговая дорожка на воздушной подушке.
И потом перед ней ставят маленький экранчик, на котором показывают некий ландшафт. И мушка смотрит на экранчик, перебирает лапками, шарик вращается, его движения регистрирует чувствительный датчик, картинка на экране меняется.
Виртуальная реальность для мушек!
(Картинка сгенерирована с использованием ChatGPT и не показывает реальную конструкцию!)
Please open Telegram to view this post
VIEW IN TELEGRAM
Продолжая тему галлюцинаций: а могут ли языковые модели лгать? То есть, иметь знание о правильном ответе, но сгенерировать неправильный.
На мой скромный взгляд, сама постановка вопроса – пример очеловечивающего языка, потому что ложь – это сознательный выбор. Его не может сделать то, что не наделено сознанием.
Но мы всё-таки изучим сегодня не мой скромный взгляд, а статью «Can LLMs Lie? Investigation beyond Hallucination». Тем более, там механистические методы интерпретации – всё как мы любим.
У меня есть мысли по поводу прочитанного.
Во-первых, идея воздействовать на механизмы внимания интересная и может пригодиться для разных исследований.
Во-вторых, всё остальное в этой статье очень узко ограничено рамками конкретных экспериментов. Неясно, воспроизведётся ли результат на других моделях, на другом языке или даже с другими формулировками запросов. Это не камень в огород авторов: они честно провели свой эксперимент и описали результаты. Но из-за существенных ограничений я бы относилась к ней скептически (во всяком случае, пока).
Зачем нам было это всё читать? Мне кажется, такая статья могла бы стать громким заголовком, а нам важно помнить, что иногда за громкими заголовками стоят не очень надёжные или незавершённые работы
На мой скромный взгляд, сама постановка вопроса – пример очеловечивающего языка, потому что ложь – это сознательный выбор. Его не может сделать то, что не наделено сознанием.
Но мы всё-таки изучим сегодня не мой скромный взгляд, а статью «Can LLMs Lie? Investigation beyond Hallucination». Тем более, там механистические методы интерпретации – всё как мы любим.
У меня есть мысли по поводу прочитанного.
Во-первых, идея воздействовать на механизмы внимания интересная и может пригодиться для разных исследований.
Во-вторых, всё остальное в этой статье очень узко ограничено рамками конкретных экспериментов. Неясно, воспроизведётся ли результат на других моделях, на другом языке или даже с другими формулировками запросов. Это не камень в огород авторов: они честно провели свой эксперимент и описали результаты. Но из-за существенных ограничений я бы относилась к ней скептически (во всяком случае, пока).
Зачем нам было это всё читать? Мне кажется, такая статья могла бы стать громким заголовком, а нам важно помнить, что иногда за громкими заголовками стоят не очень надёжные или незавершённые работы
Teletype
Могут ли языковые модели лгать
Продолжая тему галлюцинаций: а могут ли языковые модели лгать? То есть, иметь знание о правильном ответе, но сгенерировать неправильный.
Весьма приличное исследование вышло про то, чьи взгляды на мир отражают языковые модели. Предлагаю его сегодня обсудить
vc.ru
На кого похожи языковые модели
Разработчики пытаются делать так, чтобы языковые модели вели себя как люди. Но люди-то все разные, так под кого они подстраиваются?
👍1
Наткнулась я тут на интересный пост про этику применительно к ИИ, и он вызвал у меня #поток_мыслей. Сейчас я запущу в вас этот поток, а вы мне скажите, что сами думаете.
Мы когда рассуждаем про этическое регулирование ИИ (и я в том числе) представляем себе некий набор правил в духе «не убивай, не кради», который позволит сделать ИИ безопасным для человека.
Из всех предложенных разными авторами наборов таких правил мне ближе всего три закона робототехники Айзека Азимова:
«Однако, – возражает автор поста, – человеческая этика развивалась не так». Этические нормы формируются на протяжении всей истории человечества, меняются и отличаются от эпохи к эпохе и от общества к обществу.
Мы и не можем толком сформулировать всеобъемлющий набор норм и правил, который бы приняли не то что все люди на Земле, но хотя бы все люди в одной комнате, если в комнате больше одного человека. Хотя, если в комнате один человек, тоже бывает всякое.
Взять то, как мы учим детей. Если вы когда-нибудь встречали детей, то знаете: им бесполезно говорить о пользе чтения книжки, если вы сами у них на глазах регулярно не читаете книжку. Мы не заучиваем свод правил жизни в обществе, а воспринимаем его интуитивно, наблюдая за тем, как ведут себя одни люди и как на это реагируют другие люди. Потом мы переезжаем в другую страну (или в другой город, а то и на соседнюю улицу), и испытываем культурный шок.
«ИИ, – продолжает автор, – тоже у нас учится на основе нашего же поведения». Языковые модели потребляют написанный человеком текст, чтобы генерировать убедительные предложения. В тексте содержится сжатое представление наших взглядов на мир, когнитивных искажений и прочих радостей бытия человеком. И дальше какие фильтры ни навешивай, на выходе всё равно получается то, что было на входе.
Во мне сейчас сражаются два волка.
Волк 1 говорит: «Я не считаю, что появление сверхИИ, или ИИ, равного человеческому, или ИИ, наделённого сознанием – вопрос ближайшего будущего. Но у того ИИ, который есть сейчас, уже существуют конкретные риски: незащищённость данных, использование в мошеннических целях, генерация ложных фактов и ещё целый длинный список. Давайте спустимся с небес на землю и займёмся реальными проблемами.»
Тут сложно спорить: проблемы есть, пострадавшие есть. Нужны конкретные инструменты, подобные тем, что мы здесь разбираем: инструменты для оценки, контент-фильтры, инструменты прозрачности и обеспечения человеческого контроля. Нужен конкретный набор правил: «Не суй пальцы в розетку. Не суй гвозди в розетку. Ничего не суй в розетку, отойди от неё вообще, тебе там что, мёдом намазано?!»
Конкретный набор правил будет полезен в конкретных ситуациях.
Волк 2 говорит: «Но в том, чтобы менять собственное поведение есть смысл. Даже если ИИ не сравняется с человеком, он будет копировать человека. Надо бы подавать хороший пример.» Комментарий на скриншоте оставили под одним из моих видео, и он мне нравится.
Я не согласна только с частью, где «ИИ должен иметь основания…»: не нужно быть идеально моральным существом, чтобы иметь право на существование. Но идея о том, что «человеческий не значит безопасный» мне близка. Мы и правда в плане безопасности пока не очень, есть куда стремиться. Мы здорово продвинулись за прошедшие сотни тысяч лет, но всё ещё периодически пытаемся самоуничтожиться, заодно стерев с лица Земли кучу других существ. Как-то надо это, собраться уже что ли. На нас же дети смотрят, все дела.
Есть ещё третий волк, который сидит в углу с попкорном. Я пока что склоняюсь на его сторону
Мы когда рассуждаем про этическое регулирование ИИ (и я в том числе) представляем себе некий набор правил в духе «не убивай, не кради», который позволит сделать ИИ безопасным для человека.
Из всех предложенных разными авторами наборов таких правил мне ближе всего три закона робототехники Айзека Азимова:
1. Робот не может причинить вред человеку или своим бездействием допустить, чтобы человеку был причинён вред.
2. Робот должен повиноваться всем приказам, которые даёт человек, кроме тех случаев, когда эти приказы противоречат Первому Закону.
3. Робот должен заботиться о своей безопасности в той мере, в которой это не противоречит Первому или Второму Законам.
«Однако, – возражает автор поста, – человеческая этика развивалась не так». Этические нормы формируются на протяжении всей истории человечества, меняются и отличаются от эпохи к эпохе и от общества к обществу.
Мы и не можем толком сформулировать всеобъемлющий набор норм и правил, который бы приняли не то что все люди на Земле, но хотя бы все люди в одной комнате, если в комнате больше одного человека. Хотя, если в комнате один человек, тоже бывает всякое.
Взять то, как мы учим детей. Если вы когда-нибудь встречали детей, то знаете: им бесполезно говорить о пользе чтения книжки, если вы сами у них на глазах регулярно не читаете книжку. Мы не заучиваем свод правил жизни в обществе, а воспринимаем его интуитивно, наблюдая за тем, как ведут себя одни люди и как на это реагируют другие люди. Потом мы переезжаем в другую страну (или в другой город, а то и на соседнюю улицу), и испытываем культурный шок.
«ИИ, – продолжает автор, – тоже у нас учится на основе нашего же поведения». Языковые модели потребляют написанный человеком текст, чтобы генерировать убедительные предложения. В тексте содержится сжатое представление наших взглядов на мир, когнитивных искажений и прочих радостей бытия человеком. И дальше какие фильтры ни навешивай, на выходе всё равно получается то, что было на входе.
Во мне сейчас сражаются два волка.
Волк 1 говорит: «Я не считаю, что появление сверхИИ, или ИИ, равного человеческому, или ИИ, наделённого сознанием – вопрос ближайшего будущего. Но у того ИИ, который есть сейчас, уже существуют конкретные риски: незащищённость данных, использование в мошеннических целях, генерация ложных фактов и ещё целый длинный список. Давайте спустимся с небес на землю и займёмся реальными проблемами.»
Тут сложно спорить: проблемы есть, пострадавшие есть. Нужны конкретные инструменты, подобные тем, что мы здесь разбираем: инструменты для оценки, контент-фильтры, инструменты прозрачности и обеспечения человеческого контроля. Нужен конкретный набор правил: «Не суй пальцы в розетку. Не суй гвозди в розетку. Ничего не суй в розетку, отойди от неё вообще, тебе там что, мёдом намазано?!»
Конкретный набор правил будет полезен в конкретных ситуациях.
Волк 2 говорит: «Но в том, чтобы менять собственное поведение есть смысл. Даже если ИИ не сравняется с человеком, он будет копировать человека. Надо бы подавать хороший пример.» Комментарий на скриншоте оставили под одним из моих видео, и он мне нравится.
Я не согласна только с частью, где «ИИ должен иметь основания…»: не нужно быть идеально моральным существом, чтобы иметь право на существование. Но идея о том, что «человеческий не значит безопасный» мне близка. Мы и правда в плане безопасности пока не очень, есть куда стремиться. Мы здорово продвинулись за прошедшие сотни тысяч лет, но всё ещё периодически пытаемся самоуничтожиться, заодно стерев с лица Земли кучу других существ. Как-то надо это, собраться уже что ли. На нас же дети смотрят, все дела.
Есть ещё третий волк, который сидит в углу с попкорном. Я пока что склоняюсь на его сторону
Под предыдущий пост пришли ещё волки и подняли интересные вопросы. Спасибо вам, я сижу обо всём думаю
А пока подкину на обсуждение ещё одну интересную публикацию, на этот раз про ИИ и законы. Она весьма объёмная, так что я здесь представлю только краткую выжимку того, что зацепило моё внимание
А пока подкину на обсуждение ещё одну интересную публикацию, на этот раз про ИИ и законы. Она весьма объёмная, так что я здесь представлю только краткую выжимку того, что зацепило моё внимание
Teletype
Как заставить ИИ соблюдать закон
Авторы статьи «Law-Following AI: Designing AI Agents to Obey Human Laws» определяют ИИ-агентов как
👍3