Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
Forwarded from addmeto (Grigory Bakunov)
Иногда нейросети приносят нам такие шутки, что грех не поделиться, хотя шутка на грани, конечно. Помните в далеком 2015, когда в Google Photos появилась функция распознавания объектов на фото, был большой скандал — двух афроамериканцев распознало как горилл? Так вот, с тех пор и до сегодняшнего дня ни одна из подобных публичных систем (а это Эппл, Гугл, Амазон и даже Майкрософт) не умеют распознавать и показывать такой обьект как “горилла”. Поиск пустой, объекты не размечаются. Это оказалось самым простым способом починить проблему.

Если это не доказательство происхождения человека от обезьяны — я не знаю какое вам еще надо!

https://www.nytimes.com/2023/05/22/technology/ai-photo-labels-google-apple.html
🔥2😁1
Про маркировку ИИ-сгенерированных изображений.

Я уже как-то задавалась вопросом о том, как отмечать контент, созданный с помощью искусственного интеллекта. Но сегодня я хочу обратить внимание на другую интересную сторону этого вопроса - обработку изображений.

22 мая фейковое фото взрыва в Пентагоне вызвало настоящий шквал эмоций в интернете. Всего за несколько минут после публикации, это фото, которое выглядело очень реалистично, быстро разлетелось по Твиттеру и другим социальным сетям, после того, как его ретвитнули некоторые популярные аккаунты. Несмотря на то, что вскоре стало ясно, что фото является фейком, вероятно, созданным искусственным интеллектом, оно успело оказать реальное влияние и даже повлияло на финансовые рынки.

Однако, технологические гиганты уже принимают конкретные меры, чтобы предотвратить подобные ситуации и сделать контент более безопасным. Вот некоторые из этих превентивных мер:
1️⃣ Adobe разработала инструменты для добавления маркировки к ИИ-сгенерированным изображениям в форме лейбла.
2️⃣ Генерируемые искусственным интеллектом изображения теперь содержат дополнительную информацию в метаданных по умолчанию.
3️⃣ Google разрабатывает фильтр в поисковой системе, который позволит нам искать именно маркированные ИИ-сгенерированные изображения.
4️⃣ Создана коалиция компаний под названием C2PA (Coalition for Content Provenance and Authenticity), которая работает над разработкой технических стандартов для сертификации источника и истории медиаконтента.

Кроме того, технологические компании активно работают над разработкой методов определения ИИ-сгенерированных изображений уже после их создания.

Классно, что компании берут на себя ответственность и делают шаги к созданию более этичных продуктов - начинают с себя.

#кейсдатаэтики #переходкэтичному
#короткиезаметки

Вот отличный кейс, как внедрение ИИ может повлиять на рабочие места и бизнес.

Икеа внедрила ИИ-решение для автоматизации кол-центра. А освободившихся сотрудников кол-центра теперь переучивает в консультантов по дизайну интерьеров, одновременно расширяя это направление бизнеса.

Компании смогут этично автоматизировать работу и одновременно повысить квалификацию сотрудников, если захотят.
👏2👍1
#короткиезаметки

Вот еще один пример адекватного отношение к новым технологиям.

The Recording Academy (организатор премии Grammy) разработала новые правила, которые учитывают использование ИИ-инструментов в творчестве. Общий смысл такой: пользоваться можно, но вклад человека должен быть значительным, и в дальнейшем мы снова будем пересматривать этот момент.
👍3
Про науку, дата-брокеров и нарушение приватности

Еще одним источником утечки конфиденциальной информации могут стать, внезапно, исследования. Зачастую использование данных для коммерческих целей ограничено, однако для исследовательских целей оно более свободно.
И здесь на сцену выходят дата-брокеры – они специализируются на сборе и продаже данных и активно используют эти возможности, что, к сожалению, может приводить к серьезным нарушениям конфиденциальности.

Когда исследователи и ученые получают данные от дата-брокеров для своих проектов, очень важно задуматься о том, откуда эти данные поступают и нарушается ли конфиденциальность людей, чьи данные используются. Хотя есть некоторые методы, которые помогают сохранять конфиденциальность при объединении данных о местоположении, учитывая их размер и тип, но никакие протоколы агрегации не могут оправдать сбор данных о местонахождении людей без их явного согласия.

Более того, данные, предоставляемые дата-брокерами, могут быть легко связаны с другими наборами данных. Например, исследования объединяют данные о местоположении от дата-брокеров с данными переписи населения, информацией о трафике в реальном времени от Google Maps, результатами опросов домохозяйств и другими источниками информации. Хотя исследователи стремятся создать надежные и полные наборы данных, такое объединение может стать первым шагом к повторной идентификации данных и нарушению конфиденциальности.

Еще одна интересная деталь – брокеры данных часто скрывают свои методы ведения бизнеса и структуру своих хранилищ данных от общественного контроля. Это вообще "красный флаг" для регулирующих органов. Контролирующие органы должны быть в курсе того, каким образом дата-брокеры и их партнеры получают согласие от пользователей на использование их данных. Также сами ученые должны быть заинтересованы в подтверждении целостности и происхождения данных, которые они используют в своей работе.

В итоге, эта область, где тоже необходимо особое отношение, как в части регулирования деятельности дата-брокеров, так и в части передачи им данных и использованиях полученных от них данных.

#кейсдатаэтики #переходкэтичному
👍2
Про возможные риски генеративного ИИ.

Кое-что интересное на неделе вышло от Норвежского совета потребителей, Forbrukerrådet. Они опубликовали новый отчет и провели вебинар о влиянии генеративного искусственного интеллекта (ИИ) на нас, потребителей.

Отчет называется «Ghost in the machine – Addressing the consumer harms of generative AI», и он отлично раскрывает вопросы, с которыми мы сталкиваемся из-за генеративного ИИ: манипуляции, предвзятость, дискриминация, проблемы конфиденциальности и защиты данных, уязвимость систем безопасности, мошенничество, интеллектуальная собственность, воздействие на окружающую среду... и т.д.

В отчете приводятся и конкретные кейсы, например, про генератор изображений Stable Diffusion. Он обучается в том числе на датасете от немецкой некоммерческой организации LAION, содержащих только URL-адреса, ведущие к изображениям в интернете. Многие высказывают претензии к LAION по поводу недостаточно ответственного отношения к датасету. Претензии касаются не только исключения вредоносных или потенциально незаконных материалов, но и внезапно всплывшей ситуации, когда в датасете нашли ссылки на конфиденциальную медицинскую информацию.

Отчет также освещает регулирование в этой области: от закона о защите данных до закона о конкуренции и Закона об ИИ. В общем, стоит внимательно прочитать. Мне кажется, что в отчете просто и понятно собраны все риски, о которых так много мы сейчас говорим в контексте генеративного ИИ.

#почитатьнатему #кейсдатаэтики
🤔1
#короткиезаметки

(внезапно) Согласно указу Папы Римского Ватикан выпустил руководство по этике ИИ. Руководство "Ethics in the Age of Disruptive Technologies: An Operational Roadmap" разработано организацией ITEC (которая создана Ватиканом совместно с Университетом Санта-Клары). Оно помогает технологической отрасли разобраться с этическими вопросами, связанными с искусственным интеллектом, машинным обучением, шифрованием и другими технологиями.
🔥3
Про политики конфиденциальности (Privacy Policy).

Вот о чем я часто думаю. Политика конфиденциальности – важная штука, и ее значимость только растет. Я сама иногда пишу такие документы, и понимаю, насколько сложно учесть все аспекты. Ведь в них отражается не только юридическая сторона компании, но и ее этическая позиция. Мы стараемся найти баланс между бизнес-интересами и желанием быть честными и уважительными к нашим пользователям.

Проблема в том, что политику конфиденциальности мало кто читает внимательно. Но каждая строчка там имеет значение. Ведь она определяет, как мы используем данные, как защищаем их и что делаем с "общедоступной информацией". И вот недавно, например, Google обновил свою политику конфиденциальности. Теперь они прямо указали, что используют общедоступную информацию для обучения своих моделей искусственного интеллекта, включая переводчик и Бард.

Интересно, как пользователи отреагировали на это, последуют ли суды? Понятно, что речь опять о нецелевом использовании данных, т.е. люди предоставляли эти данные не для того, чтобы на них обучались модели. Но, скорее всего, дальше будет только больше. Думаю, такое использование данных станет этичной практикой в скором времени. И тут снова вернемся к политикам конфиденциальности.

Как все предусмотреть? Как помочь пользователю внимательно их читать? Как научить доверять и проверять? Я думаю, что пришло время переосмысления этого документа и уточнения требований к формату. Тут хорошо бы и кнопки добавить для управления своими данными, и повышать осознанность, объясняя для чего это все. Очень хочется поглубже позаниматься темой и может сформировать какие-то предложения.

#переходкэтичному #кейсдатаэтики
👍2
#короткиезаметки

А вот и ситуация наоборот. С фотоконкурса в Австралии сняли настоящее фото, т.к. его приняли за работу нейросети. Женщина сфотографировала сына с двумя манекенами, а судьи решили, что это плохо сгенерированные люди, и дисквалифицировали снимок.
#короткиезаметки

Более 1000 писателей подписали письмо о требованиях оплаты их контента, используемого для обучения ИИ, тем самым присоединившись к аналогичным требованиям Reddit и Twitter

Сейчас массово вижу две волны от разных создателей контента: платите за обучение ИИ как использование, и ограничьте использование, чтобы мы не потеряли работы. Думаю, у первого требования есть все шансы быть выполненным, а у второго наоборот. Но посмотрим.
Про внедрение этических практик.

Прочла тут отличную статью о том, как на практике можно внедрить этические принципы в разработку программного обеспечения, особенно ИИ. Меня всегда интересовал вопрос практических инструментов для внедрения этики, а здесь дают несколько прикладных решений.

Авторы статьи рассуждают о двух этических принципах: прозрачности (transparency) и справедливости (fairness).

1. Прозрачность. Как оказалось, часто компании неправильно понимают, что означает этот принцип. Прозрачность не обязательно связана с разглашением коммерческой тайны или публикацией исходного кода. Она помогает лучше понять, как работают алгоритмы, и создать доверие к продукту, не раскрывая конфиденциальные данные. Интересно, как именно описать и раскрыть информацию о системах ИИ? Авторы рекомендуют составить документацию, которая содержит технические аспекты (архитектуру, выбор данных, методы моделирования) и нетехнические компоненты (цели использования продукта, экономическое обоснование и т.д.). Кстати, существуют уже стандарты документации ИИ, которые предлагают шаблоны для удобного описания систем. И отдельно тут нужно подчеркнуть, что мало просто описать, нужно описать понятно. И для того, чтобы описывать понятно, научным сообществом тоже придуманы лайфхаки.

2. Справедливость. Он гарантирует отсутствие предвзятости при принятии решений алгоритмами. Авторы статьи предлагают несколько критериев для достижения справедливости:
✔️ Статистический паритет. Этот критерий позволяет определить, является ли модель справедливой по отношению к защищенным атрибутам, измеряя разницу между благоприятными результатами для большинства и защищенных классов. Значение 0 означает полную справедливость модели.
✔️ Несоизмеримое влияние. Этот критерий сравнивает процент благоприятных исходов для разных групп, что позволяет определить, есть ли предвзятость в принятии решений. Например, если модель выдает кредиты 60% людям среднего возраста и только 50% остальным, то несоизмеримое влияние составляет 0,8, что указывает на положительный уклон в сторону группы среднего возраста.
✔️ Равенство шансов. Этот критерий измеряет баланс между истинно положительными и ложноположительными результатами для защищенных и незащищенных групп, позволяя выяснить, одинаково ли работает модель для этих групп.
✔️ Определение справедливости. Компании, разрабатывающие или использующие системы ИИ, должны определить, что они понимают под понятием справедливости и как они планируют достичь этого.
✔️ Разнообразие в командах. Обеспечение широкого представительства в продуктовых командах помогает достичь справедливости через разнообразие мышления и опыта.
✔️ Образование и самоанализ. Чем лучше образованы специалисты в области данных и чем более критически они относятся к вопросу предвзятости, тем больше вероятность того, что они заранее распознают риски, связанные с справедливостью.
✔️ Учет мнения конечных пользователей. Консультации с представителями конечных пользователей, т.е. с профессионалами в соц.-эк. области, являются ключевым элементом обеспечения справедливости проекта.
✔️ Этические советы по ИИ. Советы, отделенные от команд разработки позволяют внести дополнительный вклад в этичность проекта.

Особенно радостно, что решения довольно простые и понятные. А если еще учесть то обстоятельство, что требования к прозрачности и справедливости алгоритмов ИИ сейчас пытаются вписать в законодательство, то особенно хорошо начать чуть раньше, чем заставят.

#переходкэтичному
Zoom тоже меняет свои Terms of Service, чтобы на данных пользователей можно было обучать ИИ. Как вы к относитесь к тому, что популярные сервисы теперь хотят обучать свои разработки в сфере ИИ на ваших данных?
Anonymous Poll
54%
Ничего не имею против. Как же еще качественно обучить ИИ?
46%
Я против. Это мои персональные данные и частная жизнь.
👍1
#короткиезаметки

В журнале Rolling Stone в разделе (sub)culture вышла статья о пяти известных женщинах в сфере ИИ и их опасениях о последствиях развития ИИ. Среди них, например, профессор Тимнит Гебру, известная скандальным увольнением из Google. Принципиально новых идей там нет, но в статье классно описывается история их опасений. Да и сам факт того, в каком журнале эта статья, прекрасен. Я тоже очень хочу, чтобы дискурс об этике данных и ИИ стал более широким.
👍1
Про интеллектуальные права.

Прочитала классную статью-размышление о том, что будет с интеллектуальными правами в контексте развития генеративного ИИ и больших лингвистических моделей.

Я уже задавалась вопросами, как учитывать права источника. Но не менее интересно, как присваивать права сгенерированному контенту. Вот пара гипотетических ситуаций из статьи для размышления.

Если попросить Midjourney создать изображение в стиле определенного художника, для некоторых это будет воровством. Но специалисты из Christie’s или Sotheby’s, или же люди, посещающие галереи в Манхэттене или Мэйфэер, скорее всего, не согласятся с таким утверждением. Создав что-то "в стиле" Синди Шерман, вы же её не крадете. Не все будут видеть ваше творение как замену её работам. На самом деле, как-то же мы пришли к согласию о семплировании в хип-хопе?

Или такая ситуация. Большинство понимает, что если кто-то делится ссылкой на новостную статью в Facebook и просит друзей её прочитать, новостному сайт не следует требовать за это оплату. Если же этот кто-то попросит ChatGPT прочитать десять новостных сайтов и дать резюме или объяснить главное событие дня, претензии сайтов становятся более обоснованными: технологическая компания действительно "использует новости". Неудивительно, что когда ChatGPT анонсировал собственный веб-сканер, новостные сайты начали блокировать его. Но этот пример интересен тем, что новостные сайты вышли на тропу этой войны еще несколько лет назад, когда попросили соц.сети платить за новостные заголовки, т.к большинству пользователей этого достаточно и читать саму новость они на новостной сайт уже не идут. Т.е и тут разобрались.

Да, впереди очередная юридическая тряска в сфере интеллектуальных прав. Будет много судов и законодательных изменений. Но мы уже лет двести проходим через такие тряски, и после появления фотоаппарата, и после появления граммофонных пластинок, и еще кучи других технологических прелестей. Так что утрясается все :)

#почитатьнатему #кейсдатаэтики
👍4
Про использование ИИ в работе.

Пока я тут немного привыкала к новой обстановке и не писала сюда, забастовка сценаристов закончилась. Напомню, они протестовали против использования ИИ для написания сценариев в течение пяти месяцев. Им удалось договориться на весьма выгодные условия:

- ИИ не может быть использован для написания или переработки сценариев.
- Сгенерированный ИИ текст не может рассматриваться как источник.
- Если сценарист захочет, он может использовать ИИ-инструменты, однако студии не могут его заставить это делать.
- Студии должны уведомлять сценаристов, если они будут должны использовать ИИ-сгенерированные тексты.
- Ну и пока тексты сценаристов не могут быть использованы для обучения ИИ.

Интересно, станет ли это прецедентом?

#кейсдатаэтики
#короткиезаметки

Исландцы, как и многие малочисленные нации, переживают за сохранение собственного языка в условиях глобализации. И вот они запартнерились с OpenIA и выделили ресурс, чтобы обучить модель правильно говорить по-исландски. Дело, конечно, идет со скрипом, но идет. Сейчас chatGPT может, например, написать стихотворение о капризах современной жизни в стиле Völuspá, древней исландской поэмы из «Поэтической Эдды» скандинавской мифологии.
👍5
Про внедрение этических принципов.

Мы всё думаем о том, чтобы сделать небольшой практичный гайд по дата-этике для компаний. Вот с чего можно начать, например? Если возвращаться к основам, то можно обратиться к пяти принципам дата-этики от Гарвардской бизнес школы:

1. Владение данными (Ownership)
Спрашивайте владельца данных о возможности собирать и использовать его данные/данные о нем.

2. Прозрачность (Transparency)
Рассказывайте, как и зачем вы собираете, храните и используете данные.

3. Конфиденциальность (Privacy)
Даже если вам разрешили собирать перс.данные, это не значит, что их можно опубличить. Делайте все, чтобы защитить данные.

4. Намерения (Intention)
Убедитесь, что ваши намерения работы с данными - ради блага. (Этот пункт, думаю, как раз об этике в целом, а не только о дата-этике)

5. Последствия (Outcomes)
Даже если вы работаете с данными ради блага, это не значит, что последствия ваших решений будут положительными. Думайте о том, как результат вашей работы может отразится на отдельном человеке и на обществе в целом.

#переходкэтичному
👍3
#короткиезаметки

В ФБ небольшой скандал. В галерее Гельмана открылась выставка Владимира Сорокина «Голубое сало». Там иллюстрации, созданные ИИ. Сорокин был автором идей. Но вот промт-инженером был другой человек - Евгений Никитин. И его имя нигде не упомянуто. Он возмущен, потому что считает себя со-автором. Если отвечать на вопрос «Кто является автором?», то какой был бы с вашей точки зрения ответ? Вот навскидку:
- ИИ
- промт-инженер
- автор идеи
- авторы, на основе которых тренировался ИИ
Может кто-то еще? Или кто-то лишний?
Про этичность VR-очков и рост неравенства.

Интересное наблюдение о том, что в отрасли VR тоже возникают свои этические проблемы, хоть и не такого размаха, как в отрасли ИИ. Интересно, со временем мы наверное тоже придем к каким-то этичным решениям, которые закрепятся в этикете, как снять перчатку при рукопожатии или наушники при встрече.

#кейсцифровойэтики
⬇️⬇️⬇️
Forwarded from TechSparks
Как только появляется очередная технологическая новинка, возникает масса предположений о ее воздействии на людей по отдельности и общество в целом. В случае с ИИ недостатка в в самых экзотических и панических гипотезах нет, а вот вокруг технологий смешанной реальности оригинальных причин для тревог я давно не видел. Пока не прочитал эту статью, где рассматривается неожиданное на первый взгляд преимущество, которое получают люди, которые в процессе общения носят очки дополненной реальности.
В таких очках можно реализовать привычную по соцсеточкам функцию фильтров, накладываемых на реальное изображение; в данном случае — на лицо собеседника (без его ведома).
Вот, предположим, фильтр добавит вашему собеседнику видимые только вам кошачьи ушки и усы — что изменится?
И дотошные социологи поставили такой эксперимент. Оказалось, эффект присутствует: добавление шуточных фильтров снижает тревогу при общении с незнакомцами, и вообще действует расслабляющее. Но все не так просто — те, кто без очков, начинают как раз дополнительно тревожиться, не зная, в каком обличии их сейчас наблюдает собеседник (а вдруг вообще голыми??).
В итоге, утверждают исследователи, люди без очков оказываются в уязвимом положении, и технология опять дает преимущества пользователям перед непользователями, усиливая неравенство.
Кажется, после недавнего анонса Цукербергу и от этого придется отбиваться:)
https://spectrum.ieee.org/ar-glasses
👍1
#короткиезаметки

Скарлетт Йохансон подала в суд на разработчиков ИИ-приложения, которое использовало ее внешность в рекламных целях без ее разрешения. Начинают копится преценденты и скоро появится юридическая практика. Конечно, тут вопрос не в том, кто прав, а сколько это будет стоить.