Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
Про социальные последствия.

Из нескольких источников вылезла рекомендация посмотреть новую документалку The Social Dilemma (2020).
В ней бывшие сотрудники популярных соцсетей, ученые и мыслители рассказывают, как работает экономика внимания (когда внимание стало товаром, то кто его покупает и как все устроено). Мне эта тема особенно интересна в контексте этики работы с данными. Кто ответственен за последствия и кто должен это остановить? Технологические гиганты (которые справедливо делают деньги)? Этичны ли их действия, которые ведут к таким последствиям, сейчас? Государство (которое устанавливает приоритет гуманистического над коммерчески-выгодным)? Сами люди (которым нужно быть осознаннее в уже изменившемся мире)? В общем, посмотрите.
Про анонимность.

Одно из ключевых направлений дата-этики - анонимность. Иногда сразу понятно, когда анонимность нарушается. Но бывают ситуации, когда стоит все хорошо обдумать, потому что нарушение анонимности сначала не очевидно. На эту тему есть отличный кейс 2009 года от Netflix. Netflix проводил очередной конкурс на лучший алгоритм пользовательских предпочтений. Для его проведения выкладывался набор данных, состоящий всего из нескольких полей: внутренний идентификатор пользователя, дата, название фильма и рейтинг. Netflix считал, что это полностью обезличенная информация, и предложил миллион долларов любому, кто мог бы улучшить систему рекомендаций фильмов более чем на 10%. Но что произошло? Оказалось, что многие пользователи оценивали фильмы не только на Netflix, но и на IMDb. И публиковали свои обзоры почти одновременно. Некоторым исследователям удалось связать пользователей между двумя наборами данных: сведениями от IMDb, где пользователи были идентифицированы, и писали о фильмах, которые они смотрели, и сведениями от Netflix, из которых можно было узнать, какие фильмы пользователь смотрел в принципе. А теперь подумаем, всегда ли вы хотите рассказать общественности, какие фильмы вы смотрели? Например, вы публикуете отзывы только о блокбастерах, а еще смотрите, например, гей-фильмы. И вы не хотели бы, чтобы эта информация была раскрыта. Собственно это и произошло - общественности стали известны сексуальные предпочтения некоторых пользователей, которые они не афишировали. Дело кончилось скандалом, судебным разбирательством, 9-млн. выплатой и закрытием конкурса. Вот казалось бы, всего лишь рекомендации к фильмам. Но с анализом данных в наши дни нужно быть предельно аккуратными.

#кейсдатаэтики
Про этичность распространения данных.

Сегодня общественность взбудоражила новость о том, что недавно ребрендированный Сбер хочет продавать аналитику своих данных, предварительно связав данные о транзакциях с данными о местоположении. Почему же эта новость вызывает столько эмоций? На самом деле, это отличный кейс по этике управления данными.
Считаем ли мы этичным сбор таких данных (первый этап) и их обработку (второй этап)? Конечно. Мы подписываем соглашения со Сбербанком, сбор и обработка этих данных нужна в интересах наших операций и нашей безопасности.
Считаем ли мы этичным использование этих данных в других целях (все еще второй этап)? Скорее - да. Мы понимаем, что сам Сбер использует эти данные для формирования предложений по кредиту, например, и иных задач по развитию своего бизнеса.
Считаем ли мы этичным распространение этих данных (третий этап)? А вот тут скорее - нет. Мы точно на это не подписывались. Плюс, дополнительно смущает, что речь идет не только об аналитике финансовых данных - что может еще как-то и вписалось бы в наше представление об этичности распространения - а о данных по местоположению, которые не входят в состав основных собираемых данных. То, что такие данные собираются, - понятно, но не сразу очевидно. Именно на этом моменте возникают сложности с дата-этикой. Именно тут нужно Сберу формировать новую информационную повестку.

#кейсдатаэтики
Про социальные последствия.

Сейчас, когда самый горячий период в выборах президента США закончен, хочется вспомнить про скандал, связанный с прошлыми выборами и не только - а именно про действия компании Cambridge Analytica.

Этот кейс - один из самых ярких на сегодня - о том, насколько этично распространять данные (для Facebook) и какие моральные проблемы могут возникнуть при их использовании (для CА). Если кратко, то СА собирала данные пользователей Facebook, на их основе и с помощью разработанной бихевиористкой модели подсовывала пользователям политическую рекламу. В 2016 году ее услугами пользовался штаб Трампа. Специалисты CA предположительно оказали влияние на итоги голосования по выходу Великобритании из Европейского союза (Brexit), на выборы президента Кении Ухуру Кениата и еще в более 40 политических кампаниях. Несколько сотрудников СА осознали неэтичность этого бизнеса и помогли Правительствам США и Великобритании найти истину. Тут снова дам ссылку на фильм Netflix, хотя в интернете можно найти много статей на эту тему.

Так вот, в контексте данного эпизода хотелось бы поднять тему этического кодекса дата-аналитика. Мне кажется, что это один из самых необходимых инструментов на сегодня, чтобы уменьшить вред, наносимый неуместной публикацией результатов аналитики. Кодекс дата-аналитика (как клятва Гиппократа) поможет профессионалам области осознавать, что у их действий могут быть последствия, и нести за них ответственность.

#кейсдатаэтики #переходкэтичному
Про российскую практику.

В России только начинает набирать тренд этического подхода к работе с данными. В этом направлении уже сделаны первые очень важные шаги. Например, Ассоциация больших данных (АБД) сформулировала кодекс этики больших данных. Несмотря на то, что основной задачей Кодекса является "повышение прозрачности деятельности участников рынка данных для уполномоченных органов государственной власти", в нем, на мой взгляд, изложены очень важные принципы сбора, обработки и распространения данных. Процитирую несколько.

1. "При обработке данных не допускается умышленная дискриминация граждан на основании расовой, национальной, языковой принадлежности, политических взглядов, религиозных или философских убеждений, сведений об интимной жизни. В случае обнаружения признаков дискриминации в работе алгоритма участник Кодекса принимает все разумные меры для его изменения или прекращения применения такого алгоритма" - очень важные обе мысли этого принципа. Если по результатам анализа возникла ситуация дискриминации (как в известном кейсе от Google, когда распознавание лиц имело дискриминационный характер - а именно лица афроамериканцев распознавались алгоритмом как животные) то алгоритм необходимо менять.

2. "Участники Кодекса приложат все возможные усилия к тому, чтобы при обработке данных для целей аналитики не будет нанесен вред или ущерб пользователям, чьи данные были использованы в аналитических продуктах" - очень важный принцип для исключения ситуаций, как в кейсе с Netflix и алгоритмом пользовательских предпочтений, о котором я рассказывала ранее.

3. "Сам по себе факт, что некоторые данные являются открытыми, не означает, что их использование не ограничено" - тоже ключевой принцип этики использования данных. Что будет, если ваши данные слили в сеть. Имеет ли право какая-либо организация их использовать. Например, банк, который присоединился к Кодексу, не будет использовать выложенные в Интернет данные о вашей личной жизни для решения вопроса о предоставлении кредита.

Я еще буду возвращаться к кодексу, чтобы показывать на практических примерах, как важно соблюдение изложенных в нем принципов.

#переходкэтичному #почитатьнатему
Про российскую практику.

Кроме активного перехода к этичной работе с данными очень важно заниматься популяризацией этой темы. На этом фронте также в российской практике начали появляться хорошие примеры. Вот аналитический доклад об этических проблемах цифровых технологий, подготовленный Центром подготовки руководителей цифровой трансформации. Конечно, это только первые шаги в этом направлении, но очень хорошо, что вопрос этики работы с данными начал привлекать столько внимания.

#почитатьнатему
Про социальные последствия.

Один из этических вопросов, который возникает при анализе данных, звучит следующим образом "Что делать, если алгоритм правильный, но выдает нечестные результаты (неспециальная дискриминация)?". Тут становится важным не только исправление алгоритма, но и скорость его исправления.

Вот свежий пример из Великобритании. Темнокожий парень не может подать фото на паспорт, потому что система некорректно распознает его губы и волосы. Оказалось, что проблема возникла не только на этапе разработки (программу пофиксили год назад), но и на этапе внедрения изменений (британские бюрократы не могут накатить апдейт).

Казалось бы, историю про то, как распознавание лиц имело дискриминационный характер, весь мир вместе с Google проходил еще в 2015 году, но нет. Одного кейса оказалось недостаточно.

И еще важно подчеркнуть следующее - вопросы этичной практики сбора, обработки и распространения данных могут вас коснуться даже есть вы не работаете с данными напрямую.

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про переход к этичной практике работы с данными.

Помимо описания большого количества проблем, связанных с отсутствием этики сбора, обработки или распространения данных, хочется подумать и на тему перехода к этичной практике.

Одним из способов решения этой задачи является изменение подходов к найму сотрудников (к другим способам вернусь позже). Сейчас получила распространение практика найма ответственных за вопросы этики в сфере данных и ИИ. Вот примеры релевантных позиций в крупных компаниях:

▫️AI ethicist (IBM)
▫️Chief Ethical and Humane Use Officer (Salesforce)
▫️Data Privacy and Ethics Lead (Qantas)
▫️Ethical AI Lead (Google)
▫️Chief AI Ethics Officer (US Army Artificial Intelligence Task Force)
▫️Activation Lead/Ethics & Society (Microsoft)
▫️Director of Responsible Innovation & Responsible Innovation Manager (Facebook)
▫️Social Trust Specialist (Apple)
▫️Responsible AI Specialist (H&M Group)
▫️Principal, Responsible Innovation + Data Ethics (Accenture)

Мне кажется, что это временное решение (хотя нет ничего более постоянного, как говорится). Вообще при найме компании уже задумываются о том, чтобы не просто нанимать следящего за этичностью, а сразу нанимать сотрудников - дата-саентистов, которые отвечают заданным требованиям. Gartner даже выпустил небольшой Data Ethics Interview Guide для этих целей.

#переходкэтичному
Про этичность сбора данных.

Вот ещё кейс из США. McDonald’s тестирует в 10 ресторанах в Чикаго голосового чатбота, который принимает заказы посетителей на McDrive. Точность распознавания слов — 85%, что позволяет программе принимать 80% всех заказов (остальные 20% обрабатывают живые сотрудники).

Оказалось, что такое использование голосовых записей нарушает законы штата Иллинойс — там биометрические данные граждан можно собирать только с их письменного разрешения, да и вообще законодательство штата насчет приватности данных одно из самых строгих в США. Против компании подан коллективный иск по поводу незаконного сбора и анализа биометрических данных. По законам штата, пострадавшие могут рассчитывать на компенсацию до $5000. Более того, согласно тексту иска, алгоритмы машинного обучения McDonald’s не только транскрибируют текст заказа, но и анализируют записи для определения возраста, пола, акцента и национальности клиента.

Тут сразу два момента. Первое - это вроде бы этичный сбор данных, однако нарушающий законодательство. Такой сбор данных направлен на улучшение сервиса и многие потребители согласятся с тем, что сервис всегда нужно улучшать. Но когда речь заходит про персональные данные, этическое поведение может перекрыться законодательными нормами.

А второй момент - это как раз не совсем этичное поведение в следующей части. Многие компании и госорганы зачастую собирают излишние данные - на всякий случай. В данном кейсе компания - не исключение. Стоит ли собирать излишние данные, а пользоваться ими в случае необходимости? Где проходит граница этичности такого поведения?

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)