Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
Про социальные последствия.

Из нескольких источников вылезла рекомендация посмотреть новую документалку The Social Dilemma (2020).
В ней бывшие сотрудники популярных соцсетей, ученые и мыслители рассказывают, как работает экономика внимания (когда внимание стало товаром, то кто его покупает и как все устроено). Мне эта тема особенно интересна в контексте этики работы с данными. Кто ответственен за последствия и кто должен это остановить? Технологические гиганты (которые справедливо делают деньги)? Этичны ли их действия, которые ведут к таким последствиям, сейчас? Государство (которое устанавливает приоритет гуманистического над коммерчески-выгодным)? Сами люди (которым нужно быть осознаннее в уже изменившемся мире)? В общем, посмотрите.
Про анонимность.

Одно из ключевых направлений дата-этики - анонимность. Иногда сразу понятно, когда анонимность нарушается. Но бывают ситуации, когда стоит все хорошо обдумать, потому что нарушение анонимности сначала не очевидно. На эту тему есть отличный кейс 2009 года от Netflix. Netflix проводил очередной конкурс на лучший алгоритм пользовательских предпочтений. Для его проведения выкладывался набор данных, состоящий всего из нескольких полей: внутренний идентификатор пользователя, дата, название фильма и рейтинг. Netflix считал, что это полностью обезличенная информация, и предложил миллион долларов любому, кто мог бы улучшить систему рекомендаций фильмов более чем на 10%. Но что произошло? Оказалось, что многие пользователи оценивали фильмы не только на Netflix, но и на IMDb. И публиковали свои обзоры почти одновременно. Некоторым исследователям удалось связать пользователей между двумя наборами данных: сведениями от IMDb, где пользователи были идентифицированы, и писали о фильмах, которые они смотрели, и сведениями от Netflix, из которых можно было узнать, какие фильмы пользователь смотрел в принципе. А теперь подумаем, всегда ли вы хотите рассказать общественности, какие фильмы вы смотрели? Например, вы публикуете отзывы только о блокбастерах, а еще смотрите, например, гей-фильмы. И вы не хотели бы, чтобы эта информация была раскрыта. Собственно это и произошло - общественности стали известны сексуальные предпочтения некоторых пользователей, которые они не афишировали. Дело кончилось скандалом, судебным разбирательством, 9-млн. выплатой и закрытием конкурса. Вот казалось бы, всего лишь рекомендации к фильмам. Но с анализом данных в наши дни нужно быть предельно аккуратными.

#кейсдатаэтики
Про этичность распространения данных.

Сегодня общественность взбудоражила новость о том, что недавно ребрендированный Сбер хочет продавать аналитику своих данных, предварительно связав данные о транзакциях с данными о местоположении. Почему же эта новость вызывает столько эмоций? На самом деле, это отличный кейс по этике управления данными.
Считаем ли мы этичным сбор таких данных (первый этап) и их обработку (второй этап)? Конечно. Мы подписываем соглашения со Сбербанком, сбор и обработка этих данных нужна в интересах наших операций и нашей безопасности.
Считаем ли мы этичным использование этих данных в других целях (все еще второй этап)? Скорее - да. Мы понимаем, что сам Сбер использует эти данные для формирования предложений по кредиту, например, и иных задач по развитию своего бизнеса.
Считаем ли мы этичным распространение этих данных (третий этап)? А вот тут скорее - нет. Мы точно на это не подписывались. Плюс, дополнительно смущает, что речь идет не только об аналитике финансовых данных - что может еще как-то и вписалось бы в наше представление об этичности распространения - а о данных по местоположению, которые не входят в состав основных собираемых данных. То, что такие данные собираются, - понятно, но не сразу очевидно. Именно на этом моменте возникают сложности с дата-этикой. Именно тут нужно Сберу формировать новую информационную повестку.

#кейсдатаэтики
Про социальные последствия.

Сейчас, когда самый горячий период в выборах президента США закончен, хочется вспомнить про скандал, связанный с прошлыми выборами и не только - а именно про действия компании Cambridge Analytica.

Этот кейс - один из самых ярких на сегодня - о том, насколько этично распространять данные (для Facebook) и какие моральные проблемы могут возникнуть при их использовании (для CА). Если кратко, то СА собирала данные пользователей Facebook, на их основе и с помощью разработанной бихевиористкой модели подсовывала пользователям политическую рекламу. В 2016 году ее услугами пользовался штаб Трампа. Специалисты CA предположительно оказали влияние на итоги голосования по выходу Великобритании из Европейского союза (Brexit), на выборы президента Кении Ухуру Кениата и еще в более 40 политических кампаниях. Несколько сотрудников СА осознали неэтичность этого бизнеса и помогли Правительствам США и Великобритании найти истину. Тут снова дам ссылку на фильм Netflix, хотя в интернете можно найти много статей на эту тему.

Так вот, в контексте данного эпизода хотелось бы поднять тему этического кодекса дата-аналитика. Мне кажется, что это один из самых необходимых инструментов на сегодня, чтобы уменьшить вред, наносимый неуместной публикацией результатов аналитики. Кодекс дата-аналитика (как клятва Гиппократа) поможет профессионалам области осознавать, что у их действий могут быть последствия, и нести за них ответственность.

#кейсдатаэтики #переходкэтичному
Про российскую практику.

В России только начинает набирать тренд этического подхода к работе с данными. В этом направлении уже сделаны первые очень важные шаги. Например, Ассоциация больших данных (АБД) сформулировала кодекс этики больших данных. Несмотря на то, что основной задачей Кодекса является "повышение прозрачности деятельности участников рынка данных для уполномоченных органов государственной власти", в нем, на мой взгляд, изложены очень важные принципы сбора, обработки и распространения данных. Процитирую несколько.

1. "При обработке данных не допускается умышленная дискриминация граждан на основании расовой, национальной, языковой принадлежности, политических взглядов, религиозных или философских убеждений, сведений об интимной жизни. В случае обнаружения признаков дискриминации в работе алгоритма участник Кодекса принимает все разумные меры для его изменения или прекращения применения такого алгоритма" - очень важные обе мысли этого принципа. Если по результатам анализа возникла ситуация дискриминации (как в известном кейсе от Google, когда распознавание лиц имело дискриминационный характер - а именно лица афроамериканцев распознавались алгоритмом как животные) то алгоритм необходимо менять.

2. "Участники Кодекса приложат все возможные усилия к тому, чтобы при обработке данных для целей аналитики не будет нанесен вред или ущерб пользователям, чьи данные были использованы в аналитических продуктах" - очень важный принцип для исключения ситуаций, как в кейсе с Netflix и алгоритмом пользовательских предпочтений, о котором я рассказывала ранее.

3. "Сам по себе факт, что некоторые данные являются открытыми, не означает, что их использование не ограничено" - тоже ключевой принцип этики использования данных. Что будет, если ваши данные слили в сеть. Имеет ли право какая-либо организация их использовать. Например, банк, который присоединился к Кодексу, не будет использовать выложенные в Интернет данные о вашей личной жизни для решения вопроса о предоставлении кредита.

Я еще буду возвращаться к кодексу, чтобы показывать на практических примерах, как важно соблюдение изложенных в нем принципов.

#переходкэтичному #почитатьнатему
Про российскую практику.

Кроме активного перехода к этичной работе с данными очень важно заниматься популяризацией этой темы. На этом фронте также в российской практике начали появляться хорошие примеры. Вот аналитический доклад об этических проблемах цифровых технологий, подготовленный Центром подготовки руководителей цифровой трансформации. Конечно, это только первые шаги в этом направлении, но очень хорошо, что вопрос этики работы с данными начал привлекать столько внимания.

#почитатьнатему
Про социальные последствия.

Один из этических вопросов, который возникает при анализе данных, звучит следующим образом "Что делать, если алгоритм правильный, но выдает нечестные результаты (неспециальная дискриминация)?". Тут становится важным не только исправление алгоритма, но и скорость его исправления.

Вот свежий пример из Великобритании. Темнокожий парень не может подать фото на паспорт, потому что система некорректно распознает его губы и волосы. Оказалось, что проблема возникла не только на этапе разработки (программу пофиксили год назад), но и на этапе внедрения изменений (британские бюрократы не могут накатить апдейт).

Казалось бы, историю про то, как распознавание лиц имело дискриминационный характер, весь мир вместе с Google проходил еще в 2015 году, но нет. Одного кейса оказалось недостаточно.

И еще важно подчеркнуть следующее - вопросы этичной практики сбора, обработки и распространения данных могут вас коснуться даже есть вы не работаете с данными напрямую.

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про переход к этичной практике работы с данными.

Помимо описания большого количества проблем, связанных с отсутствием этики сбора, обработки или распространения данных, хочется подумать и на тему перехода к этичной практике.

Одним из способов решения этой задачи является изменение подходов к найму сотрудников (к другим способам вернусь позже). Сейчас получила распространение практика найма ответственных за вопросы этики в сфере данных и ИИ. Вот примеры релевантных позиций в крупных компаниях:

▫️AI ethicist (IBM)
▫️Chief Ethical and Humane Use Officer (Salesforce)
▫️Data Privacy and Ethics Lead (Qantas)
▫️Ethical AI Lead (Google)
▫️Chief AI Ethics Officer (US Army Artificial Intelligence Task Force)
▫️Activation Lead/Ethics & Society (Microsoft)
▫️Director of Responsible Innovation & Responsible Innovation Manager (Facebook)
▫️Social Trust Specialist (Apple)
▫️Responsible AI Specialist (H&M Group)
▫️Principal, Responsible Innovation + Data Ethics (Accenture)

Мне кажется, что это временное решение (хотя нет ничего более постоянного, как говорится). Вообще при найме компании уже задумываются о том, чтобы не просто нанимать следящего за этичностью, а сразу нанимать сотрудников - дата-саентистов, которые отвечают заданным требованиям. Gartner даже выпустил небольшой Data Ethics Interview Guide для этих целей.

#переходкэтичному
Про этичность сбора данных.

Вот ещё кейс из США. McDonald’s тестирует в 10 ресторанах в Чикаго голосового чатбота, который принимает заказы посетителей на McDrive. Точность распознавания слов — 85%, что позволяет программе принимать 80% всех заказов (остальные 20% обрабатывают живые сотрудники).

Оказалось, что такое использование голосовых записей нарушает законы штата Иллинойс — там биометрические данные граждан можно собирать только с их письменного разрешения, да и вообще законодательство штата насчет приватности данных одно из самых строгих в США. Против компании подан коллективный иск по поводу незаконного сбора и анализа биометрических данных. По законам штата, пострадавшие могут рассчитывать на компенсацию до $5000. Более того, согласно тексту иска, алгоритмы машинного обучения McDonald’s не только транскрибируют текст заказа, но и анализируют записи для определения возраста, пола, акцента и национальности клиента.

Тут сразу два момента. Первое - это вроде бы этичный сбор данных, однако нарушающий законодательство. Такой сбор данных направлен на улучшение сервиса и многие потребители согласятся с тем, что сервис всегда нужно улучшать. Но когда речь заходит про персональные данные, этическое поведение может перекрыться законодательными нормами.

А второй момент - это как раз не совсем этичное поведение в следующей части. Многие компании и госорганы зачастую собирают излишние данные - на всякий случай. В данном кейсе компания - не исключение. Стоит ли собирать излишние данные, а пользоваться ими в случае необходимости? Где проходит граница этичности такого поведения?

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про этичность сбора данных.

На днях пересматривала фильм "13 друзей Оушена". Одним из препятствий для ограбления казино в нем заявлялась система распознавания эмоций игроков "Греко". После крупного выигрыша она по эмоциям должна была считывать, был ли этот выигрыш случайным или ожидаемым. Фильм 2007 года, думаю тогда вопрос этичности сбора такой информации еще не поднимался. Но в наши дни подобные технологии вызывают отторжение.

Китайская компания Taigusys продает технологию распознавания эмоций через камеры наблюдения. Среди десятков ее клиентов — крупнейшие китайские телеком-операторы, нефтяные компании и Huawei. Как именно компании используют распознавание эмоций в своих офисах и на производстве, неизвестно — ни одна из компаний не захотела рассказывать об этом журналистам. На сайте Taigusys написано, что система помогает "справляться с новыми вызовами" и "минимизировать конфликты". Алгоритм считывает движения мимических мышц человека и его биометрические сигналы и оценивает их по шкале "положительных" и "отрицательных" эмоций. О самых грустных сотрудниках система оповещает менеджеров, рекомендуя предоставить им эмоциональную поддержку. Сайт компании утверждает, что система может даже определять фальшивую улыбку.

Системы от Taigusys установлены в 300 тюрьмах. 60 тысяч умных камер помогают контролировать заключенных, следя за ними 24/7 и распознавая "опасное поведение". Также камеры мониторят учителей и учеников в школах и следят за эмоциональным состоянием жителей домов престарелых.

Экспертам и правозащитникам такой подход сильно не нравится: это одновременно и нарушение приватности, и использование биометрических данных человека против него, и слежка, от которой невозможно скрыться. К тому же технология основана на сомнительной науке: эксперты утверждают, что нельзя упрощать психический мир человека до оценки его мимики нейросетью.

Готовы ли сотрудники различных компаний и организаций к такой слежке?

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про переход к этичной практике работы с данными.

Еще одним способом перехода к этичной практике работы с данными является внедрение цифровой этики как части всех бизнес-процессов организации. Как пишут PwC в своем докладе "Digital ethics: main ingredient for successful digital transformation" для достижения этого результата нужно выполнить следующие шаги:

▫️Определите, каким требованиям организация должна соответствовать (законодательство и нормативные акты) и хочет соответствовать (этические принципы и ценности) в своей цифровой трансформации.
▫️Придайте выбранным принципам форму (определите содержание) и определите критерии того, как при развитии цифровых технологий (работе с данными в частности) они будут достигаться.
▫️Определите, где могут возникнуть потенциальные конфликты между различными принципами и ценностями и как организация намерена их устранять.
▫️Измеряйте и контролируйте соблюдение принципов и ценностей во время и после внедрения соответствующих цифровых технологий и (возможно) отчитывайтесь об этом перед заинтересованными сторонами организации.

Эти шаги нужны не только для цифровой трансформации. Необходимо в целом переходить к цифровой этике и этике управления данными в частности.

#переходкэтичному #почитатьнатему
Про этичность использования данных.

Одна из самых больших современных этических дилемм - это вопрос слежки за гражданами. В этом контексте интересен инцидент, который случился в США, когда 6 января этого года сторонники Трампа ворвались в Капитолий.

Об этом много было написано, но обратить внимание хочется на колонку в NYT. Авторы колонки "The stormed the Capitol. Their Apps tracked them" пишут, что государство может отслеживать местонахождение граждан по смартфонам и приводят пример перемещения одного из протестующих - они идентифицировали человека, узнали его имя и соцсети. Колонка задумывалась как предупреждение против слежки. Авторы пишут, что "передавать нашу частную жизнь правительству было бы глупо" и "никакие из этих данных никогда не должны были собираться", однако сами же подрывают свой тезис, публикуя данные о нарушителях, используя их, чтобы подчеркнуть политическую точку зрения: да, отслеживание плохое, но посмотрите, это также без тени сомнения доказывает, что протестующие могут быть связаны с Трампом.

Как будто для того, чтобы подчеркнуть это противоречие, в твиттере NYT появилась публикация о том, что были "идентифицированы некоторые участники беспорядков в Капитолии", наличие которой полностью игнорирует идею о слежке на основе данных. Сами журналисты, выступая против слежки за гражданами, публикуют статьи на основе данных, полученных в результате слежки.

Вернемся тут к Кодексу этики больших данных АБД. Один из принципов сформулирован следующим образом: "Данные, полученные с применением технологий, направленных на преодоление правомерно функционирующих средств защиты данных, не могут быть признаны собранными добросовестно." Таким образом, использовать такие данные не этично.

Ну и кроме добросовестности сбора и использования данных важный урок этого кейса - начинайте с себя.

#кейсдатаэтики #переходкэтичному
Про этичность сбора данных.

И снова о слежке. Излишний сбор данных и неприкосновенность частной жизни тут противопоставляется вопросам безопасности. И здесь важен принцип пропорциональности. Как и в правовом поле, с этической точки зрения нужно понять, насколько это необходимо. Очередной кейс, который может стать прецедентом.

В одной из школ Подмосковья будет развернута ИИ-система слежки за детьми. Она будет контролировать их поведение и психоэмоциональное состояние. В частности, она сможет помечать бег по коридорам как опасное поведение и уведомлять психолога, если ребенок долго находится в плохом настроении. Разработчики планируют внедрить такую систему во все школы Московской области. И кто знает, может уже через пару-тройку лет мы такое увидим во всех школах страны.

Насколько мы готовы к постоянному контролю?

#кейсдатаэтики