Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
Про этичность распространения данных.

Сегодня общественность взбудоражила новость о том, что недавно ребрендированный Сбер хочет продавать аналитику своих данных, предварительно связав данные о транзакциях с данными о местоположении. Почему же эта новость вызывает столько эмоций? На самом деле, это отличный кейс по этике управления данными.
Считаем ли мы этичным сбор таких данных (первый этап) и их обработку (второй этап)? Конечно. Мы подписываем соглашения со Сбербанком, сбор и обработка этих данных нужна в интересах наших операций и нашей безопасности.
Считаем ли мы этичным использование этих данных в других целях (все еще второй этап)? Скорее - да. Мы понимаем, что сам Сбер использует эти данные для формирования предложений по кредиту, например, и иных задач по развитию своего бизнеса.
Считаем ли мы этичным распространение этих данных (третий этап)? А вот тут скорее - нет. Мы точно на это не подписывались. Плюс, дополнительно смущает, что речь идет не только об аналитике финансовых данных - что может еще как-то и вписалось бы в наше представление об этичности распространения - а о данных по местоположению, которые не входят в состав основных собираемых данных. То, что такие данные собираются, - понятно, но не сразу очевидно. Именно на этом моменте возникают сложности с дата-этикой. Именно тут нужно Сберу формировать новую информационную повестку.

#кейсдатаэтики
Про социальные последствия.

Сейчас, когда самый горячий период в выборах президента США закончен, хочется вспомнить про скандал, связанный с прошлыми выборами и не только - а именно про действия компании Cambridge Analytica.

Этот кейс - один из самых ярких на сегодня - о том, насколько этично распространять данные (для Facebook) и какие моральные проблемы могут возникнуть при их использовании (для CА). Если кратко, то СА собирала данные пользователей Facebook, на их основе и с помощью разработанной бихевиористкой модели подсовывала пользователям политическую рекламу. В 2016 году ее услугами пользовался штаб Трампа. Специалисты CA предположительно оказали влияние на итоги голосования по выходу Великобритании из Европейского союза (Brexit), на выборы президента Кении Ухуру Кениата и еще в более 40 политических кампаниях. Несколько сотрудников СА осознали неэтичность этого бизнеса и помогли Правительствам США и Великобритании найти истину. Тут снова дам ссылку на фильм Netflix, хотя в интернете можно найти много статей на эту тему.

Так вот, в контексте данного эпизода хотелось бы поднять тему этического кодекса дата-аналитика. Мне кажется, что это один из самых необходимых инструментов на сегодня, чтобы уменьшить вред, наносимый неуместной публикацией результатов аналитики. Кодекс дата-аналитика (как клятва Гиппократа) поможет профессионалам области осознавать, что у их действий могут быть последствия, и нести за них ответственность.

#кейсдатаэтики #переходкэтичному
Про российскую практику.

В России только начинает набирать тренд этического подхода к работе с данными. В этом направлении уже сделаны первые очень важные шаги. Например, Ассоциация больших данных (АБД) сформулировала кодекс этики больших данных. Несмотря на то, что основной задачей Кодекса является "повышение прозрачности деятельности участников рынка данных для уполномоченных органов государственной власти", в нем, на мой взгляд, изложены очень важные принципы сбора, обработки и распространения данных. Процитирую несколько.

1. "При обработке данных не допускается умышленная дискриминация граждан на основании расовой, национальной, языковой принадлежности, политических взглядов, религиозных или философских убеждений, сведений об интимной жизни. В случае обнаружения признаков дискриминации в работе алгоритма участник Кодекса принимает все разумные меры для его изменения или прекращения применения такого алгоритма" - очень важные обе мысли этого принципа. Если по результатам анализа возникла ситуация дискриминации (как в известном кейсе от Google, когда распознавание лиц имело дискриминационный характер - а именно лица афроамериканцев распознавались алгоритмом как животные) то алгоритм необходимо менять.

2. "Участники Кодекса приложат все возможные усилия к тому, чтобы при обработке данных для целей аналитики не будет нанесен вред или ущерб пользователям, чьи данные были использованы в аналитических продуктах" - очень важный принцип для исключения ситуаций, как в кейсе с Netflix и алгоритмом пользовательских предпочтений, о котором я рассказывала ранее.

3. "Сам по себе факт, что некоторые данные являются открытыми, не означает, что их использование не ограничено" - тоже ключевой принцип этики использования данных. Что будет, если ваши данные слили в сеть. Имеет ли право какая-либо организация их использовать. Например, банк, который присоединился к Кодексу, не будет использовать выложенные в Интернет данные о вашей личной жизни для решения вопроса о предоставлении кредита.

Я еще буду возвращаться к кодексу, чтобы показывать на практических примерах, как важно соблюдение изложенных в нем принципов.

#переходкэтичному #почитатьнатему
Про российскую практику.

Кроме активного перехода к этичной работе с данными очень важно заниматься популяризацией этой темы. На этом фронте также в российской практике начали появляться хорошие примеры. Вот аналитический доклад об этических проблемах цифровых технологий, подготовленный Центром подготовки руководителей цифровой трансформации. Конечно, это только первые шаги в этом направлении, но очень хорошо, что вопрос этики работы с данными начал привлекать столько внимания.

#почитатьнатему
Про социальные последствия.

Один из этических вопросов, который возникает при анализе данных, звучит следующим образом "Что делать, если алгоритм правильный, но выдает нечестные результаты (неспециальная дискриминация)?". Тут становится важным не только исправление алгоритма, но и скорость его исправления.

Вот свежий пример из Великобритании. Темнокожий парень не может подать фото на паспорт, потому что система некорректно распознает его губы и волосы. Оказалось, что проблема возникла не только на этапе разработки (программу пофиксили год назад), но и на этапе внедрения изменений (британские бюрократы не могут накатить апдейт).

Казалось бы, историю про то, как распознавание лиц имело дискриминационный характер, весь мир вместе с Google проходил еще в 2015 году, но нет. Одного кейса оказалось недостаточно.

И еще важно подчеркнуть следующее - вопросы этичной практики сбора, обработки и распространения данных могут вас коснуться даже есть вы не работаете с данными напрямую.

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про переход к этичной практике работы с данными.

Помимо описания большого количества проблем, связанных с отсутствием этики сбора, обработки или распространения данных, хочется подумать и на тему перехода к этичной практике.

Одним из способов решения этой задачи является изменение подходов к найму сотрудников (к другим способам вернусь позже). Сейчас получила распространение практика найма ответственных за вопросы этики в сфере данных и ИИ. Вот примеры релевантных позиций в крупных компаниях:

▫️AI ethicist (IBM)
▫️Chief Ethical and Humane Use Officer (Salesforce)
▫️Data Privacy and Ethics Lead (Qantas)
▫️Ethical AI Lead (Google)
▫️Chief AI Ethics Officer (US Army Artificial Intelligence Task Force)
▫️Activation Lead/Ethics & Society (Microsoft)
▫️Director of Responsible Innovation & Responsible Innovation Manager (Facebook)
▫️Social Trust Specialist (Apple)
▫️Responsible AI Specialist (H&M Group)
▫️Principal, Responsible Innovation + Data Ethics (Accenture)

Мне кажется, что это временное решение (хотя нет ничего более постоянного, как говорится). Вообще при найме компании уже задумываются о том, чтобы не просто нанимать следящего за этичностью, а сразу нанимать сотрудников - дата-саентистов, которые отвечают заданным требованиям. Gartner даже выпустил небольшой Data Ethics Interview Guide для этих целей.

#переходкэтичному
Про этичность сбора данных.

Вот ещё кейс из США. McDonald’s тестирует в 10 ресторанах в Чикаго голосового чатбота, который принимает заказы посетителей на McDrive. Точность распознавания слов — 85%, что позволяет программе принимать 80% всех заказов (остальные 20% обрабатывают живые сотрудники).

Оказалось, что такое использование голосовых записей нарушает законы штата Иллинойс — там биометрические данные граждан можно собирать только с их письменного разрешения, да и вообще законодательство штата насчет приватности данных одно из самых строгих в США. Против компании подан коллективный иск по поводу незаконного сбора и анализа биометрических данных. По законам штата, пострадавшие могут рассчитывать на компенсацию до $5000. Более того, согласно тексту иска, алгоритмы машинного обучения McDonald’s не только транскрибируют текст заказа, но и анализируют записи для определения возраста, пола, акцента и национальности клиента.

Тут сразу два момента. Первое - это вроде бы этичный сбор данных, однако нарушающий законодательство. Такой сбор данных направлен на улучшение сервиса и многие потребители согласятся с тем, что сервис всегда нужно улучшать. Но когда речь заходит про персональные данные, этическое поведение может перекрыться законодательными нормами.

А второй момент - это как раз не совсем этичное поведение в следующей части. Многие компании и госорганы зачастую собирают излишние данные - на всякий случай. В данном кейсе компания - не исключение. Стоит ли собирать излишние данные, а пользоваться ими в случае необходимости? Где проходит граница этичности такого поведения?

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про этичность сбора данных.

На днях пересматривала фильм "13 друзей Оушена". Одним из препятствий для ограбления казино в нем заявлялась система распознавания эмоций игроков "Греко". После крупного выигрыша она по эмоциям должна была считывать, был ли этот выигрыш случайным или ожидаемым. Фильм 2007 года, думаю тогда вопрос этичности сбора такой информации еще не поднимался. Но в наши дни подобные технологии вызывают отторжение.

Китайская компания Taigusys продает технологию распознавания эмоций через камеры наблюдения. Среди десятков ее клиентов — крупнейшие китайские телеком-операторы, нефтяные компании и Huawei. Как именно компании используют распознавание эмоций в своих офисах и на производстве, неизвестно — ни одна из компаний не захотела рассказывать об этом журналистам. На сайте Taigusys написано, что система помогает "справляться с новыми вызовами" и "минимизировать конфликты". Алгоритм считывает движения мимических мышц человека и его биометрические сигналы и оценивает их по шкале "положительных" и "отрицательных" эмоций. О самых грустных сотрудниках система оповещает менеджеров, рекомендуя предоставить им эмоциональную поддержку. Сайт компании утверждает, что система может даже определять фальшивую улыбку.

Системы от Taigusys установлены в 300 тюрьмах. 60 тысяч умных камер помогают контролировать заключенных, следя за ними 24/7 и распознавая "опасное поведение". Также камеры мониторят учителей и учеников в школах и следят за эмоциональным состоянием жителей домов престарелых.

Экспертам и правозащитникам такой подход сильно не нравится: это одновременно и нарушение приватности, и использование биометрических данных человека против него, и слежка, от которой невозможно скрыться. К тому же технология основана на сомнительной науке: эксперты утверждают, что нельзя упрощать психический мир человека до оценки его мимики нейросетью.

Готовы ли сотрудники различных компаний и организаций к такой слежке?

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про переход к этичной практике работы с данными.

Еще одним способом перехода к этичной практике работы с данными является внедрение цифровой этики как части всех бизнес-процессов организации. Как пишут PwC в своем докладе "Digital ethics: main ingredient for successful digital transformation" для достижения этого результата нужно выполнить следующие шаги:

▫️Определите, каким требованиям организация должна соответствовать (законодательство и нормативные акты) и хочет соответствовать (этические принципы и ценности) в своей цифровой трансформации.
▫️Придайте выбранным принципам форму (определите содержание) и определите критерии того, как при развитии цифровых технологий (работе с данными в частности) они будут достигаться.
▫️Определите, где могут возникнуть потенциальные конфликты между различными принципами и ценностями и как организация намерена их устранять.
▫️Измеряйте и контролируйте соблюдение принципов и ценностей во время и после внедрения соответствующих цифровых технологий и (возможно) отчитывайтесь об этом перед заинтересованными сторонами организации.

Эти шаги нужны не только для цифровой трансформации. Необходимо в целом переходить к цифровой этике и этике управления данными в частности.

#переходкэтичному #почитатьнатему
Про этичность использования данных.

Одна из самых больших современных этических дилемм - это вопрос слежки за гражданами. В этом контексте интересен инцидент, который случился в США, когда 6 января этого года сторонники Трампа ворвались в Капитолий.

Об этом много было написано, но обратить внимание хочется на колонку в NYT. Авторы колонки "The stormed the Capitol. Their Apps tracked them" пишут, что государство может отслеживать местонахождение граждан по смартфонам и приводят пример перемещения одного из протестующих - они идентифицировали человека, узнали его имя и соцсети. Колонка задумывалась как предупреждение против слежки. Авторы пишут, что "передавать нашу частную жизнь правительству было бы глупо" и "никакие из этих данных никогда не должны были собираться", однако сами же подрывают свой тезис, публикуя данные о нарушителях, используя их, чтобы подчеркнуть политическую точку зрения: да, отслеживание плохое, но посмотрите, это также без тени сомнения доказывает, что протестующие могут быть связаны с Трампом.

Как будто для того, чтобы подчеркнуть это противоречие, в твиттере NYT появилась публикация о том, что были "идентифицированы некоторые участники беспорядков в Капитолии", наличие которой полностью игнорирует идею о слежке на основе данных. Сами журналисты, выступая против слежки за гражданами, публикуют статьи на основе данных, полученных в результате слежки.

Вернемся тут к Кодексу этики больших данных АБД. Один из принципов сформулирован следующим образом: "Данные, полученные с применением технологий, направленных на преодоление правомерно функционирующих средств защиты данных, не могут быть признаны собранными добросовестно." Таким образом, использовать такие данные не этично.

Ну и кроме добросовестности сбора и использования данных важный урок этого кейса - начинайте с себя.

#кейсдатаэтики #переходкэтичному
Про этичность сбора данных.

И снова о слежке. Излишний сбор данных и неприкосновенность частной жизни тут противопоставляется вопросам безопасности. И здесь важен принцип пропорциональности. Как и в правовом поле, с этической точки зрения нужно понять, насколько это необходимо. Очередной кейс, который может стать прецедентом.

В одной из школ Подмосковья будет развернута ИИ-система слежки за детьми. Она будет контролировать их поведение и психоэмоциональное состояние. В частности, она сможет помечать бег по коридорам как опасное поведение и уведомлять психолога, если ребенок долго находится в плохом настроении. Разработчики планируют внедрить такую систему во все школы Московской области. И кто знает, может уже через пару-тройку лет мы такое увидим во всех школах страны.

Насколько мы готовы к постоянному контролю?

#кейсдатаэтики
Про переход к этичной практике работы с данными.

Слушала сейчас Радио Т, ведущие обсуждали интересный кейс про dark patterns. Они прочитали заметку о том, что один из разработчиков ПО уволился после того, как на работе его попросили задеплоить код, который сохранял email пользователей на сервере после ввода в формочку, но без нажатия кнопки сохранения. Ведущие в целом сошлись на том, что такая реакция (увольнение) на такую мелочь гипертрофированна. Но поднялся вопрос границы того, где разработчик должен следить за этичностью собственных разработок. Отдельной точкой преткновения стало то, что он же сам этот код не писал. Может, кодекс этики разработчика, как клятва Гиппократа, уже тоже должен приниматься сразу после обучения?

Ещё отличная мысль прозвучала на тему того, что параноики в области ИБ (те, кто думает, что все про кто-то собирает) - это люди неэтичные. Потому что все же по себе судят :)

#кейсдатаэтики #переходкэтичному
Про ошибки в модели анализа данных.

Ошибки могут возникать на разных этапах анализа данных. Например, что делать, если разработанная модель анализа данных дает правильные, но не честные результаты. Возникает неспециальная дискриминация. Именно это и произошло в ситуации с Amazon. Кейс, мимо которого нельзя было пройти.

Amazon нанимает миллионы водителей для доставки своих посылок по США. Это не сотрудники компании, а такие же подрядчики, как и водители Uber и других сервисов подработок. Чтобы обеспечить быструю и гарантированную доставку, в Amazon разработали алгоритмы, которые анализируют работу водителей - вовремя ли они приезжают за посылками, вовремя ли их доставляют, нет ли жалоб на доставку от клиентов. Проблемным водителям снижают рейтинг, а потом увольняют.

Звучит как здравая для бизнеса оптимизация HR. Сам Безос считает, что машины принимают решения быстрее и точнее, чем люди, снижая затраты и давая его компании преимущество перед конкурентами. Но в погоне за общей эффективностью системы разработчики алгоритмов не учли все нюансы реальной работы доставщиков. Водители регулярно сталкиваются с проблемами, не зависящими от них: задержки в пункте выдачи посылок, занесенная снегом дорога, закрытые ворота по адресу доставки, и так далее. Алгоритм безжалостен и наказывает водителей даже за те ситуации, на которые они никак не могли повлиять. Писать в поддержку бесполезно: водителям отвечают автоматизированными письмами в духе "мы рассматриваем ваше обращение". Те в отчаянии пишут Безосу, но и это не помогает. Единственный способ ускорить рассмотрение апелляции - заплатить за это $200.

Если смотреть на ситуацию с точки бизнеса, то все ок. Система эффективна, 95% посылок доставляются вовремя и без проблем - в том числе благодаря суровым HR-алгоритмам. Но каждое ложноположительное срабатывание алгоритма - это личная трагедия человека, оставшегося без работы в непростой период пандемии. В тексте показаны двое таких водителей - 63-летний ветеран и мать троих детей, обоих автоматически уволили за ситуации, в которых они не виноваты.

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про этичный сбор данных.

Недавно писала про темные паттерны, и сам факт существования такого явления - большой этический вопрос. Но если остановиться на кейсах, касающихся данных, то, конечно, возникает проблема этичности сбора данных с их помощью.

Вот пример использования темных паттернов на LinkedIn (картинка).

В заголовке идёт один посыл, а в тексте ниже–второй, про совершенно другое действие.
• "Add a phone number for security"—заголовок о безопасности, класс
• "Your phone number helps us keep your account secure..."—первое предложение поясняет заголовок, ок.
• "It also helps others who already have your phone number discover..."—совершенно другая фича, которая спрятана глубоко в тексте и про неё многие даже не прочтут.

Тут сделано слияние двух фичей в одну, причём юзер не может вписаться в фичу на выбор. Давая телефон для повышения безопасности аккаунта, он автоматически соглашается отдать его для построения соц.графа Linkedin.

#кейсдатаэтики
(история взята отсюда: https://t.me/brainshare)
Про социальные последствия.

В зависимости от того, как осуществляется анализ данных и как на основе этого анализа принимаются решения, возникают разные этические дилеммы. Я уже писала, что может быть такая ситуация, когда алгоритм правильный, но результат нечестный. И про ответственность дата-аналитика при получении таких результатов тоже не стоит забывать.

И вот вчера соцсети разнесли новость о ярком примере того, как может проявится такая ситуация.

Многие уже видели скриншот письма от основателя Xsolla (бизнес, оцениваемый в $3 млрд, основанный на платежах в видеоиграх) Александра Агапитова. В нём он сообщает сотруднику об увольнении после того, как «команда биг дата проанализировала активности» в рабочих чатах, почте, документах и дашбордах и пометила его как «невовлечённого и малопродуктивного».

Насколько этично выдавать такие результаты дата-аналитику? И потом принимать на их основании такие решения?

#кейсдатаэтики
Про этичность использования данных.

Особенно интересными кейсами дата-этики мне кажутся такие истории, когда основной игрок в попытках показать себя с более этичной стороны, оказывается ровно с противоположной стороны баррикад. Я уже писала про кейс с журналистами NYT, и вот еще одна история из этой серии.

В январе 2019 года IBM Research опубликовала сообщение в блоге о новом наборе данных, который компания только что выпустила. Все началось с вопроса: “С вами когда-нибудь обращались несправедливо?” Потом было добавлено: "Большинство людей в целом согласны с тем, что более справедливый мир - это лучший мир... Вот почему мы используем возможности науки для создания систем искусственного интеллекта, которые являются более справедливыми и точными”. Далее в блоге объяснялось, что IBM Research выпускает новый большой и разнообразный набор данных под названием "Разнообразие в лицах" (Diversity in Faces - DiF), чтобы продвинуть мир в вопросе точности технологий распознавания лиц. Первый в своем роде, доступный мировому исследовательскому сообществу, DiF предоставляет собой набор описаний для одного миллиона изображений человеческих лиц. Используя общедоступные изображения из набора данных Creative Commons YFCC-100M, IBM Research описали лица, используя 10 хорошо зарекомендовавших себя и независимых схем кодирования из научной литературы. IBM Research считает, что эти данные помогут обеспечить разработку более справедливых и точных систем ИИ.

Первоначально такие средства массовой информации, как CNET, CNBC и Venturebeat, освещали это объявление как шаг вперед в усилиях по борьбе с неравномерным уровнем точности различных алгоритмов при идентификации лиц из разных групп. Как объяснил Venturebeat, исследователи отметили, что "распознавание лиц, выполненное Microsoft, IBM и китайской компанией Megvii, неверно определяло пол до 7 процентов светлокожих женщин, до 12 процентов темнокожих мужчин и до 35 процентов темнокожих женщин" - в ответ на такие показатели сотрудники многих технологических компаний работали над тем, чтобы уменьшить объемы ошибочных идентификаций.

Однако в марте 2019 года новостной репортаж NBC был посвящен другому аспекту базы данных: тому факту, что "набор данных YFCC-100M Creative Commons" состоял из фотографий, которые люди загрузили на Flickr. В статье отмечено, что некоторые пользователи Flickr, чьи фотографии были выбраны IBM для набора данных, "были удивлены и смущены, когда NBC News сообщил им, что их фотографии были снабжены подробностями, включая геометрию лица и тон кожи, и могут быть использованы для разработки алгоритмов распознавания лиц”. Она добавила, что “почти невозможно удалить фотографии [из набора данных]. IBM требует, чтобы фотографы отправляли по электронной почте ссылки на фотографии, которые они хотят удалить, но ... нет простого способа узнать, чьи фотографии включены в этот датасет".

Более того, по данным IBM, даже если фотография будет удалена по запросу из DiF, она не будет удалена из версий, уже предоставленных исследователям; до этого момента доступ запрашивали около 250 организаций.

По состоянию на сегодня на веб-сайте IBM Research все еще есть страница для статьи "Разнообразие лиц"; однако, нажав на то, что выглядит как ссылка для загрузки набора данных, вы попадете на более общую страницу под названием "Доверие ИИ".

#кейсдатаэтики
(история взята отсюда: https://www.scu.edu/ethics/ethics-resources/ethics-cases/)
Про социальные последствия.

Есть несколько наиболее известных кейсов дата-этики, которые постоянно приводят в пример, и благодаря которым развивалось в том числе законодательство. Вот один из них, на который я наталкивалась в ходе исследований зарубежного права.

В 2015 года Латанья Суини (Latanya Sweeney) - профессор Гарварда, директор лаборатории конфиденциальности данных Института количественных социальных наук (IQSS), ввела в поисковую строку Google своё имя и вместе с поисковой выдачей увидела рекламу «Latanya Sweeney, Arrested? 1) Enter name and state 2) Access full background. Checks instantly. www.instantcheckmate.com». Ее имя уникально, и она никогда не была арестована. Откуда тогда такая реклама? Однако, после ввода в поисковую строку другого имени - человека, который несколько раз был арестован, такой рекламы не появлялось.

В Гарварде было проведено исследование, результатом которого стал вывод, что поисковик Google подбирал разную рекламу в зависимости от того, какой расе присуще имя, которое ищет пользователь.

Разрабатывая алгоритмы, которые персонифицируют выдачу, нужно не забывать, что такие алгоритмы могут стать дискриминирующими.

#кейсдатаэтики
Про переход от неэтичного к этичному.

Ещё один вопрос, который, как мне кажется, скоро будут также активно обсуждать, как вопрос массовой слежки, так это дипфейки. Уже появляются правовые прецеденты, связанные с их использованием, так что этические кейсы тоже не заставят себя ждать.

Вот, например, кейс, сбор данных в котором и с правовой и с этической точки зрения вызывает вопросы. К тому же, последствия очевидно будут такими, что очередная профессия сойдёт на нет.

Мне кажется, что этот прецедент хорош тем, что тут этический подход изменится уже в скором будущем. И мы будем считать такую ситуацию нормальной.

Актриса озвучки Бев Стендинг в 2018 году озвучила 10 000 аудиофрагментов по заказу Китайского государственного института акустики. Используя эти записи, ее голос клонировала компания ByteDance, разработчик TikTok. В приложении есть опция text-to-speech, и для пользователей из Северной Америки голос озвучки по умолчанию — это клонированный голос Бев Стендинг.

Актриса заявляет, что не давала согласия на клонирование ее голоса, и подала иск против ByteDance. Сейчас его рассматривает американский суд. На судебные издержки для Бев скинулись другие актеры озвучки — прецедент нелегального клонирования голоса с помощью ИИ может оставить их в будущем без работы. Получается, что компания может купить у актера отдельные записи его голоса, а затем как бы украсть его голос полностью. Очень интересный кейс.

#кейсдатаэтики
(история взята отсюда: https://t.me/brodetsky)
Про социальные последствия.

Одним из результатов обработки данных может являться появление новой информации. И даже при корректном получении и обработке данных, и при условно правильном их анализе мы можем получить неэтичный результат.

Самый известный кейс на эту тему - история о том, как маркетинговая компания анализирована поведение пользователей и выяснила, что одна из потребительниц беременна - и направила ей соответствующую рекламу. Но вдруг оказалось, что потребительнице всего 15 и рекламу получил ее отец, который не знал, что его дочь-подросток беременна.

Ещё про один такой кейс, когда результатом обработки данных стало появление новой информации, я писала, когда только начала вести канал.

Или вот еще кейс про то, как в 2013 году Hewlett-Packard разработали алгоритм, определяющий, какие сотрудники более склонны к решению уволиться, и разослала результат руководителям таких сотрудников. Вообще, руководитель - это последний человек, который в случае желания уволиться сотрудника должен об этом узнать, особенно не от самого сотрудника.

Поэтому важно оценивать результаты действий на каждом этапе работы с данными.

#кейсдатаэтики
Про переход к этичной практике работы с данными.

Не так давно руководство Google уволило исследовательницу Тимнит Гебру, сотрудницу отдела по этике. Я уже писала про тренд на найм специалистов по этике в технологичных компаниях, и вот теперь хочу немного развить тему и обратить внимание на «подводные камни».

Казалось бы очевидно, что такие специалисты (как и любые другие сотрудники) будут сталкиваться с некоторыми организационными ограничениями. Ситуация в Google служит тому примером. Тимнит Гебру - признанный эксперт в своей области, работающая на пересечении компьютерных наук и этики. Наиболее известна своими статьями про предвзятость алгоритмов. И, собственно, ее увольнение связывают с несогласием руководства Google на публикацию новой статьи об этических и социальных проблемах вокруг обработки естественного языка (NLP), которую Гебру написала со своими коллегами.

Есть и исследование на эту тему: Джейкоб Мэткалф и его коллеги исследовали институционализацию этики в Кремниевой долине и сделали вывод, что специалисты по этике внутри компании постоянно пытаются примирить личные, профессиональные и корпоративные интересы, но не всегда удачно. Получается, что этика как набор внешних нормативных требований вступает в конфликт с ролью, обязанностями и ограничениями, задающими работу специалистов по этике внутри ИТ-компаний. 

Вообще, такие внутренние конфликты не уникальное явление. С ними сталкиваются различные специалисты. Поэтому я снова возвращаюсь тут к своему тезису, что этикой должны заниматься не специально обученные люди, а все.

#переходкэтичному
(история взята отсюда https://t.me/datastudies/)