Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
О важности сохранения данных в условиях неопределённости пишет Андрей Себрант и приводит отличный пример:

Во времена кризиса 2008 года «Яндексу» нужно было принимать «оперативные решения, и, в частности, важнейшее решение о том, как поймать момент начала восстановления экономики, вовремя вложить еще сохранившиеся ресурсы в отработку растущего спроса и первыми представить новинки на начавшем восстанавливаться рынке». Сценарии восстановления от экономистов при этом были противоречивыми.

«В результате мозгового штурма было решено отслеживать потребительское поведение пользователей интернета, отражающееся в статистике контрастных поисковых запросов. Например, отношение мощности запросов, связанных с покупкой автомобиля, к запросам, связанным с его ремонтом, или отношение запросов про заказ пиццы к запросам про рецепты пиццы.»

Собрав достаточно данных по таким типам запросов, «Яндекс» построил метрику «кризисности» в головах людей, выражающуюся в их потребительских запросах. «Она-то и позволила нам поймать начало послекризисного восстановления спроса и оценить его скорость задолго до того, как о выходе из кризиса заговорили ученые и традиционные эксперты.»
👍2
Ещё один пример использования данных в медицине. Медицинские решения, принимаемые на основе данных, вызывают гораздо больше доверия и надежды на хороший исход, а это тоже немаловажно для пациентов.

#кейсиспользованияданных
⬇️⬇️⬇️
Forwarded from addmeto (Grigory Bakunov 🧪)
Эппл только что показали, что в новом приложении для учета и помощи в принятии медицинских препаратов будут показывать, если ваши таблетки конфликтуют друг с другом. И с алкоголем.

Если вы думаете, что это неважно — важно. Теперь вы можете доверить устройству проверять то, что не учли ваши врачи. Пока что это единственное, что меня удивило на презентации.
👍2
Вопросы слежки за людьми вообще всегда находятся на грани этичности, но вот эта ситуация с абортами в США, конечно, вообще какое-то новое дно. Один из примеров, когда что-то становится законным, но не этичным.

#кейсдатаэтики
⬇️⬇️⬇️
Forwarded from Сноб
Женщины в США удаляют приложения, отслеживающие менструальный цикл. Они боятся, что данные могут использоваться для их преследования после запрета абортов в некоторых штатах.

Эти переживания не беспочвенны, потому что эти приложения как и любые другие сохраняют данные и делятся ими. В штате, где аборт стал преступлением, прокуратура может запросить информацию, собранную этими приложениями, при возбуждении дела.

Трекерами цикла пользуются около трети американок. Они помогают не только следить за месячными, но и планировать беременность и выявлять проблемы со здоровьем

@snobru
В копилку к default city. Забавный кейс сбора данных, когда ставишь себе задачу «не генерить лишние сведения» а выходит как-то по-другому.

#кейсиспользованияданных
⬇️⬇️⬇️
Forwarded from WrongTech (Konstantin Glazkov)
«пусто» не значит «ноль»

В мире геолокации существует так называемый «Нулевой остров» – место в Гвинейском заливе с координатами 0° северной широты и 0° восточной долготы. Несмотря на то, что там ничего нет (кроме небольшого буйка под именем Soul), это одно из самых наполненных контентом мест на Земле.

Причина этому – распространенная механика подмены отсутствующих геоданных (null) на нулевые координаты (zero). Из-за этого там скапливаются данные из Flickr, Strava, Twitter, Snapchat, AirBnB и прочих сервисов.

Существуют, конечно, сценарии и осознанного использования Нулевого острова. Например, одни смельчаки предложили в качестве шутки запустить там Air Null – авиакомпанию, благодаря которой летать больше никуда не надо.

Этот и другие примеры лишний раз подчеркивают, что «выдуманное» место может обретать не меньший смысл, чем «реальные» места. И пока Нулевой остров продолжают обживать новые и новые данные, он будет оставаться не только банальной точкой отсчета, но и важным социокультурным феноменом.
Интересный кейс про сбор данных в самые темные времена. Эта история важна вот почему. Даже если нам кажется, что мы работаем только с технологиями, все равно результат нашей работы влияет на людей. И какая бы ни была рабочая задача - мы отвечаем за финальный результат тоже.

Я уже писала про кодекс этики работы с данными для каждого вовлеченного - как вариант решения этой проблемы. Но может у вас есть идея получше?

*ссылки на пруфы в комментариях в оригинальном посте

#кейсдатаэтики
⬇️⬇️⬇️
Наши действия проявляют ценности, но не все ценности видимы

История повторяется даже если видимо происходит как будто бы впервые, а некоторые нарративы проявляются и помогают сильнее тиражированных историй. Как пример сопротивления любят приводить фото из 1936 года, мы все его знаем: там один человек не зигует, в то время как остальные да. Его ещё обводят в красный кружок. Это не очень хороший пример, он не работает. Рене Кармиль, которого почти никто не знает, пример намного более удачный, но чтобы рассказать о нём потребуется несколько тысяч знаков и небольшая историческая врезка во вторую мировую войну.

Что мы знаем о технологическом обеспечении холокоста? Он был возможен в таком жутком масштабе благодаря вычислительным технологиям и перфокартам IBM.

Стандартная длина строки терминала в 80 символов пришла к нам начала тридцатых годов. Dehomag объявили в своей рассылке о расширении перфокарты «по политическим причинам». Дальше Рейх начал идентификацию арийцев и евреев. Увеличив метаданные всего на 20% и обеспечив их непрерывный сбор и обработку, немцы заложили технологический фундамент будущего геноцида.

Вилли Хайдингер, СЕО Dehomag — немецкой дочерней компании IBM, был воодушевлённым поклонником гитлеровского режима. Исторические параллели проведёте сами. Бизнес-отношения между IBM и третьим рейхом не заканчивались, несмотря на призыв мирового сообщества бойкотировать Германию ещё до войны

Перепись населения 1933 года была полностью исполнена IBM и помогла нацистам опознать, изолировать и, в конце-концов, уничтожить еврейское меньшинство. Машинные таблицы данных впервые показали другие числа еврейского населения в Германии: теперь можно было определить людей с одним или несколькими предками. Предыдущая оценка в 400-600 тысяч была отброшена в пользу новой — два миллиона евреев в населении в шестьдесят пять миллионов.

Дальше немецкая армия оккупирует Европу. В каждой новой стране открываются «дочки» IBM и проводится перепись населения, идентифицирующая евреев и ром. Эти данные и сложная сеть мелких подрядчиков IBM помогают убийствам этнических евреев в Европе. Каждый концлагерь имел собственный отдел Hollerith-Abteilung, который пробивал по перфокартам IBM поступающих людей. Хейденгер и Уотсон помогли компании обойти санкции и настроить полузакрытые компании и сеть лицензиатов для доставки перфокарт клиентам на всех территориях. Так Германия стала вторым по размеру рынком для IBM после CША. Параллели и здесь проводятся сами.

Рене Кармиль не составлял списки, он их уничтожал. Эксперт по системам обработки данных стал главным по французской переписи населения, которая сама по себе, конечно же, была нейтральна — просто данные. Он лично хорошо понимал, как эти данные будут использоваться. Внешне Рене сотрудничал с режимом, но вот перепись населения во Франции почему-то проходила медленно и неэффективно. Рене и его подчинённые обыденно оставляли коробки с перфокартами где-то в запасниках с тысячами необработанных записей из переписи населения. А потом команда и вовсе поменяла процесс, чтобы в колонку 11 — религия — ничего не впечатывалось. Потенциальный смертельный приговор исчез для тысяч людей, и местных, и эмигрантов. Они все выжили благодаря человеку, сражавшемуся с фашизмом на своём рабочем месте.

Отчёт о французских евреях, заказанный немцами в 1941 не был закончен к его аресту в феврале 1944. Рене и его команду, конечно, поймали, его жестоко допрашивали, он сам умер в Дахау, не дожив всего трёх месяцев до освобождения. Так себе пример, если подумать.

В Нидерландах 73% евреев были идентифицированы, депортированы и убиты. А во Франции это же число почти в три раза меньше — 25%.

Наши действия проявляют ценности, но не все ценности видимы.
👍6
Сноб
Женщины в США удаляют приложения, отслеживающие менструальный цикл. Они боятся, что данные могут использоваться для их преследования после запрета абортов в некоторых штатах. Эти переживания не беспочвенны, потому что эти приложения как и любые другие сохраняют…
Похоже, Google правильно понял возможные последствия запроса данных для возбуждения дел о незаконных абортах, и запустил инициативу по защите частной жизни пользователей. Согласно заявлению, опубликованному в корпоративном блоге, Google начнет автоматически удалять сведения о посещении клиник абортов, центров похудения и других "потенциально чувствительных" мест. Прекрасный пример ответственного подхода к распространению своих разработок.

#кейсдатаэтики
👍3
Про утечки данных.

Интересный кейс в Индонезии, когда неэтичная во всем мире практика начинает становиться этичной в конкретном месте в противовес действиям правительства.

В очередной раз произошла масштабная утечка персональных данных индонезийцев.* Базы местного бигтеха и государственных агентств взламываются с печальной регулярностью. Власти же по-прежнему не приняли необходимых законов, а в заявлениях даже пытаются возложить ответственность на пользователей, обвиняя их в неаккуратном ведении сведений (редкой смене пароля в частности). Граждане же в ответ начинают поддерживать действия хакеров, потому что иного способа заставить правительство принимать меры по охране персональных данных они не видят.

* Ссылаюсь на статью из журналистского проекта, посвященного новостям о технологиях в незападных странах – они освещают то, что происходит в Азии, Латинской Америке, Африке и других местах, которые часто не попадают в заголовки медиа, что мы привыкли читать. Так что на счет источника до конца не уверена.

#кейсдатаэтики
👍2
Про внедрение дата-этики.

Нашла тут интересный сборник статей "Как изучать интернет: этика и политика в исследованиях", который можно считать скорее методичкой по работе с данными в контексте этики. Я уже не раз задавалась вопросом, как практически внедрить более этичное обращение с данными. Вот в тексте вижу один из подходов.

Авторы приводят схему принятия решений, в которой перечислены вопросы к собираемой информации. Отвечая на эти вопросы, как мне кажется, можно понять, где может вскрыться неэтичная практика. Вопросы касаются происхождения интереса к сбору информации, материалов, источников, того, как обрабатываются данные и что с ними происходит впоследствии. Например, "У кого есть интерес к этим данным?", "Кто и зачем создал данные?", "Сколько хранятся данные и почему?" .

Правда, вопросы скорее должны задавать исследователи, а не программисты. Но над вопросами программистов можно подумать отдельно. Так что кроме кодекса этики вполне можно и более прикладные практики внедрять.

#переходкэтичному #почитатьнатему
👍1
Про усложнение доступа к информации вместо прямых запретов.

Одним из способов этичного обращения с данными является обеспечение Privacy (конфиденциальности). Privacy имеет весьма расплывчатое определение и из-за этого разные способы достижения. Обеспечить Privacy можно посредством прямых запретов и отсутствия возможности что-то сделать с информацией или с помощью внедрения Obscurity (принцип непонятности). Если первый способ может полностью блокировать какие-то функции, то второй позволяет "усидеть на двух стульях" - обеспечить и работоспособность сервиса, и конфиденциальности.

Что такое obscurity? Это ситуация, когда информация существует, но для ее получения или интерпретации не хватает некоторых ключевых факторов, таких как:
▫️видимости в поиске - т.е. невозможно найти данные с помощью поисковой машины
▫️незащищенного доступа - т.е. есть контроли доступа, такие как биометрия, шифрование, настройки конфиденциальности и пароли
▫️идентификации - т.е. нет однозначного подтверждения между реальным человеком и аккаунтом
▫️ясности - т.е. внешний пользователь не может понять смысл информации без дополнительных вводных
▫️ресурсов для обработки - т.е. данные доступны в таком виде, что их обработка потребует очень больших затрат.

Обеспечение отсутствия этих ключевых факторов by design также приближает нас к этичной практике работы с данными. Про какие еще факторы я не написала?

#переходкэтичному
Про неоднозначные ситуации.

Сегодня немного о спорном с точки зрения этики кейсе.
С 2015 года BBC сопротивляется попыткам Google соблюдать так называемое «право на забвение» Европейского Союза. Когда ссылки удаляются из поисковой системы, служба BBC собирает и размещает удаленную информацию на своем собственном сайте. В этом случае с одной стороны право человека на obscurity (я писала об obscurity в прошлом посте). С другой стороны - политика BBC о сохранении контента и его исторической ценности. Мне эта ситуация напоминает вообще "эффект Стрейзанд".

Как думаете, этична ли позиция BBC? С точки зрения закона они правы - законом в данном случае предписывается удалить именно ссылки (не сам контент).

#кейсдатаэтики
Про распознавание лиц.

В работе я часто сталкивалась с позицией, что если что-то сложно контролировать, давайте это запретим.

Например, распознавание лиц госорганами. Распознавание лиц вообще очень сложный вопрос. Помимо угроз, которые несут в себе новые технологии в целом, распознавание особенно опасно следующим:

1. Лица трудно скрыть, отпечаток лица можно снять на расстоянии и недорого сохранить в облаке
2. Существуют разные базы данных имен и лиц, таких как водительские права и фотобанки, что делает использование собираемых отпечатков проще и более вероятным
3. В отличие от традиционного наблюдения, которое требует дорогостоящего оборудования или новых источников данных, распознавание лиц сейчас широко распространено, оно часто сочетается с камерами видеонаблюдения и нательными камерами
4. Лица, в отличие от кончиков пальцев или рисунков радужной оболочки, играют центральную роль в нашей идентичности. Они являются проводниками между нашей реальной и офлайновой жизнями, а также нитью, соединяющей наши настоящие анонимные и псевдонимные «я»

Однако, я думаю, что технологии как таковые запрещать нельзя. Нужно выстраивать разумное регулирование и развивать компетенции по технологическому контролю, а не правовому. Спрятаться от технологий невозможно, нужно учиться с ними жить.

#почитатьнатему
Про Privacy на законодательном уровне.

Этические принципы работы с данными должны быть интегрированы в законодательство, но не всегда результат соответствует заявленным целям. Разберем на примере регулирования конфиденциальности (Privacy).

Текущее законодательство воспринимает Privacy как контроль над информацией о себе. И сейчас такой подход работает плохо, т.к.:
1. Контроль иллюзорный - т.е. нам дают выбрать не из всего множества вариантов, а из ограниченного множества. Как маленьким деткам.
2. Контроля слишком много - т.е. у каждого приложения/программы/техники есть несколько вариантов контроля информации и мы просто не справляемся с объемами выбора.
3. Контроль миопический - т.е. представления об индивидуальном контроле плохо согласуются с неприкосновенностью частной жизни как коллективной ценностью. Большое количество исследований показывает, что предпочтения людей в отношении конфиденциальности неопределенны, зависят от контекста и изменчивы. Доступность знаний не обязательно приводит к принятию осмысленно обоснованных решений. Иногда нужно принять решение на государственном уровне - общее для всех и ведущее к коллективному благу, а не оставлять решение на уровне пользователя.

Такой подход в к Privacy в законодательстве не решает проблемы с конфиденциальностью в целом. Поэтому так важны этические принципы. Сведение норм работы с данными только к исполнению законов не приведет к общественном благу.

#переходкэтичному
👍1
Future is here.

Ну и бонусом сегодня кусочек чата c ИИ. Это новый продукт Open AI - ChatGPT, заметки о котором я читаю уже почти неделю, наверно. Его способности удивляют. Он может поддержать разговор на любую тему, решает задачи по математике и физике, и даже дает неплохие жизненные советы. Пишут, что к нему прикручена отдельная нейронка, отвечающая за мораль, чтобы не вышло как с Tay.AI, видимо. Классно.
Про хрупкость анонимности и про легкость слежки.

Мне очень нравятся такие кейсы, когда казалось бы довольно отстраненные от человека данные в итоге влегкую на него выводят. Так было и с Netflix, когда на основании анализа пользовательских предпочтений исследователи смогли идентифицировать самих пользователей, и с самолетом Маска, когда сайт отслеживания воздушных перемещений позволяет отслеживать конкретного человека, и теперь вот сведения о парковках.

Фанаты приватности сделали целый сайт чтобы показать: европейские парковочные приложения позволяют отслеживать положение и перемещение практически любого автомобиля просто по номеру. Т.е. по сути я могу подписаться на обновления местоположения для любого номерного знака, который я хочу, без ведома или согласия владельца этого автомобиля.

Благо есть GDPR, и разработчики сайта готовы сами автоматически требовать от создателей парковочных приложений “удалить данные о вашем автомобиле”, - просто заполните форму.

#кейсдатаэтики
(история взята отсюда: https://t.me/addmeto)
Про сбор данных для обучения ИИ.

Сегодня немного о сборе данных вне контекста этики.

Open AI, чат-бот которого ChatGPT сейчас просто меняет мир на наших глазах, занимается ML, и вот выложил результат своих очередных упражнений.

Они обучили нейронку играть в Minecraft на огромном немаркированном наборе видеоданных о том, как люди играют в Minecraft, при этом используя лишь небольшое количество размеченных данных. Обучали так: сначала записали, как совсем немного пользователей играют - 2 тысячи часов нажатия клавиатуры и мыши и видео с экрана. После этого с помощью нейронки научились понимать, какие кнопки нажимает игрок просто по видео, без записей нажатия. И тогда для обучения стали доступны более 70 тысяч часов видео, скачанные просто из сети (в данном случае с YouTube и Twitch). Такой подход назвали Video PreTraining (VPT).

Это очередной пример того, как используют публичные данные для обучения ИИ.

Вот еще один разбор того, как модные нынче системы генерации изображений (такие как Dall-e и Midjourney) используют датасеты, состоящие из картинок в интернете. И если ваша картинка доступна в интернете — у вас нет простого способа отказаться от того, чтобы она использовалась для обучения ИИ. С юридической точки зрения все в порядке, если изображение доступно для "просмотра", значит оно подходит и для обучения — закон пока не умеет различать обучение живого человека или ИИ.

#кейсиспользованияданных
Вопрос с авто-удалением рабочей переписки интересен еще и с точки зрения этичности. Я как-то писала, что новые технологии будут ставить перед нами и новые этические вопросы, помимо уже существующих, и вот, пожалуйста. Я пока для себя не решила, этично ли это. Вы как думаете?

#кейсдатаэтики
⬇️⬇️⬇️