Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
Forwarded from TechSparks
Музыканты продолжают попытки остановить распространение музыки, созданной и исполненной алгоритмами. Одна из важных для них текущих целей — Spotify.
Платформа с самого начала заняла весьма инклюзивную позицию, официально заявив, что компания “does not have a policy against artists creating content using autotune or AI tools, as long as the content does not violate our other policies” — но это совершенно не устроило некоторых белковых музыкантов. Созданные ИИ треки пока не поднимаются в топ, зато они успешно отбирают деньги у средней руки исполнителей по принципу “десять старушек — рупь”: Если синтетических авторов много и каждый по-машинному плодовит, то в итоге им набегает заметная денежка, а объем прослушиваний конечен — то есть эти деньги уходят от белковых исполнителей.
Людям ИИ-треки нравятся, поэтому музыканты занимают привычную им позицию: важны не интересы слушателей, а только их собственные, поэтому требуют и привычных мер — от полного запрета до специальных меток и исключения из рекомендательной ленты.
https://www.fastcompany.com/91170296/spotify-ai-music
👍2
Про проверку ИИ.

Sasha Luccioni, исследовательница в сфере ИИ, в прошлом году на TED говорила об актуальных рисках ИИ. Она упомянула несколько интересных инструментов, которые могут помочь справиться с этими проблемами.

1. Экология. Недавно я уже писала об устойчивом развитии. Саша отмечает, что чем больше ИИ-модель, тем больше энергии она потребляет. Поэтому важно придерживаться принципа, похожего на тот, что используется в GDPR: использовать столько ресурсов, сколько необходимо, но не больше. То есть, если можно обойтись меньшей моделью — лучше использовать её.

2. Авторское право. Мы уже касались этой темы. Художники обеспокоены тем, что ИИ-модели обучаются на их работах без их согласия. Саша показала интересный инструмент, который позволяет искать информацию в датасете, на котором обучалась модель. Забавно, что по ее имени с помощью инструмента находятся несколько ее фотографий, а также изображения других девушек в бикини. Поэтому, когда она просит ИИ изобразить её, тот рисует её в купальнике :)

3. Предвзятость (bias). Это уже давно обсуждаемая тема в ИИ-сообществе. Например, по умолчанию модели лучше распознают белых мужчин. И если спросить ИИ о почти любой профессии, он чаще всего представляет белого мужчину. Разработанный инструмент позволяет проверить, предвзята ли модель, на нескольких примерах.

Саша еще показывала эти инструменты в ООН. И это интересно, потому что регулирование ИИ может пойти в направлении поиска подобных доказательств. Может даже не только регулирование, но и судебная практика.

#посмотретьнатему
👍3
Про темные паттерны.

Послушала тут классный подкаст про темные паттерны. Логика работы многих таких паттернов понятна - сыграть на том, что человек действует автоматически. Но один из примеров прям сильно удивил.

Оказывается, некоторые приложения иммитируют персонификацию. При регистрации заполняешь большую анкету. При этом приложение тебе говорит, что контент теперь персонифицирован. Да и времени, потраченного на анкету, жалко. И ты начинаешь платить за этот сервис, хотя никакой персонификации там нет. Очень интересно получается.

Вообще, самый дурацкий паттерн, с которым я столкнулась - это попытка отписаться от платной рассылки Wall Street Journal. Для того, чтобы это сделать, им нужно было позвонить!

Вам попадается такое же бесящее? Типа нагнетание упущенной возможности на booking.com «остался последний номер»?

#кейсдатаэтики
👍3
Про скаммеров.

Начальник тут поделился интересным видео, о том, что O2 создали ИИ-бабулю, которая отвечает на звонки скаммеров и подолгу с ними разговаривает, тратя их время и нервы.

Вообще, идея забавная. Но системно мне не очень нравится такой подход. Как мне кажется, нужно бороться с корнем проблемы, а не результатами. Через какое-то время скаммеры научатся и такое обходить.

#кейсииэтики
👏2👍1
#короткиезаметки

Увидела тут классный рилс, подтверждающий тезис, что ИИ сейчас отражает то, что человек делает и все его предрассудки, ошибки, косяки и хитрости. Правда это не прямой пример, а вариативность - бывает и так. ИИ выражается мнение не основаное на данных, а основанное на мнении/работе разработчика :)

#кейсииэтики
😁1
Про этические принципы.

Я как-то писала, что мне кажется интересной идея инициации кодекса этики дата-аналитика на подобии клятвы Гиппократа. Так вот, оказалось, что этические принципы работы с данными, сформулированные в DMBoK*, основаны на медицинских/био этических принципах (меня немного тряхнуло от восторга, когда я узнала об этом :) )

Вот они:
1. Принцип благодеяния: Не причиняйте вреда, максимально увеличивайте возможные выгоды и минимизируйте возможный ущерб.
2. Принцип справедливости: Обеспечивайте честное и равное отношение ко всем людям.
3. Принцип уважения к личности: Относитесь к людям с уважением к их достоинству и автономии как к самостоятельным личностям.

Ну и немного инсайдерской информации. Сейчас ведется активная работа по обновлению DMBoK 2 и скоро (наверно, пара лет на самом деле) будет DMBoK 3, в котором этике работы с данными уделят гораздо большее внимание.

*Data Management Body of Knowledge - свод знаний по управлению данными, DMBoK представляет собой набор лучших практик, стандартов, процессов и рекомендаций для профессионалов в области управления данными.

#почитатьнатему
👍4
Про сертификацию.

Сегодня пришло подтверждение, что я теперь Certified Data Management Professional (CDMP). Это важная для меня веха. Я давно об этом думала, года так с 2018, когда узнала про DMBoK.

Для подготовки к экзамену я прошла трехдневный тренинг. На нем не учат новому, просто готовят к самому экзамену, потому что сдать его без реальной практики работы с данными невозможно.

Был забавный момент. Я висела в листе ожидания на тренинг, и тут мне предложили присоединиться к закрытой группе, потому что там не хватало людей. И вот мы представляемся: кто, откуда, с каким опытом. И оказывается, что один человек из авиационной службы Британии, другой из полиции и еще двое из МВД. И я тут такая, со своим опытом работы в госструктурах РФ. Стушевались немного ребята, конечно. Но ничего, отошли.

Они спрашивали, например, что делать с хранением данных, которые нужно хранить 100 лет (тут можно погадать, какие госданные нужно хранить столько времени). Как выбирать и менять носители под них. Как разрабатывать процедуры.

В целом, классный был тренинг. И результативный. Так что если вам нужна помощь с управлением данных, я еще и «корочкой» могу помахать :)
👍9🔥3👏3
Про культуру работы с данными и будущее

Одним из фокусов моей работы сейчас является внедрение дата-ориентированной культуры (data culture).

Тут сразу небольшое отступление. Из-за того, что я теперь работаю на английском, стало очень сложно формулировать профессиональные идеи по-русски. Поэтому извините за такой неровный текст, это перевод :)

Темп, с которым развивается ИИ, стал просто бешеным. Я уже не уверена, что те принципы, которые мы вкладывали в управление данными, до сих пор актуальны. Например, менеджмент метаданных. Зачем описывать данные, если технологии теперь понимают и без описания, что к чему (это, конечно, спорная позиция, но очень вероятно, что все туда и идет).

Единственное, в чем я все еще уверена, это то, что работа с людьми до сих пор важна. Важно быть с данными «на ты», развивать и навыки, и критическое мышление. Поэтому, чтобы быть максимально эффективной в долгосрочной перспективе, я сместила фокус на работу с людьми. Именно туда, мне кажется, двигается моя профессия.

Все профессии поменяются из-за ИИ. Понимаете ли вы, как поменяется ваша профессия? Готовы ли вы к этому?

#подуматьнатему
👍1
Про особенности местной отрасли данных и ИИ.

Была тут на мероприятии для дата-лидеров. Очень солидная была панель, ребята из Mistral AI, Stripe, Manna Air Delivery, Scaleway и т.д. И довольно интересные штуки обсуждали.

Местные, конечно, больше сконцентрированы на конкуренции с США, думают, как уменьшить зависимость и нарастить практики. Среди ограничений называют сегментированное по отраслям регулирование в некоторых странах и, конечно, недостаток и скорость финансирования. Среди точек роста называют Data Literacy.

Вообще я думаю в индустрии данных Data Literacy будет «новым черным». Если открыть сейчас список преимуществ и недостатков ИИ, то легко можно заметить, что риски описаны подробно и очень выверенно, тогда как преимущества очень расплывчаты. И не потому, что их нет, а потому что use cases очень мало. Компании пока реально не понимают, как внедрить ИИ, потому что люди пока мыслят в категории автоматизации процессов, а не изменения их полностью или создания новых. Одно из предложений по внедрению ИИ от панелистов было пойти к сотрудникам первичного звена и спросить, зачем им ИИ в работе сегодня, а не с начальниками стратегии обсуждать. Разработчиков тоже постоянно не хватает, хотя казалось бы.

Качества данных тоже коснулись, конечно. Но эта тема уже всем набила оскомину, мне кажется. Потому что все понимают, что данные должны быть качественными, но так как нет хороших use cases, риск некачественных данных не срабатывает и все только говорят, а не делают.

Пыталась немного понетворкать - поспрашивать про use cases опять же. Ничего интересного, кроме чат-ботов для покупателей и обработчиков CV не нашла.

#подуматьнатему
👍2
Про интересное с конференции.

Была тут на Analytics and AI Summit, слушала интересных людей. В рамках развития data culture затащила туда всю команду. Вообще, очень много говорили именно о культуре работы с данными, и как ее внедрять.

1. Один спикер рассказывал, что когда он был data insights manager, у него были прям отличные отношения со всеми заинтересованными сторонами, но как только он перешел на роль data governance manager (это я), то сразу столкнулся с игнорированием. Тут, конечно, ползала выдохнуло. Потому что это вечная проблема - заставить всех «правильно» работать с данными. Вообще неблагодарное дело.

2. Одна докладчица говорила о том, как вообще внедрять дата-культуру. Один из KPI, как известно, сокращение раб.часов. Она предлагала не просто считать эти часы, а идти в фин.деп. и отслеживать, куда эти сэкономленные часы ушли. Тогда начальству становится более очевидна выгода от внедрения дата-практик.
👍3👏1
3. Еще одна спикерка говорила о важности правильной визуализации данных. В эпоху роста объёмов данных и ИИ конкуренция за внимание растёт: если визуализация не цепляет, возникает риск, что важные инсайты не будут замечены. Например, нужно связывать данные с историей: начать с вопроса или сюжета, затем показать цифры как часть рассказа, а не как набор независимых метрик (как на картинке - сразу видна история).

#подуматьнатему
Еще с конференции.

Были некоторые спикеры, презентациями которых я прям восхищалась. Видно, что люди хорошо готовились. Например, Ash Hunt (Cyera) говорил о рисках и безопасности. Его доклад был очень плотный, с глубокими сложными идеями, явно долго готовившийся и прекрасно представленный.

Вот несколько интересных мыслей:
«Latency is the new downtime»: будущее безопасности — data-centric. Критично сокращать лаг между появлением данных и принятием решения; задержки равносильны простоям.
Агенты и сжатие иерархий: через призму теории игр показал, как рост данных и доступов ведёт к «скачкообразному равновесию» — решения всё чаще принимают человек+машина/агенты, и традиционные уровни согласований сокращаются.
Мыслить через компромиссы: «нет решений без trade-offs» — каждый выбор в ИИ/безопасности балансирует скорость vs контроль, приватность vs ценность, автономию агентов vs ответственность.

У меня от сложности речи буквально закипала голова, и при этом я испытывала прям удовольствие — когда мозг работает на пределе, ты ещё что-то улавливаешь, но уже чувствуешь, как бурлит внутри.

#подуматьнатему
🤔2
Про ограничения и возможности.

Часто вижу как в ИТ сообществе хейтят законодательство ЕС и GDPR в частности. Иногда даже кто-то может бросить фразу, что правительства только усложняют все, не хотят идти простому потребителю на встречу.

Но если остановится на секунду и подумать, зачем действительно нужны эти законы. Разве не затем, чтобы сохранить базовые права каждого человека?

Как мы мерим отставание в технологиях? В крутости новой фичи или в том, сколько реально блага она может принести каждому из нас?

#подуматнатему #датаэтика #ииэтика
Будущее управления данными.

А сейчас расскажу как из предыдущей мысли вытекает идея смены профессии, следите за руками :)

Разговоры про регулирование сейчас снова ведутся с удвоенной силой, потому что с 2026 года должны вступить в силу оставшиеся положения EU AI Act, принятого в 2024. Эти положения, естественно, самые сложные в исполнении (поэтому они и последние). EU AI Act сам по себе можно считать надстройкой над GDPR - отлично видно, как принципы, заложенные в одном законе, зеркалятся в другом.

Моя профессия сейчас Data Governance. AI Governance как область знаний уже появилась. Регулирование появилось. Значит и роль такая должна быть (и я уже вижу вакансии на LinkedIn).

Как все связано?
Data Governance – «управляем данными как активом» - без этого ИИ нормально не взлетит.
AI Governance – «управляем моделями и их воздействием на людей/бизнес» - опирается на Data Governance + Risk + Compliance.

В чем главный фокус сейчас в индустрии?
От “data governance как бюрократия” к “data&AI enablement”. Фокус не только на политике и контроле, а на том, как помочь бизнесу быстрее и безопаснее использовать данные и ИИ. Data Governance становится частью product thinking: data products, AI products, domain ownership.

Получается, даже Data Governance трансформируется, и одно без другого уже не будет работать.

Когда я училась в университете, профессии data governance не было совсем. И еще через лет 5 ее уже не будет в том виде, в каком она существует сейчас.
👍3