Саваровская | Интересное о данных
87 subscribers
12 photos
116 links
Про то, как данные влияют на людей — и наоборот. О честности, культуре и здравом смысле в эпоху ИИ.

Для связи (прислать мне что-то интересное, например) - @savarovskaya
Download Telegram
Про важность больших данных.

Судя по тому, что думают сами разработчики об ИИ, и сколько скандалов возникает из-за использования данных для обучения моделей, вполне возможно, что скоро обладание большими и качественными датасетами станет настоящим конкурентным преимуществом.

Довольно очевидно, у кого такие датасеты есть:
1. Google - поисковое поведение, пользовательские видео-предпочтения (YouTube)
2. Meta - предпочтения реальных людей и поведенческие паттерны
3. Amazon - покупательские предпочтения.

Из неочевидных:
а) Tesla - знание об окружающем мире
б) Apple, Google - маршруты людей

Кто-то еще? И скоро ли появятся инициативы о том, что большие данные, которые многие уже давно называют "новой нефтью", начнут регулироваться как ресурс (государственный)?

#подуматьнатему
🔥1
#короткиезаметки

Была вчера на мероприятии, посвященном внедрению ИИ в организациях. Один из участников озвучил мысль, про которую я уже читала, но не помню где. Мы массово и быстро начнем использовать GenAI везде, потому что это pull технология, а не push. Никто ее не внедрят, люди сами хотят использовать. Как в свое время смартфоны и онлайн поиск.
🔥2🤔1
#короткиезаметки

В качестве итогов года скажу, что очень много в этом году пользовалась ChatGPT - и для работы, и для развития, и для развлечения. Умение пользоваться поиском Google в итоге вылилось в отдельный навык и слово "гуглить". Умение пользоваться ИИ-чатами тоже скоро не будет чем-то особенным. А прокачать умение можно здесь (гайд от OpenAI) - отличное занятие на каникулы.

PS: Спасибо, что были тут со мной в этом году, очень ценю!
🔥4
Про ИИ и экологию.

Тренировка и разработка крупных языковых моделей, таких как ChatGPT, требуют значительного количества энергии, что приводит к серьезным экологическим последствиям. Например, ChatGPT в год выделяет около 8.4 тонн углекислого газа. Однако, некоторые инициативы разработчиков ИИ направлены на снижение влияния человека на экологию. Я уже писала про автоматизацию светофоров. Еще тот же Google и American Airlines использовали ИИ для снижения количества конденсационных следов самолетов, способствующих глобальному потеплению. Кроме того, Google применяет ИИ для прогнозирования наводнений на реках и предложения экологически чистых маршрутов в своем картографическом сервисе.

Интересно, приведут ли эти инициативы в совокупности с генерируемыми выбросами к NetZeroWorld?

#кейсдатаэтики
👍2
Про скорость внедрения новых технологий.

На международном экономическом форуме в Давосе основным из основных вопросов в повестке стал ИИ.

Итоги интересного исследования были рассказаны PwC. В своем последнем годовом опросе глав компаний было выявлено, что около половины (42%) британских руководителей внедрили новейшие технологии в прошедшем году. Это существенно превышает мировой показатель, который составил 32%.

Исследование, охватившее 4702 генеральных директоров из 105 стран, показало, что Великобритания является одним из лидеров в применении генеративного ИИ, который управляет такими чат-ботами, как ChatGPT, и создателями изображений, например, Midjourney. В сравнении, только 9% немецких и 20% французских глав компаний начали использовать GenAI. Среди американских и китайских руководителей этот показатель составил 38% и 25% соответственно. Более высокие темпы внедрения показали только Норвегия (53%), Япония (50%) и Финляндия (49%).

Кевин Эллис, ведущий партнер в PwC UK, отметил: «Преодолевая экономические трудности, британские руководители ищут новые решения для прорыва. GenAI открывает критически важный момент: если его правильно использовать, он может значительно повысить эффективность, конкурентоспособность и, в конечном счете, прибыльность компаний».

Вот у вас в компании внедряют GenAI?

#почитатьнатему
Про обучение ИИ и интеллектуальные права.

Не первая попытка СМИ заставить платить за свой контент может окончиться провалом. Вообще тут я на стороне СМИ в части оплаты их труда, но хорошее решение все еще не найдено, как мне кажется.

#кейсдатаэтики
⬇️⬇️⬇️
👍1
Forwarded from Denis Sexy IT 🤖
Если вы помните, издание NY Times, в конце того года, подало в суд на OpenAI – якобы, в моделях OpenAI находится множество их статей, поэтому NY Times требуют уничтожить все модели натренированные с применением их данных (а это и GPT 3.5, GPT 4 и все эти тысячи опенсорсных моделей которые натренированы на ответах GPT 4).

Юристы которых я читал, говорят, что NY Times просто добивается лицензирования своего контента, так как это денюжки, а у OpenAI они есть, и что закончится все соглашением сторон – обычное дело в мире юристов.

Но интернету не понравилось как NY Times сформулировала свою угрозу, так как если «в теории» они выиграют, то сильно пострадает мир опенсорса.

Чувак с реддита, с помощью языковой модели, проанализировал в деталях стиль написания статей NYC Times и сделал на этой основе открытый датасет для включения в будущие тренировки.

У датасета хорошая лицензия MIT и он по сути учит языковую модель писать статьи в стиле NY Times, но не нарушает копирайты:
https://huggingface.co/datasets/TuringsSolutions/NYTWritingStyleGuide

Стрейзант эффект на уровне датасетов 🍿
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Про ИИ и Олимпийские игры.

Давно я тут не писала, но тема дата-этики не перестала быть мне интересной. Я все еще раскачиваю навык видеть данные в любом событии. В том числе потому что последнее время (по работе) проповедую мысль, что данные есть под любым процессом. Вот например, мне тут на днях подарили бейсболку с олимпийским мерчом и я вспомнила про эту новость.

Понятно, что Олимпийские игры сами по себе очень напряженное мероприятие, но в этот раз организаторы обеспокоены еще и тем, что летние игры могут быть особенно жестокими из-за политических столкновений и конфликтов на Ближнем Востоке и в Европе.

МОК прогнозирует около 500 миллионов постов в соцсетях, связанных с Олимпиадой в этом году — и не все из них будут дружелюбными. "Если бы кто-то тратил одну секунду на прочтение каждого поста, это заняло бы 16 лет," — заявил президент МОК Томас Бах на прошлой неделе.

И вот тут в игру вступает ИИ и этика данных: МОК планирует использовать ИИ-инструмент, который будет отмечать и удалять оскорбительные посты на более чем 35 языках, чтобы защитить 15 000 спортсменов и организаторов от травли.

К тому же, эта инициатива также поможет исследователям понять масштаб проблемы — и как оскорбления могут влиять на благополучие спортсменов. Это будет первый случай использования ИИ для защиты такого большого числа спортсменов одновременно.

#кейсдатаэтики
👍5
Channel name was changed to «Саваровская | Интересное о данных»
Привет! У нас тут внезапно прибавилось подписчиков, поэтому это отличный момент, чтобы познакомиться и обновить название канала :)

Меня зовут Ольга Саваровская. Я уже давно работаю с данными. Раньше я работала с госданными, например, участвовала в большом проекте по улучшению качества данных и разрабатывала концепцию управления госданными. Сейчас я работаю менеджером по управлению данными в крупной ритейл-компании и одновременно являюсь амбассадором по безопасности и конфиденциальности данных в компании. В сферу моих интересов входят управление данными, конфиденциальность и защита данных, этика и использование данных, анализ и аналитика, а теперь ещё и искусственный интеллект, как логичное продолжение всех этих тем. Мне интересно рассматривать эти вопросы через призму их социально-экономического влияния. В этом канале я делюсь интересными кейсами из этих сфер. Раньше я больше фокусировалась на дата-этике, но со временем круг моих интересов расширился, хотя изначальная тема всё равно остаётся приоритетной.

Буду рада, если вы тоже будете делиться со мной соответствующими новостями и кейсами.
👍5🔥4
Саваровская | Интересное о данных pinned «Привет! У нас тут внезапно прибавилось подписчиков, поэтому это отличный момент, чтобы познакомиться и обновить название канала :) Меня зовут Ольга Саваровская. Я уже давно работаю с данными. Раньше я работала с госданными, например, участвовала в большом…»
Про устойчивый ИИ и энергопотребление.

Я тут недавно была на корпоративном тренинге, и там мы в том числе обсуждали интересную тему — устойчивый ИИ (Sustainable AI).

Одним из вопросов была энергопотребляемость современных языковых моделей, таких как ChatGPT. Оказывается, один запрос может потреблять около 0,0003 кВт⋅ч энергии. Получается, что миллионы пользовательских запросов ежедневно могут потреблять до 1 ГВт⋅ч энергии, что эквивалентно потреблению электроэнергии 33 тысяч домохозяйств. Углеродный след, который может достигать 7-15 тонн CO2 в день, что эквивалентно углеродному следу от примерно 1000 автомобилей в день. Интересно, что придумают завтра, чтобы минимизировать этот эффект? Думаю, научатся оптимизировать. Сложно представить, какую новую технологию тут можно придумать.

#подуматьнатему
👍2😱2
Про анализ данных в модной индустрии.

Прочитала недавно книгу об экономике моды Дональда Томпсона «Звездная экономика fashion-индустрии: миллениалы, инфлюэнсеры и пандемия» (мне вообще очень интересно, как работает внутрянка и экономика разных индустрий, а этот автор отличный, так что книгу рекомендую). Там есть несколько крутых примеров работы с данными в отрасли. Например, в книге упоминается тот давний скандал с Cambridge Analytica. Оказывается, они изучали потребительское поведение (включая предпочтение людей в сфере модных брендов) как фактор, позволяющий определить политическую ориентацию. К примеру, если человек любит традиционные американские лейблы типа Ralph Lauren или Hollister, у него, скорее всего, будут низкие показатели по шкале «открытости к новому» - иначе говоря, высокая нетерпимость и консерватизм. Поклонники же экстравагантных, не вписывающихся в стереотипы европейских марок, таких как Kenzo, практически наверняка проголосуют за демократов. Любители марок Alexander McQueen, Louis Vuitton и Stella McCartney тоже в основном демонстрировали приверженности либеральным взглядом. Понятно, что разработчики использовали готовые «нарративы, порожденные модой и массовой культурой», т.е учитывали политику и позиционирование самого бренда. Как много можно о нас узнать просто по нашим лайкам шмоток?

#кейсдатаэтики
👍5🔥2
Про изменения музыкальной индустрии.

Я вот думаю, если сгенерированной ИИ музыки становится все больше, то музыка, написанная людьми, в какой-то момент превратится в эксклюзивный контент. И будет такой контент востребован только ценителями. Напрашивается аналогия с ресторанным бизнесом, где созданная ИИ музыка - сетевые кафе, а созданная людьми - рестораны Мишлен. Или не так это будет работать?

#удивительныйновыймир
⬇️⬇️⬇️
Forwarded from TechSparks
Музыканты продолжают попытки остановить распространение музыки, созданной и исполненной алгоритмами. Одна из важных для них текущих целей — Spotify.
Платформа с самого начала заняла весьма инклюзивную позицию, официально заявив, что компания “does not have a policy against artists creating content using autotune or AI tools, as long as the content does not violate our other policies” — но это совершенно не устроило некоторых белковых музыкантов. Созданные ИИ треки пока не поднимаются в топ, зато они успешно отбирают деньги у средней руки исполнителей по принципу “десять старушек — рупь”: Если синтетических авторов много и каждый по-машинному плодовит, то в итоге им набегает заметная денежка, а объем прослушиваний конечен — то есть эти деньги уходят от белковых исполнителей.
Людям ИИ-треки нравятся, поэтому музыканты занимают привычную им позицию: важны не интересы слушателей, а только их собственные, поэтому требуют и привычных мер — от полного запрета до специальных меток и исключения из рекомендательной ленты.
https://www.fastcompany.com/91170296/spotify-ai-music
👍2
Про проверку ИИ.

Sasha Luccioni, исследовательница в сфере ИИ, в прошлом году на TED говорила об актуальных рисках ИИ. Она упомянула несколько интересных инструментов, которые могут помочь справиться с этими проблемами.

1. Экология. Недавно я уже писала об устойчивом развитии. Саша отмечает, что чем больше ИИ-модель, тем больше энергии она потребляет. Поэтому важно придерживаться принципа, похожего на тот, что используется в GDPR: использовать столько ресурсов, сколько необходимо, но не больше. То есть, если можно обойтись меньшей моделью — лучше использовать её.

2. Авторское право. Мы уже касались этой темы. Художники обеспокоены тем, что ИИ-модели обучаются на их работах без их согласия. Саша показала интересный инструмент, который позволяет искать информацию в датасете, на котором обучалась модель. Забавно, что по ее имени с помощью инструмента находятся несколько ее фотографий, а также изображения других девушек в бикини. Поэтому, когда она просит ИИ изобразить её, тот рисует её в купальнике :)

3. Предвзятость (bias). Это уже давно обсуждаемая тема в ИИ-сообществе. Например, по умолчанию модели лучше распознают белых мужчин. И если спросить ИИ о почти любой профессии, он чаще всего представляет белого мужчину. Разработанный инструмент позволяет проверить, предвзята ли модель, на нескольких примерах.

Саша еще показывала эти инструменты в ООН. И это интересно, потому что регулирование ИИ может пойти в направлении поиска подобных доказательств. Может даже не только регулирование, но и судебная практика.

#посмотретьнатему
👍3
Про темные паттерны.

Послушала тут классный подкаст про темные паттерны. Логика работы многих таких паттернов понятна - сыграть на том, что человек действует автоматически. Но один из примеров прям сильно удивил.

Оказывается, некоторые приложения иммитируют персонификацию. При регистрации заполняешь большую анкету. При этом приложение тебе говорит, что контент теперь персонифицирован. Да и времени, потраченного на анкету, жалко. И ты начинаешь платить за этот сервис, хотя никакой персонификации там нет. Очень интересно получается.

Вообще, самый дурацкий паттерн, с которым я столкнулась - это попытка отписаться от платной рассылки Wall Street Journal. Для того, чтобы это сделать, им нужно было позвонить!

Вам попадается такое же бесящее? Типа нагнетание упущенной возможности на booking.com «остался последний номер»?

#кейсдатаэтики
👍3
Про скаммеров.

Начальник тут поделился интересным видео, о том, что O2 создали ИИ-бабулю, которая отвечает на звонки скаммеров и подолгу с ними разговаривает, тратя их время и нервы.

Вообще, идея забавная. Но системно мне не очень нравится такой подход. Как мне кажется, нужно бороться с корнем проблемы, а не результатами. Через какое-то время скаммеры научатся и такое обходить.

#кейсииэтики
👏2👍1
#короткиезаметки

Увидела тут классный рилс, подтверждающий тезис, что ИИ сейчас отражает то, что человек делает и все его предрассудки, ошибки, косяки и хитрости. Правда это не прямой пример, а вариативность - бывает и так. ИИ выражается мнение не основаное на данных, а основанное на мнении/работе разработчика :)

#кейсииэтики
😁1
Про этические принципы.

Я как-то писала, что мне кажется интересной идея инициации кодекса этики дата-аналитика на подобии клятвы Гиппократа. Так вот, оказалось, что этические принципы работы с данными, сформулированные в DMBoK*, основаны на медицинских/био этических принципах (меня немного тряхнуло от восторга, когда я узнала об этом :) )

Вот они:
1. Принцип благодеяния: Не причиняйте вреда, максимально увеличивайте возможные выгоды и минимизируйте возможный ущерб.
2. Принцип справедливости: Обеспечивайте честное и равное отношение ко всем людям.
3. Принцип уважения к личности: Относитесь к людям с уважением к их достоинству и автономии как к самостоятельным личностям.

Ну и немного инсайдерской информации. Сейчас ведется активная работа по обновлению DMBoK 2 и скоро (наверно, пара лет на самом деле) будет DMBoK 3, в котором этике работы с данными уделят гораздо большее внимание.

*Data Management Body of Knowledge - свод знаний по управлению данными, DMBoK представляет собой набор лучших практик, стандартов, процессов и рекомендаций для профессионалов в области управления данными.

#почитатьнатему
👍4