Добро пожаловать в канал о качестве данных 😊
Что такое качество данных?
Качество данных - Data Quality - характеристика, показывающая степень пригодности данных к дальнейшему использованию, их соответствие предъявленным требованиям.
Например, если внезапно телефон покажет, что сегодня – сентябрь 2007 года, а доллар стоит 25 рублей, это будут однозначно некачественные данные. Ну или подтверждение работоспособности машины времени 😊
Обычно качество измеряют по нескольким критериям, чаще всего в совокупности: достоверность, точность, полнота, согласованность, доступность, надежность, своевременность, актуальность, уникальность и другие.
На пригодность данных для работы влияет сфера применения или направление отдела, который с ними работает, а также критерии оценки. Одни и те же данные могут быть пригодны для работы маркетинга, а для аналитиков – нет.
Данные в одной организации могут использоваться по-разному: для построения хранилищ данных, для дальнейшей переработки и построения витрин данных, для построения дашбордов с метриками качества данных, ведения справочников и предоставления информации конечному потребителю.
Знакомы ли вы с этим направлением деятельности? Есть ли в вашей организации подразделение, занимающееся качеством данных?
#качестводанных #dataquality
Качество данных - Data Quality - характеристика, показывающая степень пригодности данных к дальнейшему использованию, их соответствие предъявленным требованиям.
Например, если внезапно телефон покажет, что сегодня – сентябрь 2007 года, а доллар стоит 25 рублей, это будут однозначно некачественные данные. Ну или подтверждение работоспособности машины времени 😊
Обычно качество измеряют по нескольким критериям, чаще всего в совокупности: достоверность, точность, полнота, согласованность, доступность, надежность, своевременность, актуальность, уникальность и другие.
На пригодность данных для работы влияет сфера применения или направление отдела, который с ними работает, а также критерии оценки. Одни и те же данные могут быть пригодны для работы маркетинга, а для аналитиков – нет.
Данные в одной организации могут использоваться по-разному: для построения хранилищ данных, для дальнейшей переработки и построения витрин данных, для построения дашбордов с метриками качества данных, ведения справочников и предоставления информации конечному потребителю.
Знакомы ли вы с этим направлением деятельности? Есть ли в вашей организации подразделение, занимающееся качеством данных?
#качестводанных #dataquality
Когда нужно проверять данные?
Данные, если верить википедии – это зарегистрированная информация, представление фактов, понятий или инструкций в форме, приемлемой для общения, интерпретации, или обработки человеком или с помощью автоматических средств.
Для правильной интерпретации и предоставления заказчиками корректных данных, необходимо убедиться в их качестве. Это является необходимым этапом любого проекта, подразумевающего любой анализ данных, потому что иначе алгоритмы будут давать некорректные результаты.
Если планируется любое переиспользование данных, их нужно проверять, ведь их качество влияет и на принятие решений о дальнейших действиях, и на инвестиции, и на адаптацию к изменениям извне, и помогает понимать клиентов, и распределять ресурсы, и еще много чего.
А если переиспользовать данные не планируется – то зачем они вам вообще?
Проверяете ли вы данные, которые используете?
#качестводанных #dataquality
Данные, если верить википедии – это зарегистрированная информация, представление фактов, понятий или инструкций в форме, приемлемой для общения, интерпретации, или обработки человеком или с помощью автоматических средств.
Для правильной интерпретации и предоставления заказчиками корректных данных, необходимо убедиться в их качестве. Это является необходимым этапом любого проекта, подразумевающего любой анализ данных, потому что иначе алгоритмы будут давать некорректные результаты.
Если планируется любое переиспользование данных, их нужно проверять, ведь их качество влияет и на принятие решений о дальнейших действиях, и на инвестиции, и на адаптацию к изменениям извне, и помогает понимать клиентов, и распределять ресурсы, и еще много чего.
А если переиспользовать данные не планируется – то зачем они вам вообще?
Проверяете ли вы данные, которые используете?
#качестводанных #dataquality
👍1
На что проверять данные?
Один из основных вопросов, который появляется, когда принято решение о необходимости проверки данных – на что их проверять?
Для начала, рекомендуется провести профилирование имеющихся данных – узнать, какие данные есть, из каких источников поступают, как часто обновляются. Закрыты ли этими данными все требования, или их не хватает.
После профилирования становится понятно, где есть «просадки», «выбросы», на что нужно обратить особое внимание.
Обычно, начинают с проверок на дубликаты, на аномальные выбросы, на полноту данных, их целостность, точность, актуальность, уникальность и достоверность.
Затем добавляют уже точечно, нужные именно вашему процессу проверки – на объем, своевременность, доступность, согласованность и другие.
Список проверок может быть огромным, и какие именно данные и на что именно проверять – зависит от процессов, в которых эти данные используются и как часто обновляются, а еще от того, где, как и кем проверяются до вас.
Как думаете, есть ли важные и не важные проверки? Если да, то какие важны, а какие – не очень?
#качестводанных #dataquality
Один из основных вопросов, который появляется, когда принято решение о необходимости проверки данных – на что их проверять?
Для начала, рекомендуется провести профилирование имеющихся данных – узнать, какие данные есть, из каких источников поступают, как часто обновляются. Закрыты ли этими данными все требования, или их не хватает.
После профилирования становится понятно, где есть «просадки», «выбросы», на что нужно обратить особое внимание.
Обычно, начинают с проверок на дубликаты, на аномальные выбросы, на полноту данных, их целостность, точность, актуальность, уникальность и достоверность.
Затем добавляют уже точечно, нужные именно вашему процессу проверки – на объем, своевременность, доступность, согласованность и другие.
Список проверок может быть огромным, и какие именно данные и на что именно проверять – зависит от процессов, в которых эти данные используются и как часто обновляются, а еще от того, где, как и кем проверяются до вас.
Как думаете, есть ли важные и не важные проверки? Если да, то какие важны, а какие – не очень?
#качестводанных #dataquality
Способы проверки данных?
Проверять данные можно по-разному.
Самый простой, но и самый затратный и не очень надёжный способ – смотреть глазами. Простой, потому что не требует никакого ПО или специальных навыков. Любой человек может сравнить дату, стоимость, количество строк, объем (например, в накладной 10 кг, а фактически 1 – это будет заметно), названия и другие важные параметры. Другое дело, что это занимает рабочее время, а человеческие ошибки никто не отменял.
Следующий способ – доверить проверки программе. Если в организации есть разработчик, можно его попросить написать несложные проверки по заданным параметрам, особенно если налажен электронный документооборот. Критерии проверок определяются обычно совместно, бизнес-подразделением и разработчиками, с учетом возможностей поставщиков данных.
На рынке предоставлено огромное количество готовых продуктов для проверки качества данных (Data Quality Software), открывается простор для выбора решений. Это и отечественные разработки, например, Platform V SDP DataQuality от Сбера, и IBM InfoSphere Information Server, и OpenRefine (он же Google Refine), и Informatica Data Quality, и Oracle Data Quality, и Microsoft Data Quality Services, и SAP Data Services, и Talend Data Fabric (Qlik), и Ab Initio, и множество других. Выбор зависит от того, какие задачи нужно решать, бюджета, критичности и особенностей проверяемых данных.
Кстати, нужно понимать, что любые автоматизированные проверки нужно тщательно настраивать, и на это тоже нужно время.
Вы за ручные проверки или доверяете программам?
#качестводанных #dataquality
Проверять данные можно по-разному.
Самый простой, но и самый затратный и не очень надёжный способ – смотреть глазами. Простой, потому что не требует никакого ПО или специальных навыков. Любой человек может сравнить дату, стоимость, количество строк, объем (например, в накладной 10 кг, а фактически 1 – это будет заметно), названия и другие важные параметры. Другое дело, что это занимает рабочее время, а человеческие ошибки никто не отменял.
Следующий способ – доверить проверки программе. Если в организации есть разработчик, можно его попросить написать несложные проверки по заданным параметрам, особенно если налажен электронный документооборот. Критерии проверок определяются обычно совместно, бизнес-подразделением и разработчиками, с учетом возможностей поставщиков данных.
На рынке предоставлено огромное количество готовых продуктов для проверки качества данных (Data Quality Software), открывается простор для выбора решений. Это и отечественные разработки, например, Platform V SDP DataQuality от Сбера, и IBM InfoSphere Information Server, и OpenRefine (он же Google Refine), и Informatica Data Quality, и Oracle Data Quality, и Microsoft Data Quality Services, и SAP Data Services, и Talend Data Fabric (Qlik), и Ab Initio, и множество других. Выбор зависит от того, какие задачи нужно решать, бюджета, критичности и особенностей проверяемых данных.
Кстати, нужно понимать, что любые автоматизированные проверки нужно тщательно настраивать, и на это тоже нужно время.
Вы за ручные проверки или доверяете программам?
#качестводанных #dataquality
❤2
Последствия некачественных данных
Что будет, если не проверять данные, а просто использовать их?
В лучшем случае – вам повезет и данные будут проверены на стороне источника, например, если это какие-то официальные данные или поставщик данных берет на себя ответственность.
А в худшем – вы будете принимать решения, опираясь на некорректные данные, и можете понести финансовые и репутационные потери. Если в прогнозе погоды из раза в раз будет обещано солнышко, а фактически – холодный ветер с дождём, скорее всего вы перестанете доверять этому источнику. Если на ценнике написано 100 рублей, а на кассе выясняется, что 150 – неприятненько и можно начать обходить магазин стороной. Если вам обещали построить дом за месяц, вы продали квартиру и уже готовы въезжать, а от дома готов только фундамент – вероятно, впереди судебные тяжбы и поиск жилья.
Особенно важно проверять данные, если их используете не только вы сами, но и на основе ваших результатов строит свои стратегии кто-то другой. Именно от ваших решений и качества предоставляемых вами данных будет зависеть достижение результата конечным получателем данных.
Какая ситуация с некачественными данными вспоминается? Может, когда одноклассники пошутили и сказали, что ничего не задано, а вы получили двойку? А может, когда в магазине не хватило денег из-за изменения цен? Или вам понравилась красивая фотография, а на свидании ждал сюрприз? Что было у вас? 😉
#качестводанных #dataquality
Что будет, если не проверять данные, а просто использовать их?
В лучшем случае – вам повезет и данные будут проверены на стороне источника, например, если это какие-то официальные данные или поставщик данных берет на себя ответственность.
А в худшем – вы будете принимать решения, опираясь на некорректные данные, и можете понести финансовые и репутационные потери. Если в прогнозе погоды из раза в раз будет обещано солнышко, а фактически – холодный ветер с дождём, скорее всего вы перестанете доверять этому источнику. Если на ценнике написано 100 рублей, а на кассе выясняется, что 150 – неприятненько и можно начать обходить магазин стороной. Если вам обещали построить дом за месяц, вы продали квартиру и уже готовы въезжать, а от дома готов только фундамент – вероятно, впереди судебные тяжбы и поиск жилья.
Особенно важно проверять данные, если их используете не только вы сами, но и на основе ваших результатов строит свои стратегии кто-то другой. Именно от ваших решений и качества предоставляемых вами данных будет зависеть достижение результата конечным получателем данных.
Какая ситуация с некачественными данными вспоминается? Может, когда одноклассники пошутили и сказали, что ничего не задано, а вы получили двойку? А может, когда в магазине не хватило денег из-за изменения цен? Или вам понравилась красивая фотография, а на свидании ждал сюрприз? Что было у вас? 😉
#качестводанных #dataquality
О чем в камках качества данных вам было бы интересно почитать?
Самая нужная проверка
Одна из основных проверок данных – проверка на полноту.
Есть разные теории, что понимать под этим, и даже в рамках одной организации подходы могут отличаться.
Полнота данных означает, что все необходимые элементы присутствуют в наборе данных и что они полностью соответствуют требованиям задачи.
Существует несколько вариантов того, что может подразумеваться под полнотой данных:
- Наличие всех необходимых атрибутов. Например, если мы создаем базу данных клиентов, то каждый клиент должен иметь свой уникальный идентификатор, имя, фамилию, адрес электронной почты и номер телефона. Если какой-то из этих атрибутов отсутствует, то данные считаются неполными.
- Отсутствие пропусков в последовательности значений. Например, если мы составляем список товаров для интернет-магазина, то каждый товар должен иметь свой уникальный артикул и цену. Если какие-то товары отсутствуют в списке или цены на них не указаны, то данные считаются неполными.
- Достаточность объема выборки. Например, если мы проводим социологический опрос населения города N, то необходимо опросить достаточное количество респондентов, чтобы получить репрезентативную выборку. Если число опрошенных людей недостаточно велико, то данные считаются неполными.
Примеры проверки полноты данных могут быть различными в зависимости от конкретной задачи. Однако важно понимать, что любая информация должна быть полной и точной для того, чтобы ее можно было использовать в дальнейшем анализе или принятии решений.
Иногда, под полнотой понимают только объём данных (например, что количество записей из таблицы 1 совпадает с количеством записей, преданных в таблицу 2), иногда – включают проверки на глубину и широту данных (есть данные за последний год и достаточное количество атрибутов заполнено), а иногда – просто на not null.
#качестводанных #dataquality
Одна из основных проверок данных – проверка на полноту.
Есть разные теории, что понимать под этим, и даже в рамках одной организации подходы могут отличаться.
Полнота данных означает, что все необходимые элементы присутствуют в наборе данных и что они полностью соответствуют требованиям задачи.
Существует несколько вариантов того, что может подразумеваться под полнотой данных:
- Наличие всех необходимых атрибутов. Например, если мы создаем базу данных клиентов, то каждый клиент должен иметь свой уникальный идентификатор, имя, фамилию, адрес электронной почты и номер телефона. Если какой-то из этих атрибутов отсутствует, то данные считаются неполными.
- Отсутствие пропусков в последовательности значений. Например, если мы составляем список товаров для интернет-магазина, то каждый товар должен иметь свой уникальный артикул и цену. Если какие-то товары отсутствуют в списке или цены на них не указаны, то данные считаются неполными.
- Достаточность объема выборки. Например, если мы проводим социологический опрос населения города N, то необходимо опросить достаточное количество респондентов, чтобы получить репрезентативную выборку. Если число опрошенных людей недостаточно велико, то данные считаются неполными.
Примеры проверки полноты данных могут быть различными в зависимости от конкретной задачи. Однако важно понимать, что любая информация должна быть полной и точной для того, чтобы ее можно было использовать в дальнейшем анализе или принятии решений.
Иногда, под полнотой понимают только объём данных (например, что количество записей из таблицы 1 совпадает с количеством записей, преданных в таблицу 2), иногда – включают проверки на глубину и широту данных (есть данные за последний год и достаточное количество атрибутов заполнено), а иногда – просто на not null.
#качестводанных #dataquality
Актуальность данных
Следующая проверка, которую обычно тоже подключают в числе первых – проверка на актуальность.
И тут сначала нужно понять, что именно для ваших данных – актуально, как часто их нужно проверять и какие возможны допуски.
Какие-то данные обновляются раз в год, какие-то – раз в месяц, какие-то каждый день.
Например, данные об инфляции Росстат публикует раз в месяц за прошлый месяц, и их нет смысла проверять каждый день, а котировки валют Центральный Банк обновляет ежедневно. Ключевая ставка может меняться в любой день, без четкого графика, а данные о погоде обновляют много раз в день. Данные о билетах обновляются после каждой транзакции, а критичные системы мониторят несколько раз в минуту.
Следующий вопрос – как быстро вы получаете эти данные, сразу из источника или есть какие-то поставщики данных, посредники, третьи лица. Может быть, вы строите свои витрины на обработанных данных коллег, тогда ваша актуальность будет совсем не молниеносной, а спустя несколько дней, и это тоже нормально 😊
Актуальность есть смысл проверять далеко не во всех таблицах. Например, статичные справочники, таблицы с некритичными данными, технические таблицы.
После этого следует этап, на самом деле важный для многих проверок - определиться, по какому атрибуту проверять. Есть ли в вашей таблице поле, содержащее дату? Какой у этого поля формат? Вполне может оказаться, что проще и надёжнее проверять по техническому полю "дата загрузки".
А может быть и такое, что вам вообще не нужно проверять на актуальность. Может, используются только справочники, которые меняются крайне редко и нет таблиц с регулярным обновлением.
Поделитесь мнением о проверках на актуальность?
#качестводанных #dataquality
Следующая проверка, которую обычно тоже подключают в числе первых – проверка на актуальность.
И тут сначала нужно понять, что именно для ваших данных – актуально, как часто их нужно проверять и какие возможны допуски.
Какие-то данные обновляются раз в год, какие-то – раз в месяц, какие-то каждый день.
Например, данные об инфляции Росстат публикует раз в месяц за прошлый месяц, и их нет смысла проверять каждый день, а котировки валют Центральный Банк обновляет ежедневно. Ключевая ставка может меняться в любой день, без четкого графика, а данные о погоде обновляют много раз в день. Данные о билетах обновляются после каждой транзакции, а критичные системы мониторят несколько раз в минуту.
Следующий вопрос – как быстро вы получаете эти данные, сразу из источника или есть какие-то поставщики данных, посредники, третьи лица. Может быть, вы строите свои витрины на обработанных данных коллег, тогда ваша актуальность будет совсем не молниеносной, а спустя несколько дней, и это тоже нормально 😊
Актуальность есть смысл проверять далеко не во всех таблицах. Например, статичные справочники, таблицы с некритичными данными, технические таблицы.
После этого следует этап, на самом деле важный для многих проверок - определиться, по какому атрибуту проверять. Есть ли в вашей таблице поле, содержащее дату? Какой у этого поля формат? Вполне может оказаться, что проще и надёжнее проверять по техническому полю "дата загрузки".
А может быть и такое, что вам вообще не нужно проверять на актуальность. Может, используются только справочники, которые меняются крайне редко и нет таблиц с регулярным обновлением.
Поделитесь мнением о проверках на актуальность?
#качестводанных #dataquality
Проверка на уникальность данных
И речь совсем не о проверке на антиплагиат. Кстати, сталкивались с этим или получили диплом раньше? Хотя, в целом и антиплагиат о том же – проверке на уникальность. Её еще называют проверка на дубли.
Зачем это нужно? Чтобы потребители и пользователи увидели и могли использовать корректную информацию. Например, поиск по адресу, и пять домов с одинаковым номером, и только к одному из них подтягиваются номера квартир. Или номера транспортных маршрутов. Как вам 1, 1а, 1к, 1д и другие «единички» с мелкими приписанными буквами? Они идут в разные места, но часть маршрута общая. Иногда, подстраиваясь под дорожную обстановку, они меняют на лету таблички. Можно сесть в 1д, а оказаться в 1к и думать «я не внимателен или поменяли?» Но тут хотя бы есть разница в буквах. А представьте вашего полного тёзку? Может быть, даже родственника. Вы живёте в одном городе, на одной улице, в одной квартире. Как почтальону или звонящему по телефону различить, кто есть кто? Дублирование и отсутствие уникальности на лицо! 😊 А 100500 одинаковых файлов в разных папках?
Перед настройкой этой проверки стоит проверить, в каких таблицах какие атрибуты должны быть уникальными. Это может быть ключ таблицы, а может быть и нет. Вполне возможно, что уникальными должно быть сочетание полей, но не всех, а лишь некоторых (как в случае с тёзкой, людей можно различить по разным датам рождения).
Способы реализации проверки данных на дубли могут быть разные. Это и использование в скриптах HAVING count(*) > 1, и фильтрация выгрузки в эксель, и проверка на отсутствие дублей в коде, и ограничения UNIQUE, CHECK или специальные программы.
Еще не стоит забывать о противоречиях – записях, отличающихся хотя бы по одному полю. Это могут оказаться не уникальные записи, а ошибки. Если их пропустить – мы получим искаженный результат исследования данных. Настраивать ли эту проверку – зависит от данных и целесообразности использования ресурсов, соизмеримости с полученным результатом.
#качестводанных #dataquality
И речь совсем не о проверке на антиплагиат. Кстати, сталкивались с этим или получили диплом раньше? Хотя, в целом и антиплагиат о том же – проверке на уникальность. Её еще называют проверка на дубли.
Зачем это нужно? Чтобы потребители и пользователи увидели и могли использовать корректную информацию. Например, поиск по адресу, и пять домов с одинаковым номером, и только к одному из них подтягиваются номера квартир. Или номера транспортных маршрутов. Как вам 1, 1а, 1к, 1д и другие «единички» с мелкими приписанными буквами? Они идут в разные места, но часть маршрута общая. Иногда, подстраиваясь под дорожную обстановку, они меняют на лету таблички. Можно сесть в 1д, а оказаться в 1к и думать «я не внимателен или поменяли?» Но тут хотя бы есть разница в буквах. А представьте вашего полного тёзку? Может быть, даже родственника. Вы живёте в одном городе, на одной улице, в одной квартире. Как почтальону или звонящему по телефону различить, кто есть кто? Дублирование и отсутствие уникальности на лицо! 😊 А 100500 одинаковых файлов в разных папках?
Перед настройкой этой проверки стоит проверить, в каких таблицах какие атрибуты должны быть уникальными. Это может быть ключ таблицы, а может быть и нет. Вполне возможно, что уникальными должно быть сочетание полей, но не всех, а лишь некоторых (как в случае с тёзкой, людей можно различить по разным датам рождения).
Способы реализации проверки данных на дубли могут быть разные. Это и использование в скриптах HAVING count(*) > 1, и фильтрация выгрузки в эксель, и проверка на отсутствие дублей в коде, и ограничения UNIQUE, CHECK или специальные программы.
Еще не стоит забывать о противоречиях – записях, отличающихся хотя бы по одному полю. Это могут оказаться не уникальные записи, а ошибки. Если их пропустить – мы получим искаженный результат исследования данных. Настраивать ли эту проверку – зависит от данных и целесообразности использования ресурсов, соизмеримости с полученным результатом.
#качестводанных #dataquality
Кто вы?
Этот канал – копия канала в соцсети Сетка от ХэдХантера, а вот сам канал . Недавно я настроила репост отсюда туда, поэтому посты можно будет читать и там, и тут – где удобнее. И в Сетке есть свои Сетки– разделение по интересам, профессиям, организациям и другим параметрам. Для Сбера их 120!
Вспомнила, как выбирала, кем представляться – я и умная, и красивая, куда идти? 😊
Качеством данных занимаются и аналитики всех сортов (бизнес-аналитик, системный аналитик, аналитик данных, просто аналитик), и инженеры данных, и сайентисты, и бигдата инженеры, и обычные инженеры – кого только нет!
Как называется, или как вам хотелось бы, чтобы называлась должность, связанная с качеством данных? Это основное направление вашей деятельности или одно из нескольких? А может, вы специалист совсем в другом?
Расскажите немного о себе, чем вы занимаетесь?
#качестводанных #dataquality
Этот канал – копия канала в соцсети Сетка от ХэдХантера, а вот сам канал . Недавно я настроила репост отсюда туда, поэтому посты можно будет читать и там, и тут – где удобнее. И в Сетке есть свои Сетки– разделение по интересам, профессиям, организациям и другим параметрам. Для Сбера их 120!
Вспомнила, как выбирала, кем представляться – я и умная, и красивая, куда идти? 😊
Качеством данных занимаются и аналитики всех сортов (бизнес-аналитик, системный аналитик, аналитик данных, просто аналитик), и инженеры данных, и сайентисты, и бигдата инженеры, и обычные инженеры – кого только нет!
Как называется, или как вам хотелось бы, чтобы называлась должность, связанная с качеством данных? Это основное направление вашей деятельности или одно из нескольких? А может, вы специалист совсем в другом?
Расскажите немного о себе, чем вы занимаетесь?
#качестводанных #dataquality
Чем мерить качество данных?
Рубрика #DQ_ответы_на_вопросы
Сегодня поговорим о метриках качества данных.
Считается, что качество данных влияет на все данные в организации и поэтому оно должно начинаться с самого верха организации. Одновременно с этим, за качество данных отвечает каждый пользователь, создающий и использующий данные. Создатели должны придерживаться ряда правил и договоренностей, а потребители – сообщать о несоответствиях данных.
Зачастую, на некоторые моменты «закрывают глаза». Например, на дату 01.01.1900 или 31.12.9999. Эти даты удобны, они были в далёком прошлом или будут в еще более далёком будущем, именно в этом интервале их нормально воспринимает эксель. Ими же заполняют пропуски или недостающие данные, условно подходящие под «давно» и «никогда». И именно о них спотыкаются проверки на актуальность, ведь в идеале этих дат нет в таблице. Приходится придумывать обходные пути, помечать записи как неошибочные и тд.
Неисправленные ошибки в адресах, названиях, разное написание телефонных номеров – всё это может создать ложные срабатывания различных проверок и привести к падению уровня качества данных.
Определить, насколько хороши ваши данные можете только вы сами, приняв за точку отсчета текущее состояние данных. Проверить, какие там есть ошибки, как их можно исправить, а что не является критичным и существенным.
Обычно, основными метриками считают следующие:
✅ Полнота – количество или процент заполненных значений;
✅ Уникальность – процент неповторяющихся значений;
✅ Согласованность – взаимная непротиворечивость;
✅ Допустимость – соответствие типам или форматам (например, телефонный номер записан цифрами);
✅ Валидность – соответствие уровню достоверности (например, неотрицательный вес);
✅ Точность – соответствие требованиям;
✅ Контролируемость – возможность установить происхождение данных и другие.
Какой процент соответствия этим критериям допустим – определяется на уровне организации, отдела, продукта. Где-то обязательно 99,99%, а где-то и 80% - уже хорошо.
Например, обычно вы приходите на работу к 9.00, и это нормально, но именно работать начинаете в 9.15 - 15 минут на переодевание, загрузку компьютера и чай, а когда приходите в организацию, которая работает с 9, хочется чтобы в 9 вас и начали принимать. В этом случае сотрудникам нужно приходить чуть раньше, чем 9, например, 8.45. В итоге оба работают с 9, но с разными допусками к такому критерию как начало рабочего дня.
#качестводанных #dataquality
Раз в месяц публикую пост-вопрос, где тоже можно задать вопросы о качестве данных, помимо комментариев.
Рубрика #DQ_ответы_на_вопросы
Сегодня поговорим о метриках качества данных.
Считается, что качество данных влияет на все данные в организации и поэтому оно должно начинаться с самого верха организации. Одновременно с этим, за качество данных отвечает каждый пользователь, создающий и использующий данные. Создатели должны придерживаться ряда правил и договоренностей, а потребители – сообщать о несоответствиях данных.
Зачастую, на некоторые моменты «закрывают глаза». Например, на дату 01.01.1900 или 31.12.9999. Эти даты удобны, они были в далёком прошлом или будут в еще более далёком будущем, именно в этом интервале их нормально воспринимает эксель. Ими же заполняют пропуски или недостающие данные, условно подходящие под «давно» и «никогда». И именно о них спотыкаются проверки на актуальность, ведь в идеале этих дат нет в таблице. Приходится придумывать обходные пути, помечать записи как неошибочные и тд.
Неисправленные ошибки в адресах, названиях, разное написание телефонных номеров – всё это может создать ложные срабатывания различных проверок и привести к падению уровня качества данных.
Определить, насколько хороши ваши данные можете только вы сами, приняв за точку отсчета текущее состояние данных. Проверить, какие там есть ошибки, как их можно исправить, а что не является критичным и существенным.
Обычно, основными метриками считают следующие:
✅ Полнота – количество или процент заполненных значений;
✅ Уникальность – процент неповторяющихся значений;
✅ Согласованность – взаимная непротиворечивость;
✅ Допустимость – соответствие типам или форматам (например, телефонный номер записан цифрами);
✅ Валидность – соответствие уровню достоверности (например, неотрицательный вес);
✅ Точность – соответствие требованиям;
✅ Контролируемость – возможность установить происхождение данных и другие.
Какой процент соответствия этим критериям допустим – определяется на уровне организации, отдела, продукта. Где-то обязательно 99,99%, а где-то и 80% - уже хорошо.
Например, обычно вы приходите на работу к 9.00, и это нормально, но именно работать начинаете в 9.15 - 15 минут на переодевание, загрузку компьютера и чай, а когда приходите в организацию, которая работает с 9, хочется чтобы в 9 вас и начали принимать. В этом случае сотрудникам нужно приходить чуть раньше, чем 9, например, 8.45. В итоге оба работают с 9, но с разными допусками к такому критерию как начало рабочего дня.
#качестводанных #dataquality
Раз в месяц публикую пост-вопрос, где тоже можно задать вопросы о качестве данных, помимо комментариев.
Как начать внедрять качество данных в компании?
Продолжаем рубрику #dq_ответы_на_вопросы
Данные бывают разные, а используют их примерно все 😊
Внезапное «Мам, пап, завтра надо ступу бабы Яги в натуральную величину из эко-материалов» – тоже про качество данных.
И «Ой, мы продали билетов на концерт больше, чем мест в зрительном зале» - оттуда же.
И «случайно» ошибиться номером, и еще много чего бытового.
Все организации держатся на данных. Основное, что есть – знания о клиентах, партнёрах, сделках, обязательствах и т.д. Ошибки в этих знаниях могут стоить очень дорого, как в плане репутационных рисков, так и в плане финансовых потерь.
Так как же сделать так, чтобы все данных были верными? Договариваться. Со всеми:
🤵с руководством, что на эту задачу нужны люди, деньги и время;
🤵с подчиненными, что на них упадёт дополнительная работа;
🤵с коллегами, чтобы они предоставляли реальные данные не на кухне, а официальными каналами связи;
🤵с партнерами, что оттого, какие данные они предоставят, зависят существенные условия договора.
Как? Понять, что может мотивировать этих людей.
Например,
💸 для руководства – посчитать трудозатраты по вашей сфере ответственности, хотя бы примерно (не известно, что обнаружится, когда вы всерьёз возьметесь за эту задачу), выгоду и экономию, которую получит отдел или компания после приведения данных в порядок;
💸 Для подчиненных – в чем будет упрощение или удобство при работе с нормальными данными, возможно материальная мотивация;
💸 Для коллег – может быть уменьшение взаимных задач по доделыванию и исправлению ошибок, а может – новый общий интересный проект;
💸 Для партнеров – выгодные условия, сокращения сроков, приоритет выполнения заказов и др.
Желательно, договариваться одновременно со всеми.
Предварительно для каждой категории оппонентов приготовить ответы на основные возможные вопросы: зачем, что это даст, сколько это будет стоить, сколько займет времени первый этап, кто именно будет делать, кто за что нести ответственность, что вы готовы взять на себя и главное – что будет, если этого не сделать в какие-то разумные сроки. Еще можно продумать, какой минимальный уровень качества устроит вас, даст обещанное окружающим, по каким критериям это планируется измерять.
Ну а перед всем этим – понять, что вы хотите получить, внедряя работу над качеством данных в организации, в каком состоянии они сейчас, где есть слабые места и на что они влияют.
#качестводанных #dataquality
Продолжаем рубрику #dq_ответы_на_вопросы
Данные бывают разные, а используют их примерно все 😊
Внезапное «Мам, пап, завтра надо ступу бабы Яги в натуральную величину из эко-материалов» – тоже про качество данных.
И «Ой, мы продали билетов на концерт больше, чем мест в зрительном зале» - оттуда же.
И «случайно» ошибиться номером, и еще много чего бытового.
Все организации держатся на данных. Основное, что есть – знания о клиентах, партнёрах, сделках, обязательствах и т.д. Ошибки в этих знаниях могут стоить очень дорого, как в плане репутационных рисков, так и в плане финансовых потерь.
Так как же сделать так, чтобы все данных были верными? Договариваться. Со всеми:
🤵с руководством, что на эту задачу нужны люди, деньги и время;
🤵с подчиненными, что на них упадёт дополнительная работа;
🤵с коллегами, чтобы они предоставляли реальные данные не на кухне, а официальными каналами связи;
🤵с партнерами, что оттого, какие данные они предоставят, зависят существенные условия договора.
Как? Понять, что может мотивировать этих людей.
Например,
Желательно, договариваться одновременно со всеми.
Предварительно для каждой категории оппонентов приготовить ответы на основные возможные вопросы: зачем, что это даст, сколько это будет стоить, сколько займет времени первый этап, кто именно будет делать, кто за что нести ответственность, что вы готовы взять на себя и главное – что будет, если этого не сделать в какие-то разумные сроки. Еще можно продумать, какой минимальный уровень качества устроит вас, даст обещанное окружающим, по каким критериям это планируется измерять.
Ну а перед всем этим – понять, что вы хотите получить, внедряя работу над качеством данных в организации, в каком состоянии они сейчас, где есть слабые места и на что они влияют.
#качестводанных #dataquality
Please open Telegram to view this post
VIEW IN TELEGRAM
Проверки на точность и достоверность
Зачастую считают, что качество данных равно их точность. Но это не совсем так.
Точность — это то, насколько хорошо данные, хранящиеся в системе, отражают действительность. Под достоверностью обычно понимают достоверный источник данных и возможность их проверить. Фактчекинг появился именно по этой причине – проверить вызывающие сомнение факты (данные).
Данные должны не только отражать реальность, но и быть полными, действительными и единообразными. В первую очередь точность означает полноту данных, то есть должны быть известны все атрибуты, и подразумевает баланс между всеми аспектами..
Чтобы данные были действительными, они должны соответствовать какому-то стандарту. Например, у всех есть фамилия и имя, а у большинства сограждан – еще и отчество. Данные могут быть действительными, но не точными. Например, если на письме в графе «ФИО получателя» написано «Петровичу», то данные могут быть действительными (потому что фамилия Петрович тоже есть), но не проходят проверку на точность, в совокупности с другими атрибутами, так как являются отчеством.
Единообразие означает, что одни и те же данные отображаются одинаково в разных наборах данных. Например, если в одном указано «Даниил Григориевич», а в другом этот же человек – «Данила Григорьевич», то данные противоречивы и по крайней мере один из наборов неточен.
Точность данных означает выполнение всех вышеперечисленных требований.
Например, если данные точные, но поступили позже ожидаемого времени, или недостаточно детализированы, или недоступны заинтересованным лицам – их качество не будет высоким, потому что цель использования не достигнута.
#качестводанных #dataquality
Зачастую считают, что качество данных равно их точность. Но это не совсем так.
Точность — это то, насколько хорошо данные, хранящиеся в системе, отражают действительность. Под достоверностью обычно понимают достоверный источник данных и возможность их проверить. Фактчекинг появился именно по этой причине – проверить вызывающие сомнение факты (данные).
Данные должны не только отражать реальность, но и быть полными, действительными и единообразными. В первую очередь точность означает полноту данных, то есть должны быть известны все атрибуты, и подразумевает баланс между всеми аспектами..
Чтобы данные были действительными, они должны соответствовать какому-то стандарту. Например, у всех есть фамилия и имя, а у большинства сограждан – еще и отчество. Данные могут быть действительными, но не точными. Например, если на письме в графе «ФИО получателя» написано «Петровичу», то данные могут быть действительными (потому что фамилия Петрович тоже есть), но не проходят проверку на точность, в совокупности с другими атрибутами, так как являются отчеством.
Единообразие означает, что одни и те же данные отображаются одинаково в разных наборах данных. Например, если в одном указано «Даниил Григориевич», а в другом этот же человек – «Данила Григорьевич», то данные противоречивы и по крайней мере один из наборов неточен.
Точность данных означает выполнение всех вышеперечисленных требований.
Например, если данные точные, но поступили позже ожидаемого времени, или недостаточно детализированы, или недоступны заинтересованным лицам – их качество не будет высоким, потому что цель использования не достигнута.
#качестводанных #dataquality
👍3
Привет!
Вас тут здорово прибавилось, спасибо что заинтересовались 😊
Давайте знакомиться?
Я – Шахтарина Арина, вот мой личный канал.
По первому образованию юрист, за плечами работа в суде, прокуратуре и почти 10 лет в нотариате. Потом пришла в Сбер, занималась обращениями клиентов, копалась в базах, иногда видела несоответствия, очень хотелось всё исправить, выучилась на инженера и теперь занимаюсь качеством данных. Мечты сбываются :) Отдельный привет коллегам, мне очень приятно, что вы меня читаете и говорите про этот канал на работе 😊
Увлекаюсь исторической реконструкцией (Русь, 13 век) и ткачеством (про это могу много рассказывать), имею звание Мастера Декоративно-прикладного творчества, народных художественных ремёсел и промыслов.
Люблю фотографировать, разбирать, чистить и чинить старые объективы, заваривать чай, пробовать разный кофе, куда-нибудь ездить, выступать на мероприятиях, людей и вообще за движуху. Про это всё в основном канале, а тут заметки про работу.
Теперь ваша очередь, расскажите о себе? Интересно, кто меня читает)
Вас тут здорово прибавилось, спасибо что заинтересовались 😊
Давайте знакомиться?
Я – Шахтарина Арина, вот мой личный канал.
По первому образованию юрист, за плечами работа в суде, прокуратуре и почти 10 лет в нотариате. Потом пришла в Сбер, занималась обращениями клиентов, копалась в базах, иногда видела несоответствия, очень хотелось всё исправить, выучилась на инженера и теперь занимаюсь качеством данных. Мечты сбываются :) Отдельный привет коллегам, мне очень приятно, что вы меня читаете и говорите про этот канал на работе 😊
Увлекаюсь исторической реконструкцией (Русь, 13 век) и ткачеством (про это могу много рассказывать), имею звание Мастера Декоративно-прикладного творчества, народных художественных ремёсел и промыслов.
Люблю фотографировать, разбирать, чистить и чинить старые объективы, заваривать чай, пробовать разный кофе, куда-нибудь ездить, выступать на мероприятиях, людей и вообще за движуху. Про это всё в основном канале, а тут заметки про работу.
Теперь ваша очередь, расскажите о себе? Интересно, кто меня читает)
🔥9❤4
Доброе уро!
Сегодня воскресенье, а значит самое время немножко отвлечься и отдохнуть. Но мы же любим «отдыхать полезно», поэтому хочу поделиться с вами классной подборкой каналов коллег. Рекомендую добавлять папку целиком, ребята пишут от души, читать одно удовольствие.
Кто в этой подборке? Лучшие❤️
👍 Дата Инженеретта Айгуль Сибгатуллина. Автор помогает разобраться в сложных понятиях на примере реальных кейсов из собственного опыта.
👍 Госпожа аналитик Ия Зотова. Канал про жизнь и рост в IT.
👍 Антон Непша.js Канал о веб-разработке: автор делится как новинками из мира JS, так и устоявшимися фундаментальными знаниями.
👍 Уставший техдир Глеб Михеев. Автор пишет про управление, разработку, иногда продукт, делится своими выступлениями и подкастами.
👍 V{IT}A ZAEBYMBA Виталия Малютина. Канал про системный анализ, жизнь в IT и опыт работы в корпорации.
👍 Гуманный аналитик Роман Селезнёв. Канал про анализ, проектирование и всё, что так или иначе связано с информационными системами.
👍 Корпоративная Мифология от Давида Мартиросяна. Канал про развитие команд, управление людьми и собой заодно в мире разработки программных продуктов.
👍 Иван Федотов пишет про психологию, менеджмент и жизнь.
👍 Complete AI Андрей Кузнецов рассказывает о событиях и технологичных трендах в мире ИИ, а также об исследованиях Лаборатории FusionBrain в Институте AIRI.
👍 Трапезников Алексей в Рассказе фронтендера пишет про фронтенд разработку и любимый JS.
👍 Карпов Юрий в Закладках фронтендера делится своими статьями и заметками о программировании и вебе.
👍 Киберпрсихолог Ирина Линева рассказывает про психологию команды, продукта, и личную осознанность.
👍 Мотивируй IT Дмитрий Малахов делится личным опытом запуска и развития крупных проектов, новостями из мира технологий.
👍 Junior QA to Dev Иван Иксанов. Канал про QA, ручное и авто, инструменты тестирования и лучшие практики.
👍 Analyst Boost Никита Харичкин. Пишет про обучение и лучшие практики, опыт и мысли на темы PlantUML, бизнес- и системного анализа.
👍 Айтишник обыкновенный Николай Колесник. Канал про системный анализ и не только.
👍 Семён обо всём Семён Мартюшов. Канал про использование нейросетей в личной жизни.
👍 (java || kotlin) && devOps Орехов Денис. Про фреймворки, паттерны, чистый код, unit тестирование, тонкости JVM, архитектуру и конечно же DevOps.
👍 /home/Vzhyx/ от Романа Троицкого. Канал про веб-разработку от фронтенда до сервера и контейнеров.
👍 Сообщества в IT и компаниях | Community management. Управление в IT Арина Штерн рассказывает про гибкие методы управления, через комьюнити-менеджмент, создание личного бренда и эфиры с интересными гостями.
👍 Synapse Community Максим Чудновский, Александр Козлов, Алексей Игнатов, Илья Семенов, Георгий Абрамов про актуальные тренды и развитие облачных технологий, все про сервис меш и не только.
👍 Мысли менеджера Сергея Р о том, как законы менеджмента работают на практике.
👍 Плохой Project Артём Арюткин прикольно пишет про IT менеджмент.
👍 Data Quality | Качество данных Арина Шахтарина делится мыслями про качество данных, особенности и нюансы настройки проверок, выстраивание взаимодействия с поставщиками и потребителями данных. Да, это про меня)
Читайте сами, делитесь с друзьями! 📖
И еще раз, вся папка - вот 😊
Сегодня воскресенье, а значит самое время немножко отвлечься и отдохнуть. Но мы же любим «отдыхать полезно», поэтому хочу поделиться с вами классной подборкой каналов коллег. Рекомендую добавлять папку целиком, ребята пишут от души, читать одно удовольствие.
Кто в этой подборке? Лучшие
Читайте сами, делитесь с друзьями! 📖
И еще раз, вся папка - вот 😊
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥5🥰2👍1😁1
