Аналитика в HR | HR-tech
661 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#статистика #искажения

Ещё одна довольно часто встречающаяся манипуляция при работе с данными - использование средних значений и подмена понятий мер.

Предположим, вам нужно подсчитать, сколько в среднем получают сотрудники в компании. Вы собираете данные об их окладах и премиях, суммируете доходы и применяете медиану. Получившееся значение - 95 400.

Но эту же задачу можно решить иначе: посчитать среднее арифм. С точки зрения статистики - всё корректно, это допустимая мера оценки. Полученное значение - 106 200.

Наконец, третий вариант изменить состав выборки. Например, исключить внешних совместителей (или стажеров, или сотрудников в отпуске по уходу за ребенком и пр. вариантов масса). Это уже вопрос методологии: считать ли их "сотрудниками" в моменте. Допустим, мы исключаем их.. Теперь наше значение 130 267.

Во всех случаях расчёт был корректным. Только вот разница составила 34 867 руб.
Довольно часто мы видим "средние" величины, но далеко не всегда понятно что за ними стоит.
❤5
#инструменты #боты #botmother

Третья часть про тг-боты и botmother: общие рекомендации и первые шаги в работе. Первая Вторая

🔹Первое, что нам нужно сделать - добавить токен от BotFather. Для этого, после регистрации, переходим в раздел «Настройки», и там слева добавляем в соответствующее поле токен канала (на скрине).

🔹Далее, прежде чем выстраивать структуру бота, создайте её на бумаге или, например, в ппт. Блок-схема позволит посмотреть на весь бот и заранее увидеть узкие места. Это лучший способ грамотно распланировать работу вашего бота.

🔹На первых этапах держите структуру максимально простой. Сначала добейтесь стабильной логики, и только затем добавляйте более сложные инструменты и опции.

🔹Начните с 2–3 простых кнопок - не перегружайте интерфейс. Пусть каждая кнопка ведёт к отдельному блоку. Блоки - к следующим, и так далее. Пусть конечные блоки ведут к основному меню, так пользователь "не потеряется".

Не забывайте, что у самой площадки есть уроки на русском.
❤2
#HRаналитика #HR_аналитика #HR_analysis #HRtech #people_analytics

Авторский канал, посвящённый HR-аналитике, статистике в HR, исследованиям, HR Tech-решениям и AI.
Вся информация - бесплатна и доступна для свободного распространения.
Посты снабжены тегами по темам и разделам для удобной навигации.

Справочник тэгов:

⚡️ #основы — основы HR-аналитики;

⚡️ #визуализация — средства и формы визуализации данных;

⚡️ #статистика — базовая статистика и теорвер для анализа;

⚡️#методы — методы анализа HR-данных;

⚡️ #инструменты — технологические решения в области HR-аналитики и HR-tech;

⚡️ #метрики — HR-метрики и показатели;

⚡️#прогнозирование — методы прогнозирования и моделирования;

⚡️ #исследования — база для проведения качественных и количественных исследований;

⚡️ #AI — нейросети в HR и HR-анализе;

⚡️ #Excel #VBA— материалы по Excel и по языку программирования в Excel;

⚡️ #прочее — общий тег для всего прочего;

⚡️#личное — личные наблюдения и заметки автора.

t.me/analytics_hr
❤9
#статистика #Гаусс #нормальное_распределение

начало года - отличная возможность вспомнить базу )

⚡️Распределение Гаусса, нормальное распределение (НР) – это наиболее часто встречающийся в статистике тип распределения данных.

Смысл НР заключается в том, что можно считать, что распределение выборочных статистик (средняя, медиана, мода и пр.) будет нормальным, даже если выборки происходят из ГС, для которой НР не свойственно.
Человеческим языком: даже если исходные данные не подчиняются нормальному распределению, распределение выборочного среднего при достаточно большом размере выборки будет стремиться к нормальному.

Поскольку все НР имеют одинаковую форму и свойства, то для них можно сформулировать правило распределения значений в НР (на скрине). И это распределение будет одинаковым для всех НР.

Этот тип распределений открывает нам много возможностей (о них след. посты), так что нам, в аналитике персонала, важно его знать и уметь идентифицировать (об этом тоже напишу).
👍6
#статистика #Гаусс #нормальное_распределение

Мы знаем, что нормальное распределение встречается часто, но не всегда.
Поэтому важно научиться определять, действительно ли набор данных распределён нормально.

Вот базовые признаки:

🔹Симметричность распределения
Если построить гистограмму распределения данных (с небольшим шагом), мы должны увидеть более-менее симметричный график.
Форма может отличаться (на скрине — разные варианты), но левая и правая части должны быть сопоставимы.

🔹Унимодальность
Если говорить просто - у распределения должна быть одна вершина (одна мода).

🔹Близость средних значений
Среднее арифметическое, медиана и мода должны быть равны или очень близки друг к другу.

🔹 Статистические тесты
Тесты Шапиро–Уилка, Колмогорова–Смирнова и др.
Проблема в том, что в Excel нет готовых функций для их расчёта, а ручной подсчёт достаточно трудоёмкий.
Поэтому на практике удобнее использовать онлайн-калькуляторами (таким например) или рассчитывать в Python или R.
👍2❤1
#статистика #z_score

Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.

⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.

🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон

🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).

🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
👍3
#основа #CandB

С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.

🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.

2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке

3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях

🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода

2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
👍5
#статистика #z_score

Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.

Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.

Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.

Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).

То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
👍3
#статистика #выборка

При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.

⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.

🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.

🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.

🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.

в след.посте про случайный методы отбора.
❤3👍1
#статистика #выборка

Вторая часть поста про способы формирования выборки из ГС.

⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.

🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.

🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.

🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
👍2
#статистика #p_value

Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.

Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.

На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.

В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
❤3👍1
#статистика #p_value

Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.

Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.

Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?

На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.

В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
👍1
#статистика #дисперсия #станд_отклон

Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.

⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.

⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.

🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.

Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
👍1
#метрики #абсентеизм

⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.

открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).

скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.

🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%

🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные

🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
👍2
#основы #шкалы

Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.

Чаще всего используют четыре типа шкал:

🔹Номинальные данные - это просто категории без порядка.

🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.

🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.

🔹Бинарные данные - данные ограниченные только 2 значениями.

что можно и что нельзя делать с разными шкалами - на скрине выше.

Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1
#метрики #CandB

⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).

🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.

В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
❤7👍2
#методы #интервалы #частоты

Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:

🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.

🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)

🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года

итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
❤3👍1
#методы #интервалы #частоты

Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.

Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.

Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.

Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика

все готово, задача решена.
👍3❤1
#Excel

Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.

на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.

Вся статистика в одном месте.
👍12