Аналитика в HR | HR-tech
660 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#статистика #z_score

Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.

⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.

🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон

🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).

🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
👍3
#основа #CandB

С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.

🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.

2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке

3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях

🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода

2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
👍5
#статистика #z_score

Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.

Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.

Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.

Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).

То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
👍3
#статистика #выборка

При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.

⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.

🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.

🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.

🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.

в след.посте про случайный методы отбора.
❤3👍1
#статистика #выборка

Вторая часть поста про способы формирования выборки из ГС.

⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.

🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.

🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.

🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
👍2
#статистика #p_value

Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.

Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.

На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.

В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
❤3👍1
#статистика #p_value

Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.

Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.

Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?

На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.

В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
👍1
#статистика #дисперсия #станд_отклон

Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.

⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.

⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.

🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.

Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
👍1
#метрики #абсентеизм

⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.

открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).

скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.

🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%

🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные

🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
👍2
#основы #шкалы

Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.

Чаще всего используют четыре типа шкал:

🔹Номинальные данные - это просто категории без порядка.

🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.

🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.

🔹Бинарные данные - данные ограниченные только 2 значениями.

что можно и что нельзя делать с разными шкалами - на скрине выше.

Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1
#метрики #CandB

⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).

🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.

В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
❤7👍2
#методы #интервалы #частоты

Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:

🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.

🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)

🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года

итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
❤3👍1
#методы #интервалы #частоты

Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.

Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.

Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.

Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика

все готово, задача решена.
👍3❤1
#Excel

Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.

на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.

Вся статистика в одном месте.
👍12
#метрики #норма_управляемости

Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.

⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.

🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.

Источник 1
Источник 2
👍3
#исследования #Фишер #тест_Фишера

Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука

⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).

🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.

🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
from scipy.stats import fisher_exact

#Ваша таблица
table = [[7, 2],
[5, 6]]
#Тест Фишера
oddsratio, p_value = fisher_exact(table, alternative='two-sided')
#p-value
print(p_value)
👍7
#основы #FTE

⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.

🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.

🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
❤4
#метрики #абсентеизм

Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.

⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.

У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.

🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.

Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
👍6
#статистика #ЦПТ #CLT

⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).

В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.

🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.

🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
❤2
#метод #корреляция

⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).

🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.

🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц

Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
import numpy as np

a, b = 30, 10
c, d = 15, 45

phi = (a*d - b*c) / np.sqrt((a+b)*(c+d)*(a+c)*(b+d))
print(Phi)
❤1