Аналитика в HR | HR-tech
661 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#статистика #Гаусс #нормальное_распределение

начало года - отличная возможность вспомнить базу )

⚡️Распределение Гаусса, нормальное распределение (НР) – это наиболее часто встречающийся в статистике тип распределения данных.

Смысл НР заключается в том, что можно считать, что распределение выборочных статистик (средняя, медиана, мода и пр.) будет нормальным, даже если выборки происходят из ГС, для которой НР не свойственно.
Человеческим языком: даже если исходные данные не подчиняются нормальному распределению, распределение выборочного среднего при достаточно большом размере выборки будет стремиться к нормальному.

Поскольку все НР имеют одинаковую форму и свойства, то для них можно сформулировать правило распределения значений в НР (на скрине). И это распределение будет одинаковым для всех НР.

Этот тип распределений открывает нам много возможностей (о них след. посты), так что нам, в аналитике персонала, важно его знать и уметь идентифицировать (об этом тоже напишу).
👍6
#статистика #Гаусс #нормальное_распределение

Мы знаем, что нормальное распределение встречается часто, но не всегда.
Поэтому важно научиться определять, действительно ли набор данных распределён нормально.

Вот базовые признаки:

🔹Симметричность распределения
Если построить гистограмму распределения данных (с небольшим шагом), мы должны увидеть более-менее симметричный график.
Форма может отличаться (на скрине — разные варианты), но левая и правая части должны быть сопоставимы.

🔹Унимодальность
Если говорить просто - у распределения должна быть одна вершина (одна мода).

🔹Близость средних значений
Среднее арифметическое, медиана и мода должны быть равны или очень близки друг к другу.

🔹 Статистические тесты
Тесты Шапиро–Уилка, Колмогорова–Смирнова и др.
Проблема в том, что в Excel нет готовых функций для их расчёта, а ручной подсчёт достаточно трудоёмкий.
Поэтому на практике удобнее использовать онлайн-калькуляторами (таким например) или рассчитывать в Python или R.
👍2❤1
#статистика #z_score

Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.

⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.

🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон

🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).

🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
👍3
#основа #CandB

С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.

🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.

2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке

3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях

🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода

2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
👍5
#статистика #z_score

Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.

Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.

Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.

Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).

То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
👍3
#статистика #выборка

При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.

⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.

🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.

🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.

🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.

в след.посте про случайный методы отбора.
❤3👍1
#статистика #выборка

Вторая часть поста про способы формирования выборки из ГС.

⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.

🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.

🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.

🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
👍2
#статистика #p_value

Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.

Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.

На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.

В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
❤3👍1
#статистика #p_value

Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.

Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.

Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?

На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.

В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
👍1
#статистика #дисперсия #станд_отклон

Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.

⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.

⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.

🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.

Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
👍1
#метрики #абсентеизм

⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.

открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).

скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.

🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%

🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные

🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
👍2
#основы #шкалы

Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.

Чаще всего используют четыре типа шкал:

🔹Номинальные данные - это просто категории без порядка.

🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.

🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.

🔹Бинарные данные - данные ограниченные только 2 значениями.

что можно и что нельзя делать с разными шкалами - на скрине выше.

Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1
#метрики #CandB

⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).

🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.

В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
❤7👍2
#методы #интервалы #частоты

Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:

🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.

🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)

🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года

итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
❤3👍1
#методы #интервалы #частоты

Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.

Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.

Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.

Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика

все готово, задача решена.
👍3❤1
#Excel

Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.

на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.

Вся статистика в одном месте.
👍12
#метрики #норма_управляемости

Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.

⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.

🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.

Источник 1
Источник 2
👍3
#исследования #Фишер #тест_Фишера

Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука

⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).

🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.

🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
from scipy.stats import fisher_exact

#Ваша таблица
table = [[7, 2],
[5, 6]]
#Тест Фишера
oddsratio, p_value = fisher_exact(table, alternative='two-sided')
#p-value
print(p_value)
👍7
#основы #FTE

⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.

🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.

🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
❤4
#метрики #абсентеизм

Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.

⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.

У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.

🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.

Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
👍6