Аналитика в HR | HR-tech
660 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#основы #шкалы

Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.

Чаще всего используют четыре типа шкал:

🔹Номинальные данные - это просто категории без порядка.

🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.

🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.

🔹Бинарные данные - данные ограниченные только 2 значениями.

что можно и что нельзя делать с разными шкалами - на скрине выше.

Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1
#метрики #CandB

⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).

🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.

В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
❤7👍2
#методы #интервалы #частоты

Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:

🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.

🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)

🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года

итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
❤3👍1
#методы #интервалы #частоты

Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.

Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.

Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.

Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика

все готово, задача решена.
👍3❤1
#Excel

Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.

на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.

Вся статистика в одном месте.
👍12
#метрики #норма_управляемости

Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.

⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.

🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.

Источник 1
Источник 2
👍3
#исследования #Фишер #тест_Фишера

Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука

⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).

🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.

🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
from scipy.stats import fisher_exact

#Ваша таблица
table = [[7, 2],
[5, 6]]
#Тест Фишера
oddsratio, p_value = fisher_exact(table, alternative='two-sided')
#p-value
print(p_value)
👍7
#основы #FTE

⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.

🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.

🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
❤4
#метрики #абсентеизм

Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.

⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.

У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.

🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.

Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
👍6
#статистика #ЦПТ #CLT

⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).

В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.

🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.

🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
❤2
#метод #корреляция

⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).

🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.

🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц

Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
import numpy as np

a, b = 30, 10
c, d = 15, 45

phi = (a*d - b*c) / np.sqrt((a+b)*(c+d)*(a+c)*(b+d))
print(Phi)
❤1
#метрики

Ниже ключевые метрики эффективности функции компенсации и льготы. Они оценивают широкий спектр параметров от эффективности расходования бюджета и внутренней и внешней справедливости вознаграждения, до эффективности сотрудников к расходам на них.

1. Выручка и прибыль на FTE

2. Compa-ratio и Market-ratio (CR, MR)

3. Индекс вхождения в диапозон зп (Salary Range Penetration, SRP)


4. Performance to Pay Index (PPI)

5. Интенсивность расходования бюджета

6. Индекс утилизации льгот

7. Полная стоимость сотрудника (Сost per employee, CPE)
❤2👍1
#метод #корреляция

⚡️Точечно-бисериальный коэффициент корреляции (rpb) - это мера связи между одной бинарной переменной (0 / 1, да / нет), и одной количественной переменной (зарплата, возраст, KPI, стаж и т.д.).

🔹Пример:
Мы хотим выявить связь между объемом продаж у сотрудника (количественная переменная) и фактом прохождения обучения по продажам (это бинарная шкала).
Выписываем всех сотрудников с результатами их продаж и делим их на две группе, те, которые прошли обучение и не прошли.
Преобразуем это в матрицу (как на скрине) и применяем формулу точечно-бисериального коэффициента.

🔹Интерпретация аналогична всем прочим видам корреляции

Пример кода на Python для реализации
from scipy.stats import pointbiserialr

# binary — обучение (1-прошел обучение, 0 - нет)
# numeric — результаты продаж
# соотв: первый сотр. прошёл обучение, сделал 120 продаж и тд

binary = [1, 0, 1, 1, 0, 0, 1]
numeric = [120, 95, 130, 110, 90, 100, 125]

r, p = pointbiserialr(binary, numeric)

print(f"r_pb = {r:.3f}")
❤2
#методы #вовлеченность

⚡️ Gallup Q12 - простой способ измерения вовлеченности от компании Gallup.

🔹Методология метода:

1. Сотрудники отвечают на 12 вопросов (скрин) по 5-бальной шкале.

2. HR рассчитывает средний балл по всем оценкам и отдельно по блокам вопросов.

3. На основе получившихся значений считают:
3.1. Индекс вовлечения (Engagement Index):

> 4 - сотрудник активно вовлечён,
3-4 - нейтрален
< 3 - сотрудник не вовлечён.

3.2. Top-Box Scoring: рассчитывается кол-во оценок 4-5, а затем значения по блокам сравниваются между собой. Так выявляются проблемные области по сп.
❤2
#основы #ранжирование

Простенький, но очень важный метод в арсенале любого аналитика (не только HR) - ранжирование данных.

⚡️ Ранжирование - это процедура присвоения объектам порядковых номеров (рангов) на основе их значений.
Если у нас уже есть порядковая шкала (например, оценка: 1–5), мы можем перевести её в ранговую, отсортировав сотрудников и назначив места.
Например, чтобы определить победителей или для выполнения последующего корреляционного анализа (об этом дальше).

🔹В Excel можно выполнить через функцию:
=Ранг(объект, которому будет присвоен ранг; весь массив данных; порядок ранжирования (0 или 1).
не забудьте, используя эту функцию, закрепить ссылку на весь массив (как на скрине), когда будете ее протягивать для всех данных. Сделать это можно выделил ссылку и нажав F4

🔹В Python
import pandas as pd

df = pd.DataFrame({
'name': ['A','B','C','D','E'],
'score': [100, 124, 98, 81, 120]
})

df['rank'] = df['score'].rank()
👍4
#метод #корреляция #Пирсон

⚡️Корреляция Пирсона - инструмент для оценки линейной связи между двумя количественными показателями, выраженными количественными непрерывными шкалами (кг, штуки, рубли, метры и пр.)

🔹Когда применяем?
- данные количественные (зарплата, выручка, производительность, текучесть и т.д.)
- распределение близко к нормальному (или выборка достаточно большая)
- связь предполагается линейной

🔹Алгоритм:
Рассчитывается среднее значение по каждой переменной.
Для каждого наблюдения определяется отклонение от среднего.
Перемножаются отклонения двух переменных.
Сумма произведений нормируется на произведение стандартных отклонений.

🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)

🔹Интерпретация аналогична всем прочим видам корреляции
🔹Наличие кор.связи необязательно предполагает зависимость
❤5
#визуализация

Написал небольшую статью про манипуляции в аналитике через визуализацию данных.

О том, как «правильно» выбранный способ визуализации может кардинально изменить восприятие информации и превратить провальные результаты во вполне достойную работу.

Материал во многом основан на моем опыте по обе стороны «баррикад». Текст написан прежде всего для того, чтобы подчеркнуть важность критического мышления — особенно когда речь идет о данных и их интерпретации. И, конечно, это не инструкция к действию. Скорее — вредные советы.

Надеюсь, со временем дойдут руки до второй части, где разберу трюки с процентами, весами, псевдокорреляциями, манипуляциями с выборками, различными типами агрегаций и другими подобными вещами.
❤3
#метод #корреляция #Спирмен

⚡️ Ранговая корреляция Спирмена — инструмент для оценки связи между показателями, когда данные не нормальны или выражены в рангах (грейды, оценки, разряды, уровни, места и пр).
Например, вам интересно понять есть ли связь между производительностью и разрядом сотрудника.

🔹Алгоритм:
1. Присваивание рангов (пост про ранжирование).
2. Вычисление разностей рангов: Для каждой пары значений вычисляется разность рангов (di).
3. Рассчитывается квадрат разностей рангов (именно поэтому не важно будете ли вы ранжировать данные по возрастанию или убыванию, главное - делайте ранжирование одинаковым для обоих переменных)
3. вычисления коэффициента Спирмена.

🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)
но убедитесь, что вы сделали ранжирование.

🔹Интерпретация аналогична всем прочим видам корреляции
❤3
#визуализация #Excel #условное_форматирование

⚡️ Условное форматирование - это инструмент, который позволяет выделять данные в Excel таблицах на основе пользовательских правил. Инструмент удобен, когда надо "подсветить" какой-то тип данных или какое-то условие в массиве ячеек (>,<,=, повторы, уникальные значения и пр.).

🔹 Где находится:
Раздел находится на вкладке "Главная" >> "Условное форматирование".

🔹Что может:
1. Выделять конкретные значения
2. Показать данные больше/меньше заданного числа.
3. Находить значения в рамках заданного диапозона
4. Находить дубли и уникальные значения и пр.

🔹Как использовать:
Выделяете массив данных для анализа, переходите в раздел условное форматирование и создаете правило, которое тут будет применено ко всему массиву.

Подходит для отчетов, дашбордов и оперативной аналитики.
Помогает быстро находить проблемы или тренды.
Удаляются и редактируются правила в том же разделе.
👍1
#основы #Excel #анализ_данных

⚡️ Пакет анализа данных — мощный и функциональный инструмент, встроенный в Excel, о котором, к сожалению, знает не так много людей.
С его помощью можно выполнять более продвинутые методы анализа, такие как построение регрессионных уравнений, анализ вариации или построение гистограмм.
Пакет, в базовой версии Excel отключен и для его использования требует установки аддона (это бесплатно и доступно для всех версий Excel).

🔹Как подключить:
Переходим во вкладку «Файл» → «Параметры» (слева внизу) → в открывшемся окне выбираем раздел «Надстройки» → справа внизу в поле «Управление» выбираем «Надстройки Excel» и нажимаем «Перейти».
В новом окне ставим галочку рядом с «Пакет анализа» и нажимаем ОК.
После этого раздел «Анализ данных» появится во вкладке «Данные».
❤5
#методы #регрессия

Переходим к прикладным методам анализа данных - линейным уравнениям и регрессиям.

⚡️Линейное уравнение - это самый простой способ попробовать определить зависимость одного фактора от другого и ответить на вопрос: «насколько именно один фактор влияет на другой?». Если корреляции говорят о связи, то здесь речь уже идёт о зависимости (взаимосвязи).

🔹Линейное уравнение имеет вид:
y = ax+b
, где:
y — зависимая величина
a — коэффициент при независимой переменной x
x — значение показателя
b — свободный член

Самый простой способ понять как это работает на практике - посмотреть на значения стажа и оклада или стажа и производительности сотрудника. Собираем такие пары и строим по ним график (в Excel: Диаграммы - Точечная/график). График, который вы увидите на выходе и будет описывать такую связь.
Прямая (как на графике) будет описываться линейный уравнением. Это самый просто вид зависимости, но на практике, конечно, он встречается не так часто.

Как с ней работать поговорим чуть дальше.
❤4