Аналитика в HR | HR-tech
660 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#исследования #Фишер #тест_Фишера

Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука

⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).

🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.

🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
from scipy.stats import fisher_exact

#Ваша таблица
table = [[7, 2],
[5, 6]]
#Тест Фишера
oddsratio, p_value = fisher_exact(table, alternative='two-sided')
#p-value
print(p_value)
👍7
#основы #FTE

⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.

🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.

🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
❤4
#метрики #абсентеизм

Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.

⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.

У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.

🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.

Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
👍6
#статистика #ЦПТ #CLT

⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).

В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.

🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.

🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
❤2
#метод #корреляция

⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).

🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.

🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц

Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
import numpy as np

a, b = 30, 10
c, d = 15, 45

phi = (a*d - b*c) / np.sqrt((a+b)*(c+d)*(a+c)*(b+d))
print(Phi)
❤1
#метрики

Ниже ключевые метрики эффективности функции компенсации и льготы. Они оценивают широкий спектр параметров от эффективности расходования бюджета и внутренней и внешней справедливости вознаграждения, до эффективности сотрудников к расходам на них.

1. Выручка и прибыль на FTE

2. Compa-ratio и Market-ratio (CR, MR)

3. Индекс вхождения в диапозон зп (Salary Range Penetration, SRP)


4. Performance to Pay Index (PPI)

5. Интенсивность расходования бюджета

6. Индекс утилизации льгот

7. Полная стоимость сотрудника (Сost per employee, CPE)
❤2👍1
#метод #корреляция

⚡️Точечно-бисериальный коэффициент корреляции (rpb) - это мера связи между одной бинарной переменной (0 / 1, да / нет), и одной количественной переменной (зарплата, возраст, KPI, стаж и т.д.).

🔹Пример:
Мы хотим выявить связь между объемом продаж у сотрудника (количественная переменная) и фактом прохождения обучения по продажам (это бинарная шкала).
Выписываем всех сотрудников с результатами их продаж и делим их на две группе, те, которые прошли обучение и не прошли.
Преобразуем это в матрицу (как на скрине) и применяем формулу точечно-бисериального коэффициента.

🔹Интерпретация аналогична всем прочим видам корреляции

Пример кода на Python для реализации
from scipy.stats import pointbiserialr

# binary — обучение (1-прошел обучение, 0 - нет)
# numeric — результаты продаж
# соотв: первый сотр. прошёл обучение, сделал 120 продаж и тд

binary = [1, 0, 1, 1, 0, 0, 1]
numeric = [120, 95, 130, 110, 90, 100, 125]

r, p = pointbiserialr(binary, numeric)

print(f"r_pb = {r:.3f}")
❤2
#методы #вовлеченность

⚡️ Gallup Q12 - простой способ измерения вовлеченности от компании Gallup.

🔹Методология метода:

1. Сотрудники отвечают на 12 вопросов (скрин) по 5-бальной шкале.

2. HR рассчитывает средний балл по всем оценкам и отдельно по блокам вопросов.

3. На основе получившихся значений считают:
3.1. Индекс вовлечения (Engagement Index):

> 4 - сотрудник активно вовлечён,
3-4 - нейтрален
< 3 - сотрудник не вовлечён.

3.2. Top-Box Scoring: рассчитывается кол-во оценок 4-5, а затем значения по блокам сравниваются между собой. Так выявляются проблемные области по сп.
❤2
#основы #ранжирование

Простенький, но очень важный метод в арсенале любого аналитика (не только HR) - ранжирование данных.

⚡️ Ранжирование - это процедура присвоения объектам порядковых номеров (рангов) на основе их значений.
Если у нас уже есть порядковая шкала (например, оценка: 1–5), мы можем перевести её в ранговую, отсортировав сотрудников и назначив места.
Например, чтобы определить победителей или для выполнения последующего корреляционного анализа (об этом дальше).

🔹В Excel можно выполнить через функцию:
=Ранг(объект, которому будет присвоен ранг; весь массив данных; порядок ранжирования (0 или 1).
не забудьте, используя эту функцию, закрепить ссылку на весь массив (как на скрине), когда будете ее протягивать для всех данных. Сделать это можно выделил ссылку и нажав F4

🔹В Python
import pandas as pd

df = pd.DataFrame({
'name': ['A','B','C','D','E'],
'score': [100, 124, 98, 81, 120]
})

df['rank'] = df['score'].rank()
👍4
#метод #корреляция #Пирсон

⚡️Корреляция Пирсона - инструмент для оценки линейной связи между двумя количественными показателями, выраженными количественными непрерывными шкалами (кг, штуки, рубли, метры и пр.)

🔹Когда применяем?
- данные количественные (зарплата, выручка, производительность, текучесть и т.д.)
- распределение близко к нормальному (или выборка достаточно большая)
- связь предполагается линейной

🔹Алгоритм:
Рассчитывается среднее значение по каждой переменной.
Для каждого наблюдения определяется отклонение от среднего.
Перемножаются отклонения двух переменных.
Сумма произведений нормируется на произведение стандартных отклонений.

🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)

🔹Интерпретация аналогична всем прочим видам корреляции
🔹Наличие кор.связи необязательно предполагает зависимость
❤5
#визуализация

Написал небольшую статью про манипуляции в аналитике через визуализацию данных.

О том, как «правильно» выбранный способ визуализации может кардинально изменить восприятие информации и превратить провальные результаты во вполне достойную работу.

Материал во многом основан на моем опыте по обе стороны «баррикад». Текст написан прежде всего для того, чтобы подчеркнуть важность критического мышления — особенно когда речь идет о данных и их интерпретации. И, конечно, это не инструкция к действию. Скорее — вредные советы.

Надеюсь, со временем дойдут руки до второй части, где разберу трюки с процентами, весами, псевдокорреляциями, манипуляциями с выборками, различными типами агрегаций и другими подобными вещами.
❤3
#метод #корреляция #Спирмен

⚡️ Ранговая корреляция Спирмена — инструмент для оценки связи между показателями, когда данные не нормальны или выражены в рангах (грейды, оценки, разряды, уровни, места и пр).
Например, вам интересно понять есть ли связь между производительностью и разрядом сотрудника.

🔹Алгоритм:
1. Присваивание рангов (пост про ранжирование).
2. Вычисление разностей рангов: Для каждой пары значений вычисляется разность рангов (di).
3. Рассчитывается квадрат разностей рангов (именно поэтому не важно будете ли вы ранжировать данные по возрастанию или убыванию, главное - делайте ранжирование одинаковым для обоих переменных)
3. вычисления коэффициента Спирмена.

🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)
но убедитесь, что вы сделали ранжирование.

🔹Интерпретация аналогична всем прочим видам корреляции
❤3
#визуализация #Excel #условное_форматирование

⚡️ Условное форматирование - это инструмент, который позволяет выделять данные в Excel таблицах на основе пользовательских правил. Инструмент удобен, когда надо "подсветить" какой-то тип данных или какое-то условие в массиве ячеек (>,<,=, повторы, уникальные значения и пр.).

🔹 Где находится:
Раздел находится на вкладке "Главная" >> "Условное форматирование".

🔹Что может:
1. Выделять конкретные значения
2. Показать данные больше/меньше заданного числа.
3. Находить значения в рамках заданного диапозона
4. Находить дубли и уникальные значения и пр.

🔹Как использовать:
Выделяете массив данных для анализа, переходите в раздел условное форматирование и создаете правило, которое тут будет применено ко всему массиву.

Подходит для отчетов, дашбордов и оперативной аналитики.
Помогает быстро находить проблемы или тренды.
Удаляются и редактируются правила в том же разделе.
👍1
#основы #Excel #анализ_данных

⚡️ Пакет анализа данных — мощный и функциональный инструмент, встроенный в Excel, о котором, к сожалению, знает не так много людей.
С его помощью можно выполнять более продвинутые методы анализа, такие как построение регрессионных уравнений, анализ вариации или построение гистограмм.
Пакет, в базовой версии Excel отключен и для его использования требует установки аддона (это бесплатно и доступно для всех версий Excel).

🔹Как подключить:
Переходим во вкладку «Файл» → «Параметры» (слева внизу) → в открывшемся окне выбираем раздел «Надстройки» → справа внизу в поле «Управление» выбираем «Надстройки Excel» и нажимаем «Перейти».
В новом окне ставим галочку рядом с «Пакет анализа» и нажимаем ОК.
После этого раздел «Анализ данных» появится во вкладке «Данные».
❤5
#методы #регрессия

Переходим к прикладным методам анализа данных - линейным уравнениям и регрессиям.

⚡️Линейное уравнение - это самый простой способ попробовать определить зависимость одного фактора от другого и ответить на вопрос: «насколько именно один фактор влияет на другой?». Если корреляции говорят о связи, то здесь речь уже идёт о зависимости (взаимосвязи).

🔹Линейное уравнение имеет вид:
y = ax+b
, где:
y — зависимая величина
a — коэффициент при независимой переменной x
x — значение показателя
b — свободный член

Самый простой способ понять как это работает на практике - посмотреть на значения стажа и оклада или стажа и производительности сотрудника. Собираем такие пары и строим по ним график (в Excel: Диаграммы - Точечная/график). График, который вы увидите на выходе и будет описывать такую связь.
Прямая (как на графике) будет описываться линейный уравнением. Это самый просто вид зависимости, но на практике, конечно, он встречается не так часто.

Как с ней работать поговорим чуть дальше.
❤4
#метрики #укомплектованность

⚡️Укомплектованность - одна из базовых метрик показывающая, насколько заполнено штатное расписание компании. Однако, на нее можно взглянуть и под другим углом. Ниже несколько вариантов расчета метрики с разным акцентом.

🔹Классический вариант показывает, какая доля утверждённых ставок занята сотрудниками на конкретную дату. Используется для общего мониторинга кадровой ситуации и быстрой оценки дефицита персонала.
Ограничение метода — не учитывает частичную занятость и длительные отсутствия.

🔹Через расчет FTE
Более точный метод расчёта, учитывающий долю занятости сотрудников. Позволяет корректно учитывать частичную занятость, совместителей, парт-таймеров и пр. Лучше использовать для операционного управления и бюджетирования.

🔹Операционный или активный укомплект. Метод показывает фактическую рабочую мощность подразделения на дату. Подходит для: планирования смен и графиков, оценки производственной нагрузки, расчёта KPI.

Все расчеты производятся на дату
❤3
#методы #регрессия

Говоря о регрессии, нельзя не упомянуть мультиколлинеарность. Это ситуация, при которой несколько признаков в модели сильно коррелируют между собой. То есть модель получает дублирующую информацию от разных переменных.

В классических линейных моделях в такой ситуации коэффициенты становятся нестабильными, что приводит к искажению результатов и усложняет интерпретацию модели.

🔹Что с этим делать:
После анализа корреляции между признаками следующим шагом является снижение мультиколлинеарности в модели.
Существует несколько подходов:
1. Удаление признаков
Оставляем один фактор из группы сильно коррелирующих, отказываясь от остальных. Доступно в любом формате работы.
2. Регуляризация
Использование методов регуляризации, таких как Lasso и Ridge-регрессия.
Они позволяют снизить влияние избыточных признаков за счёт «штрафа» на коэффициенты. Только python или R

Модель без мультикол. становится лучше и устойчивее и без ущерба точности (пример на скрине).
❤1
#методы #регрессия

Продолжим тему линейных уравнений и поговорим о том, как построить уравнение, описывающее одну переменную через другую в Excel.

На входе у нас есть набор данных, описывающий сотрудников компании через две переменные: стаж и оклад.
Мы сделали предположение, что оклад связан со стажем, проверили это с помощью корреляции и теперь хотим количественно её оценить.

🔹Как построить:
Переходим на вкладку Данные → Анализ данных → Регрессия.
В окне выбираем следующие параметры:

Входной интервал Y — переменная, которую мы хотим описать. Оклады.
Входной интервал X — переменная, через которую мы будем описывать Y. Стаж.
Ставим галочку в разделе «Метки», если в наших данных есть заголовки.
Выходной интервал — ячейка, в которую будет выведен результат анализа.

Из всего многообразия показателей нас интересуют:
Y-пересечение — это базовый коэффициент уравнения;
Коэффициент при переменной стаж — он также войдёт в уравнение.
подставляем их в уравнение и получаем формулу расчета зависимости.
❤2
#основы #исследования

⚡️Шкала Лайкерта (Likert scale) – это шкала используемая в количественных исследованиях для измерения степени согласия или несогласия респондентов с различными утверждениями. Является «базой» для любого исследователя и используемся повсеместно при составлении большинства опросников.
Классическая версия 5-балльная, однако, возможно использовать и 7-балльный вариант, если нужен больший разброс значений (на скрине).
В HR-аналитика шкала используется в большинстве методологий определения вовлеченности персонала, лояльности, при проведении исследований EVP, SCAR, для исследования мотивации и пр.

🔹 Важные нюансы:
1. Шкала является симметричной относительно своего «центра».
2. В опросах в идеале стоит использовать одинаковые ответы. То есть все вопросы формулировать так, чтобы они закрывались одним набором.
3. Все варианты в шкалах, в рамках одного опроса, должны иметь одну логику в ответах. Если вы начинаете ответы от несогласен к согласен, то такой порядок ответов должен сохранятся и далее.
❤4
#AI #Codex

Большинство из нас использует нейронки (будь то chatGPT, deepseek или какие-то другие) в формате веб-версий. Посмотрим на альтернативный способ - через десктопное приложение, которое устанавливается на ваш компьютер.

⚡️ Codex — это инструмент (AI-агент) внутри экосистемы ChatGPT/OpenAI для разработки ПО и агентов. Доступен для скачивания всем пользователям (по крайней мере сейчас) вне зависимости от тарифа или через интерфейс веб-приложения или на оф.сайте.

🔹 Как это выглядит: Вы создаете промт, сохраняете его как навык (то есть готовый скрипт для воспроизведения), а затем автоматизируете работу это скрипта, то есть создаете правила, по которым этот скрипт будет работать уже без вашего участия.

⚠️ Важно: для работы Codex необходимо предоставить доступ к папке, над которым он работает. В этом случае нейросеть получает доступ к файлам и папкам, входящим в рабочую область проекта. Поэтому не рекомендуется размещать в рабочей директории конфиденциальные данные.
👍3
#AI #Cursor

Если Codex-а было мало, то вот еще одно десктопное решение с разными моделями AI.

⚡️ Cursor - редактор кода с встроенным AI, который выглядит как привычный веб-интерфейс нейронки, но вашем компьютере. Есть бесплатный тариф и платные версии с расширенными возможностями.

🔹 Как работать: скачиваете дистрибутив с оф.сайта, устанавливаете программу у себя и запускаете. Нужно будет создать папку проекта (по аналогии с Codex), к которой у нейронки будет доступ и с которой она будет работать. В чате пишите запросы, в соседнем окне получаете код и готовые решения.

🔹 Особенности: Не нужно копировать код в чат. Cursor индексирует проект и понимает связи между файлами, если код находится в папке, к которой у него есть доступ. Можно создавать AI агентов, которые будут выполнять задачи автономно по заранее настроенным правилам.