Аналитика в HR | HR-tech
661 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#методы #лояльность #липпонен

⚡️ Юкка Липпонен (Jukka Lipponen) — исследователь из Хельсинки, предложил интересный метод оценки лояльности и приверженности персонала компании.

Методология метода:
1. Сотрудники отвечают на 10 вопросов (на скрине) по 5-бальной шкале Ликерта, где 1 – категорически не согласен, 5 – полностью согласен с утверждением.
Причем 5 вопросов касаются структурного подразделения, где работает сотрудник и 5 - компании в целом. Вопросы идентичны, меняется только объект суждения.
2. Подсчитывается кол-во баллов отдельно по СП и компании в целом и сравнивается со значениями ниже:

Меньше 10 баллов - критическое значение, низкая лояльность, не является приверженцем компании, возможный детрактор;
10-20 баллов - нейтральная зона;
более 20 баллов - высокая лояльность, сотрудник является приверженцем компании, возможный промоутер компании.

Для чего использовать:
1. Оценка лояльности по СП и компании в целом
2. Идентификация амбассадоров компании
3. Как компонент для включения в кадровый резерв
❤4
#методы #корреляция

Иногда я шучу, что, используя корреляцию возможно найти взаимосвязь буквально между чем угодно. Например, ростом и уровнем заработной платы (надеюсь, что это считывается как шутка).
В действительно же это пример ложной корреляции, которая на практике встречается довольно часто.

⚡️Ложная корреляция – это ситуация при которой два или более показателей демонстрируют корреляцию в следствии совпадения их графиков или наличия некого скрытого фактора, а не причинно-следственной связи. То есть значения двух факторов на графике совпадают, но не связаны по смыслу.

Происходит это по двум причинам:
1. Есть некий скрытый фактор, который влияет на сравн. факторы и не учтен в модели;
2. Случайное совпадение значений двух факторов (как на графике).

Как отследить:
1. Самый очевидный способ — руководствоваться здравым смыслом. Критически анализировать возможность взаимосвязи между факторами.
2. Использовать нулевую гипотезу и проверку p-значения.
3. Обеспечить надлежащую репрезентативность выборки.
👍5❤2
#личное #полумарафон

По мотивам сегодняшнего полумарафона в Лужниках.

На скрине график нормального распределения результатов участников забега (сделаю об этом инструменте отдельный пост).
Построен на массиве данных в примерно 6.5к участников. Это те, кто добежал, дошел, дополз до финиша.

По оси Х - результаты в секундах, по оси Y - доля участников с этим результатом. Желтые колонки - это фактические результаты участников, а синяя диаграмма - это Гаусс.
Почти идеальное распределение.

Теперь немного математики: средняя время участника составило 2 часа, 14 минут 49 секунд, отклонение от него 26 минут 55 секунд.
С вероятностью 95%, если завтра вы побежите полумарафон с более-менее схожими условиями (погода, трасса и пр.), ваш результат будет в диапазоне: 80 минут - 214 минут.

Поздравляю всех, кто участвовал, кто боролся с самим собой и не смотря ни на что, добрался до финиша. Вы большие молодцы!
👍6
#статистика #IQR

⚡️Межквартальный размах (IQR) — это способ измерения разброса средних 50% массива данных. Он рассчитывается как разница между первым квартилем (Q1) и третьим квартилем (Q3).

IQR используется в расчетах, например, для определения выбросов массива данных, представления информации о распределениях случайных величин, для построения графиков (диаграмма размахов) и при анализе выборок.

⚡️Формула расчета: IQR = Q3-Q1.

В Excel готовой функции для расчёта IQR нет, поэтому сначала будет необходимо рассчитать первый и третий квартиль (здесь мы писали как), а затем, отнять от третьего – первый.
👍4
#статистика #выбросы #IQR

Выбросы – это нетипичные значения в выборке данных, которые существенно отличаются от основного массива данных по закону нормальному распределения. Для того, чтобы работать с однородным массивом данных необходимо исключать выбросы. Но как понять какое значение все еще укладывается в нормальное распределение, а какое уже считается выбросом?

Ниже метод выявление выбросов в массиве данных:


1. Сортируем все значения и определяем первый (Q1) и третий (Q3) квартиль. О них мы говорили ранее.

2. Рассчитываем межквартильный размах (IQR). О нем мы также говорили.

3. Теперь рассчитаем диапазон, за пределами которого будут находиться выбросы. Диапазон будет ограничиваться верхней и нижней границей.
a. Верхняя граница = Q3 + (IQR*3)
b. Нижняя граница = Q1 – (IQR*3)

Все, что будет находиться за рамками этих границ считается выбросами
👍8
#основы #гипотеза

⚡️ Гипотеза – один из главных инструментов HR-анализа. Без четко сформулированной гипотезы HR-аналитик рискует свернуть не туда, ничего не найти или найти совсем не то, что он должен был искать.

Ниже три простые шага, которые позволят сформулировать гипотезу:

ШАГ 1: Прежде всего любая гипотеза должна содержать основное предположение, то, что мы планируем доказать или подтвердить. Можно использовать формулировку:
«Мы полагаем, что….»

ШАГ 2: Далее мы должны определить те инструменты, с помощью которых мы сможем проверить исходную гипотезу. Это могут быть разные методы исследования, инструменты или метрики:
«Для проверки гипотезы мы осуществим анализ…. и определим…»

ШАГ 3: Критерий успеха или неудачи позволит заранее определить, что для нас будет являться положительным исходом проверки гипотезы, а что отрицательным:
«Гипотеза будет считаться подтвержденной в случае, если…» «В случае если расчетные показатели …» «Если мы получим результаты …».
👍3
#метрики #eLTV

⚡️Концепция Employee Lifetime Value (eLTV) — это способ измерения дохода, который принесет сотрудник за свою «жизнь» в компании.

Расчет: доходы – расходы на сотрудника.
Доходы – выручка от продаж, производительность выраженная в деньгах и пр.
Расходы – зп, премии, расходы на найм, адаптацию, обучение и пр.

Если речь идет про продажи, производство и подразделения, которые приносят деньги, то все работает. А что делать с бэк-офисом, с теми, кто напрямую не влияет на фин.результат компании?

Один из вариантов решения — введение балльной системы.
Рассчитывается абстрактный балл эффективности (обычно на основе произв.подразделений)
Каждый сотрудник бэк-офиса оценивается на регулярной основе (раз в месяц) и получает какое-то количество баллов.
Эти баллы конвертируются в деньги по итогам работы и определяется годовая эффективность.

Частное мнение автора: eLTVE — это больше красивая концепция. Не видел серьезных кейсов с цифрами применения eLTV в HR. Но допускаю, что где-то это работает.
👍3
#статистика #сигма #среднеквадратическое_отклонение #SD

⚡️ Среднеквадратичное отклонение (standard deviation, стандартное отклонение, сигма, σ) — это показатель, который показывает, насколько сильно все значения в наборе данных отклоняются от среднего значения.

Формулы оставим в стороне, а в Excel стандартное отклонение можно найти с помощью функции =СТАНДОТКЛОН.Г() для генеральной совокупности и =СТАНДОТКЛОН.В() для выборки.

⚡️Пример: У нас есть два набора данных, показывающих, сколько недель искали ИТ-специалиста два рекрутера.
Рекрутер 1: {1, 1, 14, 14};
Рекрутер 2: {6, 6, 9, 9}.
Нужно решить, какому рекрутеру лучше отдать вакансию.
Если рассчитать среднее арифметическое, то в обоих случаях оно составит 7,5 недели. Кажется, что разницы нет, но если посчитать сигму, то у рекрутера 1 она будет 6,5 недель, а у рекрутера 2 — 1,5 недели.

Это означает, что рекрутер 2, скорее всего, закроет вакансию за 7,5 ± 1,5 недели, тогда как у рекрутера 1 результат может варьироваться от 1,5 до 14 недель.
👍3🤔2
#метрики #подбор #испытательный_срок

⚡️ Доля кандидатов, успешно прошедших испытательный срок - это базовая метрика эффективности функций подбора и адаптации сотрудников. Обычно она рассчитывается ежемесячно, но для динамичных рынков или рынков с высокой текучестью (например, в ритейле) такую метрику можно рассчитывать и еженедельно.

Хорошей идеей будет рассчитывать этот показатель по категориям персонала (если применимо для вас): производство, бэкофис и пр. Так как условия работы у разных категорией могут сильно отличаться.

Не забывайте, что испытательный срок не может превышать трех месяцев. Для руководителей организаций, их заместителей, главных бухгалтеров и их заместителей, а также для руководителей филиалов и представительств, он может быть до шести месяцев (ТК РФ).

⚡️Пример: В марте в компанию пришли 30 сотрудников, из которых 15 успешно прошли испытательный срок.
Доля кандидатов, успешно прошедших испытательный срок в марте, составит: 15 / 30 = 0,5 (или 50%).
👍1
#статистика #CI #доверительный_интервал

Часть 1

Имеются данные количества произведенных деталей некоторой группы сотрудников (наша выборка) из большого отдела (а это генеральная совокупность, которая нам не известна).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из данного отдела
Для того, чтобы понять этот диапазон нам и понадобится доверительный интервал.

⚡️Доверительный интервал (confidence interval) – это диапазон, который с определенной вероятностью накрывает оцениваемый параметр генеральной совокупности.
Другими словами, он показывает насколько параметры из выборки могут отличаться от параметров из генеральной совокупности (ГС).

Формула расчета:
расчет происходит в два этапа.
на первом этапе рассчитывается ошибка репрезентативности (standard error). Рассчитывается как среднее квадратическое отклонение / квадратный корень размера выборки.
на втором этапе пользователь задает вероятность погрешности (через t-критерий Стьюдента) и рассчитывает ДИ.
❤3🤔1
#статистика #CI #доверительный_интервал

Часть 2

Пример расчета
:
Имеются данные количества произведенных деталей группы сотрудников (выборка) из большого отдела (ГС).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из всего отдела.

1: рассчитаем обычное среднее арифметическое по выборке. Оно нам понадобится на финальном расчете и составит 30,4

2: рассчитаем стандартного отклонения выборки. Для этого используем функцию =СТАНДОТКЛОН.В() в Excel. Оно равно 1,34

3: рассчитаем ошибку репрезентативности (она же standard error). Для этого станд.отклонение выборки / корень кол-ва эл-тов выборки. Составит 0,6.

4: рассчитаем доверительный интервал. Для этого t-критерий стьюдента * ошибку репрезентативности. Ответ 1,2

Таким образом доверительный интервал, с учетом округления до целых, будет равен 30,4 ± 1,2.

❗️Это значит, что с вероятностью в 95% все остальные значения из ГС, которые мы будем рассматривать, будут находиться в диапазоне 29-32 произведенных деталей.
👍4
#инструменты #МойОфис

⚡️ МойОфис — это альтернатива пакета MS Office от российский разработчиков.
На рынке порядка 10 лет. Входит в реестр российского ПО.
В базовом наборе три продукта: Текст (аналог Word), Таблица (Excel), Презентация (Power point). Решение десктопное.

⚡️Установка: скачиваете дистрибутив, устанавливаете.

⚡️Стоимость: есть пробная бесплатная версия. Платные начинаются от 2,990 за 3 устройства на год. Есть корпоративные решения.

⚡️ Плюсы:
- Хорошо знакомый для пользователей Office интерфейс.
- Совместим с расширениями MS Office + .pdf
- Имеет привычный функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка от разработчиков (БД, видео с обучением и пр.).

Главная фишка – это фокус на контекстных меню в интерфейсе. То есть, когда вы выделяете какие-то фрагменты или ячейки, система предлагает вам варианты того, что можно сделать. Это немного необычно, но быстро привыкаешь.
Как будто не плохое решение, как альтернатива интересна. Попробовал с интересом.
👍3
#визуализация #диаграмма_гутенберга

Вот любопытная концепция взятая из графического дизайна.

⚡️Диаграмма Гутенбрега описывает общую модель движения глаз при взгляде на равномерно распределенную, однотипную информацию, например: слайды презентации или корпоративный портал.
Согласно этой концепции дисплей/страница делится на четыре квадранта с разным уровнем внимания к ним: начальная область — вверху слева, заключительная область — внизу справа, область с высоким потенциалом — вверху справа и область с низким потенциалом — внизу слева.

Больше всего внимания уделяется тексту слева сверху, далее фрагментам в центре и, наконец, снизу справа. Исходя из этого принципа, можно размещать информацию по степени ее значимости для читателей / зрителей. То, на что хотите обратить внимание в первую очередь стоит размещать в центре или слева сверху.

Хотя дизайны, базирующиеся прямо или косвенно на диаграмме Гутенберга, широко распространены, крупных исследований на эту тему не было, так что это все лишь гипотеза.
👍1
#инструменты #Яндекс360

⚡️Яндекс 360 — это облачная экосистема сервисов от Яндекса, которая включает множество продуктов (по аналогии с Google) один из которых Документы. О нем и поговорим.
В базовом наборе три продукта: Документы (аналог Word), Таблицы (Excel) и Презентации (Power Point).
Облачное решение.

⚡️Установка: не требуется. Достаточно зарегистрироваться в система Яндекс.

⚡️Стоимость: бесплатно. Расширенный пакет Яндекс 360 дает дополнительные продукты, но не влияет на функциональность офисных решений.

⚡️Плюсы:
- Хорошо знакомый для пользователей MS Office интерфейс (на скрине)
- Совместим с расширениями MS Office
- Имеет привычный для пользователей функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка одновременной работы над файлом.
- Полностью бесплатно.

Главная фишка - все бесплатно. По функционалу и возможностям очень похоже и на Excel и на МойОфис (в большей степени чем на GDocs).
Хороший аналог, если не смущает, что нет возможности работать автономно.
#личное #полумарафон

На скрине график нормального распределения результатов участников забега национального полумарафона в Казани, который состоялся в прошлое воскресенье.

По оси Х - результаты в секундах, по оси Y - доля участников с этим результатом. Зеленые колонки - это фактические результаты участников, Красная линия – среднее значение, а две желтые линии – стандартное отклонение.
ранее я писал про аналогичное мероприятие в Москве.

Среднее время участника составило 113,1 минут, отклонение от него — 19,7 минут.
Мне было любопытно сравнить это с аналогичным мероприятием в Москве. Там среднее значение было 134,8 минуты, отклонение — 26,5 минут.

Если взять гипотезу, что в московском полумарафоне бОльшая часть участников – москвичи, а в казанском – жители Казани и РТ, то по результатам можно сделать вывод, что Казань бегает быстрее Москвы ))

Как это связано с HR? Никак…впрочем, если вам нужны сотрудники, которые умеют быстро и долго бегать – присмотритесь к ребятам из Казани )
❤3👍2
#визуализация #scatter_plot

⚡️График рассеяния (Scatter Plot) — метод визуализации корреляционных моделей. С его помощью можно определить потенциальные взаимосвязи между количественными переменными.

Каждому объекту соответствует одна точка чьи координаты задаются какими-то характеристиками (например: стаж и доля брака). Если между двумя характеристиками есть взаимосвязь (как на картинке), то точки скорее всего будут стремиться формировать прямую, то есть находиться в рамках одного «коридора» значений, а если связи нет, то вероятнее всего точки будут располагаться на графике хаотично.

⚡️Для чего использовать:
Для визуального отображения связи двух количественных факторов между собой (например, для корреляции). Для убедительности и большей наглядности можно построить дополнительную линию тренда.

⚡️Как построить:
Нужен массив данных, который будет содержать две характеристики одного объекта расположенные попарно.
В Excel на вкладке «Вставить» выбрать «Точечная или пузырьковая диаграмма».
👍1
#методы #корреляция #кендалл #kendall

часть 1

⚡️Коэффициент ранговой корреляции Кендалла (τ, kendall correlation) предназначен для определения взаимосвязи между двумя ранговыми переменными.
Главное отличие от корреляции Спирмена - возможность работать с малыми выборками.

Следует помнить, что коэффициент Кендалла (как и Спирмена) используются как меры взаимозависимости между рядами рангов, а не для определения связи между самими переменными.

Для чего используется:
для поиска взаимосвязи между группами объектов по ранговым шкалам (результаты нескольких тестов, оценки эффективности в разных системах и пр.)
❤5👍1
#методы #корреляция #кендалл

Часть 2

Пример расчета:

Исходная гипотеза: внутренняя оценка результативности работы сотрудников напрямую связана с их IQ. Если это правда, то прогнозировать результативность можно по результат IQ тестов при приеме на работу.
Для проверки гипотезы определим связь между шкалами через коэф. Кендалла. При результате 0,7 и выше - связь будет установлена и гипотеза подтверждена.

1: Проранжируем результаты IQ тестов (X). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Х
2: Проранжируем результаты Внутренняя оценка (Y). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Y
3: Отсортируем по возрастанию столбец (Ранг X)
4: Вычислим число совпадений P, Используем функцию =счетесли(). Результат в колонке P
5: Вычислим число инверсий Q, Используем функцию =счетесли(). Результат в колонке Q
6: Просуммируем совпадения и инверсии и рассчитаем коэф.корреляции Кендалла.

❗️ Коэ.корреляции Кендалла составил 0,5.
Связи между шкалами нет, гипотеза не подтвердилась
❤1
#прочее #рассел

Отдыхаем от математики

Чайник Рассела (Russell's teapot) — занятная аналогия, приведённая английским математиком и философом Бертраном Расселом для объяснения принципа, согласно которому бремя доказательства лежит на утверждающем.

"Если бы я стал утверждать, что между Землей и Марсом вокруг Солнца по эллиптической орбите вращается фарфоровый чайник, никто не смог бы опровергнуть моё утверждение, добавь я предусмотрительно, что чайник слишком мал, чтобы обнаружить его даже при помощи самых мощных телескопов. Но заяви я далее, что, поскольку моё утверждение невозможно опровергнуть, разумный человек не имеет права сомневаться в его истинности, то мне справедливо указали бы, что я несу чушь."
— Б.Рассел

Так что фраза: „Если я что-то утверждаю, я не обязан представлять доказательства. Если вы утверждаете обратное, опровергая меня, это вы должны доказательства представлять.“ контроверсионна.💁‍♂️
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента

Сейчас будет немного мозголомства🥲

⚡️Критерий T-Стьюдента (t-test) используется для проверки нулевой гипотезы и определения статистической значимости различий средних величин между двумя группами.

Условия применения t-критерия Стьюдента для независимых выборок:
- данные количественные;
- данные распределены нормально;
- выборки независимые (объекты в них разные).

Формула: t = (X1 – X2) / sqrt((σ1² / n1) + (σ2² / n2))

Как рассчитывать:
1. Рассчитываем средние значения по каждой группе (X1 и X2).
2. Рассчитываем стандартное отклонение для каждой группы (σ1 и σ2).
3. Рассчитываем стандартную ошибку среднего для каждой группы (SE1 = σ1 / sqrt(n1) и SE2 = σ2 / sqrt(n2)).
4. Подставляем значения в формулу и получаем значение t-критерия Стьюдента.

В следующем посте разберем интерпретацию критерия.
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента

Часть 2

Пример расчета:
У нас есть две выборки по числу звонков сотрудников call-центра. Наша гипотеза в том, что сотрудник 2 делает больше звонков чем сотрудник 1. Проверим гипотезу

1: Рассчитаем показатели среднего арифметического значения (x); стандартное отклонение (SD); ошибку репрезентативности (RX) для каждой из выборок.

2: Рассчитаем t-критерий Стьюдента (t) по формуле: (x1-x2)/ √ (RX1² + RX2²)

3: Рассчитаем число степеней свободы (df) по формуле: (кол-во эл-тов выборке 1 + кол-во эл-тов в выборке 2) – 2.

4. имея t-критерий Стьюдента (2,59) и число степеней свободы (18), найдем значение ошибки (p) из таблицы

❗️Это значит, что с вероятностью 95% сотрудник 2 действительно делает больше звонков чем сотрудник 1. Гипотеза подтвердилась.
❤1