Аналитика в HR | HR-tech
661 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#статистика #IQR

⚡️Межквартальный размах (IQR) — это способ измерения разброса средних 50% массива данных. Он рассчитывается как разница между первым квартилем (Q1) и третьим квартилем (Q3).

IQR используется в расчетах, например, для определения выбросов массива данных, представления информации о распределениях случайных величин, для построения графиков (диаграмма размахов) и при анализе выборок.

⚡️Формула расчета: IQR = Q3-Q1.

В Excel готовой функции для расчёта IQR нет, поэтому сначала будет необходимо рассчитать первый и третий квартиль (здесь мы писали как), а затем, отнять от третьего – первый.
👍4
#статистика #выбросы #IQR

Выбросы – это нетипичные значения в выборке данных, которые существенно отличаются от основного массива данных по закону нормальному распределения. Для того, чтобы работать с однородным массивом данных необходимо исключать выбросы. Но как понять какое значение все еще укладывается в нормальное распределение, а какое уже считается выбросом?

Ниже метод выявление выбросов в массиве данных:


1. Сортируем все значения и определяем первый (Q1) и третий (Q3) квартиль. О них мы говорили ранее.

2. Рассчитываем межквартильный размах (IQR). О нем мы также говорили.

3. Теперь рассчитаем диапазон, за пределами которого будут находиться выбросы. Диапазон будет ограничиваться верхней и нижней границей.
a. Верхняя граница = Q3 + (IQR*3)
b. Нижняя граница = Q1 – (IQR*3)

Все, что будет находиться за рамками этих границ считается выбросами
👍8
#основы #гипотеза

⚡️ Гипотеза – один из главных инструментов HR-анализа. Без четко сформулированной гипотезы HR-аналитик рискует свернуть не туда, ничего не найти или найти совсем не то, что он должен был искать.

Ниже три простые шага, которые позволят сформулировать гипотезу:

ШАГ 1: Прежде всего любая гипотеза должна содержать основное предположение, то, что мы планируем доказать или подтвердить. Можно использовать формулировку:
«Мы полагаем, что….»

ШАГ 2: Далее мы должны определить те инструменты, с помощью которых мы сможем проверить исходную гипотезу. Это могут быть разные методы исследования, инструменты или метрики:
«Для проверки гипотезы мы осуществим анализ…. и определим…»

ШАГ 3: Критерий успеха или неудачи позволит заранее определить, что для нас будет являться положительным исходом проверки гипотезы, а что отрицательным:
«Гипотеза будет считаться подтвержденной в случае, если…» «В случае если расчетные показатели …» «Если мы получим результаты …».
👍3
#метрики #eLTV

⚡️Концепция Employee Lifetime Value (eLTV) — это способ измерения дохода, который принесет сотрудник за свою «жизнь» в компании.

Расчет: доходы – расходы на сотрудника.
Доходы – выручка от продаж, производительность выраженная в деньгах и пр.
Расходы – зп, премии, расходы на найм, адаптацию, обучение и пр.

Если речь идет про продажи, производство и подразделения, которые приносят деньги, то все работает. А что делать с бэк-офисом, с теми, кто напрямую не влияет на фин.результат компании?

Один из вариантов решения — введение балльной системы.
Рассчитывается абстрактный балл эффективности (обычно на основе произв.подразделений)
Каждый сотрудник бэк-офиса оценивается на регулярной основе (раз в месяц) и получает какое-то количество баллов.
Эти баллы конвертируются в деньги по итогам работы и определяется годовая эффективность.

Частное мнение автора: eLTVE — это больше красивая концепция. Не видел серьезных кейсов с цифрами применения eLTV в HR. Но допускаю, что где-то это работает.
👍3
#статистика #сигма #среднеквадратическое_отклонение #SD

⚡️ Среднеквадратичное отклонение (standard deviation, стандартное отклонение, сигма, σ) — это показатель, который показывает, насколько сильно все значения в наборе данных отклоняются от среднего значения.

Формулы оставим в стороне, а в Excel стандартное отклонение можно найти с помощью функции =СТАНДОТКЛОН.Г() для генеральной совокупности и =СТАНДОТКЛОН.В() для выборки.

⚡️Пример: У нас есть два набора данных, показывающих, сколько недель искали ИТ-специалиста два рекрутера.
Рекрутер 1: {1, 1, 14, 14};
Рекрутер 2: {6, 6, 9, 9}.
Нужно решить, какому рекрутеру лучше отдать вакансию.
Если рассчитать среднее арифметическое, то в обоих случаях оно составит 7,5 недели. Кажется, что разницы нет, но если посчитать сигму, то у рекрутера 1 она будет 6,5 недель, а у рекрутера 2 — 1,5 недели.

Это означает, что рекрутер 2, скорее всего, закроет вакансию за 7,5 ± 1,5 недели, тогда как у рекрутера 1 результат может варьироваться от 1,5 до 14 недель.
👍3🤔2
#метрики #подбор #испытательный_срок

⚡️ Доля кандидатов, успешно прошедших испытательный срок - это базовая метрика эффективности функций подбора и адаптации сотрудников. Обычно она рассчитывается ежемесячно, но для динамичных рынков или рынков с высокой текучестью (например, в ритейле) такую метрику можно рассчитывать и еженедельно.

Хорошей идеей будет рассчитывать этот показатель по категориям персонала (если применимо для вас): производство, бэкофис и пр. Так как условия работы у разных категорией могут сильно отличаться.

Не забывайте, что испытательный срок не может превышать трех месяцев. Для руководителей организаций, их заместителей, главных бухгалтеров и их заместителей, а также для руководителей филиалов и представительств, он может быть до шести месяцев (ТК РФ).

⚡️Пример: В марте в компанию пришли 30 сотрудников, из которых 15 успешно прошли испытательный срок.
Доля кандидатов, успешно прошедших испытательный срок в марте, составит: 15 / 30 = 0,5 (или 50%).
👍1
#статистика #CI #доверительный_интервал

Часть 1

Имеются данные количества произведенных деталей некоторой группы сотрудников (наша выборка) из большого отдела (а это генеральная совокупность, которая нам не известна).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из данного отдела
Для того, чтобы понять этот диапазон нам и понадобится доверительный интервал.

⚡️Доверительный интервал (confidence interval) – это диапазон, который с определенной вероятностью накрывает оцениваемый параметр генеральной совокупности.
Другими словами, он показывает насколько параметры из выборки могут отличаться от параметров из генеральной совокупности (ГС).

Формула расчета:
расчет происходит в два этапа.
на первом этапе рассчитывается ошибка репрезентативности (standard error). Рассчитывается как среднее квадратическое отклонение / квадратный корень размера выборки.
на втором этапе пользователь задает вероятность погрешности (через t-критерий Стьюдента) и рассчитывает ДИ.
❤3🤔1
#статистика #CI #доверительный_интервал

Часть 2

Пример расчета
:
Имеются данные количества произведенных деталей группы сотрудников (выборка) из большого отдела (ГС).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из всего отдела.

1: рассчитаем обычное среднее арифметическое по выборке. Оно нам понадобится на финальном расчете и составит 30,4

2: рассчитаем стандартного отклонения выборки. Для этого используем функцию =СТАНДОТКЛОН.В() в Excel. Оно равно 1,34

3: рассчитаем ошибку репрезентативности (она же standard error). Для этого станд.отклонение выборки / корень кол-ва эл-тов выборки. Составит 0,6.

4: рассчитаем доверительный интервал. Для этого t-критерий стьюдента * ошибку репрезентативности. Ответ 1,2

Таким образом доверительный интервал, с учетом округления до целых, будет равен 30,4 ± 1,2.

❗️Это значит, что с вероятностью в 95% все остальные значения из ГС, которые мы будем рассматривать, будут находиться в диапазоне 29-32 произведенных деталей.
👍4
#инструменты #МойОфис

⚡️ МойОфис — это альтернатива пакета MS Office от российский разработчиков.
На рынке порядка 10 лет. Входит в реестр российского ПО.
В базовом наборе три продукта: Текст (аналог Word), Таблица (Excel), Презентация (Power point). Решение десктопное.

⚡️Установка: скачиваете дистрибутив, устанавливаете.

⚡️Стоимость: есть пробная бесплатная версия. Платные начинаются от 2,990 за 3 устройства на год. Есть корпоративные решения.

⚡️ Плюсы:
- Хорошо знакомый для пользователей Office интерфейс.
- Совместим с расширениями MS Office + .pdf
- Имеет привычный функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка от разработчиков (БД, видео с обучением и пр.).

Главная фишка – это фокус на контекстных меню в интерфейсе. То есть, когда вы выделяете какие-то фрагменты или ячейки, система предлагает вам варианты того, что можно сделать. Это немного необычно, но быстро привыкаешь.
Как будто не плохое решение, как альтернатива интересна. Попробовал с интересом.
👍3
#визуализация #диаграмма_гутенберга

Вот любопытная концепция взятая из графического дизайна.

⚡️Диаграмма Гутенбрега описывает общую модель движения глаз при взгляде на равномерно распределенную, однотипную информацию, например: слайды презентации или корпоративный портал.
Согласно этой концепции дисплей/страница делится на четыре квадранта с разным уровнем внимания к ним: начальная область — вверху слева, заключительная область — внизу справа, область с высоким потенциалом — вверху справа и область с низким потенциалом — внизу слева.

Больше всего внимания уделяется тексту слева сверху, далее фрагментам в центре и, наконец, снизу справа. Исходя из этого принципа, можно размещать информацию по степени ее значимости для читателей / зрителей. То, на что хотите обратить внимание в первую очередь стоит размещать в центре или слева сверху.

Хотя дизайны, базирующиеся прямо или косвенно на диаграмме Гутенберга, широко распространены, крупных исследований на эту тему не было, так что это все лишь гипотеза.
👍1
#инструменты #Яндекс360

⚡️Яндекс 360 — это облачная экосистема сервисов от Яндекса, которая включает множество продуктов (по аналогии с Google) один из которых Документы. О нем и поговорим.
В базовом наборе три продукта: Документы (аналог Word), Таблицы (Excel) и Презентации (Power Point).
Облачное решение.

⚡️Установка: не требуется. Достаточно зарегистрироваться в система Яндекс.

⚡️Стоимость: бесплатно. Расширенный пакет Яндекс 360 дает дополнительные продукты, но не влияет на функциональность офисных решений.

⚡️Плюсы:
- Хорошо знакомый для пользователей MS Office интерфейс (на скрине)
- Совместим с расширениями MS Office
- Имеет привычный для пользователей функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка одновременной работы над файлом.
- Полностью бесплатно.

Главная фишка - все бесплатно. По функционалу и возможностям очень похоже и на Excel и на МойОфис (в большей степени чем на GDocs).
Хороший аналог, если не смущает, что нет возможности работать автономно.
#личное #полумарафон

На скрине график нормального распределения результатов участников забега национального полумарафона в Казани, который состоялся в прошлое воскресенье.

По оси Х - результаты в секундах, по оси Y - доля участников с этим результатом. Зеленые колонки - это фактические результаты участников, Красная линия – среднее значение, а две желтые линии – стандартное отклонение.
ранее я писал про аналогичное мероприятие в Москве.

Среднее время участника составило 113,1 минут, отклонение от него — 19,7 минут.
Мне было любопытно сравнить это с аналогичным мероприятием в Москве. Там среднее значение было 134,8 минуты, отклонение — 26,5 минут.

Если взять гипотезу, что в московском полумарафоне бОльшая часть участников – москвичи, а в казанском – жители Казани и РТ, то по результатам можно сделать вывод, что Казань бегает быстрее Москвы ))

Как это связано с HR? Никак…впрочем, если вам нужны сотрудники, которые умеют быстро и долго бегать – присмотритесь к ребятам из Казани )
❤3👍2
#визуализация #scatter_plot

⚡️График рассеяния (Scatter Plot) — метод визуализации корреляционных моделей. С его помощью можно определить потенциальные взаимосвязи между количественными переменными.

Каждому объекту соответствует одна точка чьи координаты задаются какими-то характеристиками (например: стаж и доля брака). Если между двумя характеристиками есть взаимосвязь (как на картинке), то точки скорее всего будут стремиться формировать прямую, то есть находиться в рамках одного «коридора» значений, а если связи нет, то вероятнее всего точки будут располагаться на графике хаотично.

⚡️Для чего использовать:
Для визуального отображения связи двух количественных факторов между собой (например, для корреляции). Для убедительности и большей наглядности можно построить дополнительную линию тренда.

⚡️Как построить:
Нужен массив данных, который будет содержать две характеристики одного объекта расположенные попарно.
В Excel на вкладке «Вставить» выбрать «Точечная или пузырьковая диаграмма».
👍1
#методы #корреляция #кендалл #kendall

часть 1

⚡️Коэффициент ранговой корреляции Кендалла (τ, kendall correlation) предназначен для определения взаимосвязи между двумя ранговыми переменными.
Главное отличие от корреляции Спирмена - возможность работать с малыми выборками.

Следует помнить, что коэффициент Кендалла (как и Спирмена) используются как меры взаимозависимости между рядами рангов, а не для определения связи между самими переменными.

Для чего используется:
для поиска взаимосвязи между группами объектов по ранговым шкалам (результаты нескольких тестов, оценки эффективности в разных системах и пр.)
❤5👍1
#методы #корреляция #кендалл

Часть 2

Пример расчета:

Исходная гипотеза: внутренняя оценка результативности работы сотрудников напрямую связана с их IQ. Если это правда, то прогнозировать результативность можно по результат IQ тестов при приеме на работу.
Для проверки гипотезы определим связь между шкалами через коэф. Кендалла. При результате 0,7 и выше - связь будет установлена и гипотеза подтверждена.

1: Проранжируем результаты IQ тестов (X). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Х
2: Проранжируем результаты Внутренняя оценка (Y). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Y
3: Отсортируем по возрастанию столбец (Ранг X)
4: Вычислим число совпадений P, Используем функцию =счетесли(). Результат в колонке P
5: Вычислим число инверсий Q, Используем функцию =счетесли(). Результат в колонке Q
6: Просуммируем совпадения и инверсии и рассчитаем коэф.корреляции Кендалла.

❗️ Коэ.корреляции Кендалла составил 0,5.
Связи между шкалами нет, гипотеза не подтвердилась
❤1
#прочее #рассел

Отдыхаем от математики

Чайник Рассела (Russell's teapot) — занятная аналогия, приведённая английским математиком и философом Бертраном Расселом для объяснения принципа, согласно которому бремя доказательства лежит на утверждающем.

"Если бы я стал утверждать, что между Землей и Марсом вокруг Солнца по эллиптической орбите вращается фарфоровый чайник, никто не смог бы опровергнуть моё утверждение, добавь я предусмотрительно, что чайник слишком мал, чтобы обнаружить его даже при помощи самых мощных телескопов. Но заяви я далее, что, поскольку моё утверждение невозможно опровергнуть, разумный человек не имеет права сомневаться в его истинности, то мне справедливо указали бы, что я несу чушь."
— Б.Рассел

Так что фраза: „Если я что-то утверждаю, я не обязан представлять доказательства. Если вы утверждаете обратное, опровергая меня, это вы должны доказательства представлять.“ контроверсионна.💁‍♂️
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента

Сейчас будет немного мозголомства🥲

⚡️Критерий T-Стьюдента (t-test) используется для проверки нулевой гипотезы и определения статистической значимости различий средних величин между двумя группами.

Условия применения t-критерия Стьюдента для независимых выборок:
- данные количественные;
- данные распределены нормально;
- выборки независимые (объекты в них разные).

Формула: t = (X1 – X2) / sqrt((σ1² / n1) + (σ2² / n2))

Как рассчитывать:
1. Рассчитываем средние значения по каждой группе (X1 и X2).
2. Рассчитываем стандартное отклонение для каждой группы (σ1 и σ2).
3. Рассчитываем стандартную ошибку среднего для каждой группы (SE1 = σ1 / sqrt(n1) и SE2 = σ2 / sqrt(n2)).
4. Подставляем значения в формулу и получаем значение t-критерия Стьюдента.

В следующем посте разберем интерпретацию критерия.
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента

Часть 2

Пример расчета:
У нас есть две выборки по числу звонков сотрудников call-центра. Наша гипотеза в том, что сотрудник 2 делает больше звонков чем сотрудник 1. Проверим гипотезу

1: Рассчитаем показатели среднего арифметического значения (x); стандартное отклонение (SD); ошибку репрезентативности (RX) для каждой из выборок.

2: Рассчитаем t-критерий Стьюдента (t) по формуле: (x1-x2)/ √ (RX1² + RX2²)

3: Рассчитаем число степеней свободы (df) по формуле: (кол-во эл-тов выборке 1 + кол-во эл-тов в выборке 2) – 2.

4. имея t-критерий Стьюдента (2,59) и число степеней свободы (18), найдем значение ошибки (p) из таблицы

❗️Это значит, что с вероятностью 95% сотрудник 2 действительно делает больше звонков чем сотрудник 1. Гипотеза подтвердилась.
❤1
#Excel #МойОфис #Яндекс_Документы #LibreOffice #OpenOffice #инструменты

Собрал несколько альтернатив привычному Excel.
Их можно разделить на две категории: облачные, которые требуют постоянного подключения к сети и полноценное ПО, которое устанавливается и позволяет работать автономно.

К первой категории относятся два приложения от одной группы разработчиков: OpenOffice, LibreOffice. У обоих открытый код и сильное комьюнити. Первым был OpenOffice, но в какой-то момент часть команды начала разрабатывать другой проект - LibreOffice. Решения похожи, но поддержка LibreOffice продолжается до сих пор, а вот последнее обновление OpenOffice было в 2019 году.

Ко второй категории относится, в первую очередь, Google Таблицы, но с ним все понятно, и два решения от российских разработчиков: МойОфис, ЯндексДокументы. Как понятно оба продукта входят в реестр российского ПО. Продукты, если не учитывать специфики в интерфейсе, очень схожи.

Подробнее про решения:

OpenOffice

LibreOffice

МойОфис

Яндекс Документы: 360
👍2
#визуализация #облако_тэгов

⚡️Облако слов (или тэгов) – это популярный элемент визуализации для отображения частоты упоминаний слов и выражений в массиве текста.

Для чего использовать:
если хотите показать самые часто упоминаемые слова. Например, в отзывах или в тексте. В таких случаях размер слова будет зависеть от того, насколько часто его использовали. Больше слово - чаще упоминали.

Как построить:
Оптимальным решением будет воспользоваться R или Python. Но, по понятным причинам, это доступно не всем.
Второй вариант – воспользоваться веб-сервисами.
Для этого будет необходимо сначала посчитать количество упоминаний слов в тексте. Сделать это можно либо встроенными средствами Excel, Word или опять же специальными сервисами, например, таким.
Теперь, когда у нас есть частотность упоминаний слов идем в этот сервис или в этот.
Там руками вписываем слова (топ 10, например), указываем частоту их упоминания и сервисы сами построят вам облако слов с возможностью их выгрузки к себе на компьютер бесплатно.
❤5😢1
#методы #корреляция #пирсон

⚡️Коэффициент корреляции Пирсона (p, Pearson correlation) предназначен для определения взаимосвязи между двумя переменными (или признаками объекта) в метрических шкалах.
Важно отметить, что корреляция показывает только ассоциацию, но не прямую закономерность между факторами.

Для чего используется:
для поиска взаимосвязи между несколькими характеристиками группы объектов. Например, связь стажа сотрудника и показателями его эффективности (штуки, деньги, тонны, км и пр).

В Excel этот вид корреляции легко рассчитывается с помощью функции =КОРРЕЛ(массив данных1; массив данных2).

Интерпретация:
Аналогично другим видам корреляции. Если коэф. корреляции больше 0,7 или меньше (-0,7) существует устойчивая связь между характеристиками (положительная или отрицательная).

Пример:
есть набор данных: стаж сотрудника (мес.) и кол-во звонков, которые он делает. Наша гипотеза - эти показатели связаны.
используем функцию и выясняем, что связь есть и отрицательная. Меньше стаж - больше звонков.