Аналитика в HR | HR-tech
661 subscribers
250 photos
1 file
90 links
HR-аналитика | HR-tech
Авторский образовательный канал, посвящённый HR-аналитике, исследованиям рынка труда, HR Tech-решениям и AI.
Download Telegram
#статистика #сигма #среднеквадратическое_отклонение #SD

⚡️ Среднеквадратичное отклонение (standard deviation, стандартное отклонение, сигма, σ) — это показатель, который показывает, насколько сильно все значения в наборе данных отклоняются от среднего значения.

Формулы оставим в стороне, а в Excel стандартное отклонение можно найти с помощью функции =СТАНДОТКЛОН.Г() для генеральной совокупности и =СТАНДОТКЛОН.В() для выборки.

⚡️Пример: У нас есть два набора данных, показывающих, сколько недель искали ИТ-специалиста два рекрутера.
Рекрутер 1: {1, 1, 14, 14};
Рекрутер 2: {6, 6, 9, 9}.
Нужно решить, какому рекрутеру лучше отдать вакансию.
Если рассчитать среднее арифметическое, то в обоих случаях оно составит 7,5 недели. Кажется, что разницы нет, но если посчитать сигму, то у рекрутера 1 она будет 6,5 недель, а у рекрутера 2 — 1,5 недели.

Это означает, что рекрутер 2, скорее всего, закроет вакансию за 7,5 ± 1,5 недели, тогда как у рекрутера 1 результат может варьироваться от 1,5 до 14 недель.
👍3🤔2
#метрики #подбор #испытательный_срок

⚡️ Доля кандидатов, успешно прошедших испытательный срок - это базовая метрика эффективности функций подбора и адаптации сотрудников. Обычно она рассчитывается ежемесячно, но для динамичных рынков или рынков с высокой текучестью (например, в ритейле) такую метрику можно рассчитывать и еженедельно.

Хорошей идеей будет рассчитывать этот показатель по категориям персонала (если применимо для вас): производство, бэкофис и пр. Так как условия работы у разных категорией могут сильно отличаться.

Не забывайте, что испытательный срок не может превышать трех месяцев. Для руководителей организаций, их заместителей, главных бухгалтеров и их заместителей, а также для руководителей филиалов и представительств, он может быть до шести месяцев (ТК РФ).

⚡️Пример: В марте в компанию пришли 30 сотрудников, из которых 15 успешно прошли испытательный срок.
Доля кандидатов, успешно прошедших испытательный срок в марте, составит: 15 / 30 = 0,5 (или 50%).
👍1
#статистика #CI #доверительный_интервал

Часть 1

Имеются данные количества произведенных деталей некоторой группы сотрудников (наша выборка) из большого отдела (а это генеральная совокупность, которая нам не известна).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из данного отдела
Для того, чтобы понять этот диапазон нам и понадобится доверительный интервал.

⚡️Доверительный интервал (confidence interval) – это диапазон, который с определенной вероятностью накрывает оцениваемый параметр генеральной совокупности.
Другими словами, он показывает насколько параметры из выборки могут отличаться от параметров из генеральной совокупности (ГС).

Формула расчета:
расчет происходит в два этапа.
на первом этапе рассчитывается ошибка репрезентативности (standard error). Рассчитывается как среднее квадратическое отклонение / квадратный корень размера выборки.
на втором этапе пользователь задает вероятность погрешности (через t-критерий Стьюдента) и рассчитывает ДИ.
❤3🤔1
#статистика #CI #доверительный_интервал

Часть 2

Пример расчета
:
Имеются данные количества произведенных деталей группы сотрудников (выборка) из большого отдела (ГС).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из всего отдела.

1: рассчитаем обычное среднее арифметическое по выборке. Оно нам понадобится на финальном расчете и составит 30,4

2: рассчитаем стандартного отклонения выборки. Для этого используем функцию =СТАНДОТКЛОН.В() в Excel. Оно равно 1,34

3: рассчитаем ошибку репрезентативности (она же standard error). Для этого станд.отклонение выборки / корень кол-ва эл-тов выборки. Составит 0,6.

4: рассчитаем доверительный интервал. Для этого t-критерий стьюдента * ошибку репрезентативности. Ответ 1,2

Таким образом доверительный интервал, с учетом округления до целых, будет равен 30,4 ± 1,2.

❗️Это значит, что с вероятностью в 95% все остальные значения из ГС, которые мы будем рассматривать, будут находиться в диапазоне 29-32 произведенных деталей.
👍4
#инструменты #МойОфис

⚡️ МойОфис — это альтернатива пакета MS Office от российский разработчиков.
На рынке порядка 10 лет. Входит в реестр российского ПО.
В базовом наборе три продукта: Текст (аналог Word), Таблица (Excel), Презентация (Power point). Решение десктопное.

⚡️Установка: скачиваете дистрибутив, устанавливаете.

⚡️Стоимость: есть пробная бесплатная версия. Платные начинаются от 2,990 за 3 устройства на год. Есть корпоративные решения.

⚡️ Плюсы:
- Хорошо знакомый для пользователей Office интерфейс.
- Совместим с расширениями MS Office + .pdf
- Имеет привычный функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка от разработчиков (БД, видео с обучением и пр.).

Главная фишка – это фокус на контекстных меню в интерфейсе. То есть, когда вы выделяете какие-то фрагменты или ячейки, система предлагает вам варианты того, что можно сделать. Это немного необычно, но быстро привыкаешь.
Как будто не плохое решение, как альтернатива интересна. Попробовал с интересом.
👍3
#визуализация #диаграмма_гутенберга

Вот любопытная концепция взятая из графического дизайна.

⚡️Диаграмма Гутенбрега описывает общую модель движения глаз при взгляде на равномерно распределенную, однотипную информацию, например: слайды презентации или корпоративный портал.
Согласно этой концепции дисплей/страница делится на четыре квадранта с разным уровнем внимания к ним: начальная область — вверху слева, заключительная область — внизу справа, область с высоким потенциалом — вверху справа и область с низким потенциалом — внизу слева.

Больше всего внимания уделяется тексту слева сверху, далее фрагментам в центре и, наконец, снизу справа. Исходя из этого принципа, можно размещать информацию по степени ее значимости для читателей / зрителей. То, на что хотите обратить внимание в первую очередь стоит размещать в центре или слева сверху.

Хотя дизайны, базирующиеся прямо или косвенно на диаграмме Гутенберга, широко распространены, крупных исследований на эту тему не было, так что это все лишь гипотеза.
👍1
#инструменты #Яндекс360

⚡️Яндекс 360 — это облачная экосистема сервисов от Яндекса, которая включает множество продуктов (по аналогии с Google) один из которых Документы. О нем и поговорим.
В базовом наборе три продукта: Документы (аналог Word), Таблицы (Excel) и Презентации (Power Point).
Облачное решение.

⚡️Установка: не требуется. Достаточно зарегистрироваться в система Яндекс.

⚡️Стоимость: бесплатно. Расширенный пакет Яндекс 360 дает дополнительные продукты, но не влияет на функциональность офисных решений.

⚡️Плюсы:
- Хорошо знакомый для пользователей MS Office интерфейс (на скрине)
- Совместим с расширениями MS Office
- Имеет привычный для пользователей функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка одновременной работы над файлом.
- Полностью бесплатно.

Главная фишка - все бесплатно. По функционалу и возможностям очень похоже и на Excel и на МойОфис (в большей степени чем на GDocs).
Хороший аналог, если не смущает, что нет возможности работать автономно.
#личное #полумарафон

На скрине график нормального распределения результатов участников забега национального полумарафона в Казани, который состоялся в прошлое воскресенье.

По оси Х - результаты в секундах, по оси Y - доля участников с этим результатом. Зеленые колонки - это фактические результаты участников, Красная линия – среднее значение, а две желтые линии – стандартное отклонение.
ранее я писал про аналогичное мероприятие в Москве.

Среднее время участника составило 113,1 минут, отклонение от него — 19,7 минут.
Мне было любопытно сравнить это с аналогичным мероприятием в Москве. Там среднее значение было 134,8 минуты, отклонение — 26,5 минут.

Если взять гипотезу, что в московском полумарафоне бОльшая часть участников – москвичи, а в казанском – жители Казани и РТ, то по результатам можно сделать вывод, что Казань бегает быстрее Москвы ))

Как это связано с HR? Никак…впрочем, если вам нужны сотрудники, которые умеют быстро и долго бегать – присмотритесь к ребятам из Казани )
❤3👍2
#визуализация #scatter_plot

⚡️График рассеяния (Scatter Plot) — метод визуализации корреляционных моделей. С его помощью можно определить потенциальные взаимосвязи между количественными переменными.

Каждому объекту соответствует одна точка чьи координаты задаются какими-то характеристиками (например: стаж и доля брака). Если между двумя характеристиками есть взаимосвязь (как на картинке), то точки скорее всего будут стремиться формировать прямую, то есть находиться в рамках одного «коридора» значений, а если связи нет, то вероятнее всего точки будут располагаться на графике хаотично.

⚡️Для чего использовать:
Для визуального отображения связи двух количественных факторов между собой (например, для корреляции). Для убедительности и большей наглядности можно построить дополнительную линию тренда.

⚡️Как построить:
Нужен массив данных, который будет содержать две характеристики одного объекта расположенные попарно.
В Excel на вкладке «Вставить» выбрать «Точечная или пузырьковая диаграмма».
👍1
#методы #корреляция #кендалл #kendall

часть 1

⚡️Коэффициент ранговой корреляции Кендалла (τ, kendall correlation) предназначен для определения взаимосвязи между двумя ранговыми переменными.
Главное отличие от корреляции Спирмена - возможность работать с малыми выборками.

Следует помнить, что коэффициент Кендалла (как и Спирмена) используются как меры взаимозависимости между рядами рангов, а не для определения связи между самими переменными.

Для чего используется:
для поиска взаимосвязи между группами объектов по ранговым шкалам (результаты нескольких тестов, оценки эффективности в разных системах и пр.)
❤5👍1
#методы #корреляция #кендалл

Часть 2

Пример расчета:

Исходная гипотеза: внутренняя оценка результативности работы сотрудников напрямую связана с их IQ. Если это правда, то прогнозировать результативность можно по результат IQ тестов при приеме на работу.
Для проверки гипотезы определим связь между шкалами через коэф. Кендалла. При результате 0,7 и выше - связь будет установлена и гипотеза подтверждена.

1: Проранжируем результаты IQ тестов (X). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Х
2: Проранжируем результаты Внутренняя оценка (Y). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Y
3: Отсортируем по возрастанию столбец (Ранг X)
4: Вычислим число совпадений P, Используем функцию =счетесли(). Результат в колонке P
5: Вычислим число инверсий Q, Используем функцию =счетесли(). Результат в колонке Q
6: Просуммируем совпадения и инверсии и рассчитаем коэф.корреляции Кендалла.

❗️ Коэ.корреляции Кендалла составил 0,5.
Связи между шкалами нет, гипотеза не подтвердилась
❤1
#прочее #рассел

Отдыхаем от математики

Чайник Рассела (Russell's teapot) — занятная аналогия, приведённая английским математиком и философом Бертраном Расселом для объяснения принципа, согласно которому бремя доказательства лежит на утверждающем.

"Если бы я стал утверждать, что между Землей и Марсом вокруг Солнца по эллиптической орбите вращается фарфоровый чайник, никто не смог бы опровергнуть моё утверждение, добавь я предусмотрительно, что чайник слишком мал, чтобы обнаружить его даже при помощи самых мощных телескопов. Но заяви я далее, что, поскольку моё утверждение невозможно опровергнуть, разумный человек не имеет права сомневаться в его истинности, то мне справедливо указали бы, что я несу чушь."
— Б.Рассел

Так что фраза: „Если я что-то утверждаю, я не обязан представлять доказательства. Если вы утверждаете обратное, опровергая меня, это вы должны доказательства представлять.“ контроверсионна.💁‍♂️
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента

Сейчас будет немного мозголомства🥲

⚡️Критерий T-Стьюдента (t-test) используется для проверки нулевой гипотезы и определения статистической значимости различий средних величин между двумя группами.

Условия применения t-критерия Стьюдента для независимых выборок:
- данные количественные;
- данные распределены нормально;
- выборки независимые (объекты в них разные).

Формула: t = (X1 – X2) / sqrt((σ1² / n1) + (σ2² / n2))

Как рассчитывать:
1. Рассчитываем средние значения по каждой группе (X1 и X2).
2. Рассчитываем стандартное отклонение для каждой группы (σ1 и σ2).
3. Рассчитываем стандартную ошибку среднего для каждой группы (SE1 = σ1 / sqrt(n1) и SE2 = σ2 / sqrt(n2)).
4. Подставляем значения в формулу и получаем значение t-критерия Стьюдента.

В следующем посте разберем интерпретацию критерия.
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента

Часть 2

Пример расчета:
У нас есть две выборки по числу звонков сотрудников call-центра. Наша гипотеза в том, что сотрудник 2 делает больше звонков чем сотрудник 1. Проверим гипотезу

1: Рассчитаем показатели среднего арифметического значения (x); стандартное отклонение (SD); ошибку репрезентативности (RX) для каждой из выборок.

2: Рассчитаем t-критерий Стьюдента (t) по формуле: (x1-x2)/ √ (RX1² + RX2²)

3: Рассчитаем число степеней свободы (df) по формуле: (кол-во эл-тов выборке 1 + кол-во эл-тов в выборке 2) – 2.

4. имея t-критерий Стьюдента (2,59) и число степеней свободы (18), найдем значение ошибки (p) из таблицы

❗️Это значит, что с вероятностью 95% сотрудник 2 действительно делает больше звонков чем сотрудник 1. Гипотеза подтвердилась.
❤1
#Excel #МойОфис #Яндекс_Документы #LibreOffice #OpenOffice #инструменты

Собрал несколько альтернатив привычному Excel.
Их можно разделить на две категории: облачные, которые требуют постоянного подключения к сети и полноценное ПО, которое устанавливается и позволяет работать автономно.

К первой категории относятся два приложения от одной группы разработчиков: OpenOffice, LibreOffice. У обоих открытый код и сильное комьюнити. Первым был OpenOffice, но в какой-то момент часть команды начала разрабатывать другой проект - LibreOffice. Решения похожи, но поддержка LibreOffice продолжается до сих пор, а вот последнее обновление OpenOffice было в 2019 году.

Ко второй категории относится, в первую очередь, Google Таблицы, но с ним все понятно, и два решения от российских разработчиков: МойОфис, ЯндексДокументы. Как понятно оба продукта входят в реестр российского ПО. Продукты, если не учитывать специфики в интерфейсе, очень схожи.

Подробнее про решения:

OpenOffice

LibreOffice

МойОфис

Яндекс Документы: 360
👍2
#визуализация #облако_тэгов

⚡️Облако слов (или тэгов) – это популярный элемент визуализации для отображения частоты упоминаний слов и выражений в массиве текста.

Для чего использовать:
если хотите показать самые часто упоминаемые слова. Например, в отзывах или в тексте. В таких случаях размер слова будет зависеть от того, насколько часто его использовали. Больше слово - чаще упоминали.

Как построить:
Оптимальным решением будет воспользоваться R или Python. Но, по понятным причинам, это доступно не всем.
Второй вариант – воспользоваться веб-сервисами.
Для этого будет необходимо сначала посчитать количество упоминаний слов в тексте. Сделать это можно либо встроенными средствами Excel, Word или опять же специальными сервисами, например, таким.
Теперь, когда у нас есть частотность упоминаний слов идем в этот сервис или в этот.
Там руками вписываем слова (топ 10, например), указываем частоту их упоминания и сервисы сами построят вам облако слов с возможностью их выгрузки к себе на компьютер бесплатно.
❤5😢1
#методы #корреляция #пирсон

⚡️Коэффициент корреляции Пирсона (p, Pearson correlation) предназначен для определения взаимосвязи между двумя переменными (или признаками объекта) в метрических шкалах.
Важно отметить, что корреляция показывает только ассоциацию, но не прямую закономерность между факторами.

Для чего используется:
для поиска взаимосвязи между несколькими характеристиками группы объектов. Например, связь стажа сотрудника и показателями его эффективности (штуки, деньги, тонны, км и пр).

В Excel этот вид корреляции легко рассчитывается с помощью функции =КОРРЕЛ(массив данных1; массив данных2).

Интерпретация:
Аналогично другим видам корреляции. Если коэф. корреляции больше 0,7 или меньше (-0,7) существует устойчивая связь между характеристиками (положительная или отрицательная).

Пример:
есть набор данных: стаж сотрудника (мес.) и кол-во звонков, которые он делает. Наша гипотеза - эти показатели связаны.
используем функцию и выясняем, что связь есть и отрицательная. Меньше стаж - больше звонков.
#методы #регрессия

⚡️Линейная регрессия (linear regression) — метод прогнозирования, показывающий, как одна переменная изменяется в зависимости от другой.

Уравнение: y = a + b*x,
где y — зависимая переменная,
x — независимая переменная,
a, b — коэффициент, показывающий изменение y при увеличении x на единицу.

⚡️Как рассчитать:
В Excel, на вкладке анализ данных, можно воспользоваться функцией "Регрессия" или рассчитать по примеру ниже.

Пример: Есть данные по стажу сотрудников (в годах) и их производительности (в баллах).
Стаж: [1, 2, 3, 4]
Производительность: [60, 70, 80, 95]
Рассчитаем коэф. b и a:
Средние по: x̄ = 2.5, ȳ = 76.25.
Подставляем значения:
b = ( (1 - 2.5)(60 - 76.25) + ... + (4 - 2.5)(95 - 76.25) ) / Σ((x - x̄)²) ≈ 11.5.
a = 76.25 - 11.5 * 2.5 ≈ 47.

Итоговая модель: y = 47 + 11.5*x.
Прогноз: сотрудник со стажем 5 лет может показать производительность около 104 баллов.

❗️Важно: Линейная регрессия предполагает, что связь между переменными линейная и что ошибки распределены нормально.
👍3
#методы #td #9_box_grid

⚡️ Матрица потенциала (9-box grid) — это модель для оценки потенциала и продуктивности сотрудников. Модель состоит из матрицы 3x3, где одна ось отражает текущую продуктивность, а другая — потенциал сотрудника.

Квадраты:
9: все круто. The best in class.
8, 6: HiPo. Тянем в квадрат 9. Обучаем, развиваем.
5, 3, 2: основа компании, даем возможность работать и обучаем.
4: вправляем мозги и тащим в 5.
1: кандидаты на выход.

Критерий отнесения - результат оценки эффективности за отчетный период.

Возможное использование: Допустим, сотрудник показывает высокие результаты, но его потенциал не слишком высок — возможно, его стоит поощрять к горизонтальному росту, а не к лидерству.

Мнение автора: отношусь со скепсисом как и к любой методологии отнесения человека к какому-то умозрительному типу или классу (привет соционике). С другой стороны, даже такая система в работе с потенциалом сотрудников лучше чем никакой.
🤔3
#метрики #time_per_task

⚡️ Время на задачу (Time per task) помогает понять, сколько времени в среднем тратится на выполнение задачи определенного типа. Она полезна для выявления узких мест в рабочих процессах и выявления задач нуждающихся в декомпозиции.

Пример: Два сотрудника колл-центра делают звонки по скрипту. Один делает 25 звонков за 8 часов, второй 30 звонков за 8 часов. TPT первого: 0,32 часа на задачу, второго: 0,26 часа на задачу.

⚡️Как использовать:
Сравнение между сотрудниками. Сравнив TPT по одним и тем же задачам, можно определить, кто справляется быстрее и найти лучшие практики.
Отслеживание трендов. Сравнивая TPT по времени, можно увидеть изменения после T&D активностей
Анализ распределения времени. Если TPT для разных типов задач сильно варьируется, это может сигнализировать о перегрузке определенными задачами.
👍3❤1
#метрики #удовлетворенность #ESI

⚡️ Индекс удовлетворенности сотрудников (Employee Satisfaction Index, ESI — индикатор для оценки удовлетворенности сотрудников как альтернатива eNPS.

⚡️Методология: Сотрудники отвечают на 3 вопроса по 10 балльной шкале:
1. Насколько вы удовлетворены своей работой?
2. Насколько работа соответствует вашим ожиданиям?
3. Насколько работа удовлетворяет ваши потребности?
Вопросы могут отличаться, на самом деле, вплоть до своих собственных, но эти три считаются базовыми.

Далее происходит расчет по формуле выше (выглядит заморочено, но ничего сложного) и интерпретация результата:
>75% — высокий уровень удовлетворенности.
50–74% — средний уровень, процессы нуждаются в минорных изменениях.
<50% — низкий уровень удовлетворенности, требуются изменения в процессе.

Есть альтернативная формула ESI, она попроще и тяготеет к более высоким значениям: (ср.знач по всем вопросам/ 3) * 100%
На практике встречал оба варианта.

Лучше ли это традиционного eNPS? Пожалуй, нет, но не хуже точно.
👍4