#статистика #z_score
Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.
⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.
🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон
🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).
🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.
⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.
🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон
🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).
🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
👍3
#основа #CandB
С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.
🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.
2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке
3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях
🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода
2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.
🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.
2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке
3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях
🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода
2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
👍5
#статистика #z_score
Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.
Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.
Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.
Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).
То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.
Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.
Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.
Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).
То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
👍3
#статистика #выборка
При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.
⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.
🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.
🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.
🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.
в след.посте про случайный методы отбора.
При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.
⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.
🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.
🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.
🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.
в след.посте про случайный методы отбора.
❤3👍1
#статистика #выборка
Вторая часть поста про способы формирования выборки из ГС.
⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.
🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.
🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.
🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
Вторая часть поста про способы формирования выборки из ГС.
⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.
🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.
🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.
🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
👍2
#статистика #p_value
Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.
Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.
На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.
В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.
Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.
На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.
В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
❤3👍1
#статистика #p_value
Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.
Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.
Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?
На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.
В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.
Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.
Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?
На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.
В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
👍1
#метрики #подбор #рекрутмент
Ниже ключевые метрики эффективности функции подбора.
Если не знаете с чего выстраивать систему метрик для этой функции – начните с них.
1. Срок закрытия вакансии (Time to fill)
2. Срок работы с кандидатом (Time to offer)
3. Доля вакансий, закрытых в срок (On-time fill rate)
4. Доля принятых предложений (Offer acceptance rate)
5. Стоимость закрытия вакансии
6. Конверсия воронки подбора
7. Доля кандидатов, успешно прошедших испытательный срок
Ниже ключевые метрики эффективности функции подбора.
Если не знаете с чего выстраивать систему метрик для этой функции – начните с них.
1. Срок закрытия вакансии (Time to fill)
2. Срок работы с кандидатом (Time to offer)
3. Доля вакансий, закрытых в срок (On-time fill rate)
4. Доля принятых предложений (Offer acceptance rate)
5. Стоимость закрытия вакансии
6. Конверсия воронки подбора
7. Доля кандидатов, успешно прошедших испытательный срок
❤3👍2
#статистика #дисперсия #станд_отклон
Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.
⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.
⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.
🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.
Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.
⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.
⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.
🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.
Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
👍1
#метрики #абсентеизм
⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.
открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).
скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.
🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%
🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные
🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.
открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).
скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.
🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%
🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные
🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
👍2
#основы #шкалы
Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.
Чаще всего используют четыре типа шкал:
🔹Номинальные данные - это просто категории без порядка.
🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.
🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.
🔹Бинарные данные - данные ограниченные только 2 значениями.
что можно и что нельзя делать с разными шкалами - на скрине выше.
Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.
Чаще всего используют четыре типа шкал:
🔹Номинальные данные - это просто категории без порядка.
🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.
🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.
🔹Бинарные данные - данные ограниченные только 2 значениями.
что можно и что нельзя делать с разными шкалами - на скрине выше.
Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1
#метрики #CandB
⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).
🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.
В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).
🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.
В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
❤7👍2
#методы #интервалы #частоты
Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:
🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.
🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)
🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года
итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:
🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.
🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)
🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года
итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
❤3👍1
#методы #интервалы #частоты
Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.
Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.
Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.
Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика
все готово, задача решена.
Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.
Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.
Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.
Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика
все готово, задача решена.
👍3❤1
#Excel
Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.
на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.
Вся статистика в одном месте.
Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.
на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.
Вся статистика в одном месте.
👍12
#метрики #норма_управляемости
Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.
⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.
🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.
Источник 1
Источник 2
Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.
⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.
🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.
Источник 1
Источник 2
👍3
#исследования #Фишер #тест_Фишера
Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука
⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).
🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.
🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука
⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).
🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.
🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
from scipy.stats import fisher_exact
#Ваша таблица
table = [[7, 2],
[5, 6]]
#Тест Фишера
oddsratio, p_value = fisher_exact(table, alternative='two-sided')
#p-value
print(p_value)
👍7
#основы #FTE
⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.
🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.
🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.
🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.
🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
❤4
#метрики #абсентеизм
Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.
⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.
У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.
🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.
Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.
⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.
У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.
🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.
Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
👍6
#статистика #ЦПТ #CLT
⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).
В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.
🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.
🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).
В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.
🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.
🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
❤2
#метод #корреляция
⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).
🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.
🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц
Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).
🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.
🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц
Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
import numpy as np
a, b = 30, 10
c, d = 15, 45
phi = (a*d - b*c) / np.sqrt((a+b)*(c+d)*(a+c)*(b+d))
print(Phi)
❤1