#прогнозирование
Решил резюмировать некоторые свои наблюдения и опыт работы в области прогнозирования временных рядов в HR в виде серии статей.
Первая часть посвящена базовым моделям прогнозирования, доступным в Excel. Рассказываю об их специфике, применении, а главное - о некоторых важных особенностях работы с данными и прогнозирование метрик и показателей в HR.
Кажется, вышло довольно информативно, наглядно а главное - доступно для воспроизведения.
ссылка
Чуть позже выложу вторую часть - про более сложные и точные модели, но с реализацией уже на python (к сожалению, ресурсы Excel, в этом направлении, в первой статье практически исчерпаны).
Решил резюмировать некоторые свои наблюдения и опыт работы в области прогнозирования временных рядов в HR в виде серии статей.
Первая часть посвящена базовым моделям прогнозирования, доступным в Excel. Рассказываю об их специфике, применении, а главное - о некоторых важных особенностях работы с данными и прогнозирование метрик и показателей в HR.
Кажется, вышло довольно информативно, наглядно а главное - доступно для воспроизведения.
ссылка
Чуть позже выложу вторую часть - про более сложные и точные модели, но с реализацией уже на python (к сожалению, ресурсы Excel, в этом направлении, в первой статье практически исчерпаны).
❤7
#инструменты #боты #botfather
Пост для тех, кто давно собирался сделать свой корп. чат-бот, но никак не мог найти время, чтобы разобраться в теме. Рассказываю как это сделать: первый пост про создание ключа, второй - про конструкторы для запуска, третий - рекомендации по логике работы бота и некоторые общие советы.
Первое, что нам нужно будет сделать - получить ключ тг-бота. Это бесплатно и не займет много времени.
BotFather — это официальный бот Telegram для создания и настройки других ботов. Без него не запустится ни один Telegram-бот.
🔹 Как создать нового бота:
1. Переходим по ссылке выше;
2. Набираем команду /start для начала работы;
3. Выбираем команду /newbot для создания нового бота;
4. Придумываем имя для бота (username должен заканчиваться на bot);
5. Получаем уникальный токен - это ключ, с помощью которого платформа подключает Telegram-бота (сохраняем этот ключ, он важен).
В следующим посте рассмотрим конструкторы, которые позволят построить логику чат-бота и наполнить его.
Пост для тех, кто давно собирался сделать свой корп. чат-бот, но никак не мог найти время, чтобы разобраться в теме. Рассказываю как это сделать: первый пост про создание ключа, второй - про конструкторы для запуска, третий - рекомендации по логике работы бота и некоторые общие советы.
Первое, что нам нужно будет сделать - получить ключ тг-бота. Это бесплатно и не займет много времени.
BotFather — это официальный бот Telegram для создания и настройки других ботов. Без него не запустится ни один Telegram-бот.
🔹 Как создать нового бота:
1. Переходим по ссылке выше;
2. Набираем команду /start для начала работы;
3. Выбираем команду /newbot для создания нового бота;
4. Придумываем имя для бота (username должен заканчиваться на bot);
5. Получаем уникальный токен - это ключ, с помощью которого платформа подключает Telegram-бота (сохраняем этот ключ, он важен).
В следующим посте рассмотрим конструкторы, которые позволят построить логику чат-бота и наполнить его.
❤6
#инструменты #боты #botmother
Вторая часть про тг-боты: про конструкторы, точнее один из конструкторов.
⚡️ Botmother - no‑code конструктор чат‑ботов, который позволяет собирать бота без навыков программирования. Логику выстраиваете в визуальном редакторе: берёте готовые блоки (сообщения, кнопки, ветки сценария) и соединяете их как кубики.
Сервис обладает кроссплатформенностью, простым интерфейсом, переведен на русский, есть встроенные видеоуроки и широкий функционал. Базовая версия бесплатная.
🔹Что можно реализовать через бота:
чат-бот для новичков возможностью связи с HR-менеджером, инструкциями пр.
чат-бот функции с базой документов, которые пользователь может получать по своему запросу
платформу для опросов и пр.
🔹 Как использовать:
1.Регистрируете в botfather новый ключ (тот, что вы сохранили в пред.посте)
2.Регистрируете на платформе botmother, подвязываете ключ в настройках
3.Используете или готовый шаблон или строите бота сами
Разобраться несложно, интерфейс простой.
Вторая часть про тг-боты: про конструкторы, точнее один из конструкторов.
⚡️ Botmother - no‑code конструктор чат‑ботов, который позволяет собирать бота без навыков программирования. Логику выстраиваете в визуальном редакторе: берёте готовые блоки (сообщения, кнопки, ветки сценария) и соединяете их как кубики.
Сервис обладает кроссплатформенностью, простым интерфейсом, переведен на русский, есть встроенные видеоуроки и широкий функционал. Базовая версия бесплатная.
🔹Что можно реализовать через бота:
чат-бот для новичков возможностью связи с HR-менеджером, инструкциями пр.
чат-бот функции с базой документов, которые пользователь может получать по своему запросу
платформу для опросов и пр.
🔹 Как использовать:
1.Регистрируете в botfather новый ключ (тот, что вы сохранили в пред.посте)
2.Регистрируете на платформе botmother, подвязываете ключ в настройках
3.Используете или готовый шаблон или строите бота сами
Разобраться несложно, интерфейс простой.
👍3🤯1
#статистика #искажения
На днях прочитал книгу «Как лгать при помощи статистики». Материал довольно старый (очень), но механизмы, которые лежат в её основе, еще встречаются.
Это навело меня на идею серии постов пронеумышленные искажения аналитики - те самые случаи, когда никто не врёт, но по итогу получается, что 2 + 2 = 5.
Первая и одна из самых популярных методик искажения - это изменения при визуализации результатов анализа. На скрине выше - два графика текучести персонала. Они оба построены на одном датасете. Но на первом мы видим двукратный рост текучести, а снизу — почти прямую линию, которая едва ли может кого-то обеспокоить.
Достигнуто это тремя приёмами:
Убирается сетка - так визуально любые изменения становятся более сглаженными.
Убирается размерность на шкалах - становится вообще непонятно, есть ли у показателя какая-то динамика.
И самое интересное - "играем" с осями. Там, где в первом графике максимум по Y — 50 %, во втором он уже 100 %.
Цифры не меняются, а вот их восприятие еще как.
На днях прочитал книгу «Как лгать при помощи статистики». Материал довольно старый (очень), но механизмы, которые лежат в её основе, еще встречаются.
Это навело меня на идею серии постов про
Первая и одна из самых популярных методик искажения - это изменения при визуализации результатов анализа. На скрине выше - два графика текучести персонала. Они оба построены на одном датасете. Но на первом мы видим двукратный рост текучести, а снизу — почти прямую линию, которая едва ли может кого-то обеспокоить.
Достигнуто это тремя приёмами:
Убирается сетка - так визуально любые изменения становятся более сглаженными.
Убирается размерность на шкалах - становится вообще непонятно, есть ли у показателя какая-то динамика.
И самое интересное - "играем" с осями. Там, где в первом графике максимум по Y — 50 %, во втором он уже 100 %.
Цифры не меняются, а вот их восприятие еще как.
👍9
#статистика #искажения
Ещё одна довольно часто встречающаяся манипуляция при работе с данными - использование средних значений и подмена понятий мер.
Предположим, вам нужно подсчитать, сколько в среднем получают сотрудники в компании. Вы собираете данные об их окладах и премиях, суммируете доходы и применяете медиану. Получившееся значение - 95 400.
Но эту же задачу можно решить иначе: посчитать среднее арифм. С точки зрения статистики - всё корректно, это допустимая мера оценки. Полученное значение - 106 200.
Наконец, третий вариант изменить состав выборки. Например, исключить внешних совместителей (или стажеров, или сотрудников в отпуске по уходу за ребенком и пр. вариантов масса). Это уже вопрос методологии: считать ли их "сотрудниками" в моменте. Допустим, мы исключаем их.. Теперь наше значение 130 267.
Во всех случаях расчёт был корректным. Только вот разница составила 34 867 руб.
Довольно часто мы видим "средние" величины, но далеко не всегда понятно что за ними стоит.
Ещё одна довольно часто встречающаяся манипуляция при работе с данными - использование средних значений и подмена понятий мер.
Предположим, вам нужно подсчитать, сколько в среднем получают сотрудники в компании. Вы собираете данные об их окладах и премиях, суммируете доходы и применяете медиану. Получившееся значение - 95 400.
Но эту же задачу можно решить иначе: посчитать среднее арифм. С точки зрения статистики - всё корректно, это допустимая мера оценки. Полученное значение - 106 200.
Наконец, третий вариант изменить состав выборки. Например, исключить внешних совместителей (или стажеров, или сотрудников в отпуске по уходу за ребенком и пр. вариантов масса). Это уже вопрос методологии: считать ли их "сотрудниками" в моменте. Допустим, мы исключаем их.. Теперь наше значение 130 267.
Во всех случаях расчёт был корректным. Только вот разница составила 34 867 руб.
Довольно часто мы видим "средние" величины, но далеко не всегда понятно что за ними стоит.
❤5
#инструменты #боты #botmother
Третья часть про тг-боты и botmother: общие рекомендации и первые шаги в работе. Первая Вторая
🔹Первое, что нам нужно сделать - добавить токен от BotFather. Для этого, после регистрации, переходим в раздел «Настройки», и там слева добавляем в соответствующее поле токен канала (на скрине).
🔹Далее, прежде чем выстраивать структуру бота, создайте её на бумаге или, например, в ппт. Блок-схема позволит посмотреть на весь бот и заранее увидеть узкие места. Это лучший способ грамотно распланировать работу вашего бота.
🔹На первых этапах держите структуру максимально простой. Сначала добейтесь стабильной логики, и только затем добавляйте более сложные инструменты и опции.
🔹Начните с 2–3 простых кнопок - не перегружайте интерфейс. Пусть каждая кнопка ведёт к отдельному блоку. Блоки - к следующим, и так далее. Пусть конечные блоки ведут к основному меню, так пользователь "не потеряется".
Не забывайте, что у самой площадки есть уроки на русском.
Третья часть про тг-боты и botmother: общие рекомендации и первые шаги в работе. Первая Вторая
🔹Первое, что нам нужно сделать - добавить токен от BotFather. Для этого, после регистрации, переходим в раздел «Настройки», и там слева добавляем в соответствующее поле токен канала (на скрине).
🔹Далее, прежде чем выстраивать структуру бота, создайте её на бумаге или, например, в ппт. Блок-схема позволит посмотреть на весь бот и заранее увидеть узкие места. Это лучший способ грамотно распланировать работу вашего бота.
🔹На первых этапах держите структуру максимально простой. Сначала добейтесь стабильной логики, и только затем добавляйте более сложные инструменты и опции.
🔹Начните с 2–3 простых кнопок - не перегружайте интерфейс. Пусть каждая кнопка ведёт к отдельному блоку. Блоки - к следующим, и так далее. Пусть конечные блоки ведут к основному меню, так пользователь "не потеряется".
Не забывайте, что у самой площадки есть уроки на русском.
❤2
#HRаналитика #HR_аналитика #HR_analysis #HRtech #people_analytics
Авторский канал, посвящённый HR-аналитике, статистике в HR, исследованиям, HR Tech-решениям и AI.
Вся информация - бесплатна и доступна для свободного распространения.
Посты снабжены тегами по темам и разделам для удобной навигации.
Справочник тэгов:
⚡️ #основы — основы HR-аналитики;
⚡️ #визуализация — средства и формы визуализации данных;
⚡️ #статистика — базовая статистика и теорвер для анализа;
⚡️#методы — методы анализа HR-данных;
⚡️ #инструменты — технологические решения в области HR-аналитики и HR-tech;
⚡️ #метрики — HR-метрики и показатели;
⚡️#прогнозирование — методы прогнозирования и моделирования;
⚡️ #исследования — база для проведения качественных и количественных исследований;
⚡️ #AI — нейросети в HR и HR-анализе;
⚡️ #Excel #VBA— материалы по Excel и по языку программирования в Excel;
⚡️ #прочее — общий тег для всего прочего;
⚡️#личное — личные наблюдения и заметки автора.
t.me/analytics_hr
Авторский канал, посвящённый HR-аналитике, статистике в HR, исследованиям, HR Tech-решениям и AI.
Вся информация - бесплатна и доступна для свободного распространения.
Посты снабжены тегами по темам и разделам для удобной навигации.
Справочник тэгов:
⚡️ #основы — основы HR-аналитики;
⚡️ #визуализация — средства и формы визуализации данных;
⚡️ #статистика — базовая статистика и теорвер для анализа;
⚡️#методы — методы анализа HR-данных;
⚡️ #инструменты — технологические решения в области HR-аналитики и HR-tech;
⚡️ #метрики — HR-метрики и показатели;
⚡️#прогнозирование — методы прогнозирования и моделирования;
⚡️ #исследования — база для проведения качественных и количественных исследований;
⚡️ #AI — нейросети в HR и HR-анализе;
⚡️ #Excel #VBA— материалы по Excel и по языку программирования в Excel;
⚡️ #прочее — общий тег для всего прочего;
⚡️#личное — личные наблюдения и заметки автора.
t.me/analytics_hr
❤9
#статистика #Гаусс #нормальное_распределение
начало года - отличная возможность вспомнить базу )
⚡️Распределение Гаусса, нормальное распределение (НР) – это наиболее часто встречающийся в статистике тип распределения данных.
Смысл НР заключается в том, что можно считать, что распределение выборочных статистик (средняя, медиана, мода и пр.) будет нормальным, даже если выборки происходят из ГС, для которой НР не свойственно.
Человеческим языком: даже если исходные данные не подчиняются нормальному распределению, распределение выборочного среднего при достаточно большом размере выборки будет стремиться к нормальному.
Поскольку все НР имеют одинаковую форму и свойства, то для них можно сформулировать правило распределения значений в НР (на скрине). И это распределение будет одинаковым для всех НР.
Этот тип распределений открывает нам много возможностей (о них след. посты), так что нам, в аналитике персонала, важно его знать и уметь идентифицировать (об этом тоже напишу).
начало года - отличная возможность вспомнить базу )
⚡️Распределение Гаусса, нормальное распределение (НР) – это наиболее часто встречающийся в статистике тип распределения данных.
Смысл НР заключается в том, что можно считать, что распределение выборочных статистик (средняя, медиана, мода и пр.) будет нормальным, даже если выборки происходят из ГС, для которой НР не свойственно.
Человеческим языком: даже если исходные данные не подчиняются нормальному распределению, распределение выборочного среднего при достаточно большом размере выборки будет стремиться к нормальному.
Поскольку все НР имеют одинаковую форму и свойства, то для них можно сформулировать правило распределения значений в НР (на скрине). И это распределение будет одинаковым для всех НР.
Этот тип распределений открывает нам много возможностей (о них след. посты), так что нам, в аналитике персонала, важно его знать и уметь идентифицировать (об этом тоже напишу).
👍6
#статистика #Гаусс #нормальное_распределение
Мы знаем, что нормальное распределение встречается часто, но не всегда.
Поэтому важно научиться определять, действительно ли набор данных распределён нормально.
Вот базовые признаки:
🔹Симметричность распределения
Если построить гистограмму распределения данных (с небольшим шагом), мы должны увидеть более-менее симметричный график.
Форма может отличаться (на скрине — разные варианты), но левая и правая части должны быть сопоставимы.
🔹Унимодальность
Если говорить просто - у распределения должна быть одна вершина (одна мода).
🔹Близость средних значений
Среднее арифметическое, медиана и мода должны быть равны или очень близки друг к другу.
🔹 Статистические тесты
Тесты Шапиро–Уилка, Колмогорова–Смирнова и др.
Проблема в том, что в Excel нет готовых функций для их расчёта, а ручной подсчёт достаточно трудоёмкий.
Поэтому на практике удобнее использовать онлайн-калькуляторами (таким например) или рассчитывать в Python или R.
Мы знаем, что нормальное распределение встречается часто, но не всегда.
Поэтому важно научиться определять, действительно ли набор данных распределён нормально.
Вот базовые признаки:
🔹Симметричность распределения
Если построить гистограмму распределения данных (с небольшим шагом), мы должны увидеть более-менее симметричный график.
Форма может отличаться (на скрине — разные варианты), но левая и правая части должны быть сопоставимы.
🔹Унимодальность
Если говорить просто - у распределения должна быть одна вершина (одна мода).
🔹Близость средних значений
Среднее арифметическое, медиана и мода должны быть равны или очень близки друг к другу.
🔹 Статистические тесты
Тесты Шапиро–Уилка, Колмогорова–Смирнова и др.
Проблема в том, что в Excel нет готовых функций для их расчёта, а ручной подсчёт достаточно трудоёмкий.
Поэтому на практике удобнее использовать онлайн-калькуляторами (таким например) или рассчитывать в Python или R.
👍2❤1
#статистика #z_score
Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.
⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.
🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон
🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).
🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
Знание свойств НР позволяет решить задачу, насколько типично конкретное значение в ряду данных для ГС. Инструментом для этого служит Z-значение.
⚡️Z-значение (Z-score) - это нормализированное значение показателя в ряду данных и показывает оно, насколько далеко конкретное значение ушло от среднего в выборке или ГС.
То есть, другими словами насколько конкретное значение "нормальное" или не очень.
🔹Формула расчета:
Z = (значение - ср.знач) / станд.отклон
🔹Пример:
Вам нужно выразить насколько зп в 115k отстоит от зп других сотрудников. Рассчитываем z-значение и выясняем, что оно оно на 2,48 станд.отклонения больше ср.знач зп в отделе (на скрине выше).
🔹Для чего использовать:
Если нужно определить насколько число отстоит от ГС, насколько оно редкое, а также для сравнения отдельных значений в выборках между собой (о нормализации напишу в след.посте).
👍3
#основа #CandB
С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.
🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.
2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке
3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях
🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода
2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
С января 2026 года произошли изменения в расчете страховых взносов (опять).
Учитывая, что аналитика ФОТ в частности и C&B-функции в целом - это большая часть HR-анализа, то мимо мы пройти не можем.
🔹Список изменений:
1. Утверждена новая единая предельная величина базы для исчисления страховых взносов. Она составляет 2 979 000 рублей. Напомню, что единый тариф страховых взносов (ОПС + ОМС + ВНиМ) рассчитывается со всего дохода сотрудника.
2. Изменены льготные условия для ИТ-компаний имеющих соответствующую аккредитацию.
Что такое аккредитация (если кто не знал) и как ее получить, можно узнать по ссылке
3. Льготы МСП теперь распространяются не на всех, а только на отдельные виды деятельности. Подробнее об изменениях
🔹Механика расчета:
1. Для каждого сотрудника рассчитывается база дохода
2. СВ рассчитываются по ставке 30% если доход не превышает ЕПВ и 15,1% на часть базы сверх ЕПВ (по общим правилам).
👍5
#статистика #z_score
Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.
Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.
Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.
Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).
То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
Большое преимущество Z-значений в том, что они облегчают сравнение значений в генеральных совокупностях.
Например, рассматривая зарплаты в разных компаниях или отделах, мы не можем сразу сказать, насколько часто встречаются конкретные значения в ГС и насколько они отстоят от средних, а при анализе рынка зарплат это важная задача.
Z-значение позволяет привести разные ГС к одной системе исчисления и уже затем сравнивать их между собой.
Пример расчёта:
нам даны зарплаты в двух компаниях A и B. Задача — понять, насколько зарплата в 115k типична для обеих компаний и сравнить эти ситуации.
Для этого рассчитываем Z-значения и получаем 2,48 и 1,04 (на скрине выше).
То есть, хотя в обоих случаях зарплата выше среднего в своих ГС, в первой компании она значительно выше прочих (на 2,48 стандартного отклонения), а во второй — гораздо ближе к среднему значению.
Зарплата одинаковая, а распределение зарплат в компаниях — разное.
👍3
#статистика #выборка
При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.
⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.
🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.
🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.
🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.
в след.посте про случайный методы отбора.
При проведении исследований и прочих vox populi первый вопрос, который встает перед исследователем - как сформировать выборку, если работать с ГС невозможно.
⚡️ Детерминированные методы - методы отбора определяющиеся правилами, которые установил исследователь.
🔹Выборка из добровольцев
Участвуют все желающие. Подходит для пилотных исследований и проверки гипотез.
🔹Целевая (нерепрезентативная) выборка
Исследователь сам выбирает нужную группу (например, только новички или только руководители).
Подходит, если цель - изучить конкретный сегмент, а не всю компанию.
🔹 Выборка по квотам
Заранее задаются доли групп. Например: 2/3 — производство, 1/3 — офис.
Часто используется в HR, но отбор внутри квот обычно неслучайный. В этом случае метод получается комбинированный. Используется часто.
в след.посте про случайный методы отбора.
❤3👍1
#статистика #выборка
Вторая часть поста про способы формирования выборки из ГС.
⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.
🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.
🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.
🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
Вторая часть поста про способы формирования выборки из ГС.
⚡️Случайные (недетерминированные) методы - это методы, где каждый объект наблюдений имеет равный шанс попасть в выборку и вероятность не определяется правилами исследователя.
🔹Простая случайная выборка
У всех равные шансы попасть в выборку, отбор — через генератор случайных чисел.
Статистически лучший вариант, но требует полного списка сотрудников.
🔹Систематическая выборка
Пронумеровываем всех сотрудников. Берём каждого n сотрудника из списка после случайного стартового номера.
Например: случайно выбираем 5-ого сотрудника как стартового. Затем берем каждого 10-ого. Т.е. 5, 15, 25 и т.д.
Проще в реализации, но возможны искажения, если список упорядочен по отделам или сменам.
🔹Стратифицированная выборка
Сначала делим ГС на группы (производство, офис, менеджмент), потом случайно отбираем внутри каждой.
Часто самый практичный и точный вариант для HR-исследований и опросов.
👍2
#статистика #p_value
Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.
Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.
На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.
В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
Часть 1
Дамы и господа, пришло время вспомнить Его Величество p-значение / p-value.
Постараюсь объяснить суть этого очень важного для нас показателя.
Предположим, мы хотим определить средний возраст жителя страны. Опросить всех людей мы не сможем, и будем работать с выборкой. А в этом случае всегда возможны ошибки. Так вот, p-value показывает вероятность того, что полученное нами значение среднего возраста - случайность.
На примере биноминального распр. (т.е. для случаев, где возможны только 2 исхода):
Мы хотим выяснить вероятность того, что из 10 отправленных офферов будет принят 1 человек, при условии, что вероятность принять оффер равна 50%.
На скрине выше приведён фрагмент биноминального распределения вероятности.
Ось X - это вероятность, что оффер будет принят.
Ось Y - максимальное число успехов.
Пересечение - вероятность успеха для n значений.
В нашем случае вер. того, что отправив 10 офферов к нам выйдет только 1 человек - 1%
Далее напишу ещё пост для лучшего понимания
❤3👍1
#статистика #p_value
Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.
Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.
Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?
На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.
В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
Часть 2
Учитывая сложность для понимания p-value, рассмотрим его с другой стороны, чтобы точно разобраться в этом значении.
Допустим, мы считаем, что вероятность выхода кандидата после оффера - 50%.
Мы сделали 10 офферов и получили 1 выход. Насколько вероятно получить такой результат? (А мы уже знаем, что его вероятность 1%). Типичный ли это результат или аномалия?
На этот вопрос и отвечает p-value. То есть вероятность получить такой же результат при повторном эксперименте.
Его вероятность - 1%.
В практике часто используют уровень значимости в 5% (0,05). Это условный и общепринятый уровень.
Если шанс получить такие данные больше 5%, мы считаем, что это повод усомниться в нашей гипотезе (H1).
👍1
#метрики #подбор #рекрутмент
Ниже ключевые метрики эффективности функции подбора.
Если не знаете с чего выстраивать систему метрик для этой функции – начните с них.
1. Срок закрытия вакансии (Time to fill)
2. Срок работы с кандидатом (Time to offer)
3. Доля вакансий, закрытых в срок (On-time fill rate)
4. Доля принятых предложений (Offer acceptance rate)
5. Стоимость закрытия вакансии
6. Конверсия воронки подбора
7. Доля кандидатов, успешно прошедших испытательный срок
Ниже ключевые метрики эффективности функции подбора.
Если не знаете с чего выстраивать систему метрик для этой функции – начните с них.
1. Срок закрытия вакансии (Time to fill)
2. Срок работы с кандидатом (Time to offer)
3. Доля вакансий, закрытых в срок (On-time fill rate)
4. Доля принятых предложений (Offer acceptance rate)
5. Стоимость закрытия вакансии
6. Конверсия воронки подбора
7. Доля кандидатов, успешно прошедших испытательный срок
❤3👍2
#статистика #дисперсия #станд_отклон
Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.
⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.
⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.
🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.
Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
Одни из самых важных мер анализа разброса данных - дисперсия и стандартное отклонение. Кратко о том, что это и как их использовать.
⚡️Дисперсия - это мера разброса данных относительно их среднего значения. Она показывает, насколько сильно отдельные значения отклоняются от среднего. Так как выражается в кв.ед., то используется нечасто. Функции в Excel - на скрине.
⚡️Стандартное отклонение показывает то же самое, но используется гораздо чаще, так как является корнем из дисперсии и проще для интерпретации.
🔹Пример расчёта:
В компании посчитали клиентский NPS. Значение 4 балла высокое, но мы хотим понять, насколько оно однородное. То есть насколько каждый отдел имеет оценку, близкую к 4 баллам. Для этого используем дисперсию и стандартное отклонение для генеральной совокупности.
Чем выше стандартное отклонение, тем менее однородные результаты NPS по компании. Значит есть отделы с отличным клиентским сервисом, а есть те, кто тянет общую оценку вниз.
👍1
#метрики #абсентеизм
⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.
открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).
скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.
🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%
🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные
🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
⚡️ Абсентеизм показывает сколько рабочего времени сотрудники фактически не присутствуют на работе. В широком смысле – это невыполнение персоналом своих трудовых обязанностей, которое может быть или открытым или скрытым.
открытий абсентеизм – это в буквальном смысле отсутствие сотрудника на рабочем месте без уважительной причины. Чаще всего считают именно его (потому, что проще посчитать).
скрытый абсентеизм – это манкирование своими обязанностями, находясь при этом на рабочем месте (перекуры, кофе, соц.сети и прочее). Сложен для расчета поэтому редко используется.
🔹Формула расчета :
(Общее кол-во часов отсутствия / Общее рабочее время) * 100%
🔹В расчет НЕ входят:
- оплачиваемый отпуск - основной и дополнительные: северный, за вредные условия труда и пр.
- выходной день по причине выполнения государственных обязанностей, донорство и так далее.
- больничные
🔹В расчет входят:
- отгулы/отпуск за свой счет
- прогулы
- опоздания и пр.
👍2
#основы #шкалы
Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.
Чаще всего используют четыре типа шкал:
🔹Номинальные данные - это просто категории без порядка.
🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.
🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.
🔹Бинарные данные - данные ограниченные только 2 значениями.
что можно и что нельзя делать с разными шкалами - на скрине выше.
Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.
Чаще всего используют четыре типа шкал:
🔹Номинальные данные - это просто категории без порядка.
🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.
🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.
🔹Бинарные данные - данные ограниченные только 2 значениями.
что можно и что нельзя делать с разными шкалами - на скрине выше.
Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1