#основы #шкалы
Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.
Чаще всего используют четыре типа шкал:
🔹Номинальные данные - это просто категории без порядка.
🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.
🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.
🔹Бинарные данные - данные ограниченные только 2 значениями.
что можно и что нельзя делать с разными шкалами - на скрине выше.
Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
Периодически встречаю ошибки в обработке данных связанные с применением методов анализа к данным, к которым их применять нельзя.
Чтобы этого избежать, стоит познакомиться с особенностями шкал и допустимых манипуляций с ними.
Чаще всего используют четыре типа шкал:
🔹Номинальные данные - это просто категории без порядка.
🔹Порядковые данные - здесь есть порядок, но нет информации о расстоянии между значениями.
🔹Интервальные (и количественные) данные - здесь есть и порядок, и равные интервалы между значениями.
🔹Бинарные данные - данные ограниченные только 2 значениями.
что можно и что нельзя делать с разными шкалами - на скрине выше.
Типичные ошибки:
1. применять линейную регрессию к категориям (даже если их кодировать)
2. искать выбросы в порядковых данных
3. применять нормализацию к порядковым данным
👍1
#метрики #CandB
⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).
🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.
В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
⚡️Полная стоимость сотрудника (cost per employee) - показывает полную стоимость сотрудника для компании, не ограничиваясь расходами на его ФОТ. Строго говоря, это расширенная версия ФОТ для финансов - более полная и корректная стоимость персонала.
Интересная метрика, которая у нас используется не очень часто, а вот на ближнем востоке и в США довольно активно и иногда полностью заменяет собой классический бюджет на персонал (payroll budget).
🔹 Что включаем:
- ФОТ (включая налоги и СВ)
- бенефиты (ДМС, другие страховки)
- соц.льготы от компании
- бюджет на обучение
- резервы и лимиты (командировки, релокации и пр.)
- аренда и инфраструктура
- оборудование
- ит-лицензии, софт и пр.
В знаменателе наши иностранные коллеги используют хедкаунты (headcounts), мы можем заменить на факт. численность или план. числ. для бюджетирования /ссч
❤7👍2
#методы #интервалы #частоты
Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:
🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.
🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)
🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года
итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
Прикладная задача: у вас есть стаж, возраст, что-угодно-другое по компании, которые вам нужно разложить на группы/ частоты / интервалы. Например, что бы понять какой группы у вас больше и определить как с ней работать. Как решить эту задачу:
🔹 Определение кол-ва интервалов - решим сколько же у нас должно быть таких групп. Предложу два способа, использовать можно любой:
1. Правило Стерджеса: 1 + ( ln(кол-во наблюдений) / ln(2) );
2. Квадратный корень из наблюдений: извлекаем корень из количества значений, которые надо разделить на интервалы.
🔹 Определение ширины интервалов - теперь решаем какой ширины должны быть эти интервалы. Cамый простой из них: (макс значение - мин значение) / кол-во интервалов (его посчитали выше)
🔹Пример:
В нашем примере - 20 наблюдений.
Количество интервалов по Стерджесу - 5 (6 с учетом округлений)
Ширина каждого интервала - 2 года
итоговые интервалы:
1 - <3 (не включая)
3 - <5
5 - <7
7 - <9
можно добавить 6 интервал из-за округлений: 9+
❤3👍1
#методы #интервалы #частоты
Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.
Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.
Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.
Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика
все готово, задача решена.
Продолжаем решать задачу построения графика распределения.
В первой части мы определились с кол-вом интервалов и их шириной, теперь будет строить график в Excel.
Самый простой способ построить такую гистограмму - воспользоваться инструментом гистограмма на вкладке Анализ данных.
Но нам придётся внести конструктивные изменения в наши интервалы (в Excel они называются карманы).
Если в классическом виде (первый пост) мы писали интервалы как 1 - <3 (то есть значение 3 не входит в интервал), то Excel надо написать только верхнюю границу интервала. А он возьмет все, что между предыдущим интервалом и следующим.
И именно поэтому у нас появится дополнительный псевдо карман с верхней границей.
Пример переработки интервалов на скрине.
Данные - Анализ даных - Гистограмма.
Входной интервал - все значения
Интервал карманов - ссылаемся на диапазон с шириной карманов для Excel
Выходной интервал - место, где появится результат.
Галочку Вывод графика
все готово, задача решена.
👍3❤1
#Excel
Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.
на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.
Вся статистика в одном месте.
Удобная функция о которой мало кто знает: если вам нужно получить все ключевые стат. меры и меры разброса по некоторому массиву данных в Excel, вы можете или руками заводить каждую функцию или получить все и сразу в три клика.
на вкладке Данные - Анализ данных - Описательная статистика.
Входной интервал - все значения
Выходной интервал - место, где появится результат.
Дальше проставляем галочки в тех разделах, которые нам нужны.
Если проставить везде, то получится результат как на скрине выше.
Вся статистика в одном месте.
👍12
#метрики #норма_управляемости
Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.
⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.
🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.
Источник 1
Источник 2
Тема стара как мир, но не теряет свою актуальность. Нашел несколько интересных исследований, привожу здесь результаты и ключевые выводы.
⚡️Норма управляемости (Span of Control) - это оптимальное кол-во сотрудников в прямом подчинении у менеджера.
Единого стандарта нет. Причем исследования говорят, что норма управляемости - это не про иерархию и не про личные качества менеджера, а про характер работы и организационный контекст.
🔹Ключевые выводы:
- Принцип: "чем выше уровень — тем меньше подчинённых" не работает. Никакой корреляции с размером команд и их эффективностью на всех уровнях.
- Возраст и опыт менеджера не связаны с тем, сколькими людьми он управляет (мы и так об этом догадывались).
- Функциональные области не имеют устойчивых «гендерных» шаблонов команд, а связь между размером команды и гендерным составом - слабая.
- Приблизительные ориентиры по функция на скрине, там же факторы влияющие на рост или снижения числа подчинённых.
Источник 1
Источник 2
👍3
#исследования #Фишер #тест_Фишера
Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука
⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).
🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.
🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
Пропускайте если не занимаетесь серьёзными исследованиями. Оч. специфичная штука
⚡️ Тест Фишера используется для проверки зависимости между двумя категориальными переменными в 2x2 таблице сопряженности. особенно при малых выборках (< 100).
🔹Пример:
Мы хотим проверить, влияет ли обучение на получение повышения. Если есть связь - продолжаем обучать сотрудников.
1. Составляем таблицу наблюдений.
2. Считаем гипергеометрическая вероятность получения такой таблицы при нулевой гипотезе (что обучение не влияет).
2. Сравниваем с уровнем значимости (обычно 0,05). Если p < 0.05, то различие статистически значимо, то есть обучение влияет.
🔹 Где считать:
В Excel посчитать можно, но НЕ рекомендую так делать, легко запутаться.
Ниже код для Python. Вставляете свою таблицу и запускаете.
from scipy.stats import fisher_exact
#Ваша таблица
table = [[7, 2],
[5, 6]]
#Тест Фишера
oddsratio, p_value = fisher_exact(table, alternative='two-sided')
#p-value
print(p_value)
👍7
#основы #FTE
⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.
🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.
🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
⚡️ Эквивалент полной занятости (Full-Time Equivalent, FTE) — это мера, используемая для определения количества сотрудников, работающих полный рабочий день, которые необходимы для выполнения рабочей задачи.
Крайне полезный показатель, особенно когда у вас много нештатных сотрудников (ГПХ, самозанятые и пр.).
В международной практике FTE используется наравне с фактической численностью, а иногда даже важнее — особенно при анализе затрат, продуктивности и планировании численности.
🔹Используется:
— для определения достаточной и оптимальной численности;
— для планирования затрат на персонал (особенно для компаний с сезонной спецификой);
— в качестве индикатора для сравнения производительности подразделений (если у двух отделов одинаковое число FTE, но один показывает более высокий результат, то возникает вопрос об эффективности.);
— для расчёта производных показателей, таких как затраты на рабочую силу и эффективность.
🔹Формула:
FTE = (кол-во отработанных часов) / (норма часов на одного сотрудника)
❤4
#метрики #абсентеизм
Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.
⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.
У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.
🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.
Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
Классический абсентеизм показывает % отсутствия сотрудника на рабочем месте. Но, есть метрика, которая смещает фокус со времени, на количество таких случаев.
⚡️Абсентеизм Бредфорда - это метрика, которая измеряет влияние краткосрочного, но частого отсутствия сотрудника на работе. Предполагается, что много мелких пропусков деструктивнее, чем одно длительное отсутствие. Оно может говорить о выгорании сотрудника и хронической усталости.
У нас используется не часто, а вот в мире метрика довольно распространена, вплоть до того, что некоторый софт, типа Bamboo, включают ее в список ключевых для анализа.
🔹Как рассчитывать:
кол-во случае отсутсивя² × дни отсутствия.
Пример расчета и некоторые эмпирические пороговые значения на скрине. Серьезных академических исследований метрики я не находил, так что использовать стоит только вместе с классическим уровнем абсентеизма для более полного анализа.
👍6
#статистика #ЦПТ #CLT
⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).
В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.
🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.
🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
⚡️Центральная предельная теорема (ЦПТ) - один из ключевых принципов статистики, который объясняет, почему по выборке можно делать выводы о генеральной совокупности (ГС).
В общем виде теорема гласит: распределение значений достаточно большой выборки из ГС, которая не является распределённой нормально, будет все равно распределена нормально.
На человеческом языке: даже если в ГС распределение «кривое», то средние значения, посчитанные по большим выборкам, будут подчиняться нормальному распределению.
🔹Что это даёт в HR-анализе:
1. ЦПТ позволяет использовать классическую статистику там, где сами данные далеки от нормальности;
2. Строить доверительные интервалы;
3. Сравнивать группы (t-тесты, ANOVA);
4. Оценивать стабильность метрик во времени.
🔹Важное условие:
1. Выборка должна быть достаточно большой (часто используют правило: n ≥ 30, но это очень грубое приближение);
2. Наблюдения должны быть независимыми.
❤2
#метод #корреляция
⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).
🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.
🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц
Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
⚡️Фи-статистика (φ) - это мера связи между двумя бинарными переменными. То есть когда оба признака имеют только 2 значения: да/нет, 0/1, есть/нет, прошёл/не прошёл.
Это аналог корреляции Пирсона, но для таблицы 2×2 (на скрине).
🔹Пример:
Мы хотим выявить связь между наличием у сотрудника пенсионного плана и полом. Обе метрики принимают только два значения: м/ж и есть план/нет плана.
Собираем наблюдения, строим матрицу, применяем формулу фи-статистики (на скрине) и рассчитываем.
❗️Важно: как и любая другая корреляция - это только мера связи, НЕ подтверждение причинно-следственной связи и зависимостей.
🔹Интерпретация:
Принимает вид в диапазоне от (-1) до 1.
Далее интерпретация по модулю.
| 0.0–0.3| - связи нет или слабая
| 0.3–0.6 | - умеренная пол/ отриц
| > 0.6 | сильная пол/ отриц
Можно считать в Excel, а можно на Python. Вставляете свою таблицу в код и запускаете.
import numpy as np
a, b = 30, 10
c, d = 15, 45
phi = (a*d - b*c) / np.sqrt((a+b)*(c+d)*(a+c)*(b+d))
print(Phi)
❤1
#метрики
Ниже ключевые метрики эффективности функции компенсации и льготы. Они оценивают широкий спектр параметров от эффективности расходования бюджета и внутренней и внешней справедливости вознаграждения, до эффективности сотрудников к расходам на них.
1. Выручка и прибыль на FTE
2. Compa-ratio и Market-ratio (CR, MR)
3. Индекс вхождения в диапозон зп (Salary Range Penetration, SRP)
4. Performance to Pay Index (PPI)
5. Интенсивность расходования бюджета
6. Индекс утилизации льгот
7. Полная стоимость сотрудника (Сost per employee, CPE)
Ниже ключевые метрики эффективности функции компенсации и льготы. Они оценивают широкий спектр параметров от эффективности расходования бюджета и внутренней и внешней справедливости вознаграждения, до эффективности сотрудников к расходам на них.
1. Выручка и прибыль на FTE
2. Compa-ratio и Market-ratio (CR, MR)
3. Индекс вхождения в диапозон зп (Salary Range Penetration, SRP)
4. Performance to Pay Index (PPI)
5. Интенсивность расходования бюджета
6. Индекс утилизации льгот
7. Полная стоимость сотрудника (Сost per employee, CPE)
❤2👍1
#метод #корреляция
⚡️Точечно-бисериальный коэффициент корреляции (rpb) - это мера связи между одной бинарной переменной (0 / 1, да / нет), и одной количественной переменной (зарплата, возраст, KPI, стаж и т.д.).
🔹Пример:
Мы хотим выявить связь между объемом продаж у сотрудника (количественная переменная) и фактом прохождения обучения по продажам (это бинарная шкала).
Выписываем всех сотрудников с результатами их продаж и делим их на две группе, те, которые прошли обучение и не прошли.
Преобразуем это в матрицу (как на скрине) и применяем формулу точечно-бисериального коэффициента.
🔹Интерпретация аналогична всем прочим видам корреляции
Пример кода на Python для реализации
⚡️Точечно-бисериальный коэффициент корреляции (rpb) - это мера связи между одной бинарной переменной (0 / 1, да / нет), и одной количественной переменной (зарплата, возраст, KPI, стаж и т.д.).
🔹Пример:
Мы хотим выявить связь между объемом продаж у сотрудника (количественная переменная) и фактом прохождения обучения по продажам (это бинарная шкала).
Выписываем всех сотрудников с результатами их продаж и делим их на две группе, те, которые прошли обучение и не прошли.
Преобразуем это в матрицу (как на скрине) и применяем формулу точечно-бисериального коэффициента.
🔹Интерпретация аналогична всем прочим видам корреляции
Пример кода на Python для реализации
from scipy.stats import pointbiserialr
# binary — обучение (1-прошел обучение, 0 - нет)
# numeric — результаты продаж
# соотв: первый сотр. прошёл обучение, сделал 120 продаж и тд
binary = [1, 0, 1, 1, 0, 0, 1]
numeric = [120, 95, 130, 110, 90, 100, 125]
r, p = pointbiserialr(binary, numeric)
print(f"r_pb = {r:.3f}")
❤2
#методы #вовлеченность
⚡️ Gallup Q12 - простой способ измерения вовлеченности от компании Gallup.
🔹Методология метода:
1. Сотрудники отвечают на 12 вопросов (скрин) по 5-бальной шкале.
2. HR рассчитывает средний балл по всем оценкам и отдельно по блокам вопросов.
3. На основе получившихся значений считают:
3.1. Индекс вовлечения (Engagement Index):
> 4 - сотрудник активно вовлечён,
3-4 - нейтрален
< 3 - сотрудник не вовлечён.
3.2. Top-Box Scoring: рассчитывается кол-во оценок 4-5, а затем значения по блокам сравниваются между собой. Так выявляются проблемные области по сп.
⚡️ Gallup Q12 - простой способ измерения вовлеченности от компании Gallup.
🔹Методология метода:
1. Сотрудники отвечают на 12 вопросов (скрин) по 5-бальной шкале.
2. HR рассчитывает средний балл по всем оценкам и отдельно по блокам вопросов.
3. На основе получившихся значений считают:
3.1. Индекс вовлечения (Engagement Index):
> 4 - сотрудник активно вовлечён,
3-4 - нейтрален
< 3 - сотрудник не вовлечён.
3.2. Top-Box Scoring: рассчитывается кол-во оценок 4-5, а затем значения по блокам сравниваются между собой. Так выявляются проблемные области по сп.
❤2
#основы #ранжирование
Простенький, но очень важный метод в арсенале любого аналитика (не только HR) - ранжирование данных.
⚡️ Ранжирование - это процедура присвоения объектам порядковых номеров (рангов) на основе их значений.
Если у нас уже есть порядковая шкала (например, оценка: 1–5), мы можем перевести её в ранговую, отсортировав сотрудников и назначив места.
Например, чтобы определить победителей или для выполнения последующего корреляционного анализа (об этом дальше).
🔹В Excel можно выполнить через функцию:
=Ранг(объект, которому будет присвоен ранг; весь массив данных; порядок ранжирования (0 или 1).
не забудьте, используя эту функцию, закрепить ссылку на весь массив (как на скрине), когда будете ее протягивать для всех данных. Сделать это можно выделил ссылку и нажав F4
🔹В Python
Простенький, но очень важный метод в арсенале любого аналитика (не только HR) - ранжирование данных.
⚡️ Ранжирование - это процедура присвоения объектам порядковых номеров (рангов) на основе их значений.
Если у нас уже есть порядковая шкала (например, оценка: 1–5), мы можем перевести её в ранговую, отсортировав сотрудников и назначив места.
Например, чтобы определить победителей или для выполнения последующего корреляционного анализа (об этом дальше).
🔹В Excel можно выполнить через функцию:
=Ранг(объект, которому будет присвоен ранг; весь массив данных; порядок ранжирования (0 или 1).
не забудьте, используя эту функцию, закрепить ссылку на весь массив (как на скрине), когда будете ее протягивать для всех данных. Сделать это можно выделил ссылку и нажав F4
🔹В Python
import pandas as pd
df = pd.DataFrame({
'name': ['A','B','C','D','E'],
'score': [100, 124, 98, 81, 120]
})
df['rank'] = df['score'].rank()
👍4
#метод #корреляция #Пирсон
⚡️Корреляция Пирсона - инструмент для оценки линейной связи между двумя количественными показателями, выраженными количественными непрерывными шкалами (кг, штуки, рубли, метры и пр.)
🔹Когда применяем?
- данные количественные (зарплата, выручка, производительность, текучесть и т.д.)
- распределение близко к нормальному (или выборка достаточно большая)
- связь предполагается линейной
🔹Алгоритм:
Рассчитывается среднее значение по каждой переменной.
Для каждого наблюдения определяется отклонение от среднего.
Перемножаются отклонения двух переменных.
Сумма произведений нормируется на произведение стандартных отклонений.
🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)
🔹Интерпретация аналогична всем прочим видам корреляции
🔹Наличие кор.связи необязательно предполагает зависимость
⚡️Корреляция Пирсона - инструмент для оценки линейной связи между двумя количественными показателями, выраженными количественными непрерывными шкалами (кг, штуки, рубли, метры и пр.)
🔹Когда применяем?
- данные количественные (зарплата, выручка, производительность, текучесть и т.д.)
- распределение близко к нормальному (или выборка достаточно большая)
- связь предполагается линейной
🔹Алгоритм:
Рассчитывается среднее значение по каждой переменной.
Для каждого наблюдения определяется отклонение от среднего.
Перемножаются отклонения двух переменных.
Сумма произведений нормируется на произведение стандартных отклонений.
🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)
🔹Интерпретация аналогична всем прочим видам корреляции
🔹Наличие кор.связи необязательно предполагает зависимость
❤5
#визуализация
Написал небольшую статью про манипуляции в аналитике через визуализацию данных.
О том, как «правильно» выбранный способ визуализации может кардинально изменить восприятие информации и превратить провальные результаты во вполне достойную работу.
Материал во многом основан на моем опыте по обе стороны «баррикад». Текст написан прежде всего для того, чтобы подчеркнуть важность критического мышления — особенно когда речь идет о данных и их интерпретации. И, конечно, это не инструкция к действию. Скорее — вредные советы.
Надеюсь, со временем дойдут руки до второй части, где разберу трюки с процентами, весами, псевдокорреляциями, манипуляциями с выборками, различными типами агрегаций и другими подобными вещами.
Написал небольшую статью про манипуляции в аналитике через визуализацию данных.
О том, как «правильно» выбранный способ визуализации может кардинально изменить восприятие информации и превратить провальные результаты во вполне достойную работу.
Материал во многом основан на моем опыте по обе стороны «баррикад». Текст написан прежде всего для того, чтобы подчеркнуть важность критического мышления — особенно когда речь идет о данных и их интерпретации. И, конечно, это не инструкция к действию. Скорее — вредные советы.
Надеюсь, со временем дойдут руки до второй части, где разберу трюки с процентами, весами, псевдокорреляциями, манипуляциями с выборками, различными типами агрегаций и другими подобными вещами.
❤3
#метод #корреляция #Спирмен
⚡️ Ранговая корреляция Спирмена — инструмент для оценки связи между показателями, когда данные не нормальны или выражены в рангах (грейды, оценки, разряды, уровни, места и пр).
Например, вам интересно понять есть ли связь между производительностью и разрядом сотрудника.
🔹Алгоритм:
1. Присваивание рангов (пост про ранжирование).
2. Вычисление разностей рангов: Для каждой пары значений вычисляется разность рангов (di).
3. Рассчитывается квадрат разностей рангов (именно поэтому не важно будете ли вы ранжировать данные по возрастанию или убыванию, главное - делайте ранжирование одинаковым для обоих переменных)
3. вычисления коэффициента Спирмена.
🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)
но убедитесь, что вы сделали ранжирование.
🔹Интерпретация аналогична всем прочим видам корреляции
⚡️ Ранговая корреляция Спирмена — инструмент для оценки связи между показателями, когда данные не нормальны или выражены в рангах (грейды, оценки, разряды, уровни, места и пр).
Например, вам интересно понять есть ли связь между производительностью и разрядом сотрудника.
🔹Алгоритм:
1. Присваивание рангов (пост про ранжирование).
2. Вычисление разностей рангов: Для каждой пары значений вычисляется разность рангов (di).
3. Рассчитывается квадрат разностей рангов (именно поэтому не важно будете ли вы ранжировать данные по возрастанию или убыванию, главное - делайте ранжирование одинаковым для обоих переменных)
3. вычисления коэффициента Спирмена.
🔹В Excel можно использовать функцию
=коррел(массив 1; массив 2)
но убедитесь, что вы сделали ранжирование.
🔹Интерпретация аналогична всем прочим видам корреляции
❤3
#визуализация #Excel #условное_форматирование
⚡️ Условное форматирование - это инструмент, который позволяет выделять данные в Excel таблицах на основе пользовательских правил. Инструмент удобен, когда надо "подсветить" какой-то тип данных или какое-то условие в массиве ячеек (>,<,=, повторы, уникальные значения и пр.).
🔹 Где находится:
Раздел находится на вкладке "Главная" >> "Условное форматирование".
🔹Что может:
1. Выделять конкретные значения
2. Показать данные больше/меньше заданного числа.
3. Находить значения в рамках заданного диапозона
4. Находить дубли и уникальные значения и пр.
🔹Как использовать:
Выделяете массив данных для анализа, переходите в раздел условное форматирование и создаете правило, которое тут будет применено ко всему массиву.
Подходит для отчетов, дашбордов и оперативной аналитики.
Помогает быстро находить проблемы или тренды.
Удаляются и редактируются правила в том же разделе.
⚡️ Условное форматирование - это инструмент, который позволяет выделять данные в Excel таблицах на основе пользовательских правил. Инструмент удобен, когда надо "подсветить" какой-то тип данных или какое-то условие в массиве ячеек (>,<,=, повторы, уникальные значения и пр.).
🔹 Где находится:
Раздел находится на вкладке "Главная" >> "Условное форматирование".
🔹Что может:
1. Выделять конкретные значения
2. Показать данные больше/меньше заданного числа.
3. Находить значения в рамках заданного диапозона
4. Находить дубли и уникальные значения и пр.
🔹Как использовать:
Выделяете массив данных для анализа, переходите в раздел условное форматирование и создаете правило, которое тут будет применено ко всему массиву.
Подходит для отчетов, дашбордов и оперативной аналитики.
Помогает быстро находить проблемы или тренды.
Удаляются и редактируются правила в том же разделе.
👍1
#основы #Excel #анализ_данных
⚡️ Пакет анализа данных — мощный и функциональный инструмент, встроенный в Excel, о котором, к сожалению, знает не так много людей.
С его помощью можно выполнять более продвинутые методы анализа, такие как построение регрессионных уравнений, анализ вариации или построение гистограмм.
Пакет, в базовой версии Excel отключен и для его использования требует установки аддона (это бесплатно и доступно для всех версий Excel).
🔹Как подключить:
Переходим во вкладку «Файл» → «Параметры» (слева внизу) → в открывшемся окне выбираем раздел «Надстройки» → справа внизу в поле «Управление» выбираем «Надстройки Excel» и нажимаем «Перейти».
В новом окне ставим галочку рядом с «Пакет анализа» и нажимаем ОК.
После этого раздел «Анализ данных» появится во вкладке «Данные».
⚡️ Пакет анализа данных — мощный и функциональный инструмент, встроенный в Excel, о котором, к сожалению, знает не так много людей.
С его помощью можно выполнять более продвинутые методы анализа, такие как построение регрессионных уравнений, анализ вариации или построение гистограмм.
Пакет, в базовой версии Excel отключен и для его использования требует установки аддона (это бесплатно и доступно для всех версий Excel).
🔹Как подключить:
Переходим во вкладку «Файл» → «Параметры» (слева внизу) → в открывшемся окне выбираем раздел «Надстройки» → справа внизу в поле «Управление» выбираем «Надстройки Excel» и нажимаем «Перейти».
В новом окне ставим галочку рядом с «Пакет анализа» и нажимаем ОК.
После этого раздел «Анализ данных» появится во вкладке «Данные».
❤5
#методы #регрессия
Переходим к прикладным методам анализа данных - линейным уравнениям и регрессиям.
⚡️Линейное уравнение - это самый простой способ попробовать определить зависимость одного фактора от другого и ответить на вопрос: «насколько именно один фактор влияет на другой?». Если корреляции говорят о связи, то здесь речь уже идёт о зависимости (взаимосвязи).
🔹Линейное уравнение имеет вид:
y = ax+b, где:
y — зависимая величина
a — коэффициент при независимой переменной x
x — значение показателя
b — свободный член
Самый простой способ понять как это работает на практике - посмотреть на значения стажа и оклада или стажа и производительности сотрудника. Собираем такие пары и строим по ним график (в Excel: Диаграммы - Точечная/график). График, который вы увидите на выходе и будет описывать такую связь.
Прямая (как на графике) будет описываться линейный уравнением. Это самый просто вид зависимости, но на практике, конечно, он встречается не так часто.
Как с ней работать поговорим чуть дальше.
Переходим к прикладным методам анализа данных - линейным уравнениям и регрессиям.
⚡️Линейное уравнение - это самый простой способ попробовать определить зависимость одного фактора от другого и ответить на вопрос: «насколько именно один фактор влияет на другой?». Если корреляции говорят о связи, то здесь речь уже идёт о зависимости (взаимосвязи).
🔹Линейное уравнение имеет вид:
y = ax+b, где:
y — зависимая величина
a — коэффициент при независимой переменной x
x — значение показателя
b — свободный член
Самый простой способ понять как это работает на практике - посмотреть на значения стажа и оклада или стажа и производительности сотрудника. Собираем такие пары и строим по ним график (в Excel: Диаграммы - Точечная/график). График, который вы увидите на выходе и будет описывать такую связь.
Прямая (как на графике) будет описываться линейный уравнением. Это самый просто вид зависимости, но на практике, конечно, он встречается не так часто.
Как с ней работать поговорим чуть дальше.
❤4