#статистика #IQR
⚡️Межквартальный размах (IQR) — это способ измерения разброса средних 50% массива данных. Он рассчитывается как разница между первым квартилем (Q1) и третьим квартилем (Q3).
IQR используется в расчетах, например, для определения выбросов массива данных, представления информации о распределениях случайных величин, для построения графиков (диаграмма размахов) и при анализе выборок.
⚡️Формула расчета: IQR = Q3-Q1.
В Excel готовой функции для расчёта IQR нет, поэтому сначала будет необходимо рассчитать первый и третий квартиль (здесь мы писали как), а затем, отнять от третьего – первый.
⚡️Межквартальный размах (IQR) — это способ измерения разброса средних 50% массива данных. Он рассчитывается как разница между первым квартилем (Q1) и третьим квартилем (Q3).
IQR используется в расчетах, например, для определения выбросов массива данных, представления информации о распределениях случайных величин, для построения графиков (диаграмма размахов) и при анализе выборок.
⚡️Формула расчета: IQR = Q3-Q1.
В Excel готовой функции для расчёта IQR нет, поэтому сначала будет необходимо рассчитать первый и третий квартиль (здесь мы писали как), а затем, отнять от третьего – первый.
👍4
#статистика #выбросы #IQR
Выбросы – это нетипичные значения в выборке данных, которые существенно отличаются от основного массива данных по закону нормальному распределения. Для того, чтобы работать с однородным массивом данных необходимо исключать выбросы. Но как понять какое значение все еще укладывается в нормальное распределение, а какое уже считается выбросом?
Ниже метод выявление выбросов в массиве данных:
1. Сортируем все значения и определяем первый (Q1) и третий (Q3) квартиль. О них мы говорили ранее.
2. Рассчитываем межквартильный размах (IQR). О нем мы также говорили.
3. Теперь рассчитаем диапазон, за пределами которого будут находиться выбросы. Диапазон будет ограничиваться верхней и нижней границей.
a. Верхняя граница = Q3 + (IQR*3)
b. Нижняя граница = Q1 – (IQR*3)
Все, что будет находиться за рамками этих границ считается выбросами
Выбросы – это нетипичные значения в выборке данных, которые существенно отличаются от основного массива данных по закону нормальному распределения. Для того, чтобы работать с однородным массивом данных необходимо исключать выбросы. Но как понять какое значение все еще укладывается в нормальное распределение, а какое уже считается выбросом?
Ниже метод выявление выбросов в массиве данных:
1. Сортируем все значения и определяем первый (Q1) и третий (Q3) квартиль. О них мы говорили ранее.
2. Рассчитываем межквартильный размах (IQR). О нем мы также говорили.
3. Теперь рассчитаем диапазон, за пределами которого будут находиться выбросы. Диапазон будет ограничиваться верхней и нижней границей.
a. Верхняя граница = Q3 + (IQR*3)
b. Нижняя граница = Q1 – (IQR*3)
Все, что будет находиться за рамками этих границ считается выбросами
👍8
#основы #гипотеза
⚡️ Гипотеза – один из главных инструментов HR-анализа. Без четко сформулированной гипотезы HR-аналитик рискует свернуть не туда, ничего не найти или найти совсем не то, что он должен был искать.
Ниже три простые шага, которые позволят сформулировать гипотезу:
ШАГ 1: Прежде всего любая гипотеза должна содержать основное предположение, то, что мы планируем доказать или подтвердить. Можно использовать формулировку:
«Мы полагаем, что….»
ШАГ 2: Далее мы должны определить те инструменты, с помощью которых мы сможем проверить исходную гипотезу. Это могут быть разные методы исследования, инструменты или метрики:
«Для проверки гипотезы мы осуществим анализ…. и определим…»
ШАГ 3: Критерий успеха или неудачи позволит заранее определить, что для нас будет являться положительным исходом проверки гипотезы, а что отрицательным:
«Гипотеза будет считаться подтвержденной в случае, если…» «В случае если расчетные показатели …» «Если мы получим результаты …».
⚡️ Гипотеза – один из главных инструментов HR-анализа. Без четко сформулированной гипотезы HR-аналитик рискует свернуть не туда, ничего не найти или найти совсем не то, что он должен был искать.
Ниже три простые шага, которые позволят сформулировать гипотезу:
ШАГ 1: Прежде всего любая гипотеза должна содержать основное предположение, то, что мы планируем доказать или подтвердить. Можно использовать формулировку:
«Мы полагаем, что….»
ШАГ 2: Далее мы должны определить те инструменты, с помощью которых мы сможем проверить исходную гипотезу. Это могут быть разные методы исследования, инструменты или метрики:
«Для проверки гипотезы мы осуществим анализ…. и определим…»
ШАГ 3: Критерий успеха или неудачи позволит заранее определить, что для нас будет являться положительным исходом проверки гипотезы, а что отрицательным:
«Гипотеза будет считаться подтвержденной в случае, если…» «В случае если расчетные показатели …» «Если мы получим результаты …».
👍3
#метрики #eLTV
⚡️Концепция Employee Lifetime Value (eLTV) — это способ измерения дохода, который принесет сотрудник за свою «жизнь» в компании.
Расчет: доходы – расходы на сотрудника.
Доходы – выручка от продаж, производительность выраженная в деньгах и пр.
Расходы – зп, премии, расходы на найм, адаптацию, обучение и пр.
Если речь идет про продажи, производство и подразделения, которые приносят деньги, то все работает. А что делать с бэк-офисом, с теми, кто напрямую не влияет на фин.результат компании?
Один из вариантов решения — введение балльной системы.
Рассчитывается абстрактный балл эффективности (обычно на основе произв.подразделений)
Каждый сотрудник бэк-офиса оценивается на регулярной основе (раз в месяц) и получает какое-то количество баллов.
Эти баллы конвертируются в деньги по итогам работы и определяется годовая эффективность.
Частное мнение автора: eLTVE — это больше красивая концепция. Не видел серьезных кейсов с цифрами применения eLTV в HR. Но допускаю, что где-то это работает.
⚡️Концепция Employee Lifetime Value (eLTV) — это способ измерения дохода, который принесет сотрудник за свою «жизнь» в компании.
Расчет: доходы – расходы на сотрудника.
Доходы – выручка от продаж, производительность выраженная в деньгах и пр.
Расходы – зп, премии, расходы на найм, адаптацию, обучение и пр.
Если речь идет про продажи, производство и подразделения, которые приносят деньги, то все работает. А что делать с бэк-офисом, с теми, кто напрямую не влияет на фин.результат компании?
Один из вариантов решения — введение балльной системы.
Рассчитывается абстрактный балл эффективности (обычно на основе произв.подразделений)
Каждый сотрудник бэк-офиса оценивается на регулярной основе (раз в месяц) и получает какое-то количество баллов.
Эти баллы конвертируются в деньги по итогам работы и определяется годовая эффективность.
Частное мнение автора: eLTVE — это больше красивая концепция. Не видел серьезных кейсов с цифрами применения eLTV в HR. Но допускаю, что где-то это работает.
👍3
#статистика #сигма #среднеквадратическое_отклонение #SD
⚡️ Среднеквадратичное отклонение (standard deviation, стандартное отклонение, сигма, σ) — это показатель, который показывает, насколько сильно все значения в наборе данных отклоняются от среднего значения.
Формулы оставим в стороне, а в Excel стандартное отклонение можно найти с помощью функции =СТАНДОТКЛОН.Г() для генеральной совокупности и =СТАНДОТКЛОН.В() для выборки.
⚡️Пример: У нас есть два набора данных, показывающих, сколько недель искали ИТ-специалиста два рекрутера.
Рекрутер 1: {1, 1, 14, 14};
Рекрутер 2: {6, 6, 9, 9}.
Нужно решить, какому рекрутеру лучше отдать вакансию.
Если рассчитать среднее арифметическое, то в обоих случаях оно составит 7,5 недели. Кажется, что разницы нет, но если посчитать сигму, то у рекрутера 1 она будет 6,5 недель, а у рекрутера 2 — 1,5 недели.
Это означает, что рекрутер 2, скорее всего, закроет вакансию за 7,5 ± 1,5 недели, тогда как у рекрутера 1 результат может варьироваться от 1,5 до 14 недель.
⚡️ Среднеквадратичное отклонение (standard deviation, стандартное отклонение, сигма, σ) — это показатель, который показывает, насколько сильно все значения в наборе данных отклоняются от среднего значения.
Формулы оставим в стороне, а в Excel стандартное отклонение можно найти с помощью функции =СТАНДОТКЛОН.Г() для генеральной совокупности и =СТАНДОТКЛОН.В() для выборки.
⚡️Пример: У нас есть два набора данных, показывающих, сколько недель искали ИТ-специалиста два рекрутера.
Рекрутер 1: {1, 1, 14, 14};
Рекрутер 2: {6, 6, 9, 9}.
Нужно решить, какому рекрутеру лучше отдать вакансию.
Если рассчитать среднее арифметическое, то в обоих случаях оно составит 7,5 недели. Кажется, что разницы нет, но если посчитать сигму, то у рекрутера 1 она будет 6,5 недель, а у рекрутера 2 — 1,5 недели.
Это означает, что рекрутер 2, скорее всего, закроет вакансию за 7,5 ± 1,5 недели, тогда как у рекрутера 1 результат может варьироваться от 1,5 до 14 недель.
👍3🤔2
#метрики #подбор #испытательный_срок
⚡️ Доля кандидатов, успешно прошедших испытательный срок - это базовая метрика эффективности функций подбора и адаптации сотрудников. Обычно она рассчитывается ежемесячно, но для динамичных рынков или рынков с высокой текучестью (например, в ритейле) такую метрику можно рассчитывать и еженедельно.
Хорошей идеей будет рассчитывать этот показатель по категориям персонала (если применимо для вас): производство, бэкофис и пр. Так как условия работы у разных категорией могут сильно отличаться.
Не забывайте, что испытательный срок не может превышать трех месяцев. Для руководителей организаций, их заместителей, главных бухгалтеров и их заместителей, а также для руководителей филиалов и представительств, он может быть до шести месяцев (ТК РФ).
⚡️Пример: В марте в компанию пришли 30 сотрудников, из которых 15 успешно прошли испытательный срок.
Доля кандидатов, успешно прошедших испытательный срок в марте, составит: 15 / 30 = 0,5 (или 50%).
⚡️ Доля кандидатов, успешно прошедших испытательный срок - это базовая метрика эффективности функций подбора и адаптации сотрудников. Обычно она рассчитывается ежемесячно, но для динамичных рынков или рынков с высокой текучестью (например, в ритейле) такую метрику можно рассчитывать и еженедельно.
Хорошей идеей будет рассчитывать этот показатель по категориям персонала (если применимо для вас): производство, бэкофис и пр. Так как условия работы у разных категорией могут сильно отличаться.
Не забывайте, что испытательный срок не может превышать трех месяцев. Для руководителей организаций, их заместителей, главных бухгалтеров и их заместителей, а также для руководителей филиалов и представительств, он может быть до шести месяцев (ТК РФ).
⚡️Пример: В марте в компанию пришли 30 сотрудников, из которых 15 успешно прошли испытательный срок.
Доля кандидатов, успешно прошедших испытательный срок в марте, составит: 15 / 30 = 0,5 (или 50%).
👍1
#статистика #CI #доверительный_интервал
Часть 1
Имеются данные количества произведенных деталей некоторой группы сотрудников (наша выборка) из большого отдела (а это генеральная совокупность, которая нам не известна).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из данного отдела
Для того, чтобы понять этот диапазон нам и понадобится доверительный интервал.
⚡️Доверительный интервал (confidence interval) – это диапазон, который с определенной вероятностью накрывает оцениваемый параметр генеральной совокупности.
Другими словами, он показывает насколько параметры из выборки могут отличаться от параметров из генеральной совокупности (ГС).
Формула расчета:
расчет происходит в два этапа.
на первом этапе рассчитывается ошибка репрезентативности (standard error). Рассчитывается как среднее квадратическое отклонение / квадратный корень размера выборки.
на втором этапе пользователь задает вероятность погрешности (через t-критерий Стьюдента) и рассчитывает ДИ.
Часть 1
Имеются данные количества произведенных деталей некоторой группы сотрудников (наша выборка) из большого отдела (а это генеральная совокупность, которая нам не известна).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из данного отдела
Для того, чтобы понять этот диапазон нам и понадобится доверительный интервал.
⚡️Доверительный интервал (confidence interval) – это диапазон, который с определенной вероятностью накрывает оцениваемый параметр генеральной совокупности.
Другими словами, он показывает насколько параметры из выборки могут отличаться от параметров из генеральной совокупности (ГС).
Формула расчета:
расчет происходит в два этапа.
на первом этапе рассчитывается ошибка репрезентативности (standard error). Рассчитывается как среднее квадратическое отклонение / квадратный корень размера выборки.
на втором этапе пользователь задает вероятность погрешности (через t-критерий Стьюдента) и рассчитывает ДИ.
❤3🤔1
#статистика #CI #доверительный_интервал
Часть 2
Пример расчета:
Имеются данные количества произведенных деталей группы сотрудников (выборка) из большого отдела (ГС).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из всего отдела.
1: рассчитаем обычное среднее арифметическое по выборке. Оно нам понадобится на финальном расчете и составит 30,4
2: рассчитаем стандартного отклонения выборки. Для этого используем функцию =СТАНДОТКЛОН.В() в Excel. Оно равно 1,34
3: рассчитаем ошибку репрезентативности (она же standard error). Для этого станд.отклонение выборки / корень кол-ва эл-тов выборки. Составит 0,6.
4: рассчитаем доверительный интервал. Для этого t-критерий стьюдента * ошибку репрезентативности. Ответ 1,2
Таким образом доверительный интервал, с учетом округления до целых, будет равен 30,4 ± 1,2.
❗️Это значит, что с вероятностью в 95% все остальные значения из ГС, которые мы будем рассматривать, будут находиться в диапазоне 29-32 произведенных деталей.
Часть 2
Пример расчета:
Имеются данные количества произведенных деталей группы сотрудников (выборка) из большого отдела (ГС).
Наша задача понять диапазон кол-ва деталей, которые с 95% вероятностью делает любой сотрудники из всего отдела.
1: рассчитаем обычное среднее арифметическое по выборке. Оно нам понадобится на финальном расчете и составит 30,4
2: рассчитаем стандартного отклонения выборки. Для этого используем функцию =СТАНДОТКЛОН.В() в Excel. Оно равно 1,34
3: рассчитаем ошибку репрезентативности (она же standard error). Для этого станд.отклонение выборки / корень кол-ва эл-тов выборки. Составит 0,6.
4: рассчитаем доверительный интервал. Для этого t-критерий стьюдента * ошибку репрезентативности. Ответ 1,2
Таким образом доверительный интервал, с учетом округления до целых, будет равен 30,4 ± 1,2.
❗️Это значит, что с вероятностью в 95% все остальные значения из ГС, которые мы будем рассматривать, будут находиться в диапазоне 29-32 произведенных деталей.
👍4
#инструменты #МойОфис
⚡️ МойОфис — это альтернатива пакета MS Office от российский разработчиков.
На рынке порядка 10 лет. Входит в реестр российского ПО.
В базовом наборе три продукта: Текст (аналог Word), Таблица (Excel), Презентация (Power point). Решение десктопное.
⚡️Установка: скачиваете дистрибутив, устанавливаете.
⚡️Стоимость: есть пробная бесплатная версия. Платные начинаются от 2,990 за 3 устройства на год. Есть корпоративные решения.
⚡️ Плюсы:
- Хорошо знакомый для пользователей Office интерфейс.
- Совместим с расширениями MS Office + .pdf
- Имеет привычный функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка от разработчиков (БД, видео с обучением и пр.).
Главная фишка – это фокус на контекстных меню в интерфейсе. То есть, когда вы выделяете какие-то фрагменты или ячейки, система предлагает вам варианты того, что можно сделать. Это немного необычно, но быстро привыкаешь.
Как будто не плохое решение, как альтернатива интересна. Попробовал с интересом.
⚡️ МойОфис — это альтернатива пакета MS Office от российский разработчиков.
На рынке порядка 10 лет. Входит в реестр российского ПО.
В базовом наборе три продукта: Текст (аналог Word), Таблица (Excel), Презентация (Power point). Решение десктопное.
⚡️Установка: скачиваете дистрибутив, устанавливаете.
⚡️Стоимость: есть пробная бесплатная версия. Платные начинаются от 2,990 за 3 устройства на год. Есть корпоративные решения.
⚡️ Плюсы:
- Хорошо знакомый для пользователей Office интерфейс.
- Совместим с расширениями MS Office + .pdf
- Имеет привычный функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка от разработчиков (БД, видео с обучением и пр.).
Главная фишка – это фокус на контекстных меню в интерфейсе. То есть, когда вы выделяете какие-то фрагменты или ячейки, система предлагает вам варианты того, что можно сделать. Это немного необычно, но быстро привыкаешь.
Как будто не плохое решение, как альтернатива интересна. Попробовал с интересом.
👍3
#визуализация #диаграмма_гутенберга
Вот любопытная концепция взятая из графического дизайна.
⚡️Диаграмма Гутенбрега описывает общую модель движения глаз при взгляде на равномерно распределенную, однотипную информацию, например: слайды презентации или корпоративный портал.
Согласно этой концепции дисплей/страница делится на четыре квадранта с разным уровнем внимания к ним: начальная область — вверху слева, заключительная область — внизу справа, область с высоким потенциалом — вверху справа и область с низким потенциалом — внизу слева.
Больше всего внимания уделяется тексту слева сверху, далее фрагментам в центре и, наконец, снизу справа. Исходя из этого принципа, можно размещать информацию по степени ее значимости для читателей / зрителей. То, на что хотите обратить внимание в первую очередь стоит размещать в центре или слева сверху.
Хотя дизайны, базирующиеся прямо или косвенно на диаграмме Гутенберга, широко распространены, крупных исследований на эту тему не было, так что это все лишь гипотеза.
Вот любопытная концепция взятая из графического дизайна.
⚡️Диаграмма Гутенбрега описывает общую модель движения глаз при взгляде на равномерно распределенную, однотипную информацию, например: слайды презентации или корпоративный портал.
Согласно этой концепции дисплей/страница делится на четыре квадранта с разным уровнем внимания к ним: начальная область — вверху слева, заключительная область — внизу справа, область с высоким потенциалом — вверху справа и область с низким потенциалом — внизу слева.
Больше всего внимания уделяется тексту слева сверху, далее фрагментам в центре и, наконец, снизу справа. Исходя из этого принципа, можно размещать информацию по степени ее значимости для читателей / зрителей. То, на что хотите обратить внимание в первую очередь стоит размещать в центре или слева сверху.
Хотя дизайны, базирующиеся прямо или косвенно на диаграмме Гутенберга, широко распространены, крупных исследований на эту тему не было, так что это все лишь гипотеза.
👍1
#инструменты #Яндекс360
⚡️Яндекс 360 — это облачная экосистема сервисов от Яндекса, которая включает множество продуктов (по аналогии с Google) один из которых Документы. О нем и поговорим.
В базовом наборе три продукта: Документы (аналог Word), Таблицы (Excel) и Презентации (Power Point).
Облачное решение.
⚡️Установка: не требуется. Достаточно зарегистрироваться в система Яндекс.
⚡️Стоимость: бесплатно. Расширенный пакет Яндекс 360 дает дополнительные продукты, но не влияет на функциональность офисных решений.
⚡️Плюсы:
- Хорошо знакомый для пользователей MS Office интерфейс (на скрине)
- Совместим с расширениями MS Office
- Имеет привычный для пользователей функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка одновременной работы над файлом.
- Полностью бесплатно.
Главная фишка - все бесплатно. По функционалу и возможностям очень похоже и на Excel и на МойОфис (в большей степени чем на GDocs).
Хороший аналог, если не смущает, что нет возможности работать автономно.
⚡️Яндекс 360 — это облачная экосистема сервисов от Яндекса, которая включает множество продуктов (по аналогии с Google) один из которых Документы. О нем и поговорим.
В базовом наборе три продукта: Документы (аналог Word), Таблицы (Excel) и Презентации (Power Point).
Облачное решение.
⚡️Установка: не требуется. Достаточно зарегистрироваться в система Яндекс.
⚡️Стоимость: бесплатно. Расширенный пакет Яндекс 360 дает дополнительные продукты, но не влияет на функциональность офисных решений.
⚡️Плюсы:
- Хорошо знакомый для пользователей MS Office интерфейс (на скрине)
- Совместим с расширениями MS Office
- Имеет привычный для пользователей функционал типа сводных таблиц, функций (СУММ, ВПР и пр.), шрифтов и пр.
- Поддержка одновременной работы над файлом.
- Полностью бесплатно.
Главная фишка - все бесплатно. По функционалу и возможностям очень похоже и на Excel и на МойОфис (в большей степени чем на GDocs).
Хороший аналог, если не смущает, что нет возможности работать автономно.
#личное #полумарафон
На скрине график нормального распределения результатов участников забега национального полумарафона в Казани, который состоялся в прошлое воскресенье.
По оси Х - результаты в секундах, по оси Y - доля участников с этим результатом. Зеленые колонки - это фактические результаты участников, Красная линия – среднее значение, а две желтые линии – стандартное отклонение.
ранее я писал про аналогичное мероприятие в Москве.
Среднее время участника составило 113,1 минут, отклонение от него — 19,7 минут.
Мне было любопытно сравнить это с аналогичным мероприятием в Москве. Там среднее значение было 134,8 минуты, отклонение — 26,5 минут.
Если взять гипотезу, что в московском полумарафоне бОльшая часть участников – москвичи, а в казанском – жители Казани и РТ, то по результатам можно сделать вывод, что Казань бегает быстрее Москвы ))
Как это связано с HR? Никак…впрочем, если вам нужны сотрудники, которые умеют быстро и долго бегать – присмотритесь к ребятам из Казани )
На скрине график нормального распределения результатов участников забега национального полумарафона в Казани, который состоялся в прошлое воскресенье.
По оси Х - результаты в секундах, по оси Y - доля участников с этим результатом. Зеленые колонки - это фактические результаты участников, Красная линия – среднее значение, а две желтые линии – стандартное отклонение.
ранее я писал про аналогичное мероприятие в Москве.
Среднее время участника составило 113,1 минут, отклонение от него — 19,7 минут.
Мне было любопытно сравнить это с аналогичным мероприятием в Москве. Там среднее значение было 134,8 минуты, отклонение — 26,5 минут.
Если взять гипотезу, что в московском полумарафоне бОльшая часть участников – москвичи, а в казанском – жители Казани и РТ, то по результатам можно сделать вывод, что Казань бегает быстрее Москвы ))
Как это связано с HR? Никак…впрочем, если вам нужны сотрудники, которые умеют быстро и долго бегать – присмотритесь к ребятам из Казани )
❤3👍2
#визуализация #scatter_plot
⚡️График рассеяния (Scatter Plot) — метод визуализации корреляционных моделей. С его помощью можно определить потенциальные взаимосвязи между количественными переменными.
Каждому объекту соответствует одна точка чьи координаты задаются какими-то характеристиками (например: стаж и доля брака). Если между двумя характеристиками есть взаимосвязь (как на картинке), то точки скорее всего будут стремиться формировать прямую, то есть находиться в рамках одного «коридора» значений, а если связи нет, то вероятнее всего точки будут располагаться на графике хаотично.
⚡️Для чего использовать:
Для визуального отображения связи двух количественных факторов между собой (например, для корреляции). Для убедительности и большей наглядности можно построить дополнительную линию тренда.
⚡️Как построить:
Нужен массив данных, который будет содержать две характеристики одного объекта расположенные попарно.
В Excel на вкладке «Вставить» выбрать «Точечная или пузырьковая диаграмма».
⚡️График рассеяния (Scatter Plot) — метод визуализации корреляционных моделей. С его помощью можно определить потенциальные взаимосвязи между количественными переменными.
Каждому объекту соответствует одна точка чьи координаты задаются какими-то характеристиками (например: стаж и доля брака). Если между двумя характеристиками есть взаимосвязь (как на картинке), то точки скорее всего будут стремиться формировать прямую, то есть находиться в рамках одного «коридора» значений, а если связи нет, то вероятнее всего точки будут располагаться на графике хаотично.
⚡️Для чего использовать:
Для визуального отображения связи двух количественных факторов между собой (например, для корреляции). Для убедительности и большей наглядности можно построить дополнительную линию тренда.
⚡️Как построить:
Нужен массив данных, который будет содержать две характеристики одного объекта расположенные попарно.
В Excel на вкладке «Вставить» выбрать «Точечная или пузырьковая диаграмма».
👍1
#методы #корреляция #кендалл #kendall
часть 1
⚡️Коэффициент ранговой корреляции Кендалла (τ, kendall correlation) предназначен для определения взаимосвязи между двумя ранговыми переменными.
Главное отличие от корреляции Спирмена - возможность работать с малыми выборками.
Следует помнить, что коэффициент Кендалла (как и Спирмена) используются как меры взаимозависимости между рядами рангов, а не для определения связи между самими переменными.
Для чего используется:
для поиска взаимосвязи между группами объектов по ранговым шкалам (результаты нескольких тестов, оценки эффективности в разных системах и пр.)
часть 1
⚡️Коэффициент ранговой корреляции Кендалла (τ, kendall correlation) предназначен для определения взаимосвязи между двумя ранговыми переменными.
Главное отличие от корреляции Спирмена - возможность работать с малыми выборками.
Следует помнить, что коэффициент Кендалла (как и Спирмена) используются как меры взаимозависимости между рядами рангов, а не для определения связи между самими переменными.
Для чего используется:
для поиска взаимосвязи между группами объектов по ранговым шкалам (результаты нескольких тестов, оценки эффективности в разных системах и пр.)
❤5👍1
#методы #корреляция #кендалл
Часть 2
Пример расчета:
Исходная гипотеза: внутренняя оценка результативности работы сотрудников напрямую связана с их IQ. Если это правда, то прогнозировать результативность можно по результат IQ тестов при приеме на работу.
Для проверки гипотезы определим связь между шкалами через коэф. Кендалла. При результате 0,7 и выше - связь будет установлена и гипотеза подтверждена.
1: Проранжируем результаты IQ тестов (X). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Х
2: Проранжируем результаты Внутренняя оценка (Y). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Y
3: Отсортируем по возрастанию столбец (Ранг X)
4: Вычислим число совпадений P, Используем функцию =счетесли(). Результат в колонке P
5: Вычислим число инверсий Q, Используем функцию =счетесли(). Результат в колонке Q
6: Просуммируем совпадения и инверсии и рассчитаем коэф.корреляции Кендалла.
❗️ Коэ.корреляции Кендалла составил 0,5.
Связи между шкалами нет, гипотеза не подтвердилась
Часть 2
Пример расчета:
Исходная гипотеза: внутренняя оценка результативности работы сотрудников напрямую связана с их IQ. Если это правда, то прогнозировать результативность можно по результат IQ тестов при приеме на работу.
Для проверки гипотезы определим связь между шкалами через коэф. Кендалла. При результате 0,7 и выше - связь будет установлена и гипотеза подтверждена.
1: Проранжируем результаты IQ тестов (X). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Х
2: Проранжируем результаты Внутренняя оценка (Y). Используем функцию =ранг.ср(). Результат запишем в колонку Ранг Y
3: Отсортируем по возрастанию столбец (Ранг X)
4: Вычислим число совпадений P, Используем функцию =счетесли(). Результат в колонке P
5: Вычислим число инверсий Q, Используем функцию =счетесли(). Результат в колонке Q
6: Просуммируем совпадения и инверсии и рассчитаем коэф.корреляции Кендалла.
❗️ Коэ.корреляции Кендалла составил 0,5.
Связи между шкалами нет, гипотеза не подтвердилась
❤1
#прочее #рассел
Отдыхаем от математики
Чайник Рассела (Russell's teapot) — занятная аналогия, приведённая английским математиком и философом Бертраном Расселом для объяснения принципа, согласно которому бремя доказательства лежит на утверждающем.
"Если бы я стал утверждать, что между Землей и Марсом вокруг Солнца по эллиптической орбите вращается фарфоровый чайник, никто не смог бы опровергнуть моё утверждение, добавь я предусмотрительно, что чайник слишком мал, чтобы обнаружить его даже при помощи самых мощных телескопов. Но заяви я далее, что, поскольку моё утверждение невозможно опровергнуть, разумный человек не имеет права сомневаться в его истинности, то мне справедливо указали бы, что я несу чушь."
— Б.Рассел
Так что фраза: „Если я что-то утверждаю, я не обязан представлять доказательства. Если вы утверждаете обратное, опровергая меня, это вы должны доказательства представлять.“ контроверсионна.💁♂️
Отдыхаем от математики
Чайник Рассела (Russell's teapot) — занятная аналогия, приведённая английским математиком и философом Бертраном Расселом для объяснения принципа, согласно которому бремя доказательства лежит на утверждающем.
"Если бы я стал утверждать, что между Землей и Марсом вокруг Солнца по эллиптической орбите вращается фарфоровый чайник, никто не смог бы опровергнуть моё утверждение, добавь я предусмотрительно, что чайник слишком мал, чтобы обнаружить его даже при помощи самых мощных телескопов. Но заяви я далее, что, поскольку моё утверждение невозможно опровергнуть, разумный человек не имеет права сомневаться в его истинности, то мне справедливо указали бы, что я несу чушь."
— Б.Рассел
Так что фраза: „Если я что-то утверждаю, я не обязан представлять доказательства. Если вы утверждаете обратное, опровергая меня, это вы должны доказательства представлять.“ контроверсионна.💁♂️
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента
Сейчас будет немного мозголомства🥲
⚡️Критерий T-Стьюдента (t-test) используется для проверки нулевой гипотезы и определения статистической значимости различий средних величин между двумя группами.
Условия применения t-критерия Стьюдента для независимых выборок:
- данные количественные;
- данные распределены нормально;
- выборки независимые (объекты в них разные).
Формула: t = (X1 – X2) / sqrt((σ1² / n1) + (σ2² / n2))
Как рассчитывать:
1. Рассчитываем средние значения по каждой группе (X1 и X2).
2. Рассчитываем стандартное отклонение для каждой группы (σ1 и σ2).
3. Рассчитываем стандартную ошибку среднего для каждой группы (SE1 = σ1 / sqrt(n1) и SE2 = σ2 / sqrt(n2)).
4. Подставляем значения в формулу и получаем значение t-критерия Стьюдента.
В следующем посте разберем интерпретацию критерия.
Сейчас будет немного мозголомства🥲
⚡️Критерий T-Стьюдента (t-test) используется для проверки нулевой гипотезы и определения статистической значимости различий средних величин между двумя группами.
Условия применения t-критерия Стьюдента для независимых выборок:
- данные количественные;
- данные распределены нормально;
- выборки независимые (объекты в них разные).
Формула: t = (X1 – X2) / sqrt((σ1² / n1) + (σ2² / n2))
Как рассчитывать:
1. Рассчитываем средние значения по каждой группе (X1 и X2).
2. Рассчитываем стандартное отклонение для каждой группы (σ1 и σ2).
3. Рассчитываем стандартную ошибку среднего для каждой группы (SE1 = σ1 / sqrt(n1) и SE2 = σ2 / sqrt(n2)).
4. Подставляем значения в формулу и получаем значение t-критерия Стьюдента.
В следующем посте разберем интерпретацию критерия.
❤1
#статистика #t_test #Стьюдент #критерий_стьюдента
Часть 2
Пример расчета:
У нас есть две выборки по числу звонков сотрудников call-центра. Наша гипотеза в том, что сотрудник 2 делает больше звонков чем сотрудник 1. Проверим гипотезу
1: Рассчитаем показатели среднего арифметического значения (x); стандартное отклонение (SD); ошибку репрезентативности (RX) для каждой из выборок.
2: Рассчитаем t-критерий Стьюдента (t) по формуле: (x1-x2)/ √ (RX1² + RX2²)
3: Рассчитаем число степеней свободы (df) по формуле: (кол-во эл-тов выборке 1 + кол-во эл-тов в выборке 2) – 2.
4. имея t-критерий Стьюдента (2,59) и число степеней свободы (18), найдем значение ошибки (p) из таблицы
❗️Это значит, что с вероятностью 95% сотрудник 2 действительно делает больше звонков чем сотрудник 1. Гипотеза подтвердилась.
Часть 2
Пример расчета:
У нас есть две выборки по числу звонков сотрудников call-центра. Наша гипотеза в том, что сотрудник 2 делает больше звонков чем сотрудник 1. Проверим гипотезу
1: Рассчитаем показатели среднего арифметического значения (x); стандартное отклонение (SD); ошибку репрезентативности (RX) для каждой из выборок.
2: Рассчитаем t-критерий Стьюдента (t) по формуле: (x1-x2)/ √ (RX1² + RX2²)
3: Рассчитаем число степеней свободы (df) по формуле: (кол-во эл-тов выборке 1 + кол-во эл-тов в выборке 2) – 2.
4. имея t-критерий Стьюдента (2,59) и число степеней свободы (18), найдем значение ошибки (p) из таблицы
❗️Это значит, что с вероятностью 95% сотрудник 2 действительно делает больше звонков чем сотрудник 1. Гипотеза подтвердилась.
❤1
#Excel #МойОфис #Яндекс_Документы #LibreOffice #OpenOffice #инструменты
Собрал несколько альтернатив привычному Excel.
Их можно разделить на две категории: облачные, которые требуют постоянного подключения к сети и полноценное ПО, которое устанавливается и позволяет работать автономно.
К первой категории относятся два приложения от одной группы разработчиков: OpenOffice, LibreOffice. У обоих открытый код и сильное комьюнити. Первым был OpenOffice, но в какой-то момент часть команды начала разрабатывать другой проект - LibreOffice. Решения похожи, но поддержка LibreOffice продолжается до сих пор, а вот последнее обновление OpenOffice было в 2019 году.
Ко второй категории относится, в первую очередь, Google Таблицы, но с ним все понятно, и два решения от российских разработчиков: МойОфис, ЯндексДокументы. Как понятно оба продукта входят в реестр российского ПО. Продукты, если не учитывать специфики в интерфейсе, очень схожи.
Подробнее про решения:
OpenOffice
LibreOffice
МойОфис
Яндекс Документы: 360
Собрал несколько альтернатив привычному Excel.
Их можно разделить на две категории: облачные, которые требуют постоянного подключения к сети и полноценное ПО, которое устанавливается и позволяет работать автономно.
К первой категории относятся два приложения от одной группы разработчиков: OpenOffice, LibreOffice. У обоих открытый код и сильное комьюнити. Первым был OpenOffice, но в какой-то момент часть команды начала разрабатывать другой проект - LibreOffice. Решения похожи, но поддержка LibreOffice продолжается до сих пор, а вот последнее обновление OpenOffice было в 2019 году.
Ко второй категории относится, в первую очередь, Google Таблицы, но с ним все понятно, и два решения от российских разработчиков: МойОфис, ЯндексДокументы. Как понятно оба продукта входят в реестр российского ПО. Продукты, если не учитывать специфики в интерфейсе, очень схожи.
Подробнее про решения:
OpenOffice
LibreOffice
МойОфис
Яндекс Документы: 360
👍2
#визуализация #облако_тэгов
⚡️Облако слов (или тэгов) – это популярный элемент визуализации для отображения частоты упоминаний слов и выражений в массиве текста.
Для чего использовать:
если хотите показать самые часто упоминаемые слова. Например, в отзывах или в тексте. В таких случаях размер слова будет зависеть от того, насколько часто его использовали. Больше слово - чаще упоминали.
Как построить:
Оптимальным решением будет воспользоваться R или Python. Но, по понятным причинам, это доступно не всем.
Второй вариант – воспользоваться веб-сервисами.
Для этого будет необходимо сначала посчитать количество упоминаний слов в тексте. Сделать это можно либо встроенными средствами Excel, Word или опять же специальными сервисами, например, таким.
Теперь, когда у нас есть частотность упоминаний слов идем в этот сервис или в этот.
Там руками вписываем слова (топ 10, например), указываем частоту их упоминания и сервисы сами построят вам облако слов с возможностью их выгрузки к себе на компьютер бесплатно.
⚡️Облако слов (или тэгов) – это популярный элемент визуализации для отображения частоты упоминаний слов и выражений в массиве текста.
Для чего использовать:
если хотите показать самые часто упоминаемые слова. Например, в отзывах или в тексте. В таких случаях размер слова будет зависеть от того, насколько часто его использовали. Больше слово - чаще упоминали.
Как построить:
Оптимальным решением будет воспользоваться R или Python. Но, по понятным причинам, это доступно не всем.
Второй вариант – воспользоваться веб-сервисами.
Для этого будет необходимо сначала посчитать количество упоминаний слов в тексте. Сделать это можно либо встроенными средствами Excel, Word или опять же специальными сервисами, например, таким.
Теперь, когда у нас есть частотность упоминаний слов идем в этот сервис или в этот.
Там руками вписываем слова (топ 10, например), указываем частоту их упоминания и сервисы сами построят вам облако слов с возможностью их выгрузки к себе на компьютер бесплатно.
❤5😢1
#методы #корреляция #пирсон
⚡️Коэффициент корреляции Пирсона (p, Pearson correlation) предназначен для определения взаимосвязи между двумя переменными (или признаками объекта) в метрических шкалах.
Важно отметить, что корреляция показывает только ассоциацию, но не прямую закономерность между факторами.
Для чего используется:
для поиска взаимосвязи между несколькими характеристиками группы объектов. Например, связь стажа сотрудника и показателями его эффективности (штуки, деньги, тонны, км и пр).
В Excel этот вид корреляции легко рассчитывается с помощью функции =КОРРЕЛ(массив данных1; массив данных2).
Интерпретация:
Аналогично другим видам корреляции. Если коэф. корреляции больше 0,7 или меньше (-0,7) существует устойчивая связь между характеристиками (положительная или отрицательная).
Пример:
есть набор данных: стаж сотрудника (мес.) и кол-во звонков, которые он делает. Наша гипотеза - эти показатели связаны.
используем функцию и выясняем, что связь есть и отрицательная. Меньше стаж - больше звонков.
⚡️Коэффициент корреляции Пирсона (p, Pearson correlation) предназначен для определения взаимосвязи между двумя переменными (или признаками объекта) в метрических шкалах.
Важно отметить, что корреляция показывает только ассоциацию, но не прямую закономерность между факторами.
Для чего используется:
для поиска взаимосвязи между несколькими характеристиками группы объектов. Например, связь стажа сотрудника и показателями его эффективности (штуки, деньги, тонны, км и пр).
В Excel этот вид корреляции легко рассчитывается с помощью функции =КОРРЕЛ(массив данных1; массив данных2).
Интерпретация:
Аналогично другим видам корреляции. Если коэф. корреляции больше 0,7 или меньше (-0,7) существует устойчивая связь между характеристиками (положительная или отрицательная).
Пример:
есть набор данных: стаж сотрудника (мес.) и кол-во звонков, которые он делает. Наша гипотеза - эти показатели связаны.
используем функцию и выясняем, что связь есть и отрицательная. Меньше стаж - больше звонков.