🧑💻 Здарова ребят, хочу пояснить касаемо этих двух графиков:
y = mx + b — базовая (уже) формула линейной регрессии, где m — наклон, b — y-пересечение.
Дак вот, что меняется на графике?
1️⃣ На первом графике масштаб оси Y соответствует исходным данным.
2️⃣ На втором графике масштаб оси Y изменен, так как данные были стандартизированы. Теперь они находятся в диапазоне около [-3, 3]
________
1️⃣ Касаемо точек, на первом графике точки расположены в соответствии с исходными данными.
2️⃣ На втором графике точки На втором графике точки расположены в соответствии со стандартизированными данными.
________
1️⃣ Коэффициенты модели первой линейной регрессии зависят от масштаба исходных данных
2️⃣ Коэффициенты второй зависят от масштаба стандартизированных данных, который всегда будет иметь среднее значение 0 и стандартное отклонение 1
⚙️ Напомню, что на 2 графике у нас отображаются именно предсказанные значения модели линейной регрессии, обученной на стандартизованных данных — это первый момент.
y = mx + b — базовая (уже) формула линейной регрессии, где m — наклон, b — y-пересечение.
Дак вот, что меняется на графике?
1️⃣ На первом графике масштаб оси Y соответствует исходным данным.
2️⃣ На втором графике масштаб оси Y изменен, так как данные были стандартизированы. Теперь они находятся в диапазоне около [-3, 3]
________
1️⃣ Касаемо точек, на первом графике точки расположены в соответствии с исходными данными.
2️⃣ На втором графике точки На втором графике точки расположены в соответствии со стандартизированными данными.
________
1️⃣ Коэффициенты модели первой линейной регрессии зависят от масштаба исходных данных
2️⃣ Коэффициенты второй зависят от масштаба стандартизированных данных, который всегда будет иметь среднее значение 0 и стандартное отклонение 1
❤🔥1👍1🥰1👨💻1👀1
Коэффициенты второй зависят от масштаба стандартизированных данных, который всегда будет иметь среднее значение 0 и стандартное отклонение 1
Итак, добавлю вам 2 гистограммы для понимания среднего значения и стандартного отклонения.
1️⃣ На первой гистограмме мы видим значения массива raw_data с исходными данными. Черными крестиками показаны все наши точки массива raw_data.
Эта первая гистограмма показывает распределение значений из raw_data:
⚙️ Столбец около 0 показывает, сколько значений в raw_data близко к 0.
⚙️ Столбец около 5 показывает, сколько значений в raw_data близко к 5.
2️⃣ На второй гистограмме показано распределение Z-score преобразованных значений:
⚙️ Столбец около -1 показывает, сколько значений в transformed_data имеют Z-score около -1.
⚙️ Столбец около 0 показывает, сколько значений в transformed_data близко к среднему значению (0).
⚙️ Столбец около 1 показывает, сколько значений в transformed_data имеют Z-score около 1.
❤🔥1🤯1
🧑💻⚙️⚙️⚙️ OpenAI СРОЧНО дропнет o3-mini сегодня — в компании паника невиданных масштабов из-за DeepSeek.
⚙️ Встречайте САМУЮ МОЩНУЮ нейронку в мире:
• Базовая o3 на 30% (!) сильнее o1 в коде.
• Сразу после первых тестов o3 обошла людей в тесте на AGI.
• o3 заняла 175 место в рейтинге самых сильных кодеров мира.
• Альтман уже пообещал сделать o3-mini доступной всем БЕСПЛАТНО.
⚙️ Встречайте САМУЮ МОЩНУЮ нейронку в мире:
• Базовая o3 на 30% (!) сильнее o1 в коде.
• Сразу после первых тестов o3 обошла людей в тесте на AGI.
• o3 заняла 175 место в рейтинге самых сильных кодеров мира.
• Альтман уже пообещал сделать o3-mini доступной всем БЕСПЛАТНО.
❤1❤🔥1
М А Ш И Н Н О Е О Б У Ч Е Н И Е — Ч А С Т Ь 4
Часть 3 — ТУТ
1️⃣5️⃣ НАЧИНАЕМ РАЗБИРАТЬ ЛИНЕЙНУЮ РЕГРЕССИЮ
1️⃣6️⃣ Выводим матрицу X 🔗 Выводим матрицу для Y
1️⃣7️⃣ Реализация формулы (Очень важно!!!) 🔗 Примеры использования наших функций 🔗 Дописываем формулу до конца 🔗 Разбираем вывод
1️⃣8️⃣ Разбираем код Линейной регрессии (формулу прописываем сами) 🟰 Продолжение 🟰Продолжение 🟰 Создаем точки (дописываем код) 🟰 Результат
1️⃣9️⃣ Продолжаем изучать линейную регрессию 🟰 Метод наименьших квадратов (важно)
2️⃣0️⃣ Знакомимся с Sklearn и методом fit
2️⃣1️⃣ Разбираем наш первый датасет!
2️⃣2️⃣ Мотивационный ролик на целый год вам
2️⃣3️⃣ Продолжаем разбирать структуру датасета 🟰 Продолжение
Часть 3 — ТУТ
1️⃣5️⃣ НАЧИНАЕМ РАЗБИРАТЬ ЛИНЕЙНУЮ РЕГРЕССИЮ
1️⃣6️⃣ Выводим матрицу X 🔗 Выводим матрицу для Y
1️⃣7️⃣ Реализация формулы (Очень важно!!!) 🔗 Примеры использования наших функций 🔗 Дописываем формулу до конца 🔗 Разбираем вывод
1️⃣8️⃣ Разбираем код Линейной регрессии (формулу прописываем сами) 🟰 Продолжение 🟰Продолжение 🟰 Создаем точки (дописываем код) 🟰 Результат
1️⃣9️⃣ Продолжаем изучать линейную регрессию 🟰 Метод наименьших квадратов (важно)
2️⃣0️⃣ Знакомимся с Sklearn и методом fit
2️⃣1️⃣ Разбираем наш первый датасет!
2️⃣2️⃣ Мотивационный ролик на целый год вам
2️⃣3️⃣ Продолжаем разбирать структуру датасета 🟰 Продолжение
🥰1🤯1🤓1👨💻1
🧑💻 Гайс, всем привет! Заебал я вас уже Z-core стандартизацией, но выбора у вас, увы, нет! Хочу просто показать, чем мы все это время занимались...
📊 Эти гистограммы идеально показывают распределение значений в наших массивах данных. Каждый столбик показывает количество значений, которые попадают в определенный диапазон.
📈 Первый график (исходные данные — raw_data)
▫️Столбец около 0 показывает, сколько значений в raw_data близко к 0.
▫️Столбец около 5 показывает, сколько значений в raw_data близко к 5.
📕Красная пунктирная линия обозначает среднее значение исходных данных.
📉 Второй график (стандартизированные данные — transformed_data):
▫️Столбец около -1 показывает, сколько значений в transformed_data имеют Z-score около -1.
▫️Столбец около 0 показывает, сколько значений в transformed_data близко к среднему значению (0).
▫️Столбец около 1 показывает, сколько значений в transformed_data имеют Z-score около 1.
📙 Оранжевые штриховые линии обозначают ±1 стандартное отклонение от среднего значения.
📊 Эти гистограммы идеально показывают распределение значений в наших массивах данных. Каждый столбик показывает количество значений, которые попадают в определенный диапазон.
📈 Первый график (исходные данные — raw_data)
▫️Столбец около 0 показывает, сколько значений в raw_data близко к 0.
▫️Столбец около 5 показывает, сколько значений в raw_data близко к 5.
📕Красная пунктирная линия обозначает среднее значение исходных данных.
📉 Второй график (стандартизированные данные — transformed_data):
▫️Столбец около -1 показывает, сколько значений в transformed_data имеют Z-score около -1.
▫️Столбец около 0 показывает, сколько значений в transformed_data близко к среднему значению (0).
▫️Столбец около 1 показывает, сколько значений в transformed_data имеют Z-score около 1.
📙 Оранжевые штриховые линии обозначают ±1 стандартное отклонение от среднего значения.
❤🔥2🤓2👨💻2👀2👍1
Среднее значение (μ) — это 'главное' значение распределения данных (Это наша красная пунктирная линия).
⚙️ Для стандартизированных данных среднее значение всегда равно 0, так как Z-score преобразование приводит данные к нулевому среднему значению.
⚙️ Для стандартизированных данных среднее значение всегда равно 0, так как Z-score преобразование приводит данные к нулевому среднему значению.
📈 Центр гистограммы: ⬇️
⚙️ Среднее значение указывает на центр гистограммы. Если данные симметричны, то большинство значений будут расположены вокруг среднего значения.
📉 Расположение бинов: ⬇️
⚙️ Бины на гистограмме будут расположены относительно среднего значения. Например, у нас есть бин от -1 до 0, он будет находиться слева от среднего значения (0), а бин от 0 до 1 будет находиться справа от среднего значения.
❤1🥰1🤓1
🧑💻 Друзья, привет! Если вы думали, что постов сегодня не будет, то зря, сегодня я вашу голову еще подзаебу!
В прошлом посте, дада, тот, что сверху, мы говорили про Среднее значение и где оно на вот этих гистограммах.
⚙️ Теперь, стандартное отклонение (σ) — это мера рассеяния данных. Оно показывает, насколько сильно значения отличаются от среднего значения.
⚙️ Для стандартизированных данных стандартное отклонение всегда равно 1.
🔗 Стандартное отклонение определяет ширину гистограммы. ‼️Чем больше стандартное отклонение, тем шире будет гистограмма, так как значения будут более рассеяны.
Бины (столбцы на гистограмме, показывающие сколько значений попадает в соответствующий интервал) на гистограмме будут расположены относительно стандартного отклонения. Например, бин от -1 до 0 будет содержать значения, которые находятся в пределах одного стандартного отклонения от среднего значения.
В прошлом посте, дада, тот, что сверху, мы говорили про Среднее значение и где оно на вот этих гистограммах.
⚙️ Теперь, стандартное отклонение (σ) — это мера рассеяния данных. Оно показывает, насколько сильно значения отличаются от среднего значения.
⚙️ Для стандартизированных данных стандартное отклонение всегда равно 1.
🔗 Стандартное отклонение определяет ширину гистограммы. ‼️Чем больше стандартное отклонение, тем шире будет гистограмма, так как значения будут более рассеяны.
Бины (столбцы на гистограмме, показывающие сколько значений попадает в соответствующий интервал) на гистограмме будут расположены относительно стандартного отклонения. Например, бин от -1 до 0 будет содержать значения, которые находятся в пределах одного стандартного отклонения от среднего значения.
❤3🤯3🤓3
🟰 П О Д В Е Д Е М И Т О Г И 🟰
Зачем мы это все делали? Вопрос хороший, го попробуем на него ответить:
📊 Разбирали мы Z-score нормализацию, суть была в том, чтобы преобразовать данные таким образом, чтобы они имели среднее значение 0 и стандартное отклонение 1
⚙️ Какие же цели мы преследовали?
‼️ Во первых, это приведение к единому масштабу. Разные признаки могут иметь разные единицы измерения и диапазоны значений. Z-score стандартизация, в свою очередь, приводит все признаки к одному масштабу, что позволяет сравнивать их на равных условиях.
🔗 Во вторых, это улучшение работы алгоритмов машинного обучения, потому что некоторые алгоритмы работают лучше, когда данные находятся в одном масштабе.
🔗 Ну, и в третьих, мы вот запрогали гистограмму и поняли где у нас выбросы. Да даже на обычной линейной регрессии можно явно увидеть выбросы данных.
Зачем мы это все делали? Вопрос хороший, го попробуем на него ответить:
📊 Разбирали мы Z-score нормализацию, суть была в том, чтобы преобразовать данные таким образом, чтобы они имели среднее значение 0 и стандартное отклонение 1
⚙️ Какие же цели мы преследовали?
‼️ Во первых, это приведение к единому масштабу. Разные признаки могут иметь разные единицы измерения и диапазоны значений. Z-score стандартизация, в свою очередь, приводит все признаки к одному масштабу, что позволяет сравнивать их на равных условиях.
🔗 Во вторых, это улучшение работы алгоритмов машинного обучения, потому что некоторые алгоритмы работают лучше, когда данные находятся в одном масштабе.
🔗 Ну, и в третьих, мы вот запрогали гистограмму и поняли где у нас выбросы. Да даже на обычной линейной регрессии можно явно увидеть выбросы данных.
❤🔥3👨💻3👍2🤯2🤓2
🧑💻 Бро, привет! ⁉️ Кто я такой? Я — такой же обычный человек, как и ты. Из базовых знаний у меня только Русский язык, но этого будет достаточно). Я люблю учиться, поэтому буду рад с тобой поделиться своими знаниями.
🔗 Этот канал — это, по сути, мои 'улучшенные' заметки. Тут я объясняю материал также, как я объясняю его себе — без лишних заморочек, просто и понятно.
⚙️ Даже если ты вообще ничего не понимаешь в теме, у меня есть удобная навигация, чтобы ты мог быстро найти нужное и разобраться с любым вопросом. Так что давай, бро, пора сворачивать горы!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🥰2🤓2👨💻2❤1 1 1 1
⚙️ Как я уже сказал, этот канал — это мои заметки на стероидах. Я буквально разжевываю все темы, которые сам изучаю и выкладываю здесь, ровно поэтому у тебя не составит труда это понять.
⚙️ Этот канал абсолютно для всех. Тут уже собрана внушительная база по решениям заданий со Stepik'a, общая база по Python, огромные разборы тем по алгоритмам, даже есть разборы задач на C. Короче говоря, соскучиться тебе здесь не дам!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥2❤2
📁 Проекты
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1🤯1 1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1🤯1🤓1👨💻1
🔬 Вот так выглядит формула для метода min-max normalization (каждый нормализированный элемент признака будет вычисляться по этой формуле)
▫️X — исходное значение признака.
▫️ X min — минимальное значение признака в выборке.
▫️X max — максимальное значение признака в выборке.
▫️X norm— нормализованное значение признака.
▫️X — исходное значение признака.
▫️ X min — минимальное значение признака в выборке.
▫️X max — максимальное значение признака в выборке.
▫️X norm— нормализованное значение признака.
Формула предполагает собой, что мы будем нормализовать данные в диапазон [0,1].
2❤🔥3👍3🥰2🤯1
Всем даров, начнем воркать и разберем такой код
⚙️ Разберем такой код:
🔗 Для начала, импортируем привычные нам библиотеки а также модуль MinMaxScaler()
⚙️ По итогу, мы применяем MinMaxScaler нормализацию и обучаем модель на этих данных.
⚙️ Вывод:
⚙️ Разберем такой код:
from sklearn.preprocessing import MinMaxScaler
import numpy as np
🔗 Для начала, импортируем привычные нам библиотеки а также модуль MinMaxScaler()
raw_data = np.array([1., 3., 2., 4., 2., 10., 2., 5., 2., 2., 1., 7., 5., 2., 5., 16., 10., 3., 24.], dtype=np.float32) #датасет привычный
print('Сырой датасет: %s' % raw_data[:8])
transformed_data = MinMaxScaler().fit_transform(raw_data.reshape(-1, 1)).reshape(-1) # Обучаем модель + нормализуем данные
print('MIN-MAX scale датасет: %s' % transformed_data[:8])
⚙️ По итогу, мы применяем MinMaxScaler нормализацию и обучаем модель на этих данных.
⚙️ Вывод:
Сырой датасет: [ 1. 3. 2. 4. 2. 10. 2. 5.]
MIN-MAX scale датасет: [0. 0.08695652 0.04347826 0.13043478 0.04347826 0.39130437
0.04347826 0.17391305]
👍2🤯1🤓1👨💻1