DataFrog: Data Science
1.87K subscribers
306 photos
5 videos
60 links
Журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks | AI

@viktorreh
Download Telegram
Ученые представили EGGROLL (Evolution Guided General Optimization via Low-rank Learning) — новый алгоритм для обучения огромных нейросетей без обратного распространения ошибки. Метод использует хитрые математические приемы, чтобы сделать эволюционные стратегии быстрыми и экономичными даже для моделей с миллиардами параметров. EGGROLL не уступает по качеству существующим методам, но требует значительно меньше памяти и вычислений.

👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
2
This media is not supported in your browser
VIEW IN TELEGRAM
Не хотите подключать целый ML-трекер только чтобы давать экспериментам понятные имена вроде eternal-rabbit-123?

Для этой задачи есть минималистичная библиотека hruid. Она делает ровно одно — генерирует уникальные и читаемые идентификаторы по шаблону число-прилагательное-существительное-глагол-наречие.

import hruid

generator = hruid.Generator()
phrase = generator.random()
print(phrase)

11-suspicious-owls-consume-eagerly


Установка: pip install hruid
Репозиторий: https://github.com/nebbles/hruid-python

👉 DataFrog | #datascience #code
Please open Telegram to view this post
VIEW IN TELEGRAM
Перестаньте бояться алгоритмов! Они ваш друг, а не враг 🤝

Многие разработчики панически боятся алгоритмов на собеседованиях: «Я не олимпиадник!», «Зачем это, если есть Pandas?». Но спешу успокоить — алгосекция проверяет не знание экзотических структур данных, а нечто гораздо более важное.

Что на самом деле проверяют на собеседовании?

▪️ Умение мыслить структурно и декомпозировать задачу.
▪️Способность продумывать решение до написания кода.
▪️Внимательность к деталям и краевым случаям.

По сути, интервьюер хочет убедиться: с вами можно работать в команде, и вы не создадите тонну багов.

Почему алгоритмы — это прокачка навыков?
Представьте, что вы жмёте штангу в зале. Вы ведь не будете делать это в реальной жизни? Но это тренирует мышцы, которые пригодятся everywhere.

С алгоритмами та же история. Решая задачу о ступеньках, вы вряд ли будете применять это на практике. Но ваш мозг учится:
▪️Видеть закономерности
▪️Оптимизировать решения
▪️Предвидеть ошибки

Как правильно подходить к решению?


Плохо:
Сразу писать код, надеясь на авось.

Хорошо:
Читаешь задачу → пишешь тесты.
Проговариваешь решение → ловишь баги в голове.
Только потом кодишь.

И вот уже у тебя не просто решение, а решение, которое выглядит профессионально. Интервьюер думает: «ага, с этим чуваком можно работать».

Совет по подготовке:
▪️Сфокусируйтесь на LeetCode Easy/Medium
▪️Практикуйтесь мыслить вслух. Даже если ошибся — ничего страшного, это норм. Хуже молчать и сидеть с каменным лицом.
▪️Составьте шпаргалку с паттернами (two pointers, хеш-таблицы, динамическое программирование)


Вывод:

Алгоритмы — это не препятствие, а ваш союзник. Они качают навыки, которые делают вас сильнее как разработчика. На собеседовании важна не идеальность решения, а демонстрация системного подхода 😊

👉 DataFrog | #datascience #алгоритмы
Please open Telegram to view this post
VIEW IN TELEGRAM
Подготовили ML-словарик

Читайте и сохраняйте, что-то из этого наверняка вам пригодится на собеседованиях 👀

👉 DataFrog | #datascience #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Классика жанра по оценке ML-моделей

Нашел отличный материал для закрепления основ — статья «Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning»

Это, по сути, готовый учебник на 49 страницах, где разжеваны все ключевые моменты корректной работы с моделями:
- Как правильно оценивать качество модели.
- Как избежать утечки данных (data leakage) — главной причины неработающих моделей на проде.
- Как честно сравнивать между собой разные алгоритмы.


Если чувствуете, что в фундаментальных знаниях есть пробелы, или нужно объяснить коллегам "как правильно" — эта статья идеальный вариант. Читается довольно быстро и расставляет все по полочкам.

👉 DataFrog | #datascience #machinelearning
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Тем временем в Сан-Франциско прямо сейчас проходит OpenAI DevDay. Вот что уже показали:

➡️ Realtime api с минимальной задержкой. Это возможность встроить в свое приложение настоящий speech-to-speech. Будет доступно по цене базовой модели.

➡️ Vision файнтюнинг. Теперь можно тюнить свои модели с использованием изображений.

➡️ Завозят набор инструментов для кастомных дистилляций и ускорения моделей.

➡️ Finally: кэширование промптов, которое уже давно появилось у DeepSeek и Anthropic. На кэшированные промпты цена будет в половину меньше.

➡️ Интрумент для оценки моделей: можно будет нормально эвалить свои приложения.

👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
🚨 Откликаешься на всё подряд, но собесов нет?

Третий месяц рассылаешь резюме на ML/DS вакансии. На hh, на Хабре, везде. В ответ тишина, даже до собеседования не доходишь. А на редкие, которые всё-таки случаются, приходишь и валишься на технике.
Знакомо?

Я Богдан, ML-инженер с 6+ годами опыта. Веду канал «Раскатываем ML кабины». Честно разбираю собесы, рынок и реальные кейсы учеников.

Например, недавно расписал кейс аналитика. 4 года в данных, зарабатывал 200к, хотел вырасти. За 7 месяцев перекатился в ML. Финал: 8 офферов от 350к, выбрал лучший на 500к на руки в крупной российской компании. Полный разбор подготовки и переговоров в канале.

А ещё у нас крутая пиратская тематика 🏴‍☠️

😐 Подписывайся 😐
Please open Telegram to view this post
VIEW IN TELEGRAM
2
❗️ Финансовая модель нестабильна? Возможно, проблема в признаках

Модель обучается, но результаты нестабильны? Метрики скачут, признаки мешают друг другу, а причина неочевидна. Часто проблема скрыта в данных: корреляция и мультиколлинеарность искажают результат.

🦾 На открытом уроке разберём, как выявлять зависимые признаки и работать с размерностью данных. Покажем, как применять метод анализа главных компонент (PCA) для выделения действительно значимой информации.

Вы увидите, как упрощать пространство признаков, повышать устойчивость моделей и улучшать качество прогнозирования, особенно в задачах временных рядов. Это важный этап, без которого сложно перейти от экспериментов к стабильным решениям.

➡️ Встречаемся 18 мая в 20:00 МСК в преддверии старта курса «Машинное обучение для финансового анализа». Принять участие: https://vk.cc/cXT8HK

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Please open Telegram to view this post
VIEW IN TELEGRAM
На Stepik вышел курс«RAG-системы на векторных базах данных».

RAG нельзя оценивать по ощущению: «вроде отвечает нормально».

Нужны тестовые вопросы, метрики retrieval, контроль порога «не знаю» и понимание, где система теряет релевантные документы.

В курсе разбираем:

- Qdrant, Weaviate, FAISS
- эмбеддинги и чанкинг
- HNSW, IVF-PQ и индексы для скорости/памяти
- hybrid search: ANN + BM25
- Recall@K, Precision@K, nDCG, MRR
- порог для отсечения нерелевантных ответов
- мониторинг качества и CI/CD для RAG

Внутри — практика с рецензированием и реальные боевые задачи: собрать RAG-пайплайн, настроить retrieval, подобрать метрики и понять, почему система теряет релевантные документы.

Курс для тех, кто хочет выкатывать AI-поиск не вслепую, а через измеримые критерии качества.

Скидка 25% действует 72 часа.

Открыть курс
Хотите разобраться, как обучать интеллектуальных
агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning».

🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!

Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения».
7 июля в 20:00 мск

Программа вебинара:

1. Краткое введение в обучение с подкреплением.
2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python.
3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента.

Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока».
15 июля в 20:00 мск

Программа вебинара:
1. Разберем, как DQN работает с изображениями:
как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана.
2. Изучим архитектуру DeepMind-подхода.
3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека.

Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека».
21 июля в 20:00 мск

Программа вебинара:

1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия.
2. Изучим ключевые механизмы DQN.
3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения.

Записывайтесь https://clck.su/xYlCF

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Pandas Workout: 200
exercises to make you
a stronger data analyst


Автор: Lerner Reuven
Год издания: 2024

#ds #en

Скачать книгу