DataFrog: Data Science
1.87K subscribers
306 photos
5 videos
60 links
Журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks | AI

@viktorreh
Download Telegram
Ученые представили EGGROLL (Evolution Guided General Optimization via Low-rank Learning) — новый алгоритм для обучения огромных нейросетей без обратного распространения ошибки. Метод использует хитрые математические приемы, чтобы сделать эволюционные стратегии быстрыми и экономичными даже для моделей с миллиардами параметров. EGGROLL не уступает по качеству существующим методам, но требует значительно меньше памяти и вычислений.

👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
2
This media is not supported in your browser
VIEW IN TELEGRAM
Не хотите подключать целый ML-трекер только чтобы давать экспериментам понятные имена вроде eternal-rabbit-123?

Для этой задачи есть минималистичная библиотека hruid. Она делает ровно одно — генерирует уникальные и читаемые идентификаторы по шаблону число-прилагательное-существительное-глагол-наречие.

import hruid

generator = hruid.Generator()
phrase = generator.random()
print(phrase)

11-suspicious-owls-consume-eagerly


Установка: pip install hruid
Репозиторий: https://github.com/nebbles/hruid-python

👉 DataFrog | #datascience #code
Please open Telegram to view this post
VIEW IN TELEGRAM
Перестаньте бояться алгоритмов! Они ваш друг, а не враг 🤝

Многие разработчики панически боятся алгоритмов на собеседованиях: «Я не олимпиадник!», «Зачем это, если есть Pandas?». Но спешу успокоить — алгосекция проверяет не знание экзотических структур данных, а нечто гораздо более важное.

Что на самом деле проверяют на собеседовании?

▪️ Умение мыслить структурно и декомпозировать задачу.
▪️Способность продумывать решение до написания кода.
▪️Внимательность к деталям и краевым случаям.

По сути, интервьюер хочет убедиться: с вами можно работать в команде, и вы не создадите тонну багов.

Почему алгоритмы — это прокачка навыков?
Представьте, что вы жмёте штангу в зале. Вы ведь не будете делать это в реальной жизни? Но это тренирует мышцы, которые пригодятся everywhere.

С алгоритмами та же история. Решая задачу о ступеньках, вы вряд ли будете применять это на практике. Но ваш мозг учится:
▪️Видеть закономерности
▪️Оптимизировать решения
▪️Предвидеть ошибки

Как правильно подходить к решению?


Плохо:
Сразу писать код, надеясь на авось.

Хорошо:
Читаешь задачу → пишешь тесты.
Проговариваешь решение → ловишь баги в голове.
Только потом кодишь.

И вот уже у тебя не просто решение, а решение, которое выглядит профессионально. Интервьюер думает: «ага, с этим чуваком можно работать».

Совет по подготовке:
▪️Сфокусируйтесь на LeetCode Easy/Medium
▪️Практикуйтесь мыслить вслух. Даже если ошибся — ничего страшного, это норм. Хуже молчать и сидеть с каменным лицом.
▪️Составьте шпаргалку с паттернами (two pointers, хеш-таблицы, динамическое программирование)


Вывод:

Алгоритмы — это не препятствие, а ваш союзник. Они качают навыки, которые делают вас сильнее как разработчика. На собеседовании важна не идеальность решения, а демонстрация системного подхода 😊

👉 DataFrog | #datascience #алгоритмы
Please open Telegram to view this post
VIEW IN TELEGRAM
Подготовили ML-словарик

Читайте и сохраняйте, что-то из этого наверняка вам пригодится на собеседованиях 👀

👉 DataFrog | #datascience #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Классика жанра по оценке ML-моделей

Нашел отличный материал для закрепления основ — статья «Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning»

Это, по сути, готовый учебник на 49 страницах, где разжеваны все ключевые моменты корректной работы с моделями:
- Как правильно оценивать качество модели.
- Как избежать утечки данных (data leakage) — главной причины неработающих моделей на проде.
- Как честно сравнивать между собой разные алгоритмы.


Если чувствуете, что в фундаментальных знаниях есть пробелы, или нужно объяснить коллегам "как правильно" — эта статья идеальный вариант. Читается довольно быстро и расставляет все по полочкам.

👉 DataFrog | #datascience #machinelearning
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Тем временем в Сан-Франциско прямо сейчас проходит OpenAI DevDay. Вот что уже показали:

➡️ Realtime api с минимальной задержкой. Это возможность встроить в свое приложение настоящий speech-to-speech. Будет доступно по цене базовой модели.

➡️ Vision файнтюнинг. Теперь можно тюнить свои модели с использованием изображений.

➡️ Завозят набор инструментов для кастомных дистилляций и ускорения моделей.

➡️ Finally: кэширование промптов, которое уже давно появилось у DeepSeek и Anthropic. На кэшированные промпты цена будет в половину меньше.

➡️ Интрумент для оценки моделей: можно будет нормально эвалить свои приложения.

👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
🚨 Откликаешься на всё подряд, но собесов нет?

Третий месяц рассылаешь резюме на ML/DS вакансии. На hh, на Хабре, везде. В ответ тишина, даже до собеседования не доходишь. А на редкие, которые всё-таки случаются, приходишь и валишься на технике.
Знакомо?

Я Богдан, ML-инженер с 6+ годами опыта. Веду канал «Раскатываем ML кабины». Честно разбираю собесы, рынок и реальные кейсы учеников.

Например, недавно расписал кейс аналитика. 4 года в данных, зарабатывал 200к, хотел вырасти. За 7 месяцев перекатился в ML. Финал: 8 офферов от 350к, выбрал лучший на 500к на руки в крупной российской компании. Полный разбор подготовки и переговоров в канале.

А ещё у нас крутая пиратская тематика 🏴‍☠️

😐 Подписывайся 😐
Please open Telegram to view this post
VIEW IN TELEGRAM
2
❗️ Финансовая модель нестабильна? Возможно, проблема в признаках

Модель обучается, но результаты нестабильны? Метрики скачут, признаки мешают друг другу, а причина неочевидна. Часто проблема скрыта в данных: корреляция и мультиколлинеарность искажают результат.

🦾 На открытом уроке разберём, как выявлять зависимые признаки и работать с размерностью данных. Покажем, как применять метод анализа главных компонент (PCA) для выделения действительно значимой информации.

Вы увидите, как упрощать пространство признаков, повышать устойчивость моделей и улучшать качество прогнозирования, особенно в задачах временных рядов. Это важный этап, без которого сложно перейти от экспериментов к стабильным решениям.

➡️ Встречаемся 18 мая в 20:00 МСК в преддверии старта курса «Машинное обучение для финансового анализа». Принять участие: https://vk.cc/cXT8HK

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Please open Telegram to view this post
VIEW IN TELEGRAM
На Stepik вышел курс«RAG-системы на векторных базах данных».

RAG нельзя оценивать по ощущению: «вроде отвечает нормально».

Нужны тестовые вопросы, метрики retrieval, контроль порога «не знаю» и понимание, где система теряет релевантные документы.

В курсе разбираем:

- Qdrant, Weaviate, FAISS
- эмбеддинги и чанкинг
- HNSW, IVF-PQ и индексы для скорости/памяти
- hybrid search: ANN + BM25
- Recall@K, Precision@K, nDCG, MRR
- порог для отсечения нерелевантных ответов
- мониторинг качества и CI/CD для RAG

Внутри — практика с рецензированием и реальные боевые задачи: собрать RAG-пайплайн, настроить retrieval, подобрать метрики и понять, почему система теряет релевантные документы.

Курс для тех, кто хочет выкатывать AI-поиск не вслепую, а через измеримые критерии качества.

Скидка 25% действует 72 часа.

Открыть курс
Хотите разобраться, как обучать интеллектуальных
агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning».

🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!

Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения».
7 июля в 20:00 мск

Программа вебинара:

1. Краткое введение в обучение с подкреплением.
2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python.
3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента.

Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока».
15 июля в 20:00 мск

Программа вебинара:
1. Разберем, как DQN работает с изображениями:
как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана.
2. Изучим архитектуру DeepMind-подхода.
3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека.

Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека».
21 июля в 20:00 мск

Программа вебинара:

1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия.
2. Изучим ключевые механизмы DQN.
3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения.

Записывайтесь https://clck.su/xYlCF

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Pandas Workout: 200
exercises to make you
a stronger data analyst


Автор: Lerner Reuven
Год издания: 2024

#ds #en

Скачать книгу
Роадмап по математике для начинающих ML специалистов

Все, кто начинает путь в машинном обучении, сталкиваются с вопросом: «Какую математику нужно знать и в каком порядке?». Огромный объем информации пугает.

Автор блога The Palindrome предлагает четкий и структурированный путь, который разбивает на части эту большую задачу.

Что конкретно в ней освещается:

1. Линейная алгебра (Linear Algebra) — язык данных
Данные в ML — это векторы и матрицы. Линейная алгебра — инструмент для работы с ними.

2. Математический анализ (Calculus) — основа оптимизации
ML — это поиск оптимальных параметров модели. Анализ дает инструменты для этого поиска.

3. Многомерный анализ (Multivariable Calculus) — двигатель градиентного спуска
Реальные модели имеют тысячи параметров. Нужно уметь оптимизировать в многомерных пространствах.

4. Теория вероятностей (Probability Theory) — работа с неопределенностью
Мир данных не детерминирован. Вероятность дает язык для описания неопределенности и построения моделей, которые работают с шумом.


Главная идея роадмапа: не зубрежка, а понимание связей 🔆

Оригинал статьи с более глубоким погружением: The Roadmap of Mathematics for Machine Learning

👉 DataFrog | #datascience #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🥰1
✔️ В Roblox можно будет собрать игру по текстовому описанию

Игровая платформа анонсировала функцию Build, которая превращает простой запрос в готовую базу игры.

Под капотом целый набор ИИ-моделей, открытых и собственных - они отвечают за игровые механики, окружение, персонажей, визуальный стиль и звук.

В геймдеве опасаются, что когда порог входа падает до текстового запроса, платформу зальёт поток AI-слопа, а авторам придётся конкурировать с ИИ-контентом, который штампуется в разы быстрее ручной работы.

Общее настроение индустрии при этом тревожное - по свежему опросу конференции GDC, 52% профессионалов игровой отрасли считают, что генеративный ИИ вредит геймдеву.


Ответ Roblox - ранжирование по удержанию игроков, как и для обычных игр. То есть если в игру никто не играет, её никто и не найдёт.

Публичное альфа-тестирование Build стартует 28 июля в Новой Зеландии для пользователей от 9 лет с подтверждённым возрастом.

Публиковать свои творения на глобальную аудиторию смогут те, кому исполнилось 16. Будет бесплатная базовая версия и платные тарифы.

Roblox также готовит ИИ-агентов, которые помогут авторам с плейтестами и аналитикой, а ещё с ноября прошлого года обучает модель, генерирующую редактируемые 3D-сцены.

На этом фоне компания закрывает видеозвонки через аватаров Roblox Connect, запущенные в 2023 году.

Приоритеты, судя по всему, расставлены.


#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1🔥1