DataFrog: Data Science
1.87K subscribers
306 photos
5 videos
60 links
Журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks | AI

@viktorreh
Download Telegram
Подготовили ML-словарик

Читайте и сохраняйте, что-то из этого наверняка вам пригодится на собеседованиях 👀

👉 DataFrog | #datascience #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Классика жанра по оценке ML-моделей

Нашел отличный материал для закрепления основ — статья «Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning»

Это, по сути, готовый учебник на 49 страницах, где разжеваны все ключевые моменты корректной работы с моделями:
- Как правильно оценивать качество модели.
- Как избежать утечки данных (data leakage) — главной причины неработающих моделей на проде.
- Как честно сравнивать между собой разные алгоритмы.


Если чувствуете, что в фундаментальных знаниях есть пробелы, или нужно объяснить коллегам "как правильно" — эта статья идеальный вариант. Читается довольно быстро и расставляет все по полочкам.

👉 DataFrog | #datascience #machinelearning
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Тем временем в Сан-Франциско прямо сейчас проходит OpenAI DevDay. Вот что уже показали:

➡️ Realtime api с минимальной задержкой. Это возможность встроить в свое приложение настоящий speech-to-speech. Будет доступно по цене базовой модели.

➡️ Vision файнтюнинг. Теперь можно тюнить свои модели с использованием изображений.

➡️ Завозят набор инструментов для кастомных дистилляций и ускорения моделей.

➡️ Finally: кэширование промптов, которое уже давно появилось у DeepSeek и Anthropic. На кэшированные промпты цена будет в половину меньше.

➡️ Интрумент для оценки моделей: можно будет нормально эвалить свои приложения.

👉 DataFrog | #datascience
Please open Telegram to view this post
VIEW IN TELEGRAM
🚨 Откликаешься на всё подряд, но собесов нет?

Третий месяц рассылаешь резюме на ML/DS вакансии. На hh, на Хабре, везде. В ответ тишина, даже до собеседования не доходишь. А на редкие, которые всё-таки случаются, приходишь и валишься на технике.
Знакомо?

Я Богдан, ML-инженер с 6+ годами опыта. Веду канал «Раскатываем ML кабины». Честно разбираю собесы, рынок и реальные кейсы учеников.

Например, недавно расписал кейс аналитика. 4 года в данных, зарабатывал 200к, хотел вырасти. За 7 месяцев перекатился в ML. Финал: 8 офферов от 350к, выбрал лучший на 500к на руки в крупной российской компании. Полный разбор подготовки и переговоров в канале.

А ещё у нас крутая пиратская тематика 🏴‍☠️

😐 Подписывайся 😐
Please open Telegram to view this post
VIEW IN TELEGRAM
2
❗️ Финансовая модель нестабильна? Возможно, проблема в признаках

Модель обучается, но результаты нестабильны? Метрики скачут, признаки мешают друг другу, а причина неочевидна. Часто проблема скрыта в данных: корреляция и мультиколлинеарность искажают результат.

🦾 На открытом уроке разберём, как выявлять зависимые признаки и работать с размерностью данных. Покажем, как применять метод анализа главных компонент (PCA) для выделения действительно значимой информации.

Вы увидите, как упрощать пространство признаков, повышать устойчивость моделей и улучшать качество прогнозирования, особенно в задачах временных рядов. Это важный этап, без которого сложно перейти от экспериментов к стабильным решениям.

➡️ Встречаемся 18 мая в 20:00 МСК в преддверии старта курса «Машинное обучение для финансового анализа». Принять участие: https://vk.cc/cXT8HK

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Please open Telegram to view this post
VIEW IN TELEGRAM
На Stepik вышел курс«RAG-системы на векторных базах данных».

RAG нельзя оценивать по ощущению: «вроде отвечает нормально».

Нужны тестовые вопросы, метрики retrieval, контроль порога «не знаю» и понимание, где система теряет релевантные документы.

В курсе разбираем:

- Qdrant, Weaviate, FAISS
- эмбеддинги и чанкинг
- HNSW, IVF-PQ и индексы для скорости/памяти
- hybrid search: ANN + BM25
- Recall@K, Precision@K, nDCG, MRR
- порог для отсечения нерелевантных ответов
- мониторинг качества и CI/CD для RAG

Внутри — практика с рецензированием и реальные боевые задачи: собрать RAG-пайплайн, настроить retrieval, подобрать метрики и понять, почему система теряет релевантные документы.

Курс для тех, кто хочет выкатывать AI-поиск не вслепую, а через измеримые критерии качества.

Скидка 25% действует 72 часа.

Открыть курс
Хотите разобраться, как обучать интеллектуальных
агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning».

🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!

Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения».
7 июля в 20:00 мск

Программа вебинара:

1. Краткое введение в обучение с подкреплением.
2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python.
3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента.

Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока».
15 июля в 20:00 мск

Программа вебинара:
1. Разберем, как DQN работает с изображениями:
как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана.
2. Изучим архитектуру DeepMind-подхода.
3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека.

Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека».
21 июля в 20:00 мск

Программа вебинара:

1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия.
2. Изучим ключевые механизмы DQN.
3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения.

Записывайтесь https://clck.su/xYlCF

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Pandas Workout: 200
exercises to make you
a stronger data analyst


Автор: Lerner Reuven
Год издания: 2024

#ds #en

Скачать книгу
Роадмап по математике для начинающих ML специалистов

Все, кто начинает путь в машинном обучении, сталкиваются с вопросом: «Какую математику нужно знать и в каком порядке?». Огромный объем информации пугает.

Автор блога The Palindrome предлагает четкий и структурированный путь, который разбивает на части эту большую задачу.

Что конкретно в ней освещается:

1. Линейная алгебра (Linear Algebra) — язык данных
Данные в ML — это векторы и матрицы. Линейная алгебра — инструмент для работы с ними.

2. Математический анализ (Calculus) — основа оптимизации
ML — это поиск оптимальных параметров модели. Анализ дает инструменты для этого поиска.

3. Многомерный анализ (Multivariable Calculus) — двигатель градиентного спуска
Реальные модели имеют тысячи параметров. Нужно уметь оптимизировать в многомерных пространствах.

4. Теория вероятностей (Probability Theory) — работа с неопределенностью
Мир данных не детерминирован. Вероятность дает язык для описания неопределенности и построения моделей, которые работают с шумом.


Главная идея роадмапа: не зубрежка, а понимание связей 🔆

Оригинал статьи с более глубоким погружением: The Roadmap of Mathematics for Machine Learning

👉 DataFrog | #datascience #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🥰1
✔️ В Roblox можно будет собрать игру по текстовому описанию

Игровая платформа анонсировала функцию Build, которая превращает простой запрос в готовую базу игры.

Под капотом целый набор ИИ-моделей, открытых и собственных - они отвечают за игровые механики, окружение, персонажей, визуальный стиль и звук.

В геймдеве опасаются, что когда порог входа падает до текстового запроса, платформу зальёт поток AI-слопа, а авторам придётся конкурировать с ИИ-контентом, который штампуется в разы быстрее ручной работы.

Общее настроение индустрии при этом тревожное - по свежему опросу конференции GDC, 52% профессионалов игровой отрасли считают, что генеративный ИИ вредит геймдеву.


Ответ Roblox - ранжирование по удержанию игроков, как и для обычных игр. То есть если в игру никто не играет, её никто и не найдёт.

Публичное альфа-тестирование Build стартует 28 июля в Новой Зеландии для пользователей от 9 лет с подтверждённым возрастом.

Публиковать свои творения на глобальную аудиторию смогут те, кому исполнилось 16. Будет бесплатная базовая версия и платные тарифы.

Roblox также готовит ИИ-агентов, которые помогут авторам с плейтестами и аналитикой, а ещё с ноября прошлого года обучает модель, генерирующую редактируемые 3D-сцены.

На этом фоне компания закрывает видеозвонки через аватаров Roblox Connect, запущенные в 2023 году.

Приоритеты, судя по всему, расставлены.


#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Вышла KIMI K3

Новая мощная китайская модель, которую очень хвалят. 2,8 трлн параметров. Хвалят до того, что называют ее третьей по уровню интеллекта моделью после Fable 5 и GPT-5.6.

Я решил проверить ее на создании WebGL-сайта выдуманной студии. Один промпт, 16 мин работы, ни единой правки.

Люблю тестить новые модельки на threejs проектах, новая KIMI молодец!

Тут тестим KIMI K3
А тут можно посмотреть сайт, который я с ней сделал поближе.
👍41
Как Netflix использует ИИ?

В квартальном отчёте перед инвесторами компания рассказала, что нейросети применялись в создании примерно 300 проектов этого года. Речь об использовании на любых стадиях производства: от концептов до постпродакшена. В отчёте выделили создание «сложных сцен» с помощью ИИ для:

🟣 индийского спортивного триллера «Слава»

🟣 американского исторического мини-сериала «Американский эксперимент»

🟣 бразильской футбольной драмы «Бразилия 70’: Третья звезда».

В них нейросети использовали для прорисовки толпы, исторических баталий и экспозиционных кадров. При этом глава Netflix Тед Сарандос отметил, что не собирается заменять нейросетями креативных экспертов.

А вы стали замечать больше следов нейросетей в сериалах и фильмах?
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥1
📉 На валидации 0.92. В проде 0.61.

Модель прекрасно работала в ноутбуке и развалилась, как только увидела настоящие данные. Утечка в признаках, дрейф, метрика, которая мерила не то.

Data Scientist: от данных до деплоя моделей — про весь путь после ноутбука.

⚙️ Данные и признаки: EDA, feature engineering, data leakage, стабильность признаков
📊 Обучение и оценка: baseline и gradient boosting, experiment tracking, error analysis, ложное улучшение качества
🚀 Прод: inference API, batch-инференс, quality gates, CI/CD, мониторинг data drift

▶️ 9 секций, 46 уроков. Первые уроки открыты — посмотреть можно бесплатно
🧩 Нужен Python и pandas; если просядете, тренажёры на платформе бесплатные

🏷 Внутри промокод ML_BOOKS — 30%, двое суток

Открыть первый урок
Компания Stripe купила OpenRouter за 7 миллиардов долларов

OpenRouter был основан в 2023 году. В мае они подняли Series B на $113 млн при оценке $1.3 млрд. И вот сейчас их покупают за 7. При этом финальная цена может еще измениться: WSJ ранее писал о переговорах на сумму около $10 млрд.

Забавно, что раньше основатель OpenRouter сам называл свой стартап «AI-эквивалентом Stripe».
DeepSeek выпустили свой харнесс, и теперь это самый быстрорастущий проект на GitHub

За пару дней репа собрала уже >140к звезд. Даже быстрее, чем OpenClaw в свое время.

https://github.com/deepseek-ai/deepseek-harness (DSH)

Харнесс – это слой, который превращает голую модель в агента, то есть определяет, как происходит работа с файлами, инструментами, памятью, циклом выполнения задач и тд. Грубо говоря, это все, кроме весов.

DSH основан на мета-фреймворке Cordis и подчиняется концепции «Everything is a plugin». То есть все в системе (модели, инструменты, скиллы, сессии, песочницы, файловая система, оркестрация, UI) реализовано как плагин, и все это можно смешивать, заменять и расширять.

Кроме CLI есть еще локальный веб-интерфейс, это приятно. Также агент может вызывать Claude Code или Codex как суб-агентов внутри своего воркфлоу.

Запускается в одну строку:

npx @deepseek-ai/dsh web
1