EasyData
1.35K subscribers
176 photos
12 videos
26 files
114 links
Добро пожаловать!
Меня зовут Мария Жарова, и это мой блог про науку о данных

Лайфхаки из будней MLщика, полезности по Data Science и ответы на вопросы, которые волнуют новичков и не только🌝

Автор @NaNCat
Download Telegram
Привет, друзья!
Ответы немного задержались в пробке, но доехали 💨

Если обобщить, то во всех кейсах проблема не только в модели, но и в данных, постановке задачи и в том, как именно мы оцениваем качество.

❤️ Кейс 1 (NLP, RAG)
Основная мысль: одного хорошего retrieval’а недостаточно.

Recall@10 говорит лишь о том, что нужный документ где-то попал в десятку - но это вовсе не значит, что:
• он оказался достаточно высоко в выдаче и не потерялся среди других кандидатов,
• в контексте не было лишнего шума, и LLM действительно опиралась именно на нужный фрагмент (может, ТОП-10 вообще слишком много),
• финальный ответ получился фактически корректным - ведь в условии есть только метрики retrieval, но ничего не сказано про качество генерации.

То есть оффлайн метрика поиска и качество ответа - это разные уровни пайплайна.

Как исправить: смотреть не только на retrieval, но и на качество финального ответа, уменьшать шум в контексте и проверять, насколько модель реально опирается на источники. В чувствительных задачах ещё помогают цитирование и факт-чекинг.


❤️ Кейс 2 (NLP, классификация)
Тут тоже проблема не в самом BERT, а в валидации - из-за этого метрики были слишком оптимистичными и не соответствовали реальности.

Если случайно делить форумные тексты на train/test, легко получить утечку по пользователям - их стилю, повторяющимся формулировкам, темам или даже похожим сообщениям. Тем более раз часть авторов очень активная.

В таком случае модель на оффлайне может запоминать не только задачу, но и особенности конкретных людей. А в проде она может столкнуться с более реалистичным распределением, и качество на новых пользователях просядет.

Как исправить: строить сплит так, как модель будет работать в реальности - например, делить по пользователям, тредам или времени. И проверять, нет ли скрытых утечек или пересечений между train и test.


❤️ Кейс 3 (CV, детекция)
Здесь правда могли сыграть роль данные и разметка + команда могла не заметить проблему из-за неподходящей метрики.

Высокий mAP не всегда означает, что модель хорошо решает бизнес-задачу:
• мелкие дефекты часто детектируются хуже и теряются в общей метрике + усреднённая оценка может скрывать провалы на отдельных типах дефектов
• не самая точная локализация всё ещё может считаться "достаточно хорошей" - особенно по mAP@0.5

И вообще в производстве пропуск дефекта часто гораздо критичнее лишнего срабатывания - поэтому пороги и IoU-метрики важно подобрать под бизнес-ограничения.

Как исправить: конечно, перепроверить датасет, отдельно смотреть качество на выборке с мелкими дефектами и проверять, соответствуют ли IoU и метрики реальной задаче. Если нужна более точная локализация, можно вообще попробовать решать как сегментацию.


❤️ Кейс 4 (CV, классификация)
А тут подвох действительно очень классический: если сначала сделать аугментации, а потом случайный split - то в итоге одна и та же исходная картинка (пусть даже в разных версиях) может оказаться и в train, и в test.

Это даёт очень красивые метрики в оффлайне, но по сути модель уже подглядела часть теста во время обучения.

Как исправить: важно сначала разделять данные на train/test, и только потом уже делать аугментации(!) И вообще полезно следить, чтобы разные версии одного и того же исходного изображения не попадали в обе выборки - в таких случаях можно группировать данные по объекту/сцене/источнику.


Легкой рабочей недели! 🌱

#dl@data_easy
#nlp@data_easy
#cv@data_easy
#карьера@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥103❤‍🔥2
Привет, друзья!
Давно хотелось обсудить что-то ближе к реальным продуктам - и вот наконец вместе с коллегами из Wildberries & Russ и Томского государственного университета собрали вебинар про рекомендательные системы в e-commerce💜 первый слайд презентации на картинке🙃

Встречаемся уже завтра, 30 апреля в 13:00 (мск).

План такой:
📱 обсудим, какие существуют типы рексистем и почему нет одной универсальной
📱 на простых примерах разберём основные подходы - что выбрать в зависимости от сценария и имеющихся данных
📱 посмотрим на типичные проблемы в рекомендациях и как с ними можно бороться на практике

В этот раз без кода - больше про логику и идеи, связь продукта и техники, как всё это реально применяется и с какими вызовами приходится сталкиваться 😎

Кстати, RWB и ТГУ запускают совместную онлайн-магистратуру по Data Science! Если задумываетесь про системное обучение с уклоном в практику - приёмная кампания на грядующий учебный год стартует 20 июня.

📱 Ссылка на регистрацию на вебинар: тык
📱 Подробнее про магистратуру RWB x ТГУ: тык
📱 UPD: запись будет в канале ТГУ


До скорых встреч! 🤗
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥10🔥742
Привет, друзья!
Неделя как никогда насыщенная😁 Совместно с МФТИ выпустили статью на Хабре "ТОП-7 графиков для вашей презентации" - про оригинальные и нестандартные визуализации, которые упрощают понимание (а не наоборот).

В ТОП-7 вошли следующие графики:
• Bubble chart
• Treemap
• Heatmap
• Sankey
• Sunburst
• Radar chart
• Choropleth


А что они из себя представляют - подробно рассказываем в статье! Всё легко строится в Plotly, полную версию кода можете взять в ноутбуке.

Главное в построении графиков - не переборщить🙃

👉 Полный разбор тут
Хороших выходных!🌼

#аналитика@data_easy
14🔥9❤‍🔥5🤩3👀1
Привет, друзья!
Коллеги из НИ ТГУ проводят день открытых дверей онлайн-магистратур по ИТ-направлениям. В том числе расскажут про направление «Науки о данных и ИИ», где я участвую как эксперт.

Если вам интересны Data Science/ML/AI и хотите посмотреть, как устроено обучение - обязательно заглядывайте😊
5👍2
🗣 Как поступить в онлайн-магистратуру в 2026 году?

Расскажем на Дне открытых дверей онлайн-магистратур ИДО ТГУ 👀

13 мая в 18:00 по московскому времени разберём:
🟦 как устроено обучение в онлайн-магистратуре;
🟦 чем магистратура отличается от курсов;
🟦 какие навыки нужны для поступления;
🟦 какие карьерные возможности открываются после выпуска;
🟦 как проходит приёмная кампания в 2026 году.


Отдельно расскажем о программах:
🔵 «Науки о данных и искусственный интеллект»
🔵 «Компьютерное зрение и искусственный интеллект»
🔵 «Искусственный интеллект и обработка естественного языка»


Также на встрече выступят руководители программ, и команда приёмной кампании ответит на вопросы о поступлении, сроках и формате обучения.

Если давно присматриваетесь к магистратуре, хотите сменить направление или разобраться, как войти в сферу искусственного интеллекта — приходите!

Регистрация по ссылке: https://clck.ru/3TbwDP
Please open Telegram to view this post
VIEW IN TELEGRAM
5🐳3🤝2
LLM Interview Questions.pdf
72 KB
И ещё накопилась очередная подборка вопросов к собеседованиям по NLP и отдельно по LLM 🦸‍♂️

👉 ТУТ 100 вопросов по самым разным темам, начиная с TF-IDF. Неплохой ресурс, чтобы освежить в памяти всё-всё с основ.

👉 А в PDF 50 вопросов уже чисто по LLM. Там повторяются базовые вещи про трансформеры, но гораздо больше прикладных тем: RAG, alignment, CoT, fine-tuning, типичные проблемы и прочее.

Больших успехов в больших моделях!🤗

#nlp@data_easy
#карьера@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥148🙏6
Привет, друзья!🤚
Последнее время снова активно заговорили про роль ИИ в разработке и "заменят ли нас модели". Решила покопаться в более-менее официальной статистике и исследованиях - и наткнулась на несколько очень любопытных вещей.

Если коротко: ИИ уже массово вошёл в разработку, но эффект оказался совсем не таким, как многие ожидали.

🙂 Код правда стали писать быстрее - а вот всё остальное стало "бутылочным горлышком"
В крупном метаисследовании от Т-банка (45 исследований + опросы инженеров из разных компаний) 58% разработчиков сказали, что регулярно используют ИИ для генерации кода и автодополнения.

Но дальше интересное: для code review ИИ используют только ~24% разработчиков, а для работы с legacy-кодом - вообще <20%. Видимо, чем больше нужно контекста, тем меньше доверия к модели.

При этом ощущение продуктивности реально есть: 64% разработчиков говорят, что стали работать быстрее - но вот скорость доставки фич до прода почти не изменилась😄 ИИ не только ускорил этап написания кода, но и ярко подсветил старые добрые проблемы с тестированием, ревью, интеграцией и инфраструктурой.

Так что получается забавный парадокс: кода стало производиться больше, а способность компаний безопасно проверять этот код почти не выросла. Именно поэтому сейчас так резко выросла ценность хорошей документации, понятных процессов и платформенной инженерии.
ИИ, похоже, не упрощает хаос: он либо усиливает зрелые процессы, либо делает незрелые ещё более шумными.

🙂 А что с рынком труда?
Тут тоже всё интереснее, чем заголовки в духе "программисты больше не нужны". Андрей Карпаты недавно сделал интерактивную визуализацию по 342 профессиям в США и оценил их "AI exposure" - насколько разные профессии подвержены влиянию ИИ.
Сразу спойлер: у разработчиков показатель высокий. Но вот что пишет об этом Карпаты:
Разработчики программного обеспечения получают 9/10 баллов, потому что ИИ трансформирует их работу, но спрос на программное обеспечение может легко вырасти по мере повышения производительности каждого разработчика. Оценка не учитывает эластичность спроса, скрытый спрос, нормативные барьеры или социальные предпочтения в отношении работников-людей. Многие профессии с высоким уровнем воздействия будут изменены, а не заменены.

Как видим по предыдущему исследованию, тенденция такая: меньше времени уходит на рутину, но больше на архитектуру, диагностику, валидацию, понимание продукта и работу с контекстом. Так что можно будет больше заняться творчеством, а скучное делегировать ИИ.

🙂 И самое неожиданное - экономика пока почти не видит эффекта от ИИ...
Есть большое исследование NBER, где опросили почти 6000 CEO и CFO из США, Великобритании, Германии и Австралии.
Выяснилось, что 70% компаний уже используют ИИ, но:
• 89% не видят заметного роста производительности,
• более 90% не заметили влияния на занятость.

При этом сами руководители уверены, что изменения всё же придут в ближайшие 3 года: ожидают роста производительности и сокращения части рутинных ролей, в первую очередь в поддержке, продажах и административных функциях (про программеров не вспомнили фух).

Так что, кажется, пока мы находимся в точке перестройки процессов. И главный навык для нас - не уметь кодить с ИИ, а уметь проверять, структурировать и эффективно поддерживать сложные системы, в которых он участвует.

🔗Ссылки на оригиналы:
AI4SDLC Research 2025
визуализация Карпаты по AI Exposure
исследование NBER про влияние ИИ на экономику

Хорошего завершения весны!🌸

#полезный_ии@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥137👍4🕊3
Привет, друзья!🤚
В прошлый раз говорили про то, как ИИ меняет саму разработку - а сегодня про то, чем эту разработку вооружать.
Держите подборку материалов для тех, кто строит агентов (или собирается) - от готовых наборов до фундаментальных гайдов 😌

👍 Everything Claude Code (ECC)
Огромный репозиторий всего и сразу для агентных сред от победителя хакатона Anthropic: готовые агенты, навыки, хуки, правила и конфиги, отточенные за 10+ месяцев ежедневного использования.
Внутри ~50 агентов, 185 навыков и куча совместимых заглушек команд. Работает не только с Claude Code, но и с Cursor, Codex, OpenCode и др. По сути - это готовая оболочка, которую можно ставить плагином и подключать только нужные куски. Сейчас у репозитория уже 210k🌟.
➡️ Ссылка: тык

👍 Awesome AI Agents 2026
А этот репозиторий - навигатор по экосистеме агентов: в readme собран список из 300+ инструментов, разбитых по 20+ категориям (coding-агенты, фреймворки, браузерные агенты, research, протоколы и т.д.), обновляется ежемесячно. Этот гайд - отличная отправная точка, чтобы понять, что вообще есть на рынке и не утонуть.
➡️ Ссылка: тык

👍 AI Agents for Beginners (Microsoft)
Фаворит для старта: здесь 12 уроков от Microsoft, которые по шагам проводят от "что такое агент" до рабочих примеров, включая Agentic RAG. Идеально, если хочется системный мини-курс с базой.
➡️ Ссылка: тык

👍 Гайды от Anthropic
Материалов у них ооочень много, вот несколько самых топовых по теме агентов:

➡️ Building Effective Agents - тот самый фундаментальный текст, на который все ссылаются (включая академические работы).
Ссылка: тык

➡️ Equipping agents with Agent Skills - про то, как оснащать агентов навыками через папки с инструкциями и скриптами. Anthropic представили Agent Skills в конце 2025 и открыли формат как общий стандарт в марте 2026 - так что концепция уже не экзотика.
Ссылка: тык

➡️ How we built our multi-agent research system - как у них устроен мультиагентный research-пайплайн. Забавный инсайт про то, что ведущий агент должен давать субагентам чёткие задачи с целью, форматом вывода и границами - иначе они дублируют работу или оставляют пробелы.
Ссылка: тык

P.S. Прошло больше недели с момента выхода Claude Opus 4.8 - первые отзывы в целом положительные...
Главный акцент Anthropic сделали на честности и надёжности: модель заметно чаще признаёт собственные ошибки, сама обращает внимание на проблемы во входных данных и лучше справляется с большими многошаговыми агентными задачами. Многие отмечают, что Claude стал больше похож на внимательного коллегу по ревью, чем на "генератор ответов".
Но есть и минусы: новый токенизатор расходует больше токенов на те же запросы, модель стала осторожнее и иногда отказывается выполнять вполне легитимные задачи:) А любителям вайб-кодинга может показаться менее удобной из-за более строгого отношения к расплывчатым инструкциям.
В целом сообщество сходится во мнении, что Opus 4.8 усилил сильные стороны Claude - код, математику и агентные сценарии, хотя местами пожертвовал удобством и креативностью.


Продуктивных агентов и рабочей недели! 🤖🌿

#полезный_ии@data_easy
#nlp@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
19❤‍🔥6👍4🔥4🙏2
Привет, друзья!
Лучше один раз увидеть, чем сто раз услышать... Некоторые вещи бывает сложно объяснить словами, а если к ним ещё добавить формул - иногда вообще становится страшно🙈
На этот случай держите подборку интерактивных эксплейнеров по самым актуальным темам - где-то это просто гифки, а где-то можно покрутить руками гиперпараметры и данные:

📉 Градиентный спуск
ТОП-1 штука, чтобы прочувствовать алгоритм. Можете покрутить шаг обучения, моментум, начальное приближение - и увидеть, как меняется ситуация: аккуратно сходится или лосс скачет. Там же краткое описание происходящего с формулами.
Ссылка: тык (на соседних страницах найдёте ещё несколько других алгоритмов оптимизации)

🌳 EDA, дерево решений, bias-variance tradeoff
От этих авторов есть два шедевра:
• История решения любимой задачи по предсказанию стоимости домов.
• Рассказ про bias-variance tradeoff.
Просто листайте страничку вниз и сами всё увидите. В настройках можно выбрать русский язык.
Ссылка: тык

🧠 Нейросети
Чтобы детально понять, что происходит внутри полносвязной сети:
• В TensorFlow Playground можно покрутить архитектуру сети, активации, данные - и увидеть, как в зависимости от настроек модель определяет границу между классами.
Ссылка: тык
Заметки от deeplearning.ai помогут разобраться с проблемами обучения - затухающие и взрывающиеся градиенты, плохая начальная инициализация, влияние функции активации...
Ссылка: тык

🤖 Трансформеры
Transformer Explainer гоняет GPT-2 у вас на глазах: просто введите любой текст, и "черный ящик" в реальном времени покажет, как модель предсказывает следующие токены.
Ссылка: тык
exBERT - похожая идея для моделей из Hugging Face, можно покопаться во внутренней логике механизма внимания.
Ссылка: тык
• А если вдруг захочется сделать такую визуализацию, как exBERT, самому - есть библиотека BertViz.
Ссылка: тык

Пусть сложное становится наглядным, а непонятное очевидным

#classic_ml@data_easy
#dl@data_easy
🔥2315👍3
Привет, друзья!
Сегодняшний рассказ про marimo - реактивный блокнот для Python, который многие уже называют заменой Jupyter 👀

🤔 Что это вообще такое?
Если коротко - как Jupyter, только лучше.
Помните, этот вечный ужас, когда прогнали ячейки не по порядку, а потом непонятно, в каком состоянии сейчас ноутбук?
Здесь такого точно не случится - и это главная фишка marimo, которую называют реактивность: когда вы меняете переменную в одной ячейке, он сам автоматически пересчитывает все остальные ячейки, которые от неё зависят.

🤔 Какие ещё плюсы?
Зацепило ещё несколько моментов:
• Ноутбук хранится как обычный .py файл, а не как огромный json - а значит, git наконец-то будет нормально показывать различия.
• Никакого скрытого состояния - удаляете ячейку, и marimo вычищает её переменные из памяти автоматически.
• Встроенные интерактивные элементы управления - ползунки, выпадающие списки, таблицы. Например, двигаете ползунок прямо в ноутбуке - и связанные с ним вычисления пересчитываются.
• Тот же ноутбук можно развернуть как полноценное веб-приложение или запустить как обычный скрипт из командной строки.
• Есть нативная поддержка SQL - можно гонять запросы прямо по датафреймам и csv (под капотом DuckDB).
• Отлично дружит с ИИ-агентами - можно подключиться в пару кликов.


🤔 Как поставить?
Если по-минимуму:
pip install marimo

А если хотите сразу со всеми наворотами (SQL-ячейки, ИИ-автодополнение, серверный рендеринг графиков), то:
pip install "marimo[recommended]"

Дальше можете запустить обучающий ноутбук-туториал:
marimo tutorial intro

Создать свой новый ноутбук:
marimo edit notebook.py

Превратить его в веб-приложение:
marimo run notebook.py

Ставить можно куда угодно - локально, на сервер, в любое окружение (отлично дружит с pip, uv, conda). А если совсем не хочется - есть molab, облачная версия в духе Google Colab, достаточно просто зарегистрироваться.

Кстати, переезжать со всем нажитым добром не придётся - старые Jupyter-ноутбуки конвертируются одной командой:
marimo convert your_notebook.ipynb > your_notebook.py


🤔 Но было замечено и несколько минусов:
• Та самая реактивность поначалу непривычна - нельзя дважды определить одну переменную в разных ячейках, и переменные не должны ссылаться на то, что ещё не определено. Это сделано специально, но в первое время немного ломает мозг после Jupyter.
• Горячие клавиши и автодополнение работают иначе - придётся переучиваться.
• На GitHub ноутбук показывается как обычный .py, а не как красивый рендер с графиками. Удобно для код-ревью, но если вы привыкли делиться готовым ноутбуком "с картинками" прямо в репозитории - имейте в виду.
• Если ячейки тяжёлые и считаются долго, та самая реактивность может стать врагом... Но на этот случай есть ленивый режим - в нем marimo не пересчитывает всё сразу, а просто помечает ячейки как устаревшие.


🤔 Полезные ссылки:
• официальная документация: тык
• проект на GitHub: тык
• облачный molab: тык

В общем, штука и правда отличная, но надо привыкнуть. Кто уже пробовал marimo - делитесь впечатлениями


#mlops@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤‍🔥65🙏4
Why_machines_learn.zip
48.2 MB
Привет, друзья!
Устали от стандартных учебников по ML? Материалов с каждым месяцем и правда становится всё больше - но среди них попадаются и оригинальные новинки! Держите две по-настоящему необычные книги "с изюминкой".

📘 Why Machines Learn?
Это не учебник в привычном смысле, а редкая смесь истории ML, математики и научпопа. Главы начинаются с живых историй про конкретных исследователей и читаются как увлекательная статья. Но математику автор при этом не прячет: тут есть честные выводы формул и геометрические соображения.
Зайдет и новичкам, и опытным. Кстати, сам Джеффри Хинтон назвал её шедевром - за то, что математика подаётся прямо в контексте живой истории.
➡️ Официальная версия на английском и неофициальный перевод на русский во вложениях.

🐰 Alice's Adventures in a Differentiable Wonderland
А это совсем другой жанр: книга рассказывает о нейросетях с нуля, причём повествуется как про путешествие Алисы по стране чудес - от самых основ (автоматическое дифференцирование, оптимизация) до современных архитектур: свёрточных, рекуррентных, attention-блоков.
Подача интуитивная и с юмором, но без потери глубины: теория честно стыкуется с кодом на PyTorch и JAX. Бонусом на официальном сайте автора можно посмотреть ещё и упражнения к теории.
➡️ Ссылки:
PDF с сайта автора
версия на arXiv (самая новая)
сайт с доп. главами и упражнениями

Порой свежий взгляд на привычное помогает наконец понять самую суть 🌿


#dl@data_easy
#classic_ml@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥23🔥6🤩6👌1👀1
Привет, друзья!
Представьте: у вас есть паркет на 10 гигов, и надо всего лишь посчитать по нему пару агрегаций... А что если можно не тащить его целиком в память и не городить пайплайны, а просто написать SQL прямо по файлу - без всякой базы и серверов? 🦆

Есть такой инструмент - DuckDB, и за последние пару лет он потихоньку прописался в арсенале у многих DS-команд.

🦆 Что это такое?
Если в двух словах - это "SQLite для аналитики". Появился он ещё в 2019 году (кстати, вырос из амстердамского института CWI - того самого, откуда родом Python), но по-настоящему зрелым стал не так давно. Технически это встраиваемая колоночная база данных, заточенная под аналитические запросы.
Что это значит на практике:
• Работает прямо внутри вашего Python-скрипта - никаких серверов, подключений и конфигов.
• Читает CSV, Parquet, JSON, а также pandas- и polars-датафреймы напрямую, без предварительной загрузки в базу.
• Это полноценный SQL - с оконными функциями, подзапросами, джойнами и всем, что вы любите.
• Многопоточность из коробки + отлично работает с данными, которые больше оперативной памяти!

По сути это способ писать SQL по чему угодно: по файлам, датафреймам, бакетам в облаке, без построения пайплайнов и поднятия инфраструктуры.


🦆 Почему он такой быстрый?
• Хранение колоночное: если вам нужны две колонки из тридцати, DuckDB прочитает с диска только их (это называют projection pushdown).
• Фильтр из WHERE он старается применить как можно раньше, ещё на этапе чтения (это predicate pushdown) - то есть лишние строки даже не поднимаются в память.
• Плюс векторизованное исполнение: данные обрабатываются не по одной строчке, а пачками - отсюда и скорость на больших файлах.

🦆 Установка и использование
Ставится одной строчкой, без серверов и докера:

pip install duckdb

Самый частый сценарий - SQL прямо по паркет-файлу, без загрузки куда-либо:

import duckdb

result = duckdb.sql("""
SELECT category,
AVG(price) AS avg_price,
COUNT(*) AS orders
FROM 'sales.parquet'
WHERE price > 100
GROUP BY category
ORDER BY orders DESC
""").df()

Обратите внимание: файл указан прямо в FROM, никакой предварительной загрузки в таблицу. В конце .df() возвращает результат обычным pandas-датафреймом.
Можно так же легко пройтись сразу по нескольким файлам по маске:

duckdb.sql("SELECT * FROM 'data/2024_*.parquet'").df()

И самая приятная часть - дружба с pandas:

import pandas as pd
import duckdb

df = pd.read_csv("orders.csv")

# обращаемся к df по имени переменной прямо в SQL
result = duckdb.sql("""
SELECT user_id, SUM(amount) AS total
FROM df
GROUP BY user_id
HAVING total > 1000
""").df()

DuckDB видит переменную df в вашем Python-коде и работает с ней как с таблицей, причём без лишнего копирования данных туда-сюда - обмен идёт напрямую.
А ещё можно смешивать источники в одном запросе: сджойнить pandas-датафрейм, паркет с диска и CSV из интернета в одном SELECT 😏

🦆 Что почитать:
• Официальная документация: тык
• Раздел Guides с готовыми рецептами кода: тык
• Блог с разборами внутренностей и бенчмарками: тык

Пусть ваши запросы летают, а память не кончается! 💨


#аналитика@data_easy
#classic_ml@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥228👍7🆒1
Привет, друзья!
Автор возвращается с каникул с полным мешком пирожков полезных материалов для подготовки к собесам😄 Осенний сезон найма на носу, так что держите свежую подборку ресурсов, которых ещё не было в канале👇

🙂 Interview Query
Это интерактивная платформа с вопросами из 9300+ компаний - преимущественно международных, но есть и кое-какие из РФ. Прикольная фишка: загружаете туда своё резюме, выбираете роль и желаемые компании - и платформа сама подсказывает, какие навыки у вас уже прокачаны, а что стоит подтянуть + составляет персональную подборку заданий (начало бесплатное, но за полную версию ожидаемо придется платить 🤭).
По классике здесь собраны задачи по теории и программированию + продуктовые и поведенческие кейсы. Также найдете много статей и обсуждений. Ещё удобно, что для задачек на код есть встроенный редактор со всеми подключенными БД.
🔗 ссылка

🙂 MLStack.Cafe
А это просто огромная база задач - больше 2000 вопросов с ответами по ML, DS, Python, NLP, DL, LLM, MLOps и даже отдельные разделы по AWS и промпт инжинирингу. Все разбито по темам и уровням сложности: джуновские вопросы доступны с ответами бесплатно, а вот для middle/senior/expert уровней можно просмотреть только сами вопросы - для ответов нужна платная подписка (ну, или сходить за помощью к любимому LLM-другу🙂).
🔗 ссылка

🙂 Machine Learning Interviews Book
Легендарная бесплатная книга от ex-NVIDIA / Snorkel AI. Внутри не только 200+ вопросов с уровнями сложности, но и разбор того, как вообще устроен ML-собес в топ-компаниях: какие бывают роли (research vs production, MLE vs DS), из каких этапов состоит процесс, на что реально смотрят интервьюеры, красные флаги, как читать оффер... - словом, концентрат опыта, который обычно получают за годы практики. И всё полностью бесплатно!
🔗 ссылка

🙂 Stanford CS 229 / 230 / 221
Тут шпаргалки к курсам Stanford - вся классика ML/DL/AI в сжатом виде на нескольких страницах:
• CS 229 - классический ML
• CS 230 - простой deep learning: CNN, RNN, LSTM, backprop
• CS 221 - AI в широком смысле: MDP, RL, байесовские сети
Плюс отдельные странички по статистике, теорверу и линалу - идеально, чтобы освежить матан за пару часов. И ещё из приятного - есть официальный русский перевод.
🔗 офиц. ссылка, странички с переводом

PS: похожие посты с подборками
https://t.me/data_easy/276
https://t.me/data_easy/304
https://t.me/data_easy/310

Продуктивной осени!!!💪


#карьера@data_easy
Please open Telegram to view this post
VIEW IN TELEGRAM
221👍8🤩6🔥52