Библиотека собеса по Data Science | вопросы с собеседований
4.33K subscribers
416 photos
10 videos
1 file
382 links
Вопросы с собеседований по Data Science и ответы на них.

По рекламе: @proglib_adv

Учиться у нас: https://proglib.io/w/7dfb7235

Для обратной связи: @proglibrary_feeedback_bot

Наши каналы: https://t.me/proglibrary/9197
Download Telegram
👍 Когда стоит использовать логарифмирование признаков перед обучением модели

Логарифмирование признаков полезно, когда значения признаков распределены неравномерно или имеют сильную положительную асимметрию — например, в задачах с финансовыми, кликовыми или биомедицинскими данными, где часто встречаются очень большие значения рядом с малыми.

Такое преобразование:

📌 Снижает влияние выбросов, «сжимая» масштаб больших значений;

📌 Помогает сделать распределение более похожим на нормальное, что улучшает работу моделей, чувствительных к распределению данных (например, линейная регрессия);

📌 Выравнивает важность признаков, особенно если признаки входят в модель в виде произведений или степеней.

Библиотека собеса по Data Science
Please open Telegram to view this post
VIEW IN TELEGRAM
👀 Почему one-hot encoding может быть неэффективен при большом количестве категорией

One-hot encoding создает по одному бинарному признаку на каждое уникальное значение категориальной переменной. Когда количество категорий очень велико (например, тысячи ID товаров или пользователей), возникают несколько проблем:

📍Взрыв размерности: матрица признаков становится разреженной и очень широкой, что увеличивает требования к памяти и может замедлить обучение.
📍Переобучение: модель может начать подгоняться под шум, если некоторые категории редко встречаются.
📍Потеря семантической связи: one-hot не учитывает близость между категориями — все они считаются равными и независимыми.

В таких случаях лучше использовать альтернативы:

📍Target encoding / mean encoding — замена категории на среднее значение целевой переменной для этой категории;
📍Embedding-слои — обучаемые векторные представления категорий, особенно популярны в нейросетях;
📍Frequency encoding — замена категории на частоту её появления.

Выбор метода зависит от модели и объема данных, но при большом количестве уникальных значений one-hot часто оказывается неоптимальным.

Библиотека собеса по Data Science
Please open Telegram to view this post
VIEW IN TELEGRAM
🔎 В чём разница между доверительным интервалом и байесовским (достоверным) интервалом

Доверительный интервал (confidence interval) — это концепция из частотной статистики, где параметр считается фиксированным, а вариативность связана с данными. Например, 95% доверительный интервал означает, что при многократном повторении эксперимента 95% таких интервалов будут содержать истинное значение. Однако нельзя сказать, что с 95% вероятностью параметр лежит в этом конкретном интервале.

Байесовский достоверный интервал (credible interval) исходит из идеи, что параметр — это случайная величина. После наблюдений мы имеем апостериорное распределение, и 95% интервал означает, что с 95% вероятностью параметр лежит в этом интервале.

Библиотека собеса по Data Science
Please open Telegram to view this post
VIEW IN TELEGRAM
😱 Завтра цена на курс «AI-агенты для DS» вырастет

Пока вы думаете — другие уже покупают. Что вы теряете, откладывая решение? Как минимум — 10 000 рублей, именно столько вы переплатите завтра. Как максимум — шанс войти в топ-1% дата-сайентистов, которые умеют строить AI-агенты.

🎓 Чему вы научитесь на курсе:
— адаптировать LLM под разные предметные области и данные
— собирать свою RAG-систему: от ретривера и реранкера до генератора и оценки качества
— строить AI-агентов с нуля — на основе сценариев, функций и взаимодействия с внешней средой

Решение за вами.

👉 Купить курс по старой цене
➡️ Как batch normalization и dropout связаны с предположением о независимых и одинаково распределённых (i.i.d.) данных

Batch normalization рассчитывает среднее и дисперсию по мини-батчу, предполагая, что данные в нём отражают общее распределение. Если данные в батче не являются i.i.d. (например, временные зависимости или перекос по классам), то оценки могут быть неточными.

Dropout случайно отключает нейроны, предполагая независимость примеров между собой. При сильной корреляции в данных dropout может всё ещё помогать как регуляризация, но эффективность зависит от характера зависимости между примерами.

Библиотека собеса по Data Science
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔 Как сбалансировать уровень детализации данных и приватность пользователя, если хочется отслеживать каждое действие на сайте

Сбор очень детальных данных (например, движений мыши или всех кликов) может дать точную картину вовлечённости, но это часто противоречит ожиданиям пользователей и законам.

Чтобы найти баланс, можно:
Использовать агрегированные или анонимизированные метрики — например, сохранять данные на уровне сессии без личных идентификаторов.
Получать явное согласие пользователей и чётко объяснять, какие данные собираются и зачем.
Применять методы дифференциальной приватности, чтобы нельзя было определить конкретного пользователя даже в больших массивах данных.

Важно помнить: слишком грубые метрики могут скрыть полезные детали, а избыточный сбор личной информации без чёткого плана её использования может обернуться юридическими или имиджевыми проблемами.

Библиотека собеса по Data Science
🖼 Какие методы помогают визуализировать компромисс между точностью (precision) и полнотой (recall)

Наиболее распространённый способ — Precision-Recall кривая. Она показывает, как меняются precision и recall при изменении порога классификации от 0 до 1.

📝 Если модель удерживает высокую точность при высокой полноте — это хороший признак.
📝 Если precision резко падает при увеличении recall, значит модель плохо справляется с определением положительных примеров при более мягких порогах.

Также можно использовать ROC-кривую (True Positive Rate против False Positive Rate), но при сильной дисбалансировке классов Precision-Recall кривая информативнее, особенно при анализе качества на миноритарном классе.

Библиотека собеса по Data Science
Please open Telegram to view this post
VIEW IN TELEGRAM