Библиотека собеса по Data Science | вопросы с собеседований
4.47K subscribers
533 photos
16 videos
1 file
660 links
Вопросы с собеседований по Data Science и ответы на них.

Учиться у нас: clc.to/GjjbkQ

По рекламе: @tproger_sales_bot

Учиться у нас: https://proglib.io/w/7dfb7235

Для обратной связи: @proglibrary_feeedback_bot
Download Telegram
Алгоритмы вроде YOLO часто выдают несколько bounding boxes вокруг одного и того же объекта с разной степенью уверенности. Для очистки используется Non-Maximum Suppression.
На основе какого показателя NMS решает, что две рамки относятся к одному объекту?
Anonymous Quiz
12%
На основе разницы в площади (Area difference) между рамками
78%
На основе метрики Intersection over Union (IoU)
4%
На основе среднего цвета пикселей внутри каждой рамки
6%
На основе евклидова расстояния между левыми верхними углами рамок
🔥1
Метрика MAPE (Mean Absolute Percentage Error) очень популярна в бизнесе, потому что выражается в процентах.
В каком случае использование MAPE даст крайне искаженный или математически неопределенный результат?
Anonymous Quiz
16%
Если в данных есть выраженная сезонность
11%
Если ряд имеет слишком длинный горизонт прогнозирования
5%
Если мы используем нейросети вместо классической статистики
69%
Если фактические значения в ряду близки к нулю или равны ему
Алгоритм замечает, что тебе нравятся видео про котиков, и начинает показывать только их. Через неделю ты больше не видишь ничего другого.
Какой метод используется в RecSys для борьбы с этой проблемой, чтобы «подмешивать» пользователю новый контент?
Anonymous Quiz
24%
Exploitation
69%
Exploration
3%
Ограничение времени сессии пользователя
4%
Удаление истории просмотров каждые 24 часа
В моделях отбора кандидатов часто используют структуру Two-Tower. Одна «башня» обрабатывает данные пользователя, другая — данные контента (фильма/товара).
Какая математическая операция чаще всего выполняется в самом конце над векторами этих двух башен?
Anonymous Quiz
8%
Сложение векторов
67%
Скалярное произведение или Косинусное сходство
3%
Возведение всех элементов в квадрат
22%
Конкатенация с последующим вычислением определителя матрицы
Основной принцип работы GNN — это итеративное обновление состояния узла на основе информации от его соседей.

Какая операция агрегации информации от соседних узлов является наиболее устойчивой к изменению порядка соседей?
Anonymous Quiz
11%
Конкатенация векторов соседей в одну длинную строку
26%
Использование RNN (например, LSTM) для последовательной обработки соседей
44%
Вычисление суммы, среднего или максимума векторов признаков соседей
19%
Перемножение матриц признаков соседей в порядке их индексации в базе данных
Многие компании переходят от обычного векторного поиска к GraphRAG.
В какой ситуации GraphRAG покажет значительно лучший результат, чем обычный поиск по сходству векторов (Top-K Retrieval)?
Anonymous Quiz
8%
Когда нужно найти конкретное определение термина в тексте
5%
Когда нужно быстро перевести документ с одного языка на другой
85%
Когда вопрос требует понимания многошаговых связей
1%
Когда объем данных не превышает 10 мегабайт
👍1
Вы строите модель предсказания оттока клиентов. Один из признаков — «Среднее количество звонков в поддержку за последние 3 месяца». В данных есть клиенты, которые ушли месяц назад.
Почему использование этого признака — это утечка данных (leakage)?
Anonymous Quiz
5%
Потому что звонки в поддержку никак не связаны с желанием клиента уйти
89%
Для ушедших клиентов «последние 3 месяца» включают период после того, как они уже решили уйти
6%
Потому что среднее значение всегда скрывает выбросы
1%
Этот признак нельзя использовать, так как он имеет тип Float, а не Integer
❤2
🏃‍♀️ Мы собрали бесплатный мега-гайд по ии-агентам 👇

Выкатили большую серию постов, которая ЛЕГКО ЗАМЕНИТ ПАРОЧКУ ПЛАТНЫХ КУРСОВ на рынке.

В первой части постов навалили жесткой базы, чтобы вправить мозги на место. Во второй дали конкретные инструменты, фреймворки и пошаговые инструкции, что нужно кодить прямо сейчас.

Часть 1. Введение, юзкейсы и реальность
Разбираемся с терминами, снимаем розовые очки и смотрим, где ИИ реально приносит бабки, а где только жжет нервы:

1. «Так что вообще считается AI-агентом?»
2. «Где тут бот, а где уже AI-агент?»
3. «Не надо пихать AI-агента в каждую задачу»
4. «Что уже можно спокойно делать через AI-агентов?»
5. «А что через AI-агентов пока лучше не трогать?»

Часть 2. Изнанка, ошибки и архитектура
Как всё это устроено под капотом, чтобы не слить бюджет и не наломать дров на старте:

6. «Можно ли просто сесть вечером и собрать себе AI-агента?»
7. «С чего вообще начать, если хочется попробовать AI-агентов»
8. «Почему AI-агент может внезапно начать творить дичь»
9. «Где AI-агенты реально экономят время, а где только добавляют возни»
10. «Почему они жрут столько денег?»

Часть 3. Хардкорная практика (Что делать руками)
Хватит теории. Открываем ноут, запускаем Cursor и делаем нормальные, отказоустойчивые системы:

11. «Почему одного промпта мало?»
12. «Почему AI-агенту мало просто “дать доступ к данным”»
13. «Если не следить за AI-агентом, он быстро начинает жить своей жизнью»
14. «Собрать демку легко. Но как же сделать нормально»
15. «Как сделать, чтобы это не развалилось через неделю?»

👍 Сохраняйте пост в избранное, чтобы не потерять.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1👏1
Библиотека собеса по Data Science | вопросы с собеседований pinned «🏃‍♀️ Мы собрали бесплатный мега-гайд по ии-агентам 👇 Выкатили большую серию постов, которая ЛЕГКО ЗАМЕНИТ ПАРОЧКУ ПЛАТНЫХ КУРСОВ на рынке. В первой части постов навалили жесткой базы, чтобы вправить мозги на место. Во второй дали конкретные инструменты,…»
🤖 Ваш ИИ-агент съедает бюджет на токены и падает при сбоях API?

Пора переходить на новый уровень. Открыли продажи курса по AgentOps — управлению ИИ-агентами в рабочих процессах.

Рынок требует инженеров, которые умеют:

• Контролировать метрики и качество ответов;
• Эффективно работать с RAG-архитектурой;
• Строить системы, готовые к реальным нагрузкам.

Обучение займет 6-12 недель под руководством практиков с опытом в AI и Data Science в крупных IT-компаниях, таких как Яндекс, Сбер, МТС, Huawei, Raft и др.

🎁 Можно подождать, пока про AgentOps начнут говорить все. Или зайти сейчас — НА 30% ДЕШЕВЛЕ!

Работа с AI начинается с систем.
Системы — с AgentOps.


🔥 Забрать скидку и изучить программу.
❤2
Модель предсказания спроса начала ошибаться. Распределение входных признаков сильно изменилось по сравнению с обучающей выборкой, хотя сама логика поведения людей осталась прежней. Как называется этот тип деградации модели и какое действие требуется?
Anonymous Quiz
6%
Concept Drift; требуется немедленное изменение архитектуры нейросети на более глубокую
8%
Overfitting; требуется увеличить коэффициент регуляризации (Dropout) в текущей модели
86%
Feature Drift; требуется переобучение модели на свежих данных или обновление предобработки
0%
Системный баг; требуется откат версии Python на сервере инференса
👍1