В оригинальной архитектуре ViT к последовательности патчей изображения добавляется специальный обучаемый вектор — [CLS] token.Какую именно роль он играет при классификации всей картинки, в отличие от векторов отдельных патчей?
Anonymous Quiz
15%
Он служит «якорем» для нормализации яркости всех остальных патчей перед подачей в механизм Attention
56%
При прохождении через трансформер он агрегирует информацию со всех патчей за счет Self-Attention
21%
Он используется для сегментации объектов: указывает, какой патч является фоном, а какой - объектом
8%
Он нужен для сохранения исходного разрешения, так как при разбиении на патчи часть пикселей теряется
❤1
Алгоритмы вроде YOLO часто выдают несколько bounding boxes вокруг одного и того же объекта с разной степенью уверенности. Для очистки используется Non-Maximum Suppression.
На основе какого показателя NMS решает, что две рамки относятся к одному объекту?
На основе какого показателя NMS решает, что две рамки относятся к одному объекту?
Anonymous Quiz
12%
На основе разницы в площади (Area difference) между рамками
78%
На основе метрики Intersection over Union (IoU)
4%
На основе среднего цвета пикселей внутри каждой рамки
6%
На основе евклидова расстояния между левыми верхними углами рамок
🔥1
Метрика MAPE (Mean Absolute Percentage Error) очень популярна в бизнесе, потому что выражается в процентах.
В каком случае использование MAPE даст крайне искаженный или математически неопределенный результат?
В каком случае использование MAPE даст крайне искаженный или математически неопределенный результат?
Anonymous Quiz
16%
Если в данных есть выраженная сезонность
11%
Если ряд имеет слишком длинный горизонт прогнозирования
5%
Если мы используем нейросети вместо классической статистики
69%
Если фактические значения в ряду близки к нулю или равны ему
Алгоритм замечает, что тебе нравятся видео про котиков, и начинает показывать только их. Через неделю ты больше не видишь ничего другого.
Какой метод используется в RecSys для борьбы с этой проблемой, чтобы «подмешивать» пользователю новый контент?
Какой метод используется в RecSys для борьбы с этой проблемой, чтобы «подмешивать» пользователю новый контент?
Anonymous Quiz
24%
Exploitation
69%
Exploration
3%
Ограничение времени сессии пользователя
4%
Удаление истории просмотров каждые 24 часа
В моделях отбора кандидатов часто используют структуру Two-Tower. Одна «башня» обрабатывает данные пользователя, другая — данные контента (фильма/товара).
Какая математическая операция чаще всего выполняется в самом конце над векторами этих двух башен?
Какая математическая операция чаще всего выполняется в самом конце над векторами этих двух башен?
Anonymous Quiz
8%
Сложение векторов
67%
Скалярное произведение или Косинусное сходство
3%
Возведение всех элементов в квадрат
22%
Конкатенация с последующим вычислением определителя матрицы
Основной принцип работы GNN — это итеративное обновление состояния узла на основе информации от его соседей.
Какая операция агрегации информации от соседних узлов является наиболее устойчивой к изменению порядка соседей?
Какая операция агрегации информации от соседних узлов является наиболее устойчивой к изменению порядка соседей?
Anonymous Quiz
11%
Конкатенация векторов соседей в одну длинную строку
26%
Использование RNN (например, LSTM) для последовательной обработки соседей
44%
Вычисление суммы, среднего или максимума векторов признаков соседей
19%
Перемножение матриц признаков соседей в порядке их индексации в базе данных
Многие компании переходят от обычного векторного поиска к GraphRAG.
В какой ситуации GraphRAG покажет значительно лучший результат, чем обычный поиск по сходству векторов (Top-K Retrieval)?
В какой ситуации GraphRAG покажет значительно лучший результат, чем обычный поиск по сходству векторов (Top-K Retrieval)?
Anonymous Quiz
8%
Когда нужно найти конкретное определение термина в тексте
5%
Когда нужно быстро перевести документ с одного языка на другой
85%
Когда вопрос требует понимания многошаговых связей
1%
Когда объем данных не превышает 10 мегабайт
👍1
Вы строите модель предсказания оттока клиентов. Один из признаков — «Среднее количество звонков в поддержку за последние 3 месяца». В данных есть клиенты, которые ушли месяц назад.
Почему использование этого признака — это утечка данных (leakage)?
Почему использование этого признака — это утечка данных (leakage)?
Anonymous Quiz
5%
Потому что звонки в поддержку никак не связаны с желанием клиента уйти
89%
Для ушедших клиентов «последние 3 месяца» включают период после того, как они уже решили уйти
6%
Потому что среднее значение всегда скрывает выбросы
1%
Этот признак нельзя использовать, так как он имеет тип Float, а не Integer
❤2
Метод Hyperband (или ASHA) часто используется для настройки нейросетей.
Какая ключевая идея позволяет Hyperband работать в разы быстрее, чем обычный перебор?
Какая ключевая идея позволяет Hyperband работать в разы быстрее, чем обычный перебор?
Anonymous Quiz
3%
Он использует квантовые вычисления для параллельного перебора весов
44%
Он запускает много конфигураций на малых ресурсах, убирает 50% худших и отдает ресурсы перспективным
4%
Он автоматически переписывает код модели на язык C++ для ускорения инференса
49%
Hyperband объединяет все гиперпараметры в один вектор и оптимизирует его градиентным спуском
👍4❤1
Выкатили большую серию постов, которая ЛЕГКО ЗАМЕНИТ ПАРОЧКУ ПЛАТНЫХ КУРСОВ на рынке.
В первой части постов навалили жесткой базы, чтобы вправить мозги на место. Во второй дали конкретные инструменты, фреймворки и пошаговые инструкции, что нужно кодить прямо сейчас.
Часть 1. Введение, юзкейсы и реальность
Разбираемся с терминами, снимаем розовые очки и смотрим, где ИИ реально приносит бабки, а где только жжет нервы:
1. «Так что вообще считается AI-агентом?»
2. «Где тут бот, а где уже AI-агент?»
3. «Не надо пихать AI-агента в каждую задачу»
4. «Что уже можно спокойно делать через AI-агентов?»
5. «А что через AI-агентов пока лучше не трогать?»
Часть 2. Изнанка, ошибки и архитектура
Как всё это устроено под капотом, чтобы не слить бюджет и не наломать дров на старте:
6. «Можно ли просто сесть вечером и собрать себе AI-агента?»
7. «С чего вообще начать, если хочется попробовать AI-агентов»
8. «Почему AI-агент может внезапно начать творить дичь»
9. «Где AI-агенты реально экономят время, а где только добавляют возни»
10. «Почему они жрут столько денег?»
Часть 3. Хардкорная практика (Что делать руками)
Хватит теории. Открываем ноут, запускаем Cursor и делаем нормальные, отказоустойчивые системы:
11. «Почему одного промпта мало?»
12. «Почему AI-агенту мало просто “дать доступ к данным”»
13. «Если не следить за AI-агентом, он быстро начинает жить своей жизнью»
14. «Собрать демку легко. Но как же сделать нормально»
15. «Как сделать, чтобы это не развалилось через неделю?»
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1👏1
Библиотека собеса по Data Science | вопросы с собеседований pinned «🏃♀️ Мы собрали бесплатный мега-гайд по ии-агентам 👇 Выкатили большую серию постов, которая ЛЕГКО ЗАМЕНИТ ПАРОЧКУ ПЛАТНЫХ КУРСОВ на рынке. В первой части постов навалили жесткой базы, чтобы вправить мозги на место. Во второй дали конкретные инструменты,…»
Метод SHAP основан на теории игр и вычисляет вклад каждого признака в итоговое предсказание.Что именно представляет собой «значение Шепли» (Shapley value) для конкретного признака в отдельном предсказании?
Anonymous Quiz
8%
Это коэффициент корреляции между признаком и целевой переменной во всем датасете
73%
Это средний вклад признака в изменение предсказания по сравнению со средним прогнозом по выборке
4%
Это производная функции потерь по данному признаку в точке предсказания
16%
Это вероятность того, что модель изменит свое решение, если данный признак будет удален из данных
🤖 Ваш ИИ-агент съедает бюджет на токены и падает при сбоях API?
Пора переходить на новый уровень. Открыли продажи курса по AgentOps — управлению ИИ-агентами в рабочих процессах.
Рынок требует инженеров, которые умеют:
• Контролировать метрики и качество ответов;
• Эффективно работать с RAG-архитектурой;
• Строить системы, готовые к реальным нагрузкам.
Обучение займет 6-12 недель под руководством практиков с опытом в AI и Data Science в крупных IT-компаниях, таких как Яндекс, Сбер, МТС, Huawei, Raft и др.
🎁 Можно подождать, пока про AgentOps начнут говорить все. Или зайти сейчас — НА 30% ДЕШЕВЛЕ!
🔥 Забрать скидку и изучить программу.
Пора переходить на новый уровень. Открыли продажи курса по AgentOps — управлению ИИ-агентами в рабочих процессах.
Рынок требует инженеров, которые умеют:
• Контролировать метрики и качество ответов;
• Эффективно работать с RAG-архитектурой;
• Строить системы, готовые к реальным нагрузкам.
Обучение займет 6-12 недель под руководством практиков с опытом в AI и Data Science в крупных IT-компаниях, таких как Яндекс, Сбер, МТС, Huawei, Raft и др.
🎁 Можно подождать, пока про AgentOps начнут говорить все. Или зайти сейчас — НА 30% ДЕШЕВЛЕ!
Работа с AI начинается с систем.
Системы — с AgentOps.
🔥 Забрать скидку и изучить программу.
❤2
LIME (Local Interpretable Model-agnostic Explanations)
LIME часто используется для объяснения «черных ящиков». Каким образом LIME строит объяснение для конкретного примера (строки данных)?
LIME часто используется для объяснения «черных ящиков». Каким образом LIME строит объяснение для конкретного примера (строки данных)?
Anonymous Quiz
5%
Он обучает вторую нейросеть-копию, которая работает прозрачнее
13%
Он визуализирует веса последнего слоя нейронной сети
7%
Он находит в обучающей выборке 5 самых похожих примеров и показывает их пользователю
75%
Он создает «возмущения» вокруг этого примера, смотрит, как меняются ответы и обучает простую модель
❤1
Вы используете стандартный feature_importance_ из Random Forest (на основе Gini impurity).
В чем заключается главная опасность доверия этому методу при наличии высококоррелированных признаков?
В чем заключается главная опасность доверия этому методу при наличии высококоррелированных признаков?
Anonymous Quiz
66%
Модель может завысить важность одного из коррелирующих признаков и занизить важность другого
3%
Общая важность признаков делает обучение модели в 2 раза медленнее
2%
Этот метод работает только для задач регрессии и бесполезен для классификации
29%
Gini impurity всегда отдает предпочтение признакам с малым количеством уникальных значений
PCA проецирует данные на новые оси (главные компоненты).
Каким критерием руководствуется PCA при выборе первой главной компоненты (PC1)?
Каким критерием руководствуется PCA при выборе первой главной компоненты (PC1)?
Anonymous Quiz
15%
Направление, вдоль которого данные имеют минимальное расстояние до начала координат
17%
Направление, которое максимально коррелирует с целевой переменной
65%
Направление, вдоль которого сохраняется максимальный разброс данных
3%
Направление, которое затем корректируется градиентным спуско
❤1
BERT — это «энкодер», а GPT — «декодер». Это определяет способ их обучения.
В чем заключается ключевое различие в механизме внимания (Attention) при обучении GPT по сравнению с BERT?
В чем заключается ключевое различие в механизме внимания (Attention) при обучении GPT по сравнению с BERT?
Anonymous Quiz
8%
GPT использует Sparse Attention, чтобы обрабатывать каждое второе слово, BERT смотрит на все слова
69%
В GPT есть causal masking — токен видит прошлые слова. BERT использует двунаправленное внимание.
11%
BERT обучается предсказывать следующее слово, а GPT маскирует случайные 15% слов в середине
12%
GPT требует наличия токенов позиционного кодирования, BERT позволяет обходиться без них
👍2❤1
При генерации текста (Inference) мы часто настраиваем параметр Temperature (T).
Как математически параметр T влияет на распределение вероятностей следующего токена и на итоговый результат?
Как математически параметр T влияет на распределение вероятностей следующего токена и на итоговый результат?
Anonymous Quiz
27%
Низкая температура «разглаживает» распределение, делая выбор разных слов более вероятным
63%
Низкая тем-ра делает распределение более «острым», увеличивая вероятность наиболее вероятных токенов
8%
Температура напрямую изменяет веса модели, заставляя нейроны срабатывать чаще при высоких значениях
2%
Параметр T определяет, сколько слоев нейросети будет задействовано в генерации предложения
❤2👍1
Модель предсказания спроса начала ошибаться. Распределение входных признаков сильно изменилось по сравнению с обучающей выборкой, хотя сама логика поведения людей осталась прежней. Как называется этот тип деградации модели и какое действие требуется?
Anonymous Quiz
6%
Concept Drift; требуется немедленное изменение архитектуры нейросети на более глубокую
8%
Overfitting; требуется увеличить коэффициент регуляризации (Dropout) в текущей модели
86%
Feature Drift; требуется переобучение модели на свежих данных или обновление предобработки
0%
Системный баг; требуется откат версии Python на сервере инференса
👍1
Git плохо справляется с хранением тяжелых датасетов в несколько терабайт. Инструменты вроде DVC решают эту проблему.
Каким образом DVC позволяет версионировать данные, сохраняя при этом легковесность Git-репозитория?
Каким образом DVC позволяет версионировать данные, сохраняя при этом легковесность Git-репозитория?
Anonymous Quiz
3%
DVC сжимает данные в формат .zip и заставляет Git игнорировать их размер
85%
DVC хранит данные во внешнем хранилище, а в Git фиксирует только маленькие метафайлы с хэш-суммами
10%
DVC преобразует весь датасет в набор SQL-запросов, которые Git хранит как обычный текст
2%
Он автоматически удаляет старые версии данных, оставляя только самую последнюю
❤2👍1
В крупных компаниях используют Feature Store (например, Feast или Hopsworks).
Какую главную проблему при переходе от обучения (Offline) к работе в реальном времени (Online) решает эта инфраструктура?
Какую главную проблему при переходе от обучения (Offline) к работе в реальном времени (Online) решает эта инфраструктура?
Anonymous Quiz
43%
Проблему несоответствия (Training-Serving Skew)
30%
Она автоматически ссоздает новые признаки на основе сырых данных с помощью генетических алгоритмов
11%
Она заменяет собой облачные GPU, позволяя проводить инференс на обычных базах данных
16%
Feature Store нужен для хранения документации по признакам
👍2❤1🤩1