Науки о данных | МФТИ
337 subscribers
121 photos
1 video
120 links
Официальный канал онлайн-магистратуры «Науки о данных», МФТИ.

По всем вопросам: digital@mipt.ru
Download Telegram
📜 Что мы хотели бы знать до поступления в магистратуру МФТИ: советы от выпускников 

Если бы можно было отмотать время на два года назад, что бы вы посоветовали себе перед поступлением в онлайн-магистратуру? 🤔

С таким вопросом мы пришли к нашим выпускникам 2026 года. Ребята честно поделились своим опытом.

Узнайте из первых уст, как взять от учебы максимум, чего ждать от магистратуры и что оказалось неожиданным для студентов. Спойлер: придется попотеть.😓
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
😒 ❤️ Последняя неделя приема в онлайн-магистратуру МФТИ «Науки о данных»

До 15 августа (включительно) можно подать документы на программу набора 2026 года. Если вы давно присматривались к магистратуре, но откладывали подачу, время еще есть.

Для поступления нужно подготовить мотивационное письмо и сдать экзамен по математике и алгоритмам на Python. Для подготовки доступен специальный курс. 

Вступительное испытание можно пройти 15 или 18 августа. Ждать полной готовности к экзамену не нужно: заявление можно отправить уже сейчас, а оставшиеся дни посвятить подготовке.

На программе вы сможете выбрать один из трех профильных треков:
— Machine Learning;
— Data Engineering;
— Data Analysis.

Подробнее о программе: https://mipt.online/masters/data_science.

📥 Обратите внимание: подать документы можно до 15 августа, 23:59 (Мск), через портал Госуслуг: https://www.gosuslugi.ru/vuzonline.

👉 Инструкция по подаче документов: https://mipt.online/podacha-docs.

Если остались вопросы о программе или поступлении, оставьте заявку на консультацию на странице магистратуры — менеджер свяжется с вами и поможет разобраться.
Please open Telegram to view this post
VIEW IN TELEGRAM
🏁 Завтра пройдет последняя консультация по подготовке к вступительному экзамену

Дата: 13 августа (четверг)
Время: 18:00–20:50

Встреча пройдет в рамках подготовительного курса для абитуриентов онлайн-магистратуры «Науки о данных».

На консультации разберем демобилет 4 и порядок проведения вступительного испытания. Вы сможете решить задания самостоятельно, обсудить их с преподавателем и задать вопросы по подготовке к экзамену.

📍 На каждой консультации разбирают разные билеты.

Чтобы попасть на занятие, нужно заранее получить доступ к подготовительному курсу: оставить заявку на сайте магистратуры МФТИ и пройти консультацию с менеджером по поступлению.

Получить доступ: https://mipt.online/masters/data_science?utm_source=general&utm_source=tg&utm_medium=ds#rec2158440981

⏱️ Длительность встречи: 2 часа 50 минут. Рекомендуем подключиться заранее.
Please open Telegram to view this post
VIEW IN TELEGRAM
⏳ До конца приема документов — 2 дня

Подать документы в онлайн-магистратуры МФТИ можно только через Госуслуги gosuslugi.ru/vuzonline — до 23:59 (Мск) 15 августа. 

Вся официальная информация о правилах приема размещена на сайте приемной комиссии МФТИ: pk.mipt.ru/master.

Подробная инструкция по подаче и отслеживанию заявления: https://mipt.online/podacha-docs.

Вы можете оставить заявку на консультацию, и наш менеджер по поступлению проконсультирует вас: https://mipt.online/masters/data_science#rec2158440981 

😊До встречи в МФТИ! Если перед подачей документов остались вопросы — мы рядом и готовы помочь.
Please open Telegram to view this post
VIEW IN TELEGRAM
⏰ Сегодня последний день приема документов в онлайн-магистратуры МФТИ 

Подать заявление на программы набора 2026 года можно до 23:59 (Мск) 15 августа.

Если вы собирались поступать, но откладывали подачу документов, у вас еще есть несколько часов. Отправьте заявление через Госуслуги и сразу выберите дату вступительного испытания.

Экзамен по всем 3 программам можно сдать 18 августа.

📥 Подать заявление через Госуслуги: https://www.gosuslugi.ru/vuzonline.

Инструкция по подаче документов: https://mipt.online/podacha-docs.

🤗 Будем рады видеть вас в МФТИ — учиться, знакомиться, работать над проектами и проходить этот путь вместе!
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔 Задача: почему RAG может находить не то, что вы у него спрашиваете

VEDA — ИИ-платформа для школьников, где для ответов используют реальные учебники. Это важно: в школьной программе много точных фактов, а LLM может галлюцинировать.

На партнерском митапе МФТИ и РЭУ Пелагея Пашинская, ведущий ML-инженер и участница команды VEDA, рассказала, как команда дообучала энкодер для RAG.

😐 Качество поиска не устраивало команду, а реальных пользовательских запросов почти не было.

Если коротко, RAG сначала ищет подходящие фрагменты в базе знаний, а затем передает их LLM как контекст для ответа. Энкодер нужен, чтобы сопоставлять запросы и фрагменты текста при поиске.

Проблема: на запрос «Как человек влияет на растительный мир?» система возвращала чанки — фрагменты текста — про влияние леса на среду, среды обитания растений и лишайники. Темы рядом, но ответа на вопрос нет.

И это был не единичный случай. У модели, которая использовалась в продукте, Recall@1 был всего 36%: нужный фрагмент оказывался первым примерно в трети случаев. В 125 запросах из 500 релевантного чанка не было даже среди первых пяти.

Команда решила дорабатывать retrieval — этап, на котором RAG ищет нужные фрагменты. В VEDA использовали универсальную MiniLM, не адаптированную под школьные тексты и запросы. 

📚 Исходными данными стали 5500 чанков учебников. Для каждого через GPT-4o mini генерировали по 3–5 запросов «от лица школьника» и получили около 27,5 тыс. пар: запрос + правильный фрагмент. 

Для обучения добавили hard negatives — тексты, похожие на правильный ответ, но не отвечающие на запрос. Например, для вопроса «Как размножаются мхи?» правильный чанк описывал размножение мхов, а hard negative мог рассказывать о мхах в целом или о размножении папоротников.🌿

Не все примеры оказались одинаково полезными. Тексты, сгенерированные LLM, модель научилась отбрасывать слишком легко. Одна из гипотез команды — они могли заметно отличаться от реальных фрагментов учебников. А соседние чанки из того же параграфа оказались сложнее: тема близкая, но ответа на конкретный вопрос нет.

Отдельно команда сравнила модели еще без дообучения. Базовая BGE-M3 показала Recall@1 около 68% против 36% у MiniLM, которая использовалась в рабочей версии VEDA. 

После дообучения BGE-M3 на собранных данных показатель вырос до 76,1%. MRR — метрика, которая учитывает позицию первого релевантного фрагмента в выдаче, — вырос примерно с 0,78 до 0,85.

И на том же вопросе про влияние человека на растительный мир retrieval уже находил фрагменты про вырубку, земледелие, загрязнение, осушение и орошение земель.

В случае VEDA проблема была именно в retrieval: до LLM доходили фрагменты, близкие по теме, но не отвечающие на конкретный вопрос. После замены и дообучения энкодера качество поиска заметно выросло. 

А если вы только присматриваетесь к Data Science, в этом кейсе хорошо видно, с какой задачей может столкнуться ML-инженер: качество не устраивает, готовых данных почти нет — нужно собрать их, сравнить модели и проверить результат метриками.

Хотели бы еще разборы реальных ML-задач?

🔥 — да, особенно с метриками и ошибками
🤪 — да, только термины выдавайте порциями 
😂 — нет, мой Recall@1 на сегодня исчерпан
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7
🤩🚀 Новый учебный год в МФТИ начался

Студенты онлайн-магистратуры уже приступили к занятиям — начались пары, знакомства с преподавателями и первые учебные задачи. А мы будем в течение года показывать здесь, как проходит их обучение изнутри. 

Приемная кампания завершилась, следующий набор — весной 2027 🙂

Но если вы думаете о поступлении в следующем году, ждать весны не обязательно. Оставить заявку на консультацию можно в течение всего года — наша команда расскажет об обучении, поступлении и поможет разобраться, подходит ли вам магистратура: ☝ https://mipt.online/masters/data_science?utm_source=tg&utm_medium=ds#rec2158440981. 

Канал продолжит работать для вас. Здесь будем публиковать разборы по Data Science, ML и AI, рассказывать о карьерных траекториях в данных, преподавателях и экспертах программы, проектах студентов, хакатонах.

Так что не прощаемся — впереди много контента, который пригодится еще до поступления.

Кто остается с нами до следующей приемной — помашите нам 👋
Please open Telegram to view this post
VIEW IN TELEGRAM
🙏3
👥 Что отличает сильного кандидата в Data Science

На эфире МФТИ о карьере в Data Science Александр Толмачев, директор по машинному обучению и анализу данных в Ozon Банке, рассказал, что замечает как нанимающий менеджер:
Если вы эти пункты сделаете, я вам гарантирую, что в абсолютном большинстве собеседований вы будете очень значимо отличаться от 90% всех кандидатов


Собрали его рекомендации.

1. Проявлять инициативу

Не просто выполнить задачу, а самому погрузиться в тему, изучить новую информацию и принести предложение.

Нанимающий менеджер, когда слышит, что вы проявляете инициативу, такой: блин, классно. 9 из 10 не проявляют инициативу.


2. Уметь нормально доносить свою мысль

По словам Александра, софты становятся все важнее. Нужно «не лить воду, говорить аргументированно, говорить прозрачно, не быть токсичным», уметь договариваться и защищать свое решение.

Трансляция мысли между людьми становится очень важной.


3. Делать свои проекты и показывать их

Девятнадцать из двадцати кандидатов, которые приходят ко мне на собес, — у них резюме типовое. Работал там-то и так далее.


А у одного из двадцати уже в первых строках есть другое: «Смотри, ссылка, вот мой сайт, вот мой pet-проект, вот мой Git».
Такой кандидат сразу отличается: видно, что человек «не просто ищет работу, а кайфует от этого и хочет в этом развиваться».

4. Доводить проекты до рабочих прототипов

Особенно хорошо, если результат можно не только посмотреть в репозитории, но и запустить.
Проект может быть историей в духе «вот я на данных что-то изучил», а прототип — уже «готовая классная история, которую можно пощупать, потыкать».

5. Сделать ИИ-агентов своим рабочим инструментом

Александр советует воспринимать агентов как своих персональных ассистентов.
Это не для работы нужно, это нужно вам для жизни. 


Работа с моделями постепенно заставляет разбираться глубже: в лимитах, токенах, стоимости, выборе инструментов и в том, как собрать из них собственную систему.

6. Учиться управлять агентами и понимать архитектуру решения

Следующий уровень — уметь параллельно работать с несколькими агентами, контролировать результат и понимать, как связаны части системы.

Чем круче вы умеете управлять агентами, их развивать и контролировать, и оркестрировать, тем вы выгоднее будете отличаться от других кандидатов


🤔 А если коммерческого опыта пока нет

Сам Александр первую работу искал 6–7 месяцев.
Я просто ходил и откликался везде вообще. Главное — чтобы работать по специальности. Не важно где, но по специальности


Отказы давались тяжело: «Очень больно было, когда отказывают, прям до слез». Но после каждого собеседования он старался понять, что сделал неправильно, и использовал этот опыт, чтобы увеличить свои шансы на следующий офер.
В итоге первой работой стал небольшой региональный банк.

Мы все с вами думаем, что надо сначала попасть куда-то в крутую компанию. Ваша сейчас задача — попасть куда-нибудь, чтобы вы наработали этот опыт, прошли какие-то болячки свои, поняли, что вы не перегораете, улучшились.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2
Media is too big
VIEW IN TELEGRAM
💻«Мы учились удаленно — а эффект от Физтеха остался»

В этом году Максим Зимаков окончил онлайн-магистратуру МФТИ «Науки о данных». До этого он учился очно, поэтому онлайн был для него новым опытом: получится ли так же общаться с людьми, быть частью университетской жизни, чувствовать себя студентом Физтеха?

Через два года у Максима на этот вопрос уже есть ответ: 
— Оказалось — в принципе да.

Передаем слово Максиму.

— Сейчас мир очень динамичный, надо везде успевать: по работе, по делам, хоть какую-то личную жизнь иногда иметь. И поэтому онлайн в этом плане был упрощением: не надо ехать в определенное место, но обучение все равно остается качественным.

И самое интересное — можно приезжать в кампус, участвовать во всех активностях, приезжать на факультативы. Физтех ровно так же поддерживает и помогает, хоть ты и удаленщик. Не важно.

Мы все переписывались, друг другу помогали, друг друга поддерживали. И сейчас встречаемся, видим друг друга вживую — и это очень интересно.

Наверное, для меня самое ценное — вообще возможности, которые дает вуз. Я участвовал в конкурсе студенческих стартапов «Фонд содействия инновациям» — у Физтеха сразу для этого есть внутренний курс, где помогают понять, как подать документы, помогают с письмами. Все движухи Физтеха — это было. 

И нет такого ощущения, что раз ты на онлайн-программе, то руководству (*преподавательскому составу) все равно. Нет, им не все равно. Ты обращаешься — люди стараются помочь. Оказалось, что мой диплом есть кому показать. Просто из общения. Мне сказали: есть человек, которому можно его показать, может быть, получится дальше это продвинуть.

С дипломом у меня вообще был шикарный опыт. Я делал его реально год. С научным руководителем мы созванивались каждую неделю. Он меня направлял, а я шел дальше.

Даже на предзащите и защите все давали конкретную критику, причем обоснованную. Ты понимаешь свои слабые места и где тебе нужно усилиться. И от всех чувствуется не негатив, а то, что тебе хотят помочь. 

Этот опыт меня однозначно изменил. Я понял, что можно просто написать незнакомому преподавателю — и он тебе ответит, поможет. Можно приехать на Физтех — все доброжелательны, тебя еще встречают с улыбкой. Никакого негатива никогда не было. Чувствуется единство. 

И я, наверное, понял еще одну вещь: все двери можно открывать. Не надо сильно зажиматься. Больше коммуникации, больше общения с людьми — и люди тебе открываются тоже.
Please open Telegram to view this post
VIEW IN TELEGRAM
💯3🥰1
Задача: нужно улучшить рекомендательную систему на базе LLM. Что даст эффект — изменить размер модели или способ инициализации новых токенов? 

Александр Калистратов, выпускник Центра «Пуск» МФТИ, в выпускной работе исследовал рекомендательные системы на базе LLM.

Обычно товар в рекомендательной системе представлен своим ID. Александр действовал иначе: представил каждый товар как последовательность специальных токенов — семантический идентификатор. Если у товаров совпадает часть такой последовательности, они похожи по смыслу. Эти новые токены Александр добавил в словарь LLM. 

Эксперимент проводился на подмножестве Amazon Pet Supplies: 63 тыс. товаров и больше 100 тыс. историй покупок.

Модель проверяли на четырех задачах, и они делятся на два типа:
— семантические — сгенерировать текст по идентификатору и, наоборот, получить идентификатор по тексту;
— коллаборативные — предсказать сопутствующий товар и следующий товар в истории взаимодействий пользователя.

Как на качество влияет размер модели 

Сначала Александр сравнил четыре LLM семейства Qwen разного размера: 0,6 млрд, 1,7 млрд, 4,8 млрд и 8 млрд параметров. 

На семантических задачах более крупные модели лучше связывали идентификаторы с информацией о товаре: точнее генерировали идентификатор по тексту и текст по идентификатору. Основной прирост был при переходе от модели с 1,7 млрд параметров к модели с 4 млрд. Дальше разница между моделями сокращалась и уже не достигала статистической значимости. 
На коллаборативных задачах увеличение модели прироста не дало.

Как влияет способ инициализации новых токенов

Когда в словарь LLM добавляют новый токен, для него нужно задать эмбеддинг — вектор, с которым модель будет дальше работать. Александр проверил четыре способа задать начальные значения этих эмбеддингов.

Лучше всего сработал вариант, в котором использовали знания, уже заложенные в модели. Названия товаров разбивали на знакомые LLM токены и брали их эмбеддинги, чтобы на их основе инициализировать новые токены. По словам Александра, так они сразу оказывались «почти в правильном месте» в векторном пространстве. 

На семантических задачах этот способ показал значимо лучший результат. А вот на предсказание сопутствующего и следующего товара способ инициализации не влиял.
Собственный метод Александра — проекция кодовой книги — оказался худшим из четырех.

Что в итоге

Если нужно научить модель связывать новые идентификаторы с текстом, имеют значение и размер модели, и способ инициализации.

А в задачах на предсказание сопутствующего или следующего товара ни увеличение модели, ни способ инициализации прироста в этом эксперименте не дали.

Как говорит Александр, для одних рекомендательных задач есть смысл «запариваться с большим размером модели и всеми вытекающими», а для других — нет.


⏺Полную запись эфира смотрите по ссылке: https://vkvideo.ru/video-224205661_456239143
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1