Если бы можно было отмотать время на два года назад, что бы вы посоветовали себе перед поступлением в онлайн-магистратуру?
С таким вопросом мы пришли к нашим выпускникам 2026 года. Ребята честно поделились своим опытом.
Узнайте из первых уст, как взять от учебы максимум, чего ждать от магистратуры и что оказалось неожиданным для студентов. Спойлер: придется попотеть.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
До 15 августа (включительно) можно подать документы на программу набора 2026 года. Если вы давно присматривались к магистратуре, но откладывали подачу, время еще есть.
Для поступления нужно подготовить мотивационное письмо и сдать экзамен по математике и алгоритмам на Python. Для подготовки доступен специальный курс.
Вступительное испытание можно пройти 15 или 18 августа. Ждать полной готовности к экзамену не нужно: заявление можно отправить уже сейчас, а оставшиеся дни посвятить подготовке.
На программе вы сможете выбрать один из трех профильных треков:
— Machine Learning;
— Data Engineering;
— Data Analysis.
Подробнее о программе: https://mipt.online/masters/data_science.
📥 Обратите внимание: подать документы можно до 15 августа, 23:59 (Мск), через портал Госуслуг: https://www.gosuslugi.ru/vuzonline.
Если остались вопросы о программе или поступлении, оставьте заявку на консультацию на странице магистратуры — менеджер свяжется с вами и поможет разобраться.
Please open Telegram to view this post
VIEW IN TELEGRAM
Дата: 13 августа (четверг)
Время: 18:00–20:50
Встреча пройдет в рамках подготовительного курса для абитуриентов онлайн-магистратуры «Науки о данных».
На консультации разберем демобилет 4 и порядок проведения вступительного испытания. Вы сможете решить задания самостоятельно, обсудить их с преподавателем и задать вопросы по подготовке к экзамену.
📍 На каждой консультации разбирают разные билеты.
Чтобы попасть на занятие, нужно заранее получить доступ к подготовительному курсу: оставить заявку на сайте магистратуры МФТИ и пройти консультацию с менеджером по поступлению.
Получить доступ: https://mipt.online/masters/data_science?utm_source=general&utm_source=tg&utm_medium=ds#rec2158440981
⏱️ Длительность встречи: 2 часа 50 минут. Рекомендуем подключиться заранее.
Please open Telegram to view this post
VIEW IN TELEGRAM
mipt.online
Науки о данных онлайн-магистратура МФТИ
Магистерская программа МФТИ — это системный и фундаментальный подход к обучению
Подать документы в онлайн-магистратуры МФТИ можно только через Госуслуги gosuslugi.ru/vuzonline — до 23:59 (Мск) 15 августа.
Вся официальная информация о правилах приема размещена на сайте приемной комиссии МФТИ: pk.mipt.ru/master.
Подробная инструкция по подаче и отслеживанию заявления: https://mipt.online/podacha-docs.
Вы можете оставить заявку на консультацию, и наш менеджер по поступлению проконсультирует вас: https://mipt.online/masters/data_science#rec2158440981
Please open Telegram to view this post
VIEW IN TELEGRAM
www.gosuslugi.ru
Госуслуги
Проще, чем кажется
Подать заявление на программы набора 2026 года можно до 23:59 (Мск) 15 августа.
Если вы собирались поступать, но откладывали подачу документов, у вас еще есть несколько часов. Отправьте заявление через Госуслуги и сразу выберите дату вступительного испытания.
Экзамен по всем 3 программам можно сдать 18 августа.
📥 Подать заявление через Госуслуги: https://www.gosuslugi.ru/vuzonline.
Инструкция по подаче документов: https://mipt.online/podacha-docs.
🤗 Будем рады видеть вас в МФТИ — учиться, знакомиться, работать над проектами и проходить этот путь вместе!
Please open Telegram to view this post
VIEW IN TELEGRAM
www.gosuslugi.ru
Госуслуги
Проще, чем кажется
VEDA — ИИ-платформа для школьников, где для ответов используют реальные учебники. Это важно: в школьной программе много точных фактов, а LLM может галлюцинировать.
На партнерском митапе МФТИ и РЭУ Пелагея Пашинская, ведущий ML-инженер и участница команды VEDA, рассказала, как команда дообучала энкодер для RAG.
Если коротко, RAG сначала ищет подходящие фрагменты в базе знаний, а затем передает их LLM как контекст для ответа. Энкодер нужен, чтобы сопоставлять запросы и фрагменты текста при поиске.
Проблема: на запрос «Как человек влияет на растительный мир?» система возвращала чанки — фрагменты текста — про влияние леса на среду, среды обитания растений и лишайники. Темы рядом, но ответа на вопрос нет.
И это был не единичный случай. У модели, которая использовалась в продукте, Recall@1 был всего 36%: нужный фрагмент оказывался первым примерно в трети случаев. В 125 запросах из 500 релевантного чанка не было даже среди первых пяти.
Команда решила дорабатывать retrieval — этап, на котором RAG ищет нужные фрагменты. В VEDA использовали универсальную MiniLM, не адаптированную под школьные тексты и запросы.
Для обучения добавили hard negatives — тексты, похожие на правильный ответ, но не отвечающие на запрос. Например, для вопроса «Как размножаются мхи?» правильный чанк описывал размножение мхов, а hard negative мог рассказывать о мхах в целом или о размножении папоротников.🌿
Не все примеры оказались одинаково полезными. Тексты, сгенерированные LLM, модель научилась отбрасывать слишком легко. Одна из гипотез команды — они могли заметно отличаться от реальных фрагментов учебников. А соседние чанки из того же параграфа оказались сложнее: тема близкая, но ответа на конкретный вопрос нет.
Отдельно команда сравнила модели еще без дообучения. Базовая BGE-M3 показала Recall@1 около 68% против 36% у MiniLM, которая использовалась в рабочей версии VEDA.
После дообучения BGE-M3 на собранных данных показатель вырос до 76,1%. MRR — метрика, которая учитывает позицию первого релевантного фрагмента в выдаче, — вырос примерно с 0,78 до 0,85.
И на том же вопросе про влияние человека на растительный мир retrieval уже находил фрагменты про вырубку, земледелие, загрязнение, осушение и орошение земель.
В случае VEDA проблема была именно в retrieval: до LLM доходили фрагменты, близкие по теме, но не отвечающие на конкретный вопрос. После замены и дообучения энкодера качество поиска заметно выросло.
А если вы только присматриваетесь к Data Science, в этом кейсе хорошо видно, с какой задачей может столкнуться ML-инженер: качество не устраивает, готовых данных почти нет — нужно собрать их, сравнить модели и проверить результат метриками.
Хотели бы еще разборы реальных ML-задач?
🔥 — да, особенно с метриками и ошибками
🤪 — да, только термины выдавайте порциями
😂 — нет, мой Recall@1 на сегодня исчерпан
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7
Студенты онлайн-магистратуры уже приступили к занятиям — начались пары, знакомства с преподавателями и первые учебные задачи. А мы будем в течение года показывать здесь, как проходит их обучение изнутри.
Приемная кампания завершилась, следующий набор — весной 2027
Но если вы думаете о поступлении в следующем году, ждать весны не обязательно. Оставить заявку на консультацию можно в течение всего года — наша команда расскажет об обучении, поступлении и поможет разобраться, подходит ли вам магистратура:
Канал продолжит работать для вас. Здесь будем публиковать разборы по Data Science, ML и AI, рассказывать о карьерных траекториях в данных, преподавателях и экспертах программы, проектах студентов, хакатонах.
Так что не прощаемся — впереди много контента, который пригодится еще до поступления.
Кто остается с нами до следующей приемной — помашите нам 👋
Please open Telegram to view this post
VIEW IN TELEGRAM
🙏3
На эфире МФТИ о карьере в Data Science Александр Толмачев, директор по машинному обучению и анализу данных в Ozon Банке, рассказал, что замечает как нанимающий менеджер:
Если вы эти пункты сделаете, я вам гарантирую, что в абсолютном большинстве собеседований вы будете очень значимо отличаться от 90% всех кандидатов
Собрали его рекомендации.
1. Проявлять инициативу
Не просто выполнить задачу, а самому погрузиться в тему, изучить новую информацию и принести предложение.
Нанимающий менеджер, когда слышит, что вы проявляете инициативу, такой: блин, классно. 9 из 10 не проявляют инициативу.
2. Уметь нормально доносить свою мысль
По словам Александра, софты становятся все важнее. Нужно «не лить воду, говорить аргументированно, говорить прозрачно, не быть токсичным», уметь договариваться и защищать свое решение.
Трансляция мысли между людьми становится очень важной.
3. Делать свои проекты и показывать их
Девятнадцать из двадцати кандидатов, которые приходят ко мне на собес, — у них резюме типовое. Работал там-то и так далее.
А у одного из двадцати уже в первых строках есть другое: «Смотри, ссылка, вот мой сайт, вот мой pet-проект, вот мой Git».
Такой кандидат сразу отличается: видно, что человек «не просто ищет работу, а кайфует от этого и хочет в этом развиваться».
4. Доводить проекты до рабочих прототипов
Особенно хорошо, если результат можно не только посмотреть в репозитории, но и запустить.
Проект может быть историей в духе «вот я на данных что-то изучил», а прототип — уже «готовая классная история, которую можно пощупать, потыкать».
5. Сделать ИИ-агентов своим рабочим инструментом
Александр советует воспринимать агентов как своих персональных ассистентов.
Это не для работы нужно, это нужно вам для жизни.
Работа с моделями постепенно заставляет разбираться глубже: в лимитах, токенах, стоимости, выборе инструментов и в том, как собрать из них собственную систему.
6. Учиться управлять агентами и понимать архитектуру решения
Следующий уровень — уметь параллельно работать с несколькими агентами, контролировать результат и понимать, как связаны части системы.
Чем круче вы умеете управлять агентами, их развивать и контролировать, и оркестрировать, тем вы выгоднее будете отличаться от других кандидатов
Сам Александр первую работу искал 6–7 месяцев.
Я просто ходил и откликался везде вообще. Главное — чтобы работать по специальности. Не важно где, но по специальности
Отказы давались тяжело: «Очень больно было, когда отказывают, прям до слез». Но после каждого собеседования он старался понять, что сделал неправильно, и использовал этот опыт, чтобы увеличить свои шансы на следующий офер.
В итоге первой работой стал небольшой региональный банк.
Мы все с вами думаем, что надо сначала попасть куда-то в крутую компанию. Ваша сейчас задача — попасть куда-нибудь, чтобы вы наработали этот опыт, прошли какие-то болячки свои, поняли, что вы не перегораете, улучшились.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2
Media is too big
VIEW IN TELEGRAM
В этом году Максим Зимаков окончил онлайн-магистратуру МФТИ «Науки о данных». До этого он учился очно, поэтому онлайн был для него новым опытом: получится ли так же общаться с людьми, быть частью университетской жизни, чувствовать себя студентом Физтеха?
Через два года у Максима на этот вопрос уже есть ответ:
— Оказалось — в принципе да.
Передаем слово Максиму.
— Сейчас мир очень динамичный, надо везде успевать: по работе, по делам, хоть какую-то личную жизнь иногда иметь. И поэтому онлайн в этом плане был упрощением: не надо ехать в определенное место, но обучение все равно остается качественным.
И самое интересное — можно приезжать в кампус, участвовать во всех активностях, приезжать на факультативы. Физтех ровно так же поддерживает и помогает, хоть ты и удаленщик. Не важно.
Мы все переписывались, друг другу помогали, друг друга поддерживали. И сейчас встречаемся, видим друг друга вживую — и это очень интересно.
Наверное, для меня самое ценное — вообще возможности, которые дает вуз. Я участвовал в конкурсе студенческих стартапов «Фонд содействия инновациям» — у Физтеха сразу для этого есть внутренний курс, где помогают понять, как подать документы, помогают с письмами. Все движухи Физтеха — это было.
И нет такого ощущения, что раз ты на онлайн-программе, то руководству (*преподавательскому составу) все равно. Нет, им не все равно. Ты обращаешься — люди стараются помочь. Оказалось, что мой диплом есть кому показать. Просто из общения. Мне сказали: есть человек, которому можно его показать, может быть, получится дальше это продвинуть.
С дипломом у меня вообще был шикарный опыт. Я делал его реально год. С научным руководителем мы созванивались каждую неделю. Он меня направлял, а я шел дальше.
Даже на предзащите и защите все давали конкретную критику, причем обоснованную. Ты понимаешь свои слабые места и где тебе нужно усилиться. И от всех чувствуется не негатив, а то, что тебе хотят помочь.
Этот опыт меня однозначно изменил. Я понял, что можно просто написать незнакомому преподавателю — и он тебе ответит, поможет. Можно приехать на Физтех — все доброжелательны, тебя еще встречают с улыбкой. Никакого негатива никогда не было. Чувствуется единство.
И я, наверное, понял еще одну вещь: все двери можно открывать. Не надо сильно зажиматься. Больше коммуникации, больше общения с людьми — и люди тебе открываются тоже.
Please open Telegram to view this post
VIEW IN TELEGRAM
💯3🥰1
Задача: нужно улучшить рекомендательную систему на базе LLM. Что даст эффект — изменить размер модели или способ инициализации новых токенов?
Александр Калистратов, выпускник Центра «Пуск» МФТИ, в выпускной работе исследовал рекомендательные системы на базе LLM.
Обычно товар в рекомендательной системе представлен своим ID. Александр действовал иначе: представил каждый товар как последовательность специальных токенов — семантический идентификатор. Если у товаров совпадает часть такой последовательности, они похожи по смыслу. Эти новые токены Александр добавил в словарь LLM.
Эксперимент проводился на подмножестве Amazon Pet Supplies: 63 тыс. товаров и больше 100 тыс. историй покупок.
Модель проверяли на четырех задачах, и они делятся на два типа:
— семантические — сгенерировать текст по идентификатору и, наоборот, получить идентификатор по тексту;
— коллаборативные — предсказать сопутствующий товар и следующий товар в истории взаимодействий пользователя.
Как на качество влияет размер модели
Сначала Александр сравнил четыре LLM семейства Qwen разного размера: 0,6 млрд, 1,7 млрд, 4,8 млрд и 8 млрд параметров.
На семантических задачах более крупные модели лучше связывали идентификаторы с информацией о товаре: точнее генерировали идентификатор по тексту и текст по идентификатору. Основной прирост был при переходе от модели с 1,7 млрд параметров к модели с 4 млрд. Дальше разница между моделями сокращалась и уже не достигала статистической значимости.
На коллаборативных задачах увеличение модели прироста не дало.
Как влияет способ инициализации новых токенов
Когда в словарь LLM добавляют новый токен, для него нужно задать эмбеддинг — вектор, с которым модель будет дальше работать. Александр проверил четыре способа задать начальные значения этих эмбеддингов.
Лучше всего сработал вариант, в котором использовали знания, уже заложенные в модели. Названия товаров разбивали на знакомые LLM токены и брали их эмбеддинги, чтобы на их основе инициализировать новые токены. По словам Александра, так они сразу оказывались «почти в правильном месте» в векторном пространстве.
На семантических задачах этот способ показал значимо лучший результат. А вот на предсказание сопутствующего и следующего товара способ инициализации не влиял.
Собственный метод Александра — проекция кодовой книги — оказался худшим из четырех.
Что в итоге
⏺ Полную запись эфира смотрите по ссылке: https://vkvideo.ru/video-224205661_456239143
Александр Калистратов, выпускник Центра «Пуск» МФТИ, в выпускной работе исследовал рекомендательные системы на базе LLM.
Обычно товар в рекомендательной системе представлен своим ID. Александр действовал иначе: представил каждый товар как последовательность специальных токенов — семантический идентификатор. Если у товаров совпадает часть такой последовательности, они похожи по смыслу. Эти новые токены Александр добавил в словарь LLM.
Эксперимент проводился на подмножестве Amazon Pet Supplies: 63 тыс. товаров и больше 100 тыс. историй покупок.
Модель проверяли на четырех задачах, и они делятся на два типа:
— семантические — сгенерировать текст по идентификатору и, наоборот, получить идентификатор по тексту;
— коллаборативные — предсказать сопутствующий товар и следующий товар в истории взаимодействий пользователя.
Как на качество влияет размер модели
Сначала Александр сравнил четыре LLM семейства Qwen разного размера: 0,6 млрд, 1,7 млрд, 4,8 млрд и 8 млрд параметров.
На семантических задачах более крупные модели лучше связывали идентификаторы с информацией о товаре: точнее генерировали идентификатор по тексту и текст по идентификатору. Основной прирост был при переходе от модели с 1,7 млрд параметров к модели с 4 млрд. Дальше разница между моделями сокращалась и уже не достигала статистической значимости.
На коллаборативных задачах увеличение модели прироста не дало.
Как влияет способ инициализации новых токенов
Когда в словарь LLM добавляют новый токен, для него нужно задать эмбеддинг — вектор, с которым модель будет дальше работать. Александр проверил четыре способа задать начальные значения этих эмбеддингов.
Лучше всего сработал вариант, в котором использовали знания, уже заложенные в модели. Названия товаров разбивали на знакомые LLM токены и брали их эмбеддинги, чтобы на их основе инициализировать новые токены. По словам Александра, так они сразу оказывались «почти в правильном месте» в векторном пространстве.
На семантических задачах этот способ показал значимо лучший результат. А вот на предсказание сопутствующего и следующего товара способ инициализации не влиял.
Собственный метод Александра — проекция кодовой книги — оказался худшим из четырех.
Что в итоге
Если нужно научить модель связывать новые идентификаторы с текстом, имеют значение и размер модели, и способ инициализации.
А в задачах на предсказание сопутствующего или следующего товара ни увеличение модели, ни способ инициализации прироста в этом эксперименте не дали.
Как говорит Александр, для одних рекомендательных задач есть смысл «запариваться с большим размером модели и всеми вытекающими», а для других — нет.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1