import transformers
822 subscribers
5 photos
5 links
Всем привет, я использую import transformers!
Download Telegram
Channel created
Ознакомительный закреп.


from transformers import transformer

money = transformer.make_money()


Это канал ML-инженера, сосредоточенного на нейросетевых подходах обработки естественного языка.

Победитель IT Purple Hack, финалист VTB More.Tech и FINAMxHSE AI Trade Hack.

Ранее сокращал косты в ритейле за счет машинного обучения, а сейчас внедряю в финтех LLM. Почему? Такие проекты труднее «заставить» приносить реальную пользу компании, конвертируемую в рубли. Но это возможно, если сделать хорошо и не так, как у всех. Это стало моим вызовом самому себе и индустрии в целом.

Твоя подписка даст много мотивации для развития этого канала, а я постараюсь сделать его действительно полезным.

Навигация:

Я собрал лучшие материалы по вкату в ML, встреченные на своем пути. Если бы мне дали это всё в начале на блюдечке - я бы вкатился на полгода раньше:
1 часть (основные концепции)
2 часть (математика и нужно ли)
3 часть (в процессе)

Другое:
30+ собесов за месяц, 9 офферов от 250к до 450к ₽, работа в банке в 20 лет, успешно закрытая испыталка, победа в хакатоне МФТИ

Где применять классический ML, а где нейросети (глубокое обучение)?

Анти-паттерны успешного внедрения ЛЛМ и агентов в бизнес
🔥8🎄5🍌42🍓1🦄1
🍷 Почему нейросети плохо справляются с задачами классического машинного обучения?


Многие легко могут назвать задачи, для которых глубокое обучение избыточно, но дать полный ответ на изначальный вопрос уже затрудняются. А ведь вся соль в природе данных, на которых придется обучать модель. На самом деле данные, обрабатываемые мощными нейросетями должны обладать следующими свойствами:

1) Гомогенность признаков. (объясню далее)
2) Однородность признаков - все признаки в рамках одного набора данных имеют одну и ту же природу: пиксели, токены (слова или их части) и тд.
3) Признаковое пространство огромной размерности - тысячи пикселей в изображении, десятки тысяч слов в тексте и тд (нейронки отчасти поэтому тоже огромное количество параметров имеют)
4) Компоненты признакового пространства связаны пространственно (пиксели в изображении) или темпорально (отдельные значения непрерывного сигнала, например, звукового).

Гомогенность признаков говорит о том, что по какому-то отдельному признаку объекта ты даже отдаленно не сможешь предсказать результат для него никак
Попробуй по одному из десяти тысяч пикселей понять, что изображено на фото) Вряд ли у тебя это получится сделать, не так ли?

В случае гетерогенных признаков (к которым лучше применимы классические подходы машинного обучения) есть шанс предсказать поведение итоговой модели.
Пример: в выборке присутствуют признаки «опыт работы» и «возраст». Нужно предсказать заработную плату на определенной должности в какой-то компании. По значению, допустим, опыта работы ты скорее всего сможешь понять, каков примерно будет результат с некоторым значительным шумом эпсилон.

Так вот, упрощая, нейросети нужны, чтобы составить «удобное», в полной мере репрезентативное признаковое пространство, которое будет «близко по свойствам» к гетерогенному, чтобы на его основе в итоге сделать предсказание классическим алгоритмом машинного обучения, например, логистической регрессией 📊 (для каждого из классов узнать его вероятность).

Отчасти благодаря этим четырём свойствам признакового пространства нейронки и улавливают сложные зависимости в данных. Опять же: по одному признаки ничего полезного не расскажут, а вот если посмотреть на них всех вместе и попробовать как-то соотнести, как это делают нейронки, ты сможешь что-то понять. Подумай, наш мозг же по сути примерно так же способен действовать:
Смотрит на всю картинку целиком, анализируя некоторые части, считывая стандартные паттерны (цифра «8» = 2 кружочка, соединенных вертикально, морда кота = треугольные уши, большие усы и тд), читает текст, запоминая связи между словами и предложениями, учитывая контекст, (fly = летать, если речь об авиации или fly = муха, если речь об отряде двукрылых), а потом на основе этого делает логичные выводы.

Информация о 4-ех свойствах взята из открытых лекций Евгения Разинкова на его ютуб-канале (рекомендую)
Please open Telegram to view this post
VIEW IN TELEGRAM
🍓26🦄8🍌73🐳1
🍷 Как внедрить генеративный ИИ и потерять миллионы гарантированно?

Мой топ-10 советов:

1) Обязательно имплементируйте все новомодные и сложные техники, ведь они точно повысят качество вашего решения. Есть ресурсы дообучить ллм? Отлично! Это мы и сделаем, лишним точно не будет.

2) Не прототипируйте решение. Не проверяйте потенциал решения в зародыше, оно ведь не может быть мертво в зачатке. Это лишь замедлит процесс разработки. И так понятно, что ИИ точно принесет успех, надо сразу приступать к MVP! От сложного к ещё более сложному и дообучению ллм, только так.

3) Не замеряйте качество на собственных бенчмарках, состоящих из датасетов с примерами «запрос-нужный_ответ» и кастомных метрик, определенных вместе с заказчиками, существуют же глобальные бенчмарки! Достаточно посмотреть, какие из них больше подходят для твоей задачи и исходя из этого выбрать ЛЛМ. Главное, дообучить её потом, и она всё сможет!

4) Больше агентов - лучше качество! Да, именно так, пусть даже над не особо трудной задачей работают несколько ллм-воркеров, которых координирует ллм-оркестратор. Пусть у каждого из них будет по несколько различных инструментов, так еще и на собственном MCP-сервере! А еще для каждого агента свою ллм дообучить, ну прям космолёт какой-то

5) Если системе необходим поиск по базе знаний, то всем известный RAG - прошлый век. Обязательно стройте Graph RAG или Agentic RAG! Так мы, наконец, добьемся точности 99.9%! А с дообученной ллм все 100%

6) Относитесь к LLM не как к какой-то вероятностной модели, которая просто предсказывает следующий токен на основе предыдущих, а как к универсальному помощнику, который призван решить сотни твоих проблем даже без дообучения (а мы дообучим). Потому что LLM абсолютно на всех задачах эффективнее стандартных алгоритмов, моделей классического машинного обучения и обработки естественного языка.

7) Не доставайте заказчиков постоянными уточнениями требований к системе и метрикам качества. Не описывайте четко, как система должна себя вести в формате хотя бы промпта. Есть дела поважнее - ллм дообучить, чтобы она знала всё про наши великие ООО «Рога и Копыта».

8) Не отходите от изначального плана по архитектуре, ведь у ллм-решений особенно с агентами она довольно предсказуема и всегда однотипна, развивайте её дальше, усложняйте и однажды точно достигните успеха! А то кучу времени потеряем, нам же еще ллм дообучить надо…

9) Не обеспечивайте систему защитой. Решения на основе ллм всегда будут отрабатывать так, как вы им сказали, поэтому не имеет смысла добавлять в воркфлоу Guardrails и human-in-the-loop. Агентам не нужно отдавать фидбэк в процессе работы через llm/human-as-judge, они всегда будут верно работать, мы же дообучим ллм, зачем системе лишняя задержка?

10) ВСЕГДА ДООБУЧАЙТЕ ЛЛМ! Независимо от задачи. Это главный ключ к успеху. Большие затраты обязательно дадут плоды, нет ничего эффективнее дообучения при работе с ллм.

Поздравляю, теперь ты знаешь, как потерять миллионы на безответственном подходе к внедрению генеративного ИИ, повторив опыт 95% компаний на рынке, однажды решившихся на такой мудрый ход. Успехов!

P. S. Микропосыл про дообучение заключается не в том, что это плохо. Это хорошо. Посыл в том, что часто это избыточно.
Please open Telegram to view this post
VIEW IN TELEGRAM
17🕊5💯5🍓3🍌2💘2🔥1
🔥 Как вкатиться в ML? Путь в самую горячую сферу IT.
Часть 1.


В этой рубрике буду делиться знаниями и опытом вплоть до гайдов по прохождению ML System Design на грейд Senior на собственном примере.

Если бы мне дали это всё в начале на блюдечке - я бы вкатился на полгода раньше:

Всегда советую вкат в ml начинать с плейлиста от Евгения Соколова из ФКН ВШЭ - Машинное обучение 1.
Объясняет основные идеи через призму математики для глубокого понимания, советую конспектировать. Тут вся база по ml: градиентый спуск, обработка данных, линейные модели, деревья решений, бустинги, матричные разложения и тд (понадобятся знания матанализа ; линейной алгебры ; матстата и теорвера)

Визуальное введение в глубокое обучение от 3blue1brown - neural networks

Тренировки по мл с Радославом Нейчевым (имба).
1) 1.0 про classic ML
2) 2.0 про NLP - обработка естественного языка (там начинаются трансформеры, для лучшего их понимания очень советую этот вебинар от Игоря Котенкова, отлично объясняет архитектуру)
3) 3.0 про CV.
(У каждой части есть гитхаб с практикой. Их нужно последовательно смотреть)

Для полного понимания ИИ - плейлист от Евгения Разинкова - AI: от основ до Transformer - он очень подробно объясняет сложные концепции в глубоком обучении, особенно рекуррентные, сверточные сети, трансформеры, затрагивает LLM со всей необходимой математической составляющей (лучше изучить канал разинкова, там еще много годноты найдёте).

Совместно с тренировками 3.0 стартовать в computer vision сильно поможет канал Дмитрия Колесникова. Наверное, все, кого я знаю из CV, с него начинали

То, что я скинул - это самая база. Покроет огромное количество теоретических вопросов

Ну и, конечно, хендбук от Яндекса. Он нужен для уничтожения даже самых душных собесов. Содержит огромное количество ответов на всевозможные вопросы. Тут больше всего матеши, приступайте лучше совместно с тренировками по ml (посмотрели лекцию тренировок - почитали об изученных темах в хендбуке)
(хард)


Еще каналы, достойные упоминания:
мыш - ну прям современно-модно-молодежно поясняет за мл
machine learning - хорошие гайды для вката
ML inside - неплохие, хорошо отснятые, информативные ролики от шарящих челов
ODS - очень полезно, конференции по всем областям ML, презентации реальных кейсов из практик крупных компаний, обучающие вебинары и тд -
Вадим Новоселов - в плейлистах записи собесов по питону, ML/DS

Практика:
Добрый, добрый ИИ. Часть 1. Машинное обучение - отличный курс от Сергея Балакирева (selfedu), чтобы прочувствовать и понять алгоритмы классического машинного обучения (понадобится знание numpy)

Введение в Data Science и машинное обучение - качественный курс для начинающих от Анатолия Карпова, создателя уважаемой в сообществе платформы Karpov Courses

Серия курсов от Елены Кантонистовой из ФКН ВШЭ (выбирай, тут и classic ml, и nlp, и cv): Старт в Data Science! , Разработка ML сервиса: от идеи к прототипу , основы компьютерного зрения: мир глазами машины , First Step in NLP 2.0 , Second Step in NLP , Современные LLM , MLOps. Начало , Современный AI в IT-индустрии и науке

Deep Learning School (DLS) - тот самый имбовый курс по глубокому обучению от МФТИ, так еще и бесплатный, с сообществом в тг, с проверкой заданий. Состоит из двух частей, проводят курсы по семестрам. На их странице на степике можете проходить уже завершенные семестры, но проверки решений не будет

Kaggle. Самая знаменитая платформа для практики по ML (обзор). Огромное количество датасетов, серьезных задач и решений от профи, на которые вы должны ориентироваться. Вот примеры решения задач с кагла : один , два

ХАКАТОНЫ! Да, теперь пришла пора вам искать команду и решать реальные бизнес-кейсы (не увлекайтесь слишком, советую несколько пройти, а дальше задуматься конкретно о работе)

По вашей активности пойму, насколько релевантна вторая часть.

Удачи, воин.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥89💘25🆒1511🍓5❤‍🔥11
🎉 30+ собесов за месяц, 9 офферов от 250к до 450к ₽, работа в банке в 20 лет, успешно закрытая испыталка, победа в хакатоне МФТИ


💙 Друзья, я очень признателен вам за то, что остаётесь со мной. Произошло довольно много событий, было тяжело, и у меня огромное количество мыслей в голове, которыми не терпится поделиться. Вас уже 600, это невероятно, спасибо всем огромное! И простите, что не подавал признаков жизни... но на это были причины.
Сейчас вы увидите обобщение этого всего, а позже выпущу конкретику.

🎉 До декабря я никогда не ходил на полноценные собесы, какие они есть сейчас, а если и работал, то не по трудовому договору - на аутстаффе, пилил модели, RAG, ассистентов для ритейла через подрядчиков, которые замечали меня по результатам хакатонов, на которых в финал выходил или через другие активности.
Но какого же было мое удивление, когда я на следующий день после первой же технички получил оффер! А потом больше и больше. Я прошел 35 собесов за месяц, не считая HR-скрининги. Тогда я осознал свой потенциал и потенциал получившегося резюме: практически сотня эйчаров в лс за месяц, успешные технички, алгоритмы, финалки, офферы и преофферы.
Мне действительно удалось быть лучшим кандидатом не раз - и в этом я обязан десяткам часов, которые тратил в сутки для достижения цели последние 2 года и многим правильным решениям на пути, приведшим к результату, а так же родным и близким, что верили в меня и поддерживали.
Но главное - я верил в себя и знал, что всё получится, хотя и не раз сдавался в начале.

Один из крупнейших офферов на AI-инженера сделал Точка Банк, в который я целился с самого начала! Это прекрасная компания с окладами сильно выше рынка, полной удаленкой, крутыми процессами, операционкой, настоящей заботой о сотрудниках (её главное преимущество, которое я испытал), очень приятными коллегами, без начальников и излишек бюрократии с большой степенью автономности и свободы в принятии решений, не похожая на дефолтные корпорации. С января я приступил к необычным для себя задачам, успешно завершил испыталку, много взаимодействовал с бизнесом, выстраивал партнерскую позицию, приоритизировал и проверял гипотезы, в основном "спасал" бизнес от ИИ и даже внедрял, когда это действительно необходимо и способно принести деньги статзначимо.
Я получаю бесценнейший опыт и знания, которые намерен передать вам.

🏆 Недавно на IT Purple Hack я в двух кейсах по машинному обучению от Авито (автоматические выделение самостоятельных категорий из объявления) и Сбера (предсказание галлюцинаций LLM на основе скрытых состояний модели) забрал 1 и 2 место соответственно, будучи единственным ML'щиком в команде, обойдя ребят из МФТИ, ВШЭ, ЦУ, ИТМО, МИСИС - обязательно расскажу, это был сложнейший хакатон с миллионом нюансов и отсутствием сна.

🎓 В завершение, я закрыл все долги по вузу, которых накопилось 13, пока я занимался действительно важными вещами. И это тоже очень приятно.

🟡 Своими силами выбравшись из провинции в столицу, уже на третьем курсе я работаю в крупной компании, напрямую влияя на банковскую фин. модель по ключевым метрикам, затрагивая сотни тысяч людей, закрываю все свои потребности и даже больше, составляю неплохую конкуренцию на рынке и в соревнованиях. Но, друзья, я знаю, это начало большого пути! Ловите меня на слове и пристально следите. Увидимся!
Please open Telegram to view this post
VIEW IN TELEGRAM
74🔥28❤‍🔥15👏5💘4
📝 Научись извлекать максимум пользы от ИИ


Даже глубоко разбирающиеся во внутренностях LLM спецы неизбежно сталкиваются с горами нейрослопа.
нейрослоп — контент, сгенерованный нейросетью, не имеющий практической ценности


Я люблю системный подход и моделирование. Я вывел для себя простейший фрейм, отражающий эффект от LLM:
Результат = Ценность + Нейрослоп

Проще некуда. И нет, это не какие-то показатели, которые говорят "в тексте X% нейрослопа и Y% пользы" Это очень абстрактные переменные, составляющие trade-off, их нужно постараться осознать:

Нейрослоп — бесполезная или развлекательная и, возможно, даже вредящая информация, содержащая галлюцинации, которая очень уверенно подаётся. Из нейрослопа вы не извлечете никакой пользы.

Ценность — объективная польза от нейросети. Например, перед экзаменом вы готовились вместе с нейронкой, до этого ничего не учили, но получили высокий балл благодаря ей. Или внедрили в бизнес-процесс гипотезу на основе LLM и по результатам A/B-тестирования видите статзначимый профит. В итоге точно понимаете, что компонента ценности превалировала над слопом. Не путайте пользу с ощущением пользы!

То есть ценность и слоп в этой модели определяются уже после коммуникации с нейросетью, наблюдая конкретный эффект и его влияние.

Но как парадокс — слоп хорошо продается и становится финансовой ценностью для многих.


Наша задача — устремить шанс ценности к максимуму, а шанс слопа к минимуму.

Я выделяю 2 основных пути взаимодействия с нейронкой:

1) Заземлённый запрос:

Это запрос с опорным материалом — файлом, документом, текстом — знания, за пределы которых модель при генерации выходит незначительно.

Лучшая задача для LLM — анализ, обработка текста и ответы по нему. Это самый эффективный вариант применения LLM, значительно повышающий шанс ценности, но не гарантирующий её. Модель ориентируется на контекст и меньше "гадает", важно не засорить его.

Примеры задач: саммаризация, ответы на вопросы по файлу, NER, RAG и т.д.

2) Незаземлённый запрос:

Это запрос без опорного материала. Если к тому же инструкции нет, то это обычный вопрос/просьба к LLM сделать что-то.

При ответе нейронке приходится сильно полагаться и на собственные знания.
Этот подход является причиной большинства нейрослопа из-за доверия людей к ИИ.
Он оправдан в случае, когда вы осознанно хотите воспользоваться огромной обобщающей способностью LLM и можете провалидировать результат.

Примеры задач: классификация текста, общие вопросы о мире, генерация идей, гипотез и т.д.

В реальности же два случая нередко смешиваются, например, в агентных системах. Оценивайте заземлённость запроса и предсказывайте слабые места в ответе LLM, обязательно настраивая валидацию!

Для обоих подходов есть способы значительно повысить шанс ценности:
1) Подумайте, хватит ли человеку данной вами методологии для LLM, чтобы решить поставленную задачу. Если нет, то она не исчерпывающая
2) Используйте качественный Context Engineering для сложных задач
3) Просите LLM найти минусы в решении, а не оценить его
4) Активируйте у ассистента функцию поиска в интернете перед ответом (источники лучше проверять)
5) Запрашивайте несколько вариантов ответа на запрос в разных чатах и оценивайте согласованность

Запомните основную мысль: LLM — инструмент, а не оракул. Низкокачественный контекст, не проработанная инструкция и отсутствие валидации приводит к слопу!


Чем больше вы позволяете LLM полагаться исключительно на собственные знания, тем сильнее рискуете увеличить компоненту нейрослопа, уверенно выглядящего, но представляющего в лучшем случае лишь среднестатистический ответ по интернету без капли экспертности, особенно в чувствительных темах вроде медицины. Бесспорно, флагманские модели способны набирать высокий скор в бенчмарках, верно отвечать на многие сложные вопросы, писать код на уровне сильного джуна, помогать обучаться, но надо помнить о рисках, никогда слепо не верить LLM и валидировать её ответы - отлично, когда вы сами разбираетесь в теме.

Большие языковые модели — прекрасный инструмент, который работает на вас по мере вашей осознанности и критического подхода.
Please open Telegram to view this post
VIEW IN TELEGRAM
21208💘2
🔥 Как вкатиться в ML? Путь в самую горячую сферу IT.
Часть 2.

Математика.
Ссылка на Часть 1

А может, не стоит? Давайте сначала разберемся.
Под математикой дальше буду обозначать основы, т.е. линал, матан, теорвер, матстат, методы оптимизации и тд, + фундаментальное понимание концепций и алгоритмов машинного обучения — самое важное.

Для некоторой части вакансий в ML роль математики переоценена, это правда. Не стоит углубляться ради какой-нибудь, например, classic ML задачи, которая столько раз пережёвана временем, что достаточно просто вежливо попросить клод выдать fit-predict пайплайн с EDA для табличных данных, катбустом и визуализацией, и, вуаля, держите 101% F1.

Так же она бесполезна для расхайпленных позиций по созданию различных LLM-обвязок, где инженер чаще всего не меняет мозги модели никак, то есть не обучает/дообучает, а пишет сервис, который вызывает сервер с LLM.

— Прям вообще математика не нужна здесь?


Это не значит, что весь classic ML такой, как в случае 1. Там есть RnD, интересные задачи, где нужно исследовать новые подходы. Но часто думать приходится не над алгоритмом или функцией потерь, а над данными и бизнес-ценностью.
И в случае 2 не всё однозначно — в продвинутых командах агентов могут дообучать, а для RAG экспериментировать с алгоритмами поиска, дообучением моделей векторизации/ранжирования, и здесь без математики будет сложнее.

К тому же всегда приходится вспоминать про матстат уже после создания ML-блэкбокса — метрики качества имеют вероятностную природу и сильно зависят от распределения тестового датасета. По-хорошему надо проверять статзначимость результатовочень важно уметь отличать эффективное решение от случайно сработавшего. Человек без такой базы рискует допустить data leak, не заметить data drift, неверно интерпретировать p-value в A/B-тесте.

— А где математика на этапе разработки блэкбокса?


Решение задачи машинного обучения — это процесс генерации и проверки большого количества гипотез. На их качество и объем влияют 2 фактора: опыт и понимание концепций ML.
Можно хаотично проверять всё подряд, авось сработает — процесс затянется, вероятность успеха мала.
При одном лишь крупном опыте и насмотренности можно пытаться мэтчить паттерны с прошлых проектов на новые, но практически каждый ML-кейс уникален и требует индивидуального подхода.
Сузить круг генерируемых гипотез, повысить их качество в среднем и правильно приоритизировать позволяет именно математика — это движок, добавляющий обобщающей способности в процесс решения и значительно ускоряющий его.
Всё это в тандеме и формирует ту самую интуицию хорошего DS-специалиста, помогающую быстрее достигать успеха.

Математика нужна и при чтении статей во время ресёрча новых гипотез. Их понимание, имплементация и адаптация новых методов без неё даются намного тяжелее.

А еще математика — это невероятно интересно ;)

Надеюсь, я убедил вас в важности глубокого понимания ML для становления крутым спецом, и теперь готов поделиться материалами:


1. Mathematics for Machine Learning — легенда. Вспомнить всю математику для ML (+ практика на гитхабе). Есть перевод издательства "Питер".

2. Хендбук яндекса — курс по математике для ML и анализа данных от крутых авторов.

3. StatQuest — понятнее объяснений статистики и ML не видел.

4. mlu-explain — дополнительная визуальная интуиция.

5. Deep-ML — шикарный ресурс с практикой и теорией (MUST-HAVE)

Вообще 4-ёх ссылок на 3blue1brown и пару курсов в начале первой части хватит, чтобы хоть как-то начать понимать плейлист Соколова, который даст начальное понимание концепций ML. Но я рекомендую углубиться.
После него в первой части — плейлисты от Нейчева и в особенности Разинкова (must-have), ML-хендбук яндекса — в совокупности уже имеют необходимую базу, я это предусмотрел.
Но если хотите глубочайшего понимания концепций (советую при большом энтузиазме и хорошей математической базе) — легендарный, более фундаментальный, академический плейлист Воронцова, учителя Соколова.

Удачи, воин.

P.S. На прошлой части уже 600+ репостов, спасибо!
Please open Telegram to view this post
VIEW IN TELEGRAM
5114🔥95