Forwarded from Гречневые мысли
Курс молодого ресёрчера
Меня в последнее время уж слишком часто спрашивают, чё почитать, чтобы вкатиться в нлп, а я каждый раз пересылаю целую батарею из ссылок, которую я создал год назад. Пришло время обновить ссылки, организовать их в аккуратненький пост и потом кидать уже его.
Ссылки для обучения базе:
- HF NLP Course — Платиновая база. Это надо прочитать, чтобы научиться делать свои минимальные штуки на уровне инженера. Курс больше прикладной, не теоретический, учит взаимодействию с transformers. Он постоянно обновляется и там появляются туториалы по next big thing — например, там уже есть глава про reasoning models.
- Плейлист с лекциями Карпатого и его же гитхаб — Ещё более платиновая и ещё более база. Я очень плохо воспринимаю лекции и обычно смотрю их на х2, но тут и очень понятные объяснения, и иллюстрации в виде питоновского кода в тетрадках, и скорость изложения ровно такая, какая надо. В описаниях к видео есть домашки, если чувствуете, что надо получше разобраться, делайте их :)
- Зоопарк трансформеров — Чуть устаревшая статья на хабре, где описываются разные модификации трансформеров. Для каждой архитектуры и модели кратко описаны ключевые изменения. Новых моделей за последние пару лет тут, к сожалению, нет, но чтобы понять как всё развивалось, этого будет достаточно.
- Attention is all you need — Самая главная статья из современного NLP. Стоит прочитать, осознать и запомнить, потому что по сути с тех пор языковые модели практически не менялись.
- NLP Course For You — Классический курс по базе NLP, есть много про дотрансформерные методы. Мне кажется, что он уже не так актуален, но ознакомиться всё равно стоит.
- NLP чат — Уютненький чятик, где обсуждают новости и задают вопросы. Ваш покорный слуга выступает там в роли бесплатной добровольной техподдержки.
Ссылки для "уже смешариков", чтобы читать новости и развиваться дальше
- LocalLLaMA — Самый популярный сабреддит про локальный инференс ллмок. Все новости обычно появляются там.
- HF Daily Papers — Рассылка свежих статей по DL. Очень советую подписаться по почте, чтобы утром просматривать заголовки и читать интересующее. Помогает очень сильно расширить кругозор.
- lmarena.ai — Тут можно потыкать разные модельки руками, сравнить их и посмотреть, как они отвечают. Удобно, если надо быстро сделать сбс или проверить какую-то гипотезу.
- openrouter.ai — Сайт, где можно использовать модели через апи. Очень дёшево (по сравнению с аналогами), очень удобно. Оплачивается криптой, иностранной картой или через платиру/ggsel.
- 5 Levels of Text Splitting и RAG Techniques — Всё, что вы хотели знать про RAG, других ссылок, по сути, не нужно. В первой разбираются, как правильно сплитить текст для базы знаний, во второй рассматривают все типичные архитектуры и трюки, связанные с рагом.
- MTEB — Рейтинг эмбеддеров. Чем выше, тем лучше. Не спрашивайте в нлп чате, что выбрать, если предварительно не посмотрели сюда!
- HF Cookbook — Список готовых советов и рецептов для решения прикладных задач. Есть и код, и описание задачи, оформлено в виде блогпостов.
- vLLM, llama.cpp, TGI, sglang, Infinity Embeddings, CTranslate2 — Движки для инференса. vLLM, TGI и sglang для быстрого инференса декодеров на гпу, llama.cpp на цпу. Infinity Embeddings это движок для энкодеров во всех проявлениях, CTranslate2 для энкодер-декодеров.
Ссылки для совсем опытных Кар-Карычей
- Quantization Deep Dive — офигенный хабрапост от Яндекса, где расписывают математическую базу квантизации и про типы данных
- Ускорение LLM: универсальные методы для популярных архитектур — тоже офигенный хабрапост и тоже от Яндекса, где расписывают варианты ускорения инференса
- Статьи от Давида Дале на Хабре — все очень увлекательны и прекрасны. Мои любимые — про декодирование из эмбеддингов LaBSE, про прунинг токенизатора у mt5 и про дистилляцию берта.
- 100 questions about NLP — универсальный список вопросов для подготовки к собесам. Не на все вопросы есть ответы, но все вопросы хорошие.
Этот список, конечно же, неполный, но как база для вката работает на ура. Если есть что-то ещё полезного — кидайте в комменты.
Меня в последнее время уж слишком часто спрашивают, чё почитать, чтобы вкатиться в нлп, а я каждый раз пересылаю целую батарею из ссылок, которую я создал год назад. Пришло время обновить ссылки, организовать их в аккуратненький пост и потом кидать уже его.
Ссылки для обучения базе:
- HF NLP Course — Платиновая база. Это надо прочитать, чтобы научиться делать свои минимальные штуки на уровне инженера. Курс больше прикладной, не теоретический, учит взаимодействию с transformers. Он постоянно обновляется и там появляются туториалы по next big thing — например, там уже есть глава про reasoning models.
- Плейлист с лекциями Карпатого и его же гитхаб — Ещё более платиновая и ещё более база. Я очень плохо воспринимаю лекции и обычно смотрю их на х2, но тут и очень понятные объяснения, и иллюстрации в виде питоновского кода в тетрадках, и скорость изложения ровно такая, какая надо. В описаниях к видео есть домашки, если чувствуете, что надо получше разобраться, делайте их :)
- Зоопарк трансформеров — Чуть устаревшая статья на хабре, где описываются разные модификации трансформеров. Для каждой архитектуры и модели кратко описаны ключевые изменения. Новых моделей за последние пару лет тут, к сожалению, нет, но чтобы понять как всё развивалось, этого будет достаточно.
- Attention is all you need — Самая главная статья из современного NLP. Стоит прочитать, осознать и запомнить, потому что по сути с тех пор языковые модели практически не менялись.
- NLP Course For You — Классический курс по базе NLP, есть много про дотрансформерные методы. Мне кажется, что он уже не так актуален, но ознакомиться всё равно стоит.
- NLP чат — Уютненький чятик, где обсуждают новости и задают вопросы. Ваш покорный слуга выступает там в роли бесплатной добровольной техподдержки.
Ссылки для "уже смешариков", чтобы читать новости и развиваться дальше
- LocalLLaMA — Самый популярный сабреддит про локальный инференс ллмок. Все новости обычно появляются там.
- HF Daily Papers — Рассылка свежих статей по DL. Очень советую подписаться по почте, чтобы утром просматривать заголовки и читать интересующее. Помогает очень сильно расширить кругозор.
- lmarena.ai — Тут можно потыкать разные модельки руками, сравнить их и посмотреть, как они отвечают. Удобно, если надо быстро сделать сбс или проверить какую-то гипотезу.
- openrouter.ai — Сайт, где можно использовать модели через апи. Очень дёшево (по сравнению с аналогами), очень удобно. Оплачивается криптой, иностранной картой или через платиру/ggsel.
- 5 Levels of Text Splitting и RAG Techniques — Всё, что вы хотели знать про RAG, других ссылок, по сути, не нужно. В первой разбираются, как правильно сплитить текст для базы знаний, во второй рассматривают все типичные архитектуры и трюки, связанные с рагом.
- MTEB — Рейтинг эмбеддеров. Чем выше, тем лучше. Не спрашивайте в нлп чате, что выбрать, если предварительно не посмотрели сюда!
- HF Cookbook — Список готовых советов и рецептов для решения прикладных задач. Есть и код, и описание задачи, оформлено в виде блогпостов.
- vLLM, llama.cpp, TGI, sglang, Infinity Embeddings, CTranslate2 — Движки для инференса. vLLM, TGI и sglang для быстрого инференса декодеров на гпу, llama.cpp на цпу. Infinity Embeddings это движок для энкодеров во всех проявлениях, CTranslate2 для энкодер-декодеров.
Ссылки для совсем опытных Кар-Карычей
- Quantization Deep Dive — офигенный хабрапост от Яндекса, где расписывают математическую базу квантизации и про типы данных
- Ускорение LLM: универсальные методы для популярных архитектур — тоже офигенный хабрапост и тоже от Яндекса, где расписывают варианты ускорения инференса
- Статьи от Давида Дале на Хабре — все очень увлекательны и прекрасны. Мои любимые — про декодирование из эмбеддингов LaBSE, про прунинг токенизатора у mt5 и про дистилляцию берта.
- 100 questions about NLP — универсальный список вопросов для подготовки к собесам. Не на все вопросы есть ответы, но все вопросы хорошие.
Этот список, конечно же, неполный, но как база для вката работает на ура. Если есть что-то ещё полезного — кидайте в комменты.
huggingface.co
Introduction · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥10❤3👍1
У меня в личке уже несколько раз спрашивали, как перекатиться в ML рисерч. Рецептом успешного успеха пока не поделюсь, но! - у меня есть кое-что лучше.
❝ — Это ключ!
— Нет, кое-что получше. Это рисунок ключика. ❞
🎬 Пираты Карибского моря: Сундук мертвеца
❝ — Это ключ!
— Нет, кое-что получше. Это рисунок ключика. ❞
🎬 Пираты Карибского моря: Сундук мертвеца
👍7❤1
Forwarded from DLStories
Рисерческие программы, связанные с AI Safety
В моей рисерч деятельности я люблю копаться во внутренностях всяких AI моделей, что-то интересное про это понимать и потом на основе этого придумывать идеи для новых решений downstream задач. Например, моя последняя статья — про то, как контролировать генерацию диффузионной модели с помощью inference-time модификаций выходов слоев cross-attention. И так выходит, что вот это "копаться внутри моделей" сильно связано с interpretability, а применения этого связаны с AI Safety. В этой связи я недавно стала обращать внимание на всякие стажировки/рисерч программы/школы вокруг этих тем, и, как оказалось, их существует очень даже немало)
Если вам тоже такое интересно, то вот несколько ссылок:
(спасибо большое классным людям, которые делятся этими ссылками в чатиках!)
1. Одна из самых, наверное, известных программ по AI Safety — MATS (ML Alignment and Theory Scholars) от Berkeley. Это программа на 10 недель, где вы будете работать над рисерч проектом под руководством ментора из области. Подача на это лето уже закрыта, но, вроде как, следующая должна быть осенью. Если будете подаваться, не откладывайте это на последний момент: там достаточно объемные задания/вопросы, на которые нужно ответить.
На MATS попасть довольно сложно. По крайней мере, меня в прошлом году не взяли, и еще несколько людей вокруг меня тоже. Но у MATS есть список ссылок на альтернативные программы по AI Safety, которые они сами рекомендуют. Там есть курсы, школы, fellowships, и даже поиск фандинга для PhD и рисерча.
2. Еще есть вот список ссылок по Opportunities in AI Safety & Governance. Тут тоже очень-очень много всего разного.
Обратите только внимание, что иногда среди таких программ иногда встречаются не technical (где вы делаете AI Research), а философско-журналисткие на темы вроде "подумать и предложить roadmap регуляции AI в некоторой области". Иногда в одной и той же программе есть несколько треков, поэтому обращайте внимание, на что подаёте
В моей рисерч деятельности я люблю копаться во внутренностях всяких AI моделей, что-то интересное про это понимать и потом на основе этого придумывать идеи для новых решений downstream задач. Например, моя последняя статья — про то, как контролировать генерацию диффузионной модели с помощью inference-time модификаций выходов слоев cross-attention. И так выходит, что вот это "копаться внутри моделей" сильно связано с interpretability, а применения этого связаны с AI Safety. В этой связи я недавно стала обращать внимание на всякие стажировки/рисерч программы/школы вокруг этих тем, и, как оказалось, их существует очень даже немало)
Если вам тоже такое интересно, то вот несколько ссылок:
(спасибо большое классным людям, которые делятся этими ссылками в чатиках!)
1. Одна из самых, наверное, известных программ по AI Safety — MATS (ML Alignment and Theory Scholars) от Berkeley. Это программа на 10 недель, где вы будете работать над рисерч проектом под руководством ментора из области. Подача на это лето уже закрыта, но, вроде как, следующая должна быть осенью. Если будете подаваться, не откладывайте это на последний момент: там достаточно объемные задания/вопросы, на которые нужно ответить.
На MATS попасть довольно сложно. По крайней мере, меня в прошлом году не взяли, и еще несколько людей вокруг меня тоже. Но у MATS есть список ссылок на альтернативные программы по AI Safety, которые они сами рекомендуют. Там есть курсы, школы, fellowships, и даже поиск фандинга для PhD и рисерча.
2. Еще есть вот список ссылок по Opportunities in AI Safety & Governance. Тут тоже очень-очень много всего разного.
Обратите только внимание, что иногда среди таких программ иногда встречаются не technical (где вы делаете AI Research), а философско-журналисткие на темы вроде "подумать и предложить roadmap регуляции AI в некоторой области". Иногда в одной и той же программе есть несколько треков, поэтому обращайте внимание, на что подаёте
❤2
Forwarded from DLStories
И вот еще пара ссылок в тему к прошлому посту:
- Список школ вокруг ML/DL/AI топиков на 2025 год. Список правда огромный, кажется, что тут просто все школы по ML-тематике, которые только есть) Кажется, они делают такой список каждый год, так что и на 2026 потом должен быть.
- Если вы думаете про PhD, то у Meta есть совместные PhD программы с разными универами в нескольких городах (по крайней мере, Лондоне и Париже). То есть, это возможность делать PhD, при этом взаимодействуя с рисерчерами из Meta и получая нормальную зарплату, а не просто университетскую стипендию. Ну и "совместный PhD с Meta Research" просто звучит хорошо)
Если у вас есть еще подобные ссылки на всякие программы, делитесь в комментариях
- Список школ вокруг ML/DL/AI топиков на 2025 год. Список правда огромный, кажется, что тут просто все школы по ML-тематике, которые только есть) Кажется, они делают такой список каждый год, так что и на 2026 потом должен быть.
- Если вы думаете про PhD, то у Meta есть совместные PhD программы с разными универами в нескольких городах (по крайней мере, Лондоне и Париже). То есть, это возможность делать PhD, при этом взаимодействуя с рисерчерами из Meta и получая нормальную зарплату, а не просто университетскую стипендию. Ну и "совместный PhD с Meta Research" просто звучит хорошо)
Если у вас есть еще подобные ссылки на всякие программы, делитесь в комментариях
🔥5❤1
ML misfits club или что делать когда тебя не взяли никуда
TLDR; Я расстроился, что меня не взяли в ШАД, а попутно еще и на россыпь летних рисерческих программ. Поплакав в подушку, решил, что знания нельзя дать, можно только взять, а значит надо замутить свой ШАД / летнюю школу / рисерческо-падаванское коммьюнити с блекджеком и шлюхами. Образовательно-исследовательское сообщество для всех тех "кого не взяли". Будут дедлайны, домашки, а самое главное такие же заинтересованные люди рядышком.
https://vas3k.club/post/28799/
TLDR; Я расстроился, что меня не взяли в ШАД, а попутно еще и на россыпь летних рисерческих программ. Поплакав в подушку, решил, что знания нельзя дать, можно только взять, а значит надо замутить свой ШАД / летнюю школу / рисерческо-падаванское коммьюнити с блекджеком и шлюхами. Образовательно-исследовательское сообщество для всех тех "кого не взяли". Будут дедлайны, домашки, а самое главное такие же заинтересованные люди рядышком.
https://vas3k.club/post/28799/
🔥37👍9😱4🤡3
Баблишко на айтишку: Эпизод II — Атака клонов
Алярма! Тут раздают баблишко тем, кто вкатывается в айтишечку! Баблишко, может, и не самое большое, но от чистого сердца :)
TL;DR: Замутил частную микростипендию для перекатывальщиков. Снова. 40к/месяц в течение 6 месяцев. Без ограничений по текущей сфере деятельности, возрасту и прочей фигне.
P.S. Буду рад если поделитесь этим постом с теми, кому может быть полезно.
P.P.S. Присоединяйтесь к движняку!
https://vas3k.club/post/28980/
https://habr.com/ru/articles/927186/
Алярма! Тут раздают баблишко тем, кто вкатывается в айтишечку! Баблишко, может, и не самое большое, но от чистого сердца :)
TL;DR: Замутил частную микростипендию для перекатывальщиков. Снова. 40к/месяц в течение 6 месяцев. Без ограничений по текущей сфере деятельности, возрасту и прочей фигне.
P.S. Буду рад если поделитесь этим постом с теми, кому может быть полезно.
P.P.S. Присоединяйтесь к движняку!
https://vas3k.club/post/28980/
https://habr.com/ru/articles/927186/
Вастрик.Клуб
Баблишко на айтишку: эпизод II — Вастрик.Клуб
Алярма! Тут раздают баблишко тем, кто вкатывается в айтишечку!
“Ведь мы работаем на старость, нам неведома усталость”
А что если можно по-другому? …
“Ведь мы работаем на старость, нам неведома усталость”
А что если можно по-другому? …
👏10👍7❤6
Yet another book club in tech
Ленка, @lenka_ne_work, упоротая (в хорошем смысле!) гуру системного проганья, запускает новый поток совместного чтения легендарной Designing Data-Intensive Applications! Да-да, той самой книги с кабанчиком.
Я ее три раза начинал читать и бросал по тем или иным причинам. Что ж, с четвертого раза должно прокатить, правда? Хотя бы потому что я подписался этот поток желающих просветиться курировать xD
Звонки каждый четверг вечером с середины августа. Подключайтесь! Тут рады всем!
@lenka_ne_club -> DDIA-4
Ленка, @lenka_ne_work, упоротая (в хорошем смысле!) гуру системного проганья, запускает новый поток совместного чтения легендарной Designing Data-Intensive Applications! Да-да, той самой книги с кабанчиком.
Я ее три раза начинал читать и бросал по тем или иным причинам. Что ж, с четвертого раза должно прокатить, правда? Хотя бы потому что я подписался этот поток желающих просветиться курировать xD
Звонки каждый четверг вечером с середины августа. Подключайтесь! Тут рады всем!
@lenka_ne_club -> DDIA-4
🔥12❤1
Андрюша познает мир
Баблишко на айтишку: Эпизод II — Атака клонов Алярма! Тут раздают баблишко тем, кто вкатывается в айтишечку! Баблишко, может, и не самое большое, но от чистого сердца :) TL;DR: Замутил частную микростипендию для перекатывальщиков. Снова. 40к/месяц в течение…
Та-дам! Падаван выбран! Алексей начинает работу с этой недели. Целью поставили получить работу в качестве бекэнд питониста в команде, где можно будет учиться и расти.
Пожелаем ему удачи и будем следить за успехами!
Дневник Алексея тут @balbesov77
P.S. Благодаря @razum2um инициатива получила удвоенное финансирование, так что в течение пары недель будет выбран еще один падаван!
Пожелаем ему удачи и будем следить за успехами!
Дневник Алексея тут @balbesov77
P.S. Благодаря @razum2um инициатива получила удвоенное финансирование, так что в течение пары недель будет выбран еще один падаван!
🔥17❤4👏3
Андрюша познает мир
Та-дам! Падаван выбран! Алексей начинает работу с этой недели. Целью поставили получить работу в качестве бекэнд питониста в команде, где можно будет учиться и расти. Пожелаем ему удачи и будем следить за успехами! Дневник Алексея тут @balbesov77 P.S. Благодаря…
Та-дам x2! Выбран еще один получатель микростипы - Андрей Серяков (@sexcolliderrock)!
В прошлых сериях:
- Пару лет назад в отчаянном порыве борьбы с экзистенциальным кризисом я решил заняться точечным причинением добра - помочь кому-то залететь в айтишку;
- Выбрал падавана, помогал ему редким советом и посильной материальной поддержкой. Дмитрий нашел работу. Мы за него порадовались;
- Два месяца назад перезапустил проект. Алексей (@balbesov77) недавно начал обучение! Ждем результатов и желаем успехов!
- Владимир (@razum2um) сделал крутейшую штуку и удвоил финансирование проекта! Хорошо для подавшихся, а мне снова копаться в заявках...
Изначально я думал, что в рамках проекта было бы круто помочь людям с, возможно, не самым удачным бекграундом, но с шилом в жопе, пристроить это шило в теплое айтишное кресло. Прошла пара лет. Я знаю о жизни чутоку меньше. На вещи же гляжу чутоку шире.
Порой, сбежать от уже, казалось бы, состоявшейся и успешной карьеры может быть задачей не менее сложной. Вам заранее лепят на лоб лейблик и отказываются воспринимать в новой роли от слова "совсем". Приходится бесконечно доказывать, что с вами вообще стоит разговаривать. На это нужно чертовски много времени, терпения и, внезапно, денег. Кушать все еще хочется!
Так, отставив дальнейшее растекание мыслью по древу (какому такому древу?!), представляю вам Андрея (@sexcolliderrock)! Падваном мне его язык не повернется назвать. Тут я сам буду учиться и с большим интересом смотреть за его исследованиями. Лишь пожелаю большого терпения на пути кардинальной смены направления академической деятельности. И еще раз виртуально пожму руку @razum2um за помощь с финансированием.
Про Андрея со слов Андрея:
"Eх-физик в области столкновений ядер на ускорителях, это об изучении кварк-глюонной плазмы, вещества при температуре 1 000 000 000 000 000 С. Участник международных коллабораций в ЦЕРН и Дубне, ex-сотрудник СПбГУ. Занимался там анализом этих столкновений больше 10 лет.
В этом году поменял сферу исследований, после того, как в голову вдруг пришла идея, что множествено общающихся в сети независимых ИИшек могут создать там свою цивилизацию без какого-либо сознания, а просто оптимизируя свою работу. Тогда я написал об этом статью. И вдруг оказалось, что исследованием этого в мире занимается десяток человек и это супер новая сфера, так что я решил нырнуть! Это же офигеть.
Уже полгода погружаюсь, обучаюсь и веду свои исследования в области коллективного ИИ и ИИ безопасности. Вообще я рожаю куда больше идей, чем успеваю реализовывать."
В прошлых сериях:
- Пару лет назад в отчаянном порыве борьбы с экзистенциальным кризисом я решил заняться точечным причинением добра - помочь кому-то залететь в айтишку;
- Выбрал падавана, помогал ему редким советом и посильной материальной поддержкой. Дмитрий нашел работу. Мы за него порадовались;
- Два месяца назад перезапустил проект. Алексей (@balbesov77) недавно начал обучение! Ждем результатов и желаем успехов!
- Владимир (@razum2um) сделал крутейшую штуку и удвоил финансирование проекта! Хорошо для подавшихся, а мне снова копаться в заявках...
Изначально я думал, что в рамках проекта было бы круто помочь людям с, возможно, не самым удачным бекграундом, но с шилом в жопе, пристроить это шило в теплое айтишное кресло. Прошла пара лет. Я знаю о жизни чутоку меньше. На вещи же гляжу чутоку шире.
Порой, сбежать от уже, казалось бы, состоявшейся и успешной карьеры может быть задачей не менее сложной. Вам заранее лепят на лоб лейблик и отказываются воспринимать в новой роли от слова "совсем". Приходится бесконечно доказывать, что с вами вообще стоит разговаривать. На это нужно чертовски много времени, терпения и, внезапно, денег. Кушать все еще хочется!
Так, отставив дальнейшее растекание мыслью по древу (какому такому древу?!), представляю вам Андрея (@sexcolliderrock)! Падваном мне его язык не повернется назвать. Тут я сам буду учиться и с большим интересом смотреть за его исследованиями. Лишь пожелаю большого терпения на пути кардинальной смены направления академической деятельности. И еще раз виртуально пожму руку @razum2um за помощь с финансированием.
Про Андрея со слов Андрея:
"Eх-физик в области столкновений ядер на ускорителях, это об изучении кварк-глюонной плазмы, вещества при температуре 1 000 000 000 000 000 С. Участник международных коллабораций в ЦЕРН и Дубне, ex-сотрудник СПбГУ. Занимался там анализом этих столкновений больше 10 лет.
В этом году поменял сферу исследований, после того, как в голову вдруг пришла идея, что множествено общающихся в сети независимых ИИшек могут создать там свою цивилизацию без какого-либо сознания, а просто оптимизируя свою работу. Тогда я написал об этом статью. И вдруг оказалось, что исследованием этого в мире занимается десяток человек и это супер новая сфера, так что я решил нырнуть! Это же офигеть.
Уже полгода погружаюсь, обучаюсь и веду свои исследования в области коллективного ИИ и ИИ безопасности. Вообще я рожаю куда больше идей, чем успеваю реализовывать."
🔥25❤3👍2
Я не умею скейлить свои ЛЛМ треньки. Совсем! Но очень хочу научиться!
Леди и джентльмены, зову вас вместе почитать Ultra-scale playbook. Начнем через две недели. Будем читать небольшими частями, чтобы успешно совмещать с работой/жизнью/прочими ништяками.
Мануал:
- Добавляемся в чатик. Язык общения - английский, но если все будут рускоговорящие, то пивотнемся.
- Читаем главу по расписанию.
- Подключаемся к созвонам по четвергам в 14:00 (Лондонское время) - календарик. Будут слайды!
- Участвуем в беседе и, авось, учимся чему-то полезному.
- Пингуем в чатике, если хотите презентовать одну из глав (позязя!)
- Слайды потом зальем на Github
Первый звонок: 30 октября (четверг), 14:00 (по Лондону)
Ссылочки:
- Расписание
- Календарь со звонками
- Репка на GH
- Чатик
Леди и джентльмены, зову вас вместе почитать Ultra-scale playbook. Начнем через две недели. Будем читать небольшими частями, чтобы успешно совмещать с работой/жизнью/прочими ништяками.
Мануал:
- Добавляемся в чатик. Язык общения - английский, но если все будут рускоговорящие, то пивотнемся.
- Читаем главу по расписанию.
- Подключаемся к созвонам по четвергам в 14:00 (Лондонское время) - календарик. Будут слайды!
- Участвуем в беседе и, авось, учимся чему-то полезному.
- Пингуем в чатике, если хотите презентовать одну из глав (позязя!)
- Слайды потом зальем на Github
Первый звонок: 30 октября (четверг), 14:00 (по Лондону)
Ссылочки:
- Расписание
- Календарь со звонками
- Репка на GH
- Чатик
huggingface.co
The Ultra-Scale Playbook - a Hugging Face Space by nanotron
The ultimate guide to training LLM on large GPU Clusters
🔥8❤5🤔3
Одна голова хорошо, но сто лучше, верно? А что если часть этих голов будут ИИ?
@ctrain2042 ищет Python-разраба пилить мульти-агентные системы, где целью стоит синегрия человека и машины!
> И это даже не реклама, т.к. @ctrain2042 я знаю лично!
Более того, ребята не просто пытаются пихать агентов везде где только можно и нельзя, а следуют формальной методологии - системно-мыследеятельностному подходу (СМД). Мышление не рассматривается как индивидуальное психическое свойство, а как особый тип деятельности, возникающий в определённых организационно-деятельностных условиях.
Что надо будет делать:
- Проектировать и развивать сервисы с использованием LLM и RAG,
мультиагентных систем.
- Интегрировать внешние/локальные модели, оптимизировать качество и
стоимость.
- Строить пайплайны подготовки данных и ретрива (векторные БД, эмбеддинги,
реранкинг).
- Проектировать API, наблюдаемость и деплой в контейнерах.
Чего хочется:
- Уверенный Python 3.12+ и асинхронность (asyncio), умение писать чистый,
типизированный код.
- Опыт FastAPI/pydantic, проектирование API (OpenAPI), базовые знания
безопасности.
- Понимание работы LLM: промпт‑дизайн, токенизация, ограничения, потоковые
ответы; опыт с провайдерами/локальными моделями (например, vLLM).
- Опыт с фреймворками/SDK для LLM: LangChain/LlamaIndex;
OpenAI/Anthropic/Google SDK; локальный инференс — vLLM, Hugging Face
T ransformers, Ollama/llama.cpp.
- Базовые знания RAG: эмбеддинги, векторные БД (Qdrant/pgvector), настройка
ретривера; понимание реранкинга.
- Архитектурные принципы и паттерны: SOLID, KISS, DRY, YAGNI, паттерны «банды
четырёх» (GoF) и прочие — применять осознанно и по потребности.
Опционально, но будут очень рады:
- Опыт с очередями (Redis/RabbitMQ), PostgreSQL и Alembic.
- Whisper/аудио и парсинг документов (PDF/HTML/DOCX/EPUB/MHTML).
- Kubernetes/Helm, CI/CD, секрет‑хранилища (Vault/SM), ansible
Локация: Москва
Вилка: 250-350к
@ctrain2042 ищет Python-разраба пилить мульти-агентные системы, где целью стоит синегрия человека и машины!
> И это даже не реклама, т.к. @ctrain2042 я знаю лично!
Более того, ребята не просто пытаются пихать агентов везде где только можно и нельзя, а следуют формальной методологии - системно-мыследеятельностному подходу (СМД). Мышление не рассматривается как индивидуальное психическое свойство, а как особый тип деятельности, возникающий в определённых организационно-деятельностных условиях.
Что надо будет делать:
- Проектировать и развивать сервисы с использованием LLM и RAG,
мультиагентных систем.
- Интегрировать внешние/локальные модели, оптимизировать качество и
стоимость.
- Строить пайплайны подготовки данных и ретрива (векторные БД, эмбеддинги,
реранкинг).
- Проектировать API, наблюдаемость и деплой в контейнерах.
Чего хочется:
- Уверенный Python 3.12+ и асинхронность (asyncio), умение писать чистый,
типизированный код.
- Опыт FastAPI/pydantic, проектирование API (OpenAPI), базовые знания
безопасности.
- Понимание работы LLM: промпт‑дизайн, токенизация, ограничения, потоковые
ответы; опыт с провайдерами/локальными моделями (например, vLLM).
- Опыт с фреймворками/SDK для LLM: LangChain/LlamaIndex;
OpenAI/Anthropic/Google SDK; локальный инференс — vLLM, Hugging Face
T ransformers, Ollama/llama.cpp.
- Базовые знания RAG: эмбеддинги, векторные БД (Qdrant/pgvector), настройка
ретривера; понимание реранкинга.
- Архитектурные принципы и паттерны: SOLID, KISS, DRY, YAGNI, паттерны «банды
четырёх» (GoF) и прочие — применять осознанно и по потребности.
Опционально, но будут очень рады:
- Опыт с очередями (Redis/RabbitMQ), PostgreSQL и Alembic.
- Whisper/аудио и парсинг документов (PDF/HTML/DOCX/EPUB/MHTML).
- Kubernetes/Helm, CI/CD, секрет‑хранилища (Vault/SM), ansible
Локация: Москва
Вилка: 250-350к
🤡9🤣2❤1
Я все никак не разрожусь большим постом-постмортемом о переходе из софтварного инженера в AI рисерч. Он правда-правда есть в черновиках! Тем не менее ему все еще надо помариноваться и пропитаться моими горькими слезами исследовательским духом.
Сегодня же принес анонс топовой возможности получить PhD в AI - новая итерация совместной программы между Оксфордом и Мета*.
Крутейший проф Jakob Foerster набирает к себе падаванов. Надо будет пилить фундаментальный рисерч в области AI research agents. 50% - тусите в Оксфорде, 50% - в Лондоне в офисе Мета.
Это чуть ли не единственная возможность получать нормальные деньги во время PhD в UK! Честно! Я проверял!
Дедлайн подачи: 1 декбаря.
Да прибудет с вами Тьюринг!
* - экстремисты и плохие люди
Сегодня же принес анонс топовой возможности получить PhD в AI - новая итерация совместной программы между Оксфордом и Мета*.
Крутейший проф Jakob Foerster набирает к себе падаванов. Надо будет пилить фундаментальный рисерч в области AI research agents. 50% - тусите в Оксфорде, 50% - в Лондоне в офисе Мета.
Это чуть ли не единственная возможность получать нормальные деньги во время PhD в UK! Честно! Я проверял!
Дедлайн подачи: 1 декбаря.
Да прибудет с вами Тьюринг!
* - экстремисты и плохие люди
X (formerly Twitter)
Jakob Foerster (@j_foerst) on X
Looking for one of the most exciting Phd positions in ML this season? I have some news for you..
Joao Henriques (https://t.co/Bedosf2bDK) and I (https://t.co/GVhCt2KYJQ) are again hiring a fully funded PhD student (UK/international) for the FAIR-Oxford…
Joao Henriques (https://t.co/Bedosf2bDK) and I (https://t.co/GVhCt2KYJQ) are again hiring a fully funded PhD student (UK/international) for the FAIR-Oxford…
🔥12❤1👍1🤡1
Про умножение матриц или как курс по вычислительной линейной алгебре проигрывает жестокой реальности
Мы умеем умножать матрицы быстрее, чем за O(N^3)! По крайней мере, так рассказывают на курсе по алгоритмам. Потом теория сталкивается с "железом", и выясняется, что в DL этим почти никто не пользуется. Но почему?
Для начала вспомним базовые факты про умножение матриц:
- У нас есть матрицы A (b * d) и B (d * k);
- При их умножении нам нужно сделать одно сложение и одно умножение для каждого элемента в паре "строка–столбец";
- Получается b * d * k таких троек для каждой операции;
- Итого 2 * b * d * k троек;
Для квадратных матриц это упрощается до 2 * n^3, то есть O(n^3).
Умный дядька Штрассен когда-то предложил алгоритм, который уменьшает число умножений за счёт рекурсивного разбиения матриц. В сухом остатке теоретическая сложность падает примерно до O(N^2.7).
Сегодня я смотрел лекции "LLM from Scratch" и заметил, что они считают FLOPs что называется "в лоб" - будто в PyTorch используется наивное умножение матриц (скрин из лекции выше). Сначала подумал, что это просто упрощение, чтобы не уходить в численные методы линейной алгебры, но решил копнуть глубже.
Выяснилось, что в DL практически никто не использует алгоритм Штрассена (и его современные, ещё более эффективные аналоги)!
Во-первых, он менее численно устойчив из-за сложений и вычитаний промежуточных подматриц.
Во-вторых, он плохо стыкуется со специализированными тензорными ядрами, которые выполняют операции Matrix Multiply-Accumulate (MMA, `D = A * B + C`) на маленьких матрицах фиксированного размера.
В-третьих, из-за рекурсивной структуры он сильно менее эффективен с точки зрения работы с памятью и кэшем.
Реальность vs теория — 1:0
Мы умеем умножать матрицы быстрее, чем за O(N^3)! По крайней мере, так рассказывают на курсе по алгоритмам. Потом теория сталкивается с "железом", и выясняется, что в DL этим почти никто не пользуется. Но почему?
Для начала вспомним базовые факты про умножение матриц:
- У нас есть матрицы A (b * d) и B (d * k);
- При их умножении нам нужно сделать одно сложение и одно умножение для каждого элемента в паре "строка–столбец";
- Получается b * d * k таких троек для каждой операции;
- Итого 2 * b * d * k троек;
Для квадратных матриц это упрощается до 2 * n^3, то есть O(n^3).
Умный дядька Штрассен когда-то предложил алгоритм, который уменьшает число умножений за счёт рекурсивного разбиения матриц. В сухом остатке теоретическая сложность падает примерно до O(N^2.7).
Сегодня я смотрел лекции "LLM from Scratch" и заметил, что они считают FLOPs что называется "в лоб" - будто в PyTorch используется наивное умножение матриц (скрин из лекции выше). Сначала подумал, что это просто упрощение, чтобы не уходить в численные методы линейной алгебры, но решил копнуть глубже.
Выяснилось, что в DL практически никто не использует алгоритм Штрассена (и его современные, ещё более эффективные аналоги)!
Во-первых, он менее численно устойчив из-за сложений и вычитаний промежуточных подматриц.
Во-вторых, он плохо стыкуется со специализированными тензорными ядрами, которые выполняют операции Matrix Multiply-Accumulate (MMA, `D = A * B + C`) на маленьких матрицах фиксированного размера.
В-третьих, из-за рекурсивной структуры он сильно менее эффективен с точки зрения работы с памятью и кэшем.
Реальность vs теория — 1:0
👍9❤3😱2
🎉🎉🎉 Та-дам! Мою первую научную работу первым автором взяли на большую конфу!
Если вы не очень в теме академической жизни в ML, то я сейчас все-все-все расскажу.
Дано. Андрюша. Пилил веб. Ушел в машинное обучение полтора года назад с околонулевой математикой и без знаний по ML.
Поучился в Сколтехе. Присоединился к клевой лабе и опубликовал первый небольшой рисерч с полгода назад на российской конфе в составе группы.
Начал лидить команду. Вместе мы родили работу, которая и стала причиной этого поста.
Почему это важно. Академическая жизнь в любом домене крутится вокруг публикаций. Публикации могут быть в научных журналах или на конференциях. Точнее, технически публикация может быть где угодно (хоть в вашем личном бложеке), но всем будет на нее пофиг (если вы не команда DeepSeek xD).
У конференций и журналов есть ранжирование по научному импакту. Публикация в Nature != публикация в "Вестник котовой коллегии Простоквашино".
Так сложилось, что в ML сообществе чаще публикуются на конференциях. Возможно, потому чтоих часто проводят в красивых местах, и ученые так на халяву ездят погреться на солнышке или пропитаться культурной жизнью млщики очень экстравертные и любят общаться с коллегами.
Так, вот, мою работу как раз и приняли на хорошую конфу, которая достаточно высоко котируется! Ура!
Что дальше. Дальше у меня собесы на рисерч инженера в несколько оооочень интересных мест. Обновление курса по машинному обучению в Сколтехе. И, надеюсь, новые публикации. И многострадальный большой пост по перкатыванию в МЛ.
P.S. Дедушка Мороз застрял в вечно ломающихся британских поездах и привез подарок чуть позже. Что ж, главное, что привез!
Если вы не очень в теме академической жизни в ML, то я сейчас все-все-все расскажу.
Дано. Андрюша. Пилил веб. Ушел в машинное обучение полтора года назад с околонулевой математикой и без знаний по ML.
Поучился в Сколтехе. Присоединился к клевой лабе и опубликовал первый небольшой рисерч с полгода назад на российской конфе в составе группы.
Начал лидить команду. Вместе мы родили работу, которая и стала причиной этого поста.
Почему это важно. Академическая жизнь в любом домене крутится вокруг публикаций. Публикации могут быть в научных журналах или на конференциях. Точнее, технически публикация может быть где угодно (хоть в вашем личном бложеке), но всем будет на нее пофиг (если вы не команда DeepSeek xD).
У конференций и журналов есть ранжирование по научному импакту. Публикация в Nature != публикация в "Вестник котовой коллегии Простоквашино".
Так сложилось, что в ML сообществе чаще публикуются на конференциях. Возможно, потому что
Так, вот, мою работу как раз и приняли на хорошую конфу, которая достаточно высоко котируется! Ура!
Что дальше. Дальше у меня собесы на рисерч инженера в несколько оооочень интересных мест. Обновление курса по машинному обучению в Сколтехе. И, надеюсь, новые публикации. И многострадальный большой пост по перкатыванию в МЛ.
P.S. Дедушка Мороз застрял в вечно ломающихся британских поездах и привез подарок чуть позже. Что ж, главное, что привез!
🔥59👏20❤11🎉10
Андрюша познает мир
Я не умею скейлить свои ЛЛМ треньки. Совсем! Но очень хочу научиться! Леди и джентльмены, зову вас вместе почитать Ultra-scale playbook. Начнем через две недели. Будем читать небольшими частями, чтобы успешно совмещать с работой/жизнью/прочими ништяками.…
Напомню, что мы все еще читаем The Ultra-Scale Playbook! Можно посмотреть старые записи и присоединиться.
Сегодня разбирали "5D parallelism in a Nutshell". TL;DR:
• DP (data parallelism) - база;
• Все, кто тренят на GPU, юзают PP (pipeline parallelism);
• TPUs (читаем Гугл) жертвуют PP в пользу TP (tensor parallelism);
• Внезапно, ZeRO-1 > ZeRO-2 для Deepseek.
Запись и слайды тут. Картиночки прилагаются. Репосты в Твиттере и на Линкедине горячо приветствуются. Желающие почитать и обсудить "Finding the Best Training Configuration" очень ожидаются на следующем созвоне 22 января!
Сегодня разбирали "5D parallelism in a Nutshell". TL;DR:
• DP (data parallelism) - база;
• Все, кто тренят на GPU, юзают PP (pipeline parallelism);
• TPUs (читаем Гугл) жертвуют PP в пользу TP (tensor parallelism);
• Внезапно, ZeRO-1 > ZeRO-2 для Deepseek.
Запись и слайды тут. Картиночки прилагаются. Репосты в Твиттере и на Линкедине горячо приветствуются. Желающие почитать и обсудить "Finding the Best Training Configuration" очень ожидаются на следующем созвоне 22 января!
❤5
Кто-нибудь хочет вместе поразбираться с тем, как нынче принято делать агентов в проде? С понедельника хочу плотненько засесть за "Agentic Design Patterns: A Hands-On Guide to Building Intelligent Systems".
План-капкан:
• Читаем по главе в день;
• Каждый день в 15:00 по Лондону собираемся на звонок для обсуждения;
• На каждый звонок будет презентация с обзором ключевых моментов главы (или каким-то доп контекстом);
• Звонки записываются, чтобы можно было догнать группу, еслибес попутал пропустили;
• К концу феварля дочитываем всю книжку.
Если план звучит как-то знакомо, то это потому что мы уже читаем по похожей схеме "The Ultra-Scale Playbook". Правда, в более расслабленном режиме с созвоноами раз в неделю. Две книги лучше чем одна, верно?
Инвайт в чатик с анонсами (eng-speaking) и в дискорд (вдруг так получится привлечь больше людей за пределами русскоговорящего коммьюнити?). Анонсы буду кросс-постить и туда, и туда.
План-капкан:
• Читаем по главе в день;
• Каждый день в 15:00 по Лондону собираемся на звонок для обсуждения;
• На каждый звонок будет презентация с обзором ключевых моментов главы (или каким-то доп контекстом);
• Звонки записываются, чтобы можно было догнать группу, если
• К концу феварля дочитываем всю книжку.
Если план звучит как-то знакомо, то это потому что мы уже читаем по похожей схеме "The Ultra-Scale Playbook". Правда, в более расслабленном режиме с созвоноами раз в неделю. Две книги лучше чем одна, верно?
Инвайт в чатик с анонсами (eng-speaking) и в дискорд (вдруг так получится привлечь больше людей за пределами русскоговорящего коммьюнити?). Анонсы буду кросс-постить и туда, и туда.
Amazon
Agentic Design Patterns: A Hands-On Guide to Building Intelligent Systems
Agentic Design Patterns: A Hands-On Guide to Building Intelligent Systems
🔥5❤1
В этом году занимаюсь подготовкой домашек для студентов ML курса в Сколтехе. После множества пройденных (и заваленных) собеседований я, кажется, начал немножечко понимать, чего лично мне не хватало в момент обучения - глубокого понимания не очень большого числа базовых алгоритмов. Что ж, что мне боль, то новым студентам опыт!
В моем инженерном видении мира понимание невозможно без того, чтобы сделать реплику своими руками с нуля. В то же время не хотелось, чтобы обучение уперлось в страх перед чистым листом. Хотелось по шагам подвести к каждой задаче. Показать как она складывается из небольших кирпичиков.
Решив с формой постановки задачи, оставалось решить как проверять и как давать ребятам фидбек. С одной стороны можно проверять правильность решения вручную, но это сильно загружает преподавательскую команду и не дает студентам возможность учиться на своих ошибках. Что есть взять за основу подход к разработке индустриального софта и обмазаться автотестами? Студенты получают какой-то стартовый шаблон и набор тестов. А дальше... Дальше они взрослые люди, которые должны научиться анализировать ошибки интерпретатора и выполнять требованияпосланные свыше всеми доступными способами.
В результате подготовил набор задачек по классике машинного обучения с автопроверкой тестами. А это значит что любой может попробовать выполнить эти домашки и почувствовать себя совсем чууууууточку студентом Сколтеха.
Первая домашка с решением (отдельно) уже на Гитхабе. Планируется еще две. Выложу как задачи, так и решения. Буду рад если попробуете решить и придете с комментариями!
В моем инженерном видении мира понимание невозможно без того, чтобы сделать реплику своими руками с нуля. В то же время не хотелось, чтобы обучение уперлось в страх перед чистым листом. Хотелось по шагам подвести к каждой задаче. Показать как она складывается из небольших кирпичиков.
Решив с формой постановки задачи, оставалось решить как проверять и как давать ребятам фидбек. С одной стороны можно проверять правильность решения вручную, но это сильно загружает преподавательскую команду и не дает студентам возможность учиться на своих ошибках. Что есть взять за основу подход к разработке индустриального софта и обмазаться автотестами? Студенты получают какой-то стартовый шаблон и набор тестов. А дальше... Дальше они взрослые люди, которые должны научиться анализировать ошибки интерпретатора и выполнять требования
В результате подготовил набор задачек по классике машинного обучения с автопроверкой тестами. А это значит что любой может попробовать выполнить эти домашки и почувствовать себя совсем чууууууточку студентом Сколтеха.
Первая домашка с решением (отдельно) уже на Гитхабе. Планируется еще две. Выложу как задачи, так и решения. Буду рад если попробуете решить и придете с комментариями!
❤25👍4🔥2
Ребятушки, зазываю вас вместе читать и обсуждать "The Smol Training Playbook: The Secrets to Building World-Class LLMs"!
От авторов книги:
What does it actually take to train a high-performance LLM today? Published research makes it look straightforward: strategic architecture choices, carefully curated datasets, and sufficient compute. The reality is messier, more iterative, and full of decisions that don’t make it into the final paper.
TL;DR: обещают полный тренинг рецепт SmolLM3 от претрена до RL без купюр и замалчиваний.
Расписание: каждый четверг, 14:00 (время по Лондону), первый созвон 19 марта.
Чего ожидать:
• Читаем главу из книги
• Запрыгиваем на звонок
• Смотрим презу по главе или презентуем сами
• Участвуем в обсуждении
• Слайды будут заливаться на Github, записи звонков на Youtube
Ссылочки:
• Календарь
• Слайды, записи, расписание
• Инвайт в чатик
От авторов книги:
What does it actually take to train a high-performance LLM today? Published research makes it look straightforward: strategic architecture choices, carefully curated datasets, and sufficient compute. The reality is messier, more iterative, and full of decisions that don’t make it into the final paper.
TL;DR: обещают полный тренинг рецепт SmolLM3 от претрена до RL без купюр и замалчиваний.
Расписание: каждый четверг, 14:00 (время по Лондону), первый созвон 19 марта.
Чего ожидать:
• Читаем главу из книги
• Запрыгиваем на звонок
• Смотрим презу по главе или презентуем сами
• Участвуем в обсуждении
• Слайды будут заливаться на Github, записи звонков на Youtube
Ссылочки:
• Календарь
• Слайды, записи, расписание
• Инвайт в чатик
huggingface.co
The Smol Training Playbook - a Hugging Face Space by HuggingFaceTB
The secrets to building world-class LLMs
❤6👍2