Андрюша познает мир
813 subscribers
12 photos
42 links
AI рисерч падаван и несостоявшаяся рок-звезда. Отчаянно фейлюсь везде и делюсь кулстори на страницах этого бложика.
По совместительству, дневничок моего внутреннего 15-летнего подростка, который верит в романтику и чудеса.
Download Telegram
Андрюша познает мир
Ребятушки, студент нашелся и начинает работу. Прошу любить и жаловать - Дмитрий! А вот и его публичный дневник, как и обещал.
Ура-ура-ура! Спустя 4 месяца самостоятельного обучения, полного сомнений в выбранном пути, спустя множество недель "работы в стол", Дмитрий нашел работу!
Он оправдал мои самые смелые ожидания от стипендиального проекта. Эксперимент удался!

https://splcell.hashnode.dev/otchet-po-obucheniyu-s-150124-po-190124
1
Не перестаю удивляться роду человеческому. Прозвучало как сарказм, да? В 95% случаев моя токсичная натура именно в таком формате и излила бы образчик бесценной критики в окружающий мир, но не в этот раз. Сегодня я бы хотел восхититься тем, что делают другие люди, и восхищением поделиться.

Как новоиспеченный ML-неофит я подписан на россыпь каналов по теме машинного обучения. В их числе и канал Татьяны Гайнцевой DLStories, вчерашний пост которого и послужил поводом этой маленькой заметки.

Как я упоминал в разные времена в той или иной форме, у меня пунктик на образовании. Тем не менее писать в бложек о том, что есть "пунктик на образовании", дело куда более малозатратное, чем этим самым образованием заниматься. У меня всегда находился благовидный предлог отложить очередную инициативу: финансовое благополучие семьи, учеба, синдром самозванца, выгорание, развод. Плеяда рационально обоснованных инструментов направленная на усмирение ревущего в бессилии внутреннего дитешки, который хочет дотянуться до звезд. И как же радует, что несмотря на нагромождение сложностей преподнесенных судьбой, находятся люди, которые делают правое дело.
Просто. Берут. И. Делают.

Занимаются школьниками, вместо того, чтобы провести дополнительную платную консультацию. Создают фантастические бесплатные курсы вместо того, чтобы закрыть их за пейволлом. Пишут открытый код и проводят открытые исследования вместо того, чтобы посмотреть очередной сериал на Netflix.

Ребята, я в абсолютном восторге от того, что вы делаете. И я уверен, что я такой не один. Низкий поклон и чистосердечное спасибо!

#сентябрь_горит
18🔥2🤡2
В 15 лет я впервые сел за барабаны.
В 18 привез через половину земного шарика 3 чемодана музыкального оборудования и сделал рок-группу с лучшим другом.
В 21 поступил в музыкальное училище только-только закончив универ.
В 22 ушел из музыки и сфокусировался на программировании, оставив недописанным дебютный альбом.
В 31, наконец, закрыл гештальт и выпустил материал, прозябавший в цифровой ссылке последние 9 лет.

🎵 https://notsoalive.goncharov.page/

#до_ре_мистоевский
🔥212
Андрюша познает мир
https://vas3k.club/post/19565/
Пришла пора подвести промежуточные итоги по надёжному как швейцарские часы плану перекатиться в ML. Поехали!

1. Это был чересчур амбициозный план. Математика за такое время не учится. По крайней мере мной :) Мне кажется, что более реалистичный таймлайн и программа здесь. Этот курс я у них не проходил, но пользовался задачниками.
Хорошие материалы для обучения предложены здесь.
2. Меня накрыло разводом и всякими последующими экзистенциальными кризисами, так что я с осени 2023 занимался чем угодно только не учебой. Когда очнулся к зиме, то понял, что дело дрянь, и перекатываться получается как-то хреново.
Итак, на дворе январь или даже февраль. Ныть, конечно, дело благодатное, но не очень полезное. Вспомнил, что вообще-то у меня был всем охуенный план Г - поступить куда-то. Охуенный всем кроме времени начала набора на программы. И если раньше казалось, что это терять целый год, то теперь стало казаться, что "Ааааа! У меня всего несколько месяцев на подготовку! Все пропало".
Свято уверовав в то, что коллектив и окружение решают, я решил готовиться и поступать в ШАД или AI Masters.
3. Несколько недель я спустя задался вопросом: как я буду совмещать будущую учебу с работой? Эго нашептывало сладостную песню о том, что все получится, - я в лучших голливудских традициях буду все героически преодолевать, а в конце заиграет такая эпичная спокойная музыка, и меня покажут умудренным опытом старцем.
Пока ЧСВ рисовало молочные реки, глас рассудка валялся в истерическом припадке. Во-первых, я только-только последние полгода занимался походами, боксом, музыкой и кучей других интереснейших вещей, но не учебой. Намекает на мои текущие возможности совмещать серьезную интеллектуальную деятельность с работой. Во-вторых, во время обучения в Georgia Tech я мог комфортно брать ровно один курс в семестр в параллель с работой. Это меньше нагрузки ШАДа. А ведь я еще хотел позаниматься рисерчем! В-третьих, мне уже сейчас ботать вышмат для поступления давалось с большим трудом. С чего бы дальше стало легче?
4. Что имеем на данном этапе? Оставаться в вебе не хочется. Подготовка к поступлению в ШАД идет со скрипом. Не понятно как потом учиться. Из 4 всадников апокалипсиса светлого будущего (сон, спорт, работа, учеба) мне надо было выбрать 3. Отказаться от спорта и сна - верный путь поехать кукухой. Методом исключения получается так, что надо отказываться от... работы? Почему-то раньше мне это в голову совсем не приходило.
5. Подсчитав финансы, прикинув, что мне реально нужно для жизни (оказалось, что очень и очень не много), понял, что если доработаю до конца лета, то смогу в том же Лондоне потом минимум год (а то и два!) не работать. Но если уж мы начали задаваться неортодоксальными вопросами, то зачем останавливаться? Почему именно Лондон? Что если поехать куда-то в существенно более дешевое место?
Не буду утомлять дальнейшей долгой цепочкой размышлений. Перейду сразу к выводам - решил поступать на одну из топовых технических программ в магистратуру в России (смогу хвастать потом, что дважды магистр xD) - ШАД + ВШЭ, ИТМО, Сколтех. В параллель пробовал пройти на программы альтернативного образования - ШАД и AI Masters.
6. Ура! Финальный пункт с результатами!
Поступил в магистратуру по Data Science в Сколтех. Уволился с работы. На момент написания этого поста сижу в квартире через дорогу от красивейшего кампуса после оргсобрания перед началом первого учебного года.
32👏17🔥12👍7🤣1
Потерянные люди ищут потерянных людей,
Переплетают свои судьбы ради потерянных детей.
Потерянные дети отчаянно хотят найтись
И взглядом ищут тех, кто ищет, - по сторонам, под ноги, ввысь.

Потерянно идут со школы, потерянно сидят одни.
Летят потерянные годы, ползут потерянные дни.
Сжирают книги стеллажами и обретают там друзей.
Наедине с собой и Богом - дети потерянных идей.

Потерянно играют роли, потом выходят на поклон.
Находят счастье они в горе, никак не могут найти дом.
Читают умных и великих, бегут от сладостных страстей,
Но вечерами так же жаждут рядом потерянных людей.

Потерянно взирают в небо, потерянно влачатся вдаль,
А небо слышит, небо плачет, небу становится их жаль.
Потерянные раньше люди находят близких им людей,
Переплетают свои судьбы и создают новых детей.

#до_ре_мистоевский
🔥148👏4🤔1😈1
Андрюша познает мир
Пришла пора подвести промежуточные итоги по надёжному как швейцарские часы плану перекатиться в ML. Поехали! 1. Это был чересчур амбициозный план. Математика за такое время не учится. По крайней мере мной :) Мне кажется, что более реалистичный таймлайн и…
С вами нерегулярная рубрика "Из софтварного инженера в ML рисерч".
В декабре мне повезло попасть в отличную лабу с теплой ламповой атмосферой. Несколько месяцев спустя, подъехала первая публикация!
В папире мы исследуем связь энтропии и галлюцинаций в LLM есть красивые графики и даже формулки (верный признак качества).
Хотелось бы сказать спасибо всей команде и отдельное спасибо научному руководителю - Зайцеву Алексею, который этим условно контроллируемым хаосом (тобишь нами) управлял.
Какой-то большой апдейт по учебе в Сколтехе и по результатам будет ближе к кончу учебного года (= к лету). Тем временем можно вместе со мной порадоваться запаху весны и первым осязаемым результатам учебы ;)
🔥247🎉5👍1
Курс молодого ресёрчера

Меня в последнее время уж слишком часто спрашивают, чё почитать, чтобы вкатиться в нлп, а я каждый раз пересылаю целую батарею из ссылок, которую я создал год назад. Пришло время обновить ссылки, организовать их в аккуратненький пост и потом кидать уже его.

Ссылки для обучения базе:

- HF NLP Course — Платиновая база. Это надо прочитать, чтобы научиться делать свои минимальные штуки на уровне инженера. Курс больше прикладной, не теоретический, учит взаимодействию с transformers. Он постоянно обновляется и там появляются туториалы по next big thing — например, там уже есть глава про reasoning models.
- Плейлист с лекциями Карпатого и его же гитхаб — Ещё более платиновая и ещё более база. Я очень плохо воспринимаю лекции и обычно смотрю их на х2, но тут и очень понятные объяснения, и иллюстрации в виде питоновского кода в тетрадках, и скорость изложения ровно такая, какая надо. В описаниях к видео есть домашки, если чувствуете, что надо получше разобраться, делайте их :)
- Зоопарк трансформеров — Чуть устаревшая статья на хабре, где описываются разные модификации трансформеров. Для каждой архитектуры и модели кратко описаны ключевые изменения. Новых моделей за последние пару лет тут, к сожалению, нет, но чтобы понять как всё развивалось, этого будет достаточно.
- Attention is all you need — Самая главная статья из современного NLP. Стоит прочитать, осознать и запомнить, потому что по сути с тех пор языковые модели практически не менялись.
- NLP Course For You — Классический курс по базе NLP, есть много про дотрансформерные методы. Мне кажется, что он уже не так актуален, но ознакомиться всё равно стоит.
- NLP чат — Уютненький чятик, где обсуждают новости и задают вопросы. Ваш покорный слуга выступает там в роли бесплатной добровольной техподдержки.

Ссылки для "уже смешариков", чтобы читать новости и развиваться дальше

- LocalLLaMA — Самый популярный сабреддит про локальный инференс ллмок. Все новости обычно появляются там.
- HF Daily Papers — Рассылка свежих статей по DL. Очень советую подписаться по почте, чтобы утром просматривать заголовки и читать интересующее. Помогает очень сильно расширить кругозор.
- lmarena.ai — Тут можно потыкать разные модельки руками, сравнить их и посмотреть, как они отвечают. Удобно, если надо быстро сделать сбс или проверить какую-то гипотезу.
- openrouter.ai — Сайт, где можно использовать модели через апи. Очень дёшево (по сравнению с аналогами), очень удобно. Оплачивается криптой, иностранной картой или через платиру/ggsel.
- 5 Levels of Text Splitting и RAG Techniques — Всё, что вы хотели знать про RAG, других ссылок, по сути, не нужно. В первой разбираются, как правильно сплитить текст для базы знаний, во второй рассматривают все типичные архитектуры и трюки, связанные с рагом.
- MTEB — Рейтинг эмбеддеров. Чем выше, тем лучше. Не спрашивайте в нлп чате, что выбрать, если предварительно не посмотрели сюда!
- HF Cookbook — Список готовых советов и рецептов для решения прикладных задач. Есть и код, и описание задачи, оформлено в виде блогпостов.
- vLLM, llama.cpp, TGI, sglang, Infinity Embeddings, CTranslate2 — Движки для инференса. vLLM, TGI и sglang для быстрого инференса декодеров на гпу, llama.cpp на цпу. Infinity Embeddings это движок для энкодеров во всех проявлениях, CTranslate2 для энкодер-декодеров.

Ссылки для совсем опытных Кар-Карычей

- Quantization Deep Dive — офигенный хабрапост от Яндекса, где расписывают математическую базу квантизации и про типы данных
- Ускорение LLM: универсальные методы для популярных архитектур — тоже офигенный хабрапост и тоже от Яндекса, где расписывают варианты ускорения инференса
- Статьи от Давида Дале на Хабре — все очень увлекательны и прекрасны. Мои любимые — про декодирование из эмбеддингов LaBSE, про прунинг токенизатора у mt5 и про дистилляцию берта.
- 100 questions about NLP — универсальный список вопросов для подготовки к собесам. Не на все вопросы есть ответы, но все вопросы хорошие.

Этот список, конечно же, неполный, но как база для вката работает на ура. Если есть что-то ещё полезного — кидайте в комменты.
🔥103👍1
У меня в личке уже несколько раз спрашивали, как перекатиться в ML рисерч. Рецептом успешного успеха пока не поделюсь, но! - у меня есть кое-что лучше.

❝ — Это ключ!
— Нет, кое-что получше. Это рисунок ключика. ❞

🎬 Пираты Карибского моря: Сундук мертвеца
👍71
Forwarded from DLStories
Рисерческие программы, связанные с AI Safety

В моей рисерч деятельности я люблю копаться во внутренностях всяких AI моделей, что-то интересное про это понимать и потом на основе этого придумывать идеи для новых решений downstream задач. Например, моя последняя статья — про то, как контролировать генерацию диффузионной модели с помощью inference-time модификаций выходов слоев cross-attention. И так выходит, что вот это "копаться внутри моделей" сильно связано с interpretability, а применения этого связаны с AI Safety. В этой связи я недавно стала обращать внимание на всякие стажировки/рисерч программы/школы вокруг этих тем, и, как оказалось, их существует очень даже немало)

Если вам тоже такое интересно, то вот несколько ссылок:
(спасибо большое классным людям, которые делятся этими ссылками в чатиках!)

1. Одна из самых, наверное, известных программ по AI Safety — MATS (ML Alignment and Theory Scholars) от Berkeley. Это программа на 10 недель, где вы будете работать над рисерч проектом под руководством ментора из области. Подача на это лето уже закрыта, но, вроде как, следующая должна быть осенью. Если будете подаваться, не откладывайте это на последний момент: там достаточно объемные задания/вопросы, на которые нужно ответить.

На MATS попасть довольно сложно. По крайней мере, меня в прошлом году не взяли, и еще несколько людей вокруг меня тоже. Но у MATS есть список ссылок на альтернативные программы по AI Safety, которые они сами рекомендуют. Там есть курсы, школы, fellowships, и даже поиск фандинга для PhD и рисерча.

2. Еще есть вот список ссылок по Opportunities in AI Safety & Governance. Тут тоже очень-очень много всего разного.

Обратите только внимание, что иногда среди таких программ иногда встречаются не technical (где вы делаете AI Research), а философско-журналисткие на темы вроде "подумать и предложить roadmap регуляции AI в некоторой области". Иногда в одной и той же программе есть несколько треков, поэтому обращайте внимание, на что подаёте
2
Forwarded from DLStories
И вот еще пара ссылок в тему к прошлому посту:

- Список школ вокруг ML/DL/AI топиков на 2025 год. Список правда огромный, кажется, что тут просто все школы по ML-тематике, которые только есть) Кажется, они делают такой список каждый год, так что и на 2026 потом должен быть.
- Если вы думаете про PhD, то у Meta есть совместные PhD программы с разными универами в нескольких городах (по крайней мере, Лондоне и Париже). То есть, это возможность делать PhD, при этом взаимодействуя с рисерчерами из Meta и получая нормальную зарплату, а не просто университетскую стипендию. Ну и "совместный PhD с Meta Research" просто звучит хорошо)

Если у вас есть еще подобные ссылки на всякие программы, делитесь в комментариях
🔥51
ML misfits club или что делать когда тебя не взяли никуда

TLDR; Я расстроился, что меня не взяли в ШАД, а попутно еще и на россыпь летних рисерческих программ. Поплакав в подушку, решил, что знания нельзя дать, можно только взять, а значит надо замутить свой ШАД / летнюю школу / рисерческо-падаванское коммьюнити с блекджеком и шлюхами. Образовательно-исследовательское сообщество для всех тех "кого не взяли". Будут дедлайны, домашки, а самое главное такие же заинтересованные люди рядышком.

https://vas3k.club/post/28799/
🔥37👍9😱4🤡3
Баблишко на айтишку: Эпизод II — Атака клонов

Алярма! Тут раздают баблишко тем, кто вкатывается в айтишечку! Баблишко, может, и не самое большое, но от чистого сердца :)

TL;DR: Замутил частную микростипендию для перекатывальщиков. Снова. 40к/месяц в течение 6 месяцев. Без ограничений по текущей сфере деятельности, возрасту и прочей фигне.

P.S. Буду рад если поделитесь этим постом с теми, кому может быть полезно.
P.P.S. Присоединяйтесь к движняку!

https://vas3k.club/post/28980/
https://habr.com/ru/articles/927186/
👏10👍76
Yet another book club in tech

Ленка, @lenka_ne_work, упоротая (в хорошем смысле!) гуру системного проганья, запускает новый поток совместного чтения легендарной Designing Data-Intensive Applications! Да-да, той самой книги с кабанчиком.

Я ее три раза начинал читать и бросал по тем или иным причинам. Что ж, с четвертого раза должно прокатить, правда? Хотя бы потому что я подписался этот поток желающих просветиться курировать xD

Звонки каждый четверг вечером с середины августа. Подключайтесь! Тут рады всем!

@lenka_ne_club -> DDIA-4
🔥121
Андрюша познает мир
Баблишко на айтишку: Эпизод II — Атака клонов Алярма! Тут раздают баблишко тем, кто вкатывается в айтишечку! Баблишко, может, и не самое большое, но от чистого сердца :) TL;DR: Замутил частную микростипендию для перекатывальщиков. Снова. 40к/месяц в течение…
Та-дам! Падаван выбран! Алексей начинает работу с этой недели. Целью поставили получить работу в качестве бекэнд питониста в команде, где можно будет учиться и расти.
Пожелаем ему удачи и будем следить за успехами!

Дневник Алексея тут @balbesov77

P.S. Благодаря @razum2um инициатива получила удвоенное финансирование, так что в течение пары недель будет выбран еще один падаван!
🔥174👏3
Андрюша познает мир
Та-дам! Падаван выбран! Алексей начинает работу с этой недели. Целью поставили получить работу в качестве бекэнд питониста в команде, где можно будет учиться и расти. Пожелаем ему удачи и будем следить за успехами! Дневник Алексея тут @balbesov77 P.S. Благодаря…
Та-дам x2! Выбран еще один получатель микростипы - Андрей Серяков (@sexcolliderrock)!

В прошлых сериях:
- Пару лет назад в отчаянном порыве борьбы с экзистенциальным кризисом я решил заняться точечным причинением добра - помочь кому-то залететь в айтишку;
- Выбрал падавана, помогал ему редким советом и посильной материальной поддержкой. Дмитрий нашел работу. Мы за него порадовались;
- Два месяца назад перезапустил проект. Алексей (@balbesov77) недавно начал обучение! Ждем результатов и желаем успехов!
- Владимир (@razum2um) сделал крутейшую штуку и удвоил финансирование проекта! Хорошо для подавшихся, а мне снова копаться в заявках...

Изначально я думал, что в рамках проекта было бы круто помочь людям с, возможно, не самым удачным бекграундом, но с шилом в жопе, пристроить это шило в теплое айтишное кресло. Прошла пара лет. Я знаю о жизни чутоку меньше. На вещи же гляжу чутоку шире.

Порой, сбежать от уже, казалось бы, состоявшейся и успешной карьеры может быть задачей не менее сложной. Вам заранее лепят на лоб лейблик и отказываются воспринимать в новой роли от слова "совсем". Приходится бесконечно доказывать, что с вами вообще стоит разговаривать. На это нужно чертовски много времени, терпения и, внезапно, денег. Кушать все еще хочется!

Так, отставив дальнейшее растекание мыслью по древу (какому такому древу?!), представляю вам Андрея (@sexcolliderrock)! Падваном мне его язык не повернется назвать. Тут я сам буду учиться и с большим интересом смотреть за его исследованиями. Лишь пожелаю большого терпения на пути кардинальной смены направления академической деятельности. И еще раз виртуально пожму руку @razum2um за помощь с финансированием.

Про Андрея со слов Андрея:

"Eх-физик в области столкновений ядер на ускорителях, это об изучении кварк-глюонной плазмы, вещества при температуре 1 000 000 000 000 000 С. Участник международных коллабораций в ЦЕРН и Дубне, ex-сотрудник СПбГУ. Занимался там анализом этих столкновений больше 10 лет.

В этом году поменял сферу исследований, после того, как в голову вдруг пришла идея, что множествено общающихся в сети независимых ИИшек могут создать там свою цивилизацию без какого-либо сознания, а просто оптимизируя свою работу. Тогда я написал об этом статью. И вдруг оказалось, что исследованием этого в мире занимается десяток человек и это супер новая сфера, так что я решил нырнуть! Это же офигеть.

Уже полгода погружаюсь, обучаюсь и веду свои исследования в области коллективного ИИ и ИИ безопасности. Вообще я рожаю куда больше идей, чем успеваю реализовывать."
🔥253👍2