BigData Team (BDT)
800 subscribers
524 photos
13 videos
357 links
BigData Team: the way you learn best

Практико-ориентированное обучение по Big Data, Machine Learning, промышленной разработке на Python.

https://bigdatateam.org/ru

Чтобы бустнуть: https://t.me/boost/bigdatateam
Download Telegram
🔞 Три самых главных слова этого лета

credit за находку: Евгений Адищев
// CDO и преподаватель образовательных курсов BigData Team

Прислать ваш мем в конкурс мемасиков можно в личку этого канала.

P.S. всем хороших выходных и не забываем ставить лайки, авторам будет приятно.

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#meme #AgenticCoding #BigDataTeam
7🔥4
💤 Идеальный код, который никто не запускал
рубрика pro #ml

Открываешь присланный ноутбук: код чистый, структура на месте, комментарии по делу. Листаешь вниз, а у каждой ячейки пусто. In [ ]:, ни одного вывода, execution_count = 0. Модель описана, обучение написано, метрика где-то в тексте даже заявлена. Только всё это ни разу не прогонялось.

Мысль тут простая до обидного: непрогнанный код — это ещё не результат, а только заявка на него. Пока ячейка не выполнена, судить особо не о чем: неизвестно, обучается ли модель, сходится ли лосс, чему на самом деле равна метрика. Тихие ошибки любят прятаться именно здесь: несовпадение форм тензоров, не то устройство, внезапный OOM. Вылезают они ровно в момент запуска, а не раньше.

Где это ловится чаще всего:
1️⃣ Ноутбук не прогнан начисто сверху вниз
код эволюционирует: ячейки перезапускают, меняют местами, счётчик исполнения скачет — In [7] стоит выше In [3]. Воспроизводится ли такой прогон с нуля — уже большой вопрос. А нередко выводов и вовсе нет: ни логов обучения, ни метрик, ни графиков. Для генеративных задач та же беда: ни кривых лосса, ни реконструкций, ни единого сгенерированного сэмпла. Засчитать тут можно разве что аккуратную структуру, но не результат.
2️⃣ Метрика есть, но не в выводе
финальная цифра вписана в markdown или в комментарий руками, а не посчитана в исполненной ячейке. А раз в выводе её нет — такую метрику нельзя ни проверить, ни воспроизвести.

🚭 Полезные привычки курильщика ML'щика

Restart & Run All перед сдачей, а потом глазами пройтись сверху вниз: у каждой ячейки есть вывод, а финальная метрика стоит в выводе ячейки, а не вписана в markdown руками. Код без прогона — как рецепт, который вы так и не приготовили: на бумаге пальчики оближешь, а на деле...

В ML верят не тому, что написано, а тому, что выполнилось: пустые In [ ]: — это не "почти сдал", а ноль доказательств.

Заглядывайте к нам на практику, здесь мы хорошие привычки доводим до автоматизма.
🗓 Ближайший поток запланирован на 7 сентября

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#study #ml #MachineLearning #DataScience
🔥54👍3
❤️‍🩹 Будни ИИ-стартапов

credit за находку: Денис Л.
// CPO образовательных курсов BigData Team

Прислать ваш мем в конкурс мемасиков можно в личку этого канала.

Всем хороших выходных и не забываем ставить лайки, авторам будет приятно. Перевод и upscale: Gemini (сравниваем и улыбаемся).

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#meme #AgenticCoding #BigDataTeam
🔥64😁2
🎛 Тюнинг, который ничего не тюнит
рубрика pro #ml

Знакомая сцена с разбора практических проектов: человек честно перебрал гиперпараметры бустинга, пометил ячейку "затюнено" и идёт дальше. А на отложенном тесте после всего перебора ничего не изменилось: default давал 0.87 ROC-AUC, "затюненная" — те же 0.87. Столько усилий, чтобы остаться ровно там же.

И вот где прячется тихая ловушка. Тюнинг ощущается как работа: покрутил ручки, посмотрел на числа, устал — вроде молодец. Но засчитывается он не по усилиям, а по табло held-out: если подобранная модель не бьёт дефолтную на отложенной выборке, в прод едет default, а перебор отправляется в стол.

Смысл ведь не в том, чтобы нажать кнопку и вызвать метод, а в том, чтобы понять, стало ли реально лучше. Тюнинг ради тюнинга — это как учёба ради учёбы: движения есть, смысла нет. На учебном проекте это видно яснее всего: за цифры тут не переспросит ни начальник, ни старший, никто, кроме вас самих.

Где это всплывает чаще всего:
1️⃣ "Затюнено", а метрика на месте
модель помечена как подобранная, но на тесте метрика не выросла или даже просела относительно default. Перебор был, прироста нет.
2️⃣ Ручной перебор без кросс-валидации
параметры подобраны несколькими ручными попытками на одной отложенной выборке. Несколько точек нестабильны: удачная конфигурация легко оказывается случайной, а не реальным свойством модели.
3️⃣ Таблица default vs tuned "на глаз"
сравнение собрано с приблизительными числами вместо реально посчитанной метрики. Доказать прирост тогда попросту нечем.

🚭 Полезные привычки курильщика ML'щика

Тюнинг — это гипотеза "стало лучше", а не медаль за старания. Гоняем её кросс-валидацией на train (RandomizedSearchCV, GridSearchCV или Optuna), а не одной удачной ручной попыткой, и кладём рядом два честных числа: метрику до и после. Вырос held-out — прирост едет в прод; не вырос — остаётся default.

Отрицательный результат на held-out — тоже результат, причём честный, и о нём стоит рассказать: это экономит время тем, кто иначе полез бы в тот же тупик. В индустрии за честно закрытый неудачный эксперимент спасибо скажут не меньше, чем за удачный — так что привычки выше пригодятся и джуну, и любому синьору-помидору. Плохо не когда тюнинг не помог, плохо — когда его всё равно записали в победы.

Заглядывайте к нам на практику, где тюнинг засчитан только приростом на held-out.
🗓 Ближайший поток запланирован на 7 сентября

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#study #ml #MachineLearning #DataScience
🔥64👍4
🔬 Уровень AI adoption, независимое исследование

credit за находку: Денис С.
// выпускник практических курсов BigData Team

С вас - лайки 😉

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#meme #AgenticCoding #BigDataTeam
😁7👍3🔥3
🧐 График построен. А вывод где?
рубрика pro #ml

Смотрим проект на курсе. Ноутбук образцовый: Learning Curves аккуратные, разложение bias-variance нарисовано, оси подписаны, код отработал без единой красной ячейки. Спрашиваем автора: "ну и какую модель в прод?" Пауза. Ноутбук заканчивается картинкой, и ответа в нём нет.

А ведь самое ценное начинается ровно там, где оборвалась последняя ячейка. Кривые честно показывают over- и underfitting, но сами за себя не говорят: почему одна модель переобучается раньше другой и какую в итоге выбрать. Объяснить это ценнее, чем построить график: картинку рисует код, а понимание видно по выводу под ней.

Где под графиком чаще всего пусто:
1️⃣ Learning Curves без вывода
Даже одна кривая отвечает на главные вопросы: переобучается модель или нет, помогут ли ещё данные. Только ответы эти нужно записать: дальше в том же проекте на них опирается весь подбор параметров. Промолчали — и подбираете вслепую.
2️⃣ Bias-variance без сравнения
Почему бэггинг снижает дисперсию, можно объяснить и без графика. График строят ради другого: увидеть эффект на своих данных и поставить рядом две картинки, одиночное дерево против бэггинга. Обе нарисованы, а сравнения под ними нет.
3️⃣ Сравнение без вердикта
Optuna против Grid и Random Search: сравнение прогнали, таблица с результатами готова. Не хватает одной фразы под ней: какой способ подбора берём дальше и почему. Без неё Optuna и перебор так и остаются двумя строчками в таблице, а не решением.

🚭 Полезные привычки курильщика ML'щика

Под каждым графиком: одно-два предложения о том, что на нём видно и какой выбор из этого следует. Проверка простая: закройте картинку и перечитайте текст. Если по нему восстанавливается решение (какая модель, почему именно она), вывод есть. Если остаётся "см. график выше", вывода нет.

График — это аргумент, а не результат. Он как рентгеновский снимок: снимок сделает и аппарат, а диагноз ставит тот, кто умеет его прочитать. И на защите проекта, и на ревью в команде вопрос к вам будет один и тот же: не "как вы это построили", а "почему вы это выбрали". Привычка выше готовит ответ заранее. Правильный код — это ещё не правильная методология.

Заглядывайте к нам на практику: здесь каждый график доводим до вывода, а каждый вывод — до выбора модели.
🗓 Ближайший поток запланирован на 7 сентября

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#study #ml #MachineLearning #DataScience
🔥52
🚀 Гайд по Data-профессиям: 6 грейдов от Junior до C-level

Вместо тысячи слов (посчитал, получается ровно 2'830):
https://learn.bigdatateam.org/data-careers-guide

Если вдруг домен *.org у вас не открывается из РФ, то сделали зеркало тут:
https://learn.bigdatateam.ru/data-careers-guide

Из статьи вы узнаете про:
— аналитику IT-зарплат и зарплатных вилки
— систему грейдов в крупных IT компаниях
— аналитику карьеры и зарплаты наших выпускников в 🇰🇿
— то, как выйти на Grade 4 (устроиться на работу в Big Tech)
— эволюцию BigData Team в 2026: BDMLE + AI-native = AIE

А пока коллеги готовят официальные анонсы, я обрадую: стартовал конкурс на гранты Tech Orda. В этом году мы ищем 🔥 50 кандидатов, которых мы будем потно плотно прокачивать на протяжение 6+ месяцев. Все подробности: по ссылке.

Сроки отбора на гранты Tech Orda: до 7 сентября.
Налетай, торопись, изучай ИИ-пись.

P.S. максимальный репост — приветствуется!

// подружиться в 👉 LinkedIn | Facebook | Instagram | Threads
#work #study
🔥93👍3
🏠❤️‍🩹 Вся правда о микросервисной архитектуре

credit за находку: Денис Л.
// CPO образовательных курсов BigData Team

Прислать ваш мем в конкурс мемасиков можно в личку этого канала.

Всем хорошей недели и не забываем ставить лайки, авторам будет приятно.

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#meme #AgenticCoding #BigDataTeam
🔥7👍3😁3
🚀 50 грантов Tech Orda: специализация AI Agents Engineer

Уникальная возможность для граждан РК от 18 до 45 лет:
1. Получить грант 400 000 ₸ от государства на обучение в IT;
2. С вероятностью 60+% достичь карьерных целей в ближайшие 6 месяцев при обучении с BigData Team.

📌 Как подать заявку? До 6 сентября:
1. Нажать "подать заявку" на портале Astana Hub
2. Зарегистрироваться и пройти тестирование на Learn BDT
3. Подписаться на наш Telegram, чтобы не пропустить новости.
Результаты отбора — на почту; анонсы — здесь.

Особенности 2026

1️⃣ Конечно же ИИ (Agentic Coding и AI Agents)
Не банальный prompt engineering, а фундаментальная база: tools, skills, MCP, окружения (*code*, *claw) или harness. Управление памятью (context, memory, fine-tuning vs RAG, embeddings vs Zettelkasten) и качеством (MAS, ralph-loop, evals, понимание LLMs).

2️⃣ Стоимость
Разработали программу доступную каждому:
— стоимость программы (level 1): 595 000 ₸
— грант Tech Orda: 400 000 ₸
— остаток: 195 000 ₸. Если поделить на 6 месяцев обучения:
🔥 32 500 ₸/месяц

3️⃣ Аналитика зарплат и выпускников от Astana Hub
По нашим выпускникам программы Tech Orda в Казахстане:
— 44% пришли без профильного ИКТ-образования
— 61% достигли карьерных успехов уже в период обучения
💰 1+ млн ₸ средняя зарплата выпускника
Откуда цифры — из налоговой (но анонимно). Подробности читайте в гайде по Data-профессиям.

📌 Ключевая информация
В AI-native эпоху в IT профессии базовых навыков Computer Science уже недостаточно — важно уметь ускорять процессы разработки и аналитики в десятки раз с помощью автономных ИИ-агентов, не теряя контроля над кодовой базой и архитектурой. В 2026 году мы трансформировали программу BDMLE в новый стандарт — AI Agents Engineer (AIE).

🗓 Старт обучения: сентябрь–октябрь
▶️ Видео о школе и программе (10 минут)
🔄 Волны отбора
I волна — до 23 августа, 23:59 🔥
— II волна — до 30 августа, 23:59
— III волна — до 6 сентября, 23:59

Last, but not least

Поспешите! (почему)

📩 Вопросы: личка, комментарии или techorda@bigdatateam.org
🤗 Лайк и репост — у кого-то из ваших знакомых сейчас закроется вопрос "а на что учиться".

BigData Team: the way you learn best
AI Agents | Py4BDA | Python | Machine Learning | Big Data

#study #BigDataTeam #TechOrda #AstanaHub #BDMLE #AIE
9🔥8👍7
🔥 Лучшие курсы для работы, сохраняй (но немного)

credit за находку: Денис С.
// выпускник практических курсов BigData Team

С вас - лайки 😉

BigData Team: the way you learn best
BD/ML Engineer | AI Agents Engineer 🆕🔥
Py4BDA | Python | Machine Learning | Big Data

#meme #BigDataTeam
😁9💯4
🚀 Гранты Tech Orda: результаты волны I 🎁 bonus track

Подробности о программе AI Agents Engineer, грантах Tech Orda, правилах участия в конкурсе: https://t.me/bigdatateam/645.

🔄 Волны отбора
— I волна — до 23 августа, 23:59
— II волна — до 30 августа, 23:59 🔥
— III волна — до 6 сентября, 23:59

По итогам волны I мы отобрали топ-10 кандидатов и связались с каждым по личным каналам, чтобы согласовать обучение по грантам.

Не получили от нас сообщения? Не беспокойтесь, здесь ровно 2 сценария:
😃 тестирование еще не завершено
Пройдите оставшиеся тесты на Learn BDT до дедлайна волны II (см. раздел как подать заявку).

💛 все тесты уже пройдены
Вы уже в пуле кандидатов волны II. И на следующей неделе мы рассмотрим топ-20 кандидатов по результатам тестирования.

🎁 Bonus track.
Отдельный трек для определившихся. Если вы уже выбрали учебную программу и однозначно понимаете, что это будет интенсивный формат (Level 2 или Level 3), то напишите об этом менеджеру (или на techorda@bigdatateam.org).

Last, but not least

Поспешите! (почему)

📩 Вопросы: личка, комментарии или techorda@bigdatateam.org
🤗 Лайк и репост — у кого-то из ваших знакомых сейчас закроется вопрос "а на что учиться".

BigData Team: the way you learn best
AI Agents | Py4BDA | Python | Machine Learning | Big Data

#study #BigDataTeam #TechOrda #AstanaHub #BDMLE #AIE
Please open Telegram to view this post
VIEW IN TELEGRAM
6🔥4👍1