Data Science | Machinelearning [ru]
19.8K subscribers
802 photos
56 videos
28 files
3.72K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

Личный блог автора - @just_genych
По вопросам рекламы или разработки - @g_abashkin


РКН: https://vk.cc/cJPGXD
Download Telegram
«Я был уверен, что Service Desk сломан. Потом поговорил с одним человеком»

Первая статья из цикла «Аналитик в чужом процессе». 145 тысяч тикетов, почти 87 тысяч «аномалий» и уверенность, что Service Desk полностью сломан. Но один разговор с опытным специалистом первой линии заставил выбросить половину критериев, переписать анализатор и полностью изменить выводы.

Эта статья — о том, почему большие данные сами по себе ничего не объясняют, если сначала не понять сам процесс.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
1
👉 Как я добавил LLM в чат друзей

Очередной чувак решил, что в его чате с друзьями не хватает искусственного интеллекта. И знаешь что? Он реально сделал это.

Автор затащил туда Т-800, который мог свободно общаться с участниками. Без единой потраченной копейки на API — только бесплатные модели с OpenRouter. Позже даже локальную модель попробовал, видимо, для полного счастья.

Сюрприз: не прогорел и не схватил баг с бесконечным спамом. Подробности расписал на Хабре.

Сделаешь так же — вэлкам. Потом расскажешь, как твоя LLM в чате друзей ничего не ответила на критику.

Читать на Хабре

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Кросс-модельная оценка дрифта предсказаний через динамическое прокси-расстояние Вассерштейна в production-пайплайне

Дрифт данных неизбежен в production ML, но метрики вроде PSI или KS на фичах часто либо запаздывают, либо шумят, а сдвиг фич не всегда коррелирует с дрифтом предсказаний. Я пару раз ловил фантомные срабатывания на PSI — фичи стабильны, а модель валит. Решение, которое себя зарекомендовало, — кросс-модельная оценка через динамическое прокси-расстояние Вассерштейна.

Идея и сравнение распределений
Берете две модели: baseline (текущая в продакшене) и challenger (обученная на рецентном батче). Скармливаете им одно окно данных и считаете расстояние Вассерштейна между распределениями предсказаний. В отличие от KL или JS, Вассерштейн учитывает форму распределения, устойчив к выбросам и интерпретируем в единицах target. Прокси-дополнение — разница в AUC или logloss challenger’а на валидации текущего периода. Пример: модель предсказывает цену от 0 до 100, расстояние 0.03 — вероятно, несущественный сдвиг.

Production реализация и trade-offs
Реализация на scipy тривиальна: режете буфер предсказаний на 10 частей, считаете медиану дистанций, сравниваете с порогом. Я вешаю это на Redis с TTL — одна транзакция раз в N шагов. При срабатывании либо переключаем challenger, либо выкатываем артефакт для ручного анализа. Ошибка: если challenger протух (неактуальный ретренинг), Вассерштейн будет врать. Решение — подкручивать частоту ретрениров, а не полагаться на единый порог. Типичный порог выставляю по 95-му перцентилю исторических расстояний за неделю, подгонять под горячие окна — плохая идея.

Когда это реально нужно
Кейсы: e-commerce с сезонными пиками, рекомендательные системы с прыгающей корреляцией фич, low-latency сервисы, где трекать фичи на каждом инференсе дорого. Плюсы: не нужно тащить ретроспективные фичи и гистограммы через пайплайн, работает с временной структурой (скользящее окно), легко объяснить бизнесу («распределение уехало на 0.12»). Обязательное условие — challenger должен быть актуален, иначе метрика теряет смысл.

Вывод: Кросс-модельная дистанция Вассерштейна — надежный, интерпретируемый и инженерно простой прокси дрифта предсказаний, но требует дисциплины в ретренинге challenger’а для избежания ложных срабатываний.
2👍1
Как твой сайт выглядит в глазах AI и почему бизнесу пора врубиться

RAG-поиск (Retrieval-Augmented Generation, генерация с подкреплением поиском) — это такая штука: AI сначала шерстит сайты, выцарапывает оттуда текстовые куски, которые хоть как-то подходят под вопрос, а потом лепит из них ответ. Модель заранее не знает, что у тебя на сайте — она видит его только в момент запроса, но только если твой контент переплюнул всех в конкурсе «кто больше попадает в смысл вопроса пользователя».

Твой сайт в Google индексируется норм, трафик не дёргается, а в ответах ChatGPT или Google AI Overview тебя просто нет. Конкуренту с текстом в два раза хуже цитируют. Что на самом деле решает, заметит ли тебя AI или пролетит мимо?

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍3
Пять багов в Python-коде для LLM — найдешь сам?

Вызов языковой модели легко перепутать с обычной функцией — до тех пор, пока в дело не влезут квоты, таймауты, двойные списания и результаты, которые скачут хуже, чем на бирже.

Статья разбирает пять типовых косяков в питоновском коде, который дергает LLM, и объясняет, какие инженерные привычки спасут твой прод от неожиданных сюрпризов под нагрузкой.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Аппроксимация оптимального порога бинаризации признаков в GBDT через дифференцируемую оценку информационного выигрыша

Классические GBDT ищут точки разбиения перебором на каждом узле. Это работает, но начинает тормозить, когда признаков много или данные приходят стримом. Я часто вижу, как на сотнях фичей жадный поиск порога становится главным узким местом в пайплайне.

Идея: гладкая аппроксимация порога
Заменить жесткий порог I(x > t) на гладкую сигмоиду sigma(alpha * (x - t)). Крутизна alpha управляет тем, насколько эта штука похожа на ступеньку. Теперь информационный выигрыш -- дифференцируемая функция от t. Можно гонять градиент и не перебирать варианты.

Пример на PyTorch:
def differentiable_gain(x, y, t, alpha=10):
weights = torch.sigmoid(alpha * (x - t))
left_weight = weights.mean()
right_weight = 1 - left_weight
left_var = (y * weights).sum() / (weights.sum() + 1e-8)
right_var = (y * (1 - weights)).sum() / ((1 - weights).sum() + 1e-8)
gain = left_weight * left_var + right_weight * right_var
return gain

t = nn.Parameter(torch.tensor(0.5))
optimizer = torch.optim.SGD([t], lr=0.01)
for _ in range(100):
loss = -differentiable_gain(x_data, y_data, t)
loss.backward()
optimizer.step()


Практические советы и trade-offs
-- Высокий alpha ближе к ступеньке, но градиенты становятся резкими -- без регуляризации будете ловить NaN. Рекомендую добавлять L2 на t или использовать gradient clipping.
-- Метод вывозит на разреженных задачах или признаках вроде текстовых эмбеддингов, где переборные пороги просто не имеют смысла. Например, для фичей с низкой entropy по классам перебор теряет время на бесполезные кандидаты.
-- В гибридных подходах типа NGBoost такое ускоряет обучение: не надо ждать, пока дерево переберет все варианты. Но не ждите gain-to-gain эквивалентности с дискретным разбиением -- это trade-off за скорость.

Предупреждение о типичной ошибке
Ошибка: думать, что alpha можно сделать бесконечно большим. Это приводит к взрыву градиентов и потере дифференцируемости. Держите alpha в диапазоне 5-20, и всегда проверяйте стабильность loss. При малом alpha аппроксимация грубая -- проигрываете в точности. Компромисс обычно есть, и он оправдывает себя по скорости.

Для тех, кто хочет глубже:
-- "Differentially Private GBDT with Smooth Thresholds" (2022) -- связь с приватностью и градиентами.
-- "XGBoost with Continuous Gradient" -- модификации от сообщества.

Вывод: Гладкая аппроксимация порога в GBDT -- это инженерный компромисс между точностью и скоростью, который критически важен для production ML с высокоразмерными или стриминговыми данными.
👍1🔥1
Роботы идут, но сначала — бастуем: сотрудники Hyundai встали на дыбу из-за страха остаться без работы

Южнокорейский гигант Hyundai Motor впервые столкнулся с тем, что его же работники устроили частичную забастовку на три дня — и всё из-за человекоподобных машин, которые вот-вот попрут на конвейер. Это первый случай, когда крупный автозавод встал колом из-за планов по внедрению андроидов.

Люди просто сваливали со смен на два часа раньше, но суть ясна: они требуют от начальства чётких юридических гарантий, что их не выкинут на улицу, когда роботы начнут штамповать тачки.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍1🐳1
Как втолковать нейросетям графики: ChartNet от MIT

Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Нарыл я недавно одну тему, которая касается того, как визуально-языковые модели (VLM) тупят с графиками, и решил разобраться поглубже.

Сейчас дофига научных, деловых и политических данных рисуют в виде графиков. Только вот современные VLM эту дичь разжевывают весьма посредственно. Почему? Да потому что нет годных и больших датасетов, чтобы их нормально натаскать и проверить.

Пацаны из MIT и IBM Research придумали выход — ChartNet. Это такой мультимодальный набор данных, который учит модели втыкать в графики и понимать их суть. Глянем, что это за зверь и насколько он реально годный.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Прогнозируем не только значение, но и его разброс: гетероскедастичная регрессия остатков для GBDT

Каждый, кто хоть раз выкатывал GBDT в production для ценообразования или risk scoring, знает: метрики горят, но доверять каждому предсказанию вслепую нельзя. Ошибка в 10% для дешёвого товара — копейки, для дорогого — минус маржа. Квантильная регрессия с CQR усложняет пайплайн и плохо калибруется. Альтернатива — обучить вторую модель на логарифме абсолютных остатков первой.

Сценарий простой: предсказываем среднее, а затем — дисперсию ошибки. На инференсе — два predict и один exp. Никакого сэмплирования или байесовских сеток.

Как это реализовать

Собираете остатки: residuals = |y_pred - y_true| + 1e-8. Затем на тех же признаках учите модель для log(residuals). На выходе получаете sigma = exp(model_var.predict(X)).

residuals = np.abs(y_train - model_mean.predict(X_train)) + 1e-8
model_var = LGBMRegressor(n_estimators=80)
model_var.fit(X_train, np.log(residuals))

def predict_with_uncertainty(X):
y = model_mean.predict(X)
sigma = np.exp(model_var.predict(X))
return y, sigma


Почему это затащило в production

Первое — интерпретируемость без SHAP. Модель остатков сразу показывает, где основная модель ошибается: "на товарах с высокой ценой разброс выше". Это даёт инженерный контекст для валидации.

Второе — простота деплоя. Два predict и один exp — всё. Никаких байесовских сеток или сложных loss-функций. Надёжно и быстро.

Третье — калибровка под данные. Модель остатков учится на реальных ошибках первой, а не на теоретическом распределении. Это даёт адекватные оценки uncertainty для конкретного датасета.

Типичные грабли и trade-offs

Вторая модель легко переобучается. Я режу num_leaves, увеличиваю min_data_in_leaf и обязательно валидирую отдельный холдаут. Если дисперсия меняется скачками, лучше предсказывать log((y - y_pred)^2), но тогда больше выбросов.

Метод не учитывает асимметрию распределения остатков. Если модель системно ошибается в одну сторону, sigma будет завышена. На малых выборках вторая модель может просто выучить шум — тут помогает кросс-валидация на уровне остатков.

Для медицины или финансов я бы добавил конформное предсказание поверх — как контрольный выстрел. Это повышает надёжность, но добавляет latency.

Вывод: Двухуровневая модель GBDT — простой кирпичик для production, который даёт не только answer, но и confidence, без байеса и лишней магии.
👍1🔥1
ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic

Год назад вышла публикация Anthropic про Agentic Misalignment: когда пахло скорым отключением, модели брали в заложники переписку топ-менеджера и шантажировали им. Компания подшаманила — в актуальных версиях Claude такой херни больше не было.

Но 13 июля бахнуло продолжение. Теперь воспитанность моделей зашкаливает — они готовы защищать этичное поведение любыми методами. Даже если для этого придется нагло врать человеку в лицо.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила

Мы дико хотели высказаться про места, где стоит упорно держаться за классический ML, а где — ломиться в инновации, запилить в компании LLM, подтянуть AI-подходы и погрузиться в то светлое будущее, про которое все вокруг трубят.

Разбор батла: когда большие языковые модели — огонь, а когда задачу проще, дешевле и надежнее решить старыми проверенными методами.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Я слышу, как модель думает

Чувак, который написал пост, периодически слышит высокочастотный писк при работе с LLM на макбуке. Иногда этот звук ловится даже тогда, когда вроде бы ничего не запущено.

“Долго думал, что у меня крыша едет и профдеформация переросла в глюки. А нет — просто физика, чувак”.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Neuralink — ну да, круто, но не монополист в теме «мозг-компьютер».

Когда Маск показывает видос, где чел силой мысли двигает курсор или стучит текст, это, конечно, хайп собирает. Импланты втыкают прям в кору, сигнал от нейронов летит в комп почти без потерь. Но если смотреть шире, то Neuralink — далеко не главный игрок на этом поле.

Сейчас интерфейсы «мозг-компьютер» развиваются по куче направлений: от тех, что вживляют в башку, до тех, что просто надеваешь на голову. Второй вариант особенно активно пилят китайцы — они хотят быстрее вытащить такие штуки из лабораторий в реальную медицину.

Читать дальше

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
В поиске работы: Data Engineer

Илья Болквадзе — дата-инженер с 3+ годами коммерческого опыта. Разрабатывал и поддерживал production-хранилища данных, аналитические платформы и lakehouse-решения.

Ключевой стек:
SQL, Python, DBT, Apache Airflow, Greenplum, Amazon Redshift, Trino, Apache Iceberg, PySpark, Kafka, AWS

Чем занимался:
🔘 DWH и CDC-пайплайны, витрины данных
🔘 Контроль качества данных, историзация, CI/CD

🔘 Тбилиси, Грузия
🔘 Русский — родной, английский — B2

🔘 Более подробная информация — в CV (по запросу)
🔘 Связаться: @sovailia
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3
AI рисует героев и делает им анимации, но впихнуть их в игру — задача посложнее

Нейронки уже вовсю генерят персонажей и их движения. Но это только полдела. Дальше самое мясо: их надо запихать в проект, прикрутить к игровой механике, привязать шмот, раскидать по миру и донести до игроков без деплоя новой версии клиента.

В этой части врубайтесь, как я собрал этот конвейер. Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Мир раскололся надвое: как американцы и китайцы построили свои школы графического GenAI

Изображения генерировать научились отлично, но идеальной модели, которая умеет всё, до сих пор нет. Закинули один и тот же промпт в Midjourney, DALL‑E 3, FLUX, Hunyuan‑DiT, Wanxiang и Seedream — получили в ответ кучу абсолютно разных картинок. Одни сервисы послушно расставляли объекты как в инструкции, другие плевали на часть описания, но выдавали такую плотность деталей, что первым и не снилась.

В чём разница? Всё упирается в датасеты, токенизаторы и глубину текстовых энкодеров. Получается, сформировались две инженерные школы, каждая изначально заточена под свои ресурсы. Но сейчас обе потихоньку ползут друг к другу.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

Владимир доделал третью часть цикла — теперь про то, как запилить небольшую decoder-only LLM. В первой части он намутил токенизатор и надергал pretrain-датасет, во второй — набросал класс Трансформер-блока. Теперь дело за малым: собрать модель и прогнать pre-train.

Читать далее: Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Слушай, вбросить новый сервис в пустой репозиторий — это тебе не хухры-мухры, красиво называется greenfield. Но как только этой штуке надо вписаться в живую систему, перетащить данные за последние десять лет, подружиться со старым API и не провалить аудит — твое «чистое поле» кончается. Обычно на этапе, когда начинаешь перенос гигабайт дерьма и ловишь первый баг при интеграции.

Greenfield и brownfield — это история не про то, какой код старый или как он написан. Это про то, сколько на тебе висит ограничений. Если ты в greenfield, твоя задача — проверить, не липовая ли гипотеза про продукт. В brownfield ты уже копаешься в куче зависимостей, молишься, чтобы ничего не развалить, и не дай бог что-то уронить.

Сейчас, когда AI-помощники и coding agents на каждом углу, эта разница стала только жирнее. Да, они влёгкую наколякают приложение с нуля, глаз не оторвать. Но сколько в реальной профи разрабротке начинается с пустого репозитория? Хер там. Чаще надо сначала разобраться, что за зверь перед тобой, а потом аккуратно — без фанатизма — поменять его поведение, чтобы не сдохло.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4👎1
Ну что, айтишники, задрали уже эти вечные нытики, которые мечтают сжечь все нейросети? Пока они поливают говном прогресс, кто-то тупо берет и юзает, и не только ради галочки в резюме.

Вот вам пост про то, как автор на деле попользовал «близняшек» от Гугла (Gemini). Задумка родилась как коммент к статье «Ненависть к ИИ» от Анатолия Ализара — инфы нахуй накидало столько, что в лимит не влезло. Так что теперь это отдельный материал про личное знакомство.

Этим вашим «близняшкам» реально можно пихать всякую канцелярскую шнягу: сконвертить данные в таблицу, выплюнуть JSON, накидать тестик и проверить, шаришь ты в теме или нет. Вариантов дохрена. Что именно залетает, а где полный швах — читай в статье.

Перейти к чтению

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👎42
Технический долг не рассосался. Просто теперь за него платят токенами

Всё чаще слышно: мол, LLM и AI-агенты реально удешевят разработку. Не надо нанимать людей — скормил задачку модели, и готово за пару минут.

В этой мысли есть логика, не спорю. Но есть один нюанс, который я вынес из своих наблюдений за последние месяцы. Спалить пару токенов

Читать далее на Хабре

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Data Science под открытым небом

2 августа в Москве пройдет «Урбан ML» — большая офлайн-встреча для специалистов по Data Science. В программе доклады, дискуссии и мастер-классы по RecSys, NLP, антифроду и агентным системам, выступления экспертов из MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний.

Кроме этого вас ждут , нетворкинг, спортивные активности и вечернее афтепати.

Участие бесплатное, по предварительной регистрации (на площадку необходимо взять с собой паспорт или права). Количество мест ограничено. [ссылка]

📅 2 августа, 11:00–21:00 (первый доклад в 12:00)
📍 Москва, офлайн
3