Дата канальи
6.12K subscribers
304 photos
10 videos
15 files
271 links
Данные / ML / AI / аналитика в корпорациях. Для связи @NikitaZelinskiy (реклама и консультации по AI/ML для бизнеса)
Download Telegram
— До Таллина далеко?
— Теперь далеко!
1😁31🫡5😱41
Дата канальи
#ML Повезет ли мне? DS и карьерным стратегиям в целом и по фильмам научиться можно. Вот например, некогда популярная задача на собеседованиях по статистике (мне вот задавали году в 17м): Вы вдвоем играете в русскую рулетку, в револьвере ровна два вставленных…
#корпжиза

Несмотря на то что в Грязном Гарри снято пять частей, самая полезная и атмосферная первая.

В ней показан идеальный диалог с тимлидом:

Диалог с лейтенантом (тим лидом, TL):
— TL: Ты неплохо сработал, шеф был доволен!
— Да ну
— TL: Велел сказать тебе «well done!»
— Не могу передать как я тронут
— TL: Я передаю тебе похвалу, мог бы быть повежливее. Еще никто не умер от того, что сказал спасибо.
— Скажу спасибо когда мне оклад повысят (В оригинале «I’d much rather say thanks to a raise»)

мне даже добавить нечего, шедевр!
1😁43🔥10👍4
#корпжиза

Карьерные трэки бывают достаточно извилисты и иногда можно обнаружить в кресле большого начальника человека, очень далекого от специфики самой работы.

Диалог Гарри и самодовольного подловатого капитана полиции (далее М) из третьего фильма про Грязного Гарри:

— Это все, капитан? Мне нужно идти работать
— М: Но не в отделе убийств
— Что?!
— М: Тебя переводят в кадры (HR)!
— Да это ж для одних говнюков!
— М *встает*: Я 10 лет работал в отделе кадров!
— Да…

Здесь стоит вспомнить мудрость царя Соломона «и это пройдет» и порадоваться что такое длится обычно недолго.

PS: Выражение лица Клинта Иствуда когда его перевели в кадры — бесценно
1😁204
Теперь когда будут спрашивать что такое brand safety — буду показывать это фото
1😁37😱3
Во вторник в 6 вечера думаю послушать парней , кажется , что будет интересно. И да , у Саши Абрамова DealerAi тайтл таки поменялся — эх, упустил Сбер парня 🤷‍♂️
1🔥10🤷‍♂2👍2👏2
Forwarded from South HUB
Каждая новость на TechCrunch о GenAI обещает революцию. Но между демо на питче и production-системой, которая приносит деньги, пропасть из факапов, галлюцинаций и вопросов от CFO. Хуже, когда вопросы звучат от борда, а ответить на них некому. Как внедрять GenAI в бизнес?

17 февраля мы проведем час разговора с теми, кто внедряет GenAI в продакшн и знает разницу между демо-эффектом и реальным ROI.

Смотреть в ▶️ / Смотреть в 💬

О чём говорим:
— Как считать реальную ценность AI-агентов и выбирать направления, которые дадут эффект
— Техники повышения надёжности: снижение галлюцинаций, scaffolding, caching, debate-подходы
— Честные кейсы и факапы внедрения GenAI — что сработало, что провалилось, сколько стоило
— Agent swarm и другие тренды: перспектива или хайп?
— Как вайбкодинг изменил процессы разработки, найма и структуру команд

Участники:
Роман Куцев, Founder LLM Arena, модератор встречи
Валерий Ковальский, Head of AI в Red.Mad.Robot
Александр Абрамов, Head of AI CoE во ВкусВилл
Артур Самигуллин, руководитель платформы Yandex AI Studio в Yandex B2B Tech
Александр Толмачев, CDO, вступительное слово от ПК Snow BASE

Этот эфир для тех, кто сейчас решает, как превратить эксперименты в стабильную систему с измеримым эффектом. Подключайтесь, если эти вопросы у вас на столе.
Please open Telegram to view this post
VIEW IN TELEGRAM
114👍3🔥3👏1
Ребята из Летово не согласились что Unlearning в рекомах — нерешенная задача, и даже прислали небольшой обзор, ну а поскольку я обещал им обзор посмотреть, разобрать и дополнить , то сделаю это публично, с обсуждением. Велком!
115🔥7
Unlearning в рекомендашках завтра

Ребята, завтра в 18 поговорим на вебинаре с Никитой Зелинским директором по машинному обучению и исследованию данных в MTS Web Services про рекомендательные системы, а точнее про:

Unlearning в рекомендашках — постараемся вместе разобраться о чем речь, куда удалось продвинуться и почему до нашей индустрии это пока не докатилось.

Подпишитесь кстати на его канал — очень крутой, там про жесткий DS в корпах @datarascals

Ссылка на трансляцию будет у нас в канале, а напоминалку можете добавить в календарь: https://calendar.app.google/7rrdX5SmZgeXcqdRA
118👍5🔥4
Дата канальи
прислали небольшой обзор
machine_unlearning_recsys.pdf
99.9 KB
Итак, обзор за авторством ребят из школы Летово
1❤‍🔥17🔥7👏52
и обзор, который совершенно случайно 🤣 вышел на той неделе в IEEE Transactions on Knowledge and Data Engineering (правда препринт доступен еще с декабря) — ну что ж, обсудим, заодно захватим бенчмарки и попробуем понять что опять академики делают не так (хотя после массовых LOO-валидаций в статьях на RecSys уже удивляться не стоит)
1😁10🔥3
👁"Unlearning в рекомендашках" вебинар. Присоединяйтесь уже сейчас через 5 минут стартанем

Без смс, vpn и регистрации — https://www.twitch.tv/r77_ai
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
🚀 Ребята из ИнженеркаТех специально для канала Дата канальи дарят эксклюзивный промокод DATA, который дает -15% к скидкам на все курсы дополнительно до конца октября!

Сейчас самое время, чтобы прокачать свои навыки и освоить новый стек.

Симулятор Data Warehouse на базе dbt. Научитесь работать с dbt Core и освоите DataOps практики, каталог данных и data lineage. Решай реальные задачи в интерактивном тренажере → Начать в демо-доступе

💚 Кстати, они перевели всю документацию dbt на русский язык! Теперь она доступна бесплатно для всех: https://docs.getdbt.tech/


Теранежр Dagster + Apache Nifi ETL-разработка и оркестрация данных. Стройте современные data pipeline с одним из самых популярных инструментов на рынке → Начать в демо доступе

Тренажер DLT — Python ETL Забудьте про костыли в пайплайнах. Загружайте данные из API, ClickHouse, S3 за 5-10 строк кода. Встроенная интеграция с Dagster. От ноутбука до продакшена → Получить доступ со скидкой

Демо-доступ есть у большинства курсов, чтобы сначала попробовать, а потом уже решить

🎁 Промокод DATA действует до 28 февраля.

ООО “Инженеркатех” ИНН ИНН: 9715483673 erid: 2Vtzqv127pQ
👍84😍4
#корпжиза

Почему "не тех" бизнес часто не очень настроен к ML? В смысле признает необходимость и полезность, но не видит основным драйвером выручки?

Меня однажды это сильно фрустрировало — как так, зарабатываем миллиарды рублей на моделях, а к DS как к функции отношение скорее покровительственно-снисходительное, а не как к партнерам по бизнесу.

Хотя CIR DS-функции в крупном бизнесе может быть и менее 1% (cost to income ratio — отношение затрат к доходу), эти эффекты, в основном:
⁃ Достигаются улучшением существующих процессов (ex: улучшили качество лидогенерации, ценообразование), в тч сокращением костов (удержание сотрудников например) — но это все «и так работает» и аффектит выручку всего бизнеса максимум процентов на 10, после нескольких лет внедрений — причем низковисящие фрукты собирают за год-два (получая основной прирост), а дальше рутинная кропотливая работа с десятками и сотнями неудачных А/Б
⁃ Иногда ML и правда выступает enabler’ом — например, для запуска BNPL (рассрочки), но и здесь эффект будет сосредоточен в оценке риска а не экспоненциальном росте выручки продукта.

А чего бы бизнес вообще хотел?

В идеале что-то вроде такого (с поправкой на то что это все же dark pattern), то есть конструкцию:

◦ с практически нулевыми костами (ООО Престо, о которой речь в статье — 2 чел, 10 тыс уставного капитала и 12.5 млрд выручки ) 
◦ имеющую сильное конкурентное преимущество (например, законно обходит регуляцию)
◦ хорошо масштабируемую даже самозапрет на кредит не помеха)
◦ супер-маржинальную (85% годовых намекает)
◦ понятное и хитрое, без этой ваше заумной математики и A/B

Вот кстати, более полное расследование от того же автора

Dark patterns не специфика именно WB:
«Amazon fined in Poland for dark pattern design tricks»
и еще «The dark pattern that cost Amazon $2.5 billion»
или SHEIN, да много можно найти — не только про интерфейс, но и про алгоритмы ценообраования в доставке еды и многое другое.

Мой вывод в итоге для себя простой — делать понятные интересные вещи, не пытаясь соревноваться с бизнесом в создании денег из воздуха.
318👍6🔥6💯4🤔3👻3😢1🥱1😎1
#кейсы

Нынче популярны плтатформы а-ля «RAG из коробки», «Агент за три дня»
Очередные стартаперы пришли ровно с этой идеей — в питче голосовой агент по кнопке, мол синтез решен, turn detection 99,(9)%, гибрид промтов, гардрейлов и вызовов RAG, супер-пупер инновационный способ разработки — drugndrop на максималках, latency готового агента в миллисекундах.

Пошли в пилот — выдали ресурсов, данные, скрипты, помогли с интеграцией.

Проходит пара недель — нерабочий прототип.
Еще пара недель — агенты зависают, начинают выдавать диалоги ДРУГИХ явно клиентов из другой предметной области.
Почему так? -- пацанский ответ:

мы думали вам быстро, а не вау!


Что внутри?

Царь-промпт на полмиллиона токенов, ASR и NLU — на регэкспах, словарь опечаток текстовым файликом
😁5610
#оффтоп

31 год развития GEN AI одной картинкой 😄


PS

Ссылка на оригинальную игру на веб-архиве

PPS

Когда искал запись известной речи Мартина Лютера Кинга "I have a dream" как образец ораторского мастерства, вспомнил что кроме arxiv.org со статейками по ML есть еще и archive.org, залип
1😁191
#кейсы

Про офисную политику

В третьей части Грязного Гарри есть момент когда полицейский спецназ толпой захватил группу пацифистов, подозревая их в терроризме.
А потом шеф полиции (тот самый, который 10 лет в кадрах) предложил публично наградить Гарри и его напарницу — потому как это укрепит позиции мэра на выборах.

Как?

Ну как же, при поддержке мэра в полиции появились женщины-оперативники — и сразу крутой результат!

Что характерно, взяли не тех, и это достаточно быстро всплыло.

А теперь собственно аналогичная история.
Данным-давно один из топов городской структуры решил подняться на теме DS/ML и создал «центр анализа данных», через достаточно жесткий фильтр туда классных набрали ребят (с частью до сих пор дружим, многие очень хорошо выросли по карьере и разъехались по миру), большинство было студентами еще.

И как всегда с новыми инициативами — надо показывать квиквины (quick wins) — быстрые результаты 😄.

Поэтому уже на второй неделе работы я и пара других тим лидов докладывали о достаточно наивных «файндингах» в данных московскому замминистру, через 2 месяца — министру, еще через 4-5 — министру другого министерства.

Дело шло к подготовке большой презентации мэру где нужно было поразить его воображение насколько дата-анализ полезен городу, уже даже дату согласовали.

И тут во всем городе отхлебывает ЕМИАС — медицинская система, данные из которой (топ-1 наш источник данных, но были еще) мы уже больше чем полгода «анализировали».

Это прям серьезный форс-мажор, шеф висит на волоске — и вот он собирает нас всех (человек 30) и закрывает на трое суток — ищите мол где ошибка, что сломалось — вы же умные.

По фильму можно было догадаться что было дальше

Проблему нашел штатный, нераспиаренный, но очень синьорный аналитик из той компании, которая систему и разрабатывала (он кстати и проектировал схему данных для нее).

Через трое суток ЕМИАС заработал, а для нас это стало очень хорошим отрезвлением — кто мы и что реально можем, и почему шеф нас так пиарил и водил по кабинетам.
1🔥149👍5😭4
#ML

Флешбеков пост // можно скипнуть если хочется сути — суть «на пальцах» вынесу в следующий пост

Прежде чем постить очередной набор корпоративных кейсов и историй с собеседований, как заведено в канале, расскажу про несколько забавных связей.

В опросе я обещал рассказать про семантические айдишники в рекомендашках и VQ/RQ-VAE.

Но, как водится, вместо объяснения на пальцах (будет постом-двумя ниже), захотелось уууух — найти что-то похожее в других кусочках ML.

Например, выше в моей лекции по RAG есть слайд про Product Quntization (PQ, слайд 85)

Названия PQ / VQ / RQ / AQ чем-то похожи, не правда ли? (Q значит квантизация)

PQ — product quantization
VQ — vector quantization
RQ — residual quantization
AQ — additive quantization


И тут в голову полезли нехорошие мысли — почему вариационный автоэнкодер (VAE) именно вариационный?

Несколько лет я рассказываю студентом его устройство (и заодно про VGAE —Variational Graph Auto-Encoder), даже в блиц включил вопрос про backprop градиента через слой со случайным сэмплированием (reparametrization trick), а дежавю словил только сейчас.

Почему дежавю: в университете меня учили геофизике и сейсморазведке, в тч некорректным задачам геофизики (байессовский / вариационный вывод, регуляризация по Тихонову и Ляпунову, решению интегральных уравнений и пр и пр и пр ) и отдельно вариационному исчислению — (оба курса вроде годовые если не путаю).

С другой стороны, вариационный автоэнкодер.

Совпадение? Вот и я так не подумал.

Если совсем коротко, вариационное исчисление изучает функционалы: функции, которые сопоставляют функции (на части диапазона значений или на всей области определения) число.

Например,

Сейсморазведка: найти оптимальную траекторию луча (нормаль к фронту волны в геометрической теории волн) среди всех возможных траекторий, вдоль которой время прохождения луча через неоднородную среду будет наименьшим.
Время — функционал, траектория — функция

Или
VAE: найти оптимальную аппроксимацию апостериорного распределения латентной переменной среди заданного семейства распределений, при котором вариационная нижняя граница правдоподобия (variational lower bound — ELBO) будет наибольшей

На этом совпадения не заканчиваются.

После защиты кандидатской я занимался обработкой сигналов (signal processing) в Яндекс.Терре (сейчас Сейсмотек с другими собственниками), а в обработке сигналов есть очень похожая на RQ идея — matching pursuit: жадное разложение сигнала по словарю с вычитанием остатка (что концептуально очень близко к residual quantization) — и вот для разнообразия, ссылка не на архив а на NASA.

Идея в том чтобы разложить сигнал на элементарные (хотел написать функции, но все же нет) составляющие — то есть повторяющиеся элементы (видели зубцы на ЭКГ?).

А кремлевскую стену видели? Если вот эти замысловатые зубцы вычесть — будет стена как стена, ровная — вот мы и разложили «сигнал Кремля»: ровная стена + зубцы

Например:

преобразование Фурье представляет сигнал как взвешенную сумму базисных гармонических функций (синусов и косинусов или только синусов или только косинусов — как захотим)
вейвлет-преобразование — раскладывает сигнал на сумму вейвлетов (семейство функций, которые мы выбираем заранее сами)
чирплет преобразование — еще более общее семейство функций (когда и частота внутри такого элементарного кусочка не постоянна) — кстати, в той статье я попал в англоязычную вики на радость маме
и тд — интегральных преобразований достаточно много все же

Итак, кажется, начинает вырисовываться структура следующего поста:

— что такое RQ (residual quantization) и при чем она здесь — и как matching pursuit + product quantization до боли похожи на RQ
— что такое вариация функционала и при чем она здесь (зачем V в VAE), причем здесь физика
— как это ловко превращается в RQ-VAE и что он умеет
— причем здесь семантические айдишники и зачем нужна токенизация вне NLP

PS
Пока писал вспомнил еще что и KLT и PCA — одно и то же, но об этом в другой раз
230🔥17👍5👏2
Полистал программу из поста
Парни тоже уповают на кейсы реальных внедрений ML/AI (ну или фэйлы — на конфах про них не расскажут, а после лыж в баре — вполне).
Ждем от них тоже огненных корпорат историй?

Если в трех словах (как я вижу) — агенты, платформы, катание 😄

Шучу, там больше и интереснее — как налутать бабла с рекомендашек например — или как реально внедрили агентов в Лавку
В общем, выглядит сочно, рекомендую
1👍7🤣4