ai-it-future_notes.pdf
14.4 MB
Привет с датафеста!
Сегодня Дмитрий Колодезев рассказывал про влияние AI на рынок труда.
Запись будет попозже (непонятно когда), но слайды с пометками спикера можно скачать уже сейчас 😉
Датафест в гостях у ВТБ
#reliable_ml #data_fest #career
Сегодня Дмитрий Колодезев рассказывал про влияние AI на рынок труда.
Запись будет попозже (непонятно когда), но слайды с пометками спикера можно скачать уже сейчас 😉
Датафест в гостях у ВТБ
#reliable_ml #data_fest #career
❤🔥14🔥9👍4🙏1
Data Strategy в эпоху AI.pdf
540.6 KB
Data Strategy в эпоху AI
Доклад на Data Fest 2026 в секции Data Strategy
И снова привет с дата феста! Выкладываем слайды доклада Иры с секции Data Strategy.
После доклада и потом в кулуарах успели обсудить много вопросов, но, кажется, что остались еще. Буду рада продолжить обсуждение в треде.
Материалы всех докладов и записи должны появиться в течение 2х недель.
Ваш @Reliable ML
#reliable_ml #data_strategy #data_fest
Доклад на Data Fest 2026 в секции Data Strategy
И снова привет с дата феста! Выкладываем слайды доклада Иры с секции Data Strategy.
После доклада и потом в кулуарах успели обсудить много вопросов, но, кажется, что остались еще. Буду рада продолжить обсуждение в треде.
Материалы всех докладов и записи должны появиться в течение 2х недель.
Ваш @Reliable ML
#reliable_ml #data_strategy #data_fest
🔥18❤1
Видео с датафеста в гостях у ВТБ - доклад Дмитрия Колодезева (и другие доклады второго дня) https://vkvideo.ru/video-164555658_456242002?t=1h23m29s
Датафест в гостях у ВТБ
#reliable_ml #data_fest #career
Датафест в гостях у ВТБ
#reliable_ml #data_fest #career
VK Видео
Data Fest 2026, день 2: офлайн в Москве 24 мая в гостях у ВТБ
Трансляция с офлайна в Москве в гостях у ВТБ Встречайте секции Open Career, Mathematics & ML, ML in Advertising, ML in DBMS, а также секцию Data Fusion от хоста площадки. Полное расписание: https://ods.ai/events/fest2026-vtb-msc/schedule Информация про Data…
🔥14👍3
Секция Data Strategy от Reliable ML
Data Fest 2026, Online, Анонс
В это воскресенье проведем онлайн-день секции Data Strategy. К нам придут 2 очень интересных спикера. Фокус - опыт разработки и внедрения стратегии по данным и AI, эффективный и системный подход к масштабированию AI в организациях.
Всех ждем! Только надо зарегистрироваться.
Онлайн-день будет на платформе DION. Инструкции и ссылки по подключению появятся в ближайшие дни.
Ваш @Reliable ML
#reliable_ml #data_strategy #data_fest
Data Fest 2026, Online, Анонс
В это воскресенье проведем онлайн-день секции Data Strategy. К нам придут 2 очень интересных спикера. Фокус - опыт разработки и внедрения стратегии по данным и AI, эффективный и системный подход к масштабированию AI в организациях.
Всех ждем! Только надо зарегистрироваться.
Онлайн-день будет на платформе DION. Инструкции и ссылки по подключению появятся в ближайшие дни.
Ваш @Reliable ML
#reliable_ml #data_strategy #data_fest
👍5❤1
Practical ML Conf - заканчивается подача докладов
Дружественный Петр Ермаков пишет:
Друзья, привет!) осталось менее 3х суток для подачи докладов на Practical ML Conf, и форма подачи продлеваться не будет.
Закидывайте ваши заявки)
Кисель налью каждому выступающему!
https://pmlconf.yandex.ru/2026/call-for-papers
Дружественный Петр Ермаков пишет:
Друзья, привет!) осталось менее 3х суток для подачи докладов на Practical ML Conf, и форма подачи продлеваться не будет.
Закидывайте ваши заявки)
Кисель налью каждому выступающему!
https://pmlconf.yandex.ru/2026/call-for-papers
👍4🔥4❤2
Онлайн Data Strategy от Reliable ML - уже начали!
Data Fest 2026, Online, в 11:00
Стартовали онлайн Data Strategy! Нас ждет 2 доклада!
11:00-11:30 - Александр Кулиев - Data-Driven трансформация в ритейле: выученные уроки на пути от хаоса к культуре
11:30-12:00 - Мария Зырянова - Как внедрять AI в продукты, если они разные?
Ссылка для подключения тык.
Ваш @Reliable ML
#reliable_ml #data_strategy #data_fest
Data Fest 2026, Online, в 11:00
Стартовали онлайн Data Strategy! Нас ждет 2 доклада!
11:00-11:30 - Александр Кулиев - Data-Driven трансформация в ритейле: выученные уроки на пути от хаоса к культуре
11:30-12:00 - Мария Зырянова - Как внедрять AI в продукты, если они разные?
Ссылка для подключения тык.
Ваш @Reliable ML
#reliable_ml #data_strategy #data_fest
Каникулы Бонифация
Или ML System Design - наше все
В этом году устроила для себя необычный отпуск - поехала с маленькой дочкой в ее первый математический лагерь: напитаться детским счастьем, поддержать интерес к математике, а еще пооткисать за любимыми делами и пет-проектами пока детей занимают)
Оказалось, что в матлагеря детей везут очень интересные родители. Довольно быстро мы перезнакомились и я обнаружила себя в центре обсуждения задачки по ML в нефтепереработке, в которой «математики, клод, чатгпт и эксперты бьются над решением уже больше 6 месяцев».
Предложила поговорить детальнее и проверить дизайн системы.
За 15 минут беседы мы выяснили 2 вещи:
• Задача на ML была поставлена неверно. Так, что ее и не имеет смысла решать ни клодом, ни математиками: ни 6 месяцев, ни год. Пользы для процесса и бизнеса решение не принесет.
• В решении задачи не используется 80% данных, которые есть и которые могли бы очень помочь при правильной постановке задачи.
Еще за 10 минут мы разобрались, как именно можно поставить первую задачу на ML (классификацию) и какие данные стоит взять. При такой постановке любой DS справится за несколько дней. Обсудили, какие полезные решения для бизнеса можно будет принять на основе результатов.
Еще за 5 минут накидали, как можно далее усложнять решение, когда первая итерация уже будет внедрена.
Мама, отвечающая за внедрение проекта, ушла с листочком A4 и со схемами, менять ход проекта.
К чему я это все?
Качайте ML System Design и учитесь выходить за рамки задачи. Ключевое - решать проблему бизнеса, а не пытаться сделать быстро и круто задачу в том виде, как ее вам кто-то принес.
Ну а мы с Димой готовим для вас большие обновления в части ML/AI System Design.
Stay tuned!
Ваш @Reliable ML
#reliable_ml #ml_system_design #мысли_вслух
Или ML System Design - наше все
В этом году устроила для себя необычный отпуск - поехала с маленькой дочкой в ее первый математический лагерь: напитаться детским счастьем, поддержать интерес к математике, а еще пооткисать за любимыми делами и пет-проектами пока детей занимают)
Оказалось, что в матлагеря детей везут очень интересные родители. Довольно быстро мы перезнакомились и я обнаружила себя в центре обсуждения задачки по ML в нефтепереработке, в которой «математики, клод, чатгпт и эксперты бьются над решением уже больше 6 месяцев».
Предложила поговорить детальнее и проверить дизайн системы.
За 15 минут беседы мы выяснили 2 вещи:
• Задача на ML была поставлена неверно. Так, что ее и не имеет смысла решать ни клодом, ни математиками: ни 6 месяцев, ни год. Пользы для процесса и бизнеса решение не принесет.
• В решении задачи не используется 80% данных, которые есть и которые могли бы очень помочь при правильной постановке задачи.
Еще за 10 минут мы разобрались, как именно можно поставить первую задачу на ML (классификацию) и какие данные стоит взять. При такой постановке любой DS справится за несколько дней. Обсудили, какие полезные решения для бизнеса можно будет принять на основе результатов.
Еще за 5 минут накидали, как можно далее усложнять решение, когда первая итерация уже будет внедрена.
Мама, отвечающая за внедрение проекта, ушла с листочком A4 и со схемами, менять ход проекта.
К чему я это все?
Качайте ML System Design и учитесь выходить за рамки задачи. Ключевое - решать проблему бизнеса, а не пытаться сделать быстро и круто задачу в том виде, как ее вам кто-то принес.
Ну а мы с Димой готовим для вас большие обновления в части ML/AI System Design.
Stay tuned!
Ваш @Reliable ML
#reliable_ml #ml_system_design #мысли_вслух
1❤46🔥17❤🔥7😁5👍3👏3💊1
Ура, доклады с Датафеста!
Секция ReliableML Датафеста доступна на сайте ods.ai https://ods.ai/tracks/df26-reliable-ml
Секция DataStrategy с докладом Ирины тоже доступна https://ods.ai/tracks/df26-data-strategy
Ваш @Reliable ML
#reliable_ml #datafest #дождались
Секция ReliableML Датафеста доступна на сайте ods.ai https://ods.ai/tracks/df26-reliable-ml
Секция DataStrategy с докладом Ирины тоже доступна https://ods.ai/tracks/df26-data-strategy
Ваш @Reliable ML
#reliable_ml #datafest #дождались
❤16🎉5🍾2🔥1
LLM Evaluation как задача Causal Inference #1
Первая заметка серии, посвященной современным методам оценки качества систем искусственного интеллекта.
Когда мы создаем сложные системы на основе LLM, нам приходится принимать много решений - о данных, способах дообучения моделей, архитектурах, контексте, инструментах и проч. Измеряем качество работы нашего пайплайна и улучшаем его.
В статье Causal Methods for LLM Development and Evaluation предлагается использовать Causal Inference для оценки влияния наших решений на качество системы.
Утверждения вроде "семантический чанкинг улучшает качество ответов RAG" - причинно-следственные. Т.е. мы утверждаем, что:
1) есть улучшение качества RAG
2) причина этого улучшения - смена схемы разбиения на чанки
3) имеющиеся данные позволяют подтвердить существование влияния и оценить его величину.
Например, разработчики часто оценивают систему на основании логов (истории запросов). Но логи в общем случае не являются результатом рандомизированного эксперимента, а зависят от конфигурации системы, обратной связи от людей и ИИ, политик развертывания и т.д., подвержены выборочному смещению, дрейфу распределений и шуму в метках.
Во время разработки составные части системы (модели, пользователи и выполняемые задачи) подстраиваются друг под друга (коадаптируются). Это увеличивает разрыв между прошлыми наблюдениями и тем, что мы увидим в проде. Непонятно, что повлияло на метрики - наши доработки, конфаундеры или просто шум оценки.
Например, если система маршрутизации запросов отправляет более сложные вопросы дорогой модели, а простые - дешевой модели, наивный анализ логов может привести нас к выводу, что дорогая модель работает хуже, потому что в ее ответах больше ошибок. В causal Inference подходе мы учтем сложность запроса как конфаундер и уберем смещение матчингом или взвешиванием.
Causal Inference предоставляет матаппарат и фреймворк для оценки эффекта, позволяет адресно работать с источниками дисперсии в оценке, более эффективно использовать имеющиеся данные, обеспечивает устойчивость и статистическую достоверность результата.
Два ключевых момента в причинно-следственном анализе: идентифицируемость identifiability и оцениваемость estimability, проще говоря - позволяют ли наши данные и наши предположения о процессе генерации выявить и надежно оценить причинно-следственную связь.
В статье разбираются типичные компоненты LLM-пайплайнов - претрейн, алайнмент, роутинг, RAG, мультиагентные системы и так далее. Приведены примеры подходов, которые могут сработать, и направления для дальнейших исследований.
Фундаментальная проблема причинно-следственного вывода - невозможность наблюдать две версии системы одновременно (с воздействием и без него). LLM пайплайн - редкий случай, когда это почти возможно: один и тот же запрос прогоняется через две версии системы. Проблема не исчезает полностью (недетерминизм генерации, поведение пользователей), но возможность параллельного прогона пайплайна здорово упрощает офлайн-оценку. Строго и методично применяя доступные нам техники Causal Inference, можно построить эффективную и практичную систему оценки.
Этим мы и займемся в следующих постах серии.
Ваш @Reliable ML
#reliable_ml #causal_inference #llm_evaluation
Первая заметка серии, посвященной современным методам оценки качества систем искусственного интеллекта.
Когда мы создаем сложные системы на основе LLM, нам приходится принимать много решений - о данных, способах дообучения моделей, архитектурах, контексте, инструментах и проч. Измеряем качество работы нашего пайплайна и улучшаем его.
В статье Causal Methods for LLM Development and Evaluation предлагается использовать Causal Inference для оценки влияния наших решений на качество системы.
Утверждения вроде "семантический чанкинг улучшает качество ответов RAG" - причинно-следственные. Т.е. мы утверждаем, что:
1) есть улучшение качества RAG
2) причина этого улучшения - смена схемы разбиения на чанки
3) имеющиеся данные позволяют подтвердить существование влияния и оценить его величину.
Например, разработчики часто оценивают систему на основании логов (истории запросов). Но логи в общем случае не являются результатом рандомизированного эксперимента, а зависят от конфигурации системы, обратной связи от людей и ИИ, политик развертывания и т.д., подвержены выборочному смещению, дрейфу распределений и шуму в метках.
Во время разработки составные части системы (модели, пользователи и выполняемые задачи) подстраиваются друг под друга (коадаптируются). Это увеличивает разрыв между прошлыми наблюдениями и тем, что мы увидим в проде. Непонятно, что повлияло на метрики - наши доработки, конфаундеры или просто шум оценки.
Например, если система маршрутизации запросов отправляет более сложные вопросы дорогой модели, а простые - дешевой модели, наивный анализ логов может привести нас к выводу, что дорогая модель работает хуже, потому что в ее ответах больше ошибок. В causal Inference подходе мы учтем сложность запроса как конфаундер и уберем смещение матчингом или взвешиванием.
Causal Inference предоставляет матаппарат и фреймворк для оценки эффекта, позволяет адресно работать с источниками дисперсии в оценке, более эффективно использовать имеющиеся данные, обеспечивает устойчивость и статистическую достоверность результата.
Два ключевых момента в причинно-следственном анализе: идентифицируемость identifiability и оцениваемость estimability, проще говоря - позволяют ли наши данные и наши предположения о процессе генерации выявить и надежно оценить причинно-следственную связь.
В статье разбираются типичные компоненты LLM-пайплайнов - претрейн, алайнмент, роутинг, RAG, мультиагентные системы и так далее. Приведены примеры подходов, которые могут сработать, и направления для дальнейших исследований.
Фундаментальная проблема причинно-следственного вывода - невозможность наблюдать две версии системы одновременно (с воздействием и без него). LLM пайплайн - редкий случай, когда это почти возможно: один и тот же запрос прогоняется через две версии системы. Проблема не исчезает полностью (недетерминизм генерации, поведение пользователей), но возможность параллельного прогона пайплайна здорово упрощает офлайн-оценку. Строго и методично применяя доступные нам техники Causal Inference, можно построить эффективную и практичную систему оценки.
Этим мы и займемся в следующих постах серии.
Ваш @Reliable ML
#reliable_ml #causal_inference #llm_evaluation
1❤12💊10👍7🔥4
Не в тему - но про ИИ
Тут пришли ребята (на самом деле девчата, @Antonina_Zhiteneva) - они делают исследование про ИИ и общество. Исследование бесплатное, мы с ним не связаны никак. Но тема интересная, почему не поддержать коллег.
Вот что пишет Антонина:
Мы проводим международное исследование о том, как люди воспринимают аргументы, созданные ИИ, в обсуждении общественно значимых вопросов (IRB #19354).
Если вам интересно взаимодействие человека с ИИ, буду очень благодарна за участие.
🧠 Что нужно сделать?
— пообщаться с чат-ботом и ответить на несколько вопросов (~10 минут).
🔗 Ссылка: https://princetonsurvey.az1.qualtrics.com/jfe/form/SV_bmHuUsXoCpi4s3s?Q_Language=RU
Спасибо всем, кто сможет помочь!
#поможем_исследователю_добрым_словом
Тут пришли ребята (на самом деле девчата, @Antonina_Zhiteneva) - они делают исследование про ИИ и общество. Исследование бесплатное, мы с ним не связаны никак. Но тема интересная, почему не поддержать коллег.
Вот что пишет Антонина:
Мы проводим международное исследование о том, как люди воспринимают аргументы, созданные ИИ, в обсуждении общественно значимых вопросов (IRB #19354).
Если вам интересно взаимодействие человека с ИИ, буду очень благодарна за участие.
🧠 Что нужно сделать?
— пообщаться с чат-ботом и ответить на несколько вопросов (~10 минут).
🔗 Ссылка: https://princetonsurvey.az1.qualtrics.com/jfe/form/SV_bmHuUsXoCpi4s3s?Q_Language=RU
Спасибо всем, кто сможет помочь!
#поможем_исследователю_добрым_словом
❤8😨2
Конференция дата-аналитиков на Экономфаке МГУ
Новости за сегодня) Перепост ниже.
Прийти на родной факультет и в родной ВУЗ - это всегда вдохновение и теплота в сердце. И благодарность за глубокую фундаментальную подготовку.
Круто, что факультет продолжает быть на острие трендов и так сильно вкладываться в развитие учеников.
Ваш @Reliable ML
#мысли_вслух
Новости за сегодня) Перепост ниже.
Прийти на родной факультет и в родной ВУЗ - это всегда вдохновение и теплота в сердце. И благодарность за глубокую фундаментальную подготовку.
Круто, что факультет продолжает быть на острие трендов и так сильно вкладываться в развитие учеников.
Ваш @Reliable ML
#мысли_вслух
❤4👍1🔥1😨1💊1
Forwarded from Kartaev Macro
Наслаждаюсь работой на конференции дата-аналитиков на экономическом факультете МГУ. Тут собралось много хороших спецов из Яндекса, Сбера, Раффайзена, Озона, WB и других солидных компаний. Программа доступна тут, и если вы рядом, то все еще можно успеть заглянуть.
Мне очень нравится:
Во-первых, здорово встретить много наших выпускников, которые ушли в индустрию вместо академической карьеры, и с которыми поэтому я реже пересекаюсь. А они крутые, их интересно послушать. И чаю вместе выпить в перерыве тем более. В общем, много теплых чувств! Спасибо замечательной команде СМУЧа, которая эту конференцию организовала.
Во-вторых, получил от индустрии ответ на вопрос, который так волновал студентов на нашем вторничном ивенте про ИИ: что там с наймом джунов? И как недавним выпускникам конкурировать с ИИ, который отлично выполняет работу людей без большого опыта?
Ответ обнадеживающий: молодые выпускники большим компаниям все еще нужны. И в конкуренции за стартовые позиции хорошо помогают системные фундаментальные знания, которые как раз могут дать хорошие университеты.
Так что пока не расходимся: университетское образование всё ещё полезно.
Мне очень нравится:
Во-первых, здорово встретить много наших выпускников, которые ушли в индустрию вместо академической карьеры, и с которыми поэтому я реже пересекаюсь. А они крутые, их интересно послушать. И чаю вместе выпить в перерыве тем более. В общем, много теплых чувств! Спасибо замечательной команде СМУЧа, которая эту конференцию организовала.
Во-вторых, получил от индустрии ответ на вопрос, который так волновал студентов на нашем вторничном ивенте про ИИ: что там с наймом джунов? И как недавним выпускникам конкурировать с ИИ, который отлично выполняет работу людей без большого опыта?
Ответ обнадеживающий: молодые выпускники большим компаниям все еще нужны. И в конкуренции за стартовые позиции хорошо помогают системные фундаментальные знания, которые как раз могут дать хорошие университеты.
Так что пока не расходимся: университетское образование всё ещё полезно.
🔥9❤6😨2👍1💊1