Доска AI-объявлений
3.72K subscribers
269 photos
4 videos
140 links
Это не душный, а душевный канал про Data Science в Авито. Пишем о том, что у нас происходит, про ML, вакансии, мероприятия.
Download Telegram
Недавно мы вместе с Хабром провели исследование, как DS-инженеры используют искусственный интеллект в работе и повседневной жизни. Разобрались, какие задачи уже доверяют нейросетям и как относятся к ИИ.

Ключевые инсайты собрали в карточки, а подробности про исследование уже можно почитать, например, в этой статье🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤‍🔥3
Live с Practical ML🚀

Ходили послушать и поддержать Антона Семенистого, выступавшего с докладом про DL CTR модели в поиске. Более того, у Антона сегодня день рождения.

Антон, поздравляем тебя и желаем плодотворной творческой работы и успехов! 🎉
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥29🎉53👍1🤪1
Привет! Я Сергей Кляхандлер, техлид в команде LLM Авито. Мы с коллегами продолжаем разрабатывать мультимодальную модель для улучшения поисковой выдачи на платформе. В прошлом году научили её создавать автоописания для объявлений, чтобы упростить жизнь продавцам.

Когда продавец загружал фотографии на сервис, модель анализировала главное фото и предлагала шаблон описания. Оставалось только добавить размеры и немного отредактировать текст при желании. В этом году мы чуть изменили подход и добавили дополнительную функцию.

Как теперь обстоят дела с автоописанием
1️⃣ Научили модель анализировать все фото из объявления, а не только одно. Теперь она предлагает более полные и точные тексты.

2️⃣ Избавились от излишней «сухости» в описаниях. Они стали живее и понятнее, при этом информативность осталась на прежнем высоком уровне.

🎉 Результат: +5.7% к использованию сервиса, а продавцы на 10.8% чаще получают подходящий текст с первого раза.

Что мы придумали ещё
Ещё один проект инициировала команда Поиска. Вместе с командой LLM, в нём участвовала инженер Камила Алибаева и тимлид — Илья Валяев.

Мы переиспользовали подход, чтобы решить другую проблему — неполную индексацию объявлений. Некоторые продавцы описывают не все характеристики товара или используют непопулярные слова-синонимы.

Например, куртку цвета хаки описывают как зелёную. В итоге покупатель, который ищет куртку хаки, это объявление не видит, хотя оно подходит.

Теперь наша модель анализирует главное фото и генерирует дополнительные ключевые слова, которые не указал продавец. Эти слова добавляются в поисковый индекс сервиса, а наш покупатель, который ищет куртку хаки, теперь увидит объявление и с зелёной курткой тоже.


🎉 Результат: покупатели стали видеть на 22% больше релевантных объявлений, а количество уникальных пар «покупатель-продавец» выросло на 0.8%.

Подробный разбор с техническими деталями и цифрами читайте в моей статье на Хабре.

А если у вас есть идеи, что ещё можно улучшить — welcome в комментарии! 👇
🔥20👍6
👋 Всем привет! DataFest давно прошёл, а мы ничего не показали! Исправляемся. Отобрали 10 докладов и оставили ссылки на них в одном месте, чтобы вам не искать. Читайте описания и выбирайте интересные выступления.

Вот что можно посмотреть:

👉 Какие LLM уже разработали наши инженеры.
👉 Как мы интегрируем нейросети в продукты и рабочие процессы.
👉 Как применяем ML.
👉 Как стажируются и растут DS-инженеры в Авито.
👉 Бонус: открытый диалог мастеров по Kaggle о том, какие мифы существуют вокруг соревновательного ML.

Заходите в статью и выбирайте интересные доклады

Приятного просмотра 🙂
🔥12👍5🤝1
👀 На горизонте видна возможность интересной работы 👀

Если вы DS-инженер уровня middle+ и хотите работать в бигтехе — то приглашаем на осенний Weekend Offer в Авито. Сможете пройти все HR-этапы в ускоренном режиме и получите возможность дойти до оффера.

Что получите, если придёте на WO:
✔️ Обратную связь от команд сразу после собеседования.
✔️ Вероятность оффера через два дня после первого интервью.
✔️ Возможность попробовать себя в разных командах.

Что мы ждём от участников:
📌 Не менее трёх лет опыта в Data Science.
📌 Стек — NLP или классический ML.

Почему у нас классно:
Авито — большой продукт, которым пользуется каждый третий житель России. У нас развитая инфраструктура для разработки и обучения LLM, современные технические решения и, конечно, все айтишные плюшки: мощное железо, отличный офис или удалёнка, дополнительные дни отпуска.

→ Регистрируйтесь на мероприятие и отправляйте свои анкеты до 10 октября
👍117👀1
Всем привет! Меня зовут Алина, я DS Team Lead команды Auction Efficiency. В посте расскажу, почему хожу на профильные конференции, но сначала немного про мою команду 😇

В Авито продавцы платят за разные целевые действия: клики, сделки, звонки. Мы также хотим учитывать этот потенциал за оплату разных действий в поиске и рекомендациях — для этого рассчитываем монетизационный фактор. За его качество наша команда и отвечает.

Для оценки этого фактора мы используем ML-модели предсказаний целевых действий. Сейчас это catboost, но мы активно смотрим в сторону DL-моделей. И чтобы понимать, какие подходы есть сейчас и как они работают, мы не только читаем статьи, но и ходим на конференции.

Конференции — это возможность услышать идеи для своих задач: как на презентациях, так и в личных беседах.
Ещё, когда я слушаю об успехах, неудачах и сложностях других специалистов — это помогает мне чувствовать себя спокойнее в работе. Приятно, что не мы одни сталкиваемся с какими-то проблемами.

На конференции можно ходить, чтобы поддерживать коллег. Выступать всегда немного волнительно, особенно в первый раз. Поэтому приятно, когда в зале есть знакомые лица. Например, мы недавно ходили на Practical ML — поддерживали Антона Семенистого. Он рассказывал про DL CTR.

Ещё на таких мероприятиях можно в неформальной обстановке наладить контакт, а потом узнать подробнее про устройство бизнеса и команды. Например, на Practical ML мы слушали доклад про модель Argus, которая актуальна и для Авито, и, конечно, поболтали с ребятами из других компаний.

Ещё я как-то выигрывала два промокода в Лавку, управляя птичкой, а потом узнала, как команда Яндекс Плюс выбирает кешбэки для покупателей 😁

В общем, на конференции полезно ходить не только (и не столько) ради самих докладов, сколько ради нетворка и инсайтов, которые можно получить во время общения с коллегами из других компаний. Надеюсь, что в будущем и моя команда выступит с докладами!

А за что вы любите или не любите конференции?
175🔥4
Собеседование в прямом эфире: ML system design
13 октября | 18:30 мск

Что будет на стриме:
1️⃣ Разберём ML system design кейс, который ещё в недавнем прошлом предлагали на реальных собеседованиях.

2️⃣ Поговорим про компетенции, которые в Авито ждут от DS-инженеров.

3️⃣ Разберём результаты по итогам решения кейса и ответим на ваши вопросы.

Кто будет на стриме:
👤 Интервьюеры — Саша Ледовский, руководитель DS команд монетизации Авито и Максим Каширин, руководитель Data Science направления в модерации Авито.

👤 Кандидат —Дмитрий Савелко, LLM-инженер в R&D команде банка Точка.

Больше информации про событие и регистрация на Timepad.
Пришлём вам ссылку с напоминанием за 5 минут до старта 🚀
👍9🔥71
Привет! Меня зовут Артём, я DS-инженер в команде Auction Efficiency, занимаюсь CTR-моделями в Поиске.

С этого поста начну серию текстов, в которых буду делиться своим подходом к организации работы и исследований в Data Science.

Верхнеуровневая структура моего DS-проекта обычно выглядит следующим образом:


project/
├── code
├── configs
├── notebooks
├── data/
│ ├── input
│ └── output
├── results
├── models
├── requirements.txt
├── .gitignore
└── README.md


Пройдёмся по ней более подробно:
code: .py файлы с полезными функциями и классами.
configs: различные конфиги для обучения моделей и трансформации данных.
notebooks: jupyter-ноутбуки, в которых обычно происходит вызов функций и методов классов из python-файлов директории code.
— data: входные и выходные данные.
results: результаты (метрики и др.)
models: сохранённые модели для воспроизведения результатов.
requirements.txt: файл с зафиксированными версиями библиотек.
.gitignore: файл для создания правил по добавлению файлов в Git.
README.md: описание проекта.

Это обобщённая структура, поэтому в одних проектах каких-нибудь файлов/папок может и не быть, а в других проектах нужно будет добавить дополнительные.

В следующий раз я расскажу, как навести порядок в своих jupyter-ноутбуках, поэтому, если такие практические советы вам интересны — ставьте ✍️ под постом, чтобы мы продолжили развивать это направление!

И ловите полезные ссылки по этой теме:
Cookiecutter Data Science: шаблон, с помощью которого можно в автоматическом режиме настроить свой Data Science проект с нуля.

Обзор от ИИ Google: если поискать в интернете data science project structure, то Google предоставляет классный конспект на эту тему.

How to organize your Python data science project: ещё один подход к организации DS проекта.

А как вы структурируете свои DS-проекты? Рассказывайте в комментариях
32👍252
Привет! Я Ярослав Хрипков — DS-инженер в команде LLM. Проведу в этом канале наш первый ML reading club в прямом эфире.

Мы прочитаем и разберём статью Qwen3-Next: Towards Ultimate Training & Inference Efficiency, чтобы понять, как и почему у компании Alibaba всё так круто сработало с этой версией модели.

Узнаем:
➡️ Чем хороша эта модель.
➡️ Из-за чего выросло её качество.
➡️ Как gated attention и gated delta блоки улучшили эффективность модели.

Для контекста заглянем и в другие материалы:

Gated Delta Networks: Improving Mamba2 with Delta Rule

Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free

🎤Эфир проведу 14 октября в 18:00 прямо в этом канале. Приходите, будет интересно!

Нюанс: если эфир будет плохо работать, попробуйте использовать сторонние сервисы и приложения, чтобы подключиться с другого IP 😉
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥24🙏42🤷1
👋 Привет! Напоминаем, что ждём вас на нашем первом ML reading club. Обсудим статью Qwen3-Next: Towards Ultimate Training & Inference Efficiency, и разберёмся, что такого классного в новой модели от Alibaba.

Эфир пройдёт в этом канале завтра, в 18:00. Ссылку пришлём за час до старта.
9👍8
Через час начинаем ML reading club в этом канале
7
Live stream scheduled for
Привет, это Настя Козий — DS Tech Lead команды Horizontal ML Technologies в юните DS SWAT. Ищу ребят, которые хотят одновременно работать над продовыми задачами и заниматься образованием.

Почему это крутая возможность?

1️⃣ Уникальная комбинация ролей

✦ Вы получите классическую позицию DS-инженера: обучение моделей, эксперименты, выкатка в прод и всё, что мы любим в боевом ML.

✦ Но вместе с этим официальная часть работы — заниматься образованием. Вы будете читать лекции, делать курсы и делиться экспертизой. Причём не «дополнительно в свободное время», а в рабочие часы в рамках должностных обязанностей.

2️⃣ Разнообразие продовых задач

У нашей команды проекты из разных доменов: компьютерное зрение, обработка текста, работа со звуком и многое другое. Наши технологии используют во всём Авито!

3️⃣ Образование как драйвер развития

✦ Подготовка материалов — это возможность глубже понять алгоритмы и научиться объяснять сложные вещи простым языком.

✦ Ваши лекции будут смотреть и пересматривать сотни, а потом и тысячи студентов. Это шанс заявить о себе так же громко, как сделали когда-то Соколов, Воронцов, Кантор и другие.

Если чувствуете, что такая позиция для вас, откликайтесь на странице вакансии или пишите мне в ЛС @steysie
👍20🔥9🥰3🥱1
📌 Запись трансляции ML reading club

14 октября Ярослав Хрипков — DS-инженер в команде LLM в прямом эфире разбирал, почему новая модель от Alibaba лучше своих предшественниц. Как и обещали, выкладываем видео, оно длится около получаса.

О чём говорили:

1:15 — Как устроен Gated DeltaNet
2:19 — Gated DeltaNet vs Linear Attention/Mamba-2
5:15 — Что даёт Gated DeltaNet
7:09 — Как работает Gated Attention
11:27 — Как выглядит модель целиком
15:05 — Изменения гиперпараметров
20:00 — Производительность Qwen3-Next
20:44 — Метрики качества Qwen3-Next
24:20 — Наблюдения от слушателя

Видео на ютуб-канале AvitoTech
👍15🔥102