Data Science
42.6K subscribers
1.77K photos
5 videos
47 files
2.16K links
DS
По всем вопросам- @haarrp

@ai_machinelearning_big_data - machine learning

@pythonl - Python

@itchannels_telegram - 🔥 best it channels

@ArtificialIntelligencedl - AI

@pythonlbooks-📚

@programming_books_it -📚

Реестр РКН: https://clck.ru/3Fk3zS
Download Telegram
Не отставайте от рынка — учитесь со скидкой 16%

Если чувствуете, что стоите на месте, и хотите освоить востребованную профессию, — сейчас хороший момент начать.
Потому что до 30 сентября на все курсы Практикума действует скидка 16%. 

Выбрать курс

Вы сможете:
— получить актуальные навыки;
— освоить ИИ-инструменты для работы;
— перенять опыт экспертов, которые двигают индустрию;
— попасть в сообщество выпускников, где можно попросить совета и, возможно, найти будущих коллег.

Просто выберите курс, начните учиться бесплатно и получите скидку 16% — она автоматически появится в личном кабинете. 

Учиться!

Erid: 2SDnjezu8Km
Название: ООО "ЯНДЕКС"
ИНН: 7736207543
ττ-bench treats agent building like a real client job.


📘 Paper

@datascienceiot
Regularized Recursive Self-Improvement of Agent Harnesses


📘 Paper

@datascienceiot
🔥 DataLens Platform: что происходит, когда data stack собирают в одну систему

Yandex B2B Tech представила платформу, которая объединяет хранение, обработку, визуализацию и ИИ-аналитику данных.

Вместо связки из нескольких инструментов данные можно обрабатывать и анализировать в единой среде. Встроенный ИИ-помощник принимает запросы на обычном языке и помогает получать показатели без ручной сборки отчётов.

Отдельно интересна архитектура: storage и compute масштабируются независимо. Растет объем данных — увеличивается хранилище; растёт нагрузка на расчёты — добавляются вычислительные мощности.

По оценке Yandex B2B Tech, такой подход может сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.

📎 Подробнее о платформе — в материале СМИ.
Physics-based Deep Learning: Combining Deep Learning with Physical Simulations

📘 Paper

@datascienceiot
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.

Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.

Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.

В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.

Успей зарегистрироваться и пройти отборочный этап до 27 сентября
Agent Memory Is a Surface for Endogenous Authorization Laundering

📘 Paper

@datascienceiot
Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀

🔸 Булат Шарипов расскажет, как в Авито обучают собственные языковые модели с помощью RL, а Владислав Воробьев — как BidCorrection меняет состав трафика, не трогая сами объявления.

🔸 Всеволод Викулин расскажет, как реально автоматизировать процессы с помощью AI-агентов, — этим и многим другим он поделится на Avito DS Meetup 7 октября.

После докладов будет нетворкинг с DS-сообществом. А ещё, если придёте офлайн, сможете найти прикольные тематические пасхалки, которые мы для вас спрятали 👀

⚡️ Встречаемся в 18:30 7 октября.

Места в офлайне ограничены — регистрация обязательна.

➡️ Регистрируйтесь по ссылке и приходите!
Please open Telegram to view this post
VIEW IN TELEGRAM
New Stanford+Together AI paper shows teams that learn to check each other's work solve problems none of them got right alone.

📘 Paper

@datascienceiot
ML-проект не заканчивается на обучении модели

В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.

Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.

Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.

При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.

Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
"PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research"


📓 Read

@datascienceiot