🔥 DataLens Platform: что происходит, когда data stack собирают в одну систему
Yandex B2B Tech представила платформу, которая объединяет хранение, обработку, визуализацию и ИИ-аналитику данных.
Вместо связки из нескольких инструментов данные можно обрабатывать и анализировать в единой среде. Встроенный ИИ-помощник принимает запросы на обычном языке и помогает получать показатели без ручной сборки отчётов.
Отдельно интересна архитектура: storage и compute масштабируются независимо. Растет объем данных — увеличивается хранилище; растёт нагрузка на расчёты — добавляются вычислительные мощности.
По оценке Yandex B2B Tech, такой подход может сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.
📎 Подробнее о платформе — в материале СМИ.
Yandex B2B Tech представила платформу, которая объединяет хранение, обработку, визуализацию и ИИ-аналитику данных.
Вместо связки из нескольких инструментов данные можно обрабатывать и анализировать в единой среде. Встроенный ИИ-помощник принимает запросы на обычном языке и помогает получать показатели без ручной сборки отчётов.
Отдельно интересна архитектура: storage и compute масштабируются независимо. Растет объем данных — увеличивается хранилище; растёт нагрузка на расчёты — добавляются вычислительные мощности.
По оценке Yandex B2B Tech, такой подход может сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.
📎 Подробнее о платформе — в материале СМИ.
Physics-based Deep Learning: Combining Deep Learning with Physical Simulations
📘 Paper
@datascienceiot
📘 Paper
@datascienceiot
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.
Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.
Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.
В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.
Успей зарегистрироваться и пройти отборочный этап до 27 сентября
Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.
Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.
В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.
Успей зарегистрироваться и пройти отборочный этап до 27 сентября
Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀
🔸 Булат Шарипов расскажет, как в Авито обучают собственные языковые модели с помощью RL, а Владислав Воробьев — как BidCorrection меняет состав трафика, не трогая сами объявления.
🔸 Всеволод Викулин расскажет, как реально автоматизировать процессы с помощью AI-агентов, — этим и многим другим он поделится на Avito DS Meetup 7 октября.
После докладов будет нетворкинг с DS-сообществом. А ещё, если придёте офлайн, сможете найти прикольные тематические пасхалки, которые мы для вас спрятали👀
⚡️ Встречаемся в 18:30 7 октября.
Места в офлайне ограничены — регистрация обязательна.
➡️ Регистрируйтесь по ссылке и приходите!
После докладов будет нетворкинг с DS-сообществом. А ещё, если придёте офлайн, сможете найти прикольные тематические пасхалки, которые мы для вас спрятали
Места в офлайне ограничены — регистрация обязательна.
Please open Telegram to view this post
VIEW IN TELEGRAM
New Stanford+Together AI paper shows teams that learn to check each other's work solve problems none of them got right alone.
📘 Paper
@datascienceiot
📘 Paper
@datascienceiot
ML-проект не заканчивается на обучении модели
В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.
Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.
Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.
При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.
Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.
Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.
Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.
При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.
Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
"PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research"
📓 Read
@datascienceiot
📓 Read
@datascienceiot
5 октября начнется 19-й поток программы Data Engineer от Newprolab
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Shockingly Simple Self-retrospection Improves Agentic Models Without RL
"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."
📓 Read
@datascienceiot
"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."
📓 Read
@datascienceiot