ML-проект не заканчивается на обучении модели
В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.
Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.
Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.
При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.
Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.
Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.
Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.
При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.
Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
"PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research"
📓 Read
@datascienceiot
📓 Read
@datascienceiot
5 октября начнется 19-й поток программы Data Engineer от Newprolab
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Shockingly Simple Self-retrospection Improves Agentic Models Without RL
"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."
📓 Read
@datascienceiot
"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."
📓 Read
@datascienceiot
📚 Классика, которую стоит прочитать: бесплатная книга Давида Кризеля о нейросетях
Если хочется разобраться, как нейросети устроены на уровне основ, а не только вызывать API, есть отличный бесплатный материал: A Brief Introduction to Neural Networks Давида Кризеля. Книга выросла из семинара в Боннском университете, первая версия вышла ещё в 2005 году, и с тех пор её дорабатывали.
Книга разделена на три большие части. Первая ведёт от биологии к формализации: биологический нейрон, компоненты искусственных сетей и основы обучения. Вторая посвящена обучению с учителем: перцептроны, backpropagation, RBF-сети и рекуррентные сети. Третья про обучение без учителя: сети Хопфилда, самоорганизующиеся карты Кохонена и теорию адаптивного резонанса.
Отдельно есть экскурсы в кластеризацию, предсказание временных рядов и обучение с подкреплением.
Главное достоинство книги в подаче. Каждое понятие объясняется сначала простыми словами, а потом строго математически, поэтому её одинаково удобно читать и новичку, и тому, кто хочет формул. Иллюстрации автор рисовал сам, в конце глав есть упражнения, а примеры связаны с его Java-библиотекой SNIPE.
Про трансформеры и LLM здесь ничего нет. Зато это хороший фундамент, без которого современные архитектуры понимаются хуже. Распространяется бесплатно по лицензии Creative Commons.
https://dkriesel.com/_media/science/neuronalenetze-en-zeta2-2col-dkrieselcom.pdf
Если хочется разобраться, как нейросети устроены на уровне основ, а не только вызывать API, есть отличный бесплатный материал: A Brief Introduction to Neural Networks Давида Кризеля. Книга выросла из семинара в Боннском университете, первая версия вышла ещё в 2005 году, и с тех пор её дорабатывали.
Книга разделена на три большие части. Первая ведёт от биологии к формализации: биологический нейрон, компоненты искусственных сетей и основы обучения. Вторая посвящена обучению с учителем: перцептроны, backpropagation, RBF-сети и рекуррентные сети. Третья про обучение без учителя: сети Хопфилда, самоорганизующиеся карты Кохонена и теорию адаптивного резонанса.
Отдельно есть экскурсы в кластеризацию, предсказание временных рядов и обучение с подкреплением.
Главное достоинство книги в подаче. Каждое понятие объясняется сначала простыми словами, а потом строго математически, поэтому её одинаково удобно читать и новичку, и тому, кто хочет формул. Иллюстрации автор рисовал сам, в конце глав есть упражнения, а примеры связаны с его Java-библиотекой SNIPE.
Про трансформеры и LLM здесь ничего нет. Зато это хороший фундамент, без которого современные архитектуры понимаются хуже. Распространяется бесплатно по лицензии Creative Commons.
https://dkriesel.com/_media/science/neuronalenetze-en-zeta2-2col-dkrieselcom.pdf
Стать специалистом по Data Science всего за 10 недель — это реально!
Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.
Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.
И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.
Что вас ждёт:
➖ необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
➖ практика на реальных задачах и проектах;
➖ понятный ежедневный план обучения и поддержка менторов;
➖ еженедельные живые занятия, а не старые записи;
➖ подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.
А что после 10 недель? Буткемп — это только первый этап.
После него можно продолжить углублять экспертизу и двигаться к уровню middle:
➖ продвинутый Python;
➖ Git;
➖ продвинутая статистика и A/B-тестирование;
➖ Airflow;
➖ MLOps и развёртывание ML-моделей.
Кому подойдёт:
Тем, кто хочет войти в Data Science системно и не тратить год на самостоятельный поиск правильного маршрута.
Тем, кто начинал учиться самостоятельно, но терял темп без структуры и дедлайнов.
Тем, кто хочет не просто изучать теорию, а как можно раньше начать готовиться к выходу на рынок.
Тем, кому важно учиться на практике и получать обратную связь от менторов.
🔥 ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!
Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.
Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.
И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.
Что вас ждёт:
А что после 10 недель? Буткемп — это только первый этап.
После него можно продолжить углублять экспертизу и двигаться к уровню middle:
Кому подойдёт:
Тем, кто хочет войти в Data Science системно и не тратить год на самостоятельный поиск правильного маршрута.
Тем, кто начинал учиться самостоятельно, но терял темп без структуры и дедлайнов.
Тем, кто хочет не просто изучать теорию, а как можно раньше начать готовиться к выходу на рынок.
Тем, кому важно учиться на практике и получать обратную связь от менторов.
Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Please open Telegram to view this post
VIEW IN TELEGRAM
AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems
📓 Read
@datascienceiot
📓 Read
@datascienceiot
📚 Обновили огромный учебник по математике для Computer Science и Machine Learning - 2220 страниц.
Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.
Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/
@datascienceiot
Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.
Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/
@datascienceiot
📚 280 страниц о машинном обучении в инвестициях от J.P. Morgan
Big Data and AI Strategies Марко Колановича и Раджеша Кришнамачари: масштабный отчёт о том, как использовать ML и альтернативные данные для анализа рынков.
Внутри:
• Какие данные могут дополнять финансовую отчётность: соцсети, поисковые запросы, транзакции и другие источники.
• Как оценивать их качество и полезность.
• Обзор методов машинного обучения для анализа данных.
• Возможности и ограничения применения этих подходов в инвестициях.
Отчёт вышел в 2017 году. Его стоит читать как фундаментальный материал по ML и данным в финансах, учитывая возраст примеров.
PDF доступен бесплатно, на английском:
📓 Книга
@datascienceiot
Big Data and AI Strategies Марко Колановича и Раджеша Кришнамачари: масштабный отчёт о том, как использовать ML и альтернативные данные для анализа рынков.
Внутри:
• Какие данные могут дополнять финансовую отчётность: соцсети, поисковые запросы, транзакции и другие источники.
• Как оценивать их качество и полезность.
• Обзор методов машинного обучения для анализа данных.
• Возможности и ограничения применения этих подходов в инвестициях.
Отчёт вышел в 2017 году. Его стоит читать как фундаментальный материал по ML и данным в финансах, учитывая возраст примеров.
PDF доступен бесплатно, на английском:
📓 Книга
@datascienceiot
Подключить ИИ-агента к базе просто. Определить, что ему разрешено делать, сложнее.
Пока агент только отвечает в чате, его ошибку можно заметить и исправить. Когда он получает доступ к данным, внешним API и исполнению кода, ошибка уже может превратиться в действие.
Поэтому заранее стоит определить: какие данные агент видит, какие инструменты вызывает и какие операции требуют проверки.
Эти вопросы разбирает «Лаборатория Касперского» в руководстве «Безопасность ИИ-агентов через призму кибериммунитета». Внутри: атаки через контекст на примере EchoLeak, SearchLeak и CamoLeak, границы доверия к LLM и подходы к изоляции инструментов.
Пригодится разработчикам и архитекторам, которые внедряют агентов в реальные процессы.
Скачать
Пока агент только отвечает в чате, его ошибку можно заметить и исправить. Когда он получает доступ к данным, внешним API и исполнению кода, ошибка уже может превратиться в действие.
Поэтому заранее стоит определить: какие данные агент видит, какие инструменты вызывает и какие операции требуют проверки.
Эти вопросы разбирает «Лаборатория Касперского» в руководстве «Безопасность ИИ-агентов через призму кибериммунитета». Внутри: атаки через контекст на примере EchoLeak, SearchLeak и CamoLeak, границы доверия к LLM и подходы к изоляции инструментов.
Пригодится разработчикам и архитекторам, которые внедряют агентов в реальные процессы.
Скачать
Бесплатные учебники по математике от профессора Университета Альберты
Джереми Сильвестр, доцент кафедры математики Университета Альберты, выложил свои учебники в открытый доступ. Их можно читать онлайн, а часть скачать в PDF.
Главная находка здесь Discover Linear Algebra, полноценный курс линейной алгебры на два семестра. Для тех, кому нужно быстрее, есть сокращённая версия на один семестр. Для ML это база: векторы, матрицы, собственные значения, разложения и всё, на чём держатся нейросети.
Ещё два учебника: Calculus Concepts & Modelling по матанализу и дифференциальным уравнениям с упором на моделирование и Elementary Foundations по дискретной математике и логике, который автор обещает скоро открыть полностью.
Хороший вариант, если хочется подтянуть математику под машинное обучение по нормальным университетским учебникам и бесплатно.
https://sites.ualberta.ca/~jsylvest/
Джереми Сильвестр, доцент кафедры математики Университета Альберты, выложил свои учебники в открытый доступ. Их можно читать онлайн, а часть скачать в PDF.
Главная находка здесь Discover Linear Algebra, полноценный курс линейной алгебры на два семестра. Для тех, кому нужно быстрее, есть сокращённая версия на один семестр. Для ML это база: векторы, матрицы, собственные значения, разложения и всё, на чём держатся нейросети.
Ещё два учебника: Calculus Concepts & Modelling по матанализу и дифференциальным уравнениям с упором на моделирование и Elementary Foundations по дискретной математике и логике, который автор обещает скоро открыть полностью.
Хороший вариант, если хочется подтянуть математику под машинное обучение по нормальным университетским учебникам и бесплатно.
https://sites.ualberta.ca/~jsylvest/
Forwarded from Machinelearning
Платформа, которая хостит модели Cursor, Notion и Harvey, выложила в открытый доступ книгу
Inference Engineering за авторством Филипа Кайли. который четыре года работает в Baseten и написал её по интервью с инженерами компании и собственным докладам.Среди рецензентов - автор FlashAttention Три Дао.
Книга собирает в одном месте путь от выбора модели и GPU до мониторинга работающего сервиса.
Baseten основана в 2019 году тремя выходцами из Gumroad, четвёртым сооснователем стал Панкадж Гупта из Uber.
Компания продаёт выделенные развёртывания открытых и собственных моделей клиентов, готовые Model APIs и инфраструктуру для дообучения, а также развивает открытый фреймворк упаковки моделей Truss.
Восемь глав объясняют, как сформулировать требования к продукту, как устроены модели и где они тормозят, прежде всего в механизме внимания, разбирают GPU NVIDIA поколений Hopper и Blackwell и программный уровень, от CUDA и PyTorch до движков vLLM, SGLang, TensorRT-LLM и Dynamo.
Отдельные главы посвящены методам ускорения, моделям для речи, изображений и видео, а также эксплуатации - от автомасштабирования и батчинга до постепенной выкатки новых версий.
Новичку книга даёт карту области и порядок действий - как определить задачу, бюджет задержки, стоимости и подобрать модель, а в последующем заняться оптимизацией.
Базовые понятия вроде предзаполнения, декодирования и KV-кэша объяснены с нуля, а незнакомые термины можно найти в глоссарии.
Опытным инженерам будут интересны пороги и практические правила. Для каждой техники ускорения автор объясняет, как она устроена, при каком трафике и размере модели окупается и чем рискует качество ответов.
Отдельно сравниваются движки инференса и разобраны задачи эксплуатации, которые обычно приходится решать методом проб и ошибок.
Последний раздел посвящён продуктам компании, а оборудование рассматривается почти целиком на примере NVIDIA, другим ускорителям отведено около двух страниц.
@ai_machinelearning_big_data
#AI #ML #Inference #Book #Baseten
Please open Telegram to view this post
VIEW IN TELEGRAM