Data Science
42.6K subscribers
1.78K photos
5 videos
47 files
2.17K links
DS
По всем вопросам- @haarrp

@ai_machinelearning_big_data - machine learning

@pythonl - Python

@itchannels_telegram - 🔥 best it channels

@ArtificialIntelligencedl - AI

@pythonlbooks-📚

@programming_books_it -📚

Реестр РКН: https://clck.ru/3Fk3zS
Download Telegram
ML-проект не заканчивается на обучении модели

В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.

Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.

Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.

При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.

Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
"PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research"


📓 Read

@datascienceiot
5 октября начнется 19-й поток программы Data Engineer от Newprolab

Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE

📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы

📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы

Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь

👉 Подробности и квиз – на сайте

Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Shockingly Simple Self-retrospection Improves Agentic Models Without RL

"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."

📓 Read

@datascienceiot
📚 Классика, которую стоит прочитать: бесплатная книга Давида Кризеля о нейросетях

Если хочется разобраться, как нейросети устроены на уровне основ, а не только вызывать API, есть отличный бесплатный материал: A Brief Introduction to Neural Networks Давида Кризеля. Книга выросла из семинара в Боннском университете, первая версия вышла ещё в 2005 году, и с тех пор её дорабатывали.

Книга разделена на три большие части. Первая ведёт от биологии к формализации: биологический нейрон, компоненты искусственных сетей и основы обучения. Вторая посвящена обучению с учителем: перцептроны, backpropagation, RBF-сети и рекуррентные сети. Третья про обучение без учителя: сети Хопфилда, самоорганизующиеся карты Кохонена и теорию адаптивного резонанса.

Отдельно есть экскурсы в кластеризацию, предсказание временных рядов и обучение с подкреплением.

Главное достоинство книги в подаче. Каждое понятие объясняется сначала простыми словами, а потом строго математически, поэтому её одинаково удобно читать и новичку, и тому, кто хочет формул. Иллюстрации автор рисовал сам, в конце глав есть упражнения, а примеры связаны с его Java-библиотекой SNIPE.

Про трансформеры и LLM здесь ничего нет. Зато это хороший фундамент, без которого современные архитектуры понимаются хуже. Распространяется бесплатно по лицензии Creative Commons.

https://dkriesel.com/_media/science/neuronalenetze-en-zeta2-2col-dkrieselcom.pdf
Стать специалистом по Data Science всего за 10 недель — это реально!

Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.

Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.

И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.

Что вас ждёт:
➖необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
➖практика на реальных задачах и проектах;
➖понятный ежедневный план обучения и поддержка менторов;
➖еженедельные живые занятия, а не старые записи;
➖подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.

А что после 10 недель? Буткемп — это только первый этап.

После него можно продолжить углублять экспертизу и двигаться к уровню middle:
➖продвинутый Python;
➖Git;
➖продвинутая статистика и A/B-тестирование;
➖Airflow;
➖MLOps и развёртывание ML-моделей.

Кому подойдёт:
Тем, кто хочет войти в Data Science системно и не тратить год на самостоятельный поиск правильного маршрута.
Тем, кто начинал учиться самостоятельно, но терял темп без структуры и дедлайнов.
Тем, кто хочет не просто изучать теорию, а как можно раньше начать готовиться к выходу на рынок.
Тем, кому важно учиться на практике и получать обратную связь от менторов.

🔥ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!

Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!

🔗 ЗАБРОНИРОВАТЬ МЕСТО
Please open Telegram to view this post
VIEW IN TELEGRAM
AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems

📓 Read

@datascienceiot
📚 Обновили огромный учебник по математике для Computer Science и Machine Learning - 2220 страниц.

Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.

Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/

@datascienceiot
Handbook on Understanding Harness Engineering for AI Agents

📓 Read

@datascienceiot
📚 280 страниц о машинном обучении в инвестициях от J.P. Morgan

Big Data and AI Strategies Марко Колановича и Раджеша Кришнамачари: масштабный отчёт о том, как использовать ML и альтернативные данные для анализа рынков.

Внутри:
• Какие данные могут дополнять финансовую отчётность: соцсети, поисковые запросы, транзакции и другие источники.
• Как оценивать их качество и полезность.
• Обзор методов машинного обучения для анализа данных.
• Возможности и ограничения применения этих подходов в инвестициях.

Отчёт вышел в 2017 году. Его стоит читать как фундаментальный материал по ML и данным в финансах, учитывая возраст примеров.

PDF доступен бесплатно, на английском:

📓 Книга

@datascienceiot
Подключить ИИ-агента к базе просто. Определить, что ему разрешено делать, сложнее.

Пока агент только отвечает в чате, его ошибку можно заметить и исправить. Когда он получает доступ к данным, внешним API и исполнению кода, ошибка уже может превратиться в действие.

Поэтому заранее стоит определить: какие данные агент видит, какие инструменты вызывает и какие операции требуют проверки.

Эти вопросы разбирает «Лаборатория Касперского» в руководстве «Безопасность ИИ-агентов через призму кибериммунитета». Внутри: атаки через контекст на примере EchoLeak, SearchLeak и CamoLeak, границы доверия к LLM и подходы к изоляции инструментов.

Пригодится разработчикам и архитекторам, которые внедряют агентов в реальные процессы.

Скачать
Бесплатные учебники по математике от профессора Университета Альберты

Джереми Сильвестр, доцент кафедры математики Университета Альберты, выложил свои учебники в открытый доступ. Их можно читать онлайн, а часть скачать в PDF.

Главная находка здесь Discover Linear Algebra, полноценный курс линейной алгебры на два семестра. Для тех, кому нужно быстрее, есть сокращённая версия на один семестр. Для ML это база: векторы, матрицы, собственные значения, разложения и всё, на чём держатся нейросети.

Ещё два учебника: Calculus Concepts & Modelling по матанализу и дифференциальным уравнениям с упором на моделирование и Elementary Foundations по дискретной математике и логике, который автор обещает скоро открыть полностью.

Хороший вариант, если хочется подтянуть математику под машинное обучение по нормальным университетским учебникам и бесплатно.

https://sites.ualberta.ca/~jsylvest/
Forwarded from Machinelearning
📌Baseten выпустила бесплатный учебник по инженерии инференса

Платформа, которая хостит модели Cursor, Notion и Harvey, выложила в открытый доступ книгу Inference Engineering за авторством Филипа Кайли. который четыре года работает в Baseten и написал её по интервью с инженерами компании и собственным докладам.

Среди рецензентов - автор FlashAttention Три Дао.


Книга собирает в одном месте путь от выбора модели и GPU до мониторинга работающего сервиса.

Baseten основана в 2019 году тремя выходцами из Gumroad, четвёртым сооснователем стал Панкадж Гупта из Uber.

Компания продаёт выделенные развёртывания открытых и собственных моделей клиентов, готовые Model APIs и инфраструктуру для дообучения, а также развивает открытый фреймворк упаковки моделей Truss.


Восемь глав объясняют, как сформулировать требования к продукту, как устроены модели и где они тормозят, прежде всего в механизме внимания, разбирают GPU NVIDIA поколений Hopper и Blackwell и программный уровень, от CUDA и PyTorch до движков vLLM, SGLang, TensorRT-LLM и Dynamo.

Отдельные главы посвящены методам ускорения, моделям для речи, изображений и видео, а также эксплуатации - от автомасштабирования и батчинга до постепенной выкатки новых версий.

Новичку книга даёт карту области и порядок действий - как определить задачу, бюджет задержки, стоимости и подобрать модель, а в последующем заняться оптимизацией.

Базовые понятия вроде предзаполнения, декодирования и KV-кэша объяснены с нуля, а незнакомые термины можно найти в глоссарии.

Опытным инженерам будут интересны пороги и практические правила. Для каждой техники ускорения автор объясняет, как она устроена, при каком трафике и размере модели окупается и чем рискует качество ответов.

Отдельно сравниваются движки инференса и разобраны задачи эксплуатации, которые обычно приходится решать методом проб и ошибок.

Последний раздел посвящён продуктам компании, а оборудование рассматривается почти целиком на примере NVIDIA, другим ускорителям отведено около двух страниц.

🔜 Запросить книгу бесплатно в форматах PDF, EPUB или аудиоверсию


@ai_machinelearning_big_data

#AI #ML #Inference #Book #Baseten
Please open Telegram to view this post
VIEW IN TELEGRAM