Data Scientist | ML & AI
3.05K subscribers
620 photos
211 videos
23 files
699 links
Один из ведущих каналов по Data Science, Machine Learning и Big Data

Сотрудничество: @bape_ads
Прайс: @bape_media
Download Telegram
🔖 Большая база по Python и Machine Learning с нуля

Внутри:
🫡 Базовый синтаксис Python;
🫡 Примеры и практические задачи;
🫡 Анализ данных;
🫡 Материалы по машинному обучению;
🫡 Мини-проекты для практики.


⛓ Ссылка на GitHub

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥3👍2
📰 Как выбирать LLM для кода не по хайпу, а по деньгам

В статье разбирают, почему цена за миллион токенов почти ничего не говорит о реальной стоимости кодовой модели.

Важнее считать цену решённой задачи с учётом числа попыток, reasoning-токенов, агентских циклов и времени разработчика.

⛓️ Подробнее в статье

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1🔥1
🔖 Статистику лучше учить через задачи, а не бесконечную теорию

An Introduction to Statistical Learning — одна из самых известных книг по базовой статистике и машинному обучению.

Подход простой: читаете главу, затем решаете задачи по теме и закрепляете материал на практике.

⛓ Ссылка на книгу

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1🔥1
📰 Как построить первую ML-модель с нуля

В статье пошагово разбирают базовый ML-пайплайн на задаче прогнозирования стоимости жилья: от анализа датасета и очистки признаков до обучения моделей и оценки качества.

Внутри — Pandas, Seaborn, корреляции, выбросы, train_test_split, линейная регрессия, дерево решений и метрики MAE, RMSE и R².

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
🔖 Дообучаем open-source модели прямо в Google Colab

С Unsloth можно дообучать 500+ открытых моделей прямо в бесплатном Google Colab.

Загружаете модель и датасет, запускаете обучение, а затем экспортируете результат. Плюс PDF и CSV можно превращать в синтетические датасеты для дальнейшего fine-tuning.

⛓ Ссылка на GitHub

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤2🔥2
📰 Что можно запустить в три строки через Transformers

В статье есть примеры по:
🫡 Анализу тональности;
🫡 Суммаризации;
🫡 Question Answering;
🫡 Embeddings;
🫡 Переводу;
🫡 NER;
🫡 Классификации и генерации текста;
🫡 Другим задачам NLP и компьютерного зрения.


Всего — 20 рабочих примеров, большая часть которых запускается даже без GPU.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
🔖 Открытый Jev почти догнал оригинал

Bespoke Labs выпустила Nimble — открытую модель на базе Qwen3.5-9B с опубликованными весами, данными и рецептом обучения.

Самое интересное — её не дистиллировали из Jev: его использовали только как ориентир для оценки. Nimble обучали на синтетических контрастных примерах, где один изменённый факт должен менять итоговое решение.

⛓ GitHub | Модель

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥2
📰 RAG под капотом: от retrieval до генерации

Автор проходит весь путь: как документы режутся на чанки, превращаются в embeddings, ищутся через retrieval, реранжируются и попадают в промпт LLM.

Дальше уже начинается мясо: semantic chunking, HyDE, contextual retrieval, hybrid search и автоматизация RAG.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
🔖 Запускаем LLM локально на Mac

MLX-LM позволяет запускать модели с Hugging Face одной командой, а затем дообучать их через LoRA или полноценный fine-tuning.

Есть поддержка квантованных моделей, длинного контекста, распределённых вычислений и кэша промптов.

⛓ Ссылка на GitHub

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥2
📰 Как дообучать LLM через Supervised Fine-Tuning

В статье разбирают SFT — один из ключевых этапов выравнивания LLM, где модель дообучают на качественных примерах «правильных» ответов.

Внутри — отличие SFT от pretraining и обычного fine-tuning, роль качества датасета, связь с RLHF и практический пример через Hugging Face TRL и SFTTrainer.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤2🔥2🤩1
🔖 Архитектура GPU для тех, кто работает с LLM-инференсом

В руководстве разбирают, как современные GPU реально исполняют код и почему без этого сложно осмысленно оптимизировать ядра.

Основной фокус — NVIDIA и CUDA: execution model, occupancy, shared memory, конфликты банков и другие вещи, которые напрямую влияют на производительность инференса.

⛓ Ссылка на руководство

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
📰 Как работает поиск в векторных базах

В статье показывают весь путь: текст → embedding → расстояние между векторами → поиск похожих документов.

А дальше начинается самое интересное — NSW и HNSW, которые позволяют не сравнивать запрос вообще со всей базой, а быстро находить ближайшие векторы через граф.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1🔥1