Data Scientist | ML & AI
3.05K subscribers
621 photos
211 videos
23 files
701 links
Один из ведущих каналов по Data Science, Machine Learning и Big Data

Сотрудничество: @bape_ads
Прайс: @bape_media
Download Telegram
🔖 Статистику лучше учить через задачи, а не бесконечную теорию

An Introduction to Statistical Learning — одна из самых известных книг по базовой статистике и машинному обучению.

Подход простой: читаете главу, затем решаете задачи по теме и закрепляете материал на практике.

⛓ Ссылка на книгу

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1🔥1
📰 Как построить первую ML-модель с нуля

В статье пошагово разбирают базовый ML-пайплайн на задаче прогнозирования стоимости жилья: от анализа датасета и очистки признаков до обучения моделей и оценки качества.

Внутри — Pandas, Seaborn, корреляции, выбросы, train_test_split, линейная регрессия, дерево решений и метрики MAE, RMSE и R².

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
🔖 Дообучаем open-source модели прямо в Google Colab

С Unsloth можно дообучать 500+ открытых моделей прямо в бесплатном Google Colab.

Загружаете модель и датасет, запускаете обучение, а затем экспортируете результат. Плюс PDF и CSV можно превращать в синтетические датасеты для дальнейшего fine-tuning.

⛓ Ссылка на GitHub

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤2🔥2
📰 Что можно запустить в три строки через Transformers

В статье есть примеры по:
🫡 Анализу тональности;
🫡 Суммаризации;
🫡 Question Answering;
🫡 Embeddings;
🫡 Переводу;
🫡 NER;
🫡 Классификации и генерации текста;
🫡 Другим задачам NLP и компьютерного зрения.


Всего — 20 рабочих примеров, большая часть которых запускается даже без GPU.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
🔖 Открытый Jev почти догнал оригинал

Bespoke Labs выпустила Nimble — открытую модель на базе Qwen3.5-9B с опубликованными весами, данными и рецептом обучения.

Самое интересное — её не дистиллировали из Jev: его использовали только как ориентир для оценки. Nimble обучали на синтетических контрастных примерах, где один изменённый факт должен менять итоговое решение.

⛓ GitHub | Модель

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥2
📰 RAG под капотом: от retrieval до генерации

Автор проходит весь путь: как документы режутся на чанки, превращаются в embeddings, ищутся через retrieval, реранжируются и попадают в промпт LLM.

Дальше уже начинается мясо: semantic chunking, HyDE, contextual retrieval, hybrid search и автоматизация RAG.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
🔖 Запускаем LLM локально на Mac

MLX-LM позволяет запускать модели с Hugging Face одной командой, а затем дообучать их через LoRA или полноценный fine-tuning.

Есть поддержка квантованных моделей, длинного контекста, распределённых вычислений и кэша промптов.

⛓ Ссылка на GitHub

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥2
📰 Как дообучать LLM через Supervised Fine-Tuning

В статье разбирают SFT — один из ключевых этапов выравнивания LLM, где модель дообучают на качественных примерах «правильных» ответов.

Внутри — отличие SFT от pretraining и обычного fine-tuning, роль качества датасета, связь с RLHF и практический пример через Hugging Face TRL и SFTTrainer.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤2🔥2🤩1
🔖 Архитектура GPU для тех, кто работает с LLM-инференсом

В руководстве разбирают, как современные GPU реально исполняют код и почему без этого сложно осмысленно оптимизировать ядра.

Основной фокус — NVIDIA и CUDA: execution model, occupancy, shared memory, конфликты банков и другие вещи, которые напрямую влияют на производительность инференса.

⛓ Ссылка на руководство

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
📰 Как работает поиск в векторных базах

В статье показывают весь путь: текст → embedding → расстояние между векторами → поиск похожих документов.

А дальше начинается самое интересное — NSW и HNSW, которые позволяют не сравнивать запрос вообще со всей базой, а быстро находить ближайшие векторы через граф.

⛓️ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
Выспался, собрал чат-бота в течения дня → заработал 29 000₽

Это не развод, а обычный день работы, тех. спеца:

Взял схему от заказчика → собрал бота по шаблону → отдал клиенту → получил деньги👌

Работы — 2–4 часа.
Оплата — 20–50 000₽ за проект.

✅ Не надо рано вставать и ехать на "любимую работу"

✅ Никакого долгого обучения или знаний программирования

✅ Если умеешь пользоваться браузером, то легко справишься

И спрос на это сейчас огромный, заказов куча.

Бизнесу нужны ИИ, чат-боты и автоматизация уже сегодня.

Это одна из самых быстрорастущих ниш 2026 года, просто заходи и бери заказы.

Инструкции здесь, открой пока доступна:

👉 https://t.me/Alekseicoach_bot?start=testdrivetg209

Если ты хочешь реально хорошо зарабатывать, от 150к в месяц без начальников, нужно решать важные задачи бизнесов.

Сейчас это задачи по сборке ботов на конструкторах (да, у тебя по-любому получится).

Пробуй 👇

https://t.me/Alekseicoach_bot?start=testdrivetg209
🔖 База по CUDA от NVIDIA

В CUDA Refresher объясняют, как GPU распределяет вычисления и как устроена CUDA-модель: ядра, сетки, блоки и потоки.

Плюс есть разбор библиотек и готовых инструментов.

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2