Data Portal | DS & ML
10.5K subscribers
695 photos
160 videos
9 files
890 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM

№ 8204670314
Download Telegram
«Intermediate Microeconomics» — это бесплатный учебник, который содержит математическое изложение основных моделей, используемых в микроэкономике.

Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.

Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.

Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.

https://open.oregonstate.education/intermediatemicroeconomics/
Соберите DeepSeek с нуля. 🙂

Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.

Внутри:

- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое

Нужны только ноутбук и регулярность.

https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель Ember-1 сейчас активно обсуждают на Hacker News.

Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче. 😳

Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.

И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.

https://fireworks.ai/blog/ember-1

Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Please open Telegram to view this post
VIEW IN TELEGRAM
NVIDIA Model Optimizer — единая библиотека с современными методами оптимизации моделей: квантизацией, дистилляцией, прунингом, поиском архитектуры нейросетей, спекулятивным декодированием и другими техниками.

Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.

https://github.com/NVIDIA/Model-Optimizer
«Game Theory with Engineering Applications» — это бесплатный сборник конспектов лекций MIT, который даёт математическое введение в теорию игр и дизайн механизмов, с особым акцентом на применение в инженерии, информатике и сетевых системах.

Материал разбит на 21 лекцию. В них рассматриваются игры в стратегической форме и концепции решений, равновесия Нэша, их существование и вычисление, непрерывные и разрывные игры, супермодулярные и потенциальные игры, эволюция и обучение в играх, игры в развернутой форме, решение Нэша для переговоров, повторяющиеся игры, байесовские равновесия Нэша и игры с неполной информацией, дизайн механизмов, а также теория общественного выбора и голосования.

Я просмотрел несколько конспектов лекций и нашёл их понятными и очень хорошо структурированными. Они достаточно компактные, но при этом дают достаточно объяснений, чтобы материал оставался доступным даже для тех, кто впервые знакомится с теорией игр.

https://ocw.mit.edu/courses/6-254-game-theory-with-engineering-applications-spring-2010/resources/mit6_254s10_lec05/
У каждого зрелого системного проекта рано или поздно должна появиться учебная версия.

TinyTorch — бесплатный курс с открытым исходным кодом. В нём вы с нуля создаёте работающий фреймворк для машинного обучения на чистом Python, используя тот же интерфейс программирования, что и в PyTorch. Путь начинается с тензоров и заканчивается трансформерами.

Видеокарта не нужна: курс работает на ноутбуке с 4 ГБ оперативной памяти. В нём 20 практических модулей, которые помогают разработчикам, студентам и инженерам разобраться во внутреннем устройстве PyTorch.

https://github.com/keith2018/TinyTorch
This media is not supported in your browser
VIEW IN TELEGRAM
Уже видели интерактивное объяснение Transformer?

Очень крутая визуализация того, как работает архитектура.

https://poloclub.github.io/transformer-explainer/
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей.

Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы.

Код опубликован под MIT, доступны и веса для тестирования.

https://github.com/Friedrich-M/UniMate
«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ до продвинутых разделов.

В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла.

В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме.

Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала.

https://louis.pressbooks.pub/trigonometry/
Нельзя просто выбрать модель и видеокарту и считать, что на этом всё.

Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU.

Начнём с самого цикла.

Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется.

Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену.

У этого цикла есть две фазы, и это разные задачи.

Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом.

Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания».

Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память.

Движок инференса — это не сама модель.

Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API.

Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком.

Серьёзные движки ещё и выбирают ядра.

Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу.

На бумаге математика может быть одинаковой. Ядро — разное.

Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать.

Квантование — это не один переключатель.

Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует.

Правильный формат — тот, под который в вашем движке есть оптимизированные ядра.

Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность.

Вот конкретный пример.

Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4.

Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные.

Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах.

Это другой путь выполнения ядер.

RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными.

Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается.

Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо.

Это не одно и то же.

Поэтому prefill и decode тоже не получают одинаковый выигрыш.

Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост.

Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место.

Не тестируйте просто «модель».

Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode.
Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh

Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes.

Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh

А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh

И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh
DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей.

Она называется DeepGEMM.

Библиотека оптимизирует матричные операции, на которых работают большие языковые модели, и позволяет эффективнее использовать NVIDIA Hopper и Blackwell.

Поддерживаются FP8, FP4 и BF16. Есть оптимизации для моделей с архитектурой Mixture-of-Experts, совмещение обмена данными между GPU с вычислениями и компиляция ядер прямо во время выполнения, без отдельной сборки CUDA при установке.

По данным DeepSeek, DeepGEMM на ряде размеров матриц показывает производительность на уровне или выше специализированных библиотек, вручную оптимизированных экспертами.

https://github.com/deepseek-ai/DeepGEMM#interfaces
Гайд по RL от Unsloth.

В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле DeepSeek-R1 с помощью Unsloth и GRPO.

Полный материал — от базового уровня до продвинутого.

Ссылка: https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide
Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям.

В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN.

https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf