Привет!
Последние две недели занимаюсь расширением тензорного API и развитием функциональности, необходимой для обучения YOLOv11.
Часть времени на прошлой неделе ушла на подготовку к конференции, поэтому темп оказался ниже, чем планировал. Но, несмотря на это, работа над задачами для YOLOv11 продолжается.
Что сделано:
🔹 Тензорные операции
Добавил
🔹 Скаляры и типы
Перешёл от явных типов в аргументах к более гибкому
🔹 Boolean и unsigned integer
Отдельная история — поддержка boolean. Сначала она выглядела как небольшая задача, но на практике потребовала заметно больше времени. Нужно было аккуратно продумать хранение bool в тензорах, взаимодействие со скалярами, приведение типов, проверки на уровне backend и корректный проброс в Python.
Плюс добавил поддержку unsigned integer. В результате эти изменения затронули не одну точку в коде, а потребовали согласованной работы нескольких слоёв.
🔹 Контроль памяти
Добавил проверки на contiguous-тензоры в backend-операциях. Это помогает раньше ловить ошибки, связанные с layout и памятью, и делает поведение операций более явным.
🔹 Python bindings
Продолжаю приводить в порядок Python-слой. Добавил биндинги для новых операций, и сделал skill создания Python-биндингов для LLM агентов.
🔹 GPU backend
Подготовил skills для разработки GPU-шейдеров и регистрации dispatcher. Это больше инфраструктурная работа, поэтому неплохо автоматизируется агентами.
🔹 YOLOv11
Продолжаю двигаться к обучению YOLOv11: обновил план реализации, добавил прототип loss-функции и подготовил inference pipeline с учётом нового tensor API.
Итог: Базовый tensor API становится более зрелым, появляются элементы, необходимые для обучения моделей, и YOLOv11 уже выглядит как вполне достижимая цель 🚀
#tensor #cpp #python #machinelearning #deeplearning #yolo #yolov11 #gpu #autograd #computervision
Последние две недели занимаюсь расширением тензорного API и развитием функциональности, необходимой для обучения YOLOv11.
Часть времени на прошлой неделе ушла на подготовку к конференции, поэтому темп оказался ниже, чем планировал. Но, несмотря на это, работа над задачами для YOLOv11 продолжается.
Что сделано:
🔹 Тензорные операции
Добавил
arange для генерации последовательностей, утилиты создания тензоров и element-wise min/max. Реализовал clamp с forward/backward и Python-биндингами. Для sum() и mean() добавил keepdim, чтобы поведение было ближе к привычным ML-фреймворкам.🔹 Скаляры и типы
Перешёл от явных типов в аргументах к более гибкому
std::variant для поддержки всего набора используемых типов. Сделал типизированную поддержку скаляров в Tensor::full() и Tensor::item(), включая динамический вывод формы. Это уменьшило количество неявных преобразований и сделало API более предсказуемым.🔹 Boolean и unsigned integer
Отдельная история — поддержка boolean. Сначала она выглядела как небольшая задача, но на практике потребовала заметно больше времени. Нужно было аккуратно продумать хранение bool в тензорах, взаимодействие со скалярами, приведение типов, проверки на уровне backend и корректный проброс в Python.
Плюс добавил поддержку unsigned integer. В результате эти изменения затронули не одну точку в коде, а потребовали согласованной работы нескольких слоёв.
🔹 Контроль памяти
Добавил проверки на contiguous-тензоры в backend-операциях. Это помогает раньше ловить ошибки, связанные с layout и памятью, и делает поведение операций более явным.
🔹 Python bindings
Продолжаю приводить в порядок Python-слой. Добавил биндинги для новых операций, и сделал skill создания Python-биндингов для LLM агентов.
🔹 GPU backend
Подготовил skills для разработки GPU-шейдеров и регистрации dispatcher. Это больше инфраструктурная работа, поэтому неплохо автоматизируется агентами.
🔹 YOLOv11
Продолжаю двигаться к обучению YOLOv11: обновил план реализации, добавил прототип loss-функции и подготовил inference pipeline с учётом нового tensor API.
Итог: Базовый tensor API становится более зрелым, появляются элементы, необходимые для обучения моделей, и YOLOv11 уже выглядит как вполне достижимая цель 🚀
#tensor #cpp #python #machinelearning #deeplearning #yolo #yolov11 #gpu #autograd #computervision
🔥3
Привет!
Я уже несколько недель работаю над тем, чтобы фреймворк Adept мог обучать YOLOv11 полностью на GPU и без NumPy. Я наконец-то довёл Adept до состояния, в котором он может полностью тренировать YOLOv11 на GPU без NumPy. Делюсь тем, что пришлось починить и дописать.
🛠 Ядро и Автоград
• In-place broadcast:
• Редукция градиентов: при broadcast для
• Matmul backward: поддержка 1D тензоров (вектор-матрица и т.д.).
• Vulkan Convs: переписал накопление bias-градиента (считается один раз, без лишних аллокаций).
🧩 API для YOLO-loss (прощай, CPU)
Чтобы IoU и assigner работали на GPU, реализовал:
• Индексация:
• Форма:
• Математика:
• Скаляры: перегрузки операторов типа
• Создание:
📉 Loss, Оптимизатор и Модули
• Добавлены BCE (для DFL) и CE без усреднения (per-position loss).
• Фикс Python-операторов:
• SGD с momentum и weight decay.
• BatchNorm: инициализация дисперсии = 1 (убрал деление на ноль).
• Чекпоинты: префиксы имён корректно пробрасываются во вложенные модули.
⚙️ Пайплайн тренировки
• Loss, IoU и assigner переведены на нативный
• Warmup + Cosine LR, логирование box/cls/dfl loss.
• Упаковка нескольких GT через
• Инференс: новый CLI (`--image`,
📊 Результаты и Перф
Тренировал на синтетике (геометрические фигуры). Eval total loss стабильно упал с 13.2 (эпоха 1) до 6.5 (эпоха 24). Градиенты сходятся, детектор учится.
⚡ Оптимизировал Vulkan memory pool: выравнивание 4096, кэш 10000 буферов - заметно меньше аллокаций в train-loop.
🎯 Планы
Стек от ядра до высокоуровневого API готов. Следующий шаг - полноценное обучение на MS COCO, сбор метрик AP и дальнейший тюнинг скорости. Теперь есть инструмент для настоящих экспериментов!
#Adept #YOLO #DeepLearning #Vulkan #MachineLearning #MSCOCO
Я уже несколько недель работаю над тем, чтобы фреймворк Adept мог обучать YOLOv11 полностью на GPU и без NumPy. Я наконец-то довёл Adept до состояния, в котором он может полностью тренировать YOLOv11 на GPU без NumPy. Делюсь тем, что пришлось починить и дописать.
🛠 Ядро и Автоград
• In-place broadcast:
a -= b больше не падает, левый операнд корректно ресайзится.• Редукция градиентов: при broadcast для
+ - * / градиенты теперь сворачиваются к форме операндов.• Matmul backward: поддержка 1D тензоров (вектор-матрица и т.д.).
• Vulkan Convs: переписал накопление bias-градиента (считается один раз, без лишних аллокаций).
🧩 API для YOLO-loss (прощай, CPU)
Чтобы IoU и assigner работали на GPU, реализовал:
• Индексация:
gather, scatter/add, masked_select/fill, where, topk, unique.• Форма:
expand, permute, flatten, cat, stack, reshape.• Математика:
clamp, pow, arctan, min/max, argmax.• Скаляры: перегрузки операторов типа
2 * tensor• Создание:
arange, detach.📉 Loss, Оптимизатор и Модули
• Добавлены BCE (для DFL) и CE без усреднения (per-position loss).
• Фикс Python-операторов:
a + b теперь возвращает новый тензор, а не мутирует a (сохраняет граф!).• SGD с momentum и weight decay.
• BatchNorm: инициализация дисперсии = 1 (убрал деление на ноль).
• Чекпоинты: префиксы имён корректно пробрасываются во вложенные модули.
⚙️ Пайплайн тренировки
• Loss, IoU и assigner переведены на нативный
clamp`/`min`/`max. Сетки координат - через adept.arange.• Warmup + Cosine LR, логирование box/cls/dfl loss.
• Упаковка нескольких GT через
scatter_add (меньше синков).• Инференс: новый CLI (`--image`,
--weights и т.д.). Починил letterbox — confidence вернулась с 0.08 до 0.61.📊 Результаты и Перф
Тренировал на синтетике (геометрические фигуры). Eval total loss стабильно упал с 13.2 (эпоха 1) до 6.5 (эпоха 24). Градиенты сходятся, детектор учится.
⚡ Оптимизировал Vulkan memory pool: выравнивание 4096, кэш 10000 буферов - заметно меньше аллокаций в train-loop.
🎯 Планы
Стек от ядра до высокоуровневого API готов. Следующий шаг - полноценное обучение на MS COCO, сбор метрик AP и дальнейший тюнинг скорости. Теперь есть инструмент для настоящих экспериментов!
#Adept #YOLO #DeepLearning #Vulkan #MachineLearning #MSCOCO
👍5
Результат 12ти часов тренировки на локальном ноутбуке с RTX 4070 8GB на датасете MS COCO с 80 классами.
Кажется что тренировка может сойтись к чему-то полезному, пусть продолжается.
Я пока исследую облачные сервисы с более мощным оборудованием чтобы быстрее тренировать и проверить распределённое обучение на нескольких GPU.
Кажется что тренировка может сойтись к чему-то полезному, пусть продолжается.
Я пока исследую облачные сервисы с более мощным оборудованием чтобы быстрее тренировать и проверить распределённое обучение на нескольких GPU.
❤1
Привет!
После первых запусков конвейера тренировки YOLO11 я сосредоточился на устранении узких мест в производительности, стабилизации процесса обучения и реализации модели и инференса на С++ API.
⚡️ Производительность: два существенных улучшения
1. Прямые групповые свертки (Vulkan)
Ранее групповые свертки — основа depthwise-separable блоков backbone'а YOLO — выполнялись на GPU циклом по парам
Я реализовал single-dispatch прямую свертку для
2. Оптимизация функции потерь
Здесь было два критических узких места:
• Distributed-focus loss: ранее считался через
• Синхронизации с хостом: тензоры anchor points, stride и input-size теперь кэшируются между шагами. Гистограмму label-assignment переписал с
🔧 Vulkan backend и фреймворк
• Выделил отдельный fence pool для host-read copies, чтобы трансфер данных не блокировал основной поток сабмишена.
• Устранил edge-cases в strided reductions для случаев, когда размер не кратен размеру рабочей группы.
• Добавил поддержку broadcasting для операторов
• Убрал проверки границ индексов в scatter из fast path, снизив поэлементный оверхед.
• Добавил
• Сделал wheel-пакет relocatable (через
🧠 Обучение и инференс
• Чекпоинты: полностью переписал сериализацию — теперь это словарь именованных тензоров. Можно сохранить и восстановить полное состояние (модель, оптимизатор, эпоху, шаг) и возобновить обучение.
• C++ инференс: реализован standalone инструмент (
🎯 Планы
Валидировать end-to-end скорость обучения на GPU, протестировать поток восстановления из чекпоинтов. Тестирование распределенного обучения пока отложил, надо довести до ума реализацию в целом.
#YOLO11 #Adept #DeepLearning #ComputerVision #Vulkan #CPlusPlus #Performance
После первых запусков конвейера тренировки YOLO11 я сосредоточился на устранении узких мест в производительности, стабилизации процесса обучения и реализации модели и инференса на С++ API.
⚡️ Производительность: два существенных улучшения
1. Прямые групповые свертки (Vulkan)
Ранее групповые свертки — основа depthwise-separable блоков backbone'а YOLO — выполнялись на GPU циклом по парам
(batch, group). Для каждой пары отдельно диспатчились im2col и GEMM. На малых тензорах оверхед от запусков ядер доминировал в общем времени вычислений.Я реализовал single-dispatch прямую свертку для
groups > 1. Добавлены три новых compute shader'а (forward, input-grad, weight-grad), которые аккумулируют свертку напрямую, без использования im2col. Это существенно сократило количество запусков ядер и ускорило работу backbone'а.2. Оптимизация функции потерь
Здесь было два критических узких места:
• Distributed-focus loss: ранее считался через
dot, который диспатчил batched GEMM и выполнял итерации по хосту для каждого среза (batch, anchor, 4). Заменил на broadcast-multiply и редукцию по оси дистрибуции - получилось ускорение в несколько раз. В Adpet пока есть проблемы с эффективным пакетным GEMM.• Синхронизации с хостом: тензоры anchor points, stride и input-size теперь кэшируются между шагами. Гистограмму label-assignment переписал с
unique() + scatter_add_ (требовала синхронизации) на прямой per-batch scatter_add_. Сумму target-score теперь считает GPU max вместо чтения .cpu().item(). Вычисление loss теперь ставится в очередь асинхронно и не блокирует пайплайн.🔧 Vulkan backend и фреймворк
• Выделил отдельный fence pool для host-read copies, чтобы трансфер данных не блокировал основной поток сабмишена.
• Устранил edge-cases в strided reductions для случаев, когда размер не кратен размеру рабочей группы.
• Добавил поддержку broadcasting для операторов
eq/ne.• Убрал проверки границ индексов в scatter из fast path, снизив поэлементный оверхед.
• Добавил
Sequential и ModuleList для компоновки C++ моделей.• Сделал wheel-пакет relocatable (через
$ORIGIN), чтобы он корректно работал из любой директории установки.🧠 Обучение и инференс
• Чекпоинты: полностью переписал сериализацию — теперь это словарь именованных тензоров. Можно сохранить и восстановить полное состояние (модель, оптимизатор, эпоху, шаг) и возобновить обучение.
• C++ инференс: реализован standalone инструмент (
apps/cpp/yolo11) с JPEG decode/encode через libjpeg, letterbox, NMS и визуализацией результатов. В Python-инференсе также скорректировал масштабирование bounding box'ов обратно к исходным координатам изображения.🎯 Планы
Валидировать end-to-end скорость обучения на GPU, протестировать поток восстановления из чекпоинтов. Тестирование распределенного обучения пока отложил, надо довести до ума реализацию в целом.
#YOLO11 #Adept #DeepLearning #ComputerVision #Vulkan #CPlusPlus #Performance
👍2🔥1
Привет!
Последнюю неделю я продолжаю занимался реализацией обучениея модели YOLOv11. Основная проблема - обучение упорно не сходилось, после нескольких эпох лосс начинал катастрофически разваливаться.
Потратил немало времени на поиски причины, пока не вскрылись две большие проблемы: критический баг в ядре фреймворка и классическая боль с датасетом.
🚨 Главный фикс: баг с накоплением градиентов
Это и было основной причиной расхождения. Оказалось, что backward passes для
Решение: Заменил прямую запись на
📊 Борьба с несбалансированным MS COCO и YOLOv11 туллинг
Вторая головная боль — сам датасет MS COCO. В нём сильный перекос в сторону класса 0 (person). Чтобы нивелировать этот дисбаланс и упростить жизнь при обучении, я добавил в туллинг YOLOv11:
• Class-weighted loss: взвешивание по классам для классификационного BCE.
• Balanced subset builder: утилита для создания сбалансированных сабсетов COCO.
• CSV logging: логирование лосса по батчам с поддержкой resume/append.
• Loss-curve viewer: интерактивный вьювер для отрисовки этих CSV-логов - это позволило лучше наблюдать за динамикой обучения.
🛠 Другие важные фиксы в ядре Adept:
Vulkan push-constant packing. Буфер shader-constants паковался без std430 alignment padding. Из-за этого 64-битные скаляры могли попадать на невалидные оффсеты. Выровнял по спецификации.
Misc: В Python-биндингах тензоров теперь корректно экспортируются
🔮 Что дальше: оптимизация памяти
Следующая большая задача — потребление памяти. Сейчас Adept расходует почти в 4 раза больше памяти GPU по сравнению с зеркальной реализацией на PyTorch. Причина кроется в неоптимальной политике memory pool. При обучении YOLO генерируется огромное количество тензоров переменной длины — из-за разного количества anchors на каждом изображении. Простой пул аллокаторов приходится сильно раздувать, чтобы сократить число аллокаций, и это убивает эффективность по памяти. Нужно переработывать стратегию пула — это в планах на ближайшее время.
💡 Вывод
Решение реальной комплексной задачи вроде обучения YOLOv11 вскрыло массу проблем, которые просто невозможно было обнаружить на отдельных юнит-тестах и простых моделях. Баг с перезаписью градиентов, проблемы с non-contiguous тензорами, перерасход памяти — всё это всплыло только когда пайплайн был собран целиком и поставлен под нагрузку. Хорошее напоминание о том, что integration testing и реальные нагрузки - незаменимы.
#Adept #YOLOv11 #DeepLearning #ComputerVision #MachineLearning #Vulkan #C++ #Python #MLOps #ModelTraining
Последнюю неделю я продолжаю занимался реализацией обучениея модели YOLOv11. Основная проблема - обучение упорно не сходилось, после нескольких эпох лосс начинал катастрофически разваливаться.
Потратил немало времени на поиски причины, пока не вскрылись две большие проблемы: критический баг в ядре фреймворка и классическая боль с датасетом.
🚨 Главный фикс: баг с накоплением градиентов
Это и было основной причиной расхождения. Оказалось, что backward passes для
conv2d, conv_transpose2d и batchnorm2d писали напрямую в input.grad(). В результате градиенты просто перезаписывались, вместо того чтобы суммироваться с разных путей(ребер вычислительного графа) для одного входного тензора.Решение: Заменил прямую запись на
add_grad. Теперь вклад от всех операций корректно суммируется. Обучение наконец-то поехало!📊 Борьба с несбалансированным MS COCO и YOLOv11 туллинг
Вторая головная боль — сам датасет MS COCO. В нём сильный перекос в сторону класса 0 (person). Чтобы нивелировать этот дисбаланс и упростить жизнь при обучении, я добавил в туллинг YOLOv11:
• Class-weighted loss: взвешивание по классам для классификационного BCE.
• Balanced subset builder: утилита для создания сбалансированных сабсетов COCO.
• CSV logging: логирование лосса по батчам с поддержкой resume/append.
• Loss-curve viewer: интерактивный вьювер для отрисовки этих CSV-логов - это позволило лучше наблюдать за динамикой обучения.
🛠 Другие важные фиксы в ядре Adept:
Vulkan push-constant packing. Буфер shader-constants паковался без std430 alignment padding. Из-за этого 64-битные скаляры могли попадать на невалидные оффсеты. Выровнял по спецификации.
Misc: В Python-биндингах тензоров теперь корректно экспортируются
bool значения в protocols buffer интерфейсе. 🔮 Что дальше: оптимизация памяти
Следующая большая задача — потребление памяти. Сейчас Adept расходует почти в 4 раза больше памяти GPU по сравнению с зеркальной реализацией на PyTorch. Причина кроется в неоптимальной политике memory pool. При обучении YOLO генерируется огромное количество тензоров переменной длины — из-за разного количества anchors на каждом изображении. Простой пул аллокаторов приходится сильно раздувать, чтобы сократить число аллокаций, и это убивает эффективность по памяти. Нужно переработывать стратегию пула — это в планах на ближайшее время.
💡 Вывод
Решение реальной комплексной задачи вроде обучения YOLOv11 вскрыло массу проблем, которые просто невозможно было обнаружить на отдельных юнит-тестах и простых моделях. Баг с перезаписью градиентов, проблемы с non-contiguous тензорами, перерасход памяти — всё это всплыло только когда пайплайн был собран целиком и поставлен под нагрузку. Хорошее напоминание о том, что integration testing и реальные нагрузки - незаменимы.
#Adept #YOLOv11 #DeepLearning #ComputerVision #MachineLearning #Vulkan #C++ #Python #MLOps #ModelTraining
Изменил подход к управлению памятью, что снизило потребление в 2 раза. А это в свою очередь позволило тренировать на большем разрешении и увеличить размер пакета. На изображениях результат 24 часов тренировки. Утечек памяти не было.