GPGPU Russia
513 subscribers
44 photos
2 videos
12 files
312 links
Канал по GPGPU
Download Telegram
Продолжаем рассказывать про конференцию C++ Russia
Помимо GPGPU, на ней также представлен геймдев, который, вероятно, тоже вам интересен.

Доклад от программиста Elverils (разработчиков порта на macOS Baldur's Gate III и других игр) Платона Иофинова:
Slang: конвертируем тысячи шейдеров для кроссплатформенного рендерера
Доклад про интересный шейдерный язык Slang, разработанный Nvidia для максимально возможной кроссплатформенности между GPU-платформами.

Доклад от Александра Кухаренко, графического программиста, поработавшего в различных игровых компаниях, включая Wargaming:
Visual Studio как фронтенд для графического движка
Интересная работа по нестандартному применению Microsoft Visual Studio.

Доклад от программистов «Леста игры»: Владислава Гордиенко, Филиппа Белозёрова:
Игровой сетевой КОД, или Как приготовить UDP
Они предложили несколько вариантов доклада, и у нас был очень непростой выбор. В итоге мы остановились на докладе про сетевой код, возможно, самую сложную часть сетевых игр. Это, конечно, не относится к графике, но всё равно интересно, как в сейчас делают синхронизацию игрового мира с минимально возможной задержкой.

Доклад от программиста BlackHubGames (разработчиков игры Black Russia — это такой GTA Online в России) Ильи Лебедева:
Защита игрового клиента на C++: контент, обфускация кода и базовые античит-подходы
Тоже не про графику, но лично мне интересно про механизмы защиты игр от читеров.

#симпозиум #gamedev #shaders
🔥114👍1😁1
Forwarded from Adept | Машинное обучение | Открытое ПО (Кирилл Колодяжный)
Привет!
Я на днях делал доклад "Актуальность и области применения языка С++ в современном ML" на конференции "Современные технологии в теории и практике программирования" в Санкт-Петербургском Политехническом Университете. К сожалению записи с мероприятия нет, но я делюсь видео с подготовки доклада. Надеюсь кому-то будет полезно.

https://rutube.ru/video/bc863eb9180b8cf67d118bb4b2ab1cb7/
👍10🔥5
Привет, друзья!

Новый выпуск готов! В гостях Николай Полярный - технический директор Agisoft: разрабатывает алгоритмы компьютерного зрения для Metashape - программы, которая строит 3D-модель объекта или даже целого города по фотографиям. Автор курса по фотограмметрии и курса по вычислениям на GPU. Преподаёт программирование в школе. Что такое фотограмметрия? Зачем нужны цифровые двойники деревьев? Используют ли до сих пор классические ML-алгоритмы в CV или всё захватили нейросети? Зачем алгоритмам машинного обучения нужен зазеркальный мир? Почему в научных статьях критически важен буквально каждый абзац и как это связано с проблемой воспроизводимости исследований? Как стать экспертом по профилированию? Как спидранят разработчики? Как не потеряться в бесконечном бэклоге? Как LLM-ки помогают готовить учебные материалы в Сириусе? Много ли бюрократии в современных школах? Какие есть сложности с проектными подходами в обучении? Обо всём этом в выпуске!

https://mlpodcast.mave.digital/ep-79
👍52
Замними апрельскими деньками посетил для перенятия опыта конференцию Heisenbug, которая всё больше начинает походить на тусовку ML-щиков чем тестировщиков (:

Там был воркшоп по построению RAG.

Вот на него небольшой отзыв:
Вообще говоря, я (и ещё несколько человек) предполагали, что раз это воркшоп, то мы будем его (RAG) делать руками. Получилось что-то вроде длинного интерактивного доклада с вопросами в любой момент по ходу рассказа.

Сам воркшоп не требовал спецзнаний, поэтому было много базовых (и про векторную базу данных тоже) вопросов, поэтому под конец на сложные вопросы времени не осталось.

Однако я ухватил докладчика и допрашивал весь обед.

Если не считать несовпадения ожиданий, то рассказ получился вполне годным, особенно для тех, кто никогда не занимался RAG.

Рассказали и показали на примере, как с нуля сделать RAG по современным отраслевым стандартам и best practices. Презентацию вполне можно использовать как чек-лист, не забыл ли чего перед выкатыванием в прод, и как справочник (но тут надо понимать, что месяцев через 6 он наверняка устареет хотя бы частично и будет продолжать стремительное устаревание)

К сожалению, запись не делали (я так понял, что они планировали написание кода, но передумали), поэтому не получится пересмотреть, но презентация осталась.

Если вы, как я, сделали уже свой первый RAG, но не являетесь в этом профи, то и презентации будет достаточно.
🔥4
С Праздником Великой Победы! 🎆
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉18🤡6👍2
Продолжаем готовиться к конференции C++ Russia 2026.

У нас запланированы воркшопы и мастер-классы, и мы сейчас приглашаем желающих на тестовые прогоны двух из них.
Тестовые прогоны пройдут 12 мая в 19:00.

1. Ускоряем LLM с помощью своего расширения для PyTorch.

📃 Форма для записи.

Важно. Prerequisites:
* Во время тестового прогона мы не предоставляем доступ к железу. От участников требуется иметь доступ к машине, у которой есть видеокарта Nvidia, совместимая с CUDA 13 и установлен Docker.
* Требования к участникам: умение писать код на C++, собирать его с CMake и умение понимать Python. Умение программировать видеокарты НЕ требуется.


2. Кросс-разработка в режиме live Linux-драйвера символьного дисплея LCD1602.


📃 Форма для записи.

На этот мастер-класс каких-то особых требований к участникам нет.
👍4
Good news, everyone!

Инженеры компании YADRO сегодня развернули среду для воркшопа про ускорение LLM, и теперь можно на тестовый прогон записаться и без доступа к железу, а подключиться к их серверу.

Так что если кто хотел записаться, но не имел железа, теперь можно. Кроме того, это шанс бесплатно потрогать серверную GPU Nvidia H100.

Кстати, мы завели чаты в телеге:
🥹: тут.
🪵: тут.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥41
Alibaba выпустила пост про новую модель Qwen 3.7-Max: https://qwen.ai/blog?id=qwen3.7

Интересно посмотреть на раздел "Self-Evolving in the Wild". В нём они хвастаются, что с помощью этой модели ускорили референсную реализацию multi-head attention в SGLang в десять раз. Там же перечислены основные оптимизации, до которых додумалась нейронка.
🤯3👍2
В CUDA 13.3 Добавили нативную поддержку питона. Надеюсь, теперь, наконец, не будет отваливаться Nsight как это обычно бывает с pycuda 🎮

CUDA 13.3 получился очень насыщенным:
* Поддержка Python;
* Релиз CUDA Tile C++;
* CompileIQ — фреймворк автотюна кернелов, обещают, что ускорили некоторые аж на 15%;
* Полная поддержка С++ 23.

https://developer.nvidia.com/blog/nvidia-cuda-13-3-enhances-gpu-development-with-tile-programming-in-c-compiler-autotuning-and-python-updates/

#CUDA #GPGPU #Python
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12
Пост о том, что такое CUDA Tile, который зарелизили в CUDA 13.3:
https://developer.nvidia.com/blog/develop-high-performance-gpu-kernels-in-cpp-with-nvidia-cuda-tile/

Если кратко, то они ввели новый вид кернелов: __tile_global__, в которых вообще не указываешь работу для отдельных потоков, а пишешь кода для обработки на уровне тайлов, а компилятор уже сам определяет, как там потоки работают между собой.
Для этого есть пространство имён cuda::tiles.
В нём живут:
tensor_span (аналог std::mdspan), его растаскивают на весь буфер при помощи extents{m, n},
и обёртка partition_view, которая нарезает буфер на те самые тайлы при помощи функции load().

Получается, примерно, такой кернел для сложения массивов:
#include "cuda_tile.h"
__tile_global__ void vectorAdd(float* a, float* b, float* out, size_t n) {
 
/* set up the namespace */
  namespace ct = cuda::tiles;
  using namespace ct::literals;
 
/* attach shape to raw pointers */
  auto aSpan = ct::tensor_span{a,   ct::extents{n}};
  auto bSpan = ct::tensor_span{b,   ct::extents{n}};
  auto oSpan = ct::tensor_span{out, ct::extents{n}};
 
/* partition each span into tiles of size 8 */
  auto aView = ct::partition_view{aSpan, ct::shape{8_ic}};
  auto bView = ct::partition_view{bSpan, ct::shape{8_ic}};
  auto oView = ct::partition_view{oSpan, ct::shape{8_ic}};
 
/* load the a and b tiles from global memory */
  int bx = ct::bid().x;
  auto aTile = aView.load(bx);          // load bx-th tile
  auto bTile = bView.load(bx);
 
/* add the two tiles together, elementwise */
  auto oTile = aTile + bTile;
 
/* store the result tile to the output partition. */
  oView.store(oTile, bx);
}


Конкретно для такой задачи он намного сложнее обычного кода, но в нём не надо думать о переполнении памяти, гонках и так далее.

#CUDA #GPU #GPGPU
👍8🔥2
Меня внезапно зазвали на AI Dev Meetup поговорить про локальных ИИ-агентов и потыкать их на практике. Поговорим, кому и зачем это может быть нужно, посмотрим бесплатные альтернативы и попробуем их на живой задаче из нашего декомпилятора.

Пойду куплю себе микрофон по такому случаю.

PS: Интересно, что телега не хочет показывать preview ссылки с таймпада, а мах показывает.

PPS: Если вы уже опытный, так сказать, вайб-кодер, то вряд ли услышите что-то новое для себя. Встреча ориентирована на новичков.
🔥7👏1
В комментах к этому посту можно задавать вопросы после митапа.
🔥2
presentation-self-hosted-agents.pdf
330 KB
Запись и презентация моего выступления с AI Dev Meetup:
Youtube

VK
5👍3
Nvidia опубликовала подробную документацию к своему центральному процессору для ИИ-датацентров.
88 ядер (их назвали NVIDIA Custom Olympus) на базе архитектуры ARM v 9.2
Пропускная способность памяти до 1.2 ТБ/с, это больше, чем на любой потребительской видеокарты, кроме 5090.
Потребление до 450 Вт, как на 4090.
Само собой, наличие NVLink, через который идёт связь с GPU.
https://nvdam.widen.net/s/nmw5vblpqd/nvidia_vera_cpu_architecture_whitepaper
🔥5
Сегодня, в день знаний, по традиции, публикуем обучающие материалы — введение в технологию.

Для изучения основ графики предлагаем серию статей A trip through the Graphics Pipeline 2011
Несмотря на то, что прошло уже много лет, основные фундаментальные принципы почти не изменились: базовая модель конвейера, базовая архитектура работы памяти GPU, базовые принципы работы с текстурами и введение в оптимизацию. Это можно читать смело.

А для изучения современных технологий рекомендуем регулярно обновляемый портал Vulkan Tutorial, Vulkan Guide и How to Vulkan 2026, которые любезно предложили в комментариях.
8
Очередной сезон курса по вычислениям на видеокартах от Николая Полярного. Бесплатно, без регистрации и смс (нет, если хотите не в записи, а очно, то с регистрацией).
Для тех, кто в этом году решил научиться эффективно программировать видеокарты, я думаю, это лучшее, что есть.

Занятия будут проходить по вторникам с 18:00 в Мраморном зале, ПОМИ РАН, наб. реки Фонтанки, 27, Санкт-Петербург. Для тех, кто не в Питере, должны быть записи, по идее.
9🔥6👍1