Pixel Science
478 subscribers
136 photos
53 videos
2 files
106 links
пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Download Telegram
N-BVH: Neural ray queries with bounding volume hierarchies-Код-Сравнения

Наши соседи из Саарбрюкена сделали прикольный ресёрч по нейронному сжатию геометрии. По сути, они предлагают реймаршить shallow MLPs c multi-layer grid encodings (InstantNGP), как NERF-ы, на выходе давая visibility и в придачу intersection point + albedo + normal, в случаи если visibility != 1.0

Но т.к. реймаршинг - это дорого, Филипп с Александром обучают BVH поверх множества нейронных node-ов, чтобы скипать пустое пространство.

Таким образом они соединили классическую acceleration data structure, которую современные GPU умеют быстро травёрсить, с новомодными нейронками. которые также современные ГПУ могут ускоренно исполнять 😊

добились сжатия по памяти в десятки раз!

конечно же, из-за того что всё это реализовано "софтверно", итоговые тайминги не очень привлекательны, но мы понимаем что всё это может быть аппаратно ускорено. в теории. вопрос только: cтоит ли туда копать? 🤔🤔🤔
только не понятно чего авторы не предлагают уже ранее разработанные методы префильтрации фичей из мира нёрфов, которые борются с абсолютно такими же проблемами аляйзинга при реймаршинге нейронок что и они

надо спросить
This media is not supported in your browser
VIEW IN TELEGRAM
потому что иначе будет вот такое вот. ладно, запущу через неделю их код - проверю.

если что проверим "сработает ли фикс"
ну как бы да 🤷‍♂️
Число пикселей, генерируемые разными модельками

оффлайн рендер под угрозой 🙃🙂🙃

посмотрим как будут разрешать проблему artistic control-я в генерации видео. в рендер движках у нас конечно есть контроль над мелчайшими деталями, но... его стоимость запредельная
Запомните, перед вычислением финальных Monte Carlo экспериментов надо отключать клампинг семплов. всегда.

не благодарите 😭
😁3
https://suikasibyl.github.io/vxpg

тут очень умный знакомый студент из лиги тех самых 10х программистов смог пробраться на сиграфф, и что неожиданно статья по сути - это конкурент моей первой short paper на еврографикс.

а я то думал, чего он так обрадовался и быстро мне ответил несколько недель назад, когда я писал по поводу его опен сурс движка и желания воспользоваться его непубличным кодом 😅😅😅
(он кстати мне всё скинул!)

и самоё забавное, что оказывается мною предложенный алгоритм SSPG довольно хорошо себя показывает в полноценном сравнении.
оказывается оно было даже "State of the Art" при equal-time comparison. а я как-то когда писал статью поленился проводить глубокое исследование и подумал что моделька - хрень, и пусть пойдет максимум шорт пейпером на еврографикс и только 😂😂


пойду его поздравлю, ему точно светит хорошая карьера 👌
2🔥1
как формулируются обоснования для принятых решений для статей на top-tier конференции
😁3
Фуф, залили 1ую версию аж за 12 часов до дедлайна на сиграфф, всего то надо было прождать час времени пока файл уйдет на сервер 😢😢😢 С утра еще поредачим...

Посмотрим что на этот раз скажут нам ревьюеры, можно ли нашу технологию нести в массы или пока еще нет)()(
🔥6
Вышел новый отчёт от нвидиа.

Много можно сказать, но я пожалуй остановлюсь лишь на одной метрике:

Соотношение доходов от гейминг направления, другими словами от реал-тайм рендера, к общим доходам. (без учета профессиональной визуализации, но там -+ несколько процентов ещё). Упало до <10%

Кто хочет оставаться чисто в компьютерной графике, учитывайте эти числа в своих карьерных планах 🫡
😨3🫡3
ещё прекрасный график, демонстрирующий застой в ПК гейминг рынке. всё еще числа не вернулись к пиковым 22го года (23ый финансовый)

надо всё меньше бы классическими рендер задачами заниматься...
Так я почти разгрёб все накопившиеся дела после SigAsia -> да начнется разбор статей с сиграффа

DreamMat (код) прекрасный пример системной статьи, которая планомерно улучшает метрики SOTA. Ребята генерируют pbr материалы (альбеда, металлик, рафнес) для уже готовой геометрии на основе текстового описания.

2 главных контрибьюшена:
1. использование Classifier Score Distillation с вычитанием негативного гайдинга: "кислотные цвета", "уродливо", "слишком ярко\темно". По сути этот простой хак позволяет разрешить проблему кислотных цветов в итоговой модели. (Fig. 17)
- Light + Geometry condition map, помогающие вычленить влияние освещения на итоговый рендер и добиться стабильной работы диффузки для любого освещения и ракурса. Для этого они обучают ControlNet Stable Diffusion, подавая рендеры видимой геометрии (нормали, глубина - gbuffer) + её рендер с учетом выбранной инвайромент мапы но с белым альбедо.

Все идеи не кажутся необычными, и хоть и есть ряд вопросов к light conditioning, прогресс на лицо! 👍
"Коротенькая" статья, NeRF as a Non-Distant Environment Emitter in Physics-based Inverse Rendering, (боже мой, до чего мы дошли, называя 12-страничные статьи коротенькими 😅) презентует интересное решение в виде использования нёрфов вместо environment map для обратного рендера.

Очевидно, главное предположение environment map, зиждущееся на бесконечной удаленности окружающих точек, не реализуется во множестве сцен.

Использовали Mitsuba вместе с NeRF-Studio, и ребятам пришлось очень сильно подзадолбаться, чтобы их соединить из-за megakernel природы исполнения первого движка + прожорливости нёрфов. Даже сделали multi-GPU поддержку.

Результаты на лицо (в прямом смысле этого слова 😅).

Также ребята предложили более эффективный алгоритм для Монте-Карло оценщика градиентов, чтобы семплировать отражения лучше не только на основе BSDF. Некий упрощённый path guiding.
Pixel Science
"Коротенькая" статья, NeRF as a Non-Distant Environment Emitter in Physics-based Inverse Rendering, (боже мой, до чего мы дошли, называя 12-страничные статьи коротенькими 😅) презентует интересное решение в виде использования нёрфов вместо environment map для…
И знаете, размышляя об этой статье (и гуляя в парке), я попытался для себя сформулировать ещё раз, почему же задача обратного рендера может быть важна.

С одной стороны, да, имея "фото" какой-то сцены из "реального" мира, мы можем её реконструировать в виртуальном пространстве, вставить в игру, использовать для AR/VR и т.д. Это круто! 🔥

Но мне пришла одна очевидная, но фундаментальная мысль: устранив множество текущих инженерных и исследовательских проблем обратного рендера, мы сможем понять, почему наш рендер движок не в состоянии, в конечном итоге, реалистично воспроизвести настоящую сцену в виртуальном пространстве. Ведь если разрешить проблему оптимизации, то должен всегда найтись вектор параметров сцены (текстуры, положение вершин, источники света и их свойства, экспозиция), который приводит к той же картинке, что и камера нашего смартфона запечатлела в реальности!

Если же не находится, это значит, что или описательная способность наших BSDF моделей материалов слаба, или же то, как мы представляем источники света, или же модель камеры, GI лажает, или атмосфера не та! А может, волновую оптику надо лучше учитывать. Самое главное, что можно будет понять, какие дорогие "элементы" нашего рендера не так важны, и их можно оптимизировать. возможно, SSAO достаточен и RTAO нахер не сдался, если сравнить рендеры, используя perception-based AI: VGG/CLIP.

Пишите тоже, если есть мысли на этот счёт.... кажется и правда интересным вопросом 🤔🤔🤔
Luma Labs анонсировали свою модельку text -> video, Dream Machine!

Заявляют что 120 кадровое видео могут сгенерировать всего за 120 секунд, 1 сек/кадр. Звучит ооочень амбициозно, но проверить сложно -> кажется у них сайт перестал выдавать видосы :( перегрузили, но так попробовать может каждый бесплатно

Но предварительно результаты выглядят оооочень сочно, а также ребята указали ограничения своей модели на сайте. За что им отдельно респект 😉

Хоть и стартап изначально был создан для решения проблемы Novel View Synthesis (меня туда звучали ещё в 22ом году, так что за +- картина была понятно), nerf-ы, гауссианы все дела... Ребята решили расшить зону ресерча. И, имхо, это верное решение -> теперь у них есть своя "world model", которой они могут воспользоваться для text -> 3D генерации/novel view synthesis regularization. Круты!