Pixel Science
478 subscribers
136 photos
53 videos
2 files
106 links
пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Download Telegram
Pixel Science
"Коротенькая" статья, NeRF as a Non-Distant Environment Emitter in Physics-based Inverse Rendering, (боже мой, до чего мы дошли, называя 12-страничные статьи коротенькими 😅) презентует интересное решение в виде использования нёрфов вместо environment map для…
И знаете, размышляя об этой статье (и гуляя в парке), я попытался для себя сформулировать ещё раз, почему же задача обратного рендера может быть важна.

С одной стороны, да, имея "фото" какой-то сцены из "реального" мира, мы можем её реконструировать в виртуальном пространстве, вставить в игру, использовать для AR/VR и т.д. Это круто! 🔥

Но мне пришла одна очевидная, но фундаментальная мысль: устранив множество текущих инженерных и исследовательских проблем обратного рендера, мы сможем понять, почему наш рендер движок не в состоянии, в конечном итоге, реалистично воспроизвести настоящую сцену в виртуальном пространстве. Ведь если разрешить проблему оптимизации, то должен всегда найтись вектор параметров сцены (текстуры, положение вершин, источники света и их свойства, экспозиция), который приводит к той же картинке, что и камера нашего смартфона запечатлела в реальности!

Если же не находится, это значит, что или описательная способность наших BSDF моделей материалов слаба, или же то, как мы представляем источники света, или же модель камеры, GI лажает, или атмосфера не та! А может, волновую оптику надо лучше учитывать. Самое главное, что можно будет понять, какие дорогие "элементы" нашего рендера не так важны, и их можно оптимизировать. возможно, SSAO достаточен и RTAO нахер не сдался, если сравнить рендеры, используя perception-based AI: VGG/CLIP.

Пишите тоже, если есть мысли на этот счёт.... кажется и правда интересным вопросом 🤔🤔🤔
Luma Labs анонсировали свою модельку text -> video, Dream Machine!

Заявляют что 120 кадровое видео могут сгенерировать всего за 120 секунд, 1 сек/кадр. Звучит ооочень амбициозно, но проверить сложно -> кажется у них сайт перестал выдавать видосы :( перегрузили, но так попробовать может каждый бесплатно

Но предварительно результаты выглядят оооочень сочно, а также ребята указали ограничения своей модели на сайте. За что им отдельно респект 😉

Хоть и стартап изначально был создан для решения проблемы Novel View Synthesis (меня туда звучали ещё в 22ом году, так что за +- картина была понятно), nerf-ы, гауссианы все дела... Ребята решили расшить зону ресерча. И, имхо, это верное решение -> теперь у них есть своя "world model", которой они могут воспользоваться для text -> 3D генерации/novel view synthesis regularization. Круты!
This media is not supported in your browser
VIEW IN TELEGRAM
Кажется в особенности данный пример демонстрирует возможности text->video Dream Machine генерировать кадры, которые мы бы ожидали от супер реалистичного игрового рендера какого-то шутера.

Пока не понятно, что значит 120 second per 120 frames, на каком железе и т.д. но всего месяц назад я предполагал что генеративки являются угрозой лишь для рынка оффлайн рендера, но сейчас допускаю конкуренцию в будущем и на рынке реал тайм решений.

но вопрос контроля за тем, что происходит в сцене и как оно должно быть визуализировано. и конечно нам также нужны физические представления объектов. чтобы трекать коллизии пуль, как пример

но очень интересно.... надо думать как это все "соединить" 🤔🤔🤔
😁1
Image Neural Field Diffusion Models, диффузка генерирует латентное представление, которые определяет плавное, а не дискретное, изображение

Алгоритм можно использовать для генерации картинок высокого разрешения, при всем при этом контент остается довольно когерентным между различными разрешениями!

Основа: Stable Diffusion

(рекомендую зайти на сайт, а так же оценить Appendix самой статьи, чтобы посмотреть изображения в оригинале)
https://fixupx.com/i/status/1803181568451641487

хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
🤔3👍1👀1
Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений

Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect

Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
👍7🔥1🤯1
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели.

Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.

Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.


Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.

P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.
👍3🔥1🤯1
Pixel Science
https://fixupx.com/i/status/1803181568451641487 хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше…
This media is not supported in your browser
VIEW IN TELEGRAM
ещё один интересный пример, демонстрирующий что text->video может исполнять роль ограниченного (возможно лишь пока...) 3Д движка, на основе китайской модели Kling

проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure

Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats

Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥


Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.

Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.

Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.

(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)
🤯2👍1🔥1
Pixel Science
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure Идея в том, что вместо гридов…
Это тот самый момент, когда я рад видеть статью, разрешившую часть задач, которыми я сейчас занимаюсь 😁. Просто в связи с тем, что раз таааакие крутые авторы бросились копать в это направление, значит и я не дурак, что потратил последние недели на то чтобы разобраться с Larsen’s Generalized Boltzmann Equation. Larsens GBE - это генеральный случай Radiative Transfer Equation, т.к. последний вводит ряд предположений, которые отрицательно влияют на качество итоговых рендеров как раз таки в представленных выше кейсах)
Для интересующихся полезные ссылки на эту тему:
1 2 3
Неплохой пример, сделанный на коленках, как можно из text->video получить 3Д сцену через гауссианы, а после походить в ней в ARе

by LumaLabs

теперь осталось их сделать PBRными и заживём 👌
👾5🤯3