Pixel Science
478 subscribers
136 photos
53 videos
2 files
106 links
пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Download Telegram
Channel name was changed to «Pixel Science»
Pixel Science
"Реал-Тайм" Майнкрафт в браузере зарендеренный полностью диффузной моделью на специальном железе Sohu, заточенном исключительно на матричные операции Да да, можно поиграть прямо сейчас Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который…
This media is not supported in your browser
VIEW IN TELEGRAM
Пример реальной "памяти" диффузной модели в диффузном Minecraft-е

Тоже самое вы можете пронаблюдать, если несколько раз нырнете в воду и тут же из неё выплывете - каждый раз окружение будет совершенно разное

Поэтому, как я и писал в посте про Doom, я верую что текущие "игровые"-диффузные модели = тупо DLSS с экстраполяцией кадров на максималках, conditioned on user input. Для решения фундаментальной проблемы надо вводить блоки памяти\game state. Возможно для этого им надо реализовывать подобие Long short-term memory (LSTM) но там afaik проблемы с обучением (не обучал их с домашек по универу). Или обучаемая MLP-память, но тут лучше скажут ИИ-ученые

Или же идти через призму классического 3д рендер пайплайна, с введением понятия "сцены". Но таким образом наследуются все, или почти все, проблемы классического дифференциального рендера и light transport simulation (простой пример: зеркала)

незадача 😔

#ии
👍5
Предпосылка к темпорально-консистентной "world-model" с 90 FPS на 1ой A100

Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений

В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно

3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов

Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...

Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей

но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)

и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
🔥3
После того как все, кто только мог, процитировали твитт Тима, СЕО Epic Games, о том что ИИ - хрень, в контексте майнкрафта, как всегда приятно наблюдать качественную беседу без эмоций в реальном экспертном пузыре твиттера (Thomas Willberger - выпускник моей лабы, сделавший Enscape)

Полностью согласен с уже сдержанной оценкой Тима о разумностей последовательной интеграцией ИИ в современный рендер-пайплайн и очевидных рисках
7👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Тот самый контролируемый text-> 3D Skeleton animated mesh ->Video\Render уже на подходе

Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий

Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
AutoVFX. Заливаешь видео, дополняешь описанием желаемого эффекта и получаешь сцену + рендеры с итоговым результатом

Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями

Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.

Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)

#ии #статья
🔥31
Мне кажется этот прекрасный график объясняет за секунду важность скиллов в High Performance Computing и понимания современной архитектуры железа

Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳

#ии #индустрия
🔥3
Netflix выпустил крутую работу Diffusion-Based Facial Performance Relighting, которую я бы предложил разобрать более научно, не коротко, но без попсы

1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену


Читай ниже ⬇️

#ии #графика #статья
🔥1
Можно было бы: отсканировать геометрию, реконструировать каждый волосок, восстановить все возможны параметры описывающие BSDF кожи, важнейшие для корректного subsurface scattering-а (вплоть до определения меланина и гемоглобина в крови. читай тут). для этого надо было бы снять лицо под 1000 вариантами освещения, а не под 1им. далее провести дорогостоящую симуляцию света, ебясь с Monte Carlo шумом. Meta делала похожее просто :)

Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы

всё. 0 PBR. 0 инженерии. но работает 👌

сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...

какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
авторы собрали все ключевые слова 😁

Differentiable
Trainable
Wireless
Neural
Ray-Tracing
😁9
Odyssey, привлёкший еще дополнительно 18$ млн решил подойти к проблеме генерации реалистичных 3Д миров (именно 3Д, 3Д) прагматично:
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.

весит махина ~12кг с аккумулятором.
зачем?!?...


помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами

для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁

также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д

можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
4🫡21🔥1
Pixel Science
Ben Mildenhall, создатель NeRF-ов, объявил о своем новом стартапе World Labs, который кафаундит вместе с Fei-Fei Li (профессорка Стенфорда, ex-VP Google, "godmother of AI") и с Christoph Lassner. Все три с PhD 😊 Фандинг 230$ млн 🤯🤯🤯 И они хайрят! Им нужны…
This media is not supported in your browser
VIEW IN TELEGRAM
Не прошло и года с момента, как World Labs получили фандинг, а ребята уже выпустили интересные демки с видосами генеративных 3д миров, поддерживающих:
- базовую физику и коллизии
- передвижение камеры
- консистентный мир даже с какими-то отражениями
- освещение сцены искусственным источником света
- depth-based эффекты
- динамические эффекты, анимация, водичка

всё это работает не идеально, т.к. мы все еще наблюдаем:
- странные искажения перспективы
- несоответствие отражений и действительности
- освещение уровня 90ых годов CGI - для искусственного источника света


ставлю на то, что последние две проблемы будет очень сложно разрешить в долгосрок... но кто сказал, что их прям уж и обязательно разрешать для успешного продукта в ближайшем будущем?)

#графон #ии #индустрия
🔥3
Matthias Niessner из TUM организовал разговор от Chief Scientist-ом Luma Labs Jiaming Song, который начался лишь 10 минут назад. Кто хочет - запрыгивайте!

Upd:
Очень рекомендую
- Объясняет мотивацию к использованию фото и видео в качестве основы ИИ, а не 3Д. И почему не полагаемся на ИИ-based 3D рендере

- Кратко объясняет все то, что происходило в сфере за последний год. Приятно видеть все знакомые статьи

- Демонстрирует интересные примеры ИИ-based "light transport" и физики
❤‍🔥41