Pixel Science
"Реал-Тайм" Майнкрафт в браузере зарендеренный полностью диффузной моделью на специальном железе Sohu, заточенном исключительно на матричные операции Да да, можно поиграть прямо сейчас Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который…
This media is not supported in your browser
VIEW IN TELEGRAM
Пример реальной "памяти" диффузной модели в диффузном Minecraft-е
Тоже самое вы можете пронаблюдать, если несколько раз нырнете в воду и тут же из неё выплывете - каждый раз окружение будет совершенно разное
Поэтому, как я и писал в посте про Doom, я верую что текущие "игровые"-диффузные модели = тупо DLSS с экстраполяцией кадров на максималках, conditioned on user input. Для решения фундаментальной проблемы надо вводить блоки памяти\game state. Возможно для этого им надо реализовывать подобие Long short-term memory (LSTM) но там afaik проблемы с обучением (не обучал их с домашек по универу). Или обучаемая MLP-память, но тут лучше скажут ИИ-ученые
Или же идти через призму классического 3д рендер пайплайна, с введением понятия "сцены". Но таким образом наследуются все, или почти все, проблемы классического дифференциального рендера и light transport simulation (простой пример: зеркала)
незадача 😔
#ии
Тоже самое вы можете пронаблюдать, если несколько раз нырнете в воду и тут же из неё выплывете - каждый раз окружение будет совершенно разное
Поэтому, как я и писал в посте про Doom, я верую что текущие "игровые"-диффузные модели = тупо DLSS с экстраполяцией кадров на максималках, conditioned on user input. Для решения фундаментальной проблемы надо вводить блоки памяти\game state. Возможно для этого им надо реализовывать подобие Long short-term memory (LSTM) но там afaik проблемы с обучением (не обучал их с домашек по универу). Или обучаемая MLP-память, но тут лучше скажут ИИ-ученые
Или же идти через призму классического 3д рендер пайплайна, с введением понятия "сцены". Но таким образом наследуются все, или почти все, проблемы классического дифференциального рендера и light transport simulation (простой пример: зеркала)
незадача 😔
#ии
👍5
Предпосылка к темпорально-консистентной "world-model" с 90 FPS на 1ой A100
Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений
В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно
3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов
Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...
Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей
но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)
и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений
В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно
3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов
Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...
Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей
но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)
и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
🔥3
После того как все, кто только мог, процитировали твитт Тима, СЕО Epic Games, о том что ИИ - хрень, в контексте майнкрафта, как всегда приятно наблюдать качественную беседу без эмоций в реальном экспертном пузыре твиттера (Thomas Willberger - выпускник моей лабы, сделавший Enscape)
Полностью согласен с уже сдержанной оценкой Тима о разумностей последовательной интеграцией ИИ в современный рендер-пайплайн и очевидных рисках
Полностью согласен с уже сдержанной оценкой Тима о разумностей последовательной интеграцией ИИ в современный рендер-пайплайн и очевидных рисках
❤7👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Тот самый контролируемый text-> 3D Skeleton animated mesh ->Video\Render уже на подходе
Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий
Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий
Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
AutoVFX. Заливаешь видео, дополняешь описанием желаемого эффекта и получаешь сцену + рендеры с итоговым результатом
Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями
Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.
Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)
#ии #статья
Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями
Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.
Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)
#ии #статья
🔥3❤1
Мне кажется этот прекрасный график объясняет за секунду важность скиллов в High Performance Computing и понимания современной архитектуры железа
Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳
#ии #индустрия
Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳
#ии #индустрия
🔥3
Netflix выпустил крутую работу Diffusion-Based Facial Performance Relighting, которую я бы предложил разобрать более научно, не коротко, но без попсы
1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену
Читай ниже ⬇️
#ии #графика #статья
1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену
Читай ниже ⬇️
#ии #графика #статья
🔥1
Можно было бы: отсканировать геометрию, реконструировать каждый волосок, восстановить все возможны параметры описывающие BSDF кожи, важнейшие для корректного subsurface scattering-а (вплоть до определения меланина и гемоглобина в крови. читай тут). для этого надо было бы снять лицо под 1000 вариантами освещения, а не под 1им. далее провести дорогостоящую симуляцию света, ебясь с Monte Carlo шумом. Meta делала похожее просто :)
Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы
всё. 0 PBR. 0 инженерии. но работает 👌
сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...
какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы
всё. 0 PBR. 0 инженерии. но работает 👌
сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...
какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
Odyssey, привлёкший еще дополнительно 18$ млн решил подойти к проблеме генерации реалистичных 3Д миров (именно 3Д, 3Д) прагматично:
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.
весит махина ~12кг с аккумулятором.
зачем?!?...
помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами
для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁
также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д
можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.
весит махина ~12кг с аккумулятором.
зачем?!?...
помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами
для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁
также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д
можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
⚡4🫡2❤1🔥1
Pixel Science
Ben Mildenhall, создатель NeRF-ов, объявил о своем новом стартапе World Labs, который кафаундит вместе с Fei-Fei Li (профессорка Стенфорда, ex-VP Google, "godmother of AI") и с Christoph Lassner. Все три с PhD 😊 Фандинг 230$ млн 🤯🤯🤯 И они хайрят! Им нужны…
This media is not supported in your browser
VIEW IN TELEGRAM
Не прошло и года с момента, как World Labs получили фандинг, а ребята уже выпустили интересные демки с видосами генеративных 3д миров, поддерживающих:
- базовую физику и коллизии
- передвижение камеры
- консистентный мир даже с какими-то отражениями
- освещение сцены искусственным источником света
- depth-based эффекты
- динамические эффекты, анимация, водичка
всё это работает не идеально, т.к. мы все еще наблюдаем:
- странные искажения перспективы
- несоответствие отражений и действительности
- освещение уровня 90ых годов CGI - для искусственного источника света
ставлю на то, что последние две проблемы будет очень сложно разрешить в долгосрок... но кто сказал, что их прям уж и обязательно разрешать для успешного продукта в ближайшем будущем?)
#графон #ии #индустрия
- базовую физику и коллизии
- передвижение камеры
- консистентный мир даже с какими-то отражениями
- освещение сцены искусственным источником света
- depth-based эффекты
- динамические эффекты, анимация, водичка
всё это работает не идеально, т.к. мы все еще наблюдаем:
- странные искажения перспективы
- несоответствие отражений и действительности
- освещение уровня 90ых годов CGI - для искусственного источника света
ставлю на то, что последние две проблемы будет очень сложно разрешить в долгосрок... но кто сказал, что их прям уж и обязательно разрешать для успешного продукта в ближайшем будущем?)
#графон #ии #индустрия
🔥3
Matthias Niessner из TUM организовал разговор от Chief Scientist-ом Luma Labs Jiaming Song, который начался лишь 10 минут назад. Кто хочет - запрыгивайте!
Upd:
Очень рекомендую
- Объясняет мотивацию к использованию фото и видео в качестве основы ИИ, а не 3Д. И почему не полагаемся на ИИ-based 3D рендере
- Кратко объясняет все то, что происходило в сфере за последний год. Приятно видеть все знакомые статьи
- Демонстрирует интересные примеры ИИ-based "light transport" и физики
Upd:
Очень рекомендую
- Объясняет мотивацию к использованию фото и видео в качестве основы ИИ, а не 3Д. И почему не полагаемся на ИИ-based 3D рендере
- Кратко объясняет все то, что происходило в сфере за последний год. Приятно видеть все знакомые статьи
- Демонстрирует интересные примеры ИИ-based "light transport" и физики
YouTube
TUM AI Lecture Series - Dream Machine: Emergent Capabilities from Video Models (Jiaming Song)
Abstract:
Dream Machine is a new video generative foundation model developed by Luma AI. We will show how Dream Machine exhibits some emergent capabilities that relate to vision, such as depth, segmentation, light transport, dynamics, and causality. Given…
Dream Machine is a new video generative foundation model developed by Luma AI. We will show how Dream Machine exhibits some emergent capabilities that relate to vision, such as depth, segmentation, light transport, dynamics, and causality. Given…
❤🔥4❤1