Autodesk заэквайрила Wonder Dynamics, предлагающий AI, но в рамках классического 3Д пайплайна
Их server-based решения позволяют вытянуть анимацию из видео, наложив её на нужную модельку со скелетной\лицевой анимацией с сохранением динамики камеры, освещения и пост-эффектов. В итоге, артисты могут все подредактировать в Autodesk\UE\Blender, как и делали ранее 😊 т.е. сохранение артистик контроля что безумно важно для индустрии
Инструмент предлагает как и анимирование уже существующей 3Д сцены на основе видео, так и реалистичную вставку в уже существующие видео (кино) 3д моделей
Сумма сделки, к сожалению, не разглашается... Из интересного: кофаундером является Tye Sheridan (главный актер "Первому игроку приготовиться"), а в адвейзер-боард входит аж Стивен Спилберг!
постучался к некоторым ребятам на линкедине 😊
#индустрия #графон #ии
Их server-based решения позволяют вытянуть анимацию из видео, наложив её на нужную модельку со скелетной\лицевой анимацией с сохранением динамики камеры, освещения и пост-эффектов. В итоге, артисты могут все подредактировать в Autodesk\UE\Blender, как и делали ранее 😊 т.е. сохранение артистик контроля что безумно важно для индустрии
Инструмент предлагает как и анимирование уже существующей 3Д сцены на основе видео, так и реалистичную вставку в уже существующие видео (кино) 3д моделей
Сумма сделки, к сожалению, не разглашается... Из интересного: кофаундером является Tye Sheridan (главный актер "Первому игроку приготовиться"), а в адвейзер-боард входит аж Стивен Спилберг!
постучался к некоторым ребятам на линкедине 😊
#индустрия #графон #ии
👍7🔥5⚡1
This media is not supported in your browser
VIEW IN TELEGRAM
"Реал-Тайм" Майнкрафт в браузере зарендеренный полностью диффузной моделью на специальном железе Sohu, заточенном исключительно на матричные операции
Да да, можно поиграть прямо сейчас
Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который уже стал прибыльным. Ребята разработали свой закрытый фреймворк для обучения и исполнение диффузок, с максимально оптимизированными ядрами и коммуникацией между GPUшками. Пишут про 47ms и 156ms для 1-итерации исполнения и соответственно обучения диффузной модели. И его продают тем, кто использует кластеры c более чем 1000ми H100
Также утверждают, что на H100 их Майнкрафт-моделька исполняется в 360p в 20 фпс, а на Sohu разрешение вырастает до 4к + энергоэффективность в 10х выше. звучит ооочень сладко для будущего клауд-ИИ-гейминга\кино
Фундаментально ничего нового, т.к. игровые-диффузки изобрели не сегодня (писал тут про Doom от Google), но доступ к ним прямо через браузер + очень амбициозные числа конечно удивляют!
#ии #индустрия
Да да, можно поиграть прямо сейчас
Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который уже стал прибыльным. Ребята разработали свой закрытый фреймворк для обучения и исполнение диффузок, с максимально оптимизированными ядрами и коммуникацией между GPUшками. Пишут про 47ms и 156ms для 1-итерации исполнения и соответственно обучения диффузной модели. И его продают тем, кто использует кластеры c более чем 1000ми H100
Также утверждают, что на H100 их Майнкрафт-моделька исполняется в 360p в 20 фпс, а на Sohu разрешение вырастает до 4к + энергоэффективность в 10х выше. звучит ооочень сладко для будущего клауд-ИИ-гейминга\кино
Фундаментально ничего нового, т.к. игровые-диффузки изобрели не сегодня (писал тут про Doom от Google), но доступ к ним прямо через браузер + очень амбициозные числа конечно удивляют!
#ии #индустрия
🔥3
Pixel Science
"Реал-Тайм" Майнкрафт в браузере зарендеренный полностью диффузной моделью на специальном железе Sohu, заточенном исключительно на матричные операции Да да, можно поиграть прямо сейчас Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который…
This media is not supported in your browser
VIEW IN TELEGRAM
Пример реальной "памяти" диффузной модели в диффузном Minecraft-е
Тоже самое вы можете пронаблюдать, если несколько раз нырнете в воду и тут же из неё выплывете - каждый раз окружение будет совершенно разное
Поэтому, как я и писал в посте про Doom, я верую что текущие "игровые"-диффузные модели = тупо DLSS с экстраполяцией кадров на максималках, conditioned on user input. Для решения фундаментальной проблемы надо вводить блоки памяти\game state. Возможно для этого им надо реализовывать подобие Long short-term memory (LSTM) но там afaik проблемы с обучением (не обучал их с домашек по универу). Или обучаемая MLP-память, но тут лучше скажут ИИ-ученые
Или же идти через призму классического 3д рендер пайплайна, с введением понятия "сцены". Но таким образом наследуются все, или почти все, проблемы классического дифференциального рендера и light transport simulation (простой пример: зеркала)
незадача 😔
#ии
Тоже самое вы можете пронаблюдать, если несколько раз нырнете в воду и тут же из неё выплывете - каждый раз окружение будет совершенно разное
Поэтому, как я и писал в посте про Doom, я верую что текущие "игровые"-диффузные модели = тупо DLSS с экстраполяцией кадров на максималках, conditioned on user input. Для решения фундаментальной проблемы надо вводить блоки памяти\game state. Возможно для этого им надо реализовывать подобие Long short-term memory (LSTM) но там afaik проблемы с обучением (не обучал их с домашек по универу). Или обучаемая MLP-память, но тут лучше скажут ИИ-ученые
Или же идти через призму классического 3д рендер пайплайна, с введением понятия "сцены". Но таким образом наследуются все, или почти все, проблемы классического дифференциального рендера и light transport simulation (простой пример: зеркала)
незадача 😔
#ии
👍5
Предпосылка к темпорально-консистентной "world-model" с 90 FPS на 1ой A100
Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений
В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно
3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов
Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...
Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей
но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)
и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений
В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно
3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов
Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...
Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей
но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)
и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
🔥3
После того как все, кто только мог, процитировали твитт Тима, СЕО Epic Games, о том что ИИ - хрень, в контексте майнкрафта, как всегда приятно наблюдать качественную беседу без эмоций в реальном экспертном пузыре твиттера (Thomas Willberger - выпускник моей лабы, сделавший Enscape)
Полностью согласен с уже сдержанной оценкой Тима о разумностей последовательной интеграцией ИИ в современный рендер-пайплайн и очевидных рисках
Полностью согласен с уже сдержанной оценкой Тима о разумностей последовательной интеграцией ИИ в современный рендер-пайплайн и очевидных рисках
❤7👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Тот самый контролируемый text-> 3D Skeleton animated mesh ->Video\Render уже на подходе
Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий
Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий
Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
AutoVFX. Заливаешь видео, дополняешь описанием желаемого эффекта и получаешь сцену + рендеры с итоговым результатом
Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями
Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.
Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)
#ии #статья
Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями
Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.
Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)
#ии #статья
🔥3❤1
Мне кажется этот прекрасный график объясняет за секунду важность скиллов в High Performance Computing и понимания современной архитектуры железа
Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳
#ии #индустрия
Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳
#ии #индустрия
🔥3
Netflix выпустил крутую работу Diffusion-Based Facial Performance Relighting, которую я бы предложил разобрать более научно, не коротко, но без попсы
1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену
Читай ниже ⬇️
#ии #графика #статья
1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену
Читай ниже ⬇️
#ии #графика #статья
🔥1
Можно было бы: отсканировать геометрию, реконструировать каждый волосок, восстановить все возможны параметры описывающие BSDF кожи, важнейшие для корректного subsurface scattering-а (вплоть до определения меланина и гемоглобина в крови. читай тут). для этого надо было бы снять лицо под 1000 вариантами освещения, а не под 1им. далее провести дорогостоящую симуляцию света, ебясь с Monte Carlo шумом. Meta делала похожее просто :)
Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы
всё. 0 PBR. 0 инженерии. но работает 👌
сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...
какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы
всё. 0 PBR. 0 инженерии. но работает 👌
сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...
какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
Odyssey, привлёкший еще дополнительно 18$ млн решил подойти к проблеме генерации реалистичных 3Д миров (именно 3Д, 3Д) прагматично:
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.
весит махина ~12кг с аккумулятором.
зачем?!?...
помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами
для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁
также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д
можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.
весит махина ~12кг с аккумулятором.
зачем?!?...
помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами
для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁
также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д
можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
⚡4🫡2❤1🔥1