This media is not supported in your browser
VIEW IN TELEGRAM
Тот самый контролируемый text-> 3D Skeleton animated mesh ->Video\Render уже на подходе
Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий
Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий
Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
AutoVFX. Заливаешь видео, дополняешь описанием желаемого эффекта и получаешь сцену + рендеры с итоговым результатом
Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями
Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.
Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)
#ии #статья
Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями
Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.
Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)
#ии #статья
🔥3❤1
Мне кажется этот прекрасный график объясняет за секунду важность скиллов в High Performance Computing и понимания современной архитектуры железа
Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳
#ии #индустрия
Добавлю это в слайды для своего GPGPU курса следующего семестра! Кстати, возможно благодаря тому что я пиарил курс в этом семестре через призму AI-Computing-а мы увидели 4х рост в числе студентов 🥳
#ии #индустрия
🔥3
Netflix выпустил крутую работу Diffusion-Based Facial Performance Relighting, которую я бы предложил разобрать более научно, не коротко, но без попсы
1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену
Читай ниже ⬇️
#ии #графика #статья
1️⃣ Призываю зайти на сайт проекта и посмотреть их великолепные примеры освещения captured лиц. Качество безусловно на уровне 9-10/10. Ну и авторы просто разбили все иные решения, судя по PSNR, SSIM, FLIP и т.д. (см. внизу)
2️⃣ Окей. В чём же сыр-бор?
Дано: видео с flat-lit лицом с эмоциями
Хотим: хотим "зарендерить" с новым освещением и novel-view - вставка актеров в виртуальную сцену
Читай ниже ⬇️
#ии #графика #статья
🔥1
Можно было бы: отсканировать геометрию, реконструировать каждый волосок, восстановить все возможны параметры описывающие BSDF кожи, важнейшие для корректного subsurface scattering-а (вплоть до определения меланина и гемоглобина в крови. читай тут). для этого надо было бы снять лицо под 1000 вариантами освещения, а не под 1им. далее провести дорогостоящую симуляцию света, ебясь с Monte Carlo шумом. Meta делала похожее просто :)
Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы
всё. 0 PBR. 0 инженерии. но работает 👌
сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...
какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
Что они сделали:
1️⃣ натравили динамические GSplats на видос таргет-лица для рендера flat-lit face с любого ракурса. ушли от проблемы реконструкции геометрии.
2️⃣ далее тупо применили fine-tuned Stable Diffusion 2.1, на вход которой подается flat-lit render и token sequence с закодированным SH освещением (вместо text-conditioning) => на выходе итоговый relit рендер. обучили используя 123 environment map-ы
всё. 0 PBR. 0 инженерии. но работает 👌
сколько времени занимает рендер? 5-6 секунд на А100 (~ RTX 4090) 1080p. это без оптимизации модели, с 30 диффузными шагами. кто в теме понимают, что можно достичь около SOTA результатов за 1-4 шага, что уже позволяет достичь ~200ms/frame. если еще оптимизировать исполнение модели, уверен что ~50ms более чем возможно! теперь подумайте сколько бы времени заняла симуляция света для похожего качества 🫠 или же денег-часов инженеров, пытающихся её ускорить...
какова мысль: диффузные сетки - как показывает одно из сравнений, приложил ниже - очень хорошо понимают как должны выглядеть лица. и как +- работает light transport. так еще мы их и исполнять учимся в реал-тайме (AI-Minecraft\AI-Doom)
так может быть им и правда стоить доверить часть рендера? т.к. оно просто на просто эффективнее, а еще есть окно для оптимизации, и не требуют реконструкции 1000 параметров?
если есть чем дополнить - пишите 👍
Odyssey, привлёкший еще дополнительно 18$ млн решил подойти к проблеме генерации реалистичных 3Д миров (именно 3Д, 3Д) прагматично:
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.
весит махина ~12кг с аккумулятором.
зачем?!?...
помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами
для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁
также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д
можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.
весит махина ~12кг с аккумулятором.
зачем?!?...
помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами
для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁
также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д
можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
⚡4🫡2❤1🔥1
Pixel Science
Ben Mildenhall, создатель NeRF-ов, объявил о своем новом стартапе World Labs, который кафаундит вместе с Fei-Fei Li (профессорка Стенфорда, ex-VP Google, "godmother of AI") и с Christoph Lassner. Все три с PhD 😊 Фандинг 230$ млн 🤯🤯🤯 И они хайрят! Им нужны…
This media is not supported in your browser
VIEW IN TELEGRAM
Не прошло и года с момента, как World Labs получили фандинг, а ребята уже выпустили интересные демки с видосами генеративных 3д миров, поддерживающих:
- базовую физику и коллизии
- передвижение камеры
- консистентный мир даже с какими-то отражениями
- освещение сцены искусственным источником света
- depth-based эффекты
- динамические эффекты, анимация, водичка
всё это работает не идеально, т.к. мы все еще наблюдаем:
- странные искажения перспективы
- несоответствие отражений и действительности
- освещение уровня 90ых годов CGI - для искусственного источника света
ставлю на то, что последние две проблемы будет очень сложно разрешить в долгосрок... но кто сказал, что их прям уж и обязательно разрешать для успешного продукта в ближайшем будущем?)
#графон #ии #индустрия
- базовую физику и коллизии
- передвижение камеры
- консистентный мир даже с какими-то отражениями
- освещение сцены искусственным источником света
- depth-based эффекты
- динамические эффекты, анимация, водичка
всё это работает не идеально, т.к. мы все еще наблюдаем:
- странные искажения перспективы
- несоответствие отражений и действительности
- освещение уровня 90ых годов CGI - для искусственного источника света
ставлю на то, что последние две проблемы будет очень сложно разрешить в долгосрок... но кто сказал, что их прям уж и обязательно разрешать для успешного продукта в ближайшем будущем?)
#графон #ии #индустрия
🔥3
Matthias Niessner из TUM организовал разговор от Chief Scientist-ом Luma Labs Jiaming Song, который начался лишь 10 минут назад. Кто хочет - запрыгивайте!
Upd:
Очень рекомендую
- Объясняет мотивацию к использованию фото и видео в качестве основы ИИ, а не 3Д. И почему не полагаемся на ИИ-based 3D рендере
- Кратко объясняет все то, что происходило в сфере за последний год. Приятно видеть все знакомые статьи
- Демонстрирует интересные примеры ИИ-based "light transport" и физики
Upd:
Очень рекомендую
- Объясняет мотивацию к использованию фото и видео в качестве основы ИИ, а не 3Д. И почему не полагаемся на ИИ-based 3D рендере
- Кратко объясняет все то, что происходило в сфере за последний год. Приятно видеть все знакомые статьи
- Демонстрирует интересные примеры ИИ-based "light transport" и физики
YouTube
TUM AI Lecture Series - Dream Machine: Emergent Capabilities from Video Models (Jiaming Song)
Abstract:
Dream Machine is a new video generative foundation model developed by Luma AI. We will show how Dream Machine exhibits some emergent capabilities that relate to vision, such as depth, segmentation, light transport, dynamics, and causality. Given…
Dream Machine is a new video generative foundation model developed by Luma AI. We will show how Dream Machine exhibits some emergent capabilities that relate to vision, such as depth, segmentation, light transport, dynamics, and causality. Given…
❤🔥4❤1
Чтобы вы понимали почему скорее всего завтра не появится нормальной LLMки, которая будет писать крутые шейдера: для обучения текущих открытых SoTA LLMок используется сотни гигабайт С++ файлов, десятки миллионов Си файлов и т.д.
уже отфильтрованного кода
А с shadertoy, того же, моим коллегам по академии удалось вытащить всего лишь порядка ~200 МБ шейдеров или же 50к файлов
Спасет лишь синтетика
уже отфильтрованного кода
А с shadertoy, того же, моим коллегам по академии удалось вытащить всего лишь порядка ~200 МБ шейдеров или же 50к файлов
Спасет лишь синтетика
❤6🫡5
Pixel Science
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели. Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным…
Пока все комментируют интересные особенности опубликованной OpenAI Sora, хочу подметить, что тейк о котором я уже давно писал все еще актуален: Диффузные - flow matching - модели все еще не могут выдерживать геометрическию проекцию
на что также обратил внимание ученый из TTIC
Конечно, если поддать еще больше данных оно наверняка отскалируется. Но, учитывая уже текущие вычислительные вложения, поразительно как сетки все еще не могут успешно проецировать геометрию без искажений 🫠🫠🫠
Или же надо прибегать к 3D inductive-bias через привнесение некого rendering equation. Или biased, как в NeRFах\GSplats, или unbiased как в PBR. Но из этого наследуется столько проблем, что аж страшно себе представить и там генеративные успехи, все еще на "уровне GANов".
В общем, сложна 😕
на что также обратил внимание ученый из TTIC
Конечно, если поддать еще больше данных оно наверняка отскалируется. Но, учитывая уже текущие вычислительные вложения, поразительно как сетки все еще не могут успешно проецировать геометрию без искажений 🫠🫠🫠
Или же надо прибегать к 3D inductive-bias через привнесение некого rendering equation. Или biased, как в NeRFах\GSplats, или unbiased как в PBR. Но из этого наследуется столько проблем, что аж страшно себе представить и там генеративные успехи, все еще на "уровне GANов".
В общем, сложна 😕
В последние пара дней в твиттере происходит забавный срач на фоне выхода Sora и ооочень крутой модели text->game от Google (рекомендую оценить если ещё не видели)
Графики решили пообесценивать достижения ИИ-ресерчеров, а те в ответку поиздевались над первыми
А я в этот момент сижу на двух стульях и хохочу с этого небольшого цирка 😁
Но Ben got the point:
Графики решили пообесценивать достижения ИИ-ресерчеров, а те в ответку поиздевались над первыми
А я в этот момент сижу на двух стульях и хохочу с этого небольшого цирка 😁
Но Ben got the point:
Оставаясь чисто рендерщиком в 2024 году, можно и правда повторить судьбу лингвистов в области Natural Language Processing
🥰7