Фуф, залили 1ую версию аж за 12 часов до дедлайна на сиграфф, всего то надо было прождать час времени пока файл уйдет на сервер 😢😢😢 С утра еще поредачим...
Посмотрим что на этот раз скажут нам ревьюеры, можно ли нашу технологию нести в массы или пока еще нет)()(
Посмотрим что на этот раз скажут нам ревьюеры, можно ли нашу технологию нести в массы или пока еще нет)()(
🔥6
Вышел новый отчёт от нвидиа.
Много можно сказать, но я пожалуй остановлюсь лишь на одной метрике:
Соотношение доходов от гейминг направления, другими словами от реал-тайм рендера, к общим доходам. (без учета профессиональной визуализации, но там -+ несколько процентов ещё). Упало до <10%
Кто хочет оставаться чисто в компьютерной графике, учитывайте эти числа в своих карьерных планах 🫡
Много можно сказать, но я пожалуй остановлюсь лишь на одной метрике:
Соотношение доходов от гейминг направления, другими словами от реал-тайм рендера, к общим доходам. (без учета профессиональной визуализации, но там -+ несколько процентов ещё). Упало до <10%
Кто хочет оставаться чисто в компьютерной графике, учитывайте эти числа в своих карьерных планах 🫡
😨3🫡3
Так я почти разгрёб все накопившиеся дела после SigAsia -> да начнется разбор статей с сиграффа
DreamMat (код) прекрасный пример системной статьи, которая планомерно улучшает метрики SOTA. Ребята генерируют pbr материалы (альбеда, металлик, рафнес) для уже готовой геометрии на основе текстового описания.
2 главных контрибьюшена:
1. использование Classifier Score Distillation с вычитанием негативного гайдинга: "кислотные цвета", "уродливо", "слишком ярко\темно". По сути этот простой хак позволяет разрешить проблему кислотных цветов в итоговой модели. (Fig. 17)
- Light + Geometry condition map, помогающие вычленить влияние освещения на итоговый рендер и добиться стабильной работы диффузки для любого освещения и ракурса. Для этого они обучают ControlNet Stable Diffusion, подавая рендеры видимой геометрии (нормали, глубина - gbuffer) + её рендер с учетом выбранной инвайромент мапы но с белым альбедо.
Все идеи не кажутся необычными, и хоть и есть ряд вопросов к light conditioning, прогресс на лицо! 👍
DreamMat (код) прекрасный пример системной статьи, которая планомерно улучшает метрики SOTA. Ребята генерируют pbr материалы (альбеда, металлик, рафнес) для уже готовой геометрии на основе текстового описания.
2 главных контрибьюшена:
1. использование Classifier Score Distillation с вычитанием негативного гайдинга: "кислотные цвета", "уродливо", "слишком ярко\темно". По сути этот простой хак позволяет разрешить проблему кислотных цветов в итоговой модели. (Fig. 17)
- Light + Geometry condition map, помогающие вычленить влияние освещения на итоговый рендер и добиться стабильной работы диффузки для любого освещения и ракурса. Для этого они обучают ControlNet Stable Diffusion, подавая рендеры видимой геометрии (нормали, глубина - gbuffer) + её рендер с учетом выбранной инвайромент мапы но с белым альбедо.
Все идеи не кажутся необычными, и хоть и есть ряд вопросов к light conditioning, прогресс на лицо! 👍
"Коротенькая" статья, NeRF as a Non-Distant Environment Emitter in Physics-based Inverse Rendering, (боже мой, до чего мы дошли, называя 12-страничные статьи коротенькими 😅) презентует интересное решение в виде использования нёрфов вместо environment map для обратного рендера.
Очевидно, главное предположение environment map, зиждущееся на бесконечной удаленности окружающих точек, не реализуется во множестве сцен.
Использовали Mitsuba вместе с NeRF-Studio, и ребятам пришлось очень сильно подзадолбаться, чтобы их соединить из-за megakernel природы исполнения первого движка + прожорливости нёрфов. Даже сделали multi-GPU поддержку.
Результаты на лицо (в прямом смысле этого слова 😅).
Также ребята предложили более эффективный алгоритм для Монте-Карло оценщика градиентов, чтобы семплировать отражения лучше не только на основе BSDF. Некий упрощённый path guiding.
Очевидно, главное предположение environment map, зиждущееся на бесконечной удаленности окружающих точек, не реализуется во множестве сцен.
Использовали Mitsuba вместе с NeRF-Studio, и ребятам пришлось очень сильно подзадолбаться, чтобы их соединить из-за megakernel природы исполнения первого движка + прожорливости нёрфов. Даже сделали multi-GPU поддержку.
Результаты на лицо (в прямом смысле этого слова 😅).
Также ребята предложили более эффективный алгоритм для Монте-Карло оценщика градиентов, чтобы семплировать отражения лучше не только на основе BSDF. Некий упрощённый path guiding.
Pixel Science
"Коротенькая" статья, NeRF as a Non-Distant Environment Emitter in Physics-based Inverse Rendering, (боже мой, до чего мы дошли, называя 12-страничные статьи коротенькими 😅) презентует интересное решение в виде использования нёрфов вместо environment map для…
И знаете, размышляя об этой статье (и гуляя в парке), я попытался для себя сформулировать ещё раз, почему же задача обратного рендера может быть важна.
С одной стороны, да, имея "фото" какой-то сцены из "реального" мира, мы можем её реконструировать в виртуальном пространстве, вставить в игру, использовать для AR/VR и т.д. Это круто! 🔥
Но мне пришла одна очевидная, но фундаментальная мысль: устранив множество текущих инженерных и исследовательских проблем обратного рендера, мы сможем понять, почему наш рендер движок не в состоянии, в конечном итоге, реалистично воспроизвести настоящую сцену в виртуальном пространстве. Ведь если разрешить проблему оптимизации, то должен всегда найтись вектор параметров сцены (текстуры, положение вершин, источники света и их свойства, экспозиция), который приводит к той же картинке, что и камера нашего смартфона запечатлела в реальности!
Если же не находится, это значит, что или описательная способность наших BSDF моделей материалов слаба, или же то, как мы представляем источники света, или же модель камеры, GI лажает, или атмосфера не та! А может, волновую оптику надо лучше учитывать. Самое главное, что можно будет понять, какие дорогие "элементы" нашего рендера не так важны, и их можно оптимизировать. возможно, SSAO достаточен и RTAO нахер не сдался, если сравнить рендеры, используя perception-based AI: VGG/CLIP.
Пишите тоже, если есть мысли на этот счёт.... кажется и правда интересным вопросом 🤔🤔🤔
С одной стороны, да, имея "фото" какой-то сцены из "реального" мира, мы можем её реконструировать в виртуальном пространстве, вставить в игру, использовать для AR/VR и т.д. Это круто! 🔥
Но мне пришла одна очевидная, но фундаментальная мысль: устранив множество текущих инженерных и исследовательских проблем обратного рендера, мы сможем понять, почему наш рендер движок не в состоянии, в конечном итоге, реалистично воспроизвести настоящую сцену в виртуальном пространстве. Ведь если разрешить проблему оптимизации, то должен всегда найтись вектор параметров сцены (текстуры, положение вершин, источники света и их свойства, экспозиция), который приводит к той же картинке, что и камера нашего смартфона запечатлела в реальности!
Если же не находится, это значит, что или описательная способность наших BSDF моделей материалов слаба, или же то, как мы представляем источники света, или же модель камеры, GI лажает, или атмосфера не та! А может, волновую оптику надо лучше учитывать. Самое главное, что можно будет понять, какие дорогие "элементы" нашего рендера не так важны, и их можно оптимизировать. возможно, SSAO достаточен и RTAO нахер не сдался, если сравнить рендеры, используя perception-based AI: VGG/CLIP.
Пишите тоже, если есть мысли на этот счёт.... кажется и правда интересным вопросом 🤔🤔🤔
Luma Labs анонсировали свою модельку text -> video, Dream Machine!
Заявляют что 120 кадровое видео могут сгенерировать всего за 120 секунд, 1 сек/кадр. Звучит ооочень амбициозно, но проверить сложно -> кажется у них сайт перестал выдавать видосы :( перегрузили, но так попробовать может каждый бесплатно
Но предварительно результаты выглядят оооочень сочно, а также ребята указали ограничения своей модели на сайте. За что им отдельно респект 😉
Хоть и стартап изначально был создан для решения проблемы Novel View Synthesis (меня туда звучали ещё в 22ом году, так что за +- картина была понятно), nerf-ы, гауссианы все дела... Ребята решили расшить зону ресерча. И, имхо, это верное решение -> теперь у них есть своя "world model", которой они могут воспользоваться для text -> 3D генерации/novel view synthesis regularization. Круты!
Заявляют что 120 кадровое видео могут сгенерировать всего за 120 секунд, 1 сек/кадр. Звучит ооочень амбициозно, но проверить сложно -> кажется у них сайт перестал выдавать видосы :( перегрузили, но так попробовать может каждый бесплатно
Но предварительно результаты выглядят оооочень сочно, а также ребята указали ограничения своей модели на сайте. За что им отдельно респект 😉
Хоть и стартап изначально был создан для решения проблемы Novel View Synthesis (меня туда звучали ещё в 22ом году, так что за +- картина была понятно), nerf-ы, гауссианы все дела... Ребята решили расшить зону ресерча. И, имхо, это верное решение -> теперь у них есть своя "world model", которой они могут воспользоваться для text -> 3D генерации/novel view synthesis regularization. Круты!
This media is not supported in your browser
VIEW IN TELEGRAM
Кажется в особенности данный пример демонстрирует возможности text->video Dream Machine генерировать кадры, которые мы бы ожидали от супер реалистичного игрового рендера какого-то шутера.
Пока не понятно, что значит 120 second per 120 frames, на каком железе и т.д. но всего месяц назад я предполагал что генеративки являются угрозой лишь для рынка оффлайн рендера, но сейчас допускаю конкуренцию в будущем и на рынке реал тайм решений.
но вопрос контроля за тем, что происходит в сцене и как оно должно быть визуализировано. и конечно нам также нужны физические представления объектов. чтобы трекать коллизии пуль, как пример
но очень интересно.... надо думать как это все "соединить" 🤔🤔🤔
Пока не понятно, что значит 120 second per 120 frames, на каком железе и т.д. но всего месяц назад я предполагал что генеративки являются угрозой лишь для рынка оффлайн рендера, но сейчас допускаю конкуренцию в будущем и на рынке реал тайм решений.
но вопрос контроля за тем, что происходит в сцене и как оно должно быть визуализировано. и конечно нам также нужны физические представления объектов. чтобы трекать коллизии пуль, как пример
но очень интересно.... надо думать как это все "соединить" 🤔🤔🤔
😁1
Image Neural Field Diffusion Models, диффузка генерирует латентное представление, которые определяет плавное, а не дискретное, изображение
Алгоритм можно использовать для генерации картинок высокого разрешения, при всем при этом контент остается довольно когерентным между различными разрешениями!
Основа: Stable Diffusion
(рекомендую зайти на сайт, а так же оценить Appendix самой статьи, чтобы посмотреть изображения в оригинале)
Алгоритм можно использовать для генерации картинок высокого разрешения, при всем при этом контент остается довольно когерентным между различными разрешениями!
Основа: Stable Diffusion
(рекомендую зайти на сайт, а так же оценить Appendix самой статьи, чтобы посмотреть изображения в оригинале)
https://fixupx.com/i/status/1803181568451641487
хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
FxTwitter / FixupX
SkalskiP @CVPR2024 🇺🇸 (@skalskip92)
capabilities 1: characters stay consistent across different scenes
🤔3👍1👀1
Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений
Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect
Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect
Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
👍7🔥1🤯1