Pixel Science
478 subscribers
136 photos
53 videos
2 files
106 links
пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Download Telegram
Luma Labs анонсировали свою модельку text -> video, Dream Machine!

Заявляют что 120 кадровое видео могут сгенерировать всего за 120 секунд, 1 сек/кадр. Звучит ооочень амбициозно, но проверить сложно -> кажется у них сайт перестал выдавать видосы :( перегрузили, но так попробовать может каждый бесплатно

Но предварительно результаты выглядят оооочень сочно, а также ребята указали ограничения своей модели на сайте. За что им отдельно респект 😉

Хоть и стартап изначально был создан для решения проблемы Novel View Synthesis (меня туда звучали ещё в 22ом году, так что за +- картина была понятно), nerf-ы, гауссианы все дела... Ребята решили расшить зону ресерча. И, имхо, это верное решение -> теперь у них есть своя "world model", которой они могут воспользоваться для text -> 3D генерации/novel view synthesis regularization. Круты!
This media is not supported in your browser
VIEW IN TELEGRAM
Кажется в особенности данный пример демонстрирует возможности text->video Dream Machine генерировать кадры, которые мы бы ожидали от супер реалистичного игрового рендера какого-то шутера.

Пока не понятно, что значит 120 second per 120 frames, на каком железе и т.д. но всего месяц назад я предполагал что генеративки являются угрозой лишь для рынка оффлайн рендера, но сейчас допускаю конкуренцию в будущем и на рынке реал тайм решений.

но вопрос контроля за тем, что происходит в сцене и как оно должно быть визуализировано. и конечно нам также нужны физические представления объектов. чтобы трекать коллизии пуль, как пример

но очень интересно.... надо думать как это все "соединить" 🤔🤔🤔
😁1
Image Neural Field Diffusion Models, диффузка генерирует латентное представление, которые определяет плавное, а не дискретное, изображение

Алгоритм можно использовать для генерации картинок высокого разрешения, при всем при этом контент остается довольно когерентным между различными разрешениями!

Основа: Stable Diffusion

(рекомендую зайти на сайт, а так же оценить Appendix самой статьи, чтобы посмотреть изображения в оригинале)
https://fixupx.com/i/status/1803181568451641487

хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
🤔3👍1👀1
Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений

Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect

Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
👍7🔥1🤯1
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели.

Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.

Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.


Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.

P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.
👍3🔥1🤯1
Pixel Science
https://fixupx.com/i/status/1803181568451641487 хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше…
This media is not supported in your browser
VIEW IN TELEGRAM
ещё один интересный пример, демонстрирующий что text->video может исполнять роль ограниченного (возможно лишь пока...) 3Д движка, на основе китайской модели Kling

проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure

Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats

Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥


Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.

Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.

Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.

(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)
🤯2👍1🔥1
Pixel Science
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure Идея в том, что вместо гридов…
Это тот самый момент, когда я рад видеть статью, разрешившую часть задач, которыми я сейчас занимаюсь 😁. Просто в связи с тем, что раз таааакие крутые авторы бросились копать в это направление, значит и я не дурак, что потратил последние недели на то чтобы разобраться с Larsen’s Generalized Boltzmann Equation. Larsens GBE - это генеральный случай Radiative Transfer Equation, т.к. последний вводит ряд предположений, которые отрицательно влияют на качество итоговых рендеров как раз таки в представленных выше кейсах)
Для интересующихся полезные ссылки на эту тему:
1 2 3
Неплохой пример, сделанный на коленках, как можно из text->video получить 3Д сцену через гауссианы, а после походить в ней в ARе

by LumaLabs

теперь осталось их сделать PBRными и заживём 👌
👾5🤯3
Synthesia опять удивляют своими разработками. Они обучили ИИ, генерирующего персональные аватары всего лишь на основе фоток с телефона\вебки юзеров

Аватары очень хороши в эмоции, умеют махать руками, активно двигаться, а также разговаривают на 30 языках.

Также обещают:
- автоматическую генерацию видео по контенту сайта\документа. к примеру для FAQ. сработает ли для лекциями 🤔🤔🤔

- умный захват экрана, который фокусируется на важном контенте. полезно для стримеров\ютуберов

- автоматический перевод видео с его контентом. я не понял можно ли будет воспользоваться их сервисов для любого видео. было бы слаавно

у компании есть шанс феноменально демократизировать доступ к информации для зрителей. и что ещё важнее, это дает возможность блогерам, инфлуенсерам и преподам выйти на любую аудиторию, забыв про языковые барьеры и снизив косты на продакшен.

горжусь тем, что знаю одно из фаундеров лично и ребята демонстрируют крутейшую коллаборацию науки с бизнесом. не часто встретишь успешные немецкие стартапы