Pixel Science
478 subscribers
136 photos
53 videos
2 files
106 links
пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Download Telegram
https://fixupx.com/i/status/1803181568451641487

хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
🤔3👍1👀1
Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений

Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect

Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
👍7🔥1🤯1
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели.

Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.

Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.


Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.

P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.
👍3🔥1🤯1
Pixel Science
https://fixupx.com/i/status/1803181568451641487 хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше…
This media is not supported in your browser
VIEW IN TELEGRAM
ещё один интересный пример, демонстрирующий что text->video может исполнять роль ограниченного (возможно лишь пока...) 3Д движка, на основе китайской модели Kling

проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure

Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats

Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥


Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.

Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.

Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.

(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)
🤯2👍1🔥1
Pixel Science
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure Идея в том, что вместо гридов…
Это тот самый момент, когда я рад видеть статью, разрешившую часть задач, которыми я сейчас занимаюсь 😁. Просто в связи с тем, что раз таааакие крутые авторы бросились копать в это направление, значит и я не дурак, что потратил последние недели на то чтобы разобраться с Larsen’s Generalized Boltzmann Equation. Larsens GBE - это генеральный случай Radiative Transfer Equation, т.к. последний вводит ряд предположений, которые отрицательно влияют на качество итоговых рендеров как раз таки в представленных выше кейсах)
Для интересующихся полезные ссылки на эту тему:
1 2 3
Неплохой пример, сделанный на коленках, как можно из text->video получить 3Д сцену через гауссианы, а после походить в ней в ARе

by LumaLabs

теперь осталось их сделать PBRными и заживём 👌
👾5🤯3
Synthesia опять удивляют своими разработками. Они обучили ИИ, генерирующего персональные аватары всего лишь на основе фоток с телефона\вебки юзеров

Аватары очень хороши в эмоции, умеют махать руками, активно двигаться, а также разговаривают на 30 языках.

Также обещают:
- автоматическую генерацию видео по контенту сайта\документа. к примеру для FAQ. сработает ли для лекциями 🤔🤔🤔

- умный захват экрана, который фокусируется на важном контенте. полезно для стримеров\ютуберов

- автоматический перевод видео с его контентом. я не понял можно ли будет воспользоваться их сервисов для любого видео. было бы слаавно

у компании есть шанс феноменально демократизировать доступ к информации для зрителей. и что ещё важнее, это дает возможность блогерам, инфлуенсерам и преподам выйти на любую аудиторию, забыв про языковые барьеры и снизив косты на продакшен.

горжусь тем, что знаю одно из фаундеров лично и ребята демонстрируют крутейшую коллаборацию науки с бизнесом. не часто встретишь успешные немецкие стартапы
https://x.com/Mishok2000/status/1809262724485992749

очень рекомендую потребить talk c CVPR на эту тему
когда авторы ресёрча не опубликовали никакой код, никаких открытых данных, и приходится воспроизводить их работу, валидируя свою имплементацию "на глаз" с помощью картинок котиков из оригинальной статьи 😁
🥰5🤔2
👍👍👍

я бы лишь подметил, что за предсказанием "AGI за 5 лет" стоит некая научная доказательная база, но не ясно насколько она отображает именно глобальный, а не локальный тренд успешности скалирования AR-LLM

с CGI никакие исследования не утверждали, что с добавлением "линейно" компьюта и памяти, наши рендеры будут сами по себе становится реалистичнее
Шок. Гауссианы выебали JPEG по скорости декодирования изображения при низком битрейте. Аж под 1000-2000 FPS.😱😱😱

В сухую обогнали все SOTA нейронные методы по PSNR/Decoding time, на основе multi-level hash-encodings, SIREN и прочего.

пока лишь проблема это время кодирования изображения + отсутствие по-пиксельного random access-а. было бы полезненько для текстур конечно.

Проект + код
🔥2❤‍🔥1👍1
Онлайн-программа для начинающих графических инженеров от Chaos

Волна на 2024ый год уже прошла, но возможно на следующую весну-лето кто-то хочет запланировать себе доп обучение.

можно подаваться всем кто старше 18 лет и находится в Болгарии, Чехии, Дании и Германии (хз как валидируют локацию). Местоположение обосновано исключительно тем, что они нанимают лучших студентов на джуниор позиции к себе в штат.

хэдквартерс у них вообще в моём городе, Карлсруэ, - только сегодня узнал об этом от своего дипломника, который проходит этот самый курс. фидбек исключительно положительный, только говорит что как-то легко 😅
🤩2🔥1🤔1