https://fixupx.com/i/status/1803181568451641487
хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
FxTwitter / FixupX
SkalskiP @CVPR2024 🇺🇸 (@skalskip92)
capabilities 1: characters stay consistent across different scenes
🤔3👍1👀1
Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений
Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect
Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect
Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
👍7🔥1🤯1
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели.
Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.
Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.
Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.
P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.
Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.
Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.
Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.
P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.
👍3🔥1🤯1
Pixel Science
https://fixupx.com/i/status/1803181568451641487 хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше…
This media is not supported in your browser
VIEW IN TELEGRAM
ещё один интересный пример, демонстрирующий что text->video может исполнять роль ограниченного (возможно лишь пока...) 3Д движка, на основе китайской модели Kling
проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее
проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure
Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats
Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥
Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.
Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.
Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.
(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)
Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats
Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥
Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.
Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.
Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.
(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)
🤯2👍1🔥1
Pixel Science
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure Идея в том, что вместо гридов…
Это тот самый момент, когда я рад видеть статью, разрешившую часть задач, которыми я сейчас занимаюсь 😁. Просто в связи с тем, что раз таааакие крутые авторы бросились копать в это направление, значит и я не дурак, что потратил последние недели на то чтобы разобраться с Larsen’s Generalized Boltzmann Equation. Larsens GBE - это генеральный случай Radiative Transfer Equation, т.к. последний вводит ряд предположений, которые отрицательно влияют на качество итоговых рендеров как раз таки в представленных выше кейсах)
Для интересующихся полезные ссылки на эту тему:
1 2 3
Для интересующихся полезные ссылки на эту тему:
1 2 3
Pixel Science
Началось HPG 2024 Student Real-Time Competition, где за лучшие шейдера обычно раздают бесплатно видеокарты/денежки (до $1к) и прочие плюшки! Возможно будут очки VR Quest 3 в этом году, раз главным спонсором является Meta 😊 прикольная строчка в резюме, а закодить…
https://fixupx.com/HPG_Conf/status/1807818683324289469
объявлены призы в виде Meta Quest 3 и RTX 4080 за лучшие шейдера. победитель выбирает, что ему больше понравится!
напоминаю что 19го июля дедлайн
объявлены призы в виде Meta Quest 3 и RTX 4080 за лучшие шейдера. победитель выбирает, что ему больше понравится!
напоминаю что 19го июля дедлайн
FxTwitter / FixupX
High-Perf Graphics (@HPG_Conf)
📢Thrilled to announce that the #HPG2024 student competition will have two incredible prizes up for grabs! 🎁A Meta Quest 3 and 🎁an NVIDIA GeForce 4080, first-place winner gets their choice! Don’t miss out – check the rules and submit your entries now! htt…
❤2🔥2
Неплохой пример, сделанный на коленках, как можно из text->video получить 3Д сцену через гауссианы, а после походить в ней в ARе
by LumaLabs
теперь осталось их сделать PBRными и заживём 👌
by LumaLabs
теперь осталось их сделать PBRными и заживём 👌
👾5🤯3
Synthesia опять удивляют своими разработками. Они обучили ИИ, генерирующего персональные аватары всего лишь на основе фоток с телефона\вебки юзеров
Аватары очень хороши в эмоции, умеют махать руками, активно двигаться, а также разговаривают на 30 языках.
Также обещают:
- автоматическую генерацию видео по контенту сайта\документа. к примеру для FAQ. сработает ли для лекциями 🤔🤔🤔
- умный захват экрана, который фокусируется на важном контенте. полезно для стримеров\ютуберов
- автоматический перевод видео с его контентом. я не понял можно ли будет воспользоваться их сервисов для любого видео. было бы слаавно
у компании есть шанс феноменально демократизировать доступ к информации для зрителей. и что ещё важнее, это дает возможность блогерам, инфлуенсерам и преподам выйти на любую аудиторию, забыв про языковые барьеры и снизив косты на продакшен.
горжусь тем, что знаю одно из фаундеров лично и ребята демонстрируют крутейшую коллаборацию науки с бизнесом. не часто встретишь успешные немецкие стартапы
Аватары очень хороши в эмоции, умеют махать руками, активно двигаться, а также разговаривают на 30 языках.
Также обещают:
- автоматическую генерацию видео по контенту сайта\документа. к примеру для FAQ. сработает ли для лекциями 🤔🤔🤔
- умный захват экрана, который фокусируется на важном контенте. полезно для стримеров\ютуберов
- автоматический перевод видео с его контентом. я не понял можно ли будет воспользоваться их сервисов для любого видео. было бы слаавно
у компании есть шанс феноменально демократизировать доступ к информации для зрителей. и что ещё важнее, это дает возможность блогерам, инфлуенсерам и преподам выйти на любую аудиторию, забыв про языковые барьеры и снизив косты на продакшен.
горжусь тем, что знаю одно из фаундеров лично и ребята демонстрируют крутейшую коллаборацию науки с бизнесом. не часто встретишь успешные немецкие стартапы
https://x.com/Mishok2000/status/1809262724485992749
очень рекомендую потребить talk c CVPR на эту тему
очень рекомендую потребить talk c CVPR на эту тему
👍👍👍
я бы лишь подметил, что за предсказанием "AGI за 5 лет" стоит некая научная доказательная база, но не ясно насколько она отображает именно глобальный, а не локальный тренд успешности скалирования AR-LLM
с CGI никакие исследования не утверждали, что с добавлением "линейно" компьюта и памяти, наши рендеры будут сами по себе становится реалистичнее
я бы лишь подметил, что за предсказанием "AGI за 5 лет" стоит некая научная доказательная база, но не ясно насколько она отображает именно глобальный, а не локальный тренд успешности скалирования AR-LLM
с CGI никакие исследования не утверждали, что с добавлением "линейно" компьюта и памяти, наши рендеры будут сами по себе становится реалистичнее
Шок. Гауссианы выебали JPEG по скорости декодирования изображения при низком битрейте. Аж под 1000-2000 FPS.😱😱😱
В сухую обогнали все SOTA нейронные методы по PSNR/Decoding time, на основе multi-level hash-encodings, SIREN и прочего.
пока лишь проблема это время кодирования изображения + отсутствие по-пиксельного random access-а. было бы полезненько для текстур конечно.
Проект + код
В сухую обогнали все SOTA нейронные методы по PSNR/Decoding time, на основе multi-level hash-encodings, SIREN и прочего.
пока лишь проблема это время кодирования изображения + отсутствие по-пиксельного random access-а. было бы полезненько для текстур конечно.
Проект + код
🔥2❤🔥1👍1
Онлайн-программа для начинающих графических инженеров от Chaos
Волна на 2024ый год уже прошла, но возможно на следующую весну-лето кто-то хочет запланировать себе доп обучение.
можно подаваться всем кто старше 18 лет и находится в Болгарии, Чехии, Дании и Германии (хз как валидируют локацию). Местоположение обосновано исключительно тем, что они нанимают лучших студентов на джуниор позиции к себе в штат.
хэдквартерс у них вообще в моём городе, Карлсруэ, - только сегодня узнал об этом от своего дипломника, который проходит этот самый курс. фидбек исключительно положительный, только говорит что как-то легко 😅
Волна на 2024ый год уже прошла, но возможно на следующую весну-лето кто-то хочет запланировать себе доп обучение.
можно подаваться всем кто старше 18 лет и находится в Болгарии, Чехии, Дании и Германии (хз как валидируют локацию). Местоположение обосновано исключительно тем, что они нанимают лучших студентов на джуниор позиции к себе в штат.
хэдквартерс у них вообще в моём городе, Карлсруэ, - только сегодня узнал об этом от своего дипломника, который проходит этот самый курс. фидбек исключительно положительный, только говорит что как-то легко 😅
🤩2🔥1🤔1