Pixel Science
478 subscribers
136 photos
53 videos
2 files
106 links
пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Download Telegram
авторы собрали все ключевые слова 😁

Differentiable
Trainable
Wireless
Neural
Ray-Tracing
😁9
Odyssey, привлёкший еще дополнительно 18$ млн решил подойти к проблеме генерации реалистичных 3Д миров (именно 3Д, 3Д) прагматично:
отправить в хайк ребят с качественными панорамными камерами, лидарами, гиростабилизатор и попросить их отсканировать леса, дороги, пещеры и т.д.

весит махина ~12кг с аккумулятором.
зачем?!?...


помните давнюю работу от Интел, Enhancing Photorealism Enhancement, где ученые еще используя устаревшие GANы и датасет с камер машин, смогли добиться "реалистичной" графики в GTA (видео)? к сожалению, штука работает нормально только с похожим контентом, т.е. с трафиком, дорогами и улицами

для решения более сложной задачи нужен более генеральный датасет... вот они его в тупую и собирают 😁

также на сайте представлен очень качественный текст с рассуждением на тему проблем современных Gaussian Splats, NeRFов, Meshей и т.д. утверждают что их цель - найти новое решение, новое представление в 3Д

можно им лишь пожелать удачи! а если кто ищет работу - рекомендую постучаться :)
#индустрия
4🫡21🔥1
Pixel Science
Ben Mildenhall, создатель NeRF-ов, объявил о своем новом стартапе World Labs, который кафаундит вместе с Fei-Fei Li (профессорка Стенфорда, ex-VP Google, "godmother of AI") и с Christoph Lassner. Все три с PhD 😊 Фандинг 230$ млн 🤯🤯🤯 И они хайрят! Им нужны…
This media is not supported in your browser
VIEW IN TELEGRAM
Не прошло и года с момента, как World Labs получили фандинг, а ребята уже выпустили интересные демки с видосами генеративных 3д миров, поддерживающих:
- базовую физику и коллизии
- передвижение камеры
- консистентный мир даже с какими-то отражениями
- освещение сцены искусственным источником света
- depth-based эффекты
- динамические эффекты, анимация, водичка

всё это работает не идеально, т.к. мы все еще наблюдаем:
- странные искажения перспективы
- несоответствие отражений и действительности
- освещение уровня 90ых годов CGI - для искусственного источника света


ставлю на то, что последние две проблемы будет очень сложно разрешить в долгосрок... но кто сказал, что их прям уж и обязательно разрешать для успешного продукта в ближайшем будущем?)

#графон #ии #индустрия
🔥3
Matthias Niessner из TUM организовал разговор от Chief Scientist-ом Luma Labs Jiaming Song, который начался лишь 10 минут назад. Кто хочет - запрыгивайте!

Upd:
Очень рекомендую
- Объясняет мотивацию к использованию фото и видео в качестве основы ИИ, а не 3Д. И почему не полагаемся на ИИ-based 3D рендере

- Кратко объясняет все то, что происходило в сфере за последний год. Приятно видеть все знакомые статьи

- Демонстрирует интересные примеры ИИ-based "light transport" и физики
❤‍🔥41
Ждём такого же подъеба, но в сторону Light Transport Simulation 🫣

но пока, насколько мне известно, никто не обучает модельку, предсказывающую освещение для случайного набора параметров сцены

всё больше данных, демонстрирующий, что классические численные методы просто на просто sucks
5👍1
Чтобы вы понимали почему скорее всего завтра не появится нормальной LLMки, которая будет писать крутые шейдера: для обучения текущих открытых SoTA LLMок используется сотни гигабайт С++ файлов, десятки миллионов Си файлов и т.д.

уже отфильтрованного кода

А с shadertoy, того же, моим коллегам по академии удалось вытащить всего лишь порядка ~200 МБ шейдеров или же 50к файлов

Спасет лишь синтетика
6🫡5
Pixel Science
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели. Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным…
Пока все комментируют интересные особенности опубликованной OpenAI Sora, хочу подметить, что тейк о котором я уже давно писал все еще актуален: Диффузные - flow matching - модели все еще не могут выдерживать геометрическию проекцию

на что также обратил внимание ученый из TTIC


Конечно, если поддать еще больше данных оно наверняка отскалируется. Но, учитывая уже текущие вычислительные вложения, поразительно как сетки все еще не могут успешно проецировать геометрию без искажений 🫠🫠🫠

Или же надо прибегать к 3D inductive-bias через привнесение некого rendering equation. Или biased, как в NeRFах\GSplats, или unbiased как в PBR. Но из этого наследуется столько проблем, что аж страшно себе представить и там генеративные успехи, все еще на "уровне GANов".

В общем, сложна 😕
В последние пара дней в твиттере происходит забавный срач на фоне выхода Sora и ооочень крутой модели text->game от Google (рекомендую оценить если ещё не видели)

Графики решили пообесценивать достижения ИИ-ресерчеров, а те в ответку поиздевались над первыми

А я в этот момент сижу на двух стульях и хохочу с этого небольшого цирка 😁

Но Ben got the point:
Оставаясь чисто рендерщиком в 2024 году, можно и правда повторить судьбу лингвистов в области Natural Language Processing
🥰7
Почему полезно графикам следить за миром фундаментального ИИ?

Я думаю уже все видели самую ожидаемую презентацию Ильи Суцкевера с NIPS 24

Если же нет, то вот рекомендую выделить 20 минут своего времени, т.к. он озвучивает часть мыслей в слух, которые уже витали в воздухе, но многие в них сомневались

Находясь на научном фронтире, благодаря аллоцированным ему ресурсам (~1$ млрд) и его положению, важно что он подтверждает своими словами 2 тейка:
- Данные не растут. У нас всего 1 интернет. И именно он не позволяет отскалироваться современным моделям, полагаясь на pre-training
- Одним из решением может являться Synthetic Data

Что значит Synthetic Data в нашем случаи? Конечно же это рендеры, которые можно использовать для обучения моделей. Безусловно там еще множество фундаментальных проблем, но я бы ожидал всё больше инвестиции в физически-корректные визуализации и автоматизацию создания контента в ближайшие года

И да, Sora, кажется обучалась на Apex, подтверждая теорию выше :)

#ии #графон #индустрия
🤔64
PS5 Pro Technical Seminar

Сони выпустила небольшой доклад про новую архитектуру

Из интересного:
1️⃣ Обход BVH при трассировке лучей стал более хадвеерным - в этом смысле догнали Nvidia

2️⃣ Также подняли проблему дивергенции кода, вызванную тем, что разные лучи одного SIMD могут попасть в разные материалы. Nvidia добавляла сортировку лучей внутри одного SM для смягчение проблемы, но ничего подобного не услышал от Сони. Но, как заявили, "работает быстрее"!

3️⃣ U-Net в качестве собственного DLSS, исполняемого через fully-fused метод для уменьшения memory bottleneck. Из новенького для многих: ребята используют не только L1 кэш для хранения нейронов, но скорее регистры ядер SMа, что дает им 15 МБ с 200 TB/s. Я бы сказал, что это оригинально и никогда про такое не слышал до этого - но я слышал и мои комментарии ограничены подписанным NDA 🤭

#графон #индустрия
🔥7
4️⃣ Сони смогли выжать 300 TOPS int8 для тензорной математики, что ооочень круто! 🔥 Для сравнения RTX 4080 может в 389.9 TOPS соотвественно. Но Сони забили на тензорный fp16 и это грустно, т.к. мы наблюдаем всего лишь 67 TFLOPS fp16, когда у 4080 их 194.9. Т.е. разница обычно в 2х всего лишь, а тут аж в 4.5 :( Проблема в том, что при обучение моделей в реальном времени, как, к примеру, я делаю для нейронного кэша, нам скорее важны fp16. Видно что Сони\АМД в очередной раз жертвуют будущими инновациями в пользу максимизации текущих результатов (U-Net исполняется в режиме int8)

В общем прогресс идет, Сони так или иначе молодцы, дорожка верная, но хотелось бы больше инноваций, а не повторение за Нвидиа

#графон #индустрия #ии
🔥7
Accepted, Eurographics 2025!
Так ну статья по нейронному рендеру наконец официально прошла, теперь подаваться ещё на визу в UK, т.к. конфа уже в мае в Лондоне. Про саму работу подробно напишу, как сделаем официальный анонс, но уверяю вас что вам понравится. Безумно прикладная и одновременно - как я верую - несущий очень долгосрочный вклад. За последнее спасибо одному коллеге, ex-Weta Аватар 1 и 2, обрисовывавшему картину развития кинорендера в последние десятки лет 😊
- игры очевидно идут туда же

На днях ещё наверное поделюсь новостью про США - хотя может получится продавить Германию - и ФААНГ, но жду итогового подтверждения. Но 25ый год выйдет супер интересным, особенно если получится ещё на Siggraph/Asia 25 отправить кое-что

#обомне@pixels_science
🔥223🥰2🤩1
считаю это прекрасным окончанием 2024го ресёрч-года 🥳

всем спасибо!

P.s. больше всего радуюсь от ученого-наставника. вы его работы наверняка читали, потребляли и даже возможно видели в ААА проектах

#обомне@pixels_science
🎄22❤‍🔥10🔥6🎉4
Можно ли применить Inference-Time Scaling не только для улучшения LLM - как было с o1 - но и для генерации изображений?

Именно такой вопрос проресёрчили ребята из Гугл, NYU и MIT, и оказалось что ответ: да, можно, и приводит к успеху

Напомню на чём строится идея за этим направлением в общих чертах:
1️⃣ У нас есть проблемы с обучением ИИ, которые решают задачи с 100% точностью end-to-end
2️⃣ Но мы неплохо продвинулись в вопросе верификации ответов

Разница: легко научиться понимать вкусный ли торт, но в разы сложнее научиться его печь с нуля

Поэтому, мы можем, используя всякие метрики: CLIP/DINO/FID/IS, проверять насколько сгенерированное изображение соответствует запросу и выбирать лучшее из всех попыток - Random Search

Или пойти дальше и по пути генерации пикчи - решения ODE/интегрирования - заглядывать немного в будущее и смотреть какие шумы приведут к каким результатам и выбирать лучший путь - Search over Paths

Имхо, очень любопытно. Но можно ли эту мысль перепроецировать на рендеринг? 🤔🤔
#ии #статья
🔥3👍2
Nvidia наконец опубликовала whitepaper по Blackwell архитектуре, которую я не комментировал публично без оф. данных

Из интересного (сравнение 4090 vs 5090):

1️⃣ "Built for Neural Rendering". NRC, Neural BSDF, DLSS и т.д.

Значит направление моего ресерча всё же выбрано верно (последняя статья прям об этом, где мы обошли NRC) 😎
Добавили вызов нейронных шейдеров в трассировке через SER, на что был и правда запрос. Еще и ускорили его в 2х🔥

2️⃣ Безумный рост bandwidth в 1.7x. Для контекста - это главное бутылочное горлышка почти всех use-case-ов, и оно долго стагнировало

3️⃣ Рост TFLOPs и тензорных и обычных на ~27%. Также добавили fp4 для ИИ, позволяющий втиснуться в VRAM и предоставляющий 2х TFLOPS (аж 1.6 PFLOPS 🤯)

4️⃣ Nanite для RTX c кластерными ускоряющими структурами (CLAS), разделением TLAS на подблоки для статики\динамики, спец. геометрии для волос и управлением через GPU

имхо, прекрасное поколение и по сухим техническим данным! Пиарить просто не стоило так нагло 😉

#ии #индустрия #графон
🔥8👎1