Pixel Science
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели. Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным…
Пока все комментируют интересные особенности опубликованной OpenAI Sora, хочу подметить, что тейк о котором я уже давно писал все еще актуален: Диффузные - flow matching - модели все еще не могут выдерживать геометрическию проекцию
на что также обратил внимание ученый из TTIC
Конечно, если поддать еще больше данных оно наверняка отскалируется. Но, учитывая уже текущие вычислительные вложения, поразительно как сетки все еще не могут успешно проецировать геометрию без искажений 🫠🫠🫠
Или же надо прибегать к 3D inductive-bias через привнесение некого rendering equation. Или biased, как в NeRFах\GSplats, или unbiased как в PBR. Но из этого наследуется столько проблем, что аж страшно себе представить и там генеративные успехи, все еще на "уровне GANов".
В общем, сложна 😕
на что также обратил внимание ученый из TTIC
Конечно, если поддать еще больше данных оно наверняка отскалируется. Но, учитывая уже текущие вычислительные вложения, поразительно как сетки все еще не могут успешно проецировать геометрию без искажений 🫠🫠🫠
Или же надо прибегать к 3D inductive-bias через привнесение некого rendering equation. Или biased, как в NeRFах\GSplats, или unbiased как в PBR. Но из этого наследуется столько проблем, что аж страшно себе представить и там генеративные успехи, все еще на "уровне GANов".
В общем, сложна 😕
В последние пара дней в твиттере происходит забавный срач на фоне выхода Sora и ооочень крутой модели text->game от Google (рекомендую оценить если ещё не видели)
Графики решили пообесценивать достижения ИИ-ресерчеров, а те в ответку поиздевались над первыми
А я в этот момент сижу на двух стульях и хохочу с этого небольшого цирка 😁
Но Ben got the point:
Графики решили пообесценивать достижения ИИ-ресерчеров, а те в ответку поиздевались над первыми
А я в этот момент сижу на двух стульях и хохочу с этого небольшого цирка 😁
Но Ben got the point:
Оставаясь чисто рендерщиком в 2024 году, можно и правда повторить судьбу лингвистов в области Natural Language Processing
🥰7
Почему полезно графикам следить за миром фундаментального ИИ?
Я думаю уже все видели самую ожидаемую презентацию Ильи Суцкевера с NIPS 24
Если же нет, то вот рекомендую выделить 20 минут своего времени, т.к. он озвучивает часть мыслей в слух, которые уже витали в воздухе, но многие в них сомневались
Находясь на научном фронтире, благодаря аллоцированным ему ресурсам (~1$ млрд) и его положению, важно что он подтверждает своими словами 2 тейка:
- Данные не растут. У нас всего 1 интернет. И именно он не позволяет отскалироваться современным моделям, полагаясь на pre-training
- Одним из решением может являться Synthetic Data
Что значит Synthetic Data в нашем случаи? Конечно же это рендеры, которые можно использовать для обучения моделей. Безусловно там еще множество фундаментальных проблем, но я бы ожидал всё больше инвестиции в физически-корректные визуализации и автоматизацию создания контента в ближайшие года
И да, Sora, кажется обучалась на Apex, подтверждая теорию выше :)
#ии #графон #индустрия
Я думаю уже все видели самую ожидаемую презентацию Ильи Суцкевера с NIPS 24
Если же нет, то вот рекомендую выделить 20 минут своего времени, т.к. он озвучивает часть мыслей в слух, которые уже витали в воздухе, но многие в них сомневались
Находясь на научном фронтире, благодаря аллоцированным ему ресурсам (~1$ млрд) и его положению, важно что он подтверждает своими словами 2 тейка:
- Данные не растут. У нас всего 1 интернет. И именно он не позволяет отскалироваться современным моделям, полагаясь на pre-training
- Одним из решением может являться Synthetic Data
Что значит Synthetic Data в нашем случаи? Конечно же это рендеры, которые можно использовать для обучения моделей. Безусловно там еще множество фундаментальных проблем, но я бы ожидал всё больше инвестиции в физически-корректные визуализации и автоматизацию создания контента в ближайшие года
И да, Sora, кажется обучалась на Apex, подтверждая теорию выше :)
#ии #графон #индустрия
🤔6❤4
PS5 Pro Technical Seminar
Сони выпустила небольшой доклад про новую архитектуру
Из интересного:
1️⃣ Обход BVH при трассировке лучей стал более хадвеерным - в этом смысле догнали Nvidia
2️⃣ Также подняли проблему дивергенции кода, вызванную тем, что разные лучи одного SIMD могут попасть в разные материалы. Nvidia добавляла сортировку лучей внутри одного SM для смягчение проблемы, но ничего подобного не услышал от Сони. Но, как заявили, "работает быстрее"!
3️⃣ U-Net в качестве собственного DLSS, исполняемого через fully-fused метод для уменьшения memory bottleneck. Из новенького для многих: ребята используют не только L1 кэш для хранения нейронов, но скорее регистры ядер SMа, что дает им 15 МБ с 200 TB/s. Я бы сказал, что это оригинально и никогда про такое не слышал до этого - но я слышал и мои комментарии ограничены подписанным NDA 🤭
#графон #индустрия
Сони выпустила небольшой доклад про новую архитектуру
Из интересного:
1️⃣ Обход BVH при трассировке лучей стал более хадвеерным - в этом смысле догнали Nvidia
2️⃣ Также подняли проблему дивергенции кода, вызванную тем, что разные лучи одного SIMD могут попасть в разные материалы. Nvidia добавляла сортировку лучей внутри одного SM для смягчение проблемы, но ничего подобного не услышал от Сони. Но, как заявили, "работает быстрее"!
3️⃣ U-Net в качестве собственного DLSS, исполняемого через fully-fused метод для уменьшения memory bottleneck. Из новенького для многих: ребята используют не только L1 кэш для хранения нейронов, но скорее регистры ядер SMа, что дает им 15 МБ с 200 TB/s. Я бы сказал, что это оригинально и никогда про такое не слышал до этого - но я слышал и мои комментарии ограничены подписанным NDA 🤭
#графон #индустрия
🔥7
4️⃣ Сони смогли выжать 300 TOPS int8 для тензорной математики, что ооочень круто! 🔥 Для сравнения RTX 4080 может в 389.9 TOPS соотвественно. Но Сони забили на тензорный fp16 и это грустно, т.к. мы наблюдаем всего лишь 67 TFLOPS fp16, когда у 4080 их 194.9. Т.е. разница обычно в 2х всего лишь, а тут аж в 4.5 :( Проблема в том, что при обучение моделей в реальном времени, как, к примеру, я делаю для нейронного кэша, нам скорее важны fp16. Видно что Сони\АМД в очередной раз жертвуют будущими инновациями в пользу максимизации текущих результатов (U-Net исполняется в режиме int8)
В общем прогресс идет, Сони так или иначе молодцы, дорожка верная, но хотелось бы больше инноваций, а не повторение за Нвидиа
#графон #индустрия #ии
В общем прогресс идет, Сони так или иначе молодцы, дорожка верная, но хотелось бы больше инноваций, а не повторение за Нвидиа
#графон #индустрия #ии
🔥7
Accepted, Eurographics 2025!
Так ну статья по нейронному рендеру наконец официально прошла, теперь подаваться ещё на визу в UK, т.к. конфа уже в мае в Лондоне. Про саму работу подробно напишу, как сделаем официальный анонс, но уверяю вас что вам понравится. Безумно прикладная и одновременно - как я верую - несущий очень долгосрочный вклад. За последнее спасибо одному коллеге, ex-Weta Аватар 1 и 2, обрисовывавшему картину развития кинорендера в последние десятки лет 😊
- игры очевидно идут туда же
На днях ещё наверное поделюсь новостью про США - хотя может получится продавить Германию - и ФААНГ, но жду итогового подтверждения. Но 25ый год выйдет супер интересным, особенно если получится ещё на Siggraph/Asia 25 отправить кое-что ✨
#обомне@pixels_science
Так ну статья по нейронному рендеру наконец официально прошла, теперь подаваться ещё на визу в UK, т.к. конфа уже в мае в Лондоне. Про саму работу подробно напишу, как сделаем официальный анонс, но уверяю вас что вам понравится. Безумно прикладная и одновременно - как я верую - несущий очень долгосрочный вклад. За последнее спасибо одному коллеге, ex-Weta Аватар 1 и 2, обрисовывавшему картину развития кинорендера в последние десятки лет 😊
- игры очевидно идут туда же
На днях ещё наверное поделюсь новостью про США - хотя может получится продавить Германию - и ФААНГ, но жду итогового подтверждения. Но 25ый год выйдет супер интересным, особенно если получится ещё на Siggraph/Asia 25 отправить кое-что ✨
#обомне@pixels_science
🔥22❤3🥰2🤩1
считаю это прекрасным окончанием 2024го ресёрч-года 🥳
всем спасибо!
P.s. больше всего радуюсь от ученого-наставника. вы его работы наверняка читали, потребляли и даже возможно видели в ААА проектах
#обомне@pixels_science
всем спасибо!
P.s. больше всего радуюсь от ученого-наставника. вы его работы наверняка читали, потребляли и даже возможно видели в ААА проектах
#обомне@pixels_science
🎄22❤🔥10🔥6🎉4
Можно ли применить Inference-Time Scaling не только для улучшения LLM - как было с o1 - но и для генерации изображений?
Именно такой вопрос проресёрчили ребята из Гугл, NYU и MIT, и оказалось что ответ: да, можно, и приводит к успеху
Напомню на чём строится идея за этим направлением в общих чертах:
1️⃣ У нас есть проблемы с обучением ИИ, которые решают задачи с 100% точностью end-to-end
2️⃣ Но мы неплохо продвинулись в вопросе верификации ответов
Разница: легко научиться понимать вкусный ли торт, но в разы сложнее научиться его печь с нуля
Поэтому, мы можем, используя всякие метрики: CLIP/DINO/FID/IS, проверять насколько сгенерированное изображение соответствует запросу и выбирать лучшее из всех попыток - Random Search
Или пойти дальше и по пути генерации пикчи - решения ODE/интегрирования - заглядывать немного в будущее и смотреть какие шумы приведут к каким результатам и выбирать лучший путь - Search over Paths
Имхо, очень любопытно. Но можно ли эту мысль перепроецировать на рендеринг? 🤔🤔
#ии #статья
Именно такой вопрос проресёрчили ребята из Гугл, NYU и MIT, и оказалось что ответ: да, можно, и приводит к успеху
Напомню на чём строится идея за этим направлением в общих чертах:
1️⃣ У нас есть проблемы с обучением ИИ, которые решают задачи с 100% точностью end-to-end
2️⃣ Но мы неплохо продвинулись в вопросе верификации ответов
Разница: легко научиться понимать вкусный ли торт, но в разы сложнее научиться его печь с нуля
Поэтому, мы можем, используя всякие метрики: CLIP/DINO/FID/IS, проверять насколько сгенерированное изображение соответствует запросу и выбирать лучшее из всех попыток - Random Search
Или пойти дальше и по пути генерации пикчи - решения ODE/интегрирования - заглядывать немного в будущее и смотреть какие шумы приведут к каким результатам и выбирать лучший путь - Search over Paths
Имхо, очень любопытно. Но можно ли эту мысль перепроецировать на рендеринг? 🤔🤔
#ии #статья
🔥3👍2
Nvidia наконец опубликовала whitepaper по Blackwell архитектуре, которую я не комментировал публично без оф. данных
Из интересного (сравнение 4090 vs 5090):
1️⃣ "Built for Neural Rendering". NRC, Neural BSDF, DLSS и т.д.
Значит направление моего ресерча всё же выбрано верно (последняя статья прям об этом, где мы обошли NRC) 😎
Добавили вызов нейронных шейдеров в трассировке через SER, на что был и правда запрос. Еще и ускорили его в 2х🔥
2️⃣ Безумный рост bandwidth в 1.7x. Для контекста - это главное бутылочное горлышка почти всех use-case-ов, и оно долго стагнировало
3️⃣ Рост TFLOPs и тензорных и обычных на ~27%. Также добавили fp4 для ИИ, позволяющий втиснуться в VRAM и предоставляющий 2х TFLOPS (аж 1.6 PFLOPS 🤯)
4️⃣ Nanite для RTX c кластерными ускоряющими структурами (CLAS), разделением TLAS на подблоки для статики\динамики, спец. геометрии для волос и управлением через GPU
имхо, прекрасное поколение и по сухим техническим данным! Пиарить просто не стоило так нагло 😉
#ии #индустрия #графон
Из интересного (сравнение 4090 vs 5090):
1️⃣ "Built for Neural Rendering". NRC, Neural BSDF, DLSS и т.д.
Значит направление моего ресерча всё же выбрано верно (последняя статья прям об этом, где мы обошли NRC) 😎
Добавили вызов нейронных шейдеров в трассировке через SER, на что был и правда запрос. Еще и ускорили его в 2х🔥
2️⃣ Безумный рост bandwidth в 1.7x. Для контекста - это главное бутылочное горлышка почти всех use-case-ов, и оно долго стагнировало
3️⃣ Рост TFLOPs и тензорных и обычных на ~27%. Также добавили fp4 для ИИ, позволяющий втиснуться в VRAM и предоставляющий 2х TFLOPS (аж 1.6 PFLOPS 🤯)
4️⃣ Nanite для RTX c кластерными ускоряющими структурами (CLAS), разделением TLAS на подблоки для статики\динамики, спец. геометрии для волос и управлением через GPU
имхо, прекрасное поколение и по сухим техническим данным! Пиарить просто не стоило так нагло 😉
#ии #индустрия #графон
🔥8👎1
В связи с тем, что DLSS 4.0 на основе трансформеров также был зарелизнут, многие работающие в графике задались вопросом как далеко всё это может продвинуться
Мало того, что мы скалируем 720p изображение в 1080p/4K, и вместо "16 путей света/пиксель семплируем лишь 1", так теперь еще и предсказываем аж 3 кадра во временном пространстве
Тем самым ИИ предсказывает аж 15 пикселей из 16, или же 240 путей света из 256 🤯
Где предел? Да чёрт его знает 😅, но я бы смотрел через призму Neural Scale Law, утверждающего что в определенный момент придется делать DLSS в 10х тяжелее, чтобы качество выросло аж на 10% (см. графики)
Очевидно Нвидиа использует многие ИИ-хаки (Дистилляция, Квантизация), чтобы эти кривые роста костов немного сместить, но подход не долгосрочный и до 1 битной точности осталось небольшое окно (сейчас 4-8 бит afaik)
Чего с этими знаниями делать? Да пусть каждый решает сам, но важно держать данный контекст если задумываетесь как можно еще сильнее графон продвинуть вперёд)
#ии #графон #индустрия
Мало того, что мы скалируем 720p изображение в 1080p/4K, и вместо "16 путей света/пиксель семплируем лишь 1", так теперь еще и предсказываем аж 3 кадра во временном пространстве
Тем самым ИИ предсказывает аж 15 пикселей из 16, или же 240 путей света из 256 🤯
Где предел? Да чёрт его знает 😅, но я бы смотрел через призму Neural Scale Law, утверждающего что в определенный момент придется делать DLSS в 10х тяжелее, чтобы качество выросло аж на 10% (см. графики)
Очевидно Нвидиа использует многие ИИ-хаки (Дистилляция, Квантизация), чтобы эти кривые роста костов немного сместить, но подход не долгосрочный и до 1 битной точности осталось небольшое окно (сейчас 4-8 бит afaik)
Чего с этими знаниями делать? Да пусть каждый решает сам, но важно держать данный контекст если задумываетесь как можно еще сильнее графон продвинуть вперёд)
#ии #графон #индустрия
👍4
Супер краткое введение в реал-тайм паф трейсинг на вулкане с glsl от Кристофа Питерса в рамках его лекций в TU Delft
Курс состоит всего из двух видосов по часу и к нему полагается готовая неперегруженная кодовая база
За автора могу ручаться. Это мой бывший коллега по Интелу, которого вы можете знать по Moment-Based Shadows\Order-Independent Transparency, ASVGF и его прошлогодней работе, объединяющей Nanite и RTX, об имплементации идей которой я писал совсем недавно
#графон #карьера
Курс состоит всего из двух видосов по часу и к нему полагается готовая неперегруженная кодовая база
За автора могу ручаться. Это мой бывший коллега по Интелу, которого вы можете знать по Moment-Based Shadows\Order-Independent Transparency, ASVGF и его прошлогодней работе, объединяющей Nanite и RTX, об имплементации идей которой я писал совсем недавно
#графон #карьера
🤩14🔥5👍2⚡1
Не проплаченная - а жаль - реклама вакансий:
- Позиция на Senior-Staff Graphics Engineer (Vulkan, Low-Level). Надо будет работать над АР-очками в одной известной компании
- Знакомые фаундеры из Лондона подняли очередной раунд и ищут спецов по дифференциальному\обратному рендеру. Работают над очень крутыми штуками
Писать в лс. Возможно поможем друг другу 😉
- Позиция на Senior-Staff Graphics Engineer (Vulkan, Low-Level). Надо будет работать над АР-очками в одной известной компании
- Знакомые фаундеры из Лондона подняли очередной раунд и ищут спецов по дифференциальному\обратному рендеру. Работают над очень крутыми штуками
Писать в лс. Возможно поможем друг другу 😉
🔥4
Интересный анализ по Nvidia от Epoch AI
Там очень много данных, советую самому в них покопаться. там найдете супер полезные инсайды если вы занимаетесь ресерчерем, строите бизнес, инвестируете или просто вам полезно знать куда движутся тренды
То, что я нашел для себя довольно интересным:
1️⃣ Начиная с 2019 в среднем хватает всего 10ти месяцев для удвоению введенных в эксплуатацию Compute GPU FLOPS во всем мире
2️⃣ Соответственно в среднем годовой рост составляет 2.3х, в то же время спрос на вычисления для обучения фронтирных моделей растет в 4-5х -> "упираемся" в скалируемость по железу
3️⃣ В среднем переход от FP32 к INT8 дал 12х буст в compute - а не 4x как можно было бы предположить. У H100 разница вообще в 59 раз 🤯
4️⃣ Компьют дешевеет на 30%/год. Стоимость человеческого труда же только растет...
#индустрия #ии
Там очень много данных, советую самому в них покопаться. там найдете супер полезные инсайды если вы занимаетесь ресерчерем, строите бизнес, инвестируете или просто вам полезно знать куда движутся тренды
То, что я нашел для себя довольно интересным:
1️⃣ Начиная с 2019 в среднем хватает всего 10ти месяцев для удвоению введенных в эксплуатацию Compute GPU FLOPS во всем мире
2️⃣ Соответственно в среднем годовой рост составляет 2.3х, в то же время спрос на вычисления для обучения фронтирных моделей растет в 4-5х -> "упираемся" в скалируемость по железу
3️⃣ В среднем переход от FP32 к INT8 дал 12х буст в compute - а не 4x как можно было бы предположить. У H100 разница вообще в 59 раз 🤯
4️⃣ Компьют дешевеет на 30%/год. Стоимость человеческого труда же только растет...
#индустрия #ии
Деньги-возможности и как их искать в графике
Я недавно словил стипендию для ресерча CG/AI от Meshy вместе с крутыми ребятами из Стенфорда, MIT и т.д. - можете поздравить 😊 - и хотел бы поделиться тем, как работает процесс получения стипух/ФААНГ-стажировок
...и показать что всё это возможно, даже если вы не в топ вузе
1️⃣ Обязательно запрыгивайте в какой-то соц пузырек, где объявляют об этих возможностях: твиттер, блюскай, конфы, лабы и откликаетесь
это не делает 90% талантов 😔
ну или вас там самих находят - visibility
2️⃣ откликаясь полезно акцентировать внимание на то, чем вы будете полезны конкретному человеку. стимулы!
- в случаи со стартапами лучше понимать их бизнес
- если FAANG то полезно знать, как устроен корп. карьерный рост
3️⃣ Далее идет разговор на час-два о науке и порой об индустрии. Можно осуществлять расстрел своей научной картиной мира!
поэтому читайте папиры и работайте работу
ну и далее результат!
из ближайших окон возможностей рекомендую HPG 2025 Student Competition
#карьера
Я недавно словил стипендию для ресерча CG/AI от Meshy вместе с крутыми ребятами из Стенфорда, MIT и т.д. - можете поздравить 😊 - и хотел бы поделиться тем, как работает процесс получения стипух/ФААНГ-стажировок
...и показать что всё это возможно, даже если вы не в топ вузе
1️⃣ Обязательно запрыгивайте в какой-то соц пузырек, где объявляют об этих возможностях: твиттер, блюскай, конфы, лабы и откликаетесь
это не делает 90% талантов 😔
ну или вас там самих находят - visibility
2️⃣ откликаясь полезно акцентировать внимание на то, чем вы будете полезны конкретному человеку. стимулы!
- в случаи со стартапами лучше понимать их бизнес
- если FAANG то полезно знать, как устроен корп. карьерный рост
3️⃣ Далее идет разговор на час-два о науке и порой об индустрии. Можно осуществлять расстрел своей научной картиной мира!
поэтому читайте папиры и работайте работу
ну и далее результат!
из ближайших окон возможностей рекомендую HPG 2025 Student Competition
#карьера
🔥16👏3🎉3👍2