Ребята из Stanford-а продолжают развивать идею цикличного вызова LLMs (тут прям ChatGPT), но в области CGI.
типа давайте доверим LLMке изменение питон скрипта описывающего 3Д сцену, графов определяющие материалы и т.д.
что нового:
- Image-Based Feedback loop. мы будем возвращать ChatGPT на вход получившийся рендер после реализованных изменений, чтобы LLMка смогла "подправить" свои ошибки. ведь теперь ChatGPT может анализировать изображения
- Модуль "воображения", которым выступает по сути DALL-E 3. перед тем как просить ChatGPT предложить какие-либо изменения "кода" материала, мы сначала генерим по тексту диффузкой как мог бы выглядеть этот самый итоговый материал чисто в теории. то есть, что и художники делают в реальной жизни, представляют итоговый результат
Много вопросов, эксперименты ограниченные, но некоторые результаты конечно очень сочные. Обещают код с плагином для Blender-а - там посмотрим!
типа давайте доверим LLMке изменение питон скрипта описывающего 3Д сцену, графов определяющие материалы и т.д.
что нового:
- Image-Based Feedback loop. мы будем возвращать ChatGPT на вход получившийся рендер после реализованных изменений, чтобы LLMка смогла "подправить" свои ошибки. ведь теперь ChatGPT может анализировать изображения
- Модуль "воображения", которым выступает по сути DALL-E 3. перед тем как просить ChatGPT предложить какие-либо изменения "кода" материала, мы сначала генерим по тексту диффузкой как мог бы выглядеть этот самый итоговый материал чисто в теории. то есть, что и художники делают в реальной жизни, представляют итоговый результат
Много вопросов, эксперименты ограниченные, но некоторые результаты конечно очень сочные. Обещают код с плагином для Blender-а - там посмотрим!
Media is too big
VIEW IN TELEGRAM
Продолжаем тему ИИ-based редактирования 3д сцен. Тут авторы запили полноценный пайплайн состоящий из множества компонент вместо использования какой-то 1ой генеральной модели типа ChatGPT (но и её также применяют! 😁)
- Сегментируют мешки
- Классифицируют материалы
- Генерируют как мешка должна выглядеть "в идеале" диффузной сеточкой на основе text prompt
- Выбирают с помощью из набора уже predefined физически-корректных материалов самый подходящий под каждый сегмент объекта. Используют CLIP для этого дела
- Далее с помощью inverse рендера оптимизируют параметры графа этого материала (BRDFки, текстуры и т.д.)
На выходе PBR моделька, которую можно использовать в рендеринге, 3д редакторах, для игр и фильмов. Даже сделали удобный UI интерфейс
Относительно вчерашней статьи классическая демонстрация разницы между двумя подходами:
максимально генеральным основанным лишь на Foundational Models vs полуинженерным, с заложенными приорными знания в виде сложной архитектуры
2ое всегда дает лучше результат в краткосрок
- Сегментируют мешки
- Классифицируют материалы
- Генерируют как мешка должна выглядеть "в идеале" диффузной сеточкой на основе text prompt
- Выбирают с помощью из набора уже predefined физически-корректных материалов самый подходящий под каждый сегмент объекта. Используют CLIP для этого дела
- Далее с помощью inverse рендера оптимизируют параметры графа этого материала (BRDFки, текстуры и т.д.)
На выходе PBR моделька, которую можно использовать в рендеринге, 3д редакторах, для игр и фильмов. Даже сделали удобный UI интерфейс
Относительно вчерашней статьи классическая демонстрация разницы между двумя подходами:
максимально генеральным основанным лишь на Foundational Models vs полуинженерным, с заложенными приорными знания в виде сложной архитектуры
2ое всегда дает лучше результат в краткосрок
Прекрасный пост от Андрея Карпатый (ex-фаундер учёный OpenAI, ex-director Tesla AI) повествующий историю про революционность AlexNet, изменивший мир ИИ тогда и продолживший путь к тому, что мы сегодня наблюдаем!
Обожаю рассказывать, и напоминать себе и коллегам по цеху про The Bitter Lesson, который из неё вытекает.
Да, "просто" написанный иначе код уже существующего алгоритма может изменить науку круче, чем вывод 100ен новых алгоритмов. За это я люблю Computer Science: вычислительная сложность не перманентна и мы можем на неё влиять. И важна, в первую очередь, производительность алгоритма в будущих системах, поэтому делать ресерч здесь очень круто)
P.s. очень сочувствую Алексею. Я тоже 1ый год PhD потратил на переписывания исполнения и обучения нейронок на чистом CUDA 😅
Обожаю рассказывать, и напоминать себе и коллегам по цеху про The Bitter Lesson, который из неё вытекает.
Да, "просто" написанный иначе код уже существующего алгоритма может изменить науку круче, чем вывод 100ен новых алгоритмов. За это я люблю Computer Science: вычислительная сложность не перманентна и мы можем на неё влиять. И важна, в первую очередь, производительность алгоритма в будущих системах, поэтому делать ресерч здесь очень круто)
P.s. очень сочувствую Алексею. Я тоже 1ый год PhD потратил на переписывания исполнения и обучения нейронок на чистом CUDA 😅
This media is not supported in your browser
VIEW IN TELEGRAM
Yellow, новый стартап от Mandeep Waraich (ex Google’s Head of Product: Core ML – Large Models and Industrial AI) и Vincent Sitzmann (Prof. MIT) словил $5 млн в seed раунде 🔥
Стартап про генерацию 3Д контента для игровой индустрии, в частности моделек для персонажей с уже настроенным "скелетом" для последующей анимации - rigged meshes
очень верю в ребят, т.к. Vincent сделал прекраснейший PhD за 3 года c последующим PostDoc за 2, и сразу после стал профом в MIT основав Scene Representation Group, которая уже производит топовый ресерч. а сейчас еще и стартап в добавок. не представляю откуда у одного человека столько времени, но как-нибудь возможно его спрошу об этом
P.s. ребята ищут инженеров на удалёнку
Стартап про генерацию 3Д контента для игровой индустрии, в частности моделек для персонажей с уже настроенным "скелетом" для последующей анимации - rigged meshes
очень верю в ребят, т.к. Vincent сделал прекраснейший PhD за 3 года c последующим PostDoc за 2, и сразу после стал профом в MIT основав Scene Representation Group, которая уже производит топовый ресерч. а сейчас еще и стартап в добавок. не представляю откуда у одного человека столько времени, но как-нибудь возможно его спрошу об этом
P.s. ребята ищут инженеров на удалёнку
N-BVH: Neural ray queries with bounding volume hierarchies-Код-Сравнения
Наши соседи из Саарбрюкена сделали прикольный ресёрч по нейронному сжатию геометрии. По сути, они предлагают реймаршить shallow MLPs c multi-layer grid encodings (InstantNGP), как NERF-ы, на выходе давая visibility и в придачу intersection point + albedo + normal, в случаи если visibility != 1.0
Но т.к. реймаршинг - это дорого, Филипп с Александром обучают BVH поверх множества нейронных node-ов, чтобы скипать пустое пространство.
Таким образом они соединили классическую acceleration data structure, которую современные GPU умеют быстро травёрсить, с новомодными нейронками. которые также современные ГПУ могут ускоренно исполнять 😊
добились сжатия по памяти в десятки раз!
конечно же, из-за того что всё это реализовано "софтверно", итоговые тайминги не очень привлекательны, но мы понимаем что всё это может быть аппаратно ускорено. в теории. вопрос только: cтоит ли туда копать? 🤔🤔🤔
Наши соседи из Саарбрюкена сделали прикольный ресёрч по нейронному сжатию геометрии. По сути, они предлагают реймаршить shallow MLPs c multi-layer grid encodings (InstantNGP), как NERF-ы, на выходе давая visibility и в придачу intersection point + albedo + normal, в случаи если visibility != 1.0
Но т.к. реймаршинг - это дорого, Филипп с Александром обучают BVH поверх множества нейронных node-ов, чтобы скипать пустое пространство.
Таким образом они соединили классическую acceleration data structure, которую современные GPU умеют быстро травёрсить, с новомодными нейронками. которые также современные ГПУ могут ускоренно исполнять 😊
добились сжатия по памяти в десятки раз!
конечно же, из-за того что всё это реализовано "софтверно", итоговые тайминги не очень привлекательны, но мы понимаем что всё это может быть аппаратно ускорено. в теории. вопрос только: cтоит ли туда копать? 🤔🤔🤔
только не понятно чего авторы не предлагают уже ранее разработанные методы префильтрации фичей из мира нёрфов, которые борются с абсолютно такими же проблемами аляйзинга при реймаршинге нейронок что и они
надо спросить
надо спросить
This media is not supported in your browser
VIEW IN TELEGRAM
потому что иначе будет вот такое вот. ладно, запущу через неделю их код - проверю.
если что проверим "сработает ли фикс"
если что проверим "сработает ли фикс"
Запомните, перед вычислением финальных Monte Carlo экспериментов надо отключать клампинг семплов. всегда.
не благодарите 😭
не благодарите 😭
😁3
https://suikasibyl.github.io/vxpg
тут очень умный знакомый студент из лиги тех самых 10х программистов смог пробраться на сиграфф, и что неожиданно статья по сути - это конкурент моей первой short paper на еврографикс.
а я то думал, чего он так обрадовался и быстро мне ответил несколько недель назад, когда я писал по поводу его опен сурс движка и желания воспользоваться его непубличным кодом 😅😅😅
(он кстати мне всё скинул!)
и самоё забавное, что оказывается мною предложенный алгоритм SSPG довольно хорошо себя показывает в полноценном сравнении.
оказывается оно было даже "State of the Art" при equal-time comparison. а я как-то когда писал статью поленился проводить глубокое исследование и подумал что моделька - хрень, и пусть пойдет максимум шорт пейпером на еврографикс и только 😂😂
пойду его поздравлю, ему точно светит хорошая карьера 👌
тут очень умный знакомый студент из лиги тех самых 10х программистов смог пробраться на сиграфф, и что неожиданно статья по сути - это конкурент моей первой short paper на еврографикс.
а я то думал, чего он так обрадовался и быстро мне ответил несколько недель назад, когда я писал по поводу его опен сурс движка и желания воспользоваться его непубличным кодом 😅😅😅
(он кстати мне всё скинул!)
и самоё забавное, что оказывается мною предложенный алгоритм SSPG довольно хорошо себя показывает в полноценном сравнении.
оказывается оно было даже "State of the Art" при equal-time comparison. а я как-то когда писал статью поленился проводить глубокое исследование и подумал что моделька - хрень, и пусть пойдет максимум шорт пейпером на еврографикс и только 😂😂
пойду его поздравлю, ему точно светит хорошая карьера 👌
❤2🔥1
Фуф, залили 1ую версию аж за 12 часов до дедлайна на сиграфф, всего то надо было прождать час времени пока файл уйдет на сервер 😢😢😢 С утра еще поредачим...
Посмотрим что на этот раз скажут нам ревьюеры, можно ли нашу технологию нести в массы или пока еще нет)()(
Посмотрим что на этот раз скажут нам ревьюеры, можно ли нашу технологию нести в массы или пока еще нет)()(
🔥6
Вышел новый отчёт от нвидиа.
Много можно сказать, но я пожалуй остановлюсь лишь на одной метрике:
Соотношение доходов от гейминг направления, другими словами от реал-тайм рендера, к общим доходам. (без учета профессиональной визуализации, но там -+ несколько процентов ещё). Упало до <10%
Кто хочет оставаться чисто в компьютерной графике, учитывайте эти числа в своих карьерных планах 🫡
Много можно сказать, но я пожалуй остановлюсь лишь на одной метрике:
Соотношение доходов от гейминг направления, другими словами от реал-тайм рендера, к общим доходам. (без учета профессиональной визуализации, но там -+ несколько процентов ещё). Упало до <10%
Кто хочет оставаться чисто в компьютерной графике, учитывайте эти числа в своих карьерных планах 🫡
😨3🫡3
Так я почти разгрёб все накопившиеся дела после SigAsia -> да начнется разбор статей с сиграффа
DreamMat (код) прекрасный пример системной статьи, которая планомерно улучшает метрики SOTA. Ребята генерируют pbr материалы (альбеда, металлик, рафнес) для уже готовой геометрии на основе текстового описания.
2 главных контрибьюшена:
1. использование Classifier Score Distillation с вычитанием негативного гайдинга: "кислотные цвета", "уродливо", "слишком ярко\темно". По сути этот простой хак позволяет разрешить проблему кислотных цветов в итоговой модели. (Fig. 17)
- Light + Geometry condition map, помогающие вычленить влияние освещения на итоговый рендер и добиться стабильной работы диффузки для любого освещения и ракурса. Для этого они обучают ControlNet Stable Diffusion, подавая рендеры видимой геометрии (нормали, глубина - gbuffer) + её рендер с учетом выбранной инвайромент мапы но с белым альбедо.
Все идеи не кажутся необычными, и хоть и есть ряд вопросов к light conditioning, прогресс на лицо! 👍
DreamMat (код) прекрасный пример системной статьи, которая планомерно улучшает метрики SOTA. Ребята генерируют pbr материалы (альбеда, металлик, рафнес) для уже готовой геометрии на основе текстового описания.
2 главных контрибьюшена:
1. использование Classifier Score Distillation с вычитанием негативного гайдинга: "кислотные цвета", "уродливо", "слишком ярко\темно". По сути этот простой хак позволяет разрешить проблему кислотных цветов в итоговой модели. (Fig. 17)
- Light + Geometry condition map, помогающие вычленить влияние освещения на итоговый рендер и добиться стабильной работы диффузки для любого освещения и ракурса. Для этого они обучают ControlNet Stable Diffusion, подавая рендеры видимой геометрии (нормали, глубина - gbuffer) + её рендер с учетом выбранной инвайромент мапы но с белым альбедо.
Все идеи не кажутся необычными, и хоть и есть ряд вопросов к light conditioning, прогресс на лицо! 👍