Так, всего один пост — и страница канала уже не будет такой пугающе пустой, надо просто взять и сделать😅
Уже 3 года я занимаюсь рисерчем в генерации визуального контента и недавно поняла, что в одиночестве любоваться всей той красотой, которую я генерирую, — уже незаконно. Так что буду делиться всем в этом канале.
Что именно вы здесь найдете?
- новые фичи из мира ГенИИ
- мои краш-тесты с ними
- кучу красивых картинок и видео
- объяснения технической изнанки самых актуальных тем простым языком (кстати, нескромно считаю, что объяснять сложные вещи простым языком - моя суперспособность)
В черновиках уже лежит план классных постов, так что готовьтесь - скоро здесь будет много интересного⚡️
Уже 3 года я занимаюсь рисерчем в генерации визуального контента и недавно поняла, что в одиночестве любоваться всей той красотой, которую я генерирую, — уже незаконно. Так что буду делиться всем в этом канале.
Что именно вы здесь найдете?
- новые фичи из мира ГенИИ
- мои краш-тесты с ними
- кучу красивых картинок и видео
- объяснения технической изнанки самых актуальных тем простым языком (кстати, нескромно считаю, что объяснять сложные вещи простым языком - моя суперспособность)
В черновиках уже лежит план классных постов, так что готовьтесь - скоро здесь будет много интересного⚡️
❤7😁4👍1🔥1
Про multi-concept generation
Кажется, качественной генерацией одиночных объектов сейчас никого не удивить. In-context модели справляются отлично почти с любыми объектами, а если нужно генерировать людей — выручают старые добрые адаптеры. Например, наша T-LoRA, которую мы в этом году представили на AAAI в Сингапуре 😌
Однако, возникает задачка со звездочкой: как сгенерировать сразу несколько разных кастомных сущностей на одной картинке?
Нередко в таких случаях возникает проблема «смешивания». Когда вместо двух отдельных, хорошо узнаваемых людей вы получаете двоих, усредненных между ними по внешности👯♀️.
По моему опыту, самым стабильно работающим методом (не требующим дообучения и позволяющим надежно отделить объекты) остается маскирование.
Концепт простой: находим внутри диффузионного процесса маски нужных объектов. Дальше используем принцип «разделяй и властвуй» — внутри маски №1 применяем адаптер №1, внутри маски №2 — адаптер №2 и так далее.
Отлично работает, например, в реализации LoRAShop.
Именно поэтому мы полностью обновили репозиторий T-LoRA и адаптеировали его для генерациии нескольких концептов!
Под капотом новой версии:
📌 PEFT-адаптеры — теперь всё работает как plug-and-play с любой моделью и пайплайном Diffusers. Можно загружать, переключать или комбинировать несколько T-LoRA прямо на этапе инференса.
📌 Интеграция с LoRAShop из коробки — генерация нескольких кастомных концептов, обученных независимо.
Там же небольшая пасхалка-пример с авторами статьи🤫
А к этому посту прикрепляю результат работы T-LoRA+LoRAShop: сгенерировали сущности российского культурного кода на модели Kandinsky. Здесь исторические и современные личности, архитектурные объекты, русская кухня, персонажи мультфильмов и многое другое.
Всех узнали?🙃
Кажется, качественной генерацией одиночных объектов сейчас никого не удивить. In-context модели справляются отлично почти с любыми объектами, а если нужно генерировать людей — выручают старые добрые адаптеры. Например, наша T-LoRA, которую мы в этом году представили на AAAI в Сингапуре 😌
Однако, возникает задачка со звездочкой: как сгенерировать сразу несколько разных кастомных сущностей на одной картинке?
Нередко в таких случаях возникает проблема «смешивания». Когда вместо двух отдельных, хорошо узнаваемых людей вы получаете двоих, усредненных между ними по внешности👯♀️.
По моему опыту, самым стабильно работающим методом (не требующим дообучения и позволяющим надежно отделить объекты) остается маскирование.
Концепт простой: находим внутри диффузионного процесса маски нужных объектов. Дальше используем принцип «разделяй и властвуй» — внутри маски №1 применяем адаптер №1, внутри маски №2 — адаптер №2 и так далее.
Отлично работает, например, в реализации LoRAShop.
Именно поэтому мы полностью обновили репозиторий T-LoRA и адаптеировали его для генерациии нескольких концептов!
Под капотом новой версии:
📌 PEFT-адаптеры — теперь всё работает как plug-and-play с любой моделью и пайплайном Diffusers. Можно загружать, переключать или комбинировать несколько T-LoRA прямо на этапе инференса.
📌 Интеграция с LoRAShop из коробки — генерация нескольких кастомных концептов, обученных независимо.
Там же небольшая пасхалка-пример с авторами статьи🤫
А к этому посту прикрепляю результат работы T-LoRA+LoRAShop: сгенерировали сущности российского культурного кода на модели Kandinsky. Здесь исторические и современные личности, архитектурные объекты, русская кухня, персонажи мультфильмов и многое другое.
Всех узнали?🙃
❤6🔥5