OnlyGens
26 subscribers
9 photos
1 link
generative ai • research • creative applications
Download Telegram
Channel created
Так, всего один пост — и страница канала уже не будет такой пугающе пустой, надо просто взять и сделать😅

Уже 3 года я занимаюсь рисерчем в генерации визуального контента и недавно поняла, что в одиночестве любоваться всей той красотой, которую я генерирую, — уже незаконно. Так что буду делиться всем в этом канале.

Что именно вы здесь найдете?

- новые фичи из мира ГенИИ
- мои краш-тесты с ними
- кучу красивых картинок и видео
- объяснения технической изнанки самых актуальных тем простым языком (кстати, нескромно считаю, что объяснять сложные вещи простым языком - моя суперспособность)

В черновиках уже лежит план классных постов, так что готовьтесь - скоро здесь будет много интересного⚡️
7😁4👍1🔥1
Про multi-concept generation

Кажется, качественной генерацией одиночных объектов сейчас никого не удивить. In-context модели справляются отлично почти с любыми объектами, а если нужно генерировать людей — выручают старые добрые адаптеры. Например, наша T-LoRA, которую мы в этом году представили на AAAI в Сингапуре 😌

Однако, возникает задачка со звездочкой: как сгенерировать сразу несколько разных кастомных сущностей на одной картинке?

Нередко в таких случаях возникает проблема «смешивания». Когда вместо двух отдельных, хорошо узнаваемых людей вы получаете двоих, усредненных между ними по внешности👯‍♀️.

По моему опыту, самым стабильно работающим методом (не требующим дообучения и позволяющим надежно отделить объекты) остается маскирование.
Концепт простой: находим внутри диффузионного процесса маски нужных объектов. Дальше используем принцип «разделяй и властвуй» — внутри маски №1 применяем адаптер №1, внутри маски №2 — адаптер №2 и так далее.

Отлично работает, например, в реализации LoRAShop.

Именно поэтому мы полностью обновили репозиторий T-LoRA и адаптеировали его для генерациии нескольких концептов!

Под капотом новой версии:
📌 PEFT-адаптеры — теперь всё работает как plug-and-play с любой моделью и пайплайном Diffusers. Можно загружать, переключать или комбинировать несколько T-LoRA прямо на этапе инференса.
📌 Интеграция с LoRAShop из коробки — генерация нескольких кастомных концептов, обученных независимо.

Там же небольшая пасхалка-пример с авторами статьи🤫

А к этому посту прикрепляю результат работы T-LoRA+LoRAShop: сгенерировали сущности российского культурного кода на модели Kandinsky. Здесь исторические и современные личности, архитектурные объекты, русская кухня, персонажи мультфильмов и многое другое.
Всех узнали?🙃
6🔥5