Нейронавт | Нейросети в творчестве
13K subscribers
6.79K photos
5.46K videos
51 files
6.89K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках и запусках не участвую

для связи @Neuronauticus

РКН: https://hf.ru/link8e56d
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
#humor
но и всерьез #оффтоп

Как например я налепил этот слоп-дубляж. Дай, думаю, сделаю дубляж для подписчиков, не все же понимают басурманскую речь. Пошел искать автоматические дубляторы. На самых лучших бесплатные токены кончились - смотрю что есть в опенсорсе. Ну есть несколько хороших.

Тыкнул в Пинокио тот что судя по всему должен быть хорошим - час установки - ошибка. Не заводится.

Тыкнул другой. Час установки - завелся. Хороший UI, есть подходящий функциолнал. Транскрибация, перевод, озвучание - есть на выбор бесплатные варианты и с ключиками API. Ключиков нет у меня и жалко. Потыкал транскрибацию - из бесплатного whisper, а он уже устарел и справляется не то чтобы хорошо

Ну ладно, думаю, поправлю руками. Начинаю править руками и это сущий адъ - ибо смешаны реплики персонажей и их надо резать заново - а говорящих всего двое. Потом править текст ибо слова слоп оно не знает и разговаривает на "вы" хотя тут уместно на "ты". Потратил еще полчаса и дошел только до 30 секунд. И все это ради смешного ролика на 2 минуты

Плюнул и залил в ютуб, дождался пока всем известный браузер сделает свой дубляж и подложил его дорожку. А совсем кривую фразу просто вырезал

Куча возни нужна чтобы просто дублировать НЕЙРОНКАМИ 2-минутный ролик. Просто кошмар как я однажды вручную дублировал целую полуторачасовую документалку - убил на это полностью 12 дней зимних каникул. А потом ее перезалил себе другой канал и поднял больше просмотров
😁16👍42💯2🫡1
This media is not supported in your browser
VIEW IN TELEGRAM
YuE2

Опенсорная генерация музыки, обновка

по качеству догоняет Suno v5, но локально, редактируемо и с нотами

- Модель сначала пишет редактируемую партитуру (мелодия + аккорды), а потом по ней генерирует аудио. Партитуру можно править
- Есть редактирование через агента
- Cover: загрузил песню → транскрибировал в ноты с SheetSage2 → написал новый стиль → получил кавер
- 3.6 минуты песни за 71 секунду на RTX 4090, 24 ГБ VRAM

- 3B, лицензия CC BY-NC 4.0 (некоммерческая)
- Сопутствующие открытые модели: MERT2 (музыкальные эмбеддинги, SOTA в 14/15 метрик MARBLE), SheetSage2 (транскрипция аудио в ноты, SOTA в 10/13 метрик), WildSongBench (бенчмарк)

Гитхаб
HF
Comfyui спасибо @m_franz

#musicediting #text2music #text2midi #midi2music

VK | MAX
🔥21👍5
ComfyUI-VOSR2

Обертка VOSR 2.0 для ComfyUI - апскейл изображений в один шаг. 1.4B параметров, один forward пасс без итераций

- До 16x обучена, стабильно ~4x
- Модели докачиваются сами при первом запуске (~7 ГБ)
- Пакетная обработка: каждый кадр батча со своим сидом
- Тайлинг для больших изображений: до 512 px без тайлов, дальше — тайлы 512, для VAE — 1024
- Цветовая пост-обработка: wavelet / adain / none

- 1.4B: LightningDiT + Qwen-Image 2D VAE + DINOv2-L

ВАЖНО: тилинг не опционален выше 512 px — модель обучена нативно на 512, без тайлов качество деградирует. Дефолты ноды выключают тилинг, так что на больших картинках их надо ставить вручную

Спасибо @m_franz

#comfyui #upscale

VK | MAX
👍143
Marigold V2

Оценка глубины по одному изображению, переработанная версия Marigold

Превращает DiT в инструмент оценки глубины. Выглядит многообещающе

- Глубина в один шаг: дистилляция из многошаговой flow-matching модели, с квантованием опционально
- Решает проблему размытия: шерсть, листья, тонкие края — то, что раньше размазывалось, теперь резкое
- Обобщается на непохожие данные
- Не только глубина: те же приемы дают #SOTA на оценке нормалей и разложении изображения на компоненты

- Два ключевых приtма: выравнивание внутренних представлений с семантикой + двухстадийный финтюн с Sinkhorn-лоссом

Гитхаб
HF
Демо

#image2depth #image2normals #image2pbr
👍73🔥2
Накопилось по #minimaxH3 - часть 21
и можно полдня о нем не писать

civitai.com/models/2920872/minimax-h3-fun-control-in-comfyui-or-depth-and-pose-video - вф Fun #ControlNet - depth и pose

github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum - сэмплер для длинных роликов

github.com/lj350201364/MiniMaxH3_Single_Dancer_Prompt_Skill - #skill : промпт танца по рефу #prompting

huggingface.co/geocine/minimax-video-prompt-enhancer-2.6b-gguf - #GGUF 2.6B для рерайта промптов, в Jan.ai

huggingface.co/HardGravy2/Minimax_H3_FLF_HardGravy_6_Step_Turbo_Merge - новый 6-шаговый турбо-мерж + #realism #LoRA сверху

fal.ai/models/minimax/h3-max/multi-angle/image-to-video - #i2v с "точным контролем движения камеры" на fal.ai Спасибо @Endorpheen

civitai.red/models/2881362/minimax-seed-hunter-workflow-latent-upscaler-seamless-video-continuation-speedups - #workflow : латентный #upscale , бесшовное продолжение видео, ускорение - многократно рекомендован @DracoLockhard
👍82
This media is not supported in your browser
VIEW IN TELEGRAM
Programmable World Model (Alaya Lab)

Программируемая модель мира

Состояние мира существует отдельно от картинки как код, а не как тень в истории кадров. Раньше видеомодель сама хранила все неявно: объект ушел из кадра - забыла, правила не выражались. Теперь мир - это явные данные, а видео просто их рисует.

- Агент пишет правила мира кодом: где объекты, как двигаются, какие события происходят
- Движок состояний следит за сущностями даже за кадром — повернул камеру, а они на месте
- Детерминированный компилятор превращает состояние в управляющие сигналы для видеогенератора — модель не «вспоминает» мир, а рендерит его
- Мир описывается по одному референсу и тексту — VLM-агент собирает всю спецификацию

Результат: объекты не забываются, правила исполняются точно, 897 кадров без распада, разные миры на одном движке

Прошли по кругу и вернулись к 3D моделированию, но с лишними шагами

Гитхаб ждем

#world
👍81
Пока вы рендерили, ИИ-мир сдвинулся четыре раза 👇

🎮 GPT-6 Astra сама прошла Portal за 23 ч 43 мин — без единой подсказки, за $200 подписки вместо $570 по API
🤖 OpenAI: на один день сотрудника уже приходится 3,1 дня работы агентов, по $600 в день на API
🚗 Alibaba выложила Qwen-Drive 1.0 в открытый доступ: автопилот и ассистент в одной модели на 4B
🇨🇭 Швейцария снимает госслужащих и армию с Microsoft 365 и переводит на опенсорс

Каждое из этого меняет то, чем вы пользуетесь и за что платите. Завтра будет ещё четыре.

Минута утром с «Синапсом», и вы в курсе раньше коллег.

👉 Не пропускать

#промо

VK | MAX
🍌5😁2🥴2🔥1🌚1
FLUX Video Edit

Редактирование видео по текстовой инструкции от BFL

12 типов правок из коробки

- Удаление, добавление и замена объектов в кадре
- Смена декораций и персонажа, пересказ диалога и перевод реплик на другой язык
- Рестайлинг всего клипа
- Правки комбинируются: несколько инструкций в одном промпте
- Длина, кадрирование, камера, тайминг и аудио наследуются от источника

- До 15 секунд на вход, до 50 МБ (URL или base64)
- Разрешение следует за источником, все что больше 720p понижается до 720p 🤩
- $0.03 за секунду: 10-секундный клип — $0.30
- Аудио сохраняется, если промпт не просит его поменять

- Не умеет: маски, image-референсы, растяжку клипа
- Результаты выдают пиксель-оверлей для сравнения до/после

Плейграунд - платно
Fal.ai - тоже

#videoediting #fluxVE
🔥4👍3
Media is too big
VIEW IN TELEGRAM
SuperSplat Editor 3.0

Полная перепись редактора гауссиан на WebGPU. Крупнейший релиз за год: главное - сцены больше, меньше RAM

- Рендер полностью на GPU
- Stochastic Alpha: при работе сплаты рендерятся без сортировки, после остановки честный сортированный кадр
- Spherical Brush: кисть следует за поверхностью, выбор по глубине и границам
- Цветокоррекция выделения: tint, температура, насыщенность, яркость, прозрачность

- новый формат проектов

Тут все бесплатно и локально в браузере и это хорошо.
На днях узнал что PostShot больше не дает бесплатный экспорт сцен. А LichtFeld бесплатен только если вы сами скомпилируете исходники. Все меньше инструментов где бесплатно можно нарулить сцену на материалах которые под NDA

#gaussian #webgpu
👍9
#MiniMaxMusic

MiniMax Music Prompt Studio

Простое приложение: даешь аудиофайл, получаешь готовый промпт для MiniMax Music и текст песни в похожем вайбе
———

MiniMax Music Production Toolkit for ComfyUI

Полный конвейер производства песни внутри #ComfyUI: идея → структурированный промпт → генерация в Music 3 → восстановление аудио (Declip, FlashSR, HF shimmer repair) → подготовка релиза (LUFS, true-peak) → обложка FLUX.2 → размеченный FLAC/MP3 + JSON с параметрами

- 239 жанровых шаблонов промптов
- Локальный #GGUF LLM для капшена, текста, названия и обложки — без облака
- Custom Mode для своих промптов
- 11 встроенных профилей системных промптов в v2.1
- Отдельная лаборатория улучшения аудио

Галерея

#comfyui #musicediting
8👍6🥴2