Нейронавт | Нейросети в творчестве
13K subscribers
6.79K photos
5.46K videos
51 files
6.9K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках и запусках не участвую

для связи @Neuronauticus

РКН: https://hf.ru/link8e56d
Download Telegram
DeepSeek V4.1 Flash

Раньше в приложении надо было вручную переключаться между быстрым, экспертным и режимом с картинками. Теперь это один нативно мультимодальный флагман: обычный диалог, анализ изображений и сложные рассуждения

- Нативно мультимодальная: текст, изображения, рассуждения - один и тот же вход

- V4 Pro отключается 14 сентября (перенесли с более ранней даты)
- После этого V4-запросы автоматически идут на V4.1 Flash по цене Flash пока не выйдет V4.1 Pro

#flagship #multimodal

VK | MAX
🔥9👍5
This media is not supported in your browser
VIEW IN TELEGRAM
AuK (Tencent Hunyuan)

Универсальная модель речи: генерация, редактирование, очистка и разделение

Все через указания естественным языком

- Клонирование голоса: текст + референс голоса
- Instruct TTS: голос по описанию без референса
- Редактирование содержимого: заменил/вставил/удалил слова, переписал слова в песне с сохранением мелодии
- Акустика: питч, скорость, громкость
- Паралингвистика: эмоция, тембр, убирает акцент, дыхание/смех/кашель, обычная речь - шепот
- Очистка и разделение: улучшение речи, разделение говорящих, извлечение вокала из микса, выделение цели по сказанному

- 1.5B, MIT
- AuK-Flash: 4 шага, в 4.5x быстрее

Русский не заявлен, но текстовый энкодер - мультиязыный Qwen2.5-Omni-3B, так что пробуйте

Гитхаб
HF
Демо
ComfyUI Спасибо @m_franz

#tts #voiceclonihng #voicedesign #alm #demix #audioseparation
👍10🔥3
Uno (IFM + Cerebras)

Способ ускорить большую языковую модель не теряя ни капли качества. Обычные модели пишут текст по одному слову за раз. Uno учит модель предсказывать целыми блоками параллельно как будто она печатает сразу по несколько слов, а не по одному

У модели два набора мозгов: один отвечает за качество и делает все как раньше, второй легкий и быстрый, догадывается какие слова идут подряд. Вместе они выдают ровно тот же результат что и оригинал но в разы быстрее.

Существующие ускорители (DFlash, Eagle3) требуют вторую отдельную черновую модель - это лишняя память и сложность. Uno обходится без нее - все встроено в одну модель. Меньше веса, меньше памяти, проще запускать.

В результате до 3 раз быстрее базовой модели. При этом модель на 8B параметров обходит по качеству диффузионного гиганта на 26B и проприетарный Mercury 2

Гитхаб
HF

#optimization
🔥5👍4🤔21
This media is not supported in your browser
VIEW IN TELEGRAM
#humor
но и всерьез #оффтоп

Как например я налепил этот слоп-дубляж. Дай, думаю, сделаю дубляж для подписчиков, не все же понимают басурманскую речь. Пошел искать автоматические дубляторы. На самых лучших бесплатные токены кончились - смотрю что есть в опенсорсе. Ну есть несколько хороших.

Тыкнул в Пинокио тот что судя по всему должен быть хорошим - час установки - ошибка. Не заводится.

Тыкнул другой. Час установки - завелся. Хороший UI, есть подходящий функциолнал. Транскрибация, перевод, озвучание - есть на выбор бесплатные варианты и с ключиками API. Ключиков нет у меня и жалко. Потыкал транскрибацию - из бесплатного whisper, а он уже устарел и справляется не то чтобы хорошо

Ну ладно, думаю, поправлю руками. Начинаю править руками и это сущий адъ - ибо смешаны реплики персонажей и их надо резать заново - а говорящих всего двое. Потом править текст ибо слова слоп оно не знает и разговаривает на "вы" хотя тут уместно на "ты". Потратил еще полчаса и дошел только до 30 секунд. И все это ради смешного ролика на 2 минуты

Плюнул и залил в ютуб, дождался пока всем известный браузер сделает свой дубляж и подложил его дорожку. А совсем кривую фразу просто вырезал

Куча возни нужна чтобы просто дублировать НЕЙРОНКАМИ 2-минутный ролик. Просто кошмар как я однажды вручную дублировал целую полуторачасовую документалку - убил на это полностью 12 дней зимних каникул. А потом ее перезалил себе другой канал и поднял больше просмотров
😁16👍42💯2🫡1
This media is not supported in your browser
VIEW IN TELEGRAM
YuE2

Опенсорная генерация музыки, обновка

по качеству догоняет Suno v5, но локально, редактируемо и с нотами

- Модель сначала пишет редактируемую партитуру (мелодия + аккорды), а потом по ней генерирует аудио. Партитуру можно править
- Есть редактирование через агента
- Cover: загрузил песню → транскрибировал в ноты с SheetSage2 → написал новый стиль → получил кавер
- 3.6 минуты песни за 71 секунду на RTX 4090, 24 ГБ VRAM

- 3B, лицензия CC BY-NC 4.0 (некоммерческая)
- Сопутствующие открытые модели: MERT2 (музыкальные эмбеддинги, SOTA в 14/15 метрик MARBLE), SheetSage2 (транскрипция аудио в ноты, SOTA в 10/13 метрик), WildSongBench (бенчмарк)

Гитхаб
HF
Comfyui спасибо @m_franz

#musicediting #text2music #text2midi #midi2music

VK | MAX
🔥21👍5
ComfyUI-VOSR2

Обертка VOSR 2.0 для ComfyUI - апскейл изображений в один шаг. 1.4B параметров, один forward пасс без итераций

- До 16x обучена, стабильно ~4x
- Модели докачиваются сами при первом запуске (~7 ГБ)
- Пакетная обработка: каждый кадр батча со своим сидом
- Тайлинг для больших изображений: до 512 px без тайлов, дальше — тайлы 512, для VAE — 1024
- Цветовая пост-обработка: wavelet / adain / none

- 1.4B: LightningDiT + Qwen-Image 2D VAE + DINOv2-L

ВАЖНО: тилинг не опционален выше 512 px — модель обучена нативно на 512, без тайлов качество деградирует. Дефолты ноды выключают тилинг, так что на больших картинках их надо ставить вручную

Спасибо @m_franz

#comfyui #upscale

VK | MAX
👍143
Marigold V2

Оценка глубины по одному изображению, переработанная версия Marigold

Превращает DiT в инструмент оценки глубины. Выглядит многообещающе

- Глубина в один шаг: дистилляция из многошаговой flow-matching модели, с квантованием опционально
- Решает проблему размытия: шерсть, листья, тонкие края — то, что раньше размазывалось, теперь резкое
- Обобщается на непохожие данные
- Не только глубина: те же приемы дают #SOTA на оценке нормалей и разложении изображения на компоненты

- Два ключевых приtма: выравнивание внутренних представлений с семантикой + двухстадийный финтюн с Sinkhorn-лоссом

Гитхаб
HF
Демо

#image2depth #image2normals #image2pbr
👍73🔥2
Накопилось по #minimaxH3 - часть 21
и можно полдня о нем не писать

civitai.com/models/2920872/minimax-h3-fun-control-in-comfyui-or-depth-and-pose-video - вф Fun #ControlNet - depth и pose

github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum - сэмплер для длинных роликов

github.com/lj350201364/MiniMaxH3_Single_Dancer_Prompt_Skill - #skill : промпт танца по рефу #prompting

huggingface.co/geocine/minimax-video-prompt-enhancer-2.6b-gguf - #GGUF 2.6B для рерайта промптов, в Jan.ai

huggingface.co/HardGravy2/Minimax_H3_FLF_HardGravy_6_Step_Turbo_Merge - новый 6-шаговый турбо-мерж + #realism #LoRA сверху

fal.ai/models/minimax/h3-max/multi-angle/image-to-video - #i2v с "точным контролем движения камеры" на fal.ai Спасибо @Endorpheen

civitai.red/models/2881362/minimax-seed-hunter-workflow-latent-upscaler-seamless-video-continuation-speedups - #workflow : латентный #upscale , бесшовное продолжение видео, ускорение - многократно рекомендован @DracoLockhard
👍82
This media is not supported in your browser
VIEW IN TELEGRAM
Programmable World Model (Alaya Lab)

Программируемая модель мира

Состояние мира существует отдельно от картинки как код, а не как тень в истории кадров. Раньше видеомодель сама хранила все неявно: объект ушел из кадра - забыла, правила не выражались. Теперь мир - это явные данные, а видео просто их рисует.

- Агент пишет правила мира кодом: где объекты, как двигаются, какие события происходят
- Движок состояний следит за сущностями даже за кадром — повернул камеру, а они на месте
- Детерминированный компилятор превращает состояние в управляющие сигналы для видеогенератора — модель не «вспоминает» мир, а рендерит его
- Мир описывается по одному референсу и тексту — VLM-агент собирает всю спецификацию

Результат: объекты не забываются, правила исполняются точно, 897 кадров без распада, разные миры на одном движке

Прошли по кругу и вернулись к 3D моделированию, но с лишними шагами

Гитхаб ждем

#world
👍81
Пока вы рендерили, ИИ-мир сдвинулся четыре раза 👇

🎮 GPT-6 Astra сама прошла Portal за 23 ч 43 мин — без единой подсказки, за $200 подписки вместо $570 по API
🤖 OpenAI: на один день сотрудника уже приходится 3,1 дня работы агентов, по $600 в день на API
🚗 Alibaba выложила Qwen-Drive 1.0 в открытый доступ: автопилот и ассистент в одной модели на 4B
🇨🇭 Швейцария снимает госслужащих и армию с Microsoft 365 и переводит на опенсорс

Каждое из этого меняет то, чем вы пользуетесь и за что платите. Завтра будет ещё четыре.

Минута утром с «Синапсом», и вы в курсе раньше коллег.

👉 Не пропускать

#промо

VK | MAX
🍌5😁2🥴2🔥1🌚1