Нейронавт | Нейросети в творчестве
13K subscribers
6.79K photos
5.46K videos
51 files
6.89K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках и запусках не участвую

для связи @Neuronauticus

РКН: https://hf.ru/link8e56d
Download Telegram
StepAudio 3

Новые модели от Степана

StepAudio 3 Realtime

Полнодуплексная аудио-языковая модель. Говорит и слушает одновременно, размышляет вслух не замолкая

китайский и английский

StepAudio 3 Music

Генерация песен: планирует структуру (куплеты, припев, бридж, аранжировку), создает 48-kHz стерео до 5м 30с

язык задается описанием песни

Помимо этого в семейство вошли говорилка с дизайном голоса Gen, TTS и ASR

китайский, английский, японский, корейский, французский, испанский

Voice Studio - пока только разговорная, музыка анонсирована

#musicediting #dialog #asr #tts #voicedesign
👍7🥴2🤷‍♂11
Нативная поддержка гауссиан в Blender 5.3

Похоже что и редактирование в том числе

#gaussian #blender

VK | MAX
🔥74👍4🍌3😱1
This media is not supported in your browser
VIEW IN TELEGRAM
LynnReal-Omni

Единая модель на базе #MiniMaxH3 для всех видео-задач: #t2v, #i2v, генерация по позе, structural control, omni-reference generation, #styletransfer, видео-редактирование, восстановление деградированного видео и стриминг длинных видео. 4 шага

Принимает разнородные входы — референсы внешности, 3D-рендеры, записи игр. Агент может компоновать условия внутри одной модели

LynnReal-Omni-Flash (27B, 3 шага) — ускоренная с легким VAE-декодером. На одном H100 генерация + декодинг 22 кадров 540p: 843 ms (Standard), 377 ms (Flash). Основа для #realtime стриминга.

Гитхаб
ComfyUI

#comfyui #videoediting #controlnet #videorestoration #imageediting
🔥9👍2
Hypit

скилл превращает ролик в редактируемый шаблон для новых видео

агент через команду /hypit получает язык разметки SVML и систему для создания видео

Собирает повторно запускаемый workflow. Кадры, субтитры, перебивки и эффекты привязаны к словам, а не к секундам на таймлайне.

Дальше можно поменять ведущего, тему или часть материалов и собрать новую версию в той же структуре. В примерах - рейтинг, подкаст и уличное интервью. Для одного шаблона показаны варианты с другими персонажами и сюжетами.

#skill #videoediting

VK | MAX
👍62🔥1🥴1
Jev - System One

TypeSafe AI переизобрели классификацию и подают это как превосходящую альтернативу LLM (на задачах классификации и скоринга)

Обычные LLM пишут ответ токен за токеном и отдают строку. Ее надо парсить и валидировать, а модель в любой момент может сойти с рельсов и выдать галлюцинацию. У Jev структура ответа задана схемой заранее, варианты просчитываются параллельно одним запросом, на выходе типизированные данные с калиброванными вероятностями.

Классификация и скоринг: до 200 раз быстрее и в 450 раз дешевле классических LLM. Вход стоит $0,042 за миллион токенов, выход бесплатный.

Для бэкенда и автоматизации это готовое решение с уровнем уверенности, а не текст для разбора. Софт получает вероятности напрямую - как вызов функции с интеллектом.

Автор - выходеw из OpenAI, участвовавший в работе над методами, которые легли в основу ChatGPT

#classification #automation
🔥10👍71
Media is too big
VIEW IN TELEGRAM
VC-Attention

ускорение генерации видео до 1.7x от Nunchux AI

Стандартное внимание в диффузионных трансформерах замедляет генерацию видео: все вычисления в FP32, много лишних операций. VC-Attention решает это без переобучения модели.

V-Smooth группирует похожие токены и снижает ошибку квантования значений. ExpCast-FP8 меняет экспоненту в FP32 на прямой перевод результатов в FP8

На RTX 5090 внимание Wan2.2 ускорилось в 3.58 раза, полная генерация в 1.7 раза

Проверили на Wan2.2, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3

Nunchux Attention - проприетарное расширение VC-Attention. Усоряет MiniMax-H3 в 1.91x против BF16 FlashAttention-4 на B200

Бесплатный доступ для H3 обещают скоро открыть
Вейтлист

Спасибо @Endorpheen

#optimization

VK | MAX
👍72
HiDream-O1-Video-1.0 (HD-V1)

Первая нативная omni-modal видеомодель от HIDream. Вход - текст, картинка и видео, выход - киношные клипы 1080p длиной 5-20 секунд.

• Физика в основе движения и динамики
• Глубокое понимание замысла до генерации
• Длительность решает сюжет, а не фиксированные промпты
• Нативная синхронизация аудио и видео, без артефактов пост-даббинга

#4 на Artificial Analysis Image-to-Video (With Audio)
#8 на Arena.ai Image-to-Video

Раньше генеративные видео игнорировали физику: объекты плавились и проходили сквозь стены. Модель заземлена на реальные законы мира, поэтому студии и независимые авторы смогут делать превизуализацию и спецэффекты без ошибок симуляции.

Пока только API

#i2v #i2av

VK | MAX
👍5
#krea2

huggingface.co/jimmycarter/krea2-turbo-bbox - файнтюн для макета: панели комиксов, пузыри с текстом, идентичность персонажа. Требует PROMPTING.md

civitai.com/models/2942217/krea-2-pixel-art - #LoRA для пиксель-арта

github.com/envy-ai/ComfyUI-Krea2-Pixel-Art-Refiner - постпроцессинг пиксель-арта

huggingface.co/Cierpliwy/krea2_lineart_edit - LoRA для Krea 2 Raw: перевод лайнарта в полноценное изображение

github.com/aoleg/krea-2-merge-tool - GUI-мержер чекпоинтов и лор

huggingface.co/lvladikov/Krea2-Turbo-Distill-4step-LoRA - дистилляция Turbo 8→4 шага, ~1.6x быстрее

huggingface.co/lvladikov/Krea2-Turbo-Distill-2step-LoRA - дистилляция 8→2 шага

github.com/sempersatirica/comfy-workflows - набор #workflow: Krea 2 #charactersheet и composite, H3 детайлеры (SAM3, Yolo) и генераторы промптов, Qwen Image Edit эмплейсмент

civitai.red/models/2916843/instafame - #realism под Instagram

youtu.be/chhyJ8FgIFk?si=m9oM5EwcXppTA6Sb
drive.google.com/drive/u/4/folders/1pnjDEX6DGR-sQjqWFhZBQGgTbRnqZoVI
#workflow Character Sheet #t2i для #MiniMaxH3

civitai.com/models/2926098/updated-v2-turn-any-photo-into-a-full-character-sheet-using-krea2-free-workflow - фото → полный #charactersheet в #ComfyUI #i2i
👍15