Нейронавт | Нейросети в творчестве
13K subscribers
6.79K photos
5.46K videos
51 files
6.89K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках и запусках не участвую

для связи @Neuronauticus

РКН: https://hf.ru/link8e56d
Download Telegram
Odyssey-3

Модели мира выруливают в прикладную нишу где есть потенциал для монетизации - #embodied AI, то бишь роботы

Odyssey-3 - фундаментальная мировая модель общего назначения. Одна обученная нейросеть управляет роботами, человекоподобными, дронами, автомобилями и видеоиграми. Претрейн дает понимание физики и причинно-следственных связей, а для новой задачи нужно всего несколько часов попутных данных

- Роборуки
- Человекоподобные роботы
- Автономное вождение
- Дроны
- Видеоигры: GTA V, перенос навыков в RDR 2 и Sleeping Dogs без дополнительного обучения
- Ну и собственно создавать интерактивные миры тоже умеет

- Публичный релиз ждем в ближайшие недели

Спасибо @Endorpheen

#world #interactive #agent

VK | MAX
🔥7👍3
This media is not supported in your browser
VIEW IN TELEGRAM
EventEgoHands++ (Keio University)

Реконструкция 3D-модели кистей рук по данным event-камеры с точки зрения первого лица. Обычные камеры слепнут в темноте и от смаза при движении, event-камера фиксирует только изменения яркости — работает и в почти полной темноте

- Отдельный Hand Detector: различает левую и правую руку по-отдельности с bounding-box и масками
- Adaptive Attention: динамически гейтирует внимание по результатам детекции — моделирует взаимодействие и взаимное расположение двух рук
- Работает при плохом освещении и сильном смазе где RGB и depth пасуют
- Определяет сколько рук в кадре: одна две или ни одной

Гитхаб

#hands #videoto3d

VK | MAX
👍6🔥2
Meridian

Еще одна модель от Viggle AI на базе #MiniMaxH3

Генерирует новые ракурсы уже снятого видео. Возвращается к моменту события и снимает его заново с камеры которую выбирает юзер

Возможности:
- Камера: орбита, наезд, панорама, подъем — путь из нескольких ключевых кадров
- Буллет-тайм
- Замедление и ускорение
- Работает и от одного изображения

VGGT-Omega строит геометрию и позиции камер из исходного видео, рендерится варп-референс вдоль выбранного пути, а Meridian дорисовывает скрытые области

Файнтюн трансформера MiniMax-H3 без текст-энкодера на инференсе, 61.7 ГБ bf16 + LoRA 2.5 ГБ, 4 шага. Выход 768p

Большие движения камеры дают артефакты, скрытые поверхности не восстанавливаются а генерируются. Пока только на B200

HF
Демо

#cameracontrol #novelview

VK | MAX
🔥9👍62
FoundationStereo и FoundationPose (NVIDIA)

Две открытые модели для 3D-перцепции из систем Vision AI

FoundationStereo

Стерео-глубина без дообучения. Пара RGB-картинок со стереокамеры на входе, точная карта диспаритета на выходе.

• Zero-shot стерео-матчинг на новых сценах
• Для робототехники промышленности и умных пространств
• ONNX и TensorRT
• Работает от Jetson до H100

Слабые места: прозрачные объекты пересвет и плохое освещение.

FoundationPose

6-DoF поза объектов без обучения. CAD-модель -> положение и ориентация объекта на RGBD-кадре плюс трекинг по видео

• Zero-shot на новых объектах нужен только CAD
• Оценка позы и отслеживание на видео
• Обучена на synthetic-данных Objaverse и GSO
• Средний скор 83.3 на BOP-бенчмарках
• TensorRT работает от Orin Nano до H100

#stereo2depth #image2depth #image2pose
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Вы же наверняка слышали про Microduck

Так вот туда прикрутили цифровую копию мозга мухи. Ее буквально пересадили посмертно в новое кибертело. И вы тоже можете завести себе такую уткомуху, цена вопроса $400

Киберпанк. Начало

#robot #embodied

VK | MAX
🤯5👍4
StepAudio 3

Новые модели от Степана

StepAudio 3 Realtime

Полнодуплексная аудио-языковая модель. Говорит и слушает одновременно, размышляет вслух не замолкая

китайский и английский

StepAudio 3 Music

Генерация песен: планирует структуру (куплеты, припев, бридж, аранжировку), создает 48-kHz стерео до 5м 30с

язык задается описанием песни

Помимо этого в семейство вошли говорилка с дизайном голоса Gen, TTS и ASR

китайский, английский, японский, корейский, французский, испанский

Voice Studio - пока только разговорная, музыка анонсирована

#musicediting #dialog #asr #tts #voicedesign
👍7🥴2🤷‍♂11
Нативная поддержка гауссиан в Blender 5.3

Похоже что и редактирование в том числе

#gaussian #blender

VK | MAX
🔥74👍4🍌3😱1
This media is not supported in your browser
VIEW IN TELEGRAM
LynnReal-Omni

Единая модель на базе #MiniMaxH3 для всех видео-задач: #t2v, #i2v, генерация по позе, structural control, omni-reference generation, #styletransfer, видео-редактирование, восстановление деградированного видео и стриминг длинных видео. 4 шага

Принимает разнородные входы — референсы внешности, 3D-рендеры, записи игр. Агент может компоновать условия внутри одной модели

LynnReal-Omni-Flash (27B, 3 шага) — ускоренная с легким VAE-декодером. На одном H100 генерация + декодинг 22 кадров 540p: 843 ms (Standard), 377 ms (Flash). Основа для #realtime стриминга.

Гитхаб
ComfyUI

#comfyui #videoediting #controlnet #videorestoration #imageediting
🔥9👍2
Hypit

скилл превращает ролик в редактируемый шаблон для новых видео

агент через команду /hypit получает язык разметки SVML и систему для создания видео

Собирает повторно запускаемый workflow. Кадры, субтитры, перебивки и эффекты привязаны к словам, а не к секундам на таймлайне.

Дальше можно поменять ведущего, тему или часть материалов и собрать новую версию в той же структуре. В примерах - рейтинг, подкаст и уличное интервью. Для одного шаблона показаны варианты с другими персонажами и сюжетами.

#skill #videoediting

VK | MAX
👍62🔥1🥴1
Jev - System One

TypeSafe AI переизобрели классификацию и подают это как превосходящую альтернативу LLM (на задачах классификации и скоринга)

Обычные LLM пишут ответ токен за токеном и отдают строку. Ее надо парсить и валидировать, а модель в любой момент может сойти с рельсов и выдать галлюцинацию. У Jev структура ответа задана схемой заранее, варианты просчитываются параллельно одним запросом, на выходе типизированные данные с калиброванными вероятностями.

Классификация и скоринг: до 200 раз быстрее и в 450 раз дешевле классических LLM. Вход стоит $0,042 за миллион токенов, выход бесплатный.

Для бэкенда и автоматизации это готовое решение с уровнем уверенности, а не текст для разбора. Софт получает вероятности напрямую - как вызов функции с интеллектом.

Автор - выходеw из OpenAI, участвовавший в работе над методами, которые легли в основу ChatGPT

#classification #automation
🔥10👍71
Media is too big
VIEW IN TELEGRAM
VC-Attention

ускорение генерации видео до 1.7x от Nunchux AI

Стандартное внимание в диффузионных трансформерах замедляет генерацию видео: все вычисления в FP32, много лишних операций. VC-Attention решает это без переобучения модели.

V-Smooth группирует похожие токены и снижает ошибку квантования значений. ExpCast-FP8 меняет экспоненту в FP32 на прямой перевод результатов в FP8

На RTX 5090 внимание Wan2.2 ускорилось в 3.58 раза, полная генерация в 1.7 раза

Проверили на Wan2.2, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3

Nunchux Attention - проприетарное расширение VC-Attention. Усоряет MiniMax-H3 в 1.91x против BF16 FlashAttention-4 на B200

Бесплатный доступ для H3 обещают скоро открыть
Вейтлист

Спасибо @Endorpheen

#optimization

VK | MAX
👍72
HiDream-O1-Video-1.0 (HD-V1)

Первая нативная omni-modal видеомодель от HIDream. Вход - текст, картинка и видео, выход - киношные клипы 1080p длиной 5-20 секунд.

• Физика в основе движения и динамики
• Глубокое понимание замысла до генерации
• Длительность решает сюжет, а не фиксированные промпты
• Нативная синхронизация аудио и видео, без артефактов пост-даббинга

#4 на Artificial Analysis Image-to-Video (With Audio)
#8 на Arena.ai Image-to-Video

Раньше генеративные видео игнорировали физику: объекты плавились и проходили сквозь стены. Модель заземлена на реальные законы мира, поэтому студии и независимые авторы смогут делать превизуализацию и спецэффекты без ошибок симуляции.

Пока только API

#i2v #i2av

VK | MAX
👍5