Viggle Mine
Демоспейс с продвинутой оберткой над Viggle Animate для замен персонажа в сложных сценах. Когда герой отворачивается уходит в толпу или возвращается мелким планом идентичность не теряется.
Два режима. Standard — прямая длинная генерация. Smart — полный пайплайн: трекинг точек (TAPNext++), контроль камеры (SAM), динамический зум, Pass A и опциональный Pass B для восстановления личности.
Pass B работает так: после потери персонажа из кадра берется кадр где он снова виден, перерисовывается внешность, генерируется обратно-вперед вокруг точки сбоя и встраивается до обратного преобразования зума. Все окна около 5 секунд чтобы уложиться в один GPU allocation на ZeroGPU.
#characterswap
VK | MAX
Демоспейс с продвинутой оберткой над Viggle Animate для замен персонажа в сложных сценах. Когда герой отворачивается уходит в толпу или возвращается мелким планом идентичность не теряется.
Два режима. Standard — прямая длинная генерация. Smart — полный пайплайн: трекинг точек (TAPNext++), контроль камеры (SAM), динамический зум, Pass A и опциональный Pass B для восстановления личности.
Pass B работает так: после потери персонажа из кадра берется кадр где он снова виден, перерисовывается внешность, генерируется обратно-вперед вокруг точки сбоя и встраивается до обратного преобразования зума. Все окна около 5 секунд чтобы уложиться в один GPU allocation на ZeroGPU.
#characterswap
VK | MAX
👍4
#gaussian
offlinetools.io/colmap - COLMAP в браузере. Камера, облако точек, маски. #photogrammetry
github.com/ooolabdev/ooosplat - OOOSplat: десктоп-приложение, видео/фото → гауссианы в один клик. COLMAP, тренировка, превью, редактирование, экспорт
github.com/mlslabs/MLSLabsGaussianSplattingRenderer-UE - обновился плагин для #UE : Vulkan вместо LibTorch, AMD
github.com/WilliamLiu-1997/Gaussian-Splat-Lite - облегченная реализация 3DGS
gphyx.com - gSplatting 2.0 плагин для Final Cut Pro: эдитор пути камеры, 3D-объекты с окклюзией #FCP youtu.be/pvmV_JA9LCs
github.com/PozzettiAndrea/ComfyUI-LiTo
github.com/Ltamann/Comfyui-TBG-LiTo - ноды Apple LiTo для #ComfyUI
liquiduslabs.com/lulusplat - LuLuSplat v1.1.0 для #Mac
github.com/quixbrics/gausseous - еще один инструмент сплатов попробовать
VK | MAX
offlinetools.io/colmap - COLMAP в браузере. Камера, облако точек, маски. #photogrammetry
github.com/ooolabdev/ooosplat - OOOSplat: десктоп-приложение, видео/фото → гауссианы в один клик. COLMAP, тренировка, превью, редактирование, экспорт
github.com/mlslabs/MLSLabsGaussianSplattingRenderer-UE - обновился плагин для #UE : Vulkan вместо LibTorch, AMD
github.com/WilliamLiu-1997/Gaussian-Splat-Lite - облегченная реализация 3DGS
gphyx.com - gSplatting 2.0 плагин для Final Cut Pro: эдитор пути камеры, 3D-объекты с окклюзией #FCP youtu.be/pvmV_JA9LCs
github.com/PozzettiAndrea/ComfyUI-LiTo
github.com/Ltamann/Comfyui-TBG-LiTo - ноды Apple LiTo для #ComfyUI
liquiduslabs.com/lulusplat - LuLuSplat v1.1.0 для #Mac
github.com/quixbrics/gausseous - еще один инструмент сплатов попробовать
VK | MAX
👍7🔥2❤1
ComposeCL
Давно ничего не постил про память LLM
Исследование о том как языковые модели могут запоминать информацию поступающую последовательно и не забывать ее после десятков обновлений. Обычное дообучение на новых задачах стирает старые знания — ComposeCL проверяет какие комбинации механизмов продолжающегося обучения работают лучше всего
- Систематический тест 16 комбинаций 4 механизмов: якорь данных (генеративный реплей), якорь функции (самодистилляция), якорь весов (Synaptic Intelligence) и merged LoRA
- Лучшая комбинация всех 3 якорей + merged LoRA дает 34.9%
- Якорь данных и merged LoRA дают наибольший прирост
- 34.9% среднее финальное удержание против 1.2% у наивного обучения
- Топ-3 на 3 датасетах у одной фиксированной композиции всех механизмов
Вывод: для долгоживущих агентов нужно не выбирать один механизм а комбинировать несколько комплементарных
Гитхаб
#memory
Давно ничего не постил про память LLM
Исследование о том как языковые модели могут запоминать информацию поступающую последовательно и не забывать ее после десятков обновлений. Обычное дообучение на новых задачах стирает старые знания — ComposeCL проверяет какие комбинации механизмов продолжающегося обучения работают лучше всего
- Систематический тест 16 комбинаций 4 механизмов: якорь данных (генеративный реплей), якорь функции (самодистилляция), якорь весов (Synaptic Intelligence) и merged LoRA
- Лучшая комбинация всех 3 якорей + merged LoRA дает 34.9%
- Якорь данных и merged LoRA дают наибольший прирост
- 34.9% среднее финальное удержание против 1.2% у наивного обучения
- Топ-3 на 3 датасетах у одной фиксированной композиции всех механизмов
Вывод: для долгоживущих агентов нужно не выбирать один механизм а комбинировать несколько комплементарных
Гитхаб
#memory
👍8
This media is not supported in your browser
VIEW IN TELEGRAM
CocktailASR-1 (Xiaomi)
Распознавание речи, #sota на мультиспикер, заявлены английский и китайский
В демо распознавание одного целевого говорящего в шумной обстановке. Сначала извлекает голос конкретного человека по короткому референсу потом расшифровывает его. Остальные голоса и шум игнорируются
- Двухстадийная обработка: извлечение голоса цели по референсу + ASR на чистом сигнале
- Работает в шуме с несколькими говорящими — фон и посторонние голоса не попадают в распознавание
- Короткий референс голоса (до 3 секунд) достаточно чтобы выделить цель
Гитхаб
HF
Демо
Спасибо @m_franz
#asr
VK | MAX
Распознавание речи, #sota на мультиспикер, заявлены английский и китайский
В демо распознавание одного целевого говорящего в шумной обстановке. Сначала извлекает голос конкретного человека по короткому референсу потом расшифровывает его. Остальные голоса и шум игнорируются
- Двухстадийная обработка: извлечение голоса цели по референсу + ASR на чистом сигнале
- Работает в шуме с несколькими говорящими — фон и посторонние голоса не попадают в распознавание
- Короткий референс голоса (до 3 секунд) достаточно чтобы выделить цель
Гитхаб
HF
Демо
Спасибо @m_franz
#asr
VK | MAX
👍6🤷♂1
Накопилось по #minimaxH3 - часть 24
github.com/MiniMax-AI/MiniMax-H3/tree/main/skills - #Skill папка в официальном репозитории H3. 8 стилевых скиллов
huggingface.co/Asirus/TaoMate_H3_3_Step_LoRA - ещe 2 ComfyUI-версии TaoMate
github.com/Code2Collapse/ComfyUI-CustomNodePacks - нода для стабилизации видео #stabilize
huggingface.co/Comfy-Org/MiniMax-H3/tree/main/vae - #VAE INT8 перезалили, обновленная версия
Замена #ControlNet-pose — расширение кадра через аутпейнт дает стабильное движение даже при несовместимых пропорциях тела pastebin.com/BUBUJpwK #workflow #pose2video
huggingface.co/spaces/multimodalart/h3-acceleration-arena - лидерборд пополнился VDN-H3, TaoMate H3, LightX2V 1.2
huggingface.co/FastVideo/FastVideo-FastH3-8-Step-V2 - обновился ускоритель. Воркфлоу:
t2v
github.com/Comfy-Org/workflow_templates/blob/main/templates/video_fastvideo_fasth3_t2v.json
i2v
github.com/Comfy-Org/workflow_templates/blob/main/templates/video_fastvideo_fasth3_i2v.json
github.com/spacesimeco-hue/Chain-Motion-AI-Video-Editor - видеоредактор поверх #ComfyUI в браузере: таймлайн, библиотека ассетов, регенерирование сегментов
github.com/aa335615543-ux/BUNNY_H3_Conditioning_Bridge и huggingface.co/JOKER141/BUNNY_H3_Conditioning_Bridge - адаптер кондиционирования для H3, который чинит кто что делает в видео
github.com/vizart-vj/ComfyUI-MiniMax-H3-LongMedia - обновился кастом пак для генерации длинных видео от @vj_vizart
github.com/MiniMax-AI/MiniMax-H3/tree/main/skills - #Skill папка в официальном репозитории H3. 8 стилевых скиллов
huggingface.co/Asirus/TaoMate_H3_3_Step_LoRA - ещe 2 ComfyUI-версии TaoMate
github.com/Code2Collapse/ComfyUI-CustomNodePacks - нода для стабилизации видео #stabilize
huggingface.co/Comfy-Org/MiniMax-H3/tree/main/vae - #VAE INT8 перезалили, обновленная версия
Замена #ControlNet-pose — расширение кадра через аутпейнт дает стабильное движение даже при несовместимых пропорциях тела pastebin.com/BUBUJpwK #workflow #pose2video
huggingface.co/spaces/multimodalart/h3-acceleration-arena - лидерборд пополнился VDN-H3, TaoMate H3, LightX2V 1.2
huggingface.co/FastVideo/FastVideo-FastH3-8-Step-V2 - обновился ускоритель. Воркфлоу:
t2v
github.com/Comfy-Org/workflow_templates/blob/main/templates/video_fastvideo_fasth3_t2v.json
i2v
github.com/Comfy-Org/workflow_templates/blob/main/templates/video_fastvideo_fasth3_i2v.json
github.com/spacesimeco-hue/Chain-Motion-AI-Video-Editor - видеоредактор поверх #ComfyUI в браузере: таймлайн, библиотека ассетов, регенерирование сегментов
github.com/aa335615543-ux/BUNNY_H3_Conditioning_Bridge и huggingface.co/JOKER141/BUNNY_H3_Conditioning_Bridge - адаптер кондиционирования для H3, который чинит кто что делает в видео
github.com/vizart-vj/ComfyUI-MiniMax-H3-LongMedia - обновился кастом пак для генерации длинных видео от @vj_vizart
👍16
Odyssey-3
Модели мира выруливают в прикладную нишу где есть потенциал для монетизации - #embodied AI, то бишь роботы
Odyssey-3 - фундаментальная мировая модель общего назначения. Одна обученная нейросеть управляет роботами, человекоподобными, дронами, автомобилями и видеоиграми. Претрейн дает понимание физики и причинно-следственных связей, а для новой задачи нужно всего несколько часов попутных данных
- Роборуки
- Человекоподобные роботы
- Автономное вождение
- Дроны
- Видеоигры: GTA V, перенос навыков в RDR 2 и Sleeping Dogs без дополнительного обучения
- Ну и собственно создавать интерактивные миры тоже умеет
- Публичный релиз ждем в ближайшие недели
Спасибо @Endorpheen
#world #interactive #agent
VK | MAX
Модели мира выруливают в прикладную нишу где есть потенциал для монетизации - #embodied AI, то бишь роботы
Odyssey-3 - фундаментальная мировая модель общего назначения. Одна обученная нейросеть управляет роботами, человекоподобными, дронами, автомобилями и видеоиграми. Претрейн дает понимание физики и причинно-следственных связей, а для новой задачи нужно всего несколько часов попутных данных
- Роборуки
- Человекоподобные роботы
- Автономное вождение
- Дроны
- Видеоигры: GTA V, перенос навыков в RDR 2 и Sleeping Dogs без дополнительного обучения
- Ну и собственно создавать интерактивные миры тоже умеет
- Публичный релиз ждем в ближайшие недели
Спасибо @Endorpheen
#world #interactive #agent
VK | MAX
🔥7👍3
This media is not supported in your browser
VIEW IN TELEGRAM
EventEgoHands++ (Keio University)
Реконструкция 3D-модели кистей рук по данным event-камеры с точки зрения первого лица. Обычные камеры слепнут в темноте и от смаза при движении, event-камера фиксирует только изменения яркости — работает и в почти полной темноте
- Отдельный Hand Detector: различает левую и правую руку по-отдельности с bounding-box и масками
- Adaptive Attention: динамически гейтирует внимание по результатам детекции — моделирует взаимодействие и взаимное расположение двух рук
- Работает при плохом освещении и сильном смазе где RGB и depth пасуют
- Определяет сколько рук в кадре: одна две или ни одной
Гитхаб
#hands #videoto3d
VK | MAX
Реконструкция 3D-модели кистей рук по данным event-камеры с точки зрения первого лица. Обычные камеры слепнут в темноте и от смаза при движении, event-камера фиксирует только изменения яркости — работает и в почти полной темноте
- Отдельный Hand Detector: различает левую и правую руку по-отдельности с bounding-box и масками
- Adaptive Attention: динамически гейтирует внимание по результатам детекции — моделирует взаимодействие и взаимное расположение двух рук
- Работает при плохом освещении и сильном смазе где RGB и depth пасуют
- Определяет сколько рук в кадре: одна две или ни одной
Гитхаб
#hands #videoto3d
VK | MAX
👍6🔥2
Meridian
Еще одна модель от Viggle AI на базе #MiniMaxH3
Генерирует новые ракурсы уже снятого видео. Возвращается к моменту события и снимает его заново с камеры которую выбирает юзер
Возможности:
- Камера: орбита, наезд, панорама, подъем — путь из нескольких ключевых кадров
- Буллет-тайм
- Замедление и ускорение
- Работает и от одного изображения
VGGT-Omega строит геометрию и позиции камер из исходного видео, рендерится варп-референс вдоль выбранного пути, а Meridian дорисовывает скрытые области
Файнтюн трансформера MiniMax-H3 без текст-энкодера на инференсе, 61.7 ГБ bf16 + LoRA 2.5 ГБ, 4 шага. Выход 768p
Большие движения камеры дают артефакты, скрытые поверхности не восстанавливаются а генерируются. Пока только на B200
HF
Демо
#cameracontrol #novelview
VK | MAX
Еще одна модель от Viggle AI на базе #MiniMaxH3
Генерирует новые ракурсы уже снятого видео. Возвращается к моменту события и снимает его заново с камеры которую выбирает юзер
Возможности:
- Камера: орбита, наезд, панорама, подъем — путь из нескольких ключевых кадров
- Буллет-тайм
- Замедление и ускорение
- Работает и от одного изображения
VGGT-Omega строит геометрию и позиции камер из исходного видео, рендерится варп-референс вдоль выбранного пути, а Meridian дорисовывает скрытые области
Файнтюн трансформера MiniMax-H3 без текст-энкодера на инференсе, 61.7 ГБ bf16 + LoRA 2.5 ГБ, 4 шага. Выход 768p
Большие движения камеры дают артефакты, скрытые поверхности не восстанавливаются а генерируются. Пока только на B200
HF
Демо
#cameracontrol #novelview
VK | MAX
🔥9👍6❤2
FoundationStereo и FoundationPose (NVIDIA)
Две открытые модели для 3D-перцепции из систем Vision AI
FoundationStereo
Стерео-глубина без дообучения. Пара RGB-картинок со стереокамеры на входе, точная карта диспаритета на выходе.
• Zero-shot стерео-матчинг на новых сценах
• Для робототехники промышленности и умных пространств
• ONNX и TensorRT
• Работает от Jetson до H100
Слабые места: прозрачные объекты пересвет и плохое освещение.
FoundationPose
6-DoF поза объектов без обучения. CAD-модель -> положение и ориентация объекта на RGBD-кадре плюс трекинг по видео
• Zero-shot на новых объектах нужен только CAD
• Оценка позы и отслеживание на видео
• Обучена на synthetic-данных Objaverse и GSO
• Средний скор 83.3 на BOP-бенчмарках
• TensorRT работает от Orin Nano до H100
#stereo2depth #image2depth #image2pose
Две открытые модели для 3D-перцепции из систем Vision AI
FoundationStereo
Стерео-глубина без дообучения. Пара RGB-картинок со стереокамеры на входе, точная карта диспаритета на выходе.
• Zero-shot стерео-матчинг на новых сценах
• Для робототехники промышленности и умных пространств
• ONNX и TensorRT
• Работает от Jetson до H100
Слабые места: прозрачные объекты пересвет и плохое освещение.
FoundationPose
6-DoF поза объектов без обучения. CAD-модель -> положение и ориентация объекта на RGBD-кадре плюс трекинг по видео
• Zero-shot на новых объектах нужен только CAD
• Оценка позы и отслеживание на видео
• Обучена на synthetic-данных Objaverse и GSO
• Средний скор 83.3 на BOP-бенчмарках
• TensorRT работает от Orin Nano до H100
#stereo2depth #image2depth #image2pose
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Вы же наверняка слышали про Microduck
Так вот туда прикрутили цифровую копию мозга мухи. Ее буквально пересадили посмертно в новое кибертело. И вы тоже можете завести себе такую уткомуху, цена вопроса $400
Киберпанк. Начало
#robot #embodied
VK | MAX
Так вот туда прикрутили цифровую копию мозга мухи. Ее буквально пересадили посмертно в новое кибертело. И вы тоже можете завести себе такую уткомуху, цена вопроса $400
Киберпанк. Начало
#robot #embodied
VK | MAX
🤯5👍4
StepAudio 3
Новые модели от Степана
StepAudio 3 Realtime
Полнодуплексная аудио-языковая модель. Говорит и слушает одновременно, размышляет вслух не замолкая
китайский и английский
StepAudio 3 Music
Генерация песен: планирует структуру (куплеты, припев, бридж, аранжировку), создает 48-kHz стерео до 5м 30с
язык задается описанием песни
Помимо этого в семейство вошли говорилка с дизайном голоса Gen, TTS и ASR
китайский, английский, японский, корейский, французский, испанский
Voice Studio - пока только разговорная, музыка анонсирована
#musicediting #dialog #asr #tts #voicedesign
Новые модели от Степана
StepAudio 3 Realtime
Полнодуплексная аудио-языковая модель. Говорит и слушает одновременно, размышляет вслух не замолкая
китайский и английский
StepAudio 3 Music
Генерация песен: планирует структуру (куплеты, припев, бридж, аранжировку), создает 48-kHz стерео до 5м 30с
язык задается описанием песни
Помимо этого в семейство вошли говорилка с дизайном голоса Gen, TTS и ASR
китайский, английский, японский, корейский, французский, испанский
Voice Studio - пока только разговорная, музыка анонсирована
#musicediting #dialog #asr #tts #voicedesign
👍7🥴2🤷♂1❤1
Нативная поддержка гауссиан в Blender 5.3
Похоже что и редактирование в том числе
#gaussian #blender
VK | MAX
Похоже что и редактирование в том числе
#gaussian #blender
VK | MAX
🔥7❤4👍4🍌3😱1