FoundationStereo и FoundationPose (NVIDIA)
Две открытые модели для 3D-перцепции из систем Vision AI
FoundationStereo
Стерео-глубина без дообучения. Пара RGB-картинок со стереокамеры на входе, точная карта диспаритета на выходе.
• Zero-shot стерео-матчинг на новых сценах
• Для робототехники промышленности и умных пространств
• ONNX и TensorRT
• Работает от Jetson до H100
Слабые места: прозрачные объекты пересвет и плохое освещение.
FoundationPose
6-DoF поза объектов без обучения. CAD-модель -> положение и ориентация объекта на RGBD-кадре плюс трекинг по видео
• Zero-shot на новых объектах нужен только CAD
• Оценка позы и отслеживание на видео
• Обучена на synthetic-данных Objaverse и GSO
• Средний скор 83.3 на BOP-бенчмарках
• TensorRT работает от Orin Nano до H100
#stereo2depth #image2depth #image2pose
Две открытые модели для 3D-перцепции из систем Vision AI
FoundationStereo
Стерео-глубина без дообучения. Пара RGB-картинок со стереокамеры на входе, точная карта диспаритета на выходе.
• Zero-shot стерео-матчинг на новых сценах
• Для робототехники промышленности и умных пространств
• ONNX и TensorRT
• Работает от Jetson до H100
Слабые места: прозрачные объекты пересвет и плохое освещение.
FoundationPose
6-DoF поза объектов без обучения. CAD-модель -> положение и ориентация объекта на RGBD-кадре плюс трекинг по видео
• Zero-shot на новых объектах нужен только CAD
• Оценка позы и отслеживание на видео
• Обучена на synthetic-данных Objaverse и GSO
• Средний скор 83.3 на BOP-бенчмарках
• TensorRT работает от Orin Nano до H100
#stereo2depth #image2depth #image2pose
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Вы же наверняка слышали про Microduck
Так вот туда прикрутили цифровую копию мозга мухи. Ее буквально пересадили посмертно в новое кибертело. И вы тоже можете завести себе такую уткомуху, цена вопроса $400
Киберпанк. Начало
#robot #embodied
VK | MAX
Так вот туда прикрутили цифровую копию мозга мухи. Ее буквально пересадили посмертно в новое кибертело. И вы тоже можете завести себе такую уткомуху, цена вопроса $400
Киберпанк. Начало
#robot #embodied
VK | MAX
🤯5👍4
StepAudio 3
Новые модели от Степана
StepAudio 3 Realtime
Полнодуплексная аудио-языковая модель. Говорит и слушает одновременно, размышляет вслух не замолкая
китайский и английский
StepAudio 3 Music
Генерация песен: планирует структуру (куплеты, припев, бридж, аранжировку), создает 48-kHz стерео до 5м 30с
язык задается описанием песни
Помимо этого в семейство вошли говорилка с дизайном голоса Gen, TTS и ASR
китайский, английский, японский, корейский, французский, испанский
Voice Studio - пока только разговорная, музыка анонсирована
#musicediting #dialog #asr #tts #voicedesign
Новые модели от Степана
StepAudio 3 Realtime
Полнодуплексная аудио-языковая модель. Говорит и слушает одновременно, размышляет вслух не замолкая
китайский и английский
StepAudio 3 Music
Генерация песен: планирует структуру (куплеты, припев, бридж, аранжировку), создает 48-kHz стерео до 5м 30с
язык задается описанием песни
Помимо этого в семейство вошли говорилка с дизайном голоса Gen, TTS и ASR
китайский, английский, японский, корейский, французский, испанский
Voice Studio - пока только разговорная, музыка анонсирована
#musicediting #dialog #asr #tts #voicedesign
👍7🥴2🤷♂1❤1
Нативная поддержка гауссиан в Blender 5.3
Похоже что и редактирование в том числе
#gaussian #blender
VK | MAX
Похоже что и редактирование в том числе
#gaussian #blender
VK | MAX
🔥7❤4👍4🍌3😱1
This media is not supported in your browser
VIEW IN TELEGRAM
LynnReal-Omni
Единая модель на базе #MiniMaxH3 для всех видео-задач: #t2v, #i2v, генерация по позе, structural control, omni-reference generation, #styletransfer, видео-редактирование, восстановление деградированного видео и стриминг длинных видео. 4 шага
Принимает разнородные входы — референсы внешности, 3D-рендеры, записи игр. Агент может компоновать условия внутри одной модели
LynnReal-Omni-Flash (27B, 3 шага) — ускоренная с легким VAE-декодером. На одном H100 генерация + декодинг 22 кадров 540p: 843 ms (Standard), 377 ms (Flash). Основа для #realtime стриминга.
Гитхаб
ComfyUI
#comfyui #videoediting #controlnet #videorestoration #imageediting
Единая модель на базе #MiniMaxH3 для всех видео-задач: #t2v, #i2v, генерация по позе, structural control, omni-reference generation, #styletransfer, видео-редактирование, восстановление деградированного видео и стриминг длинных видео. 4 шага
Принимает разнородные входы — референсы внешности, 3D-рендеры, записи игр. Агент может компоновать условия внутри одной модели
LynnReal-Omni-Flash (27B, 3 шага) — ускоренная с легким VAE-декодером. На одном H100 генерация + декодинг 22 кадров 540p: 843 ms (Standard), 377 ms (Flash). Основа для #realtime стриминга.
Гитхаб
ComfyUI
#comfyui #videoediting #controlnet #videorestoration #imageediting
🔥9👍2
Hypit
скилл превращает ролик в редактируемый шаблон для новых видео
агент через команду
Собирает повторно запускаемый workflow. Кадры, субтитры, перебивки и эффекты привязаны к словам, а не к секундам на таймлайне.
Дальше можно поменять ведущего, тему или часть материалов и собрать новую версию в той же структуре. В примерах - рейтинг, подкаст и уличное интервью. Для одного шаблона показаны варианты с другими персонажами и сюжетами.
#skill #videoediting
VK | MAX
скилл превращает ролик в редактируемый шаблон для новых видео
агент через команду
/hypit получает язык разметки SVML и систему для создания видеоСобирает повторно запускаемый workflow. Кадры, субтитры, перебивки и эффекты привязаны к словам, а не к секундам на таймлайне.
Дальше можно поменять ведущего, тему или часть материалов и собрать новую версию в той же структуре. В примерах - рейтинг, подкаст и уличное интервью. Для одного шаблона показаны варианты с другими персонажами и сюжетами.
#skill #videoediting
VK | MAX
👍6❤2🔥1🥴1
Jev - System One
TypeSafe AI переизобрели классификацию и подают это как превосходящую альтернативу LLM (на задачах классификации и скоринга)
Обычные LLM пишут ответ токен за токеном и отдают строку. Ее надо парсить и валидировать, а модель в любой момент может сойти с рельсов и выдать галлюцинацию. У Jev структура ответа задана схемой заранее, варианты просчитываются параллельно одним запросом, на выходе типизированные данные с калиброванными вероятностями.
Классификация и скоринг: до 200 раз быстрее и в 450 раз дешевле классических LLM. Вход стоит $0,042 за миллион токенов, выход бесплатный.
Для бэкенда и автоматизации это готовое решение с уровнем уверенности, а не текст для разбора. Софт получает вероятности напрямую - как вызов функции с интеллектом.
Автор - выходеw из OpenAI, участвовавший в работе над методами, которые легли в основу ChatGPT
#classification #automation
TypeSafe AI переизобрели классификацию и подают это как превосходящую альтернативу LLM (на задачах классификации и скоринга)
Обычные LLM пишут ответ токен за токеном и отдают строку. Ее надо парсить и валидировать, а модель в любой момент может сойти с рельсов и выдать галлюцинацию. У Jev структура ответа задана схемой заранее, варианты просчитываются параллельно одним запросом, на выходе типизированные данные с калиброванными вероятностями.
Классификация и скоринг: до 200 раз быстрее и в 450 раз дешевле классических LLM. Вход стоит $0,042 за миллион токенов, выход бесплатный.
Для бэкенда и автоматизации это готовое решение с уровнем уверенности, а не текст для разбора. Софт получает вероятности напрямую - как вызов функции с интеллектом.
Автор - выходеw из OpenAI, участвовавший в работе над методами, которые легли в основу ChatGPT
#classification #automation
🔥10👍7❤1
Media is too big
VIEW IN TELEGRAM
VC-Attention
ускорение генерации видео до 1.7x от Nunchux AI
Стандартное внимание в диффузионных трансформерах замедляет генерацию видео: все вычисления в FP32, много лишних операций. VC-Attention решает это без переобучения модели.
V-Smooth группирует похожие токены и снижает ошибку квантования значений. ExpCast-FP8 меняет экспоненту в FP32 на прямой перевод результатов в FP8
На RTX 5090 внимание Wan2.2 ускорилось в 3.58 раза, полная генерация в 1.7 раза
Проверили на Wan2.2, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3
Nunchux Attention - проприетарное расширение VC-Attention. Усоряет MiniMax-H3 в 1.91x против BF16 FlashAttention-4 на B200
Бесплатный доступ для H3 обещают скоро открыть
Вейтлист
Спасибо @Endorpheen
#optimization
VK | MAX
ускорение генерации видео до 1.7x от Nunchux AI
Стандартное внимание в диффузионных трансформерах замедляет генерацию видео: все вычисления в FP32, много лишних операций. VC-Attention решает это без переобучения модели.
V-Smooth группирует похожие токены и снижает ошибку квантования значений. ExpCast-FP8 меняет экспоненту в FP32 на прямой перевод результатов в FP8
На RTX 5090 внимание Wan2.2 ускорилось в 3.58 раза, полная генерация в 1.7 раза
Проверили на Wan2.2, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3
Nunchux Attention - проприетарное расширение VC-Attention. Усоряет MiniMax-H3 в 1.91x против BF16 FlashAttention-4 на B200
Бесплатный доступ для H3 обещают скоро открыть
Вейтлист
Спасибо @Endorpheen
#optimization
VK | MAX
👍7❤2
HiDream-O1-Video-1.0 (HD-V1)
Первая нативная omni-modal видеомодель от HIDream. Вход - текст, картинка и видео, выход - киношные клипы 1080p длиной 5-20 секунд.
• Физика в основе движения и динамики
• Глубокое понимание замысла до генерации
• Длительность решает сюжет, а не фиксированные промпты
• Нативная синхронизация аудио и видео, без артефактов пост-даббинга
#4 на Artificial Analysis Image-to-Video (With Audio)
#8 на Arena.ai Image-to-Video
Раньше генеративные видео игнорировали физику: объекты плавились и проходили сквозь стены. Модель заземлена на реальные законы мира, поэтому студии и независимые авторы смогут делать превизуализацию и спецэффекты без ошибок симуляции.
Пока только API
#i2v #i2av
VK | MAX
Первая нативная omni-modal видеомодель от HIDream. Вход - текст, картинка и видео, выход - киношные клипы 1080p длиной 5-20 секунд.
• Физика в основе движения и динамики
• Глубокое понимание замысла до генерации
• Длительность решает сюжет, а не фиксированные промпты
• Нативная синхронизация аудио и видео, без артефактов пост-даббинга
#4 на Artificial Analysis Image-to-Video (With Audio)
#8 на Arena.ai Image-to-Video
Раньше генеративные видео игнорировали физику: объекты плавились и проходили сквозь стены. Модель заземлена на реальные законы мира, поэтому студии и независимые авторы смогут делать превизуализацию и спецэффекты без ошибок симуляции.
Пока только API
#i2v #i2av
VK | MAX
👍5
#krea2
huggingface.co/jimmycarter/krea2-turbo-bbox - файнтюн для макета: панели комиксов, пузыри с текстом, идентичность персонажа. Требует PROMPTING.md
civitai.com/models/2942217/krea-2-pixel-art - #LoRA для пиксель-арта
github.com/envy-ai/ComfyUI-Krea2-Pixel-Art-Refiner - постпроцессинг пиксель-арта
huggingface.co/Cierpliwy/krea2_lineart_edit - LoRA для Krea 2 Raw: перевод лайнарта в полноценное изображение
github.com/aoleg/krea-2-merge-tool - GUI-мержер чекпоинтов и лор
huggingface.co/lvladikov/Krea2-Turbo-Distill-4step-LoRA - дистилляция Turbo 8→4 шага, ~1.6x быстрее
huggingface.co/lvladikov/Krea2-Turbo-Distill-2step-LoRA - дистилляция 8→2 шага
github.com/sempersatirica/comfy-workflows - набор #workflow: Krea 2 #charactersheet и composite, H3 детайлеры (SAM3, Yolo) и генераторы промптов, Qwen Image Edit эмплейсмент
civitai.red/models/2916843/instafame - #realism под Instagram
youtu.be/chhyJ8FgIFk?si=m9oM5EwcXppTA6Sb
drive.google.com/drive/u/4/folders/1pnjDEX6DGR-sQjqWFhZBQGgTbRnqZoVI
#workflow Character Sheet #t2i для #MiniMaxH3
civitai.com/models/2926098/updated-v2-turn-any-photo-into-a-full-character-sheet-using-krea2-free-workflow - фото → полный #charactersheet в #ComfyUI #i2i
huggingface.co/jimmycarter/krea2-turbo-bbox - файнтюн для макета: панели комиксов, пузыри с текстом, идентичность персонажа. Требует PROMPTING.md
civitai.com/models/2942217/krea-2-pixel-art - #LoRA для пиксель-арта
github.com/envy-ai/ComfyUI-Krea2-Pixel-Art-Refiner - постпроцессинг пиксель-арта
huggingface.co/Cierpliwy/krea2_lineart_edit - LoRA для Krea 2 Raw: перевод лайнарта в полноценное изображение
github.com/aoleg/krea-2-merge-tool - GUI-мержер чекпоинтов и лор
huggingface.co/lvladikov/Krea2-Turbo-Distill-4step-LoRA - дистилляция Turbo 8→4 шага, ~1.6x быстрее
huggingface.co/lvladikov/Krea2-Turbo-Distill-2step-LoRA - дистилляция 8→2 шага
github.com/sempersatirica/comfy-workflows - набор #workflow: Krea 2 #charactersheet и composite, H3 детайлеры (SAM3, Yolo) и генераторы промптов, Qwen Image Edit эмплейсмент
civitai.red/models/2916843/instafame - #realism под Instagram
youtu.be/chhyJ8FgIFk?si=m9oM5EwcXppTA6Sb
drive.google.com/drive/u/4/folders/1pnjDEX6DGR-sQjqWFhZBQGgTbRnqZoVI
#workflow Character Sheet #t2i для #MiniMaxH3
civitai.com/models/2926098/updated-v2-turn-any-photo-into-a-full-character-sheet-using-krea2-free-workflow - фото → полный #charactersheet в #ComfyUI #i2i
👍15