🤖 معرفی SenseNova-Vision: مدل جامع بینایی ماشین
شرکت SenseTime مدل جدید SenseNova-Vision را به عنوان یک راهکار یکپارچه در حوزه Computer Vision منتشر کرد. این مدل برخلاف روشهای سنتی که برای هر وظیفه مانند تشخیص اشیاء یا تخمین عمق از ماژولهای مجزا استفاده میکنند، تمام فرآیندها را به صورت تولید متن، تصویر یا ترکیبی انجام میدهد.
🧠 ساختار این مدل بر پایه معماری Bagel-7B-MoT (ترکیب متخصصان) بنا شده که شامل ۲ بخش تخصصی با وزنهای مجزا برای درک متن/تصویر و تولید تصاویر است. در این سیستم، توکنها بهجای مسیریابی پویا، به صورت ثابت بر اساس نوع داده توزیع میشوند تا خروجیهایی نظیر مختصات و نقشه عمق تولید شود.
⚡ در بنچمارکهای انجام شده، این مدل در وظایف مبتنی بر متن ساختاریافته مانند تشخیص اشیاء در صحنههای شلوغ و لوکالیزاسیون متن پیشتاز است. با این حال، در حوزه هندسه 3D چندنمایی نسبت به مدلهای تخصصی مانند Depth Anything 3 ضعیفتر عمل میکند.
📄 مقاله arXiv
#SenseNova_Vision #MoT
شرکت SenseTime مدل جدید SenseNova-Vision را به عنوان یک راهکار یکپارچه در حوزه Computer Vision منتشر کرد. این مدل برخلاف روشهای سنتی که برای هر وظیفه مانند تشخیص اشیاء یا تخمین عمق از ماژولهای مجزا استفاده میکنند، تمام فرآیندها را به صورت تولید متن، تصویر یا ترکیبی انجام میدهد.
🧠 ساختار این مدل بر پایه معماری Bagel-7B-MoT (ترکیب متخصصان) بنا شده که شامل ۲ بخش تخصصی با وزنهای مجزا برای درک متن/تصویر و تولید تصاویر است. در این سیستم، توکنها بهجای مسیریابی پویا، به صورت ثابت بر اساس نوع داده توزیع میشوند تا خروجیهایی نظیر مختصات و نقشه عمق تولید شود.
⚡ در بنچمارکهای انجام شده، این مدل در وظایف مبتنی بر متن ساختاریافته مانند تشخیص اشیاء در صحنههای شلوغ و لوکالیزاسیون متن پیشتاز است. با این حال، در حوزه هندسه 3D چندنمایی نسبت به مدلهای تخصصی مانند Depth Anything 3 ضعیفتر عمل میکند.
📄 مقاله arXiv
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#SenseNova_Vision #MoT
❤1