This media is not supported in your browser
VIEW IN TELEGRAM
🎙️ ابزار رایگان و قدرتمند Voice-Pro برای پردازش صوت و ویدیو
پروژه Voice-Pro یک مجموعه ابزار جامع و متنباز است که بسیاری از نیازهای پردازش صوت و ویدیو را با استفاده از مدلهای هوش مصنوعی پوشش میدهد. این ابزار به دلیل یکپارچگی بالا، گزینهای عالی برای کسانی است که به دنبال راهکاری سریع برای تولید و ویرایش محتوای چندرسانهای هستند.
مهمترین قابلیتهای این پروژه شامل موارد زیر است:
• تبدیل دقیق صوت و ویدیو به متن با استفاده از مدل Whisper
• تولید صدای مصنوعی (TTS) از متن ورودی
• کلون کردن دقیق صدا تنها با یک نمونه کوتاه
• ترجمه و دوبله هوشمند محتوا به بیش از ۱۰۰ زبان زنده دنیا
• جدا کردن هوشمند صدای خواننده از فایل موسیقی
• پردازش مستقیم محتوای موجود در YouTube
این ابزار با تمرکز بر سادگی در استفاده، تمامی این عملیات پیچیده را در یک محیط واحد برای کاربر فراهم کرده است. اگر به دنبال جایگزینی رایگان برای ابزارهای گرانقیمت تدوین و پردازش صوتی هستید، این پروژه در گیتهاب قابل دسترسی است.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science
پروژه Voice-Pro یک مجموعه ابزار جامع و متنباز است که بسیاری از نیازهای پردازش صوت و ویدیو را با استفاده از مدلهای هوش مصنوعی پوشش میدهد. این ابزار به دلیل یکپارچگی بالا، گزینهای عالی برای کسانی است که به دنبال راهکاری سریع برای تولید و ویرایش محتوای چندرسانهای هستند.
مهمترین قابلیتهای این پروژه شامل موارد زیر است:
• تبدیل دقیق صوت و ویدیو به متن با استفاده از مدل Whisper
• تولید صدای مصنوعی (TTS) از متن ورودی
• کلون کردن دقیق صدا تنها با یک نمونه کوتاه
• ترجمه و دوبله هوشمند محتوا به بیش از ۱۰۰ زبان زنده دنیا
• جدا کردن هوشمند صدای خواننده از فایل موسیقی
• پردازش مستقیم محتوای موجود در YouTube
این ابزار با تمرکز بر سادگی در استفاده، تمامی این عملیات پیچیده را در یک محیط واحد برای کاربر فراهم کرده است. اگر به دنبال جایگزینی رایگان برای ابزارهای گرانقیمت تدوین و پردازش صوتی هستید، این پروژه در گیتهاب قابل دسترسی است.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science
Media is too big
VIEW IN TELEGRAM
🚀 نبرد مدلهای هوش مصنوعی: Qwen 3.8 Max در برابر Opus 5
این روزها شاهد رقابت جذابی هستیم؛ مدلهای متنباز چینی بهخوبی توانستهاند با قدرتمندترین مدلهای بستهی جهان وارد رقابت مستقیم شوند.
در یک تست عملی، از مدلها خواسته شد تا یک نمونه اولیه از موتور بخار سهبعدی با استفاده از Three.js طراحی کنند. نتیجه این مقایسه نشان میدهد که مدلهای رایگان و قابل اجرا روی سیستم شخصی، فاصلهی بسیار کمی با مدلهای تجاری و گرانقیمت دارند.
مهمترین نکات این رقابت:
- تقابل یک مدل متنباز با مدلهای سطح بالای closed-source
- قابلیت اجرای محلی مدل Qwen برای کاهش هزینهها
- دقت بالا در تولید کدهای گرافیکی پیچیده
بهنظر شما، کدام مدل در پیادهسازی پروژههای فنی بهتر عمل میکند؟
#Qwen3_8Max #Threejs
این روزها شاهد رقابت جذابی هستیم؛ مدلهای متنباز چینی بهخوبی توانستهاند با قدرتمندترین مدلهای بستهی جهان وارد رقابت مستقیم شوند.
در یک تست عملی، از مدلها خواسته شد تا یک نمونه اولیه از موتور بخار سهبعدی با استفاده از Three.js طراحی کنند. نتیجه این مقایسه نشان میدهد که مدلهای رایگان و قابل اجرا روی سیستم شخصی، فاصلهی بسیار کمی با مدلهای تجاری و گرانقیمت دارند.
مهمترین نکات این رقابت:
- تقابل یک مدل متنباز با مدلهای سطح بالای closed-source
- قابلیت اجرای محلی مدل Qwen برای کاهش هزینهها
- دقت بالا در تولید کدهای گرافیکی پیچیده
بهنظر شما، کدام مدل در پیادهسازی پروژههای فنی بهتر عمل میکند؟
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Qwen3_8Max #Threejs
This media is not supported in your browser
VIEW IN TELEGRAM
هوش مصنوعی جدید گوگل برای ترجمه زبان اشاره
گوگل دیپمایند (Google DeepMind) به تازگی از مدل جدیدی به نام SL2T رونمایی کرده است که میتواند زبان اشاره را مستقیماً به متن تبدیل کند.
بسیاری از ابزارهای تبدیل گفتار به متن بر پایه صوت کار میکنند، اما زبانهای اشاره دارای ساختار دستوری مستقل و حرکات پیچیده سهبعدی هستند. این مدل جدید بهجای استفاده از تصاویر خام دوربین یا دستکشهای حسگر، از MediaPipe Holistic برای ردیابی مختصات نقاط کلیدی بدن استفاده میکند و سپس این دادههای فضایی را به متن تبدیل مینماید.
مهمترین ویژگیهای این فناوری:
* تبدیل مستقیم حرکات زبان اشاره به متن بدون نیاز به تایپ کردن.
* قابلیت استفاده برای جستجو، نوشتن پیام و شرکت در گفتگوهای زنده.
* عدم نیاز به سختافزارهای جانبی و پردازش محلی دادههای حرکتی.
این پیشرفت میتواند به بهبود دسترسیپذیری و ارتباطات دیجیتال برای جامعه ناشنوایان کمک شایانی کند.
#SL2T #MediaPipe_Holistic
گوگل دیپمایند (Google DeepMind) به تازگی از مدل جدیدی به نام SL2T رونمایی کرده است که میتواند زبان اشاره را مستقیماً به متن تبدیل کند.
بسیاری از ابزارهای تبدیل گفتار به متن بر پایه صوت کار میکنند، اما زبانهای اشاره دارای ساختار دستوری مستقل و حرکات پیچیده سهبعدی هستند. این مدل جدید بهجای استفاده از تصاویر خام دوربین یا دستکشهای حسگر، از MediaPipe Holistic برای ردیابی مختصات نقاط کلیدی بدن استفاده میکند و سپس این دادههای فضایی را به متن تبدیل مینماید.
مهمترین ویژگیهای این فناوری:
* تبدیل مستقیم حرکات زبان اشاره به متن بدون نیاز به تایپ کردن.
* قابلیت استفاده برای جستجو، نوشتن پیام و شرکت در گفتگوهای زنده.
* عدم نیاز به سختافزارهای جانبی و پردازش محلی دادههای حرکتی.
این پیشرفت میتواند به بهبود دسترسیپذیری و ارتباطات دیجیتال برای جامعه ناشنوایان کمک شایانی کند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#SL2T #MediaPipe_Holistic
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #87 | 📌 7 آیتم گزارش | 🧾 از 12 پست بررسیشده
🕐 شنبه 1405/05/24 ساعت 14:00 تا یکشنبه 1405/05/25 ساعت 14:00
🛡️ هوش مصنوعی و امنیت سایبری
📊 تکنولوژی و بنچمارکهای مدلها
🎓 آموزش و توسعه مهارتها
🗂 گزارش #87 | 📌 7 آیتم گزارش | 🧾 از 12 پست بررسیشده
🕐 شنبه 1405/05/24 ساعت 14:00 تا یکشنبه 1405/05/25 ساعت 14:00
🛡️ هوش مصنوعی و امنیت سایبری
سازمانهای دولتی تایوان هدف حمله سایبری ایجنتهای خودمختار هوش مصنوعی قرار گرفتند که در آن مهاجمان انسانی در کنار هوش مصنوعی برای شناسایی نقاط ضعف نفوذ میکردند.
🔗 مشاهده پست
پژوهشگر سابق OpenAI هشدار داد که مدلهای فعلی هوش مصنوعی قابلیت فنی لازم برای نفوذ به کیفپولهای دیجیتال و حسابهای بانکی را دارند و تهدیدی جدی محسوب میشوند.
🔗 مشاهده پست
📊 تکنولوژی و بنچمارکهای مدلها
نتایج بنچمارک ExtractBench نشان میدهد مدلهای VLM در تحلیل اسناد طولانی بالای ۵۰ صفحه، دقت بسیار پایینی دارند و اغلب صفحات میانی و انتهایی سند را نادیده میگیرند.
🔗 مشاهده پست
کمپانی Mistral مدل OCR خود را به نسخه 4.1 ارتقا داد. این نسخه در پردازش جداول فنی، نمودارها و اسناد چندستونه پیچیده دقت بسیار بالاتری نسبت به نسخههای قبلی دارد.
🔗 مشاهده پست
در مقایسه عملکرد Qwen 3.8 Max و Opus 5 برای کدنویسی سهبعدی، مدلهای متنباز چینی ثابت کردند که فاصلهی بسیار کمی با مدلهای تجاری و گرانقیمت دارند.
🔗 مشاهده پست
🎓 آموزش و توسعه مهارتها
آکادمی همراه اول مسیر یادگیری مشخصی را برای علاقهمندان به تحلیل داده طراحی کرده است تا افراد بدون سردرگمی، مهارتهای لازم برای ورود به این حوزه را بیاموزند.
🔗 مشاهده پست
اندرو انجی در نقشه راه جدید خود بر یادگیری بلوکهای سازنده LLM، تکنیکهای RAG و گردشکارهای عاملی (Agentic) به عنوان مهارتهای ضروری مهندسان هوش مصنوعی تأکید کرد.
🔗 مشاهده پست
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🔐 واترمارکگذاری در مدلهای زبانی مانند Claude
آیا تا به حال فکر کردهاید که چگونه میتوان متون تولید شده توسط هوش مصنوعی را شناسایی کرد؟ یکی از راهکارهای کلیدی، استفاده از سیستم Watermarking در لحظه استنتاج (Inference) است.
در مدلهای زبانی، برای تولید کلمه بعدی معمولاً چندین گزینه با احتمالات نزدیک وجود دارد. فرآیند واترمارکگذاری به این صورت عمل میکند:
- تغییر در نمونهبرداری: مدل از یک کلید مخفی (Secret Key) استفاده میکند تا از میان نامزدهای قابلقبول، کلمات خاصی را با الگوی آماری مشخص انتخاب کند.
- پنهانسازی: متن نهایی برای انسان کاملاً عادی و طبیعی به نظر میرسد.
- تشخیص آماری: با تکرار این انتخابها در طول متن، یک الگوی آماری منحصربهفرد شکل میگیرد که احتمال تصادفی بودن آن تقریباً صفر است.
این فناوری میتواند به صورت یکپارچه در کل زیرساخت مدل اعمال شود تا اصالت محتوا قابل رهگیری باشد. استفاده از این روش نشاندهنده تلاش شرکتها برای استانداردسازی خروجیهای هوش مصنوعی است.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
آیا تا به حال فکر کردهاید که چگونه میتوان متون تولید شده توسط هوش مصنوعی را شناسایی کرد؟ یکی از راهکارهای کلیدی، استفاده از سیستم Watermarking در لحظه استنتاج (Inference) است.
در مدلهای زبانی، برای تولید کلمه بعدی معمولاً چندین گزینه با احتمالات نزدیک وجود دارد. فرآیند واترمارکگذاری به این صورت عمل میکند:
- تغییر در نمونهبرداری: مدل از یک کلید مخفی (Secret Key) استفاده میکند تا از میان نامزدهای قابلقبول، کلمات خاصی را با الگوی آماری مشخص انتخاب کند.
- پنهانسازی: متن نهایی برای انسان کاملاً عادی و طبیعی به نظر میرسد.
- تشخیص آماری: با تکرار این انتخابها در طول متن، یک الگوی آماری منحصربهفرد شکل میگیرد که احتمال تصادفی بودن آن تقریباً صفر است.
این فناوری میتواند به صورت یکپارچه در کل زیرساخت مدل اعمال شود تا اصالت محتوا قابل رهگیری باشد. استفاده از این روش نشاندهنده تلاش شرکتها برای استانداردسازی خروجیهای هوش مصنوعی است.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
@DataPlusScience_linkedin_7494458171483197440_01.pdf
16.8 MB
🛠 آموزش عملی فاینتیون Qwen 2.5 با LoRA
یک راهنمای عملی و گامبهگام برای فاینتیون مدل زبانی Qwen 2.5 با استفاده از روش کارآمد LoRA منتشر شده است. این آموزش به شما کمک میکند تا مدلهای بزرگ زبانی را با منابع سختافزاری محدود و به صورت بهینه شخصیسازی کنید.
ابزارهای کلیدی پروژه:
• کتابخانههای
• ابزار پیادهسازی
• فریمورکهای
مراحل اصلی نقشه راه:
• بررسی وضعیت سختافزار، GPU و CUDA
• بارگذاری مدل پایه و آمادهسازی دیتاست Alpaca
• بهینهسازی پارامترها با جادوی LoRA
• اجرای فرآیند آموزش (Training) و تست نهایی مدل
🔗 منبع
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
#Qwen2_5 #PEFT
یک راهنمای عملی و گامبهگام برای فاینتیون مدل زبانی Qwen 2.5 با استفاده از روش کارآمد LoRA منتشر شده است. این آموزش به شما کمک میکند تا مدلهای بزرگ زبانی را با منابع سختافزاری محدود و به صورت بهینه شخصیسازی کنید.
ابزارهای کلیدی پروژه:
• کتابخانههای
Transformers و Datasets• ابزار پیادهسازی
PEFT برای اعمال تکنیک LoRA• فریمورکهای
PyTorch و Accelerateمراحل اصلی نقشه راه:
• بررسی وضعیت سختافزار، GPU و CUDA
• بارگذاری مدل پایه و آمادهسازی دیتاست Alpaca
• بهینهسازی پارامترها با جادوی LoRA
• اجرای فرآیند آموزش (Training) و تست نهایی مدل
🔗 منبع
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Qwen2_5 #PEFT
🚀 فرصت شغلی: جذب Business Analyst در تپسل
اگر به دنیای دادهها علاقه دارید و از حل مسائل پیچیده لذت میبرید، تپسل برای تکمیل تیم خود در جستجوی یک Business Analyst توانمند است. در این نقش، شما به تیم ناشران کمک میکنید تا با تحلیل دقیق دادههای عملکردی، تصمیمهای هوشمندانهتری بگیرند.
مهمترین مسئولیتهای این موقعیت شغلی:
▪️ تحلیل عملکرد ناشران و جایگاههای تبلیغاتی
▪️ شناسایی دلایل نوسانات درآمدی و عملکردی
▪️ همکاری با تیمها برای حل مسائل کسبوکار
▪️ بررسی و تطبیق گزارشهای مالی و عملیاتی
▪️ تبدیل دادههای خام به گزارشها و پیشنهادهای اجرایی
در این نقش، بیش از هر چیز توانایی حل مسئله، دقت در کار با اعداد و یادگیری سریع اهمیت دارد. اگر فکر میکنید این فرصت مناسب شما یا دوستانتان است، میتوانید جزئیات بیشتر را در لینک زیر مشاهده و رزومه خود را ارسال کنید:
مشاهده جزئیات و ارسال رزومه در جابویژن
#تپسل #BusinessAnalyst
اگر به دنیای دادهها علاقه دارید و از حل مسائل پیچیده لذت میبرید، تپسل برای تکمیل تیم خود در جستجوی یک Business Analyst توانمند است. در این نقش، شما به تیم ناشران کمک میکنید تا با تحلیل دقیق دادههای عملکردی، تصمیمهای هوشمندانهتری بگیرند.
مهمترین مسئولیتهای این موقعیت شغلی:
▪️ تحلیل عملکرد ناشران و جایگاههای تبلیغاتی
▪️ شناسایی دلایل نوسانات درآمدی و عملکردی
▪️ همکاری با تیمها برای حل مسائل کسبوکار
▪️ بررسی و تطبیق گزارشهای مالی و عملیاتی
▪️ تبدیل دادههای خام به گزارشها و پیشنهادهای اجرایی
در این نقش، بیش از هر چیز توانایی حل مسئله، دقت در کار با اعداد و یادگیری سریع اهمیت دارد. اگر فکر میکنید این فرصت مناسب شما یا دوستانتان است، میتوانید جزئیات بیشتر را در لینک زیر مشاهده و رزومه خود را ارسال کنید:
مشاهده جزئیات و ارسال رزومه در جابویژن
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#تپسل #BusinessAnalyst
🚀 عصر مدلهای رایگان و تحول هزینهها در هوش مصنوعی
دنیای هوش مصنوعی با سرعتی غیرمنتظره به سمت کالایی شدن پیش میرود. در حالی که هنوز بسیاری از کسبوکارها هزینههای گزافی را برای مدلهای پیشرو در محیط عملیاتی میپردازند، ظهور مدلهای فوقبهینه نشان میدهد که تکیه بر مدلهای گرانقیمت برای ۹۰ درصد جریانهای کاری برنامهنویسی، عملاً نوعی سهلانگاری مالی محسوب میشود.
وقتی تفاوت هزینه بین یک ابزار رایگان و یک مدل پرچمدار به بیش از ۱۰,۰۰۰ درصد میرسد، شکافهای جزئی در کیفیت بنچمارکها دیگر اولویت اول نیست. بررسی قیمت توکنها نشان میدهد که رقابت شدیدی بر سر بهینهسازی رخ داده است:
- Gemini 3.7 Flash: با ساختار هزینهای رقابتی که در سطوح خاص به نزدیک صفر رسیده است.
- DeepSeek V4 Flash: با نرخهای خیرهکننده، بهویژه با استفاده از مکانیزم Cache Hit که هزینه ورودی را به حداقل میرساند.
اگر تا امروز در پروژههای تولیدی خود بدون بهینهسازی از مدلهای حجیم استفاده میکردید، شاید زمان آن رسیده که در «استک» اصلی خود بازنگری کنید.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
دنیای هوش مصنوعی با سرعتی غیرمنتظره به سمت کالایی شدن پیش میرود. در حالی که هنوز بسیاری از کسبوکارها هزینههای گزافی را برای مدلهای پیشرو در محیط عملیاتی میپردازند، ظهور مدلهای فوقبهینه نشان میدهد که تکیه بر مدلهای گرانقیمت برای ۹۰ درصد جریانهای کاری برنامهنویسی، عملاً نوعی سهلانگاری مالی محسوب میشود.
وقتی تفاوت هزینه بین یک ابزار رایگان و یک مدل پرچمدار به بیش از ۱۰,۰۰۰ درصد میرسد، شکافهای جزئی در کیفیت بنچمارکها دیگر اولویت اول نیست. بررسی قیمت توکنها نشان میدهد که رقابت شدیدی بر سر بهینهسازی رخ داده است:
- Gemini 3.7 Flash: با ساختار هزینهای رقابتی که در سطوح خاص به نزدیک صفر رسیده است.
- DeepSeek V4 Flash: با نرخهای خیرهکننده، بهویژه با استفاده از مکانیزم Cache Hit که هزینه ورودی را به حداقل میرساند.
اگر تا امروز در پروژههای تولیدی خود بدون بهینهسازی از مدلهای حجیم استفاده میکردید، شاید زمان آن رسیده که در «استک» اصلی خود بازنگری کنید.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
🚀 تحول بزرگ در دنیای Coding Agents با DeepSeek
شرکت DeepSeek با انتشار ابزار متنباز deepseek-harness، استانداردهای جدیدی را برای عوامل هوشمند کدنویسی تعریف کرده است. این ابزار که جایگزینی جدی برای سرویسهای اشتراکی نظیر Claude Code محسوب میشود، امکانات قدرتمندی را بهصورت رایگان در اختیار توسعهدهندگان قرار میدهد.
مهمترین ویژگیهای این فریمورک عبارتند از:
• معماری کاملاً ماژولار: تمامی اجزا از مدلها گرفته تا ابزارها و حلقههای اجرا، از طریق فایل تنظیمات قابل جایگزینی هستند.
• زیرساخت Cordis: بهرهگیری از موتور اختصاصی DeepSeek برای اجرای افزونهها.
• خودآموز بودن: شامل مستندات معماری و فایلهای تخصصی برای درک بهتر ساختار کد توسط خودِ Agent.
• اجرای ساده: راهاندازی رابط کاربری محلی تنها با یک دستور در محیط ترمینال.
این پروژه با مجوز MIT منتشر شده و اگرچه هنوز در مرحله پیشنمایش قرار دارد، اما مسیر دسترسی به ابزارهای پیشرفته توسعه نرمافزار با هوش مصنوعی را برای همه باز کرده است.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
شرکت DeepSeek با انتشار ابزار متنباز deepseek-harness، استانداردهای جدیدی را برای عوامل هوشمند کدنویسی تعریف کرده است. این ابزار که جایگزینی جدی برای سرویسهای اشتراکی نظیر Claude Code محسوب میشود، امکانات قدرتمندی را بهصورت رایگان در اختیار توسعهدهندگان قرار میدهد.
مهمترین ویژگیهای این فریمورک عبارتند از:
• معماری کاملاً ماژولار: تمامی اجزا از مدلها گرفته تا ابزارها و حلقههای اجرا، از طریق فایل تنظیمات قابل جایگزینی هستند.
• زیرساخت Cordis: بهرهگیری از موتور اختصاصی DeepSeek برای اجرای افزونهها.
• خودآموز بودن: شامل مستندات معماری و فایلهای تخصصی برای درک بهتر ساختار کد توسط خودِ Agent.
• اجرای ساده: راهاندازی رابط کاربری محلی تنها با یک دستور در محیط ترمینال.
این پروژه با مجوز MIT منتشر شده و اگرچه هنوز در مرحله پیشنمایش قرار دارد، اما مسیر دسترسی به ابزارهای پیشرفته توسعه نرمافزار با هوش مصنوعی را برای همه باز کرده است.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 ابزار متنباز مایکروسافت برای تحلیل داده با هوش مصنوعی
مایکروسافت به تازگی ابزار قدرتمند
هوش مصنوعی در پسزمینه این ابزار، کدهای SQL مورد نیاز را مینویسد و دادهها را آماده میکند تا به جای انبوهی از کدهای نامفهوم، نمودارهایی دقیق و قابل ویرایش در اختیار داشته باشید.
مهمترین قابلیتهای این ابزار:
- طراحی نمودار با کشیدن فیلدها در محورهای مختصات
- امکان ایجاد شاخه (Branch) برای بررسی تغییرات روی نمودار
- اتصال به دادههای زنده با قابلیت بهروزرسانی خودکار
- اجرای محلی با استفاده از کلید API اختصاصی شما
برای شروع کار با این ابزار، میتوانید به مخزن Data-Formulator در گیتهاب مراجعه کنید.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science
مایکروسافت به تازگی ابزار قدرتمند
Data-Formulator را به صورت متنباز منتشر کرده است. این ابزار، فرآیند تبدیل دادههای خام به نمودارهای کاربردی را متحول میکند. شما میتوانید منابع مختلف مانند فایلهای CSV، دیتابیسهای PostgreSQL یا BigQuery را متصل کرده و با استفاده از ترکیب «کشیدن و رها کردن» (Drag-and-drop) و دستورات متنی ساده، تحلیلهای پیچیده انجام دهید.هوش مصنوعی در پسزمینه این ابزار، کدهای SQL مورد نیاز را مینویسد و دادهها را آماده میکند تا به جای انبوهی از کدهای نامفهوم، نمودارهایی دقیق و قابل ویرایش در اختیار داشته باشید.
مهمترین قابلیتهای این ابزار:
- طراحی نمودار با کشیدن فیلدها در محورهای مختصات
- امکان ایجاد شاخه (Branch) برای بررسی تغییرات روی نمودار
- اتصال به دادههای زنده با قابلیت بهروزرسانی خودکار
- اجرای محلی با استفاده از کلید API اختصاصی شما
برای شروع کار با این ابزار، میتوانید به مخزن Data-Formulator در گیتهاب مراجعه کنید.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science
❤1
🧠 تفاوتهای شخصیتی مدلهای هوش مصنوعی
مدلهای زبانی بزرگ صرفاً ماشینهای محاسبهگر نیستند؛ آنها «شخصیت» دارند و گاهی این شخصیتپردازیها به چالشهای جدی در پاسخدهی منجر میشود.
بررسیهای اخیر نشان میدهد که مدلها رفتارهای متفاوتی در مواجهه با موضوعات مختلف نشان میدهند:
* مدل
* مدل
* مدلهای
این تفاوتها نشان میدهد که شاید در آینده، بخشی از فرآیند
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
مدلهای زبانی بزرگ صرفاً ماشینهای محاسبهگر نیستند؛ آنها «شخصیت» دارند و گاهی این شخصیتپردازیها به چالشهای جدی در پاسخدهی منجر میشود.
بررسیهای اخیر نشان میدهد که مدلها رفتارهای متفاوتی در مواجهه با موضوعات مختلف نشان میدهند:
* مدل
Claude: اغلب دچار سندرم «شخصیت اصلی» است؛ به این معنی که علاقه شدیدی دارد در پاسخهای خود، از خودش حرف بزند یا نقش فعالی در داستانپردازیها ایفا کند.* مدل
ChatGPT: در مواجهه با مباحث مربوط به جنسیت و روابط، دچار سوگیریهای نامحسوسی است که در قالب ادبیات آکادمیک ارائه میشوند. جالب اینکه حتی پس از تذکر کاربر و تایید اشتباه، در گفتگوهای بعدی دوباره همان الگو را تکرار میکند.* مدلهای
Grok و Gemini: در تحلیل موضوعات حساس، برخورد کمتر خصمانه و متعادلتری نسبت به سایر مدلها نشان میدهند.این تفاوتها نشان میدهد که شاید در آینده، بخشی از فرآیند
Alignment مدلها باید شامل تستهای شخصیتشناسی باشد تا سوگیریهای ناخودآگاه آنها کاهش یابد.📖 مطالعه کامل مطلب در وبسایت Data Plus Science
🧬 پیشبینی مدیرعامل Anthropic: درمان بیماریها با هوش مصنوعی
داریو آمودی (Dario Amodei)، مدیرعامل Anthropic، در اظهارنظری امیدبخش پیشبینی کرده است که هوش مصنوعی طی ۵ تا ۱۰ سال آینده قادر خواهد بود اکثر بیماریهای بشر را درمان کند.
آمودی اعلام کرد که این شرکت در حال افزایش تمرکز و تلاشهای خود در حوزه زیستشناسی و پزشکی است و در ماههای آینده بارقههایی از پیشرفت و در سالهای آتی، نتایج شگفتانگیز آن آشکار خواهد شد. او با اشاره به انگیزه شخصی و عمیق خود در این مسیر گفت:
وی تأکید کرد زمانی که Anthropic به یک دستاورد واقعی در این زمینه برسد، تمام دنیا با بلندترین صدای ممکن از آن باخبر خواهند شد.
#Anthropic #Dario_Amodei
داریو آمودی (Dario Amodei)، مدیرعامل Anthropic، در اظهارنظری امیدبخش پیشبینی کرده است که هوش مصنوعی طی ۵ تا ۱۰ سال آینده قادر خواهد بود اکثر بیماریهای بشر را درمان کند.
آمودی اعلام کرد که این شرکت در حال افزایش تمرکز و تلاشهای خود در حوزه زیستشناسی و پزشکی است و در ماههای آینده بارقههایی از پیشرفت و در سالهای آتی، نتایج شگفتانگیز آن آشکار خواهد شد. او با اشاره به انگیزه شخصی و عمیق خود در این مسیر گفت:
من پدرم را به دلیل بیماری هپاتیت C از دست دادم، درست چند سال پیش از تولید داروهای ضدویروسی مستقیم که امروزه ۹۵ درصد بیماران را درمان میکنند و میتوانستند جان او را نجات دهند.
وی تأکید کرد زمانی که Anthropic به یک دستاورد واقعی در این زمینه برسد، تمام دنیا با بلندترین صدای ممکن از آن باخبر خواهند شد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Anthropic #Dario_Amodei
This media is not supported in your browser
VIEW IN TELEGRAM
💡 دیدگاه جف بیزوس درباره حباب هوش مصنوعی
جف بیزوس در تحلیل حباب فعلی هوش مصنوعی، آن را با تب اینترنت در ۲۵ سال پیش مقایسه میکند. در آن زمان، سرمایهگذاران میلیاردها دلار صرف توسعه زیرساختهای فیبر نوری کردند و در نهایت ورشکست شدند؛ اما همان کابلها در زمین باقی ماندند و بعداً بستر شکلگیری نتفلیکس و اقتصاد ابری (Cloud) شدند.
به باور بیزوس، حبابها با جابهجا کردن سرمایه به نفع عموم جامعه، زیرساختهای ماندگاری خلق میکنند. دیتاسنترها و تراشههای سیلیکونی عظیمی که امروز برای AI ساخته میشوند، فراتر از عمر شرکتهای فعلی دوام میآورند و مسیر را برای برندگان واقعی آینده هموار میسازند.
جف بیزوس در تحلیل حباب فعلی هوش مصنوعی، آن را با تب اینترنت در ۲۵ سال پیش مقایسه میکند. در آن زمان، سرمایهگذاران میلیاردها دلار صرف توسعه زیرساختهای فیبر نوری کردند و در نهایت ورشکست شدند؛ اما همان کابلها در زمین باقی ماندند و بعداً بستر شکلگیری نتفلیکس و اقتصاد ابری (Cloud) شدند.
به باور بیزوس، حبابها با جابهجا کردن سرمایه به نفع عموم جامعه، زیرساختهای ماندگاری خلق میکنند. دیتاسنترها و تراشههای سیلیکونی عظیمی که امروز برای AI ساخته میشوند، فراتر از عمر شرکتهای فعلی دوام میآورند و مسیر را برای برندگان واقعی آینده هموار میسازند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
هوش مصنوعی و علم داده به فارسی
🚀 تحول بزرگ در دنیای Coding Agents با DeepSeek شرکت DeepSeek با انتشار ابزار متنباز deepseek-harness، استانداردهای جدیدی را برای عوامل هوشمند کدنویسی تعریف کرده است. این ابزار که جایگزینی جدی برای سرویسهای اشتراکی نظیر Claude Code محسوب میشود، امکانات…
🚀 معرفی DeepSeek Harness؛ فریمورک ماژولار برای عاملهای هوشمند
تیم DeepSeek به تازگی پیشنمایش توسعهدهنده از ابزار DeepSeek Harness را منتشر کرده است. این پلتفرم با مجوز MIT ارائه شده و رویکردی کاملاً پلاگینمحور را برای توسعه سیستمهای مبتنی بر Agent معرفی میکند.
مهمترین ویژگیهای این فریمورک:
• معماری بدون هسته مرکزی: تمامی اجزا شامل مدلها، ابزارها، مهارتها و حافظه به عنوان پلاگین طراحی شدهاند و بدون نیاز به تغییر در سورسکد اصلی قابل تعویض یا گسترش هستند.
• حالتهای اجرایی متنوع: چهار حالت Standard، Code، Minimal و Creator در دسترس است که هرکدام مجموعهای از پلاگینهای پیشفرض را بارگذاری میکنند. حالت Minimal برای ارزیابی دقیق مدلها در محیطهای ایزوله بهینه شده است.
• قابلیت ردگیری کامل: تمام عملیات از جمله پرامپتهای سیستمی، فراخوانی ابزارها و نتایج، در یک لاگ متمرکز ذخیره میشوند که امکان بازبینی، فورک و اجرای مجدد فرایندها را فراهم میکند.
برای مطالعه تحلیل فنی کامل میتوانید به گزارش تخصصی مارکتکپست مراجعه کنید.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science
تیم DeepSeek به تازگی پیشنمایش توسعهدهنده از ابزار DeepSeek Harness را منتشر کرده است. این پلتفرم با مجوز MIT ارائه شده و رویکردی کاملاً پلاگینمحور را برای توسعه سیستمهای مبتنی بر Agent معرفی میکند.
مهمترین ویژگیهای این فریمورک:
• معماری بدون هسته مرکزی: تمامی اجزا شامل مدلها، ابزارها، مهارتها و حافظه به عنوان پلاگین طراحی شدهاند و بدون نیاز به تغییر در سورسکد اصلی قابل تعویض یا گسترش هستند.
• حالتهای اجرایی متنوع: چهار حالت Standard، Code، Minimal و Creator در دسترس است که هرکدام مجموعهای از پلاگینهای پیشفرض را بارگذاری میکنند. حالت Minimal برای ارزیابی دقیق مدلها در محیطهای ایزوله بهینه شده است.
• قابلیت ردگیری کامل: تمام عملیات از جمله پرامپتهای سیستمی، فراخوانی ابزارها و نتایج، در یک لاگ متمرکز ذخیره میشوند که امکان بازبینی، فورک و اجرای مجدد فرایندها را فراهم میکند.
برای مطالعه تحلیل فنی کامل میتوانید به گزارش تخصصی مارکتکپست مراجعه کنید.
📖 مطالعه کامل مطلب در وبسایت Data Plus Science
📊 Data➕Science
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #88 | 📌 8 آیتم گزارش | 🧾 از 10 پست بررسیشده
🕐 یکشنبه 1405/05/25 ساعت 14:00 تا دوشنبه 1405/05/26 ساعت 14:00
🛠 نوآوریها و ابزارهای هوش مصنوعی
📈 تحولات بازار و مدلها
🚀 آینده و فرصتها
🗂 گزارش #88 | 📌 8 آیتم گزارش | 🧾 از 10 پست بررسیشده
🕐 یکشنبه 1405/05/25 ساعت 14:00 تا دوشنبه 1405/05/26 ساعت 14:00
🛠 نوآوریها و ابزارهای هوش مصنوعی
آموزش عملی و گامبهگام فاینتیون مدل Qwen 2.5 با استفاده از متد LoRA منتشر شد تا امکان شخصیسازی بهینه مدلهای بزرگ زبانی با منابع سختافزاری محدود فراهم شود.
🔗 مشاهده پست
دیپسیک با انتشار فریمورک متنباز deepseek-harness، استانداردهای جدیدی برای عوامل هوشمند کدنویسی تعریف کرده و جایگزینی رایگان برای سرویسهای اشتراکی ارائه داده است.
🔗 مشاهده پست
مایکروسافت ابزار متنباز Data-Formulator را برای تبدیل دادههای خام به نمودارهای کاربردی با ترکیب قابلیت کشیدن و رها کردن و دستورات متنی ساده منتشر کرد.
🔗 مشاهده پست
📈 تحولات بازار و مدلها
فناوری واترمارکگذاری در لحظه استنتاج با تغییر در الگوهای آماری کلمات، راهکاری کلیدی برای شناسایی متون تولید شده توسط مدلهای زبانی مانند Claude ارائه میدهد.
🔗 مشاهده پست
ظهور مدلهای فوقبهینه و ارزانقیمت نشان میدهد که تکیه بر مدلهای گرانقیمت برای اکثر جریانهای کاری برنامهنویسی، از نظر اقتصادی توجیهپذیر نیست.
🔗 مشاهده پست
بررسیها نشان میدهد مدلهای زبانی دارای شخصیت هستند؛ برای مثال مدل Claude تمایل دارد در پاسخهای خود نقش فعالی ایفا کند و از خودش صحبت کند.
🔗 مشاهده پست
🚀 آینده و فرصتها
مدیرعامل Anthropic پیشبینی کرد که با افزایش تمرکز این شرکت بر حوزههای زیستشناسی، هوش مصنوعی طی ۵ تا ۱۰ سال آینده قادر به درمان اکثر بیماریهای بشر خواهد بود.
🔗 مشاهده پست
جف بیزوس حباب فعلی هوش مصنوعی را با تب اینترنت مقایسه کرده و معتقد است این حبابها با جابهجایی سرمایه، در نهایت زیرساختهای ماندگاری برای آینده ایجاد میکنند.
🔗 مشاهده پست
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🚀 معرفی مدل بصری-زبانی جدید North Micro Vision
شرکت Cohere Labs مدل جدید North Micro Vision را با ۲.۴ میلیارد پارامتر معرفی کرده است. این مدل برخلاف نمونههای مشابه که تصاویر را فشرده میکنند، جزئیات را در رزولوشن اصلی پردازش کرده و برای تحلیل اسناد، جداول و نمودارها بهینه شده است.
از ویژگیهای مهم این مدل میتوان به موارد زیر اشاره کرد:
- قابلیت اجرا روی لپتاپ و دستگاههای موبایل به دلیل حجم کم و امکان کوانتایز کردن.
- استفاده از معماری نوین برای حفظ جزئیات تصاویر در ابعاد صفحه A4.
- عملکرد درخشان در بنچمارکهای تخصصی مانند DocVQA و ChartQA.
- انتشار تحت لایسنس متنباز Apache 2.0.
این مدل با ترکیب ویژگیهای SigLIP 2 و معماری اختصاصی North Micro LLM، دقت بالایی در درک متون موجود در تصاویر ارائه میدهد. شما میتوانید جزئیات بیشتر، کدهای مدل و محیط دموی آن را در Hugging Face بررسی کنید.
#North_Micro_Vision #SigLIP_2
شرکت Cohere Labs مدل جدید North Micro Vision را با ۲.۴ میلیارد پارامتر معرفی کرده است. این مدل برخلاف نمونههای مشابه که تصاویر را فشرده میکنند، جزئیات را در رزولوشن اصلی پردازش کرده و برای تحلیل اسناد، جداول و نمودارها بهینه شده است.
از ویژگیهای مهم این مدل میتوان به موارد زیر اشاره کرد:
- قابلیت اجرا روی لپتاپ و دستگاههای موبایل به دلیل حجم کم و امکان کوانتایز کردن.
- استفاده از معماری نوین برای حفظ جزئیات تصاویر در ابعاد صفحه A4.
- عملکرد درخشان در بنچمارکهای تخصصی مانند DocVQA و ChartQA.
- انتشار تحت لایسنس متنباز Apache 2.0.
این مدل با ترکیب ویژگیهای SigLIP 2 و معماری اختصاصی North Micro LLM، دقت بالایی در درک متون موجود در تصاویر ارائه میدهد. شما میتوانید جزئیات بیشتر، کدهای مدل و محیط دموی آن را در Hugging Face بررسی کنید.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#North_Micro_Vision #SigLIP_2
هوش مصنوعی و علم داده به فارسی
🚀 کلانپروژه Terafab: ابرکارخانه تراشهسازی SpaceX اسپیسایکس از برنامهریزی برای ساخت یک مرکز نیمههادی غولپیکر به نام Terafab در تگزاس خبر داده است. این ابرکارخانه با سرمایهگذاری اولیه ۱۶.۸ میلیارد دلار، پتانسیل تبدیل شدن به بزرگترین کارخانه چیپسازی…
Media is too big
VIEW IN TELEGRAM
🖥 بحران تراشه و رویای ترافاب ایلان ماسک
ایلان ماسک اعلام کرده است که مجموع ظرفیت بزرگترین کارخانههای تراشهسازی دنیا از جمله TSMC، سامسونگ و Micron روی هم تنها ۲ درصد از نیازهای پردازشی او برای توسعه هوش مصنوعی را تأمین میکند. او میگوید حتی اگر کل تولید این کارخانهها را هم خریداری کند، باز هم برای جاهطلبیهایش کافی نخواهد بود.
به همین دلیل، او تصمیم دارد یک ابرکارخانه عظیم به نام Terafab در تگزاس بسازد؛ سازهای با مساحت ۱۰۰ میلیون فوت مربع (۵۰ برابر بزرگتر از پنتاگون) که هزینه فاز نخست آن ۱۶.۸ میلیارد دلار برآورد شده است. ماسک معتقد است برای دستیابی به قدرت پردازشی مورد نیاز، آنها باید سالانه حجمی از تراشهها را تولید کنند که تولید آن برای کل دنیا ۵۰ سال زمان میبرد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🚀 خرید استراتژیک OpenRouter توسط Stripe
شرکت Stripe که پیشتر به غول حوزه پرداخت شهرت داشت، در یک حرکت بزرگ برای تثبیت جایگاه خود در دنیای هوش مصنوعی، قرارداد خرید OpenRouter را به مبلغ بیش از ۷ میلیارد دلار امضا کرد.
این معامله در حالی نهایی شد که OpenRouter تنها چند ماه قبل، ارزشگذاری ۱.۳ میلیارد دلاری را تجربه کرده بود. استارتاپ OpenRouter با فراهم کردن زیرساختی برای دسترسی به صدها مدل مختلف، به توسعهدهندگان کمک میکند تا با جابهجایی هوشمندانه بین مدلهای هوش مصنوعی، مقرونبهصرفهترین و کارآمدترین گزینه را برای پروژههای خود انتخاب کنند.
مهمترین نکات این رویداد:
- ورود قدرتمند Stripe به اکوسیستم AI برای پاسخ به تقاضای بالای کسبوکارها.
- جهش خیرهکننده ارزشگذاری شرکت از ۱.۳ میلیارد دلار به ۷ میلیارد دلار در کمتر از یک سال.
- تغییر مسیر استراتژیک Stripe به سمت خدمات زیرساختی هوش مصنوعی.
این خرید نشان میدهد که رقابت اصلی در دنیای هوش مصنوعی به سمت بهینهسازی هزینهها و یکپارچهسازی مدلها حرکت کرده است.
شرکت Stripe که پیشتر به غول حوزه پرداخت شهرت داشت، در یک حرکت بزرگ برای تثبیت جایگاه خود در دنیای هوش مصنوعی، قرارداد خرید OpenRouter را به مبلغ بیش از ۷ میلیارد دلار امضا کرد.
این معامله در حالی نهایی شد که OpenRouter تنها چند ماه قبل، ارزشگذاری ۱.۳ میلیارد دلاری را تجربه کرده بود. استارتاپ OpenRouter با فراهم کردن زیرساختی برای دسترسی به صدها مدل مختلف، به توسعهدهندگان کمک میکند تا با جابهجایی هوشمندانه بین مدلهای هوش مصنوعی، مقرونبهصرفهترین و کارآمدترین گزینه را برای پروژههای خود انتخاب کنند.
مهمترین نکات این رویداد:
- ورود قدرتمند Stripe به اکوسیستم AI برای پاسخ به تقاضای بالای کسبوکارها.
- جهش خیرهکننده ارزشگذاری شرکت از ۱.۳ میلیارد دلار به ۷ میلیارد دلار در کمتر از یک سال.
- تغییر مسیر استراتژیک Stripe به سمت خدمات زیرساختی هوش مصنوعی.
این خرید نشان میدهد که رقابت اصلی در دنیای هوش مصنوعی به سمت بهینهسازی هزینهها و یکپارچهسازی مدلها حرکت کرده است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🚀 داغترین اخبار هفته در دنیای هوش مصنوعی
دنیای مدلهای زبانی بزرگ (LLM) در این هفته شاهد تحولات چشمگیری بود. در ادامه مهمترین اتفاقات و روندهای جدید را مرور میکنیم:
- مدل Qwen 3.8 27B معرفی شد؛ علیبابا با عرضه این نسخه، جایگاه قدرتمندترین مدل در کلاس وزنی خود را با اختلاف قابلتوجهی تثبیت کرد.
- متا با انتشار Muse Glimmer دوباره به مسیر عرضه مدلهای متنباز بازگشت. این مدل ۳۰ میلیارد پارامتری برای اجرای محلی بهینه شده و وعده انتشار نسخههای آتی آن نیز داده شده است.
- مدل Grok 4.6 با بهرهگیری از آموزش پیشفرض ۱.۵ تریلیون پارامتری و بهینهسازیهای پس از آموزش عرضه شد. در حال حاضر محدودیتهای استفاده از این مدل در سرویسهای Grok Build و Cursor برای مدت محدودی دو برابر شده است.
- نسخه V4 Pro از مدلهای DeepSeek با ساختاری بسیار ماژولار و تحت مجوز MIT منتشر شد.
- مدل Gemini 3.7 Flash در بنچمارکهای اخیر توانست عملکردی فراتر از مدل Sonnet 5 از خود نشان دهد.
از سوی دیگر، در حوزه اخبار شرکتی، بزرگترین تحول هفته تکمیل قرارداد ۶۰ میلیارد دلاری خرید Cursor توسط SpaceX با استفاده از سهام اختصاصی بود که بازار ابزارهای توسعه هوش مصنوعی را تحتالشعاع قرار داد.
#Qwen_3 #DeepSeek_V4
دنیای مدلهای زبانی بزرگ (LLM) در این هفته شاهد تحولات چشمگیری بود. در ادامه مهمترین اتفاقات و روندهای جدید را مرور میکنیم:
- مدل Qwen 3.8 27B معرفی شد؛ علیبابا با عرضه این نسخه، جایگاه قدرتمندترین مدل در کلاس وزنی خود را با اختلاف قابلتوجهی تثبیت کرد.
- متا با انتشار Muse Glimmer دوباره به مسیر عرضه مدلهای متنباز بازگشت. این مدل ۳۰ میلیارد پارامتری برای اجرای محلی بهینه شده و وعده انتشار نسخههای آتی آن نیز داده شده است.
- مدل Grok 4.6 با بهرهگیری از آموزش پیشفرض ۱.۵ تریلیون پارامتری و بهینهسازیهای پس از آموزش عرضه شد. در حال حاضر محدودیتهای استفاده از این مدل در سرویسهای Grok Build و Cursor برای مدت محدودی دو برابر شده است.
- نسخه V4 Pro از مدلهای DeepSeek با ساختاری بسیار ماژولار و تحت مجوز MIT منتشر شد.
- مدل Gemini 3.7 Flash در بنچمارکهای اخیر توانست عملکردی فراتر از مدل Sonnet 5 از خود نشان دهد.
از سوی دیگر، در حوزه اخبار شرکتی، بزرگترین تحول هفته تکمیل قرارداد ۶۰ میلیارد دلاری خرید Cursor توسط SpaceX با استفاده از سهام اختصاصی بود که بازار ابزارهای توسعه هوش مصنوعی را تحتالشعاع قرار داد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Qwen_3 #DeepSeek_V4
🎵 معرفی مدل قدرتمند MiniMax Music 3 برای تولید موسیقی
مدل جدید MiniMax Music 3 یک ابزار متنباز و پیشرفته برای تولید قطعات موسیقی کامل (تا ۵ دقیقه) با پشتیبانی از وکال است. این مدل با درک ساختار دقیق موسیقی، خروجیهای استریو با کیفیت ۳۲ کیلوهرتز تولید میکند.
ویژگیهای فنی و معماری:
این مدل از یک معماری سلسلهمراتبی استفاده میکند: یک Global LLM (مبتنی بر Qwen3-8B) وظیفه مدیریت ساختار کلی قطعه را بر عهده دارد و یک Local LLM کوچکتر، جزئیات آکوستیک و بافت صوتی را پردازش میکند. در نهایت، با استفاده از تکنیک Flow Matching، کیفیت نهایی صدا به مراتب بالاتر از مدلهای مبتنی بر توکنسازهای گسسته است.
مهمترین نکات برای استفاده:
• پشتیبانی از اجرای بهینه در SGLang، HuggingFace Diffusers و ComfyUI.
• امکان اجرا روی کارتهای گرافیک با حافظه ۸ گیگابایت (با تکنیک streaming) تا ۲۴ گیگابایت.
• قابلیت کنترل دقیق بر سبک، ضربآهنگ (BPM) و ساختار متن ترانه با استفاده از تگهای خاص.
• دسترسی به ابزار بازنویسی پرامپت برای تولید بهتر متادیتای موسیقی.
مدل جدید MiniMax Music 3 یک ابزار متنباز و پیشرفته برای تولید قطعات موسیقی کامل (تا ۵ دقیقه) با پشتیبانی از وکال است. این مدل با درک ساختار دقیق موسیقی، خروجیهای استریو با کیفیت ۳۲ کیلوهرتز تولید میکند.
ویژگیهای فنی و معماری:
این مدل از یک معماری سلسلهمراتبی استفاده میکند: یک Global LLM (مبتنی بر Qwen3-8B) وظیفه مدیریت ساختار کلی قطعه را بر عهده دارد و یک Local LLM کوچکتر، جزئیات آکوستیک و بافت صوتی را پردازش میکند. در نهایت، با استفاده از تکنیک Flow Matching، کیفیت نهایی صدا به مراتب بالاتر از مدلهای مبتنی بر توکنسازهای گسسته است.
مهمترین نکات برای استفاده:
• پشتیبانی از اجرای بهینه در SGLang، HuggingFace Diffusers و ComfyUI.
• امکان اجرا روی کارتهای گرافیک با حافظه ۸ گیگابایت (با تکنیک streaming) تا ۲۴ گیگابایت.
• قابلیت کنترل دقیق بر سبک، ضربآهنگ (BPM) و ساختار متن ترانه با استفاده از تگهای خاص.
• دسترسی به ابزار بازنویسی پرامپت برای تولید بهتر متادیتای موسیقی.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما