هوش مصنوعی و علم داده به فارسی
6.04K subscribers
1.35K photos
364 videos
336 files
1.5K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
🚀 معرفی بنچمارک جامع FrontierBench

‏نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزه‌های مختلف است که برای سنجش واقع‌گرایانه مدل‌های هوش مصنوعی طراحی شده‌اند.

🔬 ‏ سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینه‌سازی سیستم‌های KV-cache (حافظه موقت کلید-مقدار برای شتاب‌دهی پاسخ‌دهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حمل‌ونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.

📊 ‏ در ارزیابی مدل‌های پیشرو، GPT-5.6 Sol با موفقیت در حدود یک‌سوم وظایف، عملکردی هم‌تراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزان‌تر بوده و ۵۰ درصد توکن کمتری مصرف می‌کند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیف‌تری داشته که نشان‌دهنده ناکارآمدی آن در این تست‌هاست.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#FrontierBench #KV_cache