هوش مصنوعی و علم داده به فارسی
6.04K subscribers
1.35K photos
364 videos
336 files
1.5K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 مقایسه عملکرد مدل‌های پیشرفته در بنچمارک بازی آرکید

🔬 ‏ نتایج اجرای مدل‌های Kimi K3، Fable 5، Gemini 3.6 Flash و GPT 5.6 Sol Ultra در یک بنچمارک شبیه‌سازی بازی آرکید منتشر شد. مدل Fable 5 با ارائه حرکات کاملاً طبیعی و بدون هیچ‌گونه لگ، موفق شد تمیزترین عملکرد را در این ارزیابی ثبت کند.

‏ نکته جالب درباره Gemini 3.6 Flash، رفتار تطبیقی آن است؛ این مدل در ابتدا سنگین عمل می‌کند اما با پیشرفت در بازی، چابک‌تر شده و در عین حال ۶۵٪ توکن کمتر مصرف می‌کند که بازدهی بالایی را نشان می‌دهد.

📊 ‏ در این میان GPT 5.6 Sol به عنوان یک مدل همه‌فن‌حریف، گیم‌پلی بسیار پایداری ارائه داد که فاقد هرگونه باگ یا خطای فنی بود.

🧩 ‏ در نهایت، مدل متن‌باز Kimi K3 به عنوان پدیده غیرمنتظره ظاهر شد که با وجود هزینه بسیار کمتر، از نظر کیفیت انیمیشن با Fable 5 برابری می‌کند و تحسین بسیاری را برانگیخت. این نتایج نشان‌دهنده پیشرفت چشمگیر مدل‌ها در تعاملات بلادرنگ است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Kimi_K3 #Fable_5
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 معرفی مدل Unified Video Dense Prediction برای پردازش ویدیویی

🔬 ‏ مدل جدید UniD با هدف یکپارچه‌سازی وظایف پیش‌بینی چگال در ویدیو معرفی شده است. این مدل قادر است به‌طور همزمان چندین خروجی مختلف از جمله نقشه عمق (depth)، نرمال‌های سطحی، بخش‌بندی معنایی (semantic segmentation) و تشخیص مرزها را تولید کند.

🧠 ‏ این معماری همچنین برای درک بهتر صحنه، جزئیات پیچیده‌تری نظیر بخش‌های بدن انسان، albedo، سایه‌ها و ویژگی‌های مواد موجود در ویدیو را استخراج می‌کند. این رویکرد Unified به جای استفاده از مدل‌های مجزا، پتانسیل بالایی در ارتقای درک بصری ماشین در کاربردهای پیچیده ویدیویی دارد.

📊 ‏ بررسی دقیق‌تر این پژوهش و جزئیات فنی آن در منابع زیر در دسترس است.


https://arxiv.org/pdf/2607.21592
https://unid-video.github.io/
https://github.com/YihongSun/UniD

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#UniD #Dense_Prediction
🇨🇳 جهش ریاضی مدل هوش مصنوعی چینی

🚀 ‏ شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیره‌کننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدل‌های هوش مصنوعی محسوب می‌شود.

🧠 ‏ اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارک‌های معمول، گزینه‌ای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تک‌تک خطوط استدلال را بررسی می‌کنند؛ کوچک‌ترین نقص منطقی منجر به کسر امتیاز می‌شود.

‏️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عامل‌محور) بهره می‌برد که در آن مدل، اثبات‌ها را با استفاده از Python تولید، تست، اصلاح و بازنویسی می‌کند تا به دقت نهایی برسد. نکته قابل‌توجه این است که این عملکرد درخشان توسط کوچک‌ترین نسخه از خانواده مدل‌های dots3 به دست آمده است که نشان‌دهنده بهینگی بالای معماری آن است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#dots_note_3_0 #agentic_loop
🚀 معرفی بنچمارک جامع FrontierBench

‏نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزه‌های مختلف است که برای سنجش واقع‌گرایانه مدل‌های هوش مصنوعی طراحی شده‌اند.

🔬 ‏ سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینه‌سازی سیستم‌های KV-cache (حافظه موقت کلید-مقدار برای شتاب‌دهی پاسخ‌دهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حمل‌ونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.

📊 ‏ در ارزیابی مدل‌های پیشرو، GPT-5.6 Sol با موفقیت در حدود یک‌سوم وظایف، عملکردی هم‌تراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزان‌تر بوده و ۵۰ درصد توکن کمتری مصرف می‌کند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیف‌تری داشته که نشان‌دهنده ناکارآمدی آن در این تست‌هاست.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#FrontierBench #KV_cache
🚀 آشنایی با فریم‌ورک‌های محبوب یادگیری عمیق

🧠PyTorch یک کتابخانه متن‌باز (Open-source) برای یادگیری عمیق است که توسط Meta توسعه یافته و به دلیل انعطاف‌پذیری بالا و استفاده از گراف محاسباتی پویا، در پروژه‌های تحقیقاتی و صنعتی بسیار محبوب است. این ابزار به دلیل سازگاری کامل با Python، پشتیبانی عالی از عملیات دیباگینگ و بهره‌گیری از قدرت GPU Acceleration (شتاب‌دهنده گرافیکی)، انتخابی استاندارد برای توسعه مدل‌های پیشرفته هوش مصنوعی به شمار می‌رود.


🔹یادگیری آسان: منحنی یادگیری ملایم برای کاربران جدید.
🔹جامعه کاربری گسترده: وجود اکوسیستم قوی تحقیقاتی و منابع آموزشی فراوان.
🔹ساختار داینامیک: امکان تغییر رفتار مدل در زمان اجرا برای انعطاف بیشتر.


⚡️ ‏ در مقابل، Keras یک API سطح بالا است که به عنوان رابط کاربری روی TensorFlow اجرا می‌شود تا فرآیند طراحی شبکه‌های عصبی را به شدت ساده کند. این ابزار با ارائه اینترفیس‌های بسیار ساده برای ساخت، آموزش و ارزیابی مدل‌ها، نیاز به نوشتن کدهای پیچیده را به حداقل می‌رساند.

📊 ‏ این فریم‌ورک گزینه‌ای ایده‌آل برای Fast Prototyping (نمونه‌سازی سریع) است و به‌طور بومی از معماری‌های CNN، RNN و مدل‌های پیشرفته Transformers پشتیبانی می‌کند. Keras به دلیل انتگراسیون کامل با تنسورفلو و کاهش حجم کدنویسی، بهترین نقطه شروع برای افرادی است که قصد ورود به دنیای یادگیری عمیق را دارند.



📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#PyTorch #Keras
Media is too big
VIEW IN TELEGRAM
🧠 پیشرفت‌های جدید نورالینک در کنترل تجهیزات

🚀 ‏ شرکت Neuralink در تازه‌ترین دستاورد خود اعلام کرد که بیماران دارای ایمپلنت این شرکت، اکنون قادر هستند صندلی‌های چرخ‌دار خود را تنها با استفاده از سیگنال‌های مغزی و قدرت تفکر کنترل کنند.

💡 ‏ این پیشرفت نشان‌دهنده گام بزرگی در بهبود رابط مغز و کامپیوتر (BCI) است که می‌تواند استقلال حرکتی بیشتری را برای افراد دارای معلولیت‌های حرکتی شدید فراهم کند. استفاده از فناوری‌های عصبی برای تعامل مستقیم با دنیای فیزیکی، پتانسیل بالایی در بازگرداندن توانمندی‌های حرکتی به کاربران دارد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Neuralink #BCI
🤖 بهینه‌سازی ایجنت‌های کدنویس با Harness Handbook

🔬 ‏ محققان در مقاله جدیدی به بررسی چالش ویرایش کد توسط ایجنت‌های هوشمند پرداخته‌اند. در مدل‌های فعلی، ساختار پراکنده فایل‌ها باعث می‌شود ایجنت‌ها بخش‌هایی از پیاده‌سازی را نادیده بگیرند، لذا پیشنهاد شده است که مخازن کد به‌جای فایل، بر اساس رفتار (Behavior) توصیف شوند.

⚡️ ‏ ابزار Harness Handbook با ترکیب تحلیل ایستا (Static Analysis) و LLM، نقشه‌ای از رفتار سیستم می‌سازد. این نقشه با سه سطح جزئیات، به ایجنت کمک می‌کند تا ابتدا رفتار هدف را شناسایی کرده و سپس با دقت بالا به سراغ کد اصلی برود.

📊 ‏ نتایج ارزیابی‌ها بسیار درخشان است؛ کیفیت برنامه‌ریزی در تسک‌های Codex از ۲۸.۳٪ به ۳۸.۳٪ افزایش یافت. همچنین در مدل Terminus-2، این شاخص از ۲۶.۷٪ به ۴۵.۶٪ رسید که نشان‌دهنده اثربخشی بالای این رویکرد است.

🧠 ‏ علاوه بر دقت، مصرف توکن‌های بخش برنامه‌ریز (Planner) نیز بین ۸.۶٪ تا ۱۲.۷٪ کاهش یافت.

Paper: https://arxiv.org/abs/2607.13285

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Harness_Handbook #Terminus_2
1
🐡 معرفی مدل جدید Fugu-Ultra v1.1

🚀 ‏ شرکت Sakana AI به‌تازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهره‌گیری از جدیدترین مدل‌های پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.

📊 ‏ میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد می‌رسد. بیشترین پیشرفت در شاخص‌های ProgramBench و Terminal Bench 2.1 مشاهده می‌شود که نشان‌دهنده توانمندی بالای مدل در محیط‌های تخصصی برنامه‌نویسی است.

🧠 ‏ این مدل در حوزه‌های coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلال‌های منطقی پیچیده، بسیار بهینه‌تر عمل می‌کند. نکته حائز اهمیت این است که تمامی این قابلیت‌های فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شده‌اند.

‏ توسعه‌دهندگان اکنون می‌توانند پروژه‌های عملیاتی سنگین‌تری را با همان هزینه قبلی پیش ببرند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Fugu_Ultra #ProgramBench
1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖تحلیل تخصصی معماری سخت‌افزار برای هوش مصنوعی

‏ دنیای سخت‌افزارهای AI حول ۵ معماری اصلی می‌چرخد که هرکدام توازن متفاوتی میان انعطاف‌پذیری، موازی‌سازی و دسترسی به حافظه برقرار می‌کنند. پردازنده‌های مرکزی یا CPU با هسته‌های قدرتمند برای وظایف منطقی و سیستم‌عامل بهینه شده‌اند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکه‌های عصبی و محاسبات ماتریسی موازی است.

🧠 ‏ واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی داده‌ها استفاده می‌کنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخه‌های بهینه‌شده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاه‌هایی مثل گوشی‌های هوشمند انجام می‌دهند.

🚀 ‏ نسل جدید سخت‌افزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#LMCache #Groq
🐝 پلتفرم Buzz: تحولی در تعامل انسان و ایجنت‌های هوش مصنوعی

‏پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، به‌عنوان یک فضای کار متن‌باز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیم‌های ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شده‌اند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم می‌کند.

🧠 ‏ این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نه‌تنها امنیت را ارتقا می‌دهد، بلکه اجازه می‌دهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، به‌راحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل می‌شود که تاریخچه کامل گفتگوها، کامیت‌ها و ریوها را در خود نگه می‌دارد.

‏ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنت‌ها (گروهی از ایجنت‌های همکار) بهینه شده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Buzz_Platform #Nostr_Protocol
🚀 معرفی مدل هوشمند Ling-3.0-flash

‏شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهره‌وری بی‌نظیری را برای ایجنت‌های هوش مصنوعی فراهم می‌کند و عملکردی هم‌تراز با مدل‌های 1 تریلیون پارامتری ارائه می‌دهد.

🧠 ‏ معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینه‌های پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.

‏ از قابلیت‌های کلیدی آن می‌توان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاس‌پذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستم‌های گرافیکی، مدیریت فایل‌های مالی اکسل و هماهنگی ایجنت‌های علمی عملکردی خیره‌کننده دارد.

🔭 ‏ در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Ling_3 #Hybrid_linear_attention
🤖 معرفی مدل هوشمند Claude Opus 5

‏شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که به‌طور ویژه برای کارهای پیچیده برنامه‌نویسی، وظایف عاملی (Agentic tasks) و تحلیل‌های سنگین بهینه‌سازی شده است، در بنچمارک‌های متعددی پیشتاز میدان است.

🚀 ‏ این مدل در Frontier-Bench v0.1 ویژه مهندسی نرم‌افزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیک‌ترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه می‌دهد مدل پیش از ارائه پاسخ نهایی، خروجی‌های خود را بازبینی و اشتباهات احتمالی را برطرف کند.

📊 ‏ تحلیل دقیق عملکرد نشان می‌دهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستم‌عامل است، نتایج درخشانی از خود بر جای گذاشته است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #ARC_AGI_3
1
🤖 مدل Claude Opus 5 پیشتاز جدید هوش مصنوعی

🔬 ‏ مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.

‏ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیره‌کننده در بنچمارک‌های GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجی‌های دقیق حرفه‌ای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.

📊 ‏ اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقب‌تر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی می‌کند.

💰 ‏ قیمت‌گذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #GDPval_AA
🚀 فراتر از مهندسی پرامپت: ۵ لایه کلیدی در توسعه ایجنت‌ها

🧠 ‏ برای تبدیل ایجنت‌های هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیین‌کننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیع‌تری نسبت به لایه قبل ارائه می‌دهد.

‏ لایه اول یعنی پرامپت، کنترل‌کننده تعاملات ساده مانند تعیین نقش، نمونه‌ها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی می‌پردازد تا مدل دقیق‌ترین داده‌ها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.

‏️ لایه سوم، Harness Engineering نام دارد که شامل زیرساخت‌های کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزم‌های Retry، اعتبارسنجی خروجی‌ها و مسیریابی به ساب‌ایجنت‌ها در این بخش قرار می‌گیرند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Context_Engineering #Harness_Engineering
🌐 بیانیه شرکت‌های بزرگ فناوری برای حمایت از مدل‌های متن‌باز

‏شرکت‌های بزرگ فناوری در نامه‌ای رسمی با عنوان «وزن‌های باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدل‌هایی که پارامترهای آن‌ها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمی‌شود.

🚀 ‏ این نامه استدلال می‌کند که مدل‌های متن‌باز با تسهیل دسترسی استارتاپ‌ها و دانشگاه‌ها به تکنولوژی‌های پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی می‌شوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینه‌های سنگینِ مدل‌های تجاری کاهش می‌یابد.

🛡 ‏ متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدل‌های قدرتمند برای شناسایی آسیب‌پذیری‌ها ضروری است. شفافیت ناشی از این مدل‌ها به جامعه محققان کمک می‌کند تا رفتار سیستم‌ها را مطالعه کرده و مکانیزم‌های دفاعی قوی‌تری توسعه دهند.


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Open_Weights #AI_Leadership
📊 راهنمای جامع بنچمارک‌های ارزیابی هوش مصنوعی

🔬 ‏ با رشد سریع مدل‌های زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدل‌ها فراتر از شمارش پارامترها یا تست‌های ساده است. بنچمارک‌ها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدل‌ها در محیط‌های واقعی هستند.

💻 ‏ در حوزه کدنویسی و مهندسی نرم‌افزار، مجموعه‌های SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامه‌نویسی محسوب می‌شوند.

🤖 ‏ برای ارزیابی عملکرد ایجنت‌ها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارک‌های WideSearch و BrowseComp برای سنجش مهارت‌های جست‌وجو و ناوبری ارائه شده‌اند.

🎯 ‏ جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمون‌های IFBench، SysBench و Multi-IF دقیق‌ترین ارزیابی‌ها را ارائه می‌دهند. همچنین برای سنجش حافظه و متن‌های طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#SWE_Bench_Pro #Multi_IF
1