هوش مصنوعی و علم داده به فارسی
6.04K subscribers
1.35K photos
364 videos
336 files
1.5K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ معرفی Gigatoken: توکنایزر فوق‌سریع با زبان Rust

‏ابزار جدید Gigatoken با دستیابی به سرعت خیره‌کننده ۲۴.۵۳ گیگابایت بر ثانیه، انقلابی در فرآیند توکنایز کردن (تبدیل متن به توکن برای مدل‌های زبانی) ایجاد کرده است. این عملکرد در مقایسه با HuggingFace tokenizers و tiktoken که به سرعت‌های بسیار پایین‌تری در همان سخت‌افزار می‌رسند، تا ۹۸۹ برابر سریع‌تر است.

🚀 ‏ راز این سرعت در مهندسی دقیق ساختار اجرا نهفته است. برخلاف ابزارهای معمول که از موتورهای سنگین Regex برای پیش‌پردازش استفاده می‌کنند، Gigatoken از یک جدول جستجوی بایت برای طبقه‌بندی سریع و تکنیک SWAR برای پردازش داده‌های ۸ بایتی استفاده می‌کند. این ابزار با استفاده از دو نشانگر مستقل و پردازش خارج از نظم، گلوگاه‌های پردازشی را حذف می‌کند.

🧠 ‏ همچنین قابلیت Pretoken caching برای کلمات تکراری، فرآیند رمزگذاری BPE را به‌شدت تسریع می‌کند.


🔗GitHub

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Gigatoken #SWAR
1
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #67 | 📦 10 پست
🕐 چهارشنبه 1405/04/31 ساعت 14:00 تا پنجشنبه 1405/05/01 ساعت 14:00

🤖 مدل‌های زبانی بزرگ

مدل Grok 4.5 با امتیاز 1543 در صدر مدل‌ها قرار دارد و رقبای چینی نظیر Qwen 3.8 Max با ظرفیت ۲.۴ تریلیون پارامتر به سرعت در حال پیشرفت هستند.
🔗 مشاهده پست

مدل GPT-5.6 موفق شد با ارائه یک مثال نقض، حدس ۳۰ ساله Dinitz-Garg-Goemans در نظریه گراف را رد کند و توانایی استدلال ریاضی خود را به اثبات برساند.
🔗 مشاهده پست

ایجنت Bionic در LM Studio به عنوان یک راهکار Local-first برای پردازش اسناد و کدنویسی معرفی شده است که با استفاده از مدل‌های متن‌باز، امنیت و مالکیت داده‌ها را تضمین می‌کند.
🔗 مشاهده پست


🦾 ابزارهای تخصصی و پژوهش

ابزار جدید Gigatoken با سرعت ۲۴.۵۳ گیگابایت بر ثانیه و استفاده از زبان Rust، فرآیند توکنایز کردن را تا ۹۸۹ برابر سریع‌تر از ابزارهای رایج انجام می‌دهد.
🔗 مشاهده پست

شرکت Lightricks مدل Clean Plate را برای حذف هوشمند اشیاء از ویدیوها در ورک‌فلوهای ComfyUI عرضه کرده که بر پایه متد IC-LoRA برای مدل LTX-2.3 توسعه یافته است.
🔗 مشاهده پست

سرویس Synthetic Video Detector انویدیا با استفاده از مدل‌های DINOv2 و DINOv3، قابلیت تشخیص ویدیوهای تولید شده توسط هوش مصنوعی را فراهم کرده است.
🔗 مشاهده پست


🛡 امنیت، اخلاق و صنعت

بنیاد Cisco Foundation AI مجموعه ابزارهای متن‌باز خود شامل Foundation-Sec و مدل‌های ایجنتی Antares را برای ارتقای امنیت سایبری منتشر کرد.
🔗 مشاهده پست

دولت آمریکا شرکت Moonshot AI را متهم کرده که برای توسعه مدل Kimi K3، به صورت غیرقانونی از تکنیک Distillation برای کپی‌برداری از مدل‌های شرکت Anthropic استفاده کرده است.
🔗 مشاهده پست


🎓 آموزش و منابع علم داده

کتاب Cracking the Data Science Interview به عنوان راهنمایی جامع برای تسلط بر مفاهیم پایه، آمار، Data Wrangling و مهندسی ویژگی جهت موفقیت در مصاحبه‌های شغلی منتشر شد.
🔗 مشاهده پست

این کتاب با پوشش ۱۸ مفهوم کلیدی مانند Overfitting و تریدآف Bias/Variance، مسیر حرفه‌ای شدن برای داوطلبان ورود به حوزه‌های داده‌محور را هموار می‌کند.
🔗 مشاهده پست


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
📊 رشد خیره‌کننده Google Cloud

🚀 ‏ در گزارش مالی اخیر، درآمد واحد ابری شرکت Alphabet با رشدی ۸۲ درصدی نسبت به سال گذشته به ۲۴.۸ میلیارد دلار در یک فصل رسیده است. این رقم نشان‌دهنده پتانسیل رسیدن به درآمد سالانه ۱۰۰ میلیارد دلار است. همچنین تعهدات قراردادی این بخش به ۵۱۴ میلیارد دلار صعود کرده که به‌مراتب از پیش‌بینی ۴۸۸ میلیاردی تحلیل‌گران فراتر رفته است.

🧠 ‏ موتور محرک اصلی این رشد، تقاضا برای زیرساخت‌های هوش مصنوعی، به‌ویژه پردازنده‌های گرافیکی ابری، تراشه‌های اختصاصی TPU و دسترسی به مدل‌ها از طریق Vertex AI (پلتفرم مدیریت چرخه حیات مدل‌های هوش مصنوعی) است. این نتایج، نخستین آزمون جدی برای ارزیابی بازگشت سرمایه در مسابقه جهانی احداث مراکز داده است.

‏ پیش‌بینی می‌شود غول‌های فناوری تا سال ۲۰۲۶ بیش از ۷۰۰ میلیارد دلار صرف توسعه زیرساخت‌های محاسباتی کنند. یکی از عوامل کلیدی این جهش، همکاری با Anthropic است که سفارش خرید نزدیک به یک میلیون تراشه TPU را ثبت کرده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Google_Cloud #TPU
Media is too big
VIEW IN TELEGRAM
🤖 تخته‌سیاه هوشمند با قابلیت پردازش بلادرنگ

⚡️ ‏ در کنفرانس جهانی هوش مصنوعی ۲۰۲۶ در شانگهای، فناوری جدیدی رونمایی شد که می‌تواند نحوه آموزش ریاضیات را متحول کند. این تخته‌سیاه هوشمند قادر است معادلات ریاضی دست‌نویس را به صورت آنی به نمودارهای پویا تبدیل کند.

🧠 ‏ این سیستم علاوه بر تحلیل معادلات، توانایی تبدیل اسکچ‌های ساده به مدل‌های سه‌بعدی تعاملی را در لحظه دارد. با استفاده از این ابزار، مفاهیم انتزاعی ریاضی که درک آن‌ها برای دانش‌آموزان دشوار است، به شکلی بصری و تجربه‌محور نمایش داده می‌شوند.

🚀 ‏ ادغام چنین تکنولوژی‌هایی در محیط‌های آموزشی می‌تواند تعامل بین استاد و دانشجو را افزایش داده و سرعت یادگیری مباحث پیچیده هندسی و جبری را به‌طور چشمگیری بهبود ببخشد. این دستاورد نشان‌دهنده گام بزرگ دیگری در کاربردی‌سازی هوش مصنوعی در حوزه آموزش (EdTech) است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#تخته #مدل
🫛 معرفی مدل UpCount برای شمارش هوشمند اشیاء

‏ مدل جدید UpCount یک رویکرد پیشرفته و کاملاً Class-Agnostic (بدون وابستگی به کلاس اشیاء) برای شمارش اشیاء ارائه می‌دهد که نیاز به نمونه مرجع ندارد. این معماری با بهره‌گیری از یک ViT (مدل مبتنی بر ترنسفورمر) که با روش MAE پیش‌آموزش دیده، دقت بالایی در تحلیل‌های بصری کسب کرده است.

🔬 ‏ در این سیستم، بازسازی ویژگی‌ها به سبک DPT و تکنیک Joint Bilateral Upsampling (افزایش رزولوشن با حفظ لبه‌ها) مشابه متد FeatUp ترکیب شده‌اند. این ترکیب قدرتمند امکان استخراج نقشه‌های تراکم دقیق را فراهم می‌کند.

🧠 ‏ فرآیند کاری مدل شامل ۸ مرحله حیاتی است که با دریافت تصویر ورودی شروع می‌شود. پس از استخراج ویژگی‌های اصلاح‌شده برای شمارش و تعیین پیشنهادات (Proposal)، سیستم از یک Verifier-head برای افزایش اطمینان تایید استفاده می‌کند.

📊 ‏ خروجی نهایی حاصل ضرب نقشه پیشنهادات در لایه تایید است که در نهایت اشیاء را با دقت Pixel-wise مشخص می‌کند.

🔗GitHub

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#UpCount #Class_Agnostic
1
🤖 قابلیت جدید Router در ادیتور Cursor

‏ ابزار Cursor به‌تازگی از قابلیت جدیدی به نام Router رونمایی کرده است که در حالت Auto mode به‌صورت خودکار، بهینه‌ترین مدل زبانی را برای هر درخواست انتخاب می‌کند. کاربران می‌توانند با تنظیم پارامترهای بهینه‌سازی روی «کیفیت»، «هزینه» یا «توازن»، مدیریت هوشمندتری بر مدل‌های مورد استفاده داشته باشند.

🔬 ‏ نتایج تست‌های واقعی نشان می‌دهد که حالت Intelligence قادر است کیفیتی مشابه مدل Fable 5 high را با ۶۰٪ کاهش هزینه ارائه دهد. همچنین حالت Balance نسبت به مدل Opus 4.8 عملکرد بهتری در رضایت کاربر داشته و حدود ۳۶٪ صرفه‌جویی مالی برای تیم‌ها به همراه دارد.

📊 ‏ بررسی معیارهای Cost per Commit (هزینه به ازای هر عملیات ثبت کد) نیز برتری اقتصادی این قابلیت را تأیید می‌کند؛ به‌طوری‌که هزینه در حالت Balance به ۴.۶۳ دلار کاهش یافته، در حالی که مدل Opus 4.8 Thinking هزینه‌ای معادل ۷.۳۴ دلار دارد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Cursor_Router #LLM_Optimization
This media is not supported in your browser
VIEW IN TELEGRAM
🤖امنیت پیش‌دستانه با قابلیت Claude Security

‏شرکت Anthropic قابلیت Claude Security را در قالب یک پلاگین برای Claude Code در وضعیت بتا عرضه کرده است. این ابزار به توسعه‌دهندگان اجازه می‌دهد مستقیماً از طریق ترمینال، کل ریپازیتوری یا تغییرات جدید (diff) را قبل از کامیت کردن کد برای یافتن حفره‌های امنیتی اسکن کنند.

🧠 ‏ معماری این ابزار مبتنی بر یک سیستم چندعامله (Multi-agent) است. عامل اول وظیفه ترسیم نقشه کد و تحلیل مدل تهدید را بر عهده دارد و عامل دوم به‌صورت مستقل یافته‌ها را بازبینی می‌کند.

‏ فرایند اصلاح کد تنها زمانی انجام می‌شود که سیستمِ تاییدکننده (Verifier) از سه مورد اطمینان کامل داشته باشد: رفع دقیق آسیب‌پذیری، عدم ایجاد نقص امنیتی جدید و حفظ رفتار منطقی کد. در صورت عدم احراز هر یک از این شرایط، ابزار به جای ارائه پچ، دلیل فنی عدم اصلاح را گزارش می‌کند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Security #Multi_agent
🚀 پیش‌بینی تحول خیره‌کننده بازار رباتیک

‏طبق گزارش‌های جدید، صنعت رباتیک در آستانه یک جهش تاریخی قرار دارد و پیش‌بینی می‌شود تا سال ۲۰۴۰ با رشدی ۳۷۰ برابری، ارزش بازار خود را از کمتر از ۱ میلیارد دلارِ کنونی به ۳۷۰ میلیارد دلار برساند. محرک اصلی این تحول عظیم، توسعه ربات‌های انسان‌نما و سیستم‌های چندمنظوره هوشمند است.

📊 ‏ روند رشد این صنعت در اواخر دهه ۲۰۲۰ میلادی پایدار خواهد بود و انتظار می‌رود از ابتدای دهه ۲۰۳۰، سرعت توسعه شتاب قابل‌توجهی به خود بگیرد. در تقسیم‌بندی جغرافیایی، چین پیشتاز کسب بیشترین سهم از این بازار نوظهور خواهد بود و پس از آن اروپا، آمریکای شمالی، ژاپن و کره جنوبی قرار دارند.

🧠 ‏ این جهش مدیون پیشرفت‌های اخیر در حوزه‌های هوش مصنوعی، سنسورها و فناوری باتری است که مقیاس‌پذیری و کاربردی‌شدن ربات‌ها را به شدت افزایش داده‌اند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#ربات #Harmonic_Drive_Systems
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 رونمایی از مدل ویدئویی Black Forest Labs

‏تیم Black Forest Labs که پیش‌تر با ارائه مدل‌های متن‌به‌تصویر FLUX شناخته شده بود، بالاخره جزئیات اولیه از مدل ویدئویی خود را منتشر کرد. این تیم اکنون خبر از توسعه FLUX 3 می‌دهد که تحولی در رویکرد آن‌ها محسوب می‌شود.

🧠 ‏ نکته کلیدی در مورد این مدل جدید، قابلیت تولید چندوجهی (Multimodal) آن است. گفته می‌شود FLUX 3 یک مدل یکپارچه است که توانایی تولید هم‌زمان تصویر، ویدئو و صوت را در یک ساختار واحد دارد.

‏ پیش‌بینی می‌شود سطح کیفی خروجی‌های این مدل در رقابت با مدل‌های ویدئویی پیشرفته Google قرار بگیرد. انتشار این مدل به‌صورت تدریجی در هفته‌ها و ماه‌های آتی برنامه‌ریزی شده است.

‏باید دید آیا این مدل جدید می‌تواند استانداردهای فعلی در تولید ویدئوهای هوش مصنوعی را جابه‌جا کند یا خیر.

اطلاعات بیشتر در وب‌سایت رسمی

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Black_Forest_Labs #FLUX_3
🤖 نفوذ موفق مدل Kimi K3 به Redis

🔬 ‏ مدل هوش مصنوعی Kimi K3 در یک دستاورد فنی قابل‌توجه، تنها در عرض ۲۷ دقیقه و با به‌کارگیری ۳۲ عامل (agent) خودمختار، موفق به کشف یک آسیب‌پذیری 0day و اجرای RCE (اجرای کد از راه دور) روی سرورهای Redis شده است. این عملیات نشان‌دهنده توانمندی بالای مدل‌های جدید در تحلیل ساختارهای پیچیده نرم‌افزاری و خودکارسازی فرآیند اکسپلویت‌نویسی است.

🧠 ‏ این آسیب‌پذیری که از نوع خطای حافظه در بارگذاری stream consumer-group است، به دلیل مکانیزم double free رخ می‌دهد. این باگ در واقع نمونه‌ای از نقص مشابه در CVE-2026-25243 بوده که علی‌رغم اصلاحات قبلی، همچنان نسخه‌های ۷.۴.۹ و ۸.۶.۳ را تحت تأثیر قرار می‌داد و نهایتاً در نسخه ۸.۸.۰ برطرف شد.

‏ مدل در زنجیره اکسپلویت خود برای نسخه ۶.۲.۲۲، با بهره‌گیری از تکنیک‌های پیچیده‌ای نظیر UAF و نشت اطلاعات از libc، کنترل سیستم را به دست گرفته است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Kimi_K3 #Redis_RCE
2
🤖 قابلیت جدید Claude برای خودکارسازی دسکتاپ

🚀 ‏ شرکت Anthropic قابلیت نوآورانه‌ای به نسخه دسکتاپ Claude افزوده است که به کاربران اجازه می‌دهد بدون نیاز به نوشتن پرامپت‌های متنی پیچیده، تنها با ثبت فعالیت‌های خود، اسکریپت‌های اتوماسیون (کد برنامه‌نویسی برای انجام خودکار وظایف) ایجاد کنند. این ابزار در فضای کاری Cowork و با گزینه Record a skill در دسترس است.

‏ فرآیند کار به این صورت است که کاربر با فعال‌سازی قابلیت ضبط صفحه، مراحل یک تسک روتین را در محیط دسکتاپ اجرا کرده و هم‌زمان توضیحات خود را بیان می‌کند. مدل هوش مصنوعی با تحلیل دقیق ویدیو و صوت، تمامی کلیک‌ها و تایپ‌ها را شناسایی کرده و آن‌ها را به یک Skill قابل استفاده مجدد تبدیل می‌کند.

🧠 ‏ این ویژگی که برای کاربران پلن‌های Pro، Max و Team فعال شده، گامی مهم در جهت جایگزینی دستورات متنی با آموزش مبتنی بر تماشا (Demonstration-based learning) است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Anthropic #Record_a_skill
1
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 معرفی قابلیت Plan Mode در ابزار Manus

‏ابزار هوشمند Manus که پیش‌تر مستقیماً به سراغ پیاده‌سازی پروژه‌ها می‌رفت، اکنون با معرفی قابلیت جدید Plan Mode، رویکرد خود را متحول کرده است. در این حالت، سیستم پیش از هر اقدامی، وظیفه محوله را به‌دقت تحلیل و امکان‌سنجی کرده و یک طرح اجرایی جامع برای کاربر تدوین می‌کند.

🧠 ‏ این ویژگی یکی از بزرگ‌ترین چالش‌های AI agents یعنی درک نادرست از نیازمندی‌ها را هدف قرار داده است. کاربران اکنون می‌توانند پیش از تأیید نهایی، طرح ارائه شده را ویرایش، توسعه یا کاملاً بازنویسی کنند تا از صحت مسیر اطمینان حاصل شود.

‏ اگر Manus در طول فرآیند به اطلاعات بیشتری نیاز داشته باشد، با پرسیدن سوالات شفاف‌ساز، اهداف و محدودیت‌ها را دقیق‌تر مشخص می‌کند. همچنین می‌توانید این حالت را در اواسط پروژه فعال کنید تا ابزار متوقف شده و برای مراحل باقی‌مانده، برنامه‌ریزی مجدد انجام دهد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Manus #Plan_Mode
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 مقایسه عملکرد مدل‌های پیشرفته در بنچمارک بازی آرکید

🔬 ‏ نتایج اجرای مدل‌های Kimi K3، Fable 5، Gemini 3.6 Flash و GPT 5.6 Sol Ultra در یک بنچمارک شبیه‌سازی بازی آرکید منتشر شد. مدل Fable 5 با ارائه حرکات کاملاً طبیعی و بدون هیچ‌گونه لگ، موفق شد تمیزترین عملکرد را در این ارزیابی ثبت کند.

‏ نکته جالب درباره Gemini 3.6 Flash، رفتار تطبیقی آن است؛ این مدل در ابتدا سنگین عمل می‌کند اما با پیشرفت در بازی، چابک‌تر شده و در عین حال ۶۵٪ توکن کمتر مصرف می‌کند که بازدهی بالایی را نشان می‌دهد.

📊 ‏ در این میان GPT 5.6 Sol به عنوان یک مدل همه‌فن‌حریف، گیم‌پلی بسیار پایداری ارائه داد که فاقد هرگونه باگ یا خطای فنی بود.

🧩 ‏ در نهایت، مدل متن‌باز Kimi K3 به عنوان پدیده غیرمنتظره ظاهر شد که با وجود هزینه بسیار کمتر، از نظر کیفیت انیمیشن با Fable 5 برابری می‌کند و تحسین بسیاری را برانگیخت. این نتایج نشان‌دهنده پیشرفت چشمگیر مدل‌ها در تعاملات بلادرنگ است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Kimi_K3 #Fable_5
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 معرفی مدل Unified Video Dense Prediction برای پردازش ویدیویی

🔬 ‏ مدل جدید UniD با هدف یکپارچه‌سازی وظایف پیش‌بینی چگال در ویدیو معرفی شده است. این مدل قادر است به‌طور همزمان چندین خروجی مختلف از جمله نقشه عمق (depth)، نرمال‌های سطحی، بخش‌بندی معنایی (semantic segmentation) و تشخیص مرزها را تولید کند.

🧠 ‏ این معماری همچنین برای درک بهتر صحنه، جزئیات پیچیده‌تری نظیر بخش‌های بدن انسان، albedo، سایه‌ها و ویژگی‌های مواد موجود در ویدیو را استخراج می‌کند. این رویکرد Unified به جای استفاده از مدل‌های مجزا، پتانسیل بالایی در ارتقای درک بصری ماشین در کاربردهای پیچیده ویدیویی دارد.

📊 ‏ بررسی دقیق‌تر این پژوهش و جزئیات فنی آن در منابع زیر در دسترس است.


https://arxiv.org/pdf/2607.21592
https://unid-video.github.io/
https://github.com/YihongSun/UniD

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#UniD #Dense_Prediction
🇨🇳 جهش ریاضی مدل هوش مصنوعی چینی

🚀 ‏ شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیره‌کننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدل‌های هوش مصنوعی محسوب می‌شود.

🧠 ‏ اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارک‌های معمول، گزینه‌ای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تک‌تک خطوط استدلال را بررسی می‌کنند؛ کوچک‌ترین نقص منطقی منجر به کسر امتیاز می‌شود.

‏️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عامل‌محور) بهره می‌برد که در آن مدل، اثبات‌ها را با استفاده از Python تولید، تست، اصلاح و بازنویسی می‌کند تا به دقت نهایی برسد. نکته قابل‌توجه این است که این عملکرد درخشان توسط کوچک‌ترین نسخه از خانواده مدل‌های dots3 به دست آمده است که نشان‌دهنده بهینگی بالای معماری آن است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#dots_note_3_0 #agentic_loop
🚀 معرفی بنچمارک جامع FrontierBench

‏نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزه‌های مختلف است که برای سنجش واقع‌گرایانه مدل‌های هوش مصنوعی طراحی شده‌اند.

🔬 ‏ سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینه‌سازی سیستم‌های KV-cache (حافظه موقت کلید-مقدار برای شتاب‌دهی پاسخ‌دهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حمل‌ونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.

📊 ‏ در ارزیابی مدل‌های پیشرو، GPT-5.6 Sol با موفقیت در حدود یک‌سوم وظایف، عملکردی هم‌تراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزان‌تر بوده و ۵۰ درصد توکن کمتری مصرف می‌کند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیف‌تری داشته که نشان‌دهنده ناکارآمدی آن در این تست‌هاست.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#FrontierBench #KV_cache