هوش مصنوعی و علم داده به فارسی
6.04K subscribers
1.35K photos
364 videos
336 files
1.5K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
🇨🇳 جهش ریاضی مدل هوش مصنوعی چینی

🚀 ‏ شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیره‌کننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدل‌های هوش مصنوعی محسوب می‌شود.

🧠 ‏ اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارک‌های معمول، گزینه‌ای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تک‌تک خطوط استدلال را بررسی می‌کنند؛ کوچک‌ترین نقص منطقی منجر به کسر امتیاز می‌شود.

‏️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عامل‌محور) بهره می‌برد که در آن مدل، اثبات‌ها را با استفاده از Python تولید، تست، اصلاح و بازنویسی می‌کند تا به دقت نهایی برسد. نکته قابل‌توجه این است که این عملکرد درخشان توسط کوچک‌ترین نسخه از خانواده مدل‌های dots3 به دست آمده است که نشان‌دهنده بهینگی بالای معماری آن است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#dots_note_3_0 #agentic_loop
🚀 معرفی بنچمارک جامع FrontierBench

‏نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزه‌های مختلف است که برای سنجش واقع‌گرایانه مدل‌های هوش مصنوعی طراحی شده‌اند.

🔬 ‏ سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینه‌سازی سیستم‌های KV-cache (حافظه موقت کلید-مقدار برای شتاب‌دهی پاسخ‌دهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حمل‌ونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.

📊 ‏ در ارزیابی مدل‌های پیشرو، GPT-5.6 Sol با موفقیت در حدود یک‌سوم وظایف، عملکردی هم‌تراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزان‌تر بوده و ۵۰ درصد توکن کمتری مصرف می‌کند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیف‌تری داشته که نشان‌دهنده ناکارآمدی آن در این تست‌هاست.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#FrontierBench #KV_cache
🚀 آشنایی با فریم‌ورک‌های محبوب یادگیری عمیق

🧠PyTorch یک کتابخانه متن‌باز (Open-source) برای یادگیری عمیق است که توسط Meta توسعه یافته و به دلیل انعطاف‌پذیری بالا و استفاده از گراف محاسباتی پویا، در پروژه‌های تحقیقاتی و صنعتی بسیار محبوب است. این ابزار به دلیل سازگاری کامل با Python، پشتیبانی عالی از عملیات دیباگینگ و بهره‌گیری از قدرت GPU Acceleration (شتاب‌دهنده گرافیکی)، انتخابی استاندارد برای توسعه مدل‌های پیشرفته هوش مصنوعی به شمار می‌رود.


🔹یادگیری آسان: منحنی یادگیری ملایم برای کاربران جدید.
🔹جامعه کاربری گسترده: وجود اکوسیستم قوی تحقیقاتی و منابع آموزشی فراوان.
🔹ساختار داینامیک: امکان تغییر رفتار مدل در زمان اجرا برای انعطاف بیشتر.


⚡️ ‏ در مقابل، Keras یک API سطح بالا است که به عنوان رابط کاربری روی TensorFlow اجرا می‌شود تا فرآیند طراحی شبکه‌های عصبی را به شدت ساده کند. این ابزار با ارائه اینترفیس‌های بسیار ساده برای ساخت، آموزش و ارزیابی مدل‌ها، نیاز به نوشتن کدهای پیچیده را به حداقل می‌رساند.

📊 ‏ این فریم‌ورک گزینه‌ای ایده‌آل برای Fast Prototyping (نمونه‌سازی سریع) است و به‌طور بومی از معماری‌های CNN، RNN و مدل‌های پیشرفته Transformers پشتیبانی می‌کند. Keras به دلیل انتگراسیون کامل با تنسورفلو و کاهش حجم کدنویسی، بهترین نقطه شروع برای افرادی است که قصد ورود به دنیای یادگیری عمیق را دارند.



📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#PyTorch #Keras
Media is too big
VIEW IN TELEGRAM
🧠 پیشرفت‌های جدید نورالینک در کنترل تجهیزات

🚀 ‏ شرکت Neuralink در تازه‌ترین دستاورد خود اعلام کرد که بیماران دارای ایمپلنت این شرکت، اکنون قادر هستند صندلی‌های چرخ‌دار خود را تنها با استفاده از سیگنال‌های مغزی و قدرت تفکر کنترل کنند.

💡 ‏ این پیشرفت نشان‌دهنده گام بزرگی در بهبود رابط مغز و کامپیوتر (BCI) است که می‌تواند استقلال حرکتی بیشتری را برای افراد دارای معلولیت‌های حرکتی شدید فراهم کند. استفاده از فناوری‌های عصبی برای تعامل مستقیم با دنیای فیزیکی، پتانسیل بالایی در بازگرداندن توانمندی‌های حرکتی به کاربران دارد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Neuralink #BCI
🤖 بهینه‌سازی ایجنت‌های کدنویس با Harness Handbook

🔬 ‏ محققان در مقاله جدیدی به بررسی چالش ویرایش کد توسط ایجنت‌های هوشمند پرداخته‌اند. در مدل‌های فعلی، ساختار پراکنده فایل‌ها باعث می‌شود ایجنت‌ها بخش‌هایی از پیاده‌سازی را نادیده بگیرند، لذا پیشنهاد شده است که مخازن کد به‌جای فایل، بر اساس رفتار (Behavior) توصیف شوند.

⚡️ ‏ ابزار Harness Handbook با ترکیب تحلیل ایستا (Static Analysis) و LLM، نقشه‌ای از رفتار سیستم می‌سازد. این نقشه با سه سطح جزئیات، به ایجنت کمک می‌کند تا ابتدا رفتار هدف را شناسایی کرده و سپس با دقت بالا به سراغ کد اصلی برود.

📊 ‏ نتایج ارزیابی‌ها بسیار درخشان است؛ کیفیت برنامه‌ریزی در تسک‌های Codex از ۲۸.۳٪ به ۳۸.۳٪ افزایش یافت. همچنین در مدل Terminus-2، این شاخص از ۲۶.۷٪ به ۴۵.۶٪ رسید که نشان‌دهنده اثربخشی بالای این رویکرد است.

🧠 ‏ علاوه بر دقت، مصرف توکن‌های بخش برنامه‌ریز (Planner) نیز بین ۸.۶٪ تا ۱۲.۷٪ کاهش یافت.

Paper: https://arxiv.org/abs/2607.13285

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Harness_Handbook #Terminus_2
1
🐡 معرفی مدل جدید Fugu-Ultra v1.1

🚀 ‏ شرکت Sakana AI به‌تازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهره‌گیری از جدیدترین مدل‌های پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.

📊 ‏ میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد می‌رسد. بیشترین پیشرفت در شاخص‌های ProgramBench و Terminal Bench 2.1 مشاهده می‌شود که نشان‌دهنده توانمندی بالای مدل در محیط‌های تخصصی برنامه‌نویسی است.

🧠 ‏ این مدل در حوزه‌های coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلال‌های منطقی پیچیده، بسیار بهینه‌تر عمل می‌کند. نکته حائز اهمیت این است که تمامی این قابلیت‌های فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شده‌اند.

‏ توسعه‌دهندگان اکنون می‌توانند پروژه‌های عملیاتی سنگین‌تری را با همان هزینه قبلی پیش ببرند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Fugu_Ultra #ProgramBench
1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖تحلیل تخصصی معماری سخت‌افزار برای هوش مصنوعی

‏ دنیای سخت‌افزارهای AI حول ۵ معماری اصلی می‌چرخد که هرکدام توازن متفاوتی میان انعطاف‌پذیری، موازی‌سازی و دسترسی به حافظه برقرار می‌کنند. پردازنده‌های مرکزی یا CPU با هسته‌های قدرتمند برای وظایف منطقی و سیستم‌عامل بهینه شده‌اند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکه‌های عصبی و محاسبات ماتریسی موازی است.

🧠 ‏ واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی داده‌ها استفاده می‌کنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخه‌های بهینه‌شده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاه‌هایی مثل گوشی‌های هوشمند انجام می‌دهند.

🚀 ‏ نسل جدید سخت‌افزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#LMCache #Groq
🐝 پلتفرم Buzz: تحولی در تعامل انسان و ایجنت‌های هوش مصنوعی

‏پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، به‌عنوان یک فضای کار متن‌باز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیم‌های ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شده‌اند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم می‌کند.

🧠 ‏ این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نه‌تنها امنیت را ارتقا می‌دهد، بلکه اجازه می‌دهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، به‌راحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل می‌شود که تاریخچه کامل گفتگوها، کامیت‌ها و ریوها را در خود نگه می‌دارد.

‏ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنت‌ها (گروهی از ایجنت‌های همکار) بهینه شده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Buzz_Platform #Nostr_Protocol
🚀 معرفی مدل هوشمند Ling-3.0-flash

‏شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهره‌وری بی‌نظیری را برای ایجنت‌های هوش مصنوعی فراهم می‌کند و عملکردی هم‌تراز با مدل‌های 1 تریلیون پارامتری ارائه می‌دهد.

🧠 ‏ معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینه‌های پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.

‏ از قابلیت‌های کلیدی آن می‌توان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاس‌پذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستم‌های گرافیکی، مدیریت فایل‌های مالی اکسل و هماهنگی ایجنت‌های علمی عملکردی خیره‌کننده دارد.

🔭 ‏ در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Ling_3 #Hybrid_linear_attention
🤖 معرفی مدل هوشمند Claude Opus 5

‏شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که به‌طور ویژه برای کارهای پیچیده برنامه‌نویسی، وظایف عاملی (Agentic tasks) و تحلیل‌های سنگین بهینه‌سازی شده است، در بنچمارک‌های متعددی پیشتاز میدان است.

🚀 ‏ این مدل در Frontier-Bench v0.1 ویژه مهندسی نرم‌افزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیک‌ترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه می‌دهد مدل پیش از ارائه پاسخ نهایی، خروجی‌های خود را بازبینی و اشتباهات احتمالی را برطرف کند.

📊 ‏ تحلیل دقیق عملکرد نشان می‌دهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستم‌عامل است، نتایج درخشانی از خود بر جای گذاشته است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #ARC_AGI_3
1
🤖 مدل Claude Opus 5 پیشتاز جدید هوش مصنوعی

🔬 ‏ مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.

‏ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیره‌کننده در بنچمارک‌های GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجی‌های دقیق حرفه‌ای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.

📊 ‏ اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقب‌تر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی می‌کند.

💰 ‏ قیمت‌گذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #GDPval_AA
🚀 فراتر از مهندسی پرامپت: ۵ لایه کلیدی در توسعه ایجنت‌ها

🧠 ‏ برای تبدیل ایجنت‌های هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیین‌کننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیع‌تری نسبت به لایه قبل ارائه می‌دهد.

‏ لایه اول یعنی پرامپت، کنترل‌کننده تعاملات ساده مانند تعیین نقش، نمونه‌ها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی می‌پردازد تا مدل دقیق‌ترین داده‌ها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.

‏️ لایه سوم، Harness Engineering نام دارد که شامل زیرساخت‌های کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزم‌های Retry، اعتبارسنجی خروجی‌ها و مسیریابی به ساب‌ایجنت‌ها در این بخش قرار می‌گیرند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Context_Engineering #Harness_Engineering
🌐 بیانیه شرکت‌های بزرگ فناوری برای حمایت از مدل‌های متن‌باز

‏شرکت‌های بزرگ فناوری در نامه‌ای رسمی با عنوان «وزن‌های باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدل‌هایی که پارامترهای آن‌ها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمی‌شود.

🚀 ‏ این نامه استدلال می‌کند که مدل‌های متن‌باز با تسهیل دسترسی استارتاپ‌ها و دانشگاه‌ها به تکنولوژی‌های پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی می‌شوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینه‌های سنگینِ مدل‌های تجاری کاهش می‌یابد.

🛡 ‏ متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدل‌های قدرتمند برای شناسایی آسیب‌پذیری‌ها ضروری است. شفافیت ناشی از این مدل‌ها به جامعه محققان کمک می‌کند تا رفتار سیستم‌ها را مطالعه کرده و مکانیزم‌های دفاعی قوی‌تری توسعه دهند.


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Open_Weights #AI_Leadership
📊 راهنمای جامع بنچمارک‌های ارزیابی هوش مصنوعی

🔬 ‏ با رشد سریع مدل‌های زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدل‌ها فراتر از شمارش پارامترها یا تست‌های ساده است. بنچمارک‌ها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدل‌ها در محیط‌های واقعی هستند.

💻 ‏ در حوزه کدنویسی و مهندسی نرم‌افزار، مجموعه‌های SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامه‌نویسی محسوب می‌شوند.

🤖 ‏ برای ارزیابی عملکرد ایجنت‌ها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارک‌های WideSearch و BrowseComp برای سنجش مهارت‌های جست‌وجو و ناوبری ارائه شده‌اند.

🎯 ‏ جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمون‌های IFBench، SysBench و Multi-IF دقیق‌ترین ارزیابی‌ها را ارائه می‌دهند. همچنین برای سنجش حافظه و متن‌های طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#SWE_Bench_Pro #Multi_IF
1
🧠 خلاصه تحولات 48 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #68 | 📦 103 پست
🕐 پنجشنبه 1405/05/01 ساعت 14:00 تا شنبه 1405/05/03 ساعت 14:00

🤖 مدل‌های زبانی بزرگ

مدل Grok 4.5 با کسب امتیاز 1543 در صدر مدل‌ها قرار دارد و رقابت سنگینی با مدل‌های چینی مانند Qwen 3.8 Max با ظرفیت ۲.۴ تریلیون پارامتر شکل گرفته است.
🔗 مشاهده پست

مدل Claude Opus 5 به عنوان پرچمدار جدید Anthropic، در بنچمارک ARC-AGI-3 عملکردی ۳ برابر بهتر از رقبا داشته و در حوزه کدنویسی عاملی پیشتاز است.
🔗 مشاهده پست

مدل Fugu-Ultra v1.1 از شرکت Sakana AI با ارتقای میانگین دقت ۷.۹ واحد، در حوزه‌های Agentic Tasks و برنامه‌نویسی بهینه‌سازی شده است.
🔗 مشاهده پست

مدل ویدئویی FLUX 3 از Black Forest Labs با قابلیت تولید چندوجهی Multimodal، نویدبخش تحولی جدید در رقابت با مدل‌های گوگل است.
🔗 مشاهده پست


🦾 رباتیک و هوش عاملی

صنعت رباتیک تا سال 2040 با رشدی ۳۷۰ برابری به ارزش ۳۷۰ میلیارد دلار خواهد رسید که موتور محرک آن ربات‌های انسان‌نما است.
🔗 مشاهده پست

قابلیت Plan Mode در ابزار Manus، امکان تحلیل و تدوین طرح اجرایی پیش از اقدام را برای کاهش خطاهای ایجنت‌ها فراهم می‌کند.
🔗 مشاهده پست

پلتفرم متن‌باز Buzz با پروتکل Nostr، محیطی غیرمتمرکز برای همکاری هم‌زمان انسان و ایجنت‌های هوش مصنوعی ایجاد کرده است.
🔗 مشاهده پست


⚙️ توسعه، امنیت و زیرساخت

ابزار Claude Security با معماری چندعامله، پیش از کامیت کد، ریپازیتوری را برای یافتن حفره‌های امنیتی اسکن می‌کند.
🔗 مشاهده پست

قابلیت Router در ادیتور Cursor به صورت خودکار بهینه‌ترین مدل زبانی را انتخاب کرده و تا ۶۰٪ کاهش هزینه به همراه دارد.
🔗 مشاهده پست

مدل Kimi K3 در دستاوردی فنی، با استفاده از ۳۲ عامل خودمختار موفق به اکسپلویت آسیب‌پذیری RCE در سرورهای Redis شد.
🔗 مشاهده پست


📊 ابزارهای داده و بنچمارک‌ها

بنچمارک FrontierBench با ۷۴ وظیفه عملیاتی دشوار، جایگزین TerminalBench برای سنجش واقع‌گرایانه مدل‌ها شده است.
🔗 مشاهده پست

دیتاست‌های جدید در Kaggle شامل موضوعات متنوعی نظیر پیش‌بینی سلامت، تحلیل تراکنش‌های بانکی، قیمت ارزهای دیجیتال و داده‌های تاریخی فوتبال از سال 1872 است.
🔗 مشاهده پست

دیتاست Indian Labour & Corporate Law با بیش از ۹۵۰ بخش و فرمت JSON، منبعی ارزشمند برای تحلیل‌های حقوقی و متنی است.
🔗 مشاهده پست


🎓 پژوهش و آموزش

مدل dots-note-3.0 موفق شد در آزمون المپیاد جهانی ریاضی IMO به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود است.
🔗 مشاهده پست

مدل UniD با رویکرد Unified Video Dense Prediction، وظایف پیش‌بینی چگال ویدیو را به صورت یکپارچه انجام می‌دهد.
🔗 مشاهده پست

شرکت‌های فناوری در بیانیه‌ای از اهمیت مدل‌های دارای Open Weights برای رشد اقتصاد هوش مصنوعی و ارتقای امنیت سایبری دفاع کردند.
🔗 مشاهده پست


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🤖 درخشش هوش مصنوعی در المپیاد جهانی ریاضی

🔬 ‏ نتایج اخیر نشان می‌دهد مدل Claude Opus 5 موفق شده است در تمامی ۶ مسئله المپیاد جهانی ریاضی (IMO) 2026، امتیاز کامل ۴۲ از ۴۲ را کسب کند. این در حالی است که حد نصاب دریافت مدال طلا در این دوره، کسب ۲۹ امتیاز بوده است.

‏ برخلاف سال‌های گذشته، این مدل بدون استفاده از هیچ‌گونه ابزار کمکی، دسترسی به اینترنت یا محیط اجرای پایتون این مسیر را طی کرده است. ارزیابی اولیه توسط یک «گروه مدل‌ها» و سپس بازبینی دقیق متخصصان انسانی صورت گرفته که تأیید کردند هر ۲۴ راه حل تولید شده توسط مدل، کاملاً صحیح و استاندارد هستند.

🧠 ‏ ویژگی بارز این دستاورد، استفاده از Adaptive Thinking (تفکر تطبیقی) با ظرفیت خروجی ۲۵۶ هزار توکن است. مدل در این سناریو حتی در شرایطی که با محدودیت توکن مواجه بود، توانست راهکارهای جایگزین هوشمندانه‌ای ارائه دهد.

📊 ‏ نکته قابل تأمل این است که مدل‌های قدرتمند دیگری مانند GPT-5.6-Sol-Pro و Kimi K3 نیز نتایج مشابهی کسب کرده‌اند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #Adaptive_Thinking