🇨🇳 جهش ریاضی مدل هوش مصنوعی چینی
🚀 شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیرهکننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدلهای هوش مصنوعی محسوب میشود.
🧠 اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارکهای معمول، گزینهای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تکتک خطوط استدلال را بررسی میکنند؛ کوچکترین نقص منطقی منجر به کسر امتیاز میشود.
⚙ ️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عاملمحور) بهره میبرد که در آن مدل، اثباتها را با استفاده از Python تولید، تست، اصلاح و بازنویسی میکند تا به دقت نهایی برسد. نکته قابلتوجه این است که این عملکرد درخشان توسط کوچکترین نسخه از خانواده مدلهای dots3 به دست آمده است که نشاندهنده بهینگی بالای معماری آن است.
#dots_note_3_0 #agentic_loop
🚀 شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیرهکننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدلهای هوش مصنوعی محسوب میشود.
🧠 اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارکهای معمول، گزینهای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تکتک خطوط استدلال را بررسی میکنند؛ کوچکترین نقص منطقی منجر به کسر امتیاز میشود.
⚙ ️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عاملمحور) بهره میبرد که در آن مدل، اثباتها را با استفاده از Python تولید، تست، اصلاح و بازنویسی میکند تا به دقت نهایی برسد. نکته قابلتوجه این است که این عملکرد درخشان توسط کوچکترین نسخه از خانواده مدلهای dots3 به دست آمده است که نشاندهنده بهینگی بالای معماری آن است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#dots_note_3_0 #agentic_loop
🚀 معرفی بنچمارک جامع FrontierBench
نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزههای مختلف است که برای سنجش واقعگرایانه مدلهای هوش مصنوعی طراحی شدهاند.
🔬 سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینهسازی سیستمهای KV-cache (حافظه موقت کلید-مقدار برای شتابدهی پاسخدهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حملونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.
📊 در ارزیابی مدلهای پیشرو، GPT-5.6 Sol با موفقیت در حدود یکسوم وظایف، عملکردی همتراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزانتر بوده و ۵۰ درصد توکن کمتری مصرف میکند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیفتری داشته که نشاندهنده ناکارآمدی آن در این تستهاست.
#FrontierBench #KV_cache
نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزههای مختلف است که برای سنجش واقعگرایانه مدلهای هوش مصنوعی طراحی شدهاند.
🔬 سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینهسازی سیستمهای KV-cache (حافظه موقت کلید-مقدار برای شتابدهی پاسخدهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حملونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.
📊 در ارزیابی مدلهای پیشرو، GPT-5.6 Sol با موفقیت در حدود یکسوم وظایف، عملکردی همتراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزانتر بوده و ۵۰ درصد توکن کمتری مصرف میکند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیفتری داشته که نشاندهنده ناکارآمدی آن در این تستهاست.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#FrontierBench #KV_cache
🚀 آشنایی با فریمورکهای محبوب یادگیری عمیق
🧠 PyTorch یک کتابخانه متنباز (Open-source) برای یادگیری عمیق است که توسط Meta توسعه یافته و به دلیل انعطافپذیری بالا و استفاده از گراف محاسباتی پویا، در پروژههای تحقیقاتی و صنعتی بسیار محبوب است. این ابزار به دلیل سازگاری کامل با Python، پشتیبانی عالی از عملیات دیباگینگ و بهرهگیری از قدرت GPU Acceleration (شتابدهنده گرافیکی)، انتخابی استاندارد برای توسعه مدلهای پیشرفته هوش مصنوعی به شمار میرود.
⚡️ در مقابل، Keras یک API سطح بالا است که به عنوان رابط کاربری روی TensorFlow اجرا میشود تا فرآیند طراحی شبکههای عصبی را به شدت ساده کند. این ابزار با ارائه اینترفیسهای بسیار ساده برای ساخت، آموزش و ارزیابی مدلها، نیاز به نوشتن کدهای پیچیده را به حداقل میرساند.
📊 این فریمورک گزینهای ایدهآل برای Fast Prototyping (نمونهسازی سریع) است و بهطور بومی از معماریهای CNN، RNN و مدلهای پیشرفته Transformers پشتیبانی میکند. Keras به دلیل انتگراسیون کامل با تنسورفلو و کاهش حجم کدنویسی، بهترین نقطه شروع برای افرادی است که قصد ورود به دنیای یادگیری عمیق را دارند.
#PyTorch #Keras
🧠 PyTorch یک کتابخانه متنباز (Open-source) برای یادگیری عمیق است که توسط Meta توسعه یافته و به دلیل انعطافپذیری بالا و استفاده از گراف محاسباتی پویا، در پروژههای تحقیقاتی و صنعتی بسیار محبوب است. این ابزار به دلیل سازگاری کامل با Python، پشتیبانی عالی از عملیات دیباگینگ و بهرهگیری از قدرت GPU Acceleration (شتابدهنده گرافیکی)، انتخابی استاندارد برای توسعه مدلهای پیشرفته هوش مصنوعی به شمار میرود.
🔹 یادگیری آسان: منحنی یادگیری ملایم برای کاربران جدید.
🔹 جامعه کاربری گسترده: وجود اکوسیستم قوی تحقیقاتی و منابع آموزشی فراوان.
🔹 ساختار داینامیک: امکان تغییر رفتار مدل در زمان اجرا برای انعطاف بیشتر.
⚡️ در مقابل، Keras یک API سطح بالا است که به عنوان رابط کاربری روی TensorFlow اجرا میشود تا فرآیند طراحی شبکههای عصبی را به شدت ساده کند. این ابزار با ارائه اینترفیسهای بسیار ساده برای ساخت، آموزش و ارزیابی مدلها، نیاز به نوشتن کدهای پیچیده را به حداقل میرساند.
📊 این فریمورک گزینهای ایدهآل برای Fast Prototyping (نمونهسازی سریع) است و بهطور بومی از معماریهای CNN، RNN و مدلهای پیشرفته Transformers پشتیبانی میکند. Keras به دلیل انتگراسیون کامل با تنسورفلو و کاهش حجم کدنویسی، بهترین نقطه شروع برای افرادی است که قصد ورود به دنیای یادگیری عمیق را دارند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#PyTorch #Keras
Media is too big
VIEW IN TELEGRAM
🧠 پیشرفتهای جدید نورالینک در کنترل تجهیزات
🚀 شرکت Neuralink در تازهترین دستاورد خود اعلام کرد که بیماران دارای ایمپلنت این شرکت، اکنون قادر هستند صندلیهای چرخدار خود را تنها با استفاده از سیگنالهای مغزی و قدرت تفکر کنترل کنند.
💡 این پیشرفت نشاندهنده گام بزرگی در بهبود رابط مغز و کامپیوتر (BCI) است که میتواند استقلال حرکتی بیشتری را برای افراد دارای معلولیتهای حرکتی شدید فراهم کند. استفاده از فناوریهای عصبی برای تعامل مستقیم با دنیای فیزیکی، پتانسیل بالایی در بازگرداندن توانمندیهای حرکتی به کاربران دارد.
#Neuralink #BCI
🚀 شرکت Neuralink در تازهترین دستاورد خود اعلام کرد که بیماران دارای ایمپلنت این شرکت، اکنون قادر هستند صندلیهای چرخدار خود را تنها با استفاده از سیگنالهای مغزی و قدرت تفکر کنترل کنند.
💡 این پیشرفت نشاندهنده گام بزرگی در بهبود رابط مغز و کامپیوتر (BCI) است که میتواند استقلال حرکتی بیشتری را برای افراد دارای معلولیتهای حرکتی شدید فراهم کند. استفاده از فناوریهای عصبی برای تعامل مستقیم با دنیای فیزیکی، پتانسیل بالایی در بازگرداندن توانمندیهای حرکتی به کاربران دارد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Neuralink #BCI
🤖 بهینهسازی ایجنتهای کدنویس با Harness Handbook
🔬 محققان در مقاله جدیدی به بررسی چالش ویرایش کد توسط ایجنتهای هوشمند پرداختهاند. در مدلهای فعلی، ساختار پراکنده فایلها باعث میشود ایجنتها بخشهایی از پیادهسازی را نادیده بگیرند، لذا پیشنهاد شده است که مخازن کد بهجای فایل، بر اساس رفتار (Behavior) توصیف شوند.
⚡️ ابزار Harness Handbook با ترکیب تحلیل ایستا (Static Analysis) و LLM، نقشهای از رفتار سیستم میسازد. این نقشه با سه سطح جزئیات، به ایجنت کمک میکند تا ابتدا رفتار هدف را شناسایی کرده و سپس با دقت بالا به سراغ کد اصلی برود.
📊 نتایج ارزیابیها بسیار درخشان است؛ کیفیت برنامهریزی در تسکهای Codex از ۲۸.۳٪ به ۳۸.۳٪ افزایش یافت. همچنین در مدل Terminus-2، این شاخص از ۲۶.۷٪ به ۴۵.۶٪ رسید که نشاندهنده اثربخشی بالای این رویکرد است.
🧠 علاوه بر دقت، مصرف توکنهای بخش برنامهریز (Planner) نیز بین ۸.۶٪ تا ۱۲.۷٪ کاهش یافت.
Paper: https://arxiv.org/abs/2607.13285
#Harness_Handbook #Terminus_2
🔬 محققان در مقاله جدیدی به بررسی چالش ویرایش کد توسط ایجنتهای هوشمند پرداختهاند. در مدلهای فعلی، ساختار پراکنده فایلها باعث میشود ایجنتها بخشهایی از پیادهسازی را نادیده بگیرند، لذا پیشنهاد شده است که مخازن کد بهجای فایل، بر اساس رفتار (Behavior) توصیف شوند.
⚡️ ابزار Harness Handbook با ترکیب تحلیل ایستا (Static Analysis) و LLM، نقشهای از رفتار سیستم میسازد. این نقشه با سه سطح جزئیات، به ایجنت کمک میکند تا ابتدا رفتار هدف را شناسایی کرده و سپس با دقت بالا به سراغ کد اصلی برود.
📊 نتایج ارزیابیها بسیار درخشان است؛ کیفیت برنامهریزی در تسکهای Codex از ۲۸.۳٪ به ۳۸.۳٪ افزایش یافت. همچنین در مدل Terminus-2، این شاخص از ۲۶.۷٪ به ۴۵.۶٪ رسید که نشاندهنده اثربخشی بالای این رویکرد است.
🧠 علاوه بر دقت، مصرف توکنهای بخش برنامهریز (Planner) نیز بین ۸.۶٪ تا ۱۲.۷٪ کاهش یافت.
Paper: https://arxiv.org/abs/2607.13285
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Harness_Handbook #Terminus_2
❤1
🐡 معرفی مدل جدید Fugu-Ultra v1.1
🚀 شرکت Sakana AI بهتازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهرهگیری از جدیدترین مدلهای پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.
📊 میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد میرسد. بیشترین پیشرفت در شاخصهای ProgramBench و Terminal Bench 2.1 مشاهده میشود که نشاندهنده توانمندی بالای مدل در محیطهای تخصصی برنامهنویسی است.
🧠 این مدل در حوزههای coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلالهای منطقی پیچیده، بسیار بهینهتر عمل میکند. نکته حائز اهمیت این است که تمامی این قابلیتهای فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شدهاند.
⚡ توسعهدهندگان اکنون میتوانند پروژههای عملیاتی سنگینتری را با همان هزینه قبلی پیش ببرند.
#Fugu_Ultra #ProgramBench
🚀 شرکت Sakana AI بهتازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهرهگیری از جدیدترین مدلهای پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.
📊 میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد میرسد. بیشترین پیشرفت در شاخصهای ProgramBench و Terminal Bench 2.1 مشاهده میشود که نشاندهنده توانمندی بالای مدل در محیطهای تخصصی برنامهنویسی است.
🧠 این مدل در حوزههای coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلالهای منطقی پیچیده، بسیار بهینهتر عمل میکند. نکته حائز اهمیت این است که تمامی این قابلیتهای فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شدهاند.
⚡ توسعهدهندگان اکنون میتوانند پروژههای عملیاتی سنگینتری را با همان هزینه قبلی پیش ببرند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Fugu_Ultra #ProgramBench
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 تحلیل تخصصی معماری سختافزار برای هوش مصنوعی
⚡ دنیای سختافزارهای AI حول ۵ معماری اصلی میچرخد که هرکدام توازن متفاوتی میان انعطافپذیری، موازیسازی و دسترسی به حافظه برقرار میکنند. پردازندههای مرکزی یا CPU با هستههای قدرتمند برای وظایف منطقی و سیستمعامل بهینه شدهاند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکههای عصبی و محاسبات ماتریسی موازی است.
🧠 واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی دادهها استفاده میکنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخههای بهینهشده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاههایی مثل گوشیهای هوشمند انجام میدهند.
🚀 نسل جدید سختافزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.
#LMCache #Groq
⚡ دنیای سختافزارهای AI حول ۵ معماری اصلی میچرخد که هرکدام توازن متفاوتی میان انعطافپذیری، موازیسازی و دسترسی به حافظه برقرار میکنند. پردازندههای مرکزی یا CPU با هستههای قدرتمند برای وظایف منطقی و سیستمعامل بهینه شدهاند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکههای عصبی و محاسبات ماتریسی موازی است.
🧠 واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی دادهها استفاده میکنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخههای بهینهشده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاههایی مثل گوشیهای هوشمند انجام میدهند.
🚀 نسل جدید سختافزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#LMCache #Groq
🐝 پلتفرم Buzz: تحولی در تعامل انسان و ایجنتهای هوش مصنوعی
پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، بهعنوان یک فضای کار متنباز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیمهای ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شدهاند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم میکند.
🧠 این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نهتنها امنیت را ارتقا میدهد، بلکه اجازه میدهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، بهراحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل میشود که تاریخچه کامل گفتگوها، کامیتها و ریوها را در خود نگه میدارد.
⚡ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنتها (گروهی از ایجنتهای همکار) بهینه شده است.
#Buzz_Platform #Nostr_Protocol
پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، بهعنوان یک فضای کار متنباز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیمهای ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شدهاند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم میکند.
🧠 این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نهتنها امنیت را ارتقا میدهد، بلکه اجازه میدهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، بهراحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل میشود که تاریخچه کامل گفتگوها، کامیتها و ریوها را در خود نگه میدارد.
⚡ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنتها (گروهی از ایجنتهای همکار) بهینه شده است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Buzz_Platform #Nostr_Protocol
🚀 معرفی مدل هوشمند Ling-3.0-flash
شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهرهوری بینظیری را برای ایجنتهای هوش مصنوعی فراهم میکند و عملکردی همتراز با مدلهای 1 تریلیون پارامتری ارائه میدهد.
🧠 معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینههای پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.
⚡ از قابلیتهای کلیدی آن میتوان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاسپذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستمهای گرافیکی، مدیریت فایلهای مالی اکسل و هماهنگی ایجنتهای علمی عملکردی خیرهکننده دارد.
🔭 در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.
#Ling_3 #Hybrid_linear_attention
شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهرهوری بینظیری را برای ایجنتهای هوش مصنوعی فراهم میکند و عملکردی همتراز با مدلهای 1 تریلیون پارامتری ارائه میدهد.
🧠 معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینههای پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.
⚡ از قابلیتهای کلیدی آن میتوان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاسپذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستمهای گرافیکی، مدیریت فایلهای مالی اکسل و هماهنگی ایجنتهای علمی عملکردی خیرهکننده دارد.
🔭 در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Ling_3 #Hybrid_linear_attention
🤖 معرفی مدل هوشمند Claude Opus 5
شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که بهطور ویژه برای کارهای پیچیده برنامهنویسی، وظایف عاملی (Agentic tasks) و تحلیلهای سنگین بهینهسازی شده است، در بنچمارکهای متعددی پیشتاز میدان است.
🚀 این مدل در Frontier-Bench v0.1 ویژه مهندسی نرمافزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیکترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه میدهد مدل پیش از ارائه پاسخ نهایی، خروجیهای خود را بازبینی و اشتباهات احتمالی را برطرف کند.
📊 تحلیل دقیق عملکرد نشان میدهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستمعامل است، نتایج درخشانی از خود بر جای گذاشته است.
#Claude_Opus_5 #ARC_AGI_3
شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که بهطور ویژه برای کارهای پیچیده برنامهنویسی، وظایف عاملی (Agentic tasks) و تحلیلهای سنگین بهینهسازی شده است، در بنچمارکهای متعددی پیشتاز میدان است.
🚀 این مدل در Frontier-Bench v0.1 ویژه مهندسی نرمافزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیکترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه میدهد مدل پیش از ارائه پاسخ نهایی، خروجیهای خود را بازبینی و اشتباهات احتمالی را برطرف کند.
📊 تحلیل دقیق عملکرد نشان میدهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستمعامل است، نتایج درخشانی از خود بر جای گذاشته است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Claude_Opus_5 #ARC_AGI_3
❤1
🤖 مدل Claude Opus 5 پیشتاز جدید هوش مصنوعی
🔬 مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.
⚡ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیرهکننده در بنچمارکهای GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجیهای دقیق حرفهای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.
📊 اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقبتر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی میکند.
💰 قیمتگذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.
#Claude_Opus_5 #GDPval_AA
🔬 مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.
⚡ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیرهکننده در بنچمارکهای GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجیهای دقیق حرفهای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.
📊 اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقبتر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی میکند.
💰 قیمتگذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Claude_Opus_5 #GDPval_AA
🚀 فراتر از مهندسی پرامپت: ۵ لایه کلیدی در توسعه ایجنتها
🧠 برای تبدیل ایجنتهای هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیینکننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیعتری نسبت به لایه قبل ارائه میدهد.
⚡ لایه اول یعنی پرامپت، کنترلکننده تعاملات ساده مانند تعیین نقش، نمونهها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی میپردازد تا مدل دقیقترین دادهها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.
⚙ ️ لایه سوم، Harness Engineering نام دارد که شامل زیرساختهای کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزمهای Retry، اعتبارسنجی خروجیها و مسیریابی به سابایجنتها در این بخش قرار میگیرند.
#Context_Engineering #Harness_Engineering
🧠 برای تبدیل ایجنتهای هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیینکننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیعتری نسبت به لایه قبل ارائه میدهد.
⚡ لایه اول یعنی پرامپت، کنترلکننده تعاملات ساده مانند تعیین نقش، نمونهها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی میپردازد تا مدل دقیقترین دادهها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.
⚙ ️ لایه سوم، Harness Engineering نام دارد که شامل زیرساختهای کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزمهای Retry، اعتبارسنجی خروجیها و مسیریابی به سابایجنتها در این بخش قرار میگیرند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Context_Engineering #Harness_Engineering
🌐 بیانیه شرکتهای بزرگ فناوری برای حمایت از مدلهای متنباز
شرکتهای بزرگ فناوری در نامهای رسمی با عنوان «وزنهای باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدلهایی که پارامترهای آنها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمیشود.
🚀 این نامه استدلال میکند که مدلهای متنباز با تسهیل دسترسی استارتاپها و دانشگاهها به تکنولوژیهای پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی میشوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینههای سنگینِ مدلهای تجاری کاهش مییابد.
🛡 متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدلهای قدرتمند برای شناسایی آسیبپذیریها ضروری است. شفافیت ناشی از این مدلها به جامعه محققان کمک میکند تا رفتار سیستمها را مطالعه کرده و مکانیزمهای دفاعی قویتری توسعه دهند.
#Open_Weights #AI_Leadership
شرکتهای بزرگ فناوری در نامهای رسمی با عنوان «وزنهای باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدلهایی که پارامترهای آنها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمیشود.
🚀 این نامه استدلال میکند که مدلهای متنباز با تسهیل دسترسی استارتاپها و دانشگاهها به تکنولوژیهای پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی میشوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینههای سنگینِ مدلهای تجاری کاهش مییابد.
🛡 متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدلهای قدرتمند برای شناسایی آسیبپذیریها ضروری است. شفافیت ناشی از این مدلها به جامعه محققان کمک میکند تا رفتار سیستمها را مطالعه کرده و مکانیزمهای دفاعی قویتری توسعه دهند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Open_Weights #AI_Leadership
📊 راهنمای جامع بنچمارکهای ارزیابی هوش مصنوعی
🔬 با رشد سریع مدلهای زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدلها فراتر از شمارش پارامترها یا تستهای ساده است. بنچمارکها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدلها در محیطهای واقعی هستند.
💻 در حوزه کدنویسی و مهندسی نرمافزار، مجموعههای SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامهنویسی محسوب میشوند.
🤖 برای ارزیابی عملکرد ایجنتها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارکهای WideSearch و BrowseComp برای سنجش مهارتهای جستوجو و ناوبری ارائه شدهاند.
🎯 جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمونهای IFBench، SysBench و Multi-IF دقیقترین ارزیابیها را ارائه میدهند. همچنین برای سنجش حافظه و متنهای طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.
#SWE_Bench_Pro #Multi_IF
🔬 با رشد سریع مدلهای زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدلها فراتر از شمارش پارامترها یا تستهای ساده است. بنچمارکها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدلها در محیطهای واقعی هستند.
💻 در حوزه کدنویسی و مهندسی نرمافزار، مجموعههای SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامهنویسی محسوب میشوند.
🤖 برای ارزیابی عملکرد ایجنتها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارکهای WideSearch و BrowseComp برای سنجش مهارتهای جستوجو و ناوبری ارائه شدهاند.
🎯 جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمونهای IFBench، SysBench و Multi-IF دقیقترین ارزیابیها را ارائه میدهند. همچنین برای سنجش حافظه و متنهای طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#SWE_Bench_Pro #Multi_IF
❤1
🧠 خلاصه تحولات 48 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #68 | 📦 103 پست
🕐 پنجشنبه 1405/05/01 ساعت 14:00 تا شنبه 1405/05/03 ساعت 14:00
🤖 مدلهای زبانی بزرگ
🦾 رباتیک و هوش عاملی
⚙️ توسعه، امنیت و زیرساخت
📊 ابزارهای داده و بنچمارکها
🎓 پژوهش و آموزش
🗂 گزارش #68 | 📦 103 پست
🕐 پنجشنبه 1405/05/01 ساعت 14:00 تا شنبه 1405/05/03 ساعت 14:00
🤖 مدلهای زبانی بزرگ
مدل Grok 4.5 با کسب امتیاز 1543 در صدر مدلها قرار دارد و رقابت سنگینی با مدلهای چینی مانند Qwen 3.8 Max با ظرفیت ۲.۴ تریلیون پارامتر شکل گرفته است.
🔗 مشاهده پست
مدل Claude Opus 5 به عنوان پرچمدار جدید Anthropic، در بنچمارک ARC-AGI-3 عملکردی ۳ برابر بهتر از رقبا داشته و در حوزه کدنویسی عاملی پیشتاز است.
🔗 مشاهده پست
مدل Fugu-Ultra v1.1 از شرکت Sakana AI با ارتقای میانگین دقت ۷.۹ واحد، در حوزههای Agentic Tasks و برنامهنویسی بهینهسازی شده است.
🔗 مشاهده پست
مدل ویدئویی FLUX 3 از Black Forest Labs با قابلیت تولید چندوجهی Multimodal، نویدبخش تحولی جدید در رقابت با مدلهای گوگل است.
🔗 مشاهده پست
🦾 رباتیک و هوش عاملی
صنعت رباتیک تا سال 2040 با رشدی ۳۷۰ برابری به ارزش ۳۷۰ میلیارد دلار خواهد رسید که موتور محرک آن رباتهای انساننما است.
🔗 مشاهده پست
قابلیت Plan Mode در ابزار Manus، امکان تحلیل و تدوین طرح اجرایی پیش از اقدام را برای کاهش خطاهای ایجنتها فراهم میکند.
🔗 مشاهده پست
پلتفرم متنباز Buzz با پروتکل Nostr، محیطی غیرمتمرکز برای همکاری همزمان انسان و ایجنتهای هوش مصنوعی ایجاد کرده است.
🔗 مشاهده پست
⚙️ توسعه، امنیت و زیرساخت
ابزار Claude Security با معماری چندعامله، پیش از کامیت کد، ریپازیتوری را برای یافتن حفرههای امنیتی اسکن میکند.
🔗 مشاهده پست
قابلیت Router در ادیتور Cursor به صورت خودکار بهینهترین مدل زبانی را انتخاب کرده و تا ۶۰٪ کاهش هزینه به همراه دارد.
🔗 مشاهده پست
مدل Kimi K3 در دستاوردی فنی، با استفاده از ۳۲ عامل خودمختار موفق به اکسپلویت آسیبپذیری RCE در سرورهای Redis شد.
🔗 مشاهده پست
📊 ابزارهای داده و بنچمارکها
بنچمارک FrontierBench با ۷۴ وظیفه عملیاتی دشوار، جایگزین TerminalBench برای سنجش واقعگرایانه مدلها شده است.
🔗 مشاهده پست
دیتاستهای جدید در Kaggle شامل موضوعات متنوعی نظیر پیشبینی سلامت، تحلیل تراکنشهای بانکی، قیمت ارزهای دیجیتال و دادههای تاریخی فوتبال از سال 1872 است.
🔗 مشاهده پست
دیتاست Indian Labour & Corporate Law با بیش از ۹۵۰ بخش و فرمت JSON، منبعی ارزشمند برای تحلیلهای حقوقی و متنی است.
🔗 مشاهده پست
🎓 پژوهش و آموزش
مدل dots-note-3.0 موفق شد در آزمون المپیاد جهانی ریاضی IMO به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود است.
🔗 مشاهده پست
مدل UniD با رویکرد Unified Video Dense Prediction، وظایف پیشبینی چگال ویدیو را به صورت یکپارچه انجام میدهد.
🔗 مشاهده پست
شرکتهای فناوری در بیانیهای از اهمیت مدلهای دارای Open Weights برای رشد اقتصاد هوش مصنوعی و ارتقای امنیت سایبری دفاع کردند.
🔗 مشاهده پست
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🤖 درخشش هوش مصنوعی در المپیاد جهانی ریاضی
🔬 نتایج اخیر نشان میدهد مدل Claude Opus 5 موفق شده است در تمامی ۶ مسئله المپیاد جهانی ریاضی (IMO) 2026، امتیاز کامل ۴۲ از ۴۲ را کسب کند. این در حالی است که حد نصاب دریافت مدال طلا در این دوره، کسب ۲۹ امتیاز بوده است.
⚡ برخلاف سالهای گذشته، این مدل بدون استفاده از هیچگونه ابزار کمکی، دسترسی به اینترنت یا محیط اجرای پایتون این مسیر را طی کرده است. ارزیابی اولیه توسط یک «گروه مدلها» و سپس بازبینی دقیق متخصصان انسانی صورت گرفته که تأیید کردند هر ۲۴ راه حل تولید شده توسط مدل، کاملاً صحیح و استاندارد هستند.
🧠 ویژگی بارز این دستاورد، استفاده از Adaptive Thinking (تفکر تطبیقی) با ظرفیت خروجی ۲۵۶ هزار توکن است. مدل در این سناریو حتی در شرایطی که با محدودیت توکن مواجه بود، توانست راهکارهای جایگزین هوشمندانهای ارائه دهد.
📊 نکته قابل تأمل این است که مدلهای قدرتمند دیگری مانند GPT-5.6-Sol-Pro و Kimi K3 نیز نتایج مشابهی کسب کردهاند.
#Claude_Opus_5 #Adaptive_Thinking
🔬 نتایج اخیر نشان میدهد مدل Claude Opus 5 موفق شده است در تمامی ۶ مسئله المپیاد جهانی ریاضی (IMO) 2026، امتیاز کامل ۴۲ از ۴۲ را کسب کند. این در حالی است که حد نصاب دریافت مدال طلا در این دوره، کسب ۲۹ امتیاز بوده است.
⚡ برخلاف سالهای گذشته، این مدل بدون استفاده از هیچگونه ابزار کمکی، دسترسی به اینترنت یا محیط اجرای پایتون این مسیر را طی کرده است. ارزیابی اولیه توسط یک «گروه مدلها» و سپس بازبینی دقیق متخصصان انسانی صورت گرفته که تأیید کردند هر ۲۴ راه حل تولید شده توسط مدل، کاملاً صحیح و استاندارد هستند.
🧠 ویژگی بارز این دستاورد، استفاده از Adaptive Thinking (تفکر تطبیقی) با ظرفیت خروجی ۲۵۶ هزار توکن است. مدل در این سناریو حتی در شرایطی که با محدودیت توکن مواجه بود، توانست راهکارهای جایگزین هوشمندانهای ارائه دهد.
📊 نکته قابل تأمل این است که مدلهای قدرتمند دیگری مانند GPT-5.6-Sol-Pro و Kimi K3 نیز نتایج مشابهی کسب کردهاند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Claude_Opus_5 #Adaptive_Thinking