This media is not supported in your browser
VIEW IN TELEGRAM
🤖 مقایسه عملکرد مدلهای پیشرفته در بنچمارک بازی آرکید
🔬 نتایج اجرای مدلهای Kimi K3، Fable 5، Gemini 3.6 Flash و GPT 5.6 Sol Ultra در یک بنچمارک شبیهسازی بازی آرکید منتشر شد. مدل Fable 5 با ارائه حرکات کاملاً طبیعی و بدون هیچگونه لگ، موفق شد تمیزترین عملکرد را در این ارزیابی ثبت کند.
⚡ نکته جالب درباره Gemini 3.6 Flash، رفتار تطبیقی آن است؛ این مدل در ابتدا سنگین عمل میکند اما با پیشرفت در بازی، چابکتر شده و در عین حال ۶۵٪ توکن کمتر مصرف میکند که بازدهی بالایی را نشان میدهد.
📊 در این میان GPT 5.6 Sol به عنوان یک مدل همهفنحریف، گیمپلی بسیار پایداری ارائه داد که فاقد هرگونه باگ یا خطای فنی بود.
🧩 در نهایت، مدل متنباز Kimi K3 به عنوان پدیده غیرمنتظره ظاهر شد که با وجود هزینه بسیار کمتر، از نظر کیفیت انیمیشن با Fable 5 برابری میکند و تحسین بسیاری را برانگیخت. این نتایج نشاندهنده پیشرفت چشمگیر مدلها در تعاملات بلادرنگ است.
#Kimi_K3 #Fable_5
🔬 نتایج اجرای مدلهای Kimi K3، Fable 5، Gemini 3.6 Flash و GPT 5.6 Sol Ultra در یک بنچمارک شبیهسازی بازی آرکید منتشر شد. مدل Fable 5 با ارائه حرکات کاملاً طبیعی و بدون هیچگونه لگ، موفق شد تمیزترین عملکرد را در این ارزیابی ثبت کند.
⚡ نکته جالب درباره Gemini 3.6 Flash، رفتار تطبیقی آن است؛ این مدل در ابتدا سنگین عمل میکند اما با پیشرفت در بازی، چابکتر شده و در عین حال ۶۵٪ توکن کمتر مصرف میکند که بازدهی بالایی را نشان میدهد.
📊 در این میان GPT 5.6 Sol به عنوان یک مدل همهفنحریف، گیمپلی بسیار پایداری ارائه داد که فاقد هرگونه باگ یا خطای فنی بود.
🧩 در نهایت، مدل متنباز Kimi K3 به عنوان پدیده غیرمنتظره ظاهر شد که با وجود هزینه بسیار کمتر، از نظر کیفیت انیمیشن با Fable 5 برابری میکند و تحسین بسیاری را برانگیخت. این نتایج نشاندهنده پیشرفت چشمگیر مدلها در تعاملات بلادرنگ است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Kimi_K3 #Fable_5
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 معرفی مدل Unified Video Dense Prediction برای پردازش ویدیویی
🔬 مدل جدید UniD با هدف یکپارچهسازی وظایف پیشبینی چگال در ویدیو معرفی شده است. این مدل قادر است بهطور همزمان چندین خروجی مختلف از جمله نقشه عمق (depth)، نرمالهای سطحی، بخشبندی معنایی (semantic segmentation) و تشخیص مرزها را تولید کند.
🧠 این معماری همچنین برای درک بهتر صحنه، جزئیات پیچیدهتری نظیر بخشهای بدن انسان، albedo، سایهها و ویژگیهای مواد موجود در ویدیو را استخراج میکند. این رویکرد Unified به جای استفاده از مدلهای مجزا، پتانسیل بالایی در ارتقای درک بصری ماشین در کاربردهای پیچیده ویدیویی دارد.
📊 بررسی دقیقتر این پژوهش و جزئیات فنی آن در منابع زیر در دسترس است.
https://arxiv.org/pdf/2607.21592
https://unid-video.github.io/
https://github.com/YihongSun/UniD
#UniD #Dense_Prediction
🔬 مدل جدید UniD با هدف یکپارچهسازی وظایف پیشبینی چگال در ویدیو معرفی شده است. این مدل قادر است بهطور همزمان چندین خروجی مختلف از جمله نقشه عمق (depth)، نرمالهای سطحی، بخشبندی معنایی (semantic segmentation) و تشخیص مرزها را تولید کند.
🧠 این معماری همچنین برای درک بهتر صحنه، جزئیات پیچیدهتری نظیر بخشهای بدن انسان، albedo، سایهها و ویژگیهای مواد موجود در ویدیو را استخراج میکند. این رویکرد Unified به جای استفاده از مدلهای مجزا، پتانسیل بالایی در ارتقای درک بصری ماشین در کاربردهای پیچیده ویدیویی دارد.
📊 بررسی دقیقتر این پژوهش و جزئیات فنی آن در منابع زیر در دسترس است.
https://arxiv.org/pdf/2607.21592
https://unid-video.github.io/
https://github.com/YihongSun/UniD
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#UniD #Dense_Prediction
🇨🇳 جهش ریاضی مدل هوش مصنوعی چینی
🚀 شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیرهکننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدلهای هوش مصنوعی محسوب میشود.
🧠 اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارکهای معمول، گزینهای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تکتک خطوط استدلال را بررسی میکنند؛ کوچکترین نقص منطقی منجر به کسر امتیاز میشود.
⚙ ️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عاملمحور) بهره میبرد که در آن مدل، اثباتها را با استفاده از Python تولید، تست، اصلاح و بازنویسی میکند تا به دقت نهایی برسد. نکته قابلتوجه این است که این عملکرد درخشان توسط کوچکترین نسخه از خانواده مدلهای dots3 به دست آمده است که نشاندهنده بهینگی بالای معماری آن است.
#dots_note_3_0 #agentic_loop
🚀 شرکت RedNote که پشت پلتفرم Xiaohongshu قرار دارد، از دستاورد خیرهکننده مدل هوش مصنوعی جدید خود با نام dots-note-3.0 خبر داد. این مدل موفق شد در آزمون المپیاد جهانی ریاضی (IMO) به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود برای مدلهای هوش مصنوعی محسوب میشود.
🧠 اهمیت این موفقیت در ماهیت آزمون IMO نهفته است که بر خلاف بنچمارکهای معمول، گزینهای نیست. هر پاسخ نیازمند ارائه یک اثبات کتبی کامل است و داوران انسانی تکتک خطوط استدلال را بررسی میکنند؛ کوچکترین نقص منطقی منجر به کسر امتیاز میشود.
⚙ ️ این مدل برای حل مسائل از یک agentic loop (حلقه خودکار عاملمحور) بهره میبرد که در آن مدل، اثباتها را با استفاده از Python تولید، تست، اصلاح و بازنویسی میکند تا به دقت نهایی برسد. نکته قابلتوجه این است که این عملکرد درخشان توسط کوچکترین نسخه از خانواده مدلهای dots3 به دست آمده است که نشاندهنده بهینگی بالای معماری آن است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#dots_note_3_0 #agentic_loop
🚀 معرفی بنچمارک جامع FrontierBench
نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزههای مختلف است که برای سنجش واقعگرایانه مدلهای هوش مصنوعی طراحی شدهاند.
🔬 سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینهسازی سیستمهای KV-cache (حافظه موقت کلید-مقدار برای شتابدهی پاسخدهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حملونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.
📊 در ارزیابی مدلهای پیشرو، GPT-5.6 Sol با موفقیت در حدود یکسوم وظایف، عملکردی همتراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزانتر بوده و ۵۰ درصد توکن کمتری مصرف میکند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیفتری داشته که نشاندهنده ناکارآمدی آن در این تستهاست.
#FrontierBench #KV_cache
نسخه جدید بنچمارک محبوب TerminalBench با تغییراتی بنیادین به FrontierBench ارتقا یافت. این ابزار شامل ۷۴ وظیفه عملیاتی دشوار و دستی در حوزههای مختلف است که برای سنجش واقعگرایانه مدلهای هوش مصنوعی طراحی شدهاند.
🔬 سناریوهای این بنچمارک بسیار کاربردی هستند؛ از بهینهسازی سیستمهای KV-cache (حافظه موقت کلید-مقدار برای شتابدهی پاسخدهی) بدون قطعی سرویس تا محاسبات پیچیده مالی برای ذخایر بانکی و مدیریت پویای ناوگان حملونقل کالا. تمرکز اصلی بر ارزش اقتصادی و توانایی حل مسائل دنیای واقعی در شرایط در حال تغییر است.
📊 در ارزیابی مدلهای پیشرو، GPT-5.6 Sol با موفقیت در حدود یکسوم وظایف، عملکردی همتراز با Fable 5 ثبت کرده است، با این تفاوت که مدل OpenAI حدود ۴۰ درصد ارزانتر بوده و ۵۰ درصد توکن کمتری مصرف میکند. در مقابل، مدل Sonnet 5 با وجود هزینه بالاتر و مصرف توکن زیاد، نتایج ضعیفتری داشته که نشاندهنده ناکارآمدی آن در این تستهاست.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#FrontierBench #KV_cache
🚀 آشنایی با فریمورکهای محبوب یادگیری عمیق
🧠 PyTorch یک کتابخانه متنباز (Open-source) برای یادگیری عمیق است که توسط Meta توسعه یافته و به دلیل انعطافپذیری بالا و استفاده از گراف محاسباتی پویا، در پروژههای تحقیقاتی و صنعتی بسیار محبوب است. این ابزار به دلیل سازگاری کامل با Python، پشتیبانی عالی از عملیات دیباگینگ و بهرهگیری از قدرت GPU Acceleration (شتابدهنده گرافیکی)، انتخابی استاندارد برای توسعه مدلهای پیشرفته هوش مصنوعی به شمار میرود.
⚡️ در مقابل، Keras یک API سطح بالا است که به عنوان رابط کاربری روی TensorFlow اجرا میشود تا فرآیند طراحی شبکههای عصبی را به شدت ساده کند. این ابزار با ارائه اینترفیسهای بسیار ساده برای ساخت، آموزش و ارزیابی مدلها، نیاز به نوشتن کدهای پیچیده را به حداقل میرساند.
📊 این فریمورک گزینهای ایدهآل برای Fast Prototyping (نمونهسازی سریع) است و بهطور بومی از معماریهای CNN، RNN و مدلهای پیشرفته Transformers پشتیبانی میکند. Keras به دلیل انتگراسیون کامل با تنسورفلو و کاهش حجم کدنویسی، بهترین نقطه شروع برای افرادی است که قصد ورود به دنیای یادگیری عمیق را دارند.
#PyTorch #Keras
🧠 PyTorch یک کتابخانه متنباز (Open-source) برای یادگیری عمیق است که توسط Meta توسعه یافته و به دلیل انعطافپذیری بالا و استفاده از گراف محاسباتی پویا، در پروژههای تحقیقاتی و صنعتی بسیار محبوب است. این ابزار به دلیل سازگاری کامل با Python، پشتیبانی عالی از عملیات دیباگینگ و بهرهگیری از قدرت GPU Acceleration (شتابدهنده گرافیکی)، انتخابی استاندارد برای توسعه مدلهای پیشرفته هوش مصنوعی به شمار میرود.
🔹 یادگیری آسان: منحنی یادگیری ملایم برای کاربران جدید.
🔹 جامعه کاربری گسترده: وجود اکوسیستم قوی تحقیقاتی و منابع آموزشی فراوان.
🔹 ساختار داینامیک: امکان تغییر رفتار مدل در زمان اجرا برای انعطاف بیشتر.
⚡️ در مقابل، Keras یک API سطح بالا است که به عنوان رابط کاربری روی TensorFlow اجرا میشود تا فرآیند طراحی شبکههای عصبی را به شدت ساده کند. این ابزار با ارائه اینترفیسهای بسیار ساده برای ساخت، آموزش و ارزیابی مدلها، نیاز به نوشتن کدهای پیچیده را به حداقل میرساند.
📊 این فریمورک گزینهای ایدهآل برای Fast Prototyping (نمونهسازی سریع) است و بهطور بومی از معماریهای CNN، RNN و مدلهای پیشرفته Transformers پشتیبانی میکند. Keras به دلیل انتگراسیون کامل با تنسورفلو و کاهش حجم کدنویسی، بهترین نقطه شروع برای افرادی است که قصد ورود به دنیای یادگیری عمیق را دارند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#PyTorch #Keras
Media is too big
VIEW IN TELEGRAM
🧠 پیشرفتهای جدید نورالینک در کنترل تجهیزات
🚀 شرکت Neuralink در تازهترین دستاورد خود اعلام کرد که بیماران دارای ایمپلنت این شرکت، اکنون قادر هستند صندلیهای چرخدار خود را تنها با استفاده از سیگنالهای مغزی و قدرت تفکر کنترل کنند.
💡 این پیشرفت نشاندهنده گام بزرگی در بهبود رابط مغز و کامپیوتر (BCI) است که میتواند استقلال حرکتی بیشتری را برای افراد دارای معلولیتهای حرکتی شدید فراهم کند. استفاده از فناوریهای عصبی برای تعامل مستقیم با دنیای فیزیکی، پتانسیل بالایی در بازگرداندن توانمندیهای حرکتی به کاربران دارد.
#Neuralink #BCI
🚀 شرکت Neuralink در تازهترین دستاورد خود اعلام کرد که بیماران دارای ایمپلنت این شرکت، اکنون قادر هستند صندلیهای چرخدار خود را تنها با استفاده از سیگنالهای مغزی و قدرت تفکر کنترل کنند.
💡 این پیشرفت نشاندهنده گام بزرگی در بهبود رابط مغز و کامپیوتر (BCI) است که میتواند استقلال حرکتی بیشتری را برای افراد دارای معلولیتهای حرکتی شدید فراهم کند. استفاده از فناوریهای عصبی برای تعامل مستقیم با دنیای فیزیکی، پتانسیل بالایی در بازگرداندن توانمندیهای حرکتی به کاربران دارد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Neuralink #BCI
🤖 بهینهسازی ایجنتهای کدنویس با Harness Handbook
🔬 محققان در مقاله جدیدی به بررسی چالش ویرایش کد توسط ایجنتهای هوشمند پرداختهاند. در مدلهای فعلی، ساختار پراکنده فایلها باعث میشود ایجنتها بخشهایی از پیادهسازی را نادیده بگیرند، لذا پیشنهاد شده است که مخازن کد بهجای فایل، بر اساس رفتار (Behavior) توصیف شوند.
⚡️ ابزار Harness Handbook با ترکیب تحلیل ایستا (Static Analysis) و LLM، نقشهای از رفتار سیستم میسازد. این نقشه با سه سطح جزئیات، به ایجنت کمک میکند تا ابتدا رفتار هدف را شناسایی کرده و سپس با دقت بالا به سراغ کد اصلی برود.
📊 نتایج ارزیابیها بسیار درخشان است؛ کیفیت برنامهریزی در تسکهای Codex از ۲۸.۳٪ به ۳۸.۳٪ افزایش یافت. همچنین در مدل Terminus-2، این شاخص از ۲۶.۷٪ به ۴۵.۶٪ رسید که نشاندهنده اثربخشی بالای این رویکرد است.
🧠 علاوه بر دقت، مصرف توکنهای بخش برنامهریز (Planner) نیز بین ۸.۶٪ تا ۱۲.۷٪ کاهش یافت.
Paper: https://arxiv.org/abs/2607.13285
#Harness_Handbook #Terminus_2
🔬 محققان در مقاله جدیدی به بررسی چالش ویرایش کد توسط ایجنتهای هوشمند پرداختهاند. در مدلهای فعلی، ساختار پراکنده فایلها باعث میشود ایجنتها بخشهایی از پیادهسازی را نادیده بگیرند، لذا پیشنهاد شده است که مخازن کد بهجای فایل، بر اساس رفتار (Behavior) توصیف شوند.
⚡️ ابزار Harness Handbook با ترکیب تحلیل ایستا (Static Analysis) و LLM، نقشهای از رفتار سیستم میسازد. این نقشه با سه سطح جزئیات، به ایجنت کمک میکند تا ابتدا رفتار هدف را شناسایی کرده و سپس با دقت بالا به سراغ کد اصلی برود.
📊 نتایج ارزیابیها بسیار درخشان است؛ کیفیت برنامهریزی در تسکهای Codex از ۲۸.۳٪ به ۳۸.۳٪ افزایش یافت. همچنین در مدل Terminus-2، این شاخص از ۲۶.۷٪ به ۴۵.۶٪ رسید که نشاندهنده اثربخشی بالای این رویکرد است.
🧠 علاوه بر دقت، مصرف توکنهای بخش برنامهریز (Planner) نیز بین ۸.۶٪ تا ۱۲.۷٪ کاهش یافت.
Paper: https://arxiv.org/abs/2607.13285
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Harness_Handbook #Terminus_2
❤1
🐡 معرفی مدل جدید Fugu-Ultra v1.1
🚀 شرکت Sakana AI بهتازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهرهگیری از جدیدترین مدلهای پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.
📊 میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد میرسد. بیشترین پیشرفت در شاخصهای ProgramBench و Terminal Bench 2.1 مشاهده میشود که نشاندهنده توانمندی بالای مدل در محیطهای تخصصی برنامهنویسی است.
🧠 این مدل در حوزههای coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلالهای منطقی پیچیده، بسیار بهینهتر عمل میکند. نکته حائز اهمیت این است که تمامی این قابلیتهای فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شدهاند.
⚡ توسعهدهندگان اکنون میتوانند پروژههای عملیاتی سنگینتری را با همان هزینه قبلی پیش ببرند.
#Fugu_Ultra #ProgramBench
🚀 شرکت Sakana AI بهتازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهرهگیری از جدیدترین مدلهای پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.
📊 میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد میرسد. بیشترین پیشرفت در شاخصهای ProgramBench و Terminal Bench 2.1 مشاهده میشود که نشاندهنده توانمندی بالای مدل در محیطهای تخصصی برنامهنویسی است.
🧠 این مدل در حوزههای coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلالهای منطقی پیچیده، بسیار بهینهتر عمل میکند. نکته حائز اهمیت این است که تمامی این قابلیتهای فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شدهاند.
⚡ توسعهدهندگان اکنون میتوانند پروژههای عملیاتی سنگینتری را با همان هزینه قبلی پیش ببرند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Fugu_Ultra #ProgramBench
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 تحلیل تخصصی معماری سختافزار برای هوش مصنوعی
⚡ دنیای سختافزارهای AI حول ۵ معماری اصلی میچرخد که هرکدام توازن متفاوتی میان انعطافپذیری، موازیسازی و دسترسی به حافظه برقرار میکنند. پردازندههای مرکزی یا CPU با هستههای قدرتمند برای وظایف منطقی و سیستمعامل بهینه شدهاند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکههای عصبی و محاسبات ماتریسی موازی است.
🧠 واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی دادهها استفاده میکنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخههای بهینهشده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاههایی مثل گوشیهای هوشمند انجام میدهند.
🚀 نسل جدید سختافزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.
#LMCache #Groq
⚡ دنیای سختافزارهای AI حول ۵ معماری اصلی میچرخد که هرکدام توازن متفاوتی میان انعطافپذیری، موازیسازی و دسترسی به حافظه برقرار میکنند. پردازندههای مرکزی یا CPU با هستههای قدرتمند برای وظایف منطقی و سیستمعامل بهینه شدهاند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکههای عصبی و محاسبات ماتریسی موازی است.
🧠 واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی دادهها استفاده میکنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخههای بهینهشده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاههایی مثل گوشیهای هوشمند انجام میدهند.
🚀 نسل جدید سختافزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#LMCache #Groq
🐝 پلتفرم Buzz: تحولی در تعامل انسان و ایجنتهای هوش مصنوعی
پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، بهعنوان یک فضای کار متنباز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیمهای ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شدهاند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم میکند.
🧠 این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نهتنها امنیت را ارتقا میدهد، بلکه اجازه میدهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، بهراحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل میشود که تاریخچه کامل گفتگوها، کامیتها و ریوها را در خود نگه میدارد.
⚡ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنتها (گروهی از ایجنتهای همکار) بهینه شده است.
#Buzz_Platform #Nostr_Protocol
پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، بهعنوان یک فضای کار متنباز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیمهای ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شدهاند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم میکند.
🧠 این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نهتنها امنیت را ارتقا میدهد، بلکه اجازه میدهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، بهراحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل میشود که تاریخچه کامل گفتگوها، کامیتها و ریوها را در خود نگه میدارد.
⚡ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنتها (گروهی از ایجنتهای همکار) بهینه شده است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Buzz_Platform #Nostr_Protocol
🚀 معرفی مدل هوشمند Ling-3.0-flash
شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهرهوری بینظیری را برای ایجنتهای هوش مصنوعی فراهم میکند و عملکردی همتراز با مدلهای 1 تریلیون پارامتری ارائه میدهد.
🧠 معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینههای پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.
⚡ از قابلیتهای کلیدی آن میتوان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاسپذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستمهای گرافیکی، مدیریت فایلهای مالی اکسل و هماهنگی ایجنتهای علمی عملکردی خیرهکننده دارد.
🔭 در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.
#Ling_3 #Hybrid_linear_attention
شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهرهوری بینظیری را برای ایجنتهای هوش مصنوعی فراهم میکند و عملکردی همتراز با مدلهای 1 تریلیون پارامتری ارائه میدهد.
🧠 معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینههای پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.
⚡ از قابلیتهای کلیدی آن میتوان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاسپذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستمهای گرافیکی، مدیریت فایلهای مالی اکسل و هماهنگی ایجنتهای علمی عملکردی خیرهکننده دارد.
🔭 در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Ling_3 #Hybrid_linear_attention
🤖 معرفی مدل هوشمند Claude Opus 5
شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که بهطور ویژه برای کارهای پیچیده برنامهنویسی، وظایف عاملی (Agentic tasks) و تحلیلهای سنگین بهینهسازی شده است، در بنچمارکهای متعددی پیشتاز میدان است.
🚀 این مدل در Frontier-Bench v0.1 ویژه مهندسی نرمافزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیکترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه میدهد مدل پیش از ارائه پاسخ نهایی، خروجیهای خود را بازبینی و اشتباهات احتمالی را برطرف کند.
📊 تحلیل دقیق عملکرد نشان میدهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستمعامل است، نتایج درخشانی از خود بر جای گذاشته است.
#Claude_Opus_5 #ARC_AGI_3
شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که بهطور ویژه برای کارهای پیچیده برنامهنویسی، وظایف عاملی (Agentic tasks) و تحلیلهای سنگین بهینهسازی شده است، در بنچمارکهای متعددی پیشتاز میدان است.
🚀 این مدل در Frontier-Bench v0.1 ویژه مهندسی نرمافزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیکترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه میدهد مدل پیش از ارائه پاسخ نهایی، خروجیهای خود را بازبینی و اشتباهات احتمالی را برطرف کند.
📊 تحلیل دقیق عملکرد نشان میدهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستمعامل است، نتایج درخشانی از خود بر جای گذاشته است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Claude_Opus_5 #ARC_AGI_3
❤1
🤖 مدل Claude Opus 5 پیشتاز جدید هوش مصنوعی
🔬 مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.
⚡ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیرهکننده در بنچمارکهای GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجیهای دقیق حرفهای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.
📊 اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقبتر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی میکند.
💰 قیمتگذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.
#Claude_Opus_5 #GDPval_AA
🔬 مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.
⚡ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیرهکننده در بنچمارکهای GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجیهای دقیق حرفهای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.
📊 اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقبتر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی میکند.
💰 قیمتگذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Claude_Opus_5 #GDPval_AA
🚀 فراتر از مهندسی پرامپت: ۵ لایه کلیدی در توسعه ایجنتها
🧠 برای تبدیل ایجنتهای هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیینکننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیعتری نسبت به لایه قبل ارائه میدهد.
⚡ لایه اول یعنی پرامپت، کنترلکننده تعاملات ساده مانند تعیین نقش، نمونهها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی میپردازد تا مدل دقیقترین دادهها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.
⚙ ️ لایه سوم، Harness Engineering نام دارد که شامل زیرساختهای کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزمهای Retry، اعتبارسنجی خروجیها و مسیریابی به سابایجنتها در این بخش قرار میگیرند.
#Context_Engineering #Harness_Engineering
🧠 برای تبدیل ایجنتهای هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیینکننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیعتری نسبت به لایه قبل ارائه میدهد.
⚡ لایه اول یعنی پرامپت، کنترلکننده تعاملات ساده مانند تعیین نقش، نمونهها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی میپردازد تا مدل دقیقترین دادهها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.
⚙ ️ لایه سوم، Harness Engineering نام دارد که شامل زیرساختهای کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزمهای Retry، اعتبارسنجی خروجیها و مسیریابی به سابایجنتها در این بخش قرار میگیرند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Context_Engineering #Harness_Engineering
🌐 بیانیه شرکتهای بزرگ فناوری برای حمایت از مدلهای متنباز
شرکتهای بزرگ فناوری در نامهای رسمی با عنوان «وزنهای باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدلهایی که پارامترهای آنها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمیشود.
🚀 این نامه استدلال میکند که مدلهای متنباز با تسهیل دسترسی استارتاپها و دانشگاهها به تکنولوژیهای پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی میشوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینههای سنگینِ مدلهای تجاری کاهش مییابد.
🛡 متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدلهای قدرتمند برای شناسایی آسیبپذیریها ضروری است. شفافیت ناشی از این مدلها به جامعه محققان کمک میکند تا رفتار سیستمها را مطالعه کرده و مکانیزمهای دفاعی قویتری توسعه دهند.
#Open_Weights #AI_Leadership
شرکتهای بزرگ فناوری در نامهای رسمی با عنوان «وزنهای باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدلهایی که پارامترهای آنها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمیشود.
🚀 این نامه استدلال میکند که مدلهای متنباز با تسهیل دسترسی استارتاپها و دانشگاهها به تکنولوژیهای پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی میشوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینههای سنگینِ مدلهای تجاری کاهش مییابد.
🛡 متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدلهای قدرتمند برای شناسایی آسیبپذیریها ضروری است. شفافیت ناشی از این مدلها به جامعه محققان کمک میکند تا رفتار سیستمها را مطالعه کرده و مکانیزمهای دفاعی قویتری توسعه دهند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Open_Weights #AI_Leadership
📊 راهنمای جامع بنچمارکهای ارزیابی هوش مصنوعی
🔬 با رشد سریع مدلهای زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدلها فراتر از شمارش پارامترها یا تستهای ساده است. بنچمارکها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدلها در محیطهای واقعی هستند.
💻 در حوزه کدنویسی و مهندسی نرمافزار، مجموعههای SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامهنویسی محسوب میشوند.
🤖 برای ارزیابی عملکرد ایجنتها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارکهای WideSearch و BrowseComp برای سنجش مهارتهای جستوجو و ناوبری ارائه شدهاند.
🎯 جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمونهای IFBench، SysBench و Multi-IF دقیقترین ارزیابیها را ارائه میدهند. همچنین برای سنجش حافظه و متنهای طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.
#SWE_Bench_Pro #Multi_IF
🔬 با رشد سریع مدلهای زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدلها فراتر از شمارش پارامترها یا تستهای ساده است. بنچمارکها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدلها در محیطهای واقعی هستند.
💻 در حوزه کدنویسی و مهندسی نرمافزار، مجموعههای SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامهنویسی محسوب میشوند.
🤖 برای ارزیابی عملکرد ایجنتها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارکهای WideSearch و BrowseComp برای سنجش مهارتهای جستوجو و ناوبری ارائه شدهاند.
🎯 جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمونهای IFBench، SysBench و Multi-IF دقیقترین ارزیابیها را ارائه میدهند. همچنین برای سنجش حافظه و متنهای طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#SWE_Bench_Pro #Multi_IF
❤1