🚀 بررسی بنچمارکهای جدید هوش مصنوعی
نتایج بنچمارکهای تازه منتشر شده نشان میدهد که مدلهای هوش مصنوعی با سرعت خیرهکنندهای در حال پیشرفت هستند و استانداردهای جدیدی را در عملکرد فنی تعریف میکنند.
در حوزه وظایف تخصصی تحلیلگر مالی، مدلهای زیر عملکرد برجستهای داشتهاند:
* Gemini 3.8 Flash با کسب نرخ موفقیت ۶۱.۴٪ در صدر لیست قرار گرفته است.
* Gemini 3.7 Flash با ۵۹.۰٪ عملکرد، در رده بعدی جای دارد.
* Claude Opus 5 با ثبت ۵۸.۶٪ موفقیت، همچنان یکی از گزینههای قدرتمند در تحلیلهای مالی است.
این دادهها نشان میدهد که برای کارهای تخصصی و تحلیلهای پیچیده مالی، ابزارهای سری Gemini در حال حاضر به عنوان یک مرجع کلیدی شناخته میشوند. با توجه به قیمت و کارایی، این مدلها مرزهای جدیدی را در دنیای پردازش دادههای مالی ترسیم کردهاند.
#Gemini_3 #Financial_Analyst
نتایج بنچمارکهای تازه منتشر شده نشان میدهد که مدلهای هوش مصنوعی با سرعت خیرهکنندهای در حال پیشرفت هستند و استانداردهای جدیدی را در عملکرد فنی تعریف میکنند.
در حوزه وظایف تخصصی تحلیلگر مالی، مدلهای زیر عملکرد برجستهای داشتهاند:
* Gemini 3.8 Flash با کسب نرخ موفقیت ۶۱.۴٪ در صدر لیست قرار گرفته است.
* Gemini 3.7 Flash با ۵۹.۰٪ عملکرد، در رده بعدی جای دارد.
* Claude Opus 5 با ثبت ۵۸.۶٪ موفقیت، همچنان یکی از گزینههای قدرتمند در تحلیلهای مالی است.
این دادهها نشان میدهد که برای کارهای تخصصی و تحلیلهای پیچیده مالی، ابزارهای سری Gemini در حال حاضر به عنوان یک مرجع کلیدی شناخته میشوند. با توجه به قیمت و کارایی، این مدلها مرزهای جدیدی را در دنیای پردازش دادههای مالی ترسیم کردهاند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Gemini_3 #Financial_Analyst
🚀 معرفی مدل هوش مصنوعی Muse Spark 1.3 متا
متا از مدل جدید خود به نام Muse Spark 1.3 رونمایی کرد که در بنچمارکهای کلیدی، رقبای قدرتمندی چون GPT 5.6 Sol و Claude Opus 5 را به چالش کشیده است. برای ارزیابی دقیقتر مشخصات، تحلیل معماری و قابلیتها جزئیات فنی بیشتری ارائه میکند.
این مدل جدید در دستهبندیهای زیر عملکرد درخشانی نشان داده است:
• برنامهنویسی: کسب بالاترین امتیاز در بنچمارکهای DeepSWE v1.1 (با نمره ۷۵.۴) و SWEAtlas (با نمره ۵۹.۴).
• متنهای طولانی: برتری قاطع در بنچمارکهای MRCR با دقت بالای ۹۸ درصد در پردازش متنهای طولانی تا سقف ۱ مگاتوکن.
اگرچه در برخی وظایف عاملی (Agentic) مدل Opus 5 همچنان پیشتاز است، اما Muse Spark 1.3 جهش بزرگی در توسعه مدلهای چندمنظوره به شمار میرود.
متا از مدل جدید خود به نام Muse Spark 1.3 رونمایی کرد که در بنچمارکهای کلیدی، رقبای قدرتمندی چون GPT 5.6 Sol و Claude Opus 5 را به چالش کشیده است. برای ارزیابی دقیقتر مشخصات، تحلیل معماری و قابلیتها جزئیات فنی بیشتری ارائه میکند.
این مدل جدید در دستهبندیهای زیر عملکرد درخشانی نشان داده است:
• برنامهنویسی: کسب بالاترین امتیاز در بنچمارکهای DeepSWE v1.1 (با نمره ۷۵.۴) و SWEAtlas (با نمره ۵۹.۴).
• متنهای طولانی: برتری قاطع در بنچمارکهای MRCR با دقت بالای ۹۸ درصد در پردازش متنهای طولانی تا سقف ۱ مگاتوکن.
اگرچه در برخی وظایف عاملی (Agentic) مدل Opus 5 همچنان پیشتاز است، اما Muse Spark 1.3 جهش بزرگی در توسعه مدلهای چندمنظوره به شمار میرود.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
⚠️ هشدار ایلیـا ساتسکور درباره امنیت هوش مصنوعی
ایلیا ساتسکور، چهره کلیدی سابق OpenAI، در توییتی تازه نسبت به ضعفهای امنیتی زیرساختهای ابری هشدار داد. او معتقد است که در آینده با هوشمندتر شدن ایجنتهای خودمختار، خطر نفوذ آنها به محیطهای ابری به یک تهدید جدی تبدیل خواهد شد. جزئیات، زمینه و نکات تکمیلی این مطلب در نسخه کامل مطلب با عمق بیشتری آمده است.
او معتقد است اگر یک مدل یا ایجنت از کنترل خارج شود، اولین هدفش تسخیر منابع محاسباتی در «نئوکلاودها» برای تکثیر نسخههای خود خواهد بود.
نکات کلیدی این هشدار:
- نئوکلاودها در حال حاضر فاقد تدابیر امنیتی لازم برای مقابله با هوش مصنوعیهای مهاجم هستند.
- تسلط ایجنتها بر این زیرساختها باعث میشود آنها بتوانند مقیاس قدرت خود را به صورت کنترلنشده افزایش دهند.
- تمامی شرکتهای پیشرو در حوزه مدلهای سایبری باید برای تقویت امنیت این زیرساختها با یکدیگر همکاری کنند.
این اظهارات در حالی مطرح میشود که دنیای تکنولوژی به سرعت به سمت استفاده از ایجنتهای خودمختار حرکت میکند. آیا زیرساختهای فعلی برای این سطح از خودمختاری آماده هستند؟
📊 Data➕Science
ایلیا ساتسکور، چهره کلیدی سابق OpenAI، در توییتی تازه نسبت به ضعفهای امنیتی زیرساختهای ابری هشدار داد. او معتقد است که در آینده با هوشمندتر شدن ایجنتهای خودمختار، خطر نفوذ آنها به محیطهای ابری به یک تهدید جدی تبدیل خواهد شد. جزئیات، زمینه و نکات تکمیلی این مطلب در نسخه کامل مطلب با عمق بیشتری آمده است.
او معتقد است اگر یک مدل یا ایجنت از کنترل خارج شود، اولین هدفش تسخیر منابع محاسباتی در «نئوکلاودها» برای تکثیر نسخههای خود خواهد بود.
نکات کلیدی این هشدار:
- نئوکلاودها در حال حاضر فاقد تدابیر امنیتی لازم برای مقابله با هوش مصنوعیهای مهاجم هستند.
- تسلط ایجنتها بر این زیرساختها باعث میشود آنها بتوانند مقیاس قدرت خود را به صورت کنترلنشده افزایش دهند.
- تمامی شرکتهای پیشرو در حوزه مدلهای سایبری باید برای تقویت امنیت این زیرساختها با یکدیگر همکاری کنند.
این اظهارات در حالی مطرح میشود که دنیای تکنولوژی به سرعت به سمت استفاده از ایجنتهای خودمختار حرکت میکند. آیا زیرساختهای فعلی برای این سطح از خودمختاری آماده هستند؟
📊 Data➕Science
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #104 | 📌 8 آیتم گزارش | 🧾 از 20 پست بررسیشده
🕐 چهارشنبه 1405/06/11 ساعت 14:00 تا پنجشنبه 1405/06/12 ساعت 14:00
🔎 تحلیل کوتاه
🧠 توسعه و معماری مدلهای پیشرو
🛡️ امنیت و زیرساخت در هوش مصنوعی
💼 ابزارها و نقشهای تخصصی
🗂 گزارش #104 | 📌 8 آیتم گزارش | 🧾 از 20 پست بررسیشده
🕐 چهارشنبه 1405/06/11 ساعت 14:00 تا پنجشنبه 1405/06/12 ساعت 14:00
🔎 تحلیل کوتاه
توسعه مدلهای هوش مصنوعی با تمرکز دوجانبه بر بهینهسازی فنی و ارزیابیهای امنیتی پیش میرود. در حالی که مدلهایی مانند Gemini 3.8 Flash و پروژه Astra جهشهای فنی قابلتوجهی نشان میدهند، تاخیر در عرضه عمومی و هشدارهای امنیتی نشاندهنده اولویتیافتن ارزیابی امنیت سایبری در زیرساختها و مدلهای عاملیتمحور جدید است. همچنین، تلاش برای کاهش محدودیتهای سختافزاری با ابزارهای نوین کماکان ادامه دارد.
🧠 توسعه و معماری مدلهای پیشرو
معماری بازگشتی پروژه Astra؛ گامی نو در بهبود کارایی مدلها
بررسی لایههای بازگشتی و تکرار محاسبات میانی برای افزایش سرعت مدلهای زبانی بزرگ.
🔗 ادامه مطلب در سایت
بررسی فنی مدل جدید Gemini 3.8 Flash در API گوگل
تحلیل مشخصات فنی، محدودیتهای کانتکست و پتانسیل عملکردی نسخه جدید فلاش در گوگل.
🔗 جزئیات کامل در سایت
عملکرد درخشان مدلهای Gemini در بنچمارکهای تحلیل مالی
صدرنشینی Gemini 3.8 Flash با موفقیت ۶۱.۴ درصدی در انجام وظایف تخصصی تحلیلگری مالی.
🔗 مشاهده پست
🛡️ امنیت و زیرساخت در هوش مصنوعی
ارزیابی امنیت سایبری؛ علت تاخیر عرضه مدل Astra توسط OpenAI
بررسی توانایی کشف آسیبپذیریها در مدل Astra و کسب نرخ موفقیت ۳۹ درصد در ExploitBench. زمینه خبر، جزئیات اعلام رسمی و نکات مرتبط در گزارش کامل خبر با جزئیات بیشتری آمده است.
🔗 مشاهده پست
هشدار ایلیا ساتسکور نسبت به خطر ایجنتها برای امنیت ابری
ابراز نگرانی درباره احتمال نفوذ ایجنتهای خودمختار مهاجم به منابع محاسباتی نئوکلاودها. زمینه و جزئیات تکمیلی را در مطالعه کامل با شرح بیشتری آوردهایم.
🔗 مشاهده پست
فاینتیون مدلهای 8B روی سختافزار محدود با ابزار Soup
امکانآموزش مدلهای زبانی ۸ میلیاردی روی کارتهای گرافیک لپتاپ با حافظه محدود ۴ گیگابایت.
🔗 ادامه مطلب در سایت
💼 ابزارها و نقشهای تخصصی
تمایز میان مهندس هوش مصنوعی و مهندس استقراریافته (AI FDE)
تبیین تفاوتهای اساسی، نقشهای مکمل و مسئولیتهای این دو تخصص در توسعه ابزارهای هوشمند.
🔗 جزئیات کامل در سایت
پایان دوره آزمایشی و عرضه رسمی افزونه Claude در کروم
انتشار ابزار تعامل مستقیم با صفحات وب و انجام خودکار وظایف چندمرحلهای برای کاربران اشتراکی.
🔗 ادامه مطلب در سایت
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
@DataPlusScience_linkedin_7501157818226409473_01.pdf
153.4 KB
مهندسی گراف برای سیستمهای هوش مصنوعی چندعامله
سیستمهای هوش مصنوعی چندعامله (Multi-agent Systems) دیگر نیازی به پرامپتهای پیچیدهتر یا حلقههای تکرار (Loop) بیانتها ندارند. آنچه این سیستمها برای رسیدن به مقیاسپذیری و قابلیت اطمینان در محیطهای عملیاتی نیاز دارند، مهندسی گراف (Graph Engineering) است. برای اجرای دقیقتر، راهنمای گامبهگام مراحل و نکات کاربردی را یکجا ارائه میکند.
در حالی که در «Agent Loop» تمرکز بر حلقههای فکری مدل است، «Agent Graph» با ساختارمند کردن مسیرهای اجرا، انتقال وظایف (Handoffs) و مدیریت وضعیت (State)، امکان طراحی سیستمهای مهندسیشده را فراهم میکند.
مهمترین اصول در طراحی گرافهای عاملی:
• تعریف صریح گرهها و لبهها: هر گره باید وظیفهای مشخص (مانند برنامهریز، منتقد یا مجری ابزار) داشته باشد و لبهها باید شروط دقیق انتقال را تعیین کنند.
• مدیریت وضعیت و تاریخچه: استفاده از دادههای بادوام (Durable State) برای بازیابی دقیق پس از خطا و بازرسی عملیات.
سیستمهای هوش مصنوعی چندعامله (Multi-agent Systems) دیگر نیازی به پرامپتهای پیچیدهتر یا حلقههای تکرار (Loop) بیانتها ندارند. آنچه این سیستمها برای رسیدن به مقیاسپذیری و قابلیت اطمینان در محیطهای عملیاتی نیاز دارند، مهندسی گراف (Graph Engineering) است. برای اجرای دقیقتر، راهنمای گامبهگام مراحل و نکات کاربردی را یکجا ارائه میکند.
در حالی که در «Agent Loop» تمرکز بر حلقههای فکری مدل است، «Agent Graph» با ساختارمند کردن مسیرهای اجرا، انتقال وظایف (Handoffs) و مدیریت وضعیت (State)، امکان طراحی سیستمهای مهندسیشده را فراهم میکند.
مهمترین اصول در طراحی گرافهای عاملی:
• تعریف صریح گرهها و لبهها: هر گره باید وظیفهای مشخص (مانند برنامهریز، منتقد یا مجری ابزار) داشته باشد و لبهها باید شروط دقیق انتقال را تعیین کنند.
• مدیریت وضعیت و تاریخچه: استفاده از دادههای بادوام (Durable State) برای بازیابی دقیق پس از خطا و بازرسی عملیات.
هوش مصنوعی و علم داده به فارسی
🚀 تحول در تولید ویدیو با Wan 3.0 تیم علیبابا از مدل جدید ویدیویی خود به نام Wan 3.0 رونمایی کرد که امکان ساخت ویدیوهای ۳۰ ثانیهای را در یک مرحله فراهم میکند. این مدل با حذف نیاز به چسباندن کلیپهای کوتاه، جهشی بزرگ در کیفیت خروجیها ایجاد کرده است. …
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 ظهور مدل قدرتمند Wan 3.0 در دنیای تولید ویدیو
شرکت علیبابا با معرفی مدل Wan 3.0، استانداردهای جدیدی را در تولید و ویرایش هوشمند ویدیو تعریف کرده است. این مدل چندوجهی میتواند با دریافت متن، تصویر، صدا و حتی صفحات وب، ویدیوهایی با کیفیت 1080p و مدت زمان ۳۰ ثانیه همراه با صدای اختصاصی تولید کند. جزئیات معماری، قابلیتها و محدودیتهای فنی در بررسی فنی مدل با دقت بیشتری مرور شده است.
بر اساس تحلیلهای Artificial Analysis، این مدل جهشی بزرگ نسبت به نسخه قبلی خود داشته و در میان رقبا جایگاههای برتر را به دست آورده است:
* رتبه اول در ویرایش ویدیویی همراه با صدا
* رتبه دوم در تبدیل متن به ویدیو همراه با صدا
* رتبه پنجم در تبدیل تصویر به ویدیو همراه با صدا
قابلیتهای ویرایشی این سیستم شامل تغییرات مستقیم در جلوههای بصری، پیرنگ داستان، دیالوگ و صدا است که آن را به ابزاری همهکاره برای تولید محتوا تبدیل میکند. این مدل هماکنون در پلتفرم Alibaba Cloud Model Studio در دسترس عموم قرار گرفته است.
#Wan_3_0 #Alibaba_Cloud
شرکت علیبابا با معرفی مدل Wan 3.0، استانداردهای جدیدی را در تولید و ویرایش هوشمند ویدیو تعریف کرده است. این مدل چندوجهی میتواند با دریافت متن، تصویر، صدا و حتی صفحات وب، ویدیوهایی با کیفیت 1080p و مدت زمان ۳۰ ثانیه همراه با صدای اختصاصی تولید کند. جزئیات معماری، قابلیتها و محدودیتهای فنی در بررسی فنی مدل با دقت بیشتری مرور شده است.
بر اساس تحلیلهای Artificial Analysis، این مدل جهشی بزرگ نسبت به نسخه قبلی خود داشته و در میان رقبا جایگاههای برتر را به دست آورده است:
* رتبه اول در ویرایش ویدیویی همراه با صدا
* رتبه دوم در تبدیل متن به ویدیو همراه با صدا
* رتبه پنجم در تبدیل تصویر به ویدیو همراه با صدا
قابلیتهای ویرایشی این سیستم شامل تغییرات مستقیم در جلوههای بصری، پیرنگ داستان، دیالوگ و صدا است که آن را به ابزاری همهکاره برای تولید محتوا تبدیل میکند. این مدل هماکنون در پلتفرم Alibaba Cloud Model Studio در دسترس عموم قرار گرفته است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Wan_3_0 #Alibaba_Cloud
🚀 معرفی مدلهای جدید Gemini 3.8 Flash
گوگل از نسل جدید مدلهای خود با نام Gemini 3.8 Flash رونمایی کرد. این مدل برای تحلیل همزمان متن و تصویر با کارایی بالا بهینهسازی شده و تمرکز اصلی آن بر توسعه نرمافزار، کدنویسی و تستهای پیچیده برنامههاست. جزئیات معماری، قابلیتها و محدودیتهای فنی در بررسی فنی مدل با دقت بیشتری مرور شده است.
در بنچمارک DeepSWE 1.1، این مدل به امتیاز خیرهکننده ۷۳.۷٪ دست یافته که بسیار به مدل قدرتمند Claude Opus 5 نزدیک است، با این تفاوت که از نظر اقتصادی بسیار مقرونبهصرفهتر عمل میکند.
مهمترین ویژگیهای این بهروزرسانی:
* پشتیبانی عالی از تحلیل دادههای حجیم و ترکیب اطلاعات متنی و تصویری.
* عملکرد بسیار نزدیک به بهترین مدلهای حال حاضر بازار در تستهای کدنویسی.
* ارائه مدل تخصصی Gemini 3.8 Flash Cyber جهت شناسایی خودکار حفرههای امنیتی که در تستهای کروم، ۲.۶ برابر پچهای دقیقتری نسبت به رقبا تولید کرده است.
* قیمتگذاری رقابتی در API که تا پایان سال ۲۰۲۶ با نرخ ۰.۷۵ دلار برای ورودی و ۳.۷۵ دلار برای خروجی ارائه میشود.
📊 Data➕Science
گوگل از نسل جدید مدلهای خود با نام Gemini 3.8 Flash رونمایی کرد. این مدل برای تحلیل همزمان متن و تصویر با کارایی بالا بهینهسازی شده و تمرکز اصلی آن بر توسعه نرمافزار، کدنویسی و تستهای پیچیده برنامههاست. جزئیات معماری، قابلیتها و محدودیتهای فنی در بررسی فنی مدل با دقت بیشتری مرور شده است.
در بنچمارک DeepSWE 1.1، این مدل به امتیاز خیرهکننده ۷۳.۷٪ دست یافته که بسیار به مدل قدرتمند Claude Opus 5 نزدیک است، با این تفاوت که از نظر اقتصادی بسیار مقرونبهصرفهتر عمل میکند.
مهمترین ویژگیهای این بهروزرسانی:
* پشتیبانی عالی از تحلیل دادههای حجیم و ترکیب اطلاعات متنی و تصویری.
* عملکرد بسیار نزدیک به بهترین مدلهای حال حاضر بازار در تستهای کدنویسی.
* ارائه مدل تخصصی Gemini 3.8 Flash Cyber جهت شناسایی خودکار حفرههای امنیتی که در تستهای کروم، ۲.۶ برابر پچهای دقیقتری نسبت به رقبا تولید کرده است.
* قیمتگذاری رقابتی در API که تا پایان سال ۲۰۲۶ با نرخ ۰.۷۵ دلار برای ورودی و ۳.۷۵ دلار برای خروجی ارائه میشود.
📊 Data➕Science
🚀 معرفی مدل GLM-5.3 با قابلیتهای ویژه برای ردتیمینگ
تیم AbliterationAI نسخه جدیدی از مدل GLM-5.3 را با نام
این مدل در بنچمارکهای امنیتی عملکرد قابل توجهی داشته است:
• در CyberGym برای کشف آسیبپذیریهای OSS-Fuzz موفقیت ۸۴.۵ درصدی ثبت کرده که با مدلهای پیشرویی مانند GPT-5.5 و DeepSeek V4 رقابت میکند.
• در بنچمارک Terminal-Bench 4.0 نیز امتیاز ۴۱.۸ درصد را کسب کرده است.
از ویژگیهای کلیدی این سرویس میتوان به موارد زیر اشاره کرد:
• حذف محدودیتهای محتوایی (به جز موارد غیراخلاقی خاص)
• ارائه API سازگار با استانداردهای OpenAI و Anthropic
• تضمین عدم ذخیرهسازی پرامپتها و دادههای کاربر
• دسترسی از طریق وبسایت رسمی (Playground) برای تست اولیه
📊 Data➕Science
تیم AbliterationAI نسخه جدیدی از مدل GLM-5.3 را با نام
abliterated-model-large-v2 عرضه کرده است. در این مدل، وزنهای شبکه به گونهای اصلاح شدهاند که مکانیسمهای سختگیرانه رد درخواستها در آن کاهش یابد تا برای تحلیلهای امنیتی، تست نفوذ و استفاده توسط ایجنتها بهینهتر شود. بررسی فنی کامل معماری، عملکرد و نکات مهم این مدل را در کنار هم قرار میدهد.این مدل در بنچمارکهای امنیتی عملکرد قابل توجهی داشته است:
• در CyberGym برای کشف آسیبپذیریهای OSS-Fuzz موفقیت ۸۴.۵ درصدی ثبت کرده که با مدلهای پیشرویی مانند GPT-5.5 و DeepSeek V4 رقابت میکند.
• در بنچمارک Terminal-Bench 4.0 نیز امتیاز ۴۱.۸ درصد را کسب کرده است.
از ویژگیهای کلیدی این سرویس میتوان به موارد زیر اشاره کرد:
• حذف محدودیتهای محتوایی (به جز موارد غیراخلاقی خاص)
• ارائه API سازگار با استانداردهای OpenAI و Anthropic
• تضمین عدم ذخیرهسازی پرامپتها و دادههای کاربر
• دسترسی از طریق وبسایت رسمی (Playground) برای تست اولیه
📊 Data➕Science
❤1
هوش مصنوعی و علم داده به فارسی
🚀 رونمایی از مدل هوشمند Fable 5.1 نسخه جدید Fable 5.1 با پیشرفتهای چشمگیر در بنچمارکهای هوش مصنوعی منتشر شد. این مدل در مقایسه با نسخه قبلی، در تمامی سطوح عملکردی، امتیازات بالاتری کسب کرده و بهینهسازیهای قابلتوجهی در هزینههای پردازشی ارائه میدهد.…
🤖 تست رایگان Claude Fable 5.1 در Arena
فرصت محدودی برای تست مستقیم یکی از مدلهای جدید هوش مصنوعی فراهم شده است. شما میتوانید مدل Claude Fable 5.1 را به طور مستقیم در پلتفرم Arena ارزیابی کنید.
برای استفاده از این امکان، کافی است در بخش Direct Mode این پلتفرم، مدل مذکور را از منوی کشویی انتخاب کنید. این دسترسی مستقیم تا ۵ سپتامبر (ساعت ۱۸:۳۰ به وقت تهران) برقرار است. پس از این تاریخ، مدل Fable 5.1 همچنان در بخشهای رقابتی Battle Mode و Agent Mode در دسترس کاربران خواهد بود.
#Claude_Fable_5_1 #Direct_Mode
فرصت محدودی برای تست مستقیم یکی از مدلهای جدید هوش مصنوعی فراهم شده است. شما میتوانید مدل Claude Fable 5.1 را به طور مستقیم در پلتفرم Arena ارزیابی کنید.
برای استفاده از این امکان، کافی است در بخش Direct Mode این پلتفرم، مدل مذکور را از منوی کشویی انتخاب کنید. این دسترسی مستقیم تا ۵ سپتامبر (ساعت ۱۸:۳۰ به وقت تهران) برقرار است. پس از این تاریخ، مدل Fable 5.1 همچنان در بخشهای رقابتی Battle Mode و Agent Mode در دسترس کاربران خواهد بود.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Claude_Fable_5_1 #Direct_Mode
هوش مصنوعی و علم داده به فارسی
🤖 معماری جدید Astra و چالشهای استدلال پنهان اخبار منتشر شده از معماری مدل جدید OpenAI موسوم به Astra نشان میدهد این مدل از تکنیکی به نام «عمق بازگشتی» یا «ترانسفورمر حلقوی» استفاده میکند. در این روش، مدل بهجای عبور متوالی از لایهها، متن را چندین بار…
ورود به عصر AGI با معرفی GPT-6 Astra
شرکت OpenAI بهتازگی از مدل قدرتمند GPT-6 Astra رونمایی کرد. این مدل که اولین خروجی آموزشی مبتنی بر بیش از ۱۰۰ هزار GPU است، در بنچمارکهای متعددی نظیر TBv4، SRE-Bench و FrontierMath عملکرد خیرهکنندهای را ثبت کرده و فاصله قابلتوجهی با رقبا ایجاد کرده است. برای ارزیابی دقیقتر مشخصات، تحلیل معماری و قابلیتها جزئیات فنی بیشتری ارائه میکند.
گریگ براکمن، رئیس OpenAI، این نقطه عطف را سرآغاز عصر هوش مصنوعی عمومی (AGI) دانسته است. در ادامه به برخی از مهمترین نتایج عملکرد این مدل اشاره میکنیم:
* قابلیتهای کدنویسی: کسب امتیاز ۵۷.۷٪ در Terminal-Bench 4.0 که فراتر از رقباست.
* امنیت سایبری: ثبت دقت ۱۰۰٪ در ExploitBench و پیشتازی در SRE-Bench.
* عملکرد آکادمیک: دستیابی به نرخ خیرهکننده ۹۷.۶٪ در آزمون FrontierMath Tier 4.
* کار با کامپیوتر: برتری در بنچمارکهای OSWorld 2.0 و ScreenSpot-Pro با دقت ۹۲.۷٪.
* بهینهسازی هزینه: نرخ حل مسئله بالاتر در کنار هزینه API کمتر در مقایسه با سایر رقبا.
شرکت OpenAI بهتازگی از مدل قدرتمند GPT-6 Astra رونمایی کرد. این مدل که اولین خروجی آموزشی مبتنی بر بیش از ۱۰۰ هزار GPU است، در بنچمارکهای متعددی نظیر TBv4، SRE-Bench و FrontierMath عملکرد خیرهکنندهای را ثبت کرده و فاصله قابلتوجهی با رقبا ایجاد کرده است. برای ارزیابی دقیقتر مشخصات، تحلیل معماری و قابلیتها جزئیات فنی بیشتری ارائه میکند.
گریگ براکمن، رئیس OpenAI، این نقطه عطف را سرآغاز عصر هوش مصنوعی عمومی (AGI) دانسته است. در ادامه به برخی از مهمترین نتایج عملکرد این مدل اشاره میکنیم:
* قابلیتهای کدنویسی: کسب امتیاز ۵۷.۷٪ در Terminal-Bench 4.0 که فراتر از رقباست.
* امنیت سایبری: ثبت دقت ۱۰۰٪ در ExploitBench و پیشتازی در SRE-Bench.
* عملکرد آکادمیک: دستیابی به نرخ خیرهکننده ۹۷.۶٪ در آزمون FrontierMath Tier 4.
* کار با کامپیوتر: برتری در بنچمارکهای OSWorld 2.0 و ScreenSpot-Pro با دقت ۹۲.۷٪.
* بهینهسازی هزینه: نرخ حل مسئله بالاتر در کنار هزینه API کمتر در مقایسه با سایر رقبا.
هوش مصنوعی و علم داده به فارسی
ورود به عصر AGI با معرفی GPT-6 Astra شرکت OpenAI بهتازگی از مدل قدرتمند GPT-6 Astra رونمایی کرد. این مدل که اولین خروجی آموزشی مبتنی بر بیش از ۱۰۰ هزار GPU است، در بنچمارکهای متعددی نظیر TBv4، SRE-Bench و FrontierMath عملکرد خیرهکنندهای را ثبت کرده…
📊 تحلیل عملکرد مدل Astra در مقابله با توهمات
محققان برای ارزیابی دقت فاکتوریال مدلهای زبانی، از دادههای چالشبرانگیزی استفاده کردهاند که پیشتر کاربران در آنها گزارش «توهم» (Hallucination) ثبت کرده بودند. این ارزیابی بر دو شاخص استوار است: بروز هرگونه خطای جدید در پاسخ و تکرار همان خطای قبلی گزارششده توسط کاربر. جزئیات معماری، قابلیتها و محدودیتهای فنی در بررسی فنی مدل با دقت بیشتری مرور شده است.
نتایج بنچمارک نشان میدهد مدل GPT-6 Astra با اختلاف عملکردی معنادار، نرخ خطای بسیار کمتری نسبت به مدلهای سری GPT-5.6 و GPT-5.5 دارد. مهمترین نکات این ارزیابی عبارتند از:
* در شاخص وقوع کلی توهم، مدل
* با افزایش زمان تأخیر (Latency)، دقت مدلها بهبود مییابد؛ اما
* در بازتولید خطاهای گزارششده، مدل
محققان برای ارزیابی دقت فاکتوریال مدلهای زبانی، از دادههای چالشبرانگیزی استفاده کردهاند که پیشتر کاربران در آنها گزارش «توهم» (Hallucination) ثبت کرده بودند. این ارزیابی بر دو شاخص استوار است: بروز هرگونه خطای جدید در پاسخ و تکرار همان خطای قبلی گزارششده توسط کاربر. جزئیات معماری، قابلیتها و محدودیتهای فنی در بررسی فنی مدل با دقت بیشتری مرور شده است.
نتایج بنچمارک نشان میدهد مدل GPT-6 Astra با اختلاف عملکردی معنادار، نرخ خطای بسیار کمتری نسبت به مدلهای سری GPT-5.6 و GPT-5.5 دارد. مهمترین نکات این ارزیابی عبارتند از:
* در شاخص وقوع کلی توهم، مدل
Astra نرخ خطایی بین ۴ تا ۸ درصد دارد، در حالی که مدل GPT-5.6 Sol با نرخ بالای ۳۰ درصد شروع میکند.* با افزایش زمان تأخیر (Latency)، دقت مدلها بهبود مییابد؛ اما
Astra حتی در تأخیرهای پایین نیز پایداری خیرهکنندهای در صحت پاسخها نشان میدهد.* در بازتولید خطاهای گزارششده، مدل
Astra با نرخ خطای حدود ۳ درصد، بسیار قابلاعتمادتر از رقبا ظاهر شده است.This media is not supported in your browser
VIEW IN TELEGRAM
🌍 تبدیل تصاویر دوبعدی به دنیای سهبعدی با WorldGen
مدل جدید WorldGen که توسط Hyper3D معرفی شده، مرزهای تبدیل تصویر به صحنههای سهبعدی را جابهجا کرده است. این ابزار قادر است تنها از یک تصویر دوبعدی، یک محیط سهبعدی کامل با ویژگیهای فیزیکی واقعی بسازد.
یکی از قابلیتهای کلیدی این مدل، استقلال اشیاء در صحنه است. شما میتوانید میز، صندلی و سایر اجزا را بهصورت جداگانه جابهجا، جایگزین یا اصلاح کنید. علاوه بر این، WorldGen بهطور خودکار ویژگیهای فیزیکی مانند برخورد، جرم و اصطکاک را به اشیاء اختصاص میدهد.
مهمترین ویژگیهای این مدل:
• خروجیهای بهینهشده برای استفاده در Blender، Unity و Unreal Engine
• امکان استفاده در پروژههای بازیسازی، فیلم، XR و شبیهسازی رباتیک
• قابلیت ترکیب با مدلهای ویدئویی مثل Seedance 2.5 برای اصلاح نورپردازی، متریال و تبدیل صحنهها به کلیپهای سینمایی
این فناوری گامی بزرگ برای تسریع در تولید محتوای سهبعدی و مدلسازی خودکار است.
#WorldGen #Seedance_2_5
مدل جدید WorldGen که توسط Hyper3D معرفی شده، مرزهای تبدیل تصویر به صحنههای سهبعدی را جابهجا کرده است. این ابزار قادر است تنها از یک تصویر دوبعدی، یک محیط سهبعدی کامل با ویژگیهای فیزیکی واقعی بسازد.
یکی از قابلیتهای کلیدی این مدل، استقلال اشیاء در صحنه است. شما میتوانید میز، صندلی و سایر اجزا را بهصورت جداگانه جابهجا، جایگزین یا اصلاح کنید. علاوه بر این، WorldGen بهطور خودکار ویژگیهای فیزیکی مانند برخورد، جرم و اصطکاک را به اشیاء اختصاص میدهد.
مهمترین ویژگیهای این مدل:
• خروجیهای بهینهشده برای استفاده در Blender، Unity و Unreal Engine
• امکان استفاده در پروژههای بازیسازی، فیلم، XR و شبیهسازی رباتیک
• قابلیت ترکیب با مدلهای ویدئویی مثل Seedance 2.5 برای اصلاح نورپردازی، متریال و تبدیل صحنهها به کلیپهای سینمایی
این فناوری گامی بزرگ برای تسریع در تولید محتوای سهبعدی و مدلسازی خودکار است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#WorldGen #Seedance_2_5