gemini-3-5benchmarkslight-6a0cb6540a3211b2de67c184.gif
120.1 KB
با توجه به جدول عملکردی ارائه شده، Gemini 3.5 Flash نه تنها نسبت به نسلهای پیشین گوگل پیشرفت چشمگیری داشته، بلکه در رقابت با مدلهای مطرح دیگر نیز بسیار قدرتمند ظاهر شده است؛ بهطوری که در حوزهی فعالیتهای «عاملمحور» (Agentic) مانند MCP Atlas با امتیاز ۸۳.۶٪ و Toolathlon با ۵۶.۵٪، از رقبای سرشناسی همچون Claude Opus 4.7 و حتی GPT-5.5 پیشی گرفته است. همچنین در بخش «چندوجهی» (Multimodal)، این مدل با امتیاز ۸۳.۶٪ در آزمون MMMU-Pro، عملکردی فراتر از تمامی مدلهای رقیب (شامل Claude و GPT-5.5) دارد. با این حال، در زمینههایی نظیر کدنویسی تخصصی در Terminal-bench 2.1 (با امتیاز ۷۶.۲٪) یا توانایی استدلال انتزاعی در ARC-AGI-2 (با امتیاز ۷۲.۱٪)، مدل GPT-5.5 همچنان با اختلاف برتری خود را حفظ کرده و پیشتاز است؛ این نشان میدهد که Gemini 3.5 Flash با تمرکز ویژه بر سرعت و اجرای هوشمندِ وظایف چندمرحلهای (Agentic)، جایگاه خود را به عنوان یکی از منعطفترین مدلهای فعلی بازار تثبیت کرده است.
Forwarded from PyTorch Howsam (Ali Farajnia)
نسخه Claude Opus 4.8 منتشر شد.
- سه تغییر مشخص نسبت به نسخه 4.7:
قضاوت دقیقتر درباره وضعیت، صداقت بیشتر در بیان محدودیتهای خود و حفظ طولانیتر زمینه هنگام کار مستقل بدون راهنمایی.
- در بنچمارکها:
کدنویسی عاملی (SWE-Bench Pro) 69.2٪ در مقابل 64.3٪ در نسخه 4.7 و 58.6٪ در GPT-5.5. استفاده از کامپیوتر (OSWorld) 83.4٪. کار دانش (GDPval-AA) 1890 در مقابل 1753 نسخه قبلی.
در کدنویسی ترمینالی GPT-5.5 فعلاً با 78.2٪ در مقابل 74.6٪ جلوتر است، اما فاصله کم است.
- قیمت تغییر نکرده است.
- سه تغییر مشخص نسبت به نسخه 4.7:
قضاوت دقیقتر درباره وضعیت، صداقت بیشتر در بیان محدودیتهای خود و حفظ طولانیتر زمینه هنگام کار مستقل بدون راهنمایی.
- در بنچمارکها:
کدنویسی عاملی (SWE-Bench Pro) 69.2٪ در مقابل 64.3٪ در نسخه 4.7 و 58.6٪ در GPT-5.5. استفاده از کامپیوتر (OSWorld) 83.4٪. کار دانش (GDPval-AA) 1890 در مقابل 1753 نسخه قبلی.
در کدنویسی ترمینالی GPT-5.5 فعلاً با 78.2٪ در مقابل 74.6٪ جلوتر است، اما فاصله کم است.
- قیمت تغییر نکرده است.
Claude
Introducing dynamic workflows | Claude by Anthropic
Dynamic workflows in Claude Code let Claude tackle the most challenging tasks by executing across 10s to 100s of parallel subagents, and checking its work before anything reaches you.
با سلام
در صورتی که دانشجویی به دنبال فرصت کارآموزی باشد، چند موقعیت کارآموزی در صنعت موجود است که امکان معرفی برای آنها را دارم. در صورت تمایل لطفاً رزومه خود را برای من ایمیل کنید.
Behnam.y2010@aut.ac.ir
در صورتی که دانشجویی به دنبال فرصت کارآموزی باشد، چند موقعیت کارآموزی در صنعت موجود است که امکان معرفی برای آنها را دارم. در صورت تمایل لطفاً رزومه خود را برای من ایمیل کنید.
Behnam.y2010@aut.ac.ir
Forwarded from TechTube 𝕏 تک توب
شرکت SpaceXAI مدل جدید Grok 4.5 رو عرضه کرده که قدرت کدنویسی در سطح Claude Opus 4.8 رو با هزینه ای بسیار کمتر در اختیار کاربران قرار میده.
این مدل که با همکاری Cursor توسعه داده شده، طبق تستهای Artificial Analysis در کدنویسی با ایجنتها، قدرتی بالاتر از Opus 4.8 و نزدیک به GPT 5.5 و Fable 5 رو از خودش نشون داده.
همچنین نه تنها مصرف توکنهای اون بین 3 تا 5 برابر از مدلهای Claude کمتر بوده، بلکه برای اجرای این تستها در حالی که Fable 5 حدود 3800 دلار هزینه داره، هزینه اجرای اونها با Grok 4.5 چیزی حدود 833 دلار هست و سرعت بیشتری در اجرای اونها داره.
این مدل از حالا در پلتفرمهای مختلف و همچنین ابزار برنامه نویسی Grok Build در دسترس کاربران قرار گرفته.
🔎 ArtificialAnlys
📍 @TechTube
این مدل که با همکاری Cursor توسعه داده شده، طبق تستهای Artificial Analysis در کدنویسی با ایجنتها، قدرتی بالاتر از Opus 4.8 و نزدیک به GPT 5.5 و Fable 5 رو از خودش نشون داده.
همچنین نه تنها مصرف توکنهای اون بین 3 تا 5 برابر از مدلهای Claude کمتر بوده، بلکه برای اجرای این تستها در حالی که Fable 5 حدود 3800 دلار هزینه داره، هزینه اجرای اونها با Grok 4.5 چیزی حدود 833 دلار هست و سرعت بیشتری در اجرای اونها داره.
این مدل از حالا در پلتفرمهای مختلف و همچنین ابزار برنامه نویسی Grok Build در دسترس کاربران قرار گرفته.
🔎 ArtificialAnlys
📍 @TechTube
Forwarded from TechTube 𝕏 تک توب
شرکت OpenAI رسما مدلهای GPT 5.6 رو به طور رسمی برای تمام کاربران عرضه کرده.
این مدلها حدود دو هفته رونمایی شدن ولی در اون زمان فقط در دسترس شرکتهای خاصی بودن ولی حالا OpenAI مجوز عرضه عمومی اونهارو از دولت امریکا دریافت کرده.
این سری از مدلها شامل سه مدل هستن که Sol قویترین اونهاست، Terra تعادلی بین سرعت و قدرت داره و Luna برای سرعت و قیمت پایین بهینه شده.
مدل Sol قویترین مدل این شرکت تاکنون هست و عملکرد بالایی در کدنویسی، پیدا کردن حفره های امنیتی و بیولوژی داره و در تستهای مختلف قدرتی نزدیک به Claude Fable و Claude Mythos با مصرف کمتر توکن و هزینه پایینتر رو به نمایش گذاشته.
به دلیل قدرت بالای این مدل در شناسایی حفره های امنیتی، این شرکت سیستم حفاظتی جدیدی برای این مدل کار گذاشته تا نشه از اون برای انجام حملات سایبری و نوشتن کدهایی برای سواستفاده از حفره های امنیتی استفاده کرد. در عوض سیستم اون اجازه دفاع کردن و رفع حفره های امنیتی رو خواهد داد که البته این قابلیت فقط در دسترس افرادی هست که مجوز لازم رو برای اینکار از OpenAI دریافت کرده باشن.
این مدلها از حالا برای کاربران اشتراک Pro عرضه شدن و طی 24 ساعت اینده در دسترس کاربران اشتراک پلاس هم قرار خواهند گرفت.
🔎 openai
📍 @TechTube
این مدلها حدود دو هفته رونمایی شدن ولی در اون زمان فقط در دسترس شرکتهای خاصی بودن ولی حالا OpenAI مجوز عرضه عمومی اونهارو از دولت امریکا دریافت کرده.
این سری از مدلها شامل سه مدل هستن که Sol قویترین اونهاست، Terra تعادلی بین سرعت و قدرت داره و Luna برای سرعت و قیمت پایین بهینه شده.
مدل Sol قویترین مدل این شرکت تاکنون هست و عملکرد بالایی در کدنویسی، پیدا کردن حفره های امنیتی و بیولوژی داره و در تستهای مختلف قدرتی نزدیک به Claude Fable و Claude Mythos با مصرف کمتر توکن و هزینه پایینتر رو به نمایش گذاشته.
به دلیل قدرت بالای این مدل در شناسایی حفره های امنیتی، این شرکت سیستم حفاظتی جدیدی برای این مدل کار گذاشته تا نشه از اون برای انجام حملات سایبری و نوشتن کدهایی برای سواستفاده از حفره های امنیتی استفاده کرد. در عوض سیستم اون اجازه دفاع کردن و رفع حفره های امنیتی رو خواهد داد که البته این قابلیت فقط در دسترس افرادی هست که مجوز لازم رو برای اینکار از OpenAI دریافت کرده باشن.
این مدلها از حالا برای کاربران اشتراک Pro عرضه شدن و طی 24 ساعت اینده در دسترس کاربران اشتراک پلاس هم قرار خواهند گرفت.
🔎 openai
📍 @TechTube
خلاصه دو پست بالایی اینه که از یک طرف، SpaceXAI مدل جدید Grok 4.5 رو با همکاری Cursor عرضه کرده که توی کدنویسی عملکردی عالی در سطح Claude Opus 4.8 داره و با مصرف توکن کمتر، هزینهها رو هم به شدت کاهش داده.
از طرف دیگه، OpenAI هم سری جدید GPT-5.6 رو منتشر کرده که شامل سه مدل با کاربری متفاوته: مدل Sol که قدرتمندترینِ این سریه و برای تحلیلهای پیچیده و امنیت طراحی شده، مدل Terra که تعادلِ ایدهآلی بین سرعت و قدرت ایجاد کرده، و مدل Luna که برای کسانی که سرعت بالا و هزینهی کمتر میخوان بهینه شده. البته OpenAI برای جلوگیری از سوءاستفادههای سایبری، سدهای امنیتی سختی روی Sol گذاشته تا فقط برای کارهای دفاعی استفاده بشه.
از طرف دیگه، OpenAI هم سری جدید GPT-5.6 رو منتشر کرده که شامل سه مدل با کاربری متفاوته: مدل Sol که قدرتمندترینِ این سریه و برای تحلیلهای پیچیده و امنیت طراحی شده، مدل Terra که تعادلِ ایدهآلی بین سرعت و قدرت ایجاد کرده، و مدل Luna که برای کسانی که سرعت بالا و هزینهی کمتر میخوان بهینه شده. البته OpenAI برای جلوگیری از سوءاستفادههای سایبری، سدهای امنیتی سختی روی Sol گذاشته تا فقط برای کارهای دفاعی استفاده بشه.
Forwarded from TechTube 𝕏 تک توب
شرکت OpenAI مدل صوتی جدید GPT-Live-1 رو عرضه کرده که صدای اون طبیعی تر هست و یک مدل Full-Duplex محسوب میشه در نتیجه به طور همزمان هم میتونه صحبت کنه هم به حرفای شما گوش بده.
بنابراین با این مدل، کاربران میتونن مثل یک مکالمه عادی، روی صحبتهای مدل وقفه بندازن و حرفشون رو بزنن بدون اینکه روی حرفای بعدی مدل اختلالی ایجاد بشه. همچنین چنین چیزی قابلیتهایی مثل ترجمه زنده و همزمان رو هم ممکن میکنه.
این مدل صوتی به مدلهای جدیدتر GPT دسترسی داره در نتیجه میتونه سوالات پیچیده تر رو جواب بده، جوابهای تصویری در حین مکالمه به کاربر بده و در حین حرف زدن کاربر، برای مدت طولانی ساکت بمونه تا حرفهای اون رو با دقت بیشتری متوجه بشه. علاوه بر این انجام مکالمات طولانی مثلا تا نیم ساعت رو هم داره. همچنین داری درکی از زمان هست و مثلا میتونه گذشت 30 ثانیه رو بفهمه و به کاربر خبر بده.
مدل GPT-Live-1 از حالا برای کاربران دارای اشتراک ChatGPT عرضه شده و برای کاربران رایگان به مرور زمان فعال خواهد شد.
🔎 techcrunch
📍 @TechTube
بنابراین با این مدل، کاربران میتونن مثل یک مکالمه عادی، روی صحبتهای مدل وقفه بندازن و حرفشون رو بزنن بدون اینکه روی حرفای بعدی مدل اختلالی ایجاد بشه. همچنین چنین چیزی قابلیتهایی مثل ترجمه زنده و همزمان رو هم ممکن میکنه.
این مدل صوتی به مدلهای جدیدتر GPT دسترسی داره در نتیجه میتونه سوالات پیچیده تر رو جواب بده، جوابهای تصویری در حین مکالمه به کاربر بده و در حین حرف زدن کاربر، برای مدت طولانی ساکت بمونه تا حرفهای اون رو با دقت بیشتری متوجه بشه. علاوه بر این انجام مکالمات طولانی مثلا تا نیم ساعت رو هم داره. همچنین داری درکی از زمان هست و مثلا میتونه گذشت 30 ثانیه رو بفهمه و به کاربر خبر بده.
مدل GPT-Live-1 از حالا برای کاربران دارای اشتراک ChatGPT عرضه شده و برای کاربران رایگان به مرور زمان فعال خواهد شد.
🔎 techcrunch
📍 @TechTube
Forwarded from جادی | Jadi
اگر وردپرسی دارین که از نسخه اش از ۷.۰.۲ قدیمی تر است، سریعا آپدیتش کنین. دو تا مشکل امنیتی خیلی حاد هست که داره به شکل فعال برای حمله به سایت ها استفاده می شه. یک حمله sql injection و یک مشکل در REST API که اجازه اجرای کد از راه دور رو می ده. آپدیت همیشه مهمه، الان در وردپرس الزامی.
شاید براتون سوال باشه الان بهترین مدلهای زبانی هوش مصنوعی کدوما هستن؛ چه بهصورت کلی، چه برای تسکهای خاص مثل کدنویسی، ریاضی، تحلیل داده و…
سایت LiveBench یه لیدربورد بهروز از مدلهای مختلف داره که میتونید عملکردشون رو در دستهبندیهای مختلف ببینید، امتیاز هر زیرتسک رو بررسی کنید و حتی هزینهی استفاده از مدلها رو کنار امتیازها مقایسه کنید.
لینک:
https://livebench.ai
سایت LiveBench یه لیدربورد بهروز از مدلهای مختلف داره که میتونید عملکردشون رو در دستهبندیهای مختلف ببینید، امتیاز هر زیرتسک رو بررسی کنید و حتی هزینهی استفاده از مدلها رو کنار امتیازها مقایسه کنید.
لینک:
https://livebench.ai
در مدل جدیدی به اسم bina که برای ocr زبان فارسی فاین تیون کردن با عملکردی خیره کننده نسبت به مدلهای سطح یک دنیا در رتبه ۱ برتری خودشو نشون داد
https://huggingface.co/Reza2kn/Bina-0.1
https://huggingface.co/Reza2kn/Bina-0.1
Forwarded from PyTorch Howsam (Ali Farajnia)