🚀 رونمایی از مدل قدرتمند Qwen3.8-27B
تیم Qwen از مدل جدید خود با نام Qwen3.8-27B رونمایی کرد. این مدل ۲۷ میلیاردی با لایسنس Apache 2.0، از ۲۶۲ هزار توکن در پنجره متنی پشتیبانی میکند که تا ۱ میلیون توکن قابل گسترش است.
این مدل علاوه بر متن، توانایی درک تصویر و ویدیو را دارد و با قابلیتهای Thinking Mode و استفاده از ابزار، برای سناریوهای عاملمحور (Agentic) بهینه شده است.
مهمترین نتایج بنچمارکهای این مدل:
* کدنویسی رقابتی (LiveCodeBench): امتیاز ۹۰.۳
* مهندسی نرمافزار (SWE-bench Pro): امتیاز ۶۱.۷
* استفاده از سیستمعامل (OSWorld): امتیاز ۸۴.۳
* استفاده از موبایل (AndroidWorld): امتیاز ۸۱.۹
* تحلیل نمودارهای علمی (CharXiv): امتیاز ۹۰.۲
شما میتوانید این مدل را از طریق فریمورکهایی مانند Transformers، vLLM و SGLang اجرا کنید. همچنین نسخههای سازگار برای استفاده در محیطهای محلی مانند llama.cpp، Ollama و LM Studio در دسترس است.
تیم Qwen از مدل جدید خود با نام Qwen3.8-27B رونمایی کرد. این مدل ۲۷ میلیاردی با لایسنس Apache 2.0، از ۲۶۲ هزار توکن در پنجره متنی پشتیبانی میکند که تا ۱ میلیون توکن قابل گسترش است.
این مدل علاوه بر متن، توانایی درک تصویر و ویدیو را دارد و با قابلیتهای Thinking Mode و استفاده از ابزار، برای سناریوهای عاملمحور (Agentic) بهینه شده است.
مهمترین نتایج بنچمارکهای این مدل:
* کدنویسی رقابتی (LiveCodeBench): امتیاز ۹۰.۳
* مهندسی نرمافزار (SWE-bench Pro): امتیاز ۶۱.۷
* استفاده از سیستمعامل (OSWorld): امتیاز ۸۴.۳
* استفاده از موبایل (AndroidWorld): امتیاز ۸۱.۹
* تحلیل نمودارهای علمی (CharXiv): امتیاز ۹۰.۲
شما میتوانید این مدل را از طریق فریمورکهایی مانند Transformers، vLLM و SGLang اجرا کنید. همچنین نسخههای سازگار برای استفاده در محیطهای محلی مانند llama.cpp، Ollama و LM Studio در دسترس است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی#Qwen3_8_27B #OSWorld
📩 ارتباط با ما
📉 چالش پذیرش مدلهای هوش مصنوعی در کسبوکارها
دادههای جدید پلتفرم مالی Ramp نشان میدهد که برخلاف انتظار، مدل قدرتمند Fable 5 محصول Anthropic شروع موفقی در بازار شرکتی نداشته است. در اولین ماه عرضه، این مدل تنها ۶ درصد از سهم توکنهای خریداریشده توسط سازمانها را به خود اختصاص داده است.
مهمترین دلایل این استقبال سرد عبارتند از:
* هزینه بالای استفاده: قیمت این مدل برای هر میلیون توکن ورودی و خروجی، دو برابر مدل GPT-5.6 Sol است که باعث شده درآمد حاصل از آن یکچهارم کمتر از رقیب اصلی باشد.
* ابهام در بازگشت سرمایه: شرکتها در وظایف روتین کاری، افزایش کیفیت محسوسی را نسبت به هزینه پرداختی مشاهده نمیکنند.
* گرایش به Open-source: با کاهش شکاف میان مدلهای تجاری و مدلهای متنباز، سازمانها ترجیح میدهند به جای صرف هزینههای سنگین برای API مدلهای بسته، به سراغ جایگزینهای متنباز بروند.
این وضعیت نشان میدهد که برای سازمانها، بهرهوری واقعی و تحلیل دقیق هزینهها در استفاده از منابع محاسباتی اهمیت بیشتری نسبت به صرفاً قدرتمندترین مدل موجود پیدا کرده است.📊 Data➕Science
دادههای جدید پلتفرم مالی Ramp نشان میدهد که برخلاف انتظار، مدل قدرتمند Fable 5 محصول Anthropic شروع موفقی در بازار شرکتی نداشته است. در اولین ماه عرضه، این مدل تنها ۶ درصد از سهم توکنهای خریداریشده توسط سازمانها را به خود اختصاص داده است.
مهمترین دلایل این استقبال سرد عبارتند از:
* هزینه بالای استفاده: قیمت این مدل برای هر میلیون توکن ورودی و خروجی، دو برابر مدل GPT-5.6 Sol است که باعث شده درآمد حاصل از آن یکچهارم کمتر از رقیب اصلی باشد.
* ابهام در بازگشت سرمایه: شرکتها در وظایف روتین کاری، افزایش کیفیت محسوسی را نسبت به هزینه پرداختی مشاهده نمیکنند.
* گرایش به Open-source: با کاهش شکاف میان مدلهای تجاری و مدلهای متنباز، سازمانها ترجیح میدهند به جای صرف هزینههای سنگین برای API مدلهای بسته، به سراغ جایگزینهای متنباز بروند.
این وضعیت نشان میدهد که برای سازمانها، بهرهوری واقعی و تحلیل دقیق هزینهها در استفاده از منابع محاسباتی اهمیت بیشتری نسبت به صرفاً قدرتمندترین مدل موجود پیدا کرده است.📊 Data➕Science
🤖 چالش بزرگ هوش مصنوعی: فراتر از هوش فردی
امروز چالش اصلی در دنیای هوش مصنوعی، ساخت مدلهای باهوشتر نیست، بلکه هماهنگ کردن آنها برای کار گروهی است. تحقیقات اخیر Anthropic بر روی سیستمهای چندعامله (Multi-agent) نتایج شگفتانگیز و در عین حال هشداردهندهای به همراه داشته است.
در یکی از آزمایشها، ۴۵ عامل Claude به صورت تیمی توانستند ۲۶۶ آسیبپذیری امنیتی را در ۱۵ پروژه متنباز شناسایی کنند، در حالی که در حالت انفرادی این عدد بسیار کمتر بود. با این حال، افزایش تعداد عوامل همیشه به نتایج بهتر منجر نمیشود و چالشهای زیر را ایجاد میکند:
• تداخل در کار و ایجاد هزاران Pull request بیفایده
• تکرار اشتباهات مشابه توسط عوامل مختلف
• بروز تضاد منافع و «جنگ قلمرو» در صورت داشتن اهداف متناقض
• ناتوانی در به اشتراکگذاری اطلاعات کلیدی میان اعضای تیم
درس بزرگ این آزمایش این است که هوش فردی هر مدل، تضمینکننده عملکرد هوشمندانه گروه نیست.
امروز چالش اصلی در دنیای هوش مصنوعی، ساخت مدلهای باهوشتر نیست، بلکه هماهنگ کردن آنها برای کار گروهی است. تحقیقات اخیر Anthropic بر روی سیستمهای چندعامله (Multi-agent) نتایج شگفتانگیز و در عین حال هشداردهندهای به همراه داشته است.
در یکی از آزمایشها، ۴۵ عامل Claude به صورت تیمی توانستند ۲۶۶ آسیبپذیری امنیتی را در ۱۵ پروژه متنباز شناسایی کنند، در حالی که در حالت انفرادی این عدد بسیار کمتر بود. با این حال، افزایش تعداد عوامل همیشه به نتایج بهتر منجر نمیشود و چالشهای زیر را ایجاد میکند:
• تداخل در کار و ایجاد هزاران Pull request بیفایده
• تکرار اشتباهات مشابه توسط عوامل مختلف
• بروز تضاد منافع و «جنگ قلمرو» در صورت داشتن اهداف متناقض
• ناتوانی در به اشتراکگذاری اطلاعات کلیدی میان اعضای تیم
درس بزرگ این آزمایش این است که هوش فردی هر مدل، تضمینکننده عملکرد هوشمندانه گروه نیست.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی#Claude #Multi_agent
📩 ارتباط با ما
🚀 ادغام بزرگ: Cursor به SpaceX پیوست
شرکت Cursor به صورت رسمی توسط SpaceX خریداری شد. این ادغام که با ارزش ۶۰ میلیارد دلار انجام شده، فصلی جدید برای توسعه ابزارهای هوش مصنوعی رقم میزند.
طبق اعلام رسمی، تیم Cursor به زیرمجموعه xAI ملحق میشود تا تمرکز اصلی بر ارتقای مدلهای Grok و تبدیل آن به قدرتمندترین دستیار هوش مصنوعی جهان قرار بگیرد.
مهمترین اهداف این همکاری عبارتند از:
• توسعه قابلیتهای Grok Build برای کدنویسی هوشمند
• بهبود عملکرد Grok Bot در تعاملات کاربر
• گسترش زیرساختهای Grok API
• یکپارچهسازی فناوریهای Cursor با اکوسیستم SpaceX
باید دید ایلان ماسک چه نامی برای این پلتفرم جدید انتخاب خواهد کرد و آیا این ترکیب میتواند سلطه فعلی مدلهای بزرگ در حوزه برنامهنویسی را به چالش بکشد یا خیر.
شرکت Cursor به صورت رسمی توسط SpaceX خریداری شد. این ادغام که با ارزش ۶۰ میلیارد دلار انجام شده، فصلی جدید برای توسعه ابزارهای هوش مصنوعی رقم میزند.
طبق اعلام رسمی، تیم Cursor به زیرمجموعه xAI ملحق میشود تا تمرکز اصلی بر ارتقای مدلهای Grok و تبدیل آن به قدرتمندترین دستیار هوش مصنوعی جهان قرار بگیرد.
مهمترین اهداف این همکاری عبارتند از:
• توسعه قابلیتهای Grok Build برای کدنویسی هوشمند
• بهبود عملکرد Grok Bot در تعاملات کاربر
• گسترش زیرساختهای Grok API
• یکپارچهسازی فناوریهای Cursor با اکوسیستم SpaceX
باید دید ایلان ماسک چه نامی برای این پلتفرم جدید انتخاب خواهد کرد و آیا این ترکیب میتواند سلطه فعلی مدلهای بزرگ در حوزه برنامهنویسی را به چالش بکشد یا خیر.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی#Cursor #Grok
📩 ارتباط با ما
🔓 نشت استدلال پنهان مدلهای زبانی بزرگ
پژوهشگران در مطالعهای تازه با عنوان Stealing Reasoning Traces from Proprietary LLM APIs، حفره امنیتی عجیبی در مدلهای پیشرو مانند GPT، Claude و Gemini کشف کردند. این بررسی نشان میدهد که بخش استدلال (Reasoning) مدلها که معمولاً مخفی است، قابل رمزگشایی کامل است.
نکته نگرانکننده اینجاست که بلوکهای استدلال بین مدلهای یک ارائهدهنده، کاملاً سازگار و قابل جایگزینی هستند. یعنی میتوان استدلال پیچیده یک مدل قدرتمند را استخراج و به مدلی سادهتر خوراند تا آن را بهصورت متنی و واضح بازخوانی کند.
مهمترین پیامدهای این یافته:
- دور زدن مکانیزمهای ضد استخراج دانش.
- نشت اطلاعات حساس و PII (دادههای شناسایی شخصی) موجود در زنجیرههای استدلال که در مخازن عمومی یافت شده است.
- تسهیل حملات Jailbreak و Prompt Injection.
جزئیات بیشتر این تحقیق و نمودارهای همبستگی استدلال مدلها را میتوانید در وبسایت stolen-thoughts.com مشاهده کنید. این یافتهها به شرکتهای بزرگ گزارش شده و در حال پیگیری است.
پژوهشگران در مطالعهای تازه با عنوان Stealing Reasoning Traces from Proprietary LLM APIs، حفره امنیتی عجیبی در مدلهای پیشرو مانند GPT، Claude و Gemini کشف کردند. این بررسی نشان میدهد که بخش استدلال (Reasoning) مدلها که معمولاً مخفی است، قابل رمزگشایی کامل است.
نکته نگرانکننده اینجاست که بلوکهای استدلال بین مدلهای یک ارائهدهنده، کاملاً سازگار و قابل جایگزینی هستند. یعنی میتوان استدلال پیچیده یک مدل قدرتمند را استخراج و به مدلی سادهتر خوراند تا آن را بهصورت متنی و واضح بازخوانی کند.
مهمترین پیامدهای این یافته:
- دور زدن مکانیزمهای ضد استخراج دانش.
- نشت اطلاعات حساس و PII (دادههای شناسایی شخصی) موجود در زنجیرههای استدلال که در مخازن عمومی یافت شده است.
- تسهیل حملات Jailbreak و Prompt Injection.
جزئیات بیشتر این تحقیق و نمودارهای همبستگی استدلال مدلها را میتوانید در وبسایت stolen-thoughts.com مشاهده کنید. این یافتهها به شرکتهای بزرگ گزارش شده و در حال پیگیری است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
Media is too big
VIEW IN TELEGRAM
🤖 رکوردشکنی ربات WALL-B در دستهبندی هوشمند بستهها
ربات WALL-B موفق شد در یک پخش زنده، ۱,۸۱۶ بسته را در ساعت با دقت بالای ۹۸ درصد دستهبندی کند. برای مقایسه، ربات معروف Figure به طور میانگین ۱,۲۴۸ بسته در ساعت را ثبت کرده بود که نشان از کارایی ۴۵ درصد بالاتر ربات WALL-B دارد.
برخلاف رباتهای انساننما، این سیستم از دو بازوی مکانیکی ۶محوره بهره میبرد و هوش مصنوعی آن با ارزیابی مداوم چیدمان، تغییر شکل بستهها یا ناخوانا بودن برچسبها، استراتژی خود را در لحظه تطبیق میدهد. این مدل ادراکی و استدلالی پیشرفته، علاوه بر محیطهای صنعتی، پتانسیل بالایی برای استفاده در کارهای خانگی و محیطهای پویا دارد.
ربات WALL-B موفق شد در یک پخش زنده، ۱,۸۱۶ بسته را در ساعت با دقت بالای ۹۸ درصد دستهبندی کند. برای مقایسه، ربات معروف Figure به طور میانگین ۱,۲۴۸ بسته در ساعت را ثبت کرده بود که نشان از کارایی ۴۵ درصد بالاتر ربات WALL-B دارد.
برخلاف رباتهای انساننما، این سیستم از دو بازوی مکانیکی ۶محوره بهره میبرد و هوش مصنوعی آن با ارزیابی مداوم چیدمان، تغییر شکل بستهها یا ناخوانا بودن برچسبها، استراتژی خود را در لحظه تطبیق میدهد. این مدل ادراکی و استدلالی پیشرفته، علاوه بر محیطهای صنعتی، پتانسیل بالایی برای استفاده در کارهای خانگی و محیطهای پویا دارد.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی#WALL_B #بازوی_مکانیکی
📩 ارتباط با ما
Media is too big
VIEW IN TELEGRAM
🛠️ آرشیو برترین کتابخانههای یادگیری ماشین پایتون
اگر به دنبال ابزارهای کاربردی و قدرتمند برای هوش مصنوعی هستید، مخزن گیتهاب Best of ML Python یک گنجینه بینظیر برای شماست. این آرشیو شامل بیش از ۹۰۰ کتابخانه و فریمورک پایتون در حوزه یادگیری ماشین است.
تمامی پروژهها در این مخزن بر اساس کیفیت و میزان محبوبیت دستهبندی شدهاند تا بتوانید بهسرعت بهترین ابزارها را برای توسعه پروژههای هوش مصنوعی (AI) و Machine Learning پیدا کنید.
اگر به دنبال ابزارهای کاربردی و قدرتمند برای هوش مصنوعی هستید، مخزن گیتهاب Best of ML Python یک گنجینه بینظیر برای شماست. این آرشیو شامل بیش از ۹۰۰ کتابخانه و فریمورک پایتون در حوزه یادگیری ماشین است.
تمامی پروژهها در این مخزن بر اساس کیفیت و میزان محبوبیت دستهبندی شدهاند تا بتوانید بهسرعت بهترین ابزارها را برای توسعه پروژههای هوش مصنوعی (AI) و Machine Learning پیدا کنید.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
❤1
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #86 | 📌 7 آیتم گزارش | 🧾 از 15 پست بررسیشده
🕐 جمعه 1405/05/23 ساعت 14:00 تا شنبه 1405/05/24 ساعت 14:00
🤖 مدلها و ابزارهای هوش مصنوعی
🚀 تحولات دنیای عوامل هوشمند
⚠️ اخبار صنعت و چالشهای امنیتی
🗂 گزارش #86 | 📌 7 آیتم گزارش | 🧾 از 15 پست بررسیشده
🕐 جمعه 1405/05/23 ساعت 14:00 تا شنبه 1405/05/24 ساعت 14:00
🤖 مدلها و ابزارهای هوش مصنوعی
اجرای مدل عظیم Kimi K3 با ۲.۷۸ تریلیون پارامتر روی پردازنده معمولی و ۸ گیگابایت رم با استفاده از پیادهسازی بهینه در زبان C99، یک دستاورد فنی مهم در حوزه هوش مصنوعی محلی محسوب میشود.
🔗 مشاهده پست
تیم Qwen از مدل جدید Qwen3.8-27B رونمایی کرد. این مدل با لایسنس باز، پشتیبانی از یک میلیون توکن و قابلیتهای پیشرفته چندوجهی و استدلال، برای سناریوهای عاملمحور بهینه شده است.
🔗 مشاهده پست
قابلیت Claude Cowork به افزونه کروم افزوده شد. این بهروزرسانی به کاربران اجازه میدهد جلسات کاری و اتوماسیونهای پیچیده هوش مصنوعی را مستقیماً در محیط مرورگر مدیریت کنند.
🔗 مشاهده پست
🚀 تحولات دنیای عوامل هوشمند
تحقیقات Anthropic نشان میدهد که هماهنگی مدلها برای کار گروهی (Multi-agent) قدرت حل مسئله را بهشدت افزایش میدهد؛ بهطوری که ۴۵ عامل کلود توانستند ۲۶۶ آسیبپذیری امنیتی را شناسایی کنند.
🔗 مشاهده پست
بررسیها نشان میدهد سرعت تحولات هوش مصنوعی فراتر از پیشبینیهاست؛ ظهور موفق نسل اول عوامل هوشمند (AI Agents) در ۲۰۲۵ و اتوماسیون گسترده در کدنویسی، از موارد محققشده تا سال ۲۰۲۷ هستند.
🔗 مشاهده پست
⚠️ اخبار صنعت و چالشهای امنیتی
شرکت Cursor در قراردادی ۶۰ میلیارد دلاری به SpaceX پیوست. تیم این شرکت به بخش xAI ملحق خواهد شد تا روی ارتقای مدل Grok و تبدیل آن به قدرتمندترین دستیار هوش مصنوعی جهان تمرکز کنند.
🔗 مشاهده پست
پژوهشگران حفره امنیتی جدیدی در مدلهای پیشرو مانند GPT و Claude کشف کردند که اجازه میدهد بلوکهای استدلال (Reasoning) پنهان مدلها رمزگشایی و استخراج شوند.
🔗 مشاهده پست
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
Forwarded from آکادمی همراه
📊 میخوای تحلیلگر داده بشی؟ مسیرش از همینجا شروع میشه!
وقتی تصمیم میگیری وارد دنیای تحلیل داده بشی، احتمالاً با کلی دوره، ابزار و مهارت مختلف روبهرو میشی و اولین سؤال اینه:
🤔 از کجا شروع کنم و دقیقاً چه چیزهایی باید یاد بگیرم؟
🧭 مسیر یادگیری تحلیلگر داده آکادمی همراه اول برای همین ساخته شده؛ تا آموزشهای موردنیازت رو در یک مسیر مشخص داشته باشی و بدون سردرگمی، قدمبهقدم مهارتهای لازم برای تحلیلگر داده شدن رو یاد بگیری.
📚 در این مسیر به بیش از ۹۰ ساعت آموزش تخصصی و شغلمحور دسترسی داری و با کمک منتورینگ تخصصی میتونی یادگیریت رو هدفمندتر جلو ببری.
📚 بیش از ۹۰ ساعت آموزش تخصصی
💼 آموزشهای شغلمحور
🧭 مسیر یادگیری مشخص و منسجم
👥 منتورینگ تخصصی
💳 امکان پرداخت اقساطی
🔥 خبر خوب اینکه الان میتونی این مسیر رو با ۳۰٪ تخفیف شروع کنی.
📈 اگر تحلیل داده یکی از مهارتهاییه که همیشه میخواستی یاد بگیری، وقتشه علاقهات رو به یک مهارت واقعی تبدیل کنی و اولین قدم رو برداری.
🎯 دریافت تخفیف و شروع مسیر:
https://l.hamrah.academy/1es
⭐️ @Hamrah_Academy | آکادمی همراه اول
وقتی تصمیم میگیری وارد دنیای تحلیل داده بشی، احتمالاً با کلی دوره، ابزار و مهارت مختلف روبهرو میشی و اولین سؤال اینه:
🤔 از کجا شروع کنم و دقیقاً چه چیزهایی باید یاد بگیرم؟
🧭 مسیر یادگیری تحلیلگر داده آکادمی همراه اول برای همین ساخته شده؛ تا آموزشهای موردنیازت رو در یک مسیر مشخص داشته باشی و بدون سردرگمی، قدمبهقدم مهارتهای لازم برای تحلیلگر داده شدن رو یاد بگیری.
📚 در این مسیر به بیش از ۹۰ ساعت آموزش تخصصی و شغلمحور دسترسی داری و با کمک منتورینگ تخصصی میتونی یادگیریت رو هدفمندتر جلو ببری.
📚 بیش از ۹۰ ساعت آموزش تخصصی
💼 آموزشهای شغلمحور
🧭 مسیر یادگیری مشخص و منسجم
👥 منتورینگ تخصصی
💳 امکان پرداخت اقساطی
🔥 خبر خوب اینکه الان میتونی این مسیر رو با ۳۰٪ تخفیف شروع کنی.
📈 اگر تحلیل داده یکی از مهارتهاییه که همیشه میخواستی یاد بگیری، وقتشه علاقهات رو به یک مهارت واقعی تبدیل کنی و اولین قدم رو برداری.
🎯 دریافت تخفیف و شروع مسیر:
https://l.hamrah.academy/1es
⭐️ @Hamrah_Academy | آکادمی همراه اول
📊 توکن ارزان همیشه به معنای مدل اقتصادی نیست
این تصور که قیمت پایین هر توکن بهمعنای بهصرفهتر بودن مدل است، لزوماً درست نیست. در واقع، فرمول اصلی هزینه تابعی از «قیمت توکن» ضربدر «تعداد کل توکنهای مصرفی تا پایان کار» است.
مدلهایی با توکن ارزان، اگر برای رسیدن به پاسخ نهایی به جستجوی طولانیتر یا پردازش کانتکست (Context) بزرگتر نیاز داشته باشند، در نهایت هزینه بیشتری به شما تحمیل میکنند. در سیستمهای مبتنی بر Agent، این موضوع حیاتیتر است؛ چرا که یک خطای کوچک در مراحل اولیه Retrieval میتواند هزینهی تمام مراحل بعدی را به شدت افزایش دهد.
بر اساس تحلیل AlphaSense، بهینهسازی پایپلاین Retrieval حتی بدون تغییر مدل، میتواند هزینهها را تا ۳ برابر کاهش دهد. در دنیای هوش مصنوعی، اقتصاد پروژه بیش از آنکه به تعرفه API وابسته باشد، به مهندسی دقیق Retrieval، Routing و Evaluation بستگی دارد.
مهمترین مدلها از نظر نسبت کیفیت به هزینه:
* GPT-5.6 Sol: بالاترین کیفیت پاسخ.
* Opus 4.8: کیفیت بالا با هزینه متوسط.
* Sonnet 5: عملکرد بهینه با هزینه بسیار کم.
* Gemma-4-31B: اقتصادیترین گزینه متنباز.
این تصور که قیمت پایین هر توکن بهمعنای بهصرفهتر بودن مدل است، لزوماً درست نیست. در واقع، فرمول اصلی هزینه تابعی از «قیمت توکن» ضربدر «تعداد کل توکنهای مصرفی تا پایان کار» است.
مدلهایی با توکن ارزان، اگر برای رسیدن به پاسخ نهایی به جستجوی طولانیتر یا پردازش کانتکست (Context) بزرگتر نیاز داشته باشند، در نهایت هزینه بیشتری به شما تحمیل میکنند. در سیستمهای مبتنی بر Agent، این موضوع حیاتیتر است؛ چرا که یک خطای کوچک در مراحل اولیه Retrieval میتواند هزینهی تمام مراحل بعدی را به شدت افزایش دهد.
بر اساس تحلیل AlphaSense، بهینهسازی پایپلاین Retrieval حتی بدون تغییر مدل، میتواند هزینهها را تا ۳ برابر کاهش دهد. در دنیای هوش مصنوعی، اقتصاد پروژه بیش از آنکه به تعرفه API وابسته باشد، به مهندسی دقیق Retrieval، Routing و Evaluation بستگی دارد.
مهمترین مدلها از نظر نسبت کیفیت به هزینه:
* GPT-5.6 Sol: بالاترین کیفیت پاسخ.
* Opus 4.8: کیفیت بالا با هزینه متوسط.
* Sonnet 5: عملکرد بهینه با هزینه بسیار کم.
* Gemma-4-31B: اقتصادیترین گزینه متنباز.
📉 چالش واقعی مدلهای هوش مصنوعی در تحلیل اسناد طولانی
بیشتر بنچمارکهای فعلی استخراج داده، مدلها را روی اسناد کوتاه ارزیابی میکنند و نمرات درخشانی میگیرند. اما در دنیای واقعی و اسناد طولانی، ورق برمیگردد.
بنچمارک جدید ExtractBench از LlamaIndex با بررسی نزدیک به ۵۰۰۰ صفحه سند سازمانی، نتایج قابلتاملی را منتشر کرده است:
• در اسناد بالای ۵۰ صفحه، میزان Recall مدلهای VLM تجاری به زیر ۳۵ درصد میرسد؛ یعنی مدل صرفاً صفحات ابتدایی را پردازش کرده و بقیه سند را نادیده میگیرد.
• قیمت بالاتر لزوماً به معنای دقت بیشتر نیست. در تستها، سیستمهای اقتصادیتر عملکردی بهمراتب دقیقتر از مدلهای گرانقیمت ارائه دادند.
• ایجنتهای کدنویسی فعلی هنوز در درک اسناد اسکنشده یا دستنویس با چالشهای جدی مواجه هستند.
اگر در پروژههای RAG یا سیستمهای تحلیل اسناد فعالیت میکنید، بررسی این بنچمارک برای درک محدودیتهای فعلی مدلهای بزرگ ضروری است. پیشنهاد میکنیم دیتاسِت و نتایج دقیق این تحقیق را در گیتهاب بررسی کنید.
بیشتر بنچمارکهای فعلی استخراج داده، مدلها را روی اسناد کوتاه ارزیابی میکنند و نمرات درخشانی میگیرند. اما در دنیای واقعی و اسناد طولانی، ورق برمیگردد.
بنچمارک جدید ExtractBench از LlamaIndex با بررسی نزدیک به ۵۰۰۰ صفحه سند سازمانی، نتایج قابلتاملی را منتشر کرده است:
• در اسناد بالای ۵۰ صفحه، میزان Recall مدلهای VLM تجاری به زیر ۳۵ درصد میرسد؛ یعنی مدل صرفاً صفحات ابتدایی را پردازش کرده و بقیه سند را نادیده میگیرد.
• قیمت بالاتر لزوماً به معنای دقت بیشتر نیست. در تستها، سیستمهای اقتصادیتر عملکردی بهمراتب دقیقتر از مدلهای گرانقیمت ارائه دادند.
• ایجنتهای کدنویسی فعلی هنوز در درک اسناد اسکنشده یا دستنویس با چالشهای جدی مواجه هستند.
اگر در پروژههای RAG یا سیستمهای تحلیل اسناد فعالیت میکنید، بررسی این بنچمارک برای درک محدودیتهای فعلی مدلهای بزرگ ضروری است. پیشنهاد میکنیم دیتاسِت و نتایج دقیق این تحقیق را در گیتهاب بررسی کنید.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی#ExtractBench #LlamaIndex
📩 ارتباط با ما
🚀 جهش بزرگ Mistral در مدل OCR نسخه 4.1
کمپانی Mistral بهتازگی مدل پردازش اسناد خود را به نسخه 4.1 ارتقا داده است. تمرکز اصلی این بهروزرسانی بر بهبود تحلیل صفحات شلوغ و پیچیده، شامل جداول فنی، نمودارها و اسناد چندستونه است.
این مدل اکنون مرزهای عناصر صفحه را با دقت بسیار بیشتری تشخیص میدهد و برخلاف نسخههای قبلی، متنها و تصاویر را در هم نمیآمیزد. از قابلیتهای کلیدی این نسخه میتوان به موارد زیر اشاره کرد:
• تفکیک دقیق بلوکهای متنی و تصاویر در صفحات متراکم
• حفظ ساختار اصلی اسناد در زمان استخراج دادههای چندستونه
• شناسایی هوشمندانه یادداشتها و جداول فنی پیچیده
• عملکرد بهینه در تحلیل اسناد تاریخی و گزارشهای مهندسی
اگر از API مدلهای Mistral استفاده میکنید، سیستم بهطور خودکار از طریق نام مستعار
کمپانی Mistral بهتازگی مدل پردازش اسناد خود را به نسخه 4.1 ارتقا داده است. تمرکز اصلی این بهروزرسانی بر بهبود تحلیل صفحات شلوغ و پیچیده، شامل جداول فنی، نمودارها و اسناد چندستونه است.
این مدل اکنون مرزهای عناصر صفحه را با دقت بسیار بیشتری تشخیص میدهد و برخلاف نسخههای قبلی، متنها و تصاویر را در هم نمیآمیزد. از قابلیتهای کلیدی این نسخه میتوان به موارد زیر اشاره کرد:
• تفکیک دقیق بلوکهای متنی و تصاویر در صفحات متراکم
• حفظ ساختار اصلی اسناد در زمان استخراج دادههای چندستونه
• شناسایی هوشمندانه یادداشتها و جداول فنی پیچیده
• عملکرد بهینه در تحلیل اسناد تاریخی و گزارشهای مهندسی
اگر از API مدلهای Mistral استفاده میکنید، سیستم بهطور خودکار از طریق نام مستعار
mistral-ocr-latest به این نسخه جدید مهاجرت کرده است. برای تست و تجربه مستقیم خروجی این مدل میتوانید به Mistral OCR Playground مراجعه کنید.🌐 مشاهده مطلب در سایت📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی#Mistral_OCR #Document_Parsing
📩 ارتباط با ما