این بنچمارک قشنگ دست مدلهایی که موقع بلد نبودن، با اعتمادبهنفس دروغ میگن رو رو میکنه... امتیاز منفی توی این چارت یعنی مدل بیشتر از اینکه حرف درست بزنه، توهم زده و اطلاعات غلط داده.
خانواده Claude 5 فعلاً قابلاعتمادترین خروجیها رو دارن.
اون ته چارت هم وضعیت DeepSeek اصلاً جالب نیست... عملاً داره بیشتر از اطلاعات درست، چرتوپرت تحویل میده.
https://arxiv.org/abs/2511.13029
🛠 Join @LLMEngineers Community
خانواده Claude 5 فعلاً قابلاعتمادترین خروجیها رو دارن.
اون ته چارت هم وضعیت DeepSeek اصلاً جالب نیست... عملاً داره بیشتر از اطلاعات درست، چرتوپرت تحویل میده.
https://arxiv.org/abs/2511.13029
🛠 Join @LLMEngineers Community
👍5❤3🔥2
یه پرامپت ساده و ۱۰ تا پلتفرم (وبسایت) AI نتونستن انجامش بدن از جمله کلاد، ChatGPT, جمنای، Qwen ، گروک، Kimiو…
و تنها دو جا جواب درستو گرفتم:
Hermes Agent 100/100
Manus Agent 60/100
اینجاعه ک فرق ایجنت با دسترسی به ابزار های مفید با یه چت بات معمولی مشخص میشه.
🛠 Join @LLMEngineers Community
و تنها دو جا جواب درستو گرفتم:
Hermes Agent 100/100
Manus Agent 60/100
اینجاعه ک فرق ایجنت با دسترسی به ابزار های مفید با یه چت بات معمولی مشخص میشه.
🛠 Join @LLMEngineers Community
👍6👌2❤1
تقاضای همکاری برای بهبود هوش مصنوعی فارسی زبان و آزاد:
تیم ما در حال کار روی پروژه های مختلفی برای بهبود عملکرد هوش مصنوعی فارسی زبان و آزاد هست و برای اینکار نیاز به همکاری شما دوست عزیز داریم! 🤗
همه ی ما به صورت رایگان کار میکنیم و این پروژه ها برای افرادی که میخوان وقت و تلاششون رو به صورت داوطلبانه در اختیار زبان فارسی بذارن ایده آل هست👨🍳
هدف: یادگیری و جلو بردن هوش مصنوعی فارسی زبان بدون هیچ قید و بندی💪
روش همکاری: ما پلتفرم های مخصوصی رو برای لیبل زدن یا تصحیح دیتا درست کردیم و فقط از شما میخوایم تو این پلتفرم ها تا جای ممکن همکاری کنید. ویدیو های آموزشی هم داریم.🔥
در صورت علاقه مندی به @Reza2kn پیام بدین 🙏
تیم ما در حال کار روی پروژه های مختلفی برای بهبود عملکرد هوش مصنوعی فارسی زبان و آزاد هست و برای اینکار نیاز به همکاری شما دوست عزیز داریم! 🤗
همه ی ما به صورت رایگان کار میکنیم و این پروژه ها برای افرادی که میخوان وقت و تلاششون رو به صورت داوطلبانه در اختیار زبان فارسی بذارن ایده آل هست👨🍳
هدف: یادگیری و جلو بردن هوش مصنوعی فارسی زبان بدون هیچ قید و بندی💪
روش همکاری: ما پلتفرم های مخصوصی رو برای لیبل زدن یا تصحیح دیتا درست کردیم و فقط از شما میخوایم تو این پلتفرم ها تا جای ممکن همکاری کنید. ویدیو های آموزشی هم داریم.🔥
در صورت علاقه مندی به @Reza2kn پیام بدین 🙏
🔥6❤4👎4
مسیر Backend به سمت Applied AI و Agent Engineering منطقیترین راه ورود به هوش مصنوعی تو سال ۲۰۲۶ هست. اگه دنبال فریلنسری ارزی یا جابهای جدی هستی، باید بدونی که آگهیها دیگه دنبال «محقق هوش مصنوعی» نیستن؛ اونا کسی رو میخوان که پایتون، FastAPI، دیتابیسهای رابطهای مثل PostgreSQL و Docker رو بلد باشه و بتونه اینا رو به LLMها و ابزارهایی مثل LangGraph وصل کنه.
واقعیت بازار اینه که بیزنسها دنبال خریدن «عامل هوش مصنوعی» یا Agent نیستن؛ اونا میخوان یه مشکل واقعیشون حل بشه. مثلاً کاهش بار تیکتهای پشتیبانی یا استخراج خودکار دیتا از هزاران فایل پیدیاف. پروژههای با بودجه بالا (مثلاً ۲۵۰۰ دلار به بالا) صریحاً مینویسن که دنبال سیستمهای آماده برای محیط عملیاتی (Production-ready) هستن، نه چتباتهای سادهای که تو توتوریالها ساخته میشه.
برای اینکه تو این مسیر شلوغ و پر از هایپ (Hype) گم نشی و بدونی دقیقاً چه مهارتی رو کی و چطور یاد بگیری، دارم یه پلتفرم به اسم AI Engineering Atlas رو میسازم. اطلس یه نقشهی راهنمای دقیقه که مفاهیم، پروژههای واقعی و مهارتهایی که تو دنیای واقعی لازم داری رو بهت نشون میده تا با شفافیت کامل یاد بگیری.
Coming soon...
اگه بخوام مسیر رو برات ساده کنم، ترتیب یادگیری باید اینجوری باشه:
۱. Python:
تسلط روی زبان، نه فقط سینتکس. باید بتونی کد تمیز بنویسی.
۲. Backend:
یادگیری FastAPI و کار با PostgreSQL. دیتابیس قلب هر سیستم هوشمندی هست. باید بتونی احراز هویت و تستنویسی رو هندل کنی.
۳. LLM Engineering:
کار با API مدلهای بزرگ (مثل OpenAI یا Claude). یادگیری خروجیهای ساختاریافته (Structured Output) و اینکه چطور مدل بتونه ابزارهای مختلف رو صدا بزنه (Tool Calling).
۴. RAG:
تبدیل متن به بردار (Embeddings) و ذخیره تو دیتابیسهای برداری برای اینکه مدل بتونه بر اساس اسناد شرکت جواب بده.
۵. Agents:
مدیریت وضعیت چت و چرخههای تصمیمگیری پیچیده. جایی که مدل تصمیم میگیره کدوم مرحله رو اول انجام بده و کجا منتظر تایید آدم بمونه.
⚠️ فریب پروژههای دمویی رو نخور
توی مارکت فریلنسری رقابت شدیده. چیزی که تو رو متمایز میکنه، داشتن ۳ تا پروژه عمیق تو پورتفولیو هست:
- یه سیستم اتوماسیون که ایمیل میگیره و تو CRM ثبت میکنه.
- یه دستیار جستجوی اسناد سازمانی (RAG) که منبع دقیق جواب رو نشون میده.
- یه بکاندر مستحکم که نشون بده تو فقط کد AI کپی نمیکنی، بلکه مهندس نرمافزاری.
فعلاً وقتت رو روی ریاضیات سنگین یادگیری ماشین، آموزش مدلها از صفر (Training) یا مقالات پژوهشی پیچیده تلف نکن. اینها برای شروع کار فریلنسری و رسیدن به درآمد اولیه لازم نیستن. تمرکزت رو بذار روی حل مسئله. بیزنسها بابت حل شدن دردسرهاشون پول میدن، نه بابت اینکه چقدر از معماری ترنسفورمر سر در میاری.
منتظر AI Engineering Atlas باش؛ قراره دقیقاً همین مسیر رو برات مرتب کنه.
🛠 Join @LLMEngineers Community
واقعیت بازار اینه که بیزنسها دنبال خریدن «عامل هوش مصنوعی» یا Agent نیستن؛ اونا میخوان یه مشکل واقعیشون حل بشه. مثلاً کاهش بار تیکتهای پشتیبانی یا استخراج خودکار دیتا از هزاران فایل پیدیاف. پروژههای با بودجه بالا (مثلاً ۲۵۰۰ دلار به بالا) صریحاً مینویسن که دنبال سیستمهای آماده برای محیط عملیاتی (Production-ready) هستن، نه چتباتهای سادهای که تو توتوریالها ساخته میشه.
برای اینکه تو این مسیر شلوغ و پر از هایپ (Hype) گم نشی و بدونی دقیقاً چه مهارتی رو کی و چطور یاد بگیری، دارم یه پلتفرم به اسم AI Engineering Atlas رو میسازم. اطلس یه نقشهی راهنمای دقیقه که مفاهیم، پروژههای واقعی و مهارتهایی که تو دنیای واقعی لازم داری رو بهت نشون میده تا با شفافیت کامل یاد بگیری.
Coming soon...
اگه بخوام مسیر رو برات ساده کنم، ترتیب یادگیری باید اینجوری باشه:
۱. Python:
تسلط روی زبان، نه فقط سینتکس. باید بتونی کد تمیز بنویسی.
۲. Backend:
یادگیری FastAPI و کار با PostgreSQL. دیتابیس قلب هر سیستم هوشمندی هست. باید بتونی احراز هویت و تستنویسی رو هندل کنی.
۳. LLM Engineering:
کار با API مدلهای بزرگ (مثل OpenAI یا Claude). یادگیری خروجیهای ساختاریافته (Structured Output) و اینکه چطور مدل بتونه ابزارهای مختلف رو صدا بزنه (Tool Calling).
۴. RAG:
تبدیل متن به بردار (Embeddings) و ذخیره تو دیتابیسهای برداری برای اینکه مدل بتونه بر اساس اسناد شرکت جواب بده.
۵. Agents:
مدیریت وضعیت چت و چرخههای تصمیمگیری پیچیده. جایی که مدل تصمیم میگیره کدوم مرحله رو اول انجام بده و کجا منتظر تایید آدم بمونه.
⚠️ فریب پروژههای دمویی رو نخور
توی مارکت فریلنسری رقابت شدیده. چیزی که تو رو متمایز میکنه، داشتن ۳ تا پروژه عمیق تو پورتفولیو هست:
- یه سیستم اتوماسیون که ایمیل میگیره و تو CRM ثبت میکنه.
- یه دستیار جستجوی اسناد سازمانی (RAG) که منبع دقیق جواب رو نشون میده.
- یه بکاندر مستحکم که نشون بده تو فقط کد AI کپی نمیکنی، بلکه مهندس نرمافزاری.
فعلاً وقتت رو روی ریاضیات سنگین یادگیری ماشین، آموزش مدلها از صفر (Training) یا مقالات پژوهشی پیچیده تلف نکن. اینها برای شروع کار فریلنسری و رسیدن به درآمد اولیه لازم نیستن. تمرکزت رو بذار روی حل مسئله. بیزنسها بابت حل شدن دردسرهاشون پول میدن، نه بابت اینکه چقدر از معماری ترنسفورمر سر در میاری.
منتظر AI Engineering Atlas باش؛ قراره دقیقاً همین مسیر رو برات مرتب کنه.
🛠 Join @LLMEngineers Community
❤5👍3🔥2
با 10 هزار دلار میشه دسترسی نامحدود و همیشه رایگان به DeepSeek V4 Flash داشت.
پیش بینی: در آینده با کوچیکتر شدن و قویتر شدن مدل های لوکال این مبلغ کمتر و کمتر خواهد شد…
🛠 Join @LLMEngineers Community
پیش بینی: در آینده با کوچیکتر شدن و قویتر شدن مدل های لوکال این مبلغ کمتر و کمتر خواهد شد…
🛠 Join @LLMEngineers Community
👍6❤1
AI Engineers
Game on …
متا وزنهای Muse Glimmer رو بهصورت آزاد منتشر کرد... یه مدل ۳۰ میلیاردی متراکم (Dense) که برخلاف لاما، با لایسنس Apache 2.0 اومده. یعنی محدودیت استفاده تجاری نداره و کاملاً بازه.
این مدل رو برای چت کردن ساده نساختن، هدف اصلیش «ایجنتها» هستن. یعنی مدل رو طوری آموزش دادن که بتونه برای یه کار چندمرحلهای برنامهریزی کنه، از ابزارهای مختلف استفاده کنه و اگه جایی مسیر رو اشتباه رفت، خودش رو اصلاح کنه. در واقع این مدل رو از دل مدل قویترشون یعنی Muse Spark بیرون کشیدن (Distill کردن) تا رفتارهای هوشمندانه رو توی سایز کوچکتر داشته باشه.
از نظر فنی، معماری مدل ترکیبی از متن و تصویره. یه بخش ۲۸ میلیاردی برای متن و یه بخش ۱.۸ میلیاردی هم برای تحلیل تصویر (Perception Encoder) داره. این یعنی میتونه اسکرینشات، نمودار یا فایلهای PDF رو مستقیم بررسی کنه. ظرفیت حافظهاش هم حدود ۱۳۱ هزار توکن هست که برای خوندن مستندات طولانی یا لاگهای حجیم سیستم عالیه.
برای ما که دنبال اجرای مدل روی سیستم خودمون هستیم، متا یه حرکت خوب زده: بهینهسازی مصرف رم گرافیک. اگه از نسخههای فشردهشده (۴ بیتی) استفاده کنی، بخش زبانی مدل زیر ۲۰ گیگابایت فضا میگیره. یعنی روی یه کارت RTX 3090 یا 4090 که ۲۴ گیگ رم دارن، راحت اجرا میشه و هنوز فضا برای پردازش تصویر و حافظه موقت متن باقی میمونه. جالب اینجاست که طبق تستهای خودشون، این فشردهسازی فقط حدود ۱ درصد روی دقت مدل اثر منفی گذاشته.
یه تکنیک باحال به اسم DFlash هم اعمال کردن که یه جور حدسزدن کلمات بعدی توسط یه مدل خیلی کوچکتره (Speculative Decoding). اینجوری سرعت خروجی گرفتن روی گرافیکهای جدید مثل 5090 تا ۳ برابر بیشتر میشه؛ روی مکهای سری M4 و M5 هم بین ۱.۵ تا ۱.۸ برابر سرعت رو بالا میبره.
توی بنچمارکها، Glimmer برای کارهای ایجنتی و منطقی (مثل MCP Atlas یا GAIA2) از مدلهای همردهاش مثل Gemma 4 یا Qwen 3.6 27B بهتر عمل کرده. اما یه نکته وجود داره: اگه فقط برای «کد زدن» خالص میخوایدش، Qwen هنوز توی تستهای تخصصی برنامهنویسی امتیازهای بالاتری داره. در واقع Glimmer یه مدل «همهکاره» برای ایجنتهاست، نه فقط یه ابزار کدنویسی.
خبر مهمتر اینه که مدل اصلی و غولپیکرشون، یعنی Muse Spark 1.2 با کانتکست ۱ میلیونی هم قراره بهزودی وزنهاش باز بشه.
فعلاً Glimmer برای پروژههای محلی مثل Hermes یا دستیارهای شخصی که قراره روی سیستم خودمون بمونن، بهترین گزینه ۳۰ میلیاردی فعلیه.
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
https://huggingface.co/meta-models/Muse-Glimmer-30B
https://huggingface.co/blog/muse-glimmer
🛠 Join @LLMEngineers Community
این مدل رو برای چت کردن ساده نساختن، هدف اصلیش «ایجنتها» هستن. یعنی مدل رو طوری آموزش دادن که بتونه برای یه کار چندمرحلهای برنامهریزی کنه، از ابزارهای مختلف استفاده کنه و اگه جایی مسیر رو اشتباه رفت، خودش رو اصلاح کنه. در واقع این مدل رو از دل مدل قویترشون یعنی Muse Spark بیرون کشیدن (Distill کردن) تا رفتارهای هوشمندانه رو توی سایز کوچکتر داشته باشه.
از نظر فنی، معماری مدل ترکیبی از متن و تصویره. یه بخش ۲۸ میلیاردی برای متن و یه بخش ۱.۸ میلیاردی هم برای تحلیل تصویر (Perception Encoder) داره. این یعنی میتونه اسکرینشات، نمودار یا فایلهای PDF رو مستقیم بررسی کنه. ظرفیت حافظهاش هم حدود ۱۳۱ هزار توکن هست که برای خوندن مستندات طولانی یا لاگهای حجیم سیستم عالیه.
برای ما که دنبال اجرای مدل روی سیستم خودمون هستیم، متا یه حرکت خوب زده: بهینهسازی مصرف رم گرافیک. اگه از نسخههای فشردهشده (۴ بیتی) استفاده کنی، بخش زبانی مدل زیر ۲۰ گیگابایت فضا میگیره. یعنی روی یه کارت RTX 3090 یا 4090 که ۲۴ گیگ رم دارن، راحت اجرا میشه و هنوز فضا برای پردازش تصویر و حافظه موقت متن باقی میمونه. جالب اینجاست که طبق تستهای خودشون، این فشردهسازی فقط حدود ۱ درصد روی دقت مدل اثر منفی گذاشته.
یه تکنیک باحال به اسم DFlash هم اعمال کردن که یه جور حدسزدن کلمات بعدی توسط یه مدل خیلی کوچکتره (Speculative Decoding). اینجوری سرعت خروجی گرفتن روی گرافیکهای جدید مثل 5090 تا ۳ برابر بیشتر میشه؛ روی مکهای سری M4 و M5 هم بین ۱.۵ تا ۱.۸ برابر سرعت رو بالا میبره.
توی بنچمارکها، Glimmer برای کارهای ایجنتی و منطقی (مثل MCP Atlas یا GAIA2) از مدلهای همردهاش مثل Gemma 4 یا Qwen 3.6 27B بهتر عمل کرده. اما یه نکته وجود داره: اگه فقط برای «کد زدن» خالص میخوایدش، Qwen هنوز توی تستهای تخصصی برنامهنویسی امتیازهای بالاتری داره. در واقع Glimmer یه مدل «همهکاره» برای ایجنتهاست، نه فقط یه ابزار کدنویسی.
خبر مهمتر اینه که مدل اصلی و غولپیکرشون، یعنی Muse Spark 1.2 با کانتکست ۱ میلیونی هم قراره بهزودی وزنهاش باز بشه.
فعلاً Glimmer برای پروژههای محلی مثل Hermes یا دستیارهای شخصی که قراره روی سیستم خودمون بمونن، بهترین گزینه ۳۰ میلیاردی فعلیه.
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
https://huggingface.co/meta-models/Muse-Glimmer-30B
https://huggingface.co/blog/muse-glimmer
🛠 Join @LLMEngineers Community
🔥6❤2
This media is not supported in your browser
VIEW IN TELEGRAM
سایت paperswithcode.co یه مرجع برای پیدا کردن بهترین مدلهای هوش مصنوعی توی هر حوزهست. برای هر تسکی، از بینایی ماشین تا پردازش متن، یه جدول امتیازات داره که نشون میده کدوم مدل الان رکوردداره یا اصطلاحاً SOTA محسوب میشه.
توی ویدیو قابلیت جدید Ask رو میبینید؛ یه دستیار پژوهشی که بین هزاران مقاله میگرده و جواب سوالای فنی رو با منبع میده. مثلاً میتونه معماری دو تا مدل رو با هم مقایسه کنه و مستقیم بگه کجای مقاله در موردش حرف زده شده.
مدیریت سایت با تیم Hugging Face هست و برای استخراج دادهها از ۱۰۸ هزار مقاله، از ایجنتهای هوش مصنوعی استفاده کردن. هر مقاله هم لینک مستقیم به کد گیتهاب و دیتاسِت مربوطهش رو داره. API عمومی هم باز کردن که میشه دیتای بنچمارکها رو راحت کشید.
🛠 Join @LLMEngineers Community
توی ویدیو قابلیت جدید Ask رو میبینید؛ یه دستیار پژوهشی که بین هزاران مقاله میگرده و جواب سوالای فنی رو با منبع میده. مثلاً میتونه معماری دو تا مدل رو با هم مقایسه کنه و مستقیم بگه کجای مقاله در موردش حرف زده شده.
مدیریت سایت با تیم Hugging Face هست و برای استخراج دادهها از ۱۰۸ هزار مقاله، از ایجنتهای هوش مصنوعی استفاده کردن. هر مقاله هم لینک مستقیم به کد گیتهاب و دیتاسِت مربوطهش رو داره. API عمومی هم باز کردن که میشه دیتای بنچمارکها رو راحت کشید.
🛠 Join @LLMEngineers Community
🔥8❤3
شرکت Unsloth اپ دسکتاپش رو منتشر کرد؛ اولین اپلیکیشنی که هم اجرا و هم فاینتیون مدلها رو کامل لوکال روی سیستم خودت میاره. متنبازه و روی مک، ویندوز و لینوکس کار میکنه.
فایدهش برای کساییه که نمیخوان مدلهاشون به جای دیگهای بره. از MLX و GGUF بگیر تا مدلهای دیفیوژن تصویر/ویدیو و صدا رو پشتیبانی میکنه، و از همه جالبتر اینکه میشه Claude Code و Codex رو به LLMهای محلی وصل کرد. علاوه بر اون یه API سازگار با OpenAI هم داره که مثل یه سرور شخصی، مدلهای محلی و ابری رو در دسترس قرار میده — حتی استقرار از راه دور و دسترسی از هر جا هم براش در نظر گرفتن.
طبق ادعای خودشون، فراخوانی ابزارها (tool calls) ۵۰٪ دقیقتر و خودترمیمشوندهست با اجرای کد توی محیط ایزوله (sandbox)، آموزش مدل هم ۲ برابر سریعتر با ۷۰٪ حافظه VRAM کمتر انجام میشه. جستجوی وب خصوصی، deep research، RAG و MCP هم داخلش هست.
اگه دنبال یه راهحل متنباز برای اجرا و فاینتیون مدلهای لوکال بودی، این یه گزینه جدیه. دانلود و مستنداتش از unsloth.ai و گیتهاب در دسترسه:
- https://github.com/unslothai/unsloth
- https://unsloth.ai/docs/desktop
🛠 Join @LLMEngineers Community
فایدهش برای کساییه که نمیخوان مدلهاشون به جای دیگهای بره. از MLX و GGUF بگیر تا مدلهای دیفیوژن تصویر/ویدیو و صدا رو پشتیبانی میکنه، و از همه جالبتر اینکه میشه Claude Code و Codex رو به LLMهای محلی وصل کرد. علاوه بر اون یه API سازگار با OpenAI هم داره که مثل یه سرور شخصی، مدلهای محلی و ابری رو در دسترس قرار میده — حتی استقرار از راه دور و دسترسی از هر جا هم براش در نظر گرفتن.
طبق ادعای خودشون، فراخوانی ابزارها (tool calls) ۵۰٪ دقیقتر و خودترمیمشوندهست با اجرای کد توی محیط ایزوله (sandbox)، آموزش مدل هم ۲ برابر سریعتر با ۷۰٪ حافظه VRAM کمتر انجام میشه. جستجوی وب خصوصی، deep research، RAG و MCP هم داخلش هست.
اگه دنبال یه راهحل متنباز برای اجرا و فاینتیون مدلهای لوکال بودی، این یه گزینه جدیه. دانلود و مستنداتش از unsloth.ai و گیتهاب در دسترسه:
- https://github.com/unslothai/unsloth
- https://unsloth.ai/docs/desktop
🛠 Join @LLMEngineers Community
👍4❤3🔥2
بالاخره جامعهٔ ساخت هوش مصنوعی فارسی متنباز رو عمومی کردیم.
اینجا قراره روی مدلهای زیر کار کنیم:
شنوا (تشخیص گفتار)
گویا (تبدیل متن به گفتار)
بینا (بینایی و OCR)
دانا (مدل زبانی)
دادگان (دیتاستها)
هر کی دوست داره بیاد کمک کنه یا ایده بده، خوشحال میشیم.
لینک گروه:
https://t.me/PersianML
هاگینگفیس:
https://huggingface.co/PersianML
اینجا قراره روی مدلهای زیر کار کنیم:
شنوا (تشخیص گفتار)
گویا (تبدیل متن به گفتار)
بینا (بینایی و OCR)
دانا (مدل زبانی)
دادگان (دیتاستها)
هر کی دوست داره بیاد کمک کنه یا ایده بده، خوشحال میشیم.
لینک گروه:
https://t.me/PersianML
هاگینگفیس:
https://huggingface.co/PersianML
❤20👌6🎉4
نسخه جدید مدل DeepSeek-V4-Pro-0813 منتشر شد!
نسخه رسمی Production مدل پرچمدار DeepSeek (جایگزین Preview آوریل).
مشخصات اصلی: • MoE با ~۱.۶T پارامتر (۴۹B فعال) • کانتکس ۱M توکن • تمرکز قوی روی Agentic Coding و Tool Use • وزنهای MIT روی Hugging Face
در مقایسه با Fable 5 ، کلاد حدود ۵٪ بهتره توی بنچمارکهای agentic، اما قیمتش تقریباً ۴۵ برابر بالاتره ($۱۰/$۵۰ در مقابل $۰.۴۳/$۰.۸۷).
دیپ سیک با قیمت خیلی پایینتر و وزنهای باز، گزینه جذابتری برای production و agentهای واقعیه.
اگر تست کردید بگید.
🛠 Join @LLMEngineers Community
نسخه رسمی Production مدل پرچمدار DeepSeek (جایگزین Preview آوریل).
مشخصات اصلی: • MoE با ~۱.۶T پارامتر (۴۹B فعال) • کانتکس ۱M توکن • تمرکز قوی روی Agentic Coding و Tool Use • وزنهای MIT روی Hugging Face
در مقایسه با Fable 5 ، کلاد حدود ۵٪ بهتره توی بنچمارکهای agentic، اما قیمتش تقریباً ۴۵ برابر بالاتره ($۱۰/$۵۰ در مقابل $۰.۴۳/$۰.۸۷).
دیپ سیک با قیمت خیلی پایینتر و وزنهای باز، گزینه جذابتری برای production و agentهای واقعیه.
اگر تست کردید بگید.
🛠 Join @LLMEngineers Community
👌4❤3👍2
تیم EXO Labs پلتفرم local.ai را در فاز دسترسی زودهنگام راهاندازی کرده است؛ پلتفرمی تخصصی برای اندازهگیری عملکرد واقعی مدلهای هوش مصنوعی روی سختافزار محلی.
چه چیزی ارائه میده؟
بنچمارکهای مستقل روی سختافزار واقعی (Mac، RTX، DGX و…)
• معیارهای دقیق: سرعت، هزینه، مصرف انرژی و قابلیتهای مدل
مرتبط با پروژه متنباز exo برای کلاستر کردن دستگاههای محلی و اجرای مدلهای بزرگ بهصورت خصوصی
Local.ai
چه چیزی ارائه میده؟
بنچمارکهای مستقل روی سختافزار واقعی (Mac، RTX، DGX و…)
• معیارهای دقیق: سرعت، هزینه، مصرف انرژی و قابلیتهای مدل
مرتبط با پروژه متنباز exo برای کلاستر کردن دستگاههای محلی و اجرای مدلهای بزرگ بهصورت خصوصی
Local.ai
❤1
مشکل اصلی خیلی از این ابزارای «کاهش توکن» اینه که کم شدن توکن توی یه پاسخ ابزار، لزوماً معنیش این نیست که کل ایجنت ارزونتر یا سبکتر کار میکنه. ایجنت یه حلقهی بازخوردی چندمرحلهایه؛ اگه اطلاعات مهم رو حذف کنی، ممکنه مجبور بشه دوباره جستوجو کنه، فایل رو بخونه، ابهام رو رفع کنه و حتی پچ یا تست رو تکرار کنه. یعنی یه جورایی مثل اینه که حین بازی، نصف نقشهی مهم رو پاک کنی و بعد مجبور شی دوباره بری همونجا رو کشف کنی.
مستقیمترین مدرک یه مقالهست با عنوان *Token Reduction Is Not Cost Reduction* که روی ۲۹۰۸ اجرای صورتحسابشده از سمت ارائهدهنده روی Claude Code آزمایش کرده. نتیجه؟ خروجی خام ابزارها ۳۸.۴٪ کمتر شده، ولی هزینهی واقعی ۶.۸٪ بیشتر شده. تو یه آزمایش دیگه، موفقیت ویرایش کد از ۲۷ مورد اومده پایین به ۱۵ تا؛ چون فشردهسازی دقیقاً همون شواهد دقیق و نقطههای ویرایش لفظبهلفظ رو خراب کرده بود که برای اعمال پچ لازم بود.
علتش کاملاً قابلفهمه: فشردن ۱۰ هزار توکن به ۲ هزار فقط وقتی صرفهجویی حساب میشه که همون ۲ هزار تا برای تصمیم بعدی کافی باشه. اگه نباشه، مسیر میشه «جستوجو ← خواندن ← استدلال ← تلاش مجدد» و هر مرحله ممکنه بافت قبلی رو دوباره به مدل بفرسته. ضمن اینکه تو همون مطالعه، حدود ۸۷٪ هزینهی بازسازیشده مربوط به ساخت و خواندن حافظهی سریع درخواست بوده، نه صرفاً خروجی ابزارها. یعنی بخش عمدهی صورتحساب، همون چیزاییه که مرتب دوباره خونده میشه، نه متن تازهی ابزار.
البته نتیجه این نیست که هر نوع فشردهسازی بده. پژوهشهای ACL و EMNLP نشون میدن فشردهسازی شدید و کور میتونه اطلاعات کلیدی رو حذف کنه و عملکرد کارهای پیچیده رو خراب کنه؛ ولی روشهای آگاه از پرسش و انتخاب محتوای مرتبط گاهی هم کیفیت رو بهتر میکنن و هم توکن کمتری میخورن. مسئله فقط مقدار اطلاعات نیست؛ اطلاعات نامرتبط و بدجایگذاریشده هم میتونه مدل رو گیج کنه.
نمونههای ابزارها هم همین تفاوت رو نشون میدن. RepoWise با وارد کردن بافت بیشتر و هوشمندانهتر تو هر مرحله، تعداد گامها و فراخوانی ابزارها رو کم کرده. CodeGraph تو بعضی مخزنها بافت باقیموندهی بیشتری نگه داشته، ولی کار کلی کمتری انجام داده. در مقابل، Caveman و بعضی حالتهای Ponytail نشون دادن که کوتاهتر کردن پاسخ میتونه تعداد توکن، هزینه یا زمان رو بیشتر کنه. RTK هم هشدار داده که خروجیهای کوتاهتر ممکنه نشانگر موفقیت، ساختار داده، شمارهی خط یا حتی معنای داده رو خراب کنن.
پس معیار درست «درصد توکن ذخیرهشده» نیست. باید هزینهی واقعی هر کار موفق رو سنجید: موفقیت کار، هزینهی صورتحسابشده، تعداد نوبتها، ترافیک حافظهی سریع، تلاش مجدد، جستوجوهای تکراری، فراخوانی ابزارها، زمان و سربار خود فشردهساز. نتیجهی عملی اینه: فشردهسازی باید انتخابی، آگاه از کار، قابلبازگشت و روی کل مسیر ارزیابی بشه. ابزاری که فقط «توکن کمتر» رو گزارش میکنه، هنوز ثابت نکرده که ایجنت رو ارزونتر یا کارآمدتر کرده.
🛠 Join @LLMEngineers Community
مستقیمترین مدرک یه مقالهست با عنوان *Token Reduction Is Not Cost Reduction* که روی ۲۹۰۸ اجرای صورتحسابشده از سمت ارائهدهنده روی Claude Code آزمایش کرده. نتیجه؟ خروجی خام ابزارها ۳۸.۴٪ کمتر شده، ولی هزینهی واقعی ۶.۸٪ بیشتر شده. تو یه آزمایش دیگه، موفقیت ویرایش کد از ۲۷ مورد اومده پایین به ۱۵ تا؛ چون فشردهسازی دقیقاً همون شواهد دقیق و نقطههای ویرایش لفظبهلفظ رو خراب کرده بود که برای اعمال پچ لازم بود.
علتش کاملاً قابلفهمه: فشردن ۱۰ هزار توکن به ۲ هزار فقط وقتی صرفهجویی حساب میشه که همون ۲ هزار تا برای تصمیم بعدی کافی باشه. اگه نباشه، مسیر میشه «جستوجو ← خواندن ← استدلال ← تلاش مجدد» و هر مرحله ممکنه بافت قبلی رو دوباره به مدل بفرسته. ضمن اینکه تو همون مطالعه، حدود ۸۷٪ هزینهی بازسازیشده مربوط به ساخت و خواندن حافظهی سریع درخواست بوده، نه صرفاً خروجی ابزارها. یعنی بخش عمدهی صورتحساب، همون چیزاییه که مرتب دوباره خونده میشه، نه متن تازهی ابزار.
البته نتیجه این نیست که هر نوع فشردهسازی بده. پژوهشهای ACL و EMNLP نشون میدن فشردهسازی شدید و کور میتونه اطلاعات کلیدی رو حذف کنه و عملکرد کارهای پیچیده رو خراب کنه؛ ولی روشهای آگاه از پرسش و انتخاب محتوای مرتبط گاهی هم کیفیت رو بهتر میکنن و هم توکن کمتری میخورن. مسئله فقط مقدار اطلاعات نیست؛ اطلاعات نامرتبط و بدجایگذاریشده هم میتونه مدل رو گیج کنه.
نمونههای ابزارها هم همین تفاوت رو نشون میدن. RepoWise با وارد کردن بافت بیشتر و هوشمندانهتر تو هر مرحله، تعداد گامها و فراخوانی ابزارها رو کم کرده. CodeGraph تو بعضی مخزنها بافت باقیموندهی بیشتری نگه داشته، ولی کار کلی کمتری انجام داده. در مقابل، Caveman و بعضی حالتهای Ponytail نشون دادن که کوتاهتر کردن پاسخ میتونه تعداد توکن، هزینه یا زمان رو بیشتر کنه. RTK هم هشدار داده که خروجیهای کوتاهتر ممکنه نشانگر موفقیت، ساختار داده، شمارهی خط یا حتی معنای داده رو خراب کنن.
پس معیار درست «درصد توکن ذخیرهشده» نیست. باید هزینهی واقعی هر کار موفق رو سنجید: موفقیت کار، هزینهی صورتحسابشده، تعداد نوبتها، ترافیک حافظهی سریع، تلاش مجدد، جستوجوهای تکراری، فراخوانی ابزارها، زمان و سربار خود فشردهساز. نتیجهی عملی اینه: فشردهسازی باید انتخابی، آگاه از کار، قابلبازگشت و روی کل مسیر ارزیابی بشه. ابزاری که فقط «توکن کمتر» رو گزارش میکنه، هنوز ثابت نکرده که ایجنت رو ارزونتر یا کارآمدتر کرده.
🛠 Join @LLMEngineers Community
👍8👌2❤1
دیروز تیم Qwen مدل Qwen3.8-27B رو منتشر کرد؛ یه مدل open-weight و multimodal که با فقط ۲۷B پارامتر در coding agent، computer use، browser task و کارهای حرفهای طولانی به سطح مدلهای خیلی بزرگتر رسیده.
گزارشهای اولیه میگن مدل قبل از جوابدادن، مسئله رو کاملتر داخل reasoning خودش میسازه؛ انگار یک build کامل رو درون trajectory اجرا میکنه و بعد خروجی نهایی رو میده. این باعث شده verbose thinking اینبار بیشتر شبیه مزیت باشه تا اتلاف توکن.
از نظر فنی هم تصویر، ویدیو، reasoning قابل تنظیم، context native تا ۲۶۲K و امکان گسترش تا حدود ۱M توکن رو داره.
اگر این روند ادامه پیدا کنه، agentهای جدی کمکم از مدلهای عظیم ابری جدا میشن و روی سختافزار محلی هم قابل اجرا میشن.
جهت حرکت کاملاً مشخصه: مدلهای agentic دارن کوچکتر، ارزانتر و عملیاتیتر میشن.
🛠 Join @LLMEngineers Community
گزارشهای اولیه میگن مدل قبل از جوابدادن، مسئله رو کاملتر داخل reasoning خودش میسازه؛ انگار یک build کامل رو درون trajectory اجرا میکنه و بعد خروجی نهایی رو میده. این باعث شده verbose thinking اینبار بیشتر شبیه مزیت باشه تا اتلاف توکن.
از نظر فنی هم تصویر، ویدیو، reasoning قابل تنظیم، context native تا ۲۶۲K و امکان گسترش تا حدود ۱M توکن رو داره.
اگر این روند ادامه پیدا کنه، agentهای جدی کمکم از مدلهای عظیم ابری جدا میشن و روی سختافزار محلی هم قابل اجرا میشن.
جهت حرکت کاملاً مشخصه: مدلهای agentic دارن کوچکتر، ارزانتر و عملیاتیتر میشن.
🛠 Join @LLMEngineers Community
👍2🔥1