هوش مصنوعی و علم داده به فارسی
6.06K subscribers
1.66K photos
436 videos
348 files
1.82K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
تحول در سنجش عملکرد مدل‌های هوش مصنوعی با قابلیت‌های جدید Agent Arena

‏پروژه Agent Arena با تحلیل بیش از ۱.۷ میلیون نشست کاربری، رویکرد خود را از یک رتبه‌بندی کلی به سیستمی جامع برای انتخاب مدل‌های هوش مصنوعی تغییر داده است. از این پس، ارزیابی مدل‌ها تنها بر اساس عملکرد نیست و دو فاکتور کلیدی «هزینه انجام وظیفه» و «دسته‌بندی موضوعی» به لیدربرد اضافه شده‌اند.

‏مهم‌ترین نکات این به‌روزرسانی:

‏- هزینه واقعی انجام وظیفه (Agent Costs): مدل‌ها بر اساس هزینه تکمیل هر تسک واقعی سنجیده می‌شوند. با استفاده از نمودار Pareto Frontier، می‌توانید به‌سادگی مدل‌های دارای بهترین نسبت «کارایی به قیمت» را شناسایی کنید.
‏- دسته‌بندی‌های تخصصی (Agent Categories): عملکرد مدل‌ها اکنون در سه حوزه اصلی تفکیک شده است تا درک دقیق‌تری از توانمندی آن‌ها داشته باشید:
‏ - Code: برای برنامه‌نویسی، دیباگ و تحلیل داده.
‏ - Chat: برای چت‌های عمومی، یادگیری و تولید محتوای خلاقانه.
‏ - Work: برای امور اداری، تحقیق حرفه‌ای و مستندسازی که با ۶۹٪ بیشترین حجم تسک‌ها را شامل می‌شود.

📊 DataScience
🧠 کالبدشکافی ساختار ایجنت‌های هوش مصنوعی

‏اگر در حال توسعه یا مقیاس‌پذیری سیستم‌های هوش مصنوعی هستید، باید بدانید که فارغ از نوع مدل یا فریم‌ورک، اکثر ایجنت‌های کاربردی از یک الگوی معماری واحد پیروی می‌کنند. برای درک عمیق‌تر، این لایه‌های کلیدی را به خاطر بسپارید:

‏- لایه ادراک (Perception): ورودی‌ها شامل متن، رویدادها یا سنسورها را دریافت می‌کند.
‏- موتور استدلال (Reasoning): مدل زبانی (LLM) که وظیفه تحلیل، برنامه‌ریزی و تصمیم‌گیری را بر عهده دارد.
‏- ماژول برنامه‌ریزی (Planning): اهداف بزرگ را به گام‌های اجرایی و کوچک تبدیل می‌کند.
‏- لایه اجرا (Action Layer): بخش تعامل با ابزارها، APIها، کدنویسی و پایگاه‌های داده برای انجام کار.
‏- سیستم حافظه (Memory): شامل حافظه کوتاه‌مدت برای متن جاری و حافظه بلندمدت برای دانش تخصصی.
‏- لایه نظارت و ایمنی (Guardrails): مدیریت محدودیت‌ها، فیلترینگ محتوا و تایید نهایی توسط انسان.
‏- لایه رصد (Observability): پایش لاگ‌ها، هزینه، تاخیر و عملکرد سیستم.

📚 مطالعه با جزئیات بیشتر

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#AI_Agent #Reasoning_Engine
🤖 مفاهیم کلیدی که هر متخصص هوش مصنوعی باید بداند

‏بسیاری از مهندسان با اصطلاحات دنیای هوش مصنوعی آشنا هستند، اما درک تفاوت‌های دقیق آن‌ها برای ساخت سیستم‌های واقعی حیاتی است. در اینجا مهم‌ترین این مفاهیم را بررسی می‌کنیم:

‏• LLM در برابر AI Agent: مدل زبانی تنها مغز متفکر است، اما ایجنت سیستمی است که با استفاده از حافظه و ابزارها به یک هدف مشخص می‌رسد.

‏• RAG در برابر Grounding: تکنیک RAG برای بازیابی اطلاعات خارجی استفاده می‌شود، در حالی که Grounding به معنای متصل کردن خروجی مدل به منابع قابل اعتماد است.

‏• Fine-tuning در برابر Prompt Engineering: اولی وزن‌های مدل را تغییر می‌دهد و دومی نحوه تعامل و دستورالعمل‌های ورودی به مدل را بهینه‌سازی می‌کند.

‏• Vector Database در برابر Knowledge Graph: دیتابیس برداری بر پایه شباهت‌های معنایی جستجو می‌کند، اما گراف دانش بر پایه روابط میان موجودیت‌ها استوار است.

‏• Data Lineage در برابر Data Observability: اولی مسیر حرکت و منشأ داده را نشان می‌دهد و دومی سلامت و پایداری داده در لحظه را بررسی می‌کند.

📚 مطالعه با جزئیات بیشتر

📊 DataScience
۷ پارامتر کلیدی که خروجی LLM را کنترل می‌کنند

‏هر مدل زبانی (LLM) با نمونه‌برداری از توزیع احتمالات، توکن‌ها را یکی‌یکی تولید می‌کند. برای مدیریت دقیق این خروجی، شناخت این هفت پارامتر حیاتی است:

‏* Max tokens: تعیین حداکثر تعداد توکن‌های تولیدی که در صورت رسیدن به سقف، فرآیند را قطع می‌کند.
‏* Temperature: تنظیم میزان خلاقیت یا قطعیت مدل؛ مقادیر کمتر از ۱ مدل را محافظه‌کار و مقادیر بالاتر آن را متنوع‌تر می‌کند.
‏* Top_p: انتخاب از میان مجموعه‌ای از توکن‌ها که مجموع احتمال آن‌ها برابر با p است؛ این پارامتر با میزان اطمینان مدل تطبیق می‌یابد.
‏* Top_k: محدود کردن انتخاب به k توکن برتر؛ فارغ از اینکه مدل چقدر به پاسخ اطمینان دارد.
‏* Frequency & Presence Penalties: کاهش احتمال تکرار کلمات؛ اولی بر اساس دفعات تکرار و دومی بر اساس حضور یک توکن در متن عمل می‌کند تا تنوع موضوعی حفظ شود.
‏* Stop sequences: رشته‌های خاصی که به محض تولید توسط مدل، باعث توقف فوری فرآیند پاسخ‌دهی می‌شوند.

📚 مطالعه با جزئیات بیشتر

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Temperature #Top_p
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #91 | 📌 6 آیتم گزارش | 🧾 از 11 پست بررسی‌شده
🕐 چهارشنبه 1405/05/28 ساعت 14:00 تا پنجشنبه 1405/05/29 ساعت 14:00

🛠️ ابزارها و توسعه نرم‌افزار

شرکت Modular زبان برنامه‌نویسی Mojo را به صورت متن‌باز تحت مجوز Apache 2.0 منتشر کرد که دسترسی توسعه‌دهندگان به زیرساخت‌های این زبان متمرکز بر هوش مصنوعی را متحول می‌کند.
🔗 مشاهده پست

ابزار متن‌باز TrueForge معرفی شد؛ یک Agent Harness برای مدیریت هزینه‌ها، حفظ وضعیت و بهبود کارایی اِیجنت‌های هوش مصنوعی در پروژه‌های طولانی‌مدت.
🔗 مشاهده پست


🧪 دستاوردهای علمی و پژوهشی

شرکت Anthropic با استفاده از مدل هوش مصنوعی Claude Opus موفق شد برای ۱۴ مورد از ۱۵ هدف تعیین‌شده، پروتئین‌های اختصاصی با نرخ موفقیت بی‌سابقه ۲۲ تا ۳۵ درصد طراحی کند.
🔗 مشاهده پست

پژوهشگران استنفورد و MIT سیستم Meta-Harness را معرفی کردند که با بهینه‌سازی کد محیط اجرا (بدون نیاز به تغییر وزن‌های مدل)، عملکرد مدل‌های زبانی بزرگ را تا ۶ برابر بهبود می‌دهد.
🔗 مشاهده پست


🤖 کاربردها و مفاهیم هوش مصنوعی

شرکت OpenAI نسخه اختصاصی ChatGPT را برای نوجوانان ۱۳ تا ۱۷ سال با تمرکز بر یادگیری عمیق، حل مسئله (از طریق حالت Study Mode) و امنیت پیشرفته طراحی و عرضه کرده است.
🔗 مشاهده پست

بررسی تفاوت‌های ساختاری کلیدی مانند تفاوت LLM با AI Agent (عامل هوشمند مجهز به حافظه و ابزار) و تفاوت تکنیک RAG (بازیابی اطلاعات) با Grounding (اتصال به منابع معتبر).
🔗 مشاهده پست


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
هوش مصنوعی مایکروسافت در میدان رقابت تصویر

‏مایکروسافت با عرضه مدل‌های جدید سری MAI-Image توانسته است خود را به جمع برترین‌های حوزه تبدیل تصویر به عکس (t2i) برساند. عملکرد خیره‌کننده این تیم که متشکل از متخصصان سابق Meta GenAI است، در بنچمارک‌های اخیر توجه زیادی را به خود جلب کرده است.

‏بر اساس تحلیل‌های Artificial Analysis، مدل‌های جدید در پیاده‌سازی جزئیات دقیق، رندر متن و طراحی رابط کاربری (UI/UX) نتایج رقابتی و نزدیکی با مدل‌هایی نظیر GPT Image 2 ارائه می‌دهند.

‏مهم‌ترین نکات درباره این تحولات:
‏* مدل MAI-Image-2.6-Preview یکی از مدعیان جدید در صدر جدول رده‌بندی است.
‏* نسخه MAI-Image-2.5-Pro با استفاده از فشرده‌سازی پیشرفته، تعادل خوبی میان کیفیت و هزینه ایجاد کرده است.
‏* عملکرد مدل‌ها در آزمون‌های پیچیده مانند نمایش احساسات در انیمه یا ترسیم دیاگرام‌های ایزومتریک، نشان‌دهنده دقت بالای موتورهای تولید تصویر این مجموعه است.

‏برای بررسی و تست مستقیم توانایی‌های این مدل‌ها می‌توانید از Playground مایکروسافت استفاده کنید.

📚 مطالعه با جزئیات بیشتر

📊 DataScience
⚡️ رقابت داغ در دنیای AI: چین به مرزهای آمریکا رسید

‏گزارش‌های تازه بلومبرگ و تحلیل‌های مستقل نشان می‌دهد که شکاف میان توانمندی‌های هوش مصنوعی چین و آمریکا با سرعتی غیرمنتظره در حال بسته شدن است. مدل جدید Kimi K3 از شرکت Moonshot اکنون در کنار بزرگانی نظیر مدل‌های پیشرو Anthropic و OpenAI قرار گرفته و در بسیاری از بنچمارک‌ها پابه‌پای آن‌ها پیش می‌رود.

‏نکته قابل‌توجه این است که علاوه بر بهبود عملکرد فنی، مدل‌های چینی مانند Kimi، GLM و Qwen به‌طور قابل‌توجهی در هزینه‌های عملیاتی بهینه‌تر هستند.

‏مهم‌ترین یافته‌های تحلیل‌های اخیر:

‏* شاخص Artificial Analysis: مدل Kimi K3 در ارزیابی ترکیبی از کدنویسی و استدلال، خود را به رده‌های بالای جهان رسانده است.
‏* شاخص توانمندی Epoch: این مدل با کسب امتیازهای بالا در بیش از ۵۰ بنچمارک، رسماً در جمع پیشروترین هوش‌های مصنوعی جهان قرار دارد.
‏* شاخص Vals: بررسی عملکرد تخصصی در حوزه‌های حقوقی، مالی و برنامه‌نویسی نشان می‌دهد که Kimi K3 در وضعیت عملکردی بسیار رقابتی قرار گرفته است.

📚 مطالعه با جزئیات بیشتر

📊 DataScience
📊 تحلیل عملکرد مدل‌های کوانتایز شده Qwen

‏آیا کوانتایز کردن مدل‌ها به قیمت از دست رفتن هوش آن‌ها تمام می‌شود؟ پاسخ به این پرسش در یک بنچمارک ۶۷ ساعته روی خانواده Qwen 2.5-32B بررسی شده است.

‏نتایج نشان می‌دهد که برخلاف تصور رایج، استفاده از کوانتایزیشن ۴ بیت نه تنها فاجعه‌بار نیست، بلکه در برخی متدها عملکردی خیره‌کننده دارد:

‏• متد AWQ INT4 توانسته با ثبت دقت ۹۰٪، حتی از نسخه‌های FP8 با دقت ۸۸.۷٪ نیز پیشی بگیرد.
‏• سایر روش‌های ۴ بیتی نیز در محدوده عملکردی بسیار نزدیک به نسخه‌های سنگین‌تر (۸۸ تا ۸۹ درصد) قرار دارند.
‏• مدل‌های xhigh در عمل تنها باعث مصرف بیشتر توکن و منابع می‌شوند و تفاوت کیفیت آن‌ها با مدل‌های بهینه‌تر بسیار ناچیز است.

‏برای کاربردهای عملی و واقعی، استفاده از مدل‌های سبک‌تر با کوانتایزیشن مناسب، انتخاب هوشمندانه‌ای است. نسخه‌های سنگین عمدتاً برای بهبود رتبه‌بندی در لیدربوردها کاربرد دارند و ارزش افزوده عملیاتی چندانی ایجاد نمی‌کنند. این تحلیل دید دقیق‌تری برای انتخاب مدل بر اساس منابع سخت‌افزاری و نیاز واقعی پروژه به ما می‌دهد.

📚 مطالعه با جزئیات بیشتر

📊 DataScience
1
🧬 موفقیت بزرگ هوش مصنوعی در ساخت واکسن سرطان

‏در یک پیشرفت انقلابی، واکسن سرطان شخصی‌سازی‌شده که با کمک هوش مصنوعی توسط شرکت‌های مدرنا و مرک توسعه یافته، فاز سوم کارآزمایی بالینی خود را با موفقیت پشت سر گذاشت.

‏این فرآیند درمانی با توالی‌یابی ژنوم تومور بیمار و مقایسه آن با DNA سالم آغاز می‌شود. سپس هوش مصنوعی جهش‌های خاصی را شناسایی می‌کند که بیشترین پتانسیل را برای تحریک سیستم ایمنی بدن دارند. بر اساس این داده‌ها، یک درمان اختصاصی مبتنی بر mRNA برای هدف قرار دادن حداکثر ۳۴ آنتی‌ژن ساخته می‌شود.

‏نتایج اولیه و فاز سوم این مطالعه نشان‌دهنمهم‌ترین دستاوردهاهای مهمی است:

‏* کاهش ۴۹ درصدی خطر بازگشت بیماری یا مرگ در بیماران.
‏* کاهش ۵۹ درصدی احتمال متاستاز یا مرگ.
‏* ماندگاری نرخ بقای بدون سرطان در بیش از ۶۸ درصد بیماران پس از ۵ سال.

‏جزئیات بیشتر این دستاورد پزشکی را می‌توانید در وب‌سایت رسمی مرک مشاهده کنید. این موفقیت، گامی کلیدی در استفاده از یادگیری ماشین برای درمان‌های شخصی‌سازی‌شده پزشکی است.

📚 مطالعه با جزئیات بیشتر

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🚀 افزایش چشمگیر سرعت دیکودینگ با مدل‌های جدید Liquid AI

‏شرکت Liquid AI به تازگی مدل‌های LFM2.5-DSpark را معرفی کرده است که می‌توانند سرعت تولید توکن (Decoding) را تا ۳.۱۸ برابر افزایش دهند، بدون اینکه کوچک‌ترین تغییری در خروجی نهایی مدل ایجاد کنند.

‏مهم‌ترین نکات این نسخه:
‏• عملکرد بدون تغییر در کیفیت: این معماری به گونه‌ای طراحی شده که خروجی مدل کاملاً مشابه مدل پایه باقی می‌ماند. اگر توکن پیش‌بینی شده توسط مدلِ درفتر با توزیع هدف مطابقت نداشته باشد، مدل اصلی جایگزین آن می‌شود.

‏• ارتباط مستقیم با نرخ پذیرش: افزایش سرعت وابستگی مستقیمی به «نرخ پذیرش توکن‌ها» دارد. به عبارت دیگر، هرچه مدل پیش‌بینی‌های دقیق‌تری داشته باشد، جهش سرعت بیشتر خواهد بود.

‏• مدل‌های منتشر شده:
‏- LFM2.5-1.2B-Instruct
‏- LFM2.5-2.6B
‏- LFM2.5-8B-A1B

‏این مدل‌های درفتر با حدود ۳۰۰ میلیون پارامتر، بهینه‌سازی بسیار کارآمدی برای تسریع در اجرا روی سخت‌افزارهایی مانند H100 یا پردازنده‌های سری M اپل محسوب می‌شوند. برای مطالعه تحلیل کامل فنی، می‌توانید به این گزارش مراجعه کنید.

📚 مطالعه با جزئیات بیشتر

📊 DataScience