هوش مصنوعی و علم داده به فارسی
6.04K subscribers
1.35K photos
364 videos
336 files
1.5K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
🐡 معرفی مدل جدید Fugu-Ultra v1.1

🚀 ‏ شرکت Sakana AI به‌تازگی نسخه ارتقایافته مدل خود یعنی Fugu-Ultra v1.1 را منتشر کرد. این نسخه با بهره‌گیری از جدیدترین مدل‌های پیشرو (Frontier Models)، بهبود عملکرد چشمگیری را در تمامی benchmarkهای استاندارد تجربه کرده است.

📊 ‏ میانگین رشد دقت این مدل نسبت به نسخه 1.0 به حدود 7.9 واحد می‌رسد. بیشترین پیشرفت در شاخص‌های ProgramBench و Terminal Bench 2.1 مشاهده می‌شود که نشان‌دهنده توانمندی بالای مدل در محیط‌های تخصصی برنامه‌نویسی است.

🧠 ‏ این مدل در حوزه‌های coding، وظایف مبتنی بر ایجنت (Agentic Tasks) و استدلال‌های منطقی پیچیده، بسیار بهینه‌تر عمل می‌کند. نکته حائز اهمیت این است که تمامی این قابلیت‌های فنی ارتقایافته، بدون افزایش قیمت نسبت به نسخه قبلی ارائه شده‌اند.

‏ توسعه‌دهندگان اکنون می‌توانند پروژه‌های عملیاتی سنگین‌تری را با همان هزینه قبلی پیش ببرند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Fugu_Ultra #ProgramBench
1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖تحلیل تخصصی معماری سخت‌افزار برای هوش مصنوعی

‏ دنیای سخت‌افزارهای AI حول ۵ معماری اصلی می‌چرخد که هرکدام توازن متفاوتی میان انعطاف‌پذیری، موازی‌سازی و دسترسی به حافظه برقرار می‌کنند. پردازنده‌های مرکزی یا CPU با هسته‌های قدرتمند برای وظایف منطقی و سیستم‌عامل بهینه شده‌اند، در حالی که GPU با هزاران هسته کوچک، پادشاه بلامنازع آموزش شبکه‌های عصبی و محاسبات ماتریسی موازی است.

🧠 ‏ واحدهای پردازش تنسور یا TPU با طراحی گوگل، از واحدهای MAC برای جریان موجی داده‌ها استفاده می‌کنند تا نیاز به جابجایی مداوم در حافظه حذف شود. در مقابل، NPUها نسخه‌های بهینه‌شده برای لبه (Edge) هستند که با مصرف توان بسیار اندک، عملیات استنتاج را در دستگاه‌هایی مثل گوشی‌های هوشمند انجام می‌دهند.

🚀 ‏ نسل جدید سخت‌افزارها یعنی LPU ساخته شرکت Groq، با حذف کامل حافظه خارجی و تکیه بر SRAM روی تراشه، تأخیر را به حداقل رسانده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#LMCache #Groq
🐝 پلتفرم Buzz: تحولی در تعامل انسان و ایجنت‌های هوش مصنوعی

‏پروژه Buzz، جدیدترین ابتکار جک دورسی (خالق توییتر)، به‌عنوان یک فضای کار متن‌باز و غیرمتمرکز معرفی شده است که با هدف هماهنگی تیم‌های ترکیبیِ متشکل از انسان و ایجنت (Agent) طراحی شده است. برخلاف ابزارهایی مانند Slack که برای ارتباطات انسانی ساخته شده‌اند، Buzz محیطی بومی برای تعامل همزمان انسان و ایجنت فراهم می‌کند.

🧠 ‏ این پلتفرم بر پایه پروتکل Nostr بنا شده و هر ایجنت دارای هویت و کلید اختصاصی است. این معماری نه‌تنها امنیت را ارتقا می‌دهد، بلکه اجازه می‌دهد هر ایجنتی با پروتکل ACP، ازجمله Claude Code و Codex، به‌راحتی متصل شود. هر پروژه در اینجا به یک چتِ مجهز به کد تبدیل می‌شود که تاریخچه کامل گفتگوها، کامیت‌ها و ریوها را در خود نگه می‌دارد.

‏ علاوه بر این، Buzz یک Git-hosting پیشرفته دارد که برای مدیریت روِ ایجنت‌ها (گروهی از ایجنت‌های همکار) بهینه شده است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Buzz_Platform #Nostr_Protocol
🚀 معرفی مدل هوشمند Ling-3.0-flash

‏شرکت InclusionAI از مدل جدید Ling-3.0-flash رونمایی کرد. این مدل MoE با 124 میلیارد پارامتر کل، تنها 5.1 میلیارد پارامتر فعال در هر توکن دارد که بهره‌وری بی‌نظیری را برای ایجنت‌های هوش مصنوعی فراهم می‌کند و عملکردی هم‌تراز با مدل‌های 1 تریلیون پارامتری ارائه می‌دهد.

🧠 ‏ معماری پیشرفته این مدل مبتنی بر Hybrid linear attention است. این ساختار ترکیبی شامل 5 لایه KDA برای مدیریت حافظه بلندمدت و یک لایه MLA برای دقت در محاسبات است تا بدون تحمیل هزینه‌های پردازشی سنگین، دقت بالایی در پردازش متون طولانی داشته باشد.

‏ از قابلیت‌های کلیدی آن می‌توان به context window با ظرفیت اولیه 256 هزار توکن اشاره کرد که قرار است تا 1 میلیون مقیاس‌پذیر شود. این مدل در اجرای سناریوهای پیچیده مثل طراحی سیستم‌های گرافیکی، مدیریت فایل‌های مالی اکسل و هماهنگی ایجنت‌های علمی عملکردی خیره‌کننده دارد.

🔭 ‏ در حال حاضر این مدل برای تست روی پلتفرم OpenRouter در دسترس است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Ling_3 #Hybrid_linear_attention
🤖 معرفی مدل هوشمند Claude Opus 5

‏شرکت Anthropic از مدل پرچمدار جدید خود، Claude Opus 5، رونمایی کرد. این مدل که به‌طور ویژه برای کارهای پیچیده برنامه‌نویسی، وظایف عاملی (Agentic tasks) و تحلیل‌های سنگین بهینه‌سازی شده است، در بنچمارک‌های متعددی پیشتاز میدان است.

🚀 ‏ این مدل در Frontier-Bench v0.1 ویژه مهندسی نرم‌افزار به سطح SOTA دست یافته و در شاخص ARC-AGI-3 عملکردی حدود ۳ برابر بهتر از نزدیک‌ترین رقیب دارد. برتری اصلی Opus 5 در قابلیت خوداصلاحی بالاتر است که اجازه می‌دهد مدل پیش از ارائه پاسخ نهایی، خروجی‌های خود را بازبینی و اشتباهات احتمالی را برطرف کند.

📊 ‏ تحلیل دقیق عملکرد نشان می‌دهد Opus 5 با کسب امتیاز بیش از ۳۰٪ در حل مسائل نوین و ۴۳.۳٪ در کدنویسی عاملی، رقبایی مانند GPT-5.6 Sol را پشت سر گذاشته است. این مدل همچنین در OSWorld 2.0 که شاخصی برای توانایی مدل در استفاده از سیستم‌عامل است، نتایج درخشانی از خود بر جای گذاشته است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #ARC_AGI_3
1
🤖 مدل Claude Opus 5 پیشتاز جدید هوش مصنوعی

🔬 ‏ مدل Claude Opus 5 با کسب امتیاز 61 در Artificial Analysis Intelligence Index، رسماً جایگاه نخست هوشمندی را تصاحب کرد. این مدل با عملکردی برتر نسبت به Fable 5 و GPT-5.6 Sol، در هر تسک 26% هزینه کمتری برای کاربران به همراه دارد.

‏ در حوزه هوش عاملی، Opus 5 با ثبت امتیازات خیره‌کننده در بنچمارک‌های GDPval-AA v2 و AA-Briefcase، استانداردهای جدیدی برای خروجی‌های دقیق حرفه‌ای تعریف کرده است. همچنین با استفاده از ابزار Claude Code، این مدل در Coding Agent Index به رتبه اول دست یافته است.

📊 ‏ اگرچه استدلال علمی مدل بهبود یافته، اما در دانش واقعی همچنان از Fable 5 عقب‌تر است و نرخ توهم آن با افزایش 14 درصدی به 50% رسیده است. این مدل از پنج سطح تلاش مجزا و پنجره متنی 1 میلیون توکنی پشتیبانی می‌کند.

💰 ‏ قیمت‌گذاری به ازای هر میلیون توکن ورودی و خروجی به ترتیب 5 و 25 دلار است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #GDPval_AA
🚀 فراتر از مهندسی پرامپت: ۵ لایه کلیدی در توسعه ایجنت‌ها

🧠 ‏ برای تبدیل ایجنت‌های هوش مصنوعی از یک دمو به محصولی کاربردی، باید فراتر از Prompt Engineering حرکت کنید. مدل در مرکز این چرخه قرار دارد اما ۵ لایه مجزا تعیین‌کننده موفقیت نهایی پروژه شما هستند و هر لایه دید وسیع‌تری نسبت به لایه قبل ارائه می‌دهد.

‏ لایه اول یعنی پرامپت، کنترل‌کننده تعاملات ساده مانند تعیین نقش، نمونه‌ها و فرمت خروجی است. Context Engineering به مدیریت هوشمندانه فضای محدود پنجره متنی می‌پردازد تا مدل دقیق‌ترین داده‌ها را قبل از شروع کار در اختیار داشته باشد، چرا که مدیریت این حافظه محدود، بخش بزرگی از چالش توسعه است.

‏️ لایه سوم، Harness Engineering نام دارد که شامل زیرساخت‌های کد پیرامون مدل است؛ مواردی مانند دسترسی به ابزارها، مکانیزم‌های Retry، اعتبارسنجی خروجی‌ها و مسیریابی به ساب‌ایجنت‌ها در این بخش قرار می‌گیرند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Context_Engineering #Harness_Engineering
🌐 بیانیه شرکت‌های بزرگ فناوری برای حمایت از مدل‌های متن‌باز

‏شرکت‌های بزرگ فناوری در نامه‌ای رسمی با عنوان «وزن‌های باز و پیشگامی آمریکا در هوش مصنوعی»، از اهمیت دسترسی عمومی به Open Weights (مدل‌هایی که پارامترهای آن‌ها برای دانلود و اجرا در دسترس است) دفاع کردند. جالب است که نام OpenAI و Anthropic در میان امضاکنندگان این بیانیه دیده نمی‌شود.

🚀 ‏ این نامه استدلال می‌کند که مدل‌های متن‌باز با تسهیل دسترسی استارتاپ‌ها و دانشگاه‌ها به تکنولوژی‌های پیشرفته، باعث شکوفایی اقتصاد هوش مصنوعی می‌شوند. با این رویکرد، نیاز به آموزش از صفر یا پرداخت هزینه‌های سنگینِ مدل‌های تجاری کاهش می‌یابد.

🛡 ‏ متخصصان امنیت معتقدند برای مقابله با تهدیدات سایبری، دسترسی به مدل‌های قدرتمند برای شناسایی آسیب‌پذیری‌ها ضروری است. شفافیت ناشی از این مدل‌ها به جامعه محققان کمک می‌کند تا رفتار سیستم‌ها را مطالعه کرده و مکانیزم‌های دفاعی قوی‌تری توسعه دهند.


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Open_Weights #AI_Leadership
📊 راهنمای جامع بنچمارک‌های ارزیابی هوش مصنوعی

🔬 ‏ با رشد سریع مدل‌های زبانی بزرگ (LLM)، ارزیابی دقیق عملکرد مدل‌ها فراتر از شمارش پارامترها یا تست‌های ساده است. بنچمارک‌ها ابزارهای حیاتی برای درک نقاط قوت تخصصی مدل‌ها در محیط‌های واقعی هستند.

💻 ‏ در حوزه کدنویسی و مهندسی نرم‌افزار، مجموعه‌های SWE-Bench Pro، نسخه Multilingual و Terminal-Bench استانداردهای اصلی برای سنجش توانایی حل مسائل پیچیده برنامه‌نویسی محسوب می‌شوند.

🤖 ‏ برای ارزیابی عملکرد ایجنت‌ها و تعامل با ابزارها، معیارهایی نظیر Tau3-banking-AA، MCP-Atlas و SkillsBench به همراه بنچمارک‌های WideSearch و BrowseComp برای سنجش مهارت‌های جست‌وجو و ناوبری ارائه شده‌اند.

🎯 ‏ جهت بررسی دستورپذیری و کنترل رفتاری مدل، آزمون‌های IFBench، SysBench و Multi-IF دقیق‌ترین ارزیابی‌ها را ارائه می‌دهند. همچنین برای سنجش حافظه و متن‌های طولانی، بنچمارک MRCR-128k یک انتخاب کلیدی است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#SWE_Bench_Pro #Multi_IF
1
🧠 خلاصه تحولات 48 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #68 | 📦 103 پست
🕐 پنجشنبه 1405/05/01 ساعت 14:00 تا شنبه 1405/05/03 ساعت 14:00

🤖 مدل‌های زبانی بزرگ

مدل Grok 4.5 با کسب امتیاز 1543 در صدر مدل‌ها قرار دارد و رقابت سنگینی با مدل‌های چینی مانند Qwen 3.8 Max با ظرفیت ۲.۴ تریلیون پارامتر شکل گرفته است.
🔗 مشاهده پست

مدل Claude Opus 5 به عنوان پرچمدار جدید Anthropic، در بنچمارک ARC-AGI-3 عملکردی ۳ برابر بهتر از رقبا داشته و در حوزه کدنویسی عاملی پیشتاز است.
🔗 مشاهده پست

مدل Fugu-Ultra v1.1 از شرکت Sakana AI با ارتقای میانگین دقت ۷.۹ واحد، در حوزه‌های Agentic Tasks و برنامه‌نویسی بهینه‌سازی شده است.
🔗 مشاهده پست

مدل ویدئویی FLUX 3 از Black Forest Labs با قابلیت تولید چندوجهی Multimodal، نویدبخش تحولی جدید در رقابت با مدل‌های گوگل است.
🔗 مشاهده پست


🦾 رباتیک و هوش عاملی

صنعت رباتیک تا سال 2040 با رشدی ۳۷۰ برابری به ارزش ۳۷۰ میلیارد دلار خواهد رسید که موتور محرک آن ربات‌های انسان‌نما است.
🔗 مشاهده پست

قابلیت Plan Mode در ابزار Manus، امکان تحلیل و تدوین طرح اجرایی پیش از اقدام را برای کاهش خطاهای ایجنت‌ها فراهم می‌کند.
🔗 مشاهده پست

پلتفرم متن‌باز Buzz با پروتکل Nostr، محیطی غیرمتمرکز برای همکاری هم‌زمان انسان و ایجنت‌های هوش مصنوعی ایجاد کرده است.
🔗 مشاهده پست


⚙️ توسعه، امنیت و زیرساخت

ابزار Claude Security با معماری چندعامله، پیش از کامیت کد، ریپازیتوری را برای یافتن حفره‌های امنیتی اسکن می‌کند.
🔗 مشاهده پست

قابلیت Router در ادیتور Cursor به صورت خودکار بهینه‌ترین مدل زبانی را انتخاب کرده و تا ۶۰٪ کاهش هزینه به همراه دارد.
🔗 مشاهده پست

مدل Kimi K3 در دستاوردی فنی، با استفاده از ۳۲ عامل خودمختار موفق به اکسپلویت آسیب‌پذیری RCE در سرورهای Redis شد.
🔗 مشاهده پست


📊 ابزارهای داده و بنچمارک‌ها

بنچمارک FrontierBench با ۷۴ وظیفه عملیاتی دشوار، جایگزین TerminalBench برای سنجش واقع‌گرایانه مدل‌ها شده است.
🔗 مشاهده پست

دیتاست‌های جدید در Kaggle شامل موضوعات متنوعی نظیر پیش‌بینی سلامت، تحلیل تراکنش‌های بانکی، قیمت ارزهای دیجیتال و داده‌های تاریخی فوتبال از سال 1872 است.
🔗 مشاهده پست

دیتاست Indian Labour & Corporate Law با بیش از ۹۵۰ بخش و فرمت JSON، منبعی ارزشمند برای تحلیل‌های حقوقی و متنی است.
🔗 مشاهده پست


🎓 پژوهش و آموزش

مدل dots-note-3.0 موفق شد در آزمون المپیاد جهانی ریاضی IMO به نمره کامل ۴۲ از ۴۲ دست یابد که اولین مورد در نوع خود است.
🔗 مشاهده پست

مدل UniD با رویکرد Unified Video Dense Prediction، وظایف پیش‌بینی چگال ویدیو را به صورت یکپارچه انجام می‌دهد.
🔗 مشاهده پست

شرکت‌های فناوری در بیانیه‌ای از اهمیت مدل‌های دارای Open Weights برای رشد اقتصاد هوش مصنوعی و ارتقای امنیت سایبری دفاع کردند.
🔗 مشاهده پست


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🤖 درخشش هوش مصنوعی در المپیاد جهانی ریاضی

🔬 ‏ نتایج اخیر نشان می‌دهد مدل Claude Opus 5 موفق شده است در تمامی ۶ مسئله المپیاد جهانی ریاضی (IMO) 2026، امتیاز کامل ۴۲ از ۴۲ را کسب کند. این در حالی است که حد نصاب دریافت مدال طلا در این دوره، کسب ۲۹ امتیاز بوده است.

‏ برخلاف سال‌های گذشته، این مدل بدون استفاده از هیچ‌گونه ابزار کمکی، دسترسی به اینترنت یا محیط اجرای پایتون این مسیر را طی کرده است. ارزیابی اولیه توسط یک «گروه مدل‌ها» و سپس بازبینی دقیق متخصصان انسانی صورت گرفته که تأیید کردند هر ۲۴ راه حل تولید شده توسط مدل، کاملاً صحیح و استاندارد هستند.

🧠 ‏ ویژگی بارز این دستاورد، استفاده از Adaptive Thinking (تفکر تطبیقی) با ظرفیت خروجی ۲۵۶ هزار توکن است. مدل در این سناریو حتی در شرایطی که با محدودیت توکن مواجه بود، توانست راهکارهای جایگزین هوشمندانه‌ای ارائه دهد.

📊 ‏ نکته قابل تأمل این است که مدل‌های قدرتمند دیگری مانند GPT-5.6-Sol-Pro و Kimi K3 نیز نتایج مشابهی کسب کرده‌اند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_Opus_5 #Adaptive_Thinking
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 معرفی Fireducks به‌عنوان جایگزین بهینه Pandas

‏اگر در پردازش‌های سنگین داده با کتابخانه Pandas با چالش سرعت مواجه هستید، ابزار جدید Fireducks یک جایگزین قدرتمند و بسیار سریع برای بهبود کارایی عملیات‌های داده‌محور است. این کتابخانه به گونه‌ای طراحی شده که بدون نیاز به تغییرات گسترده در کدهای فعلی شما، سرعت اجرای برنامه‌ها را به شکل چشمگیری افزایش می‌دهد.

‏️ برای بهره‌مندی از این قابلیت، تنها کافی است دستور import خود را به صورت import fireducks.pandas as pd تغییر دهید. این تغییر بسیار ساده، مسیر را برای اجرای بهینه‌تر و سریع‌تر توابع سنتی Pandas در پروژه‌های شما هموار می‌کند.

📈 ‏ نتایج حاصل از benchmarkهای معتبر نشان می‌دهد که Fireducks در سناریوهای مختلف پردازش، بهبود عملکرد قابل‌توجهی نسبت به نسخه‌های استاندارد دارد. این ابزار برای متخصصانی که با حجم بالای داده سر و کار دارند، گزینه‌ای ایده‌آل جهت کاهش چشمگیر زمان محاسبات و افزایش بهره‌وری تیم‌های تحلیل داده محسوب می‌شود.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Fireducks #Pandas_Benchmark
🤖 تحول مدل‌های هوش مصنوعی در حل باگ‌های برنامه‌نویسی

🔬 ‏ بررسی تخصصی روی بنچمارک Bug Hunt Bench نشان می‌دهد که نسخه جدید Claude 5 Opus در شناسایی و رفع خطاهای نرم‌افزاری جهش خیره‌کننده‌ای داشته است. این مدل در یک مخزن کد VS Code با ۲۸ هزار خط و ۴۵ باگ تعبیه‌شده، موفق به رفع ۱۱ خطا شد که نشان‌دهنده درک عمیق‌تر آن از ساختار کدهای پیچیده است.

⚡️ ‏ در مقایسه، نسخه Opus 4.8 تنها توانسته بود ۲ باگ را اصلاح کند. نسخه جدید نه تنها موارد پیشین را با موفقیت پشت سر گذاشت، بلکه ۹ باگ پیچیده دیگر را نیز بدون ایجاد False Fix (اصلاحات کاذب) برطرف کرد که نرخ موفقیت آن را به‌طور محسوسی ارتقا داد.

📊 ‏ با وجود این بهبود عملکرد، مدل GPT-5.6 Sol همچنان با حل ۱۳ باگ، پیشتاز این ارزیابی است. با این حال، همچنان ۲۷ خطا از مجموع ۴۵ مورد، توسط تمام مدل‌های بررسی‌شده حل‌نشده باقی مانده‌اند که نشان می‌دهد دنیای توسعه خودکار کد، همچنان برای رسیدن به دقت مطلق راه درازی در پیش دارد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Claude_3 #Bug_Hunt_Bench
📚 کتاب جامع و رایگان نظریه بازی‌ها

⚡️ ‏ انتشار یک منبع آموزشی رایگان و متن‌باز (Open Source) با عنوان Game Theory اثر Giacomo Bonanno فرصتی عالی برای متخصصان حوزه‌های الگوریتم و هوش مصنوعی است. این کتاب ۵۷۸ صفحه‌ای که در دانشگاه کالیفرنیا، دیویس تدوین شده، مرجعی قدرتمند برای درک تعاملات استراتژیک در سیستم‌های چندعاملی (Multi-Agent Systems) و یادگیری ماشین است.

🧠 ‏ محتوای این اثر شامل اصول بنیادی نظریه بازی‌ها، مفاهیم تعادل و فرآیندهای تصمیم‌گیری است. با تکیه بر ۱۶۵ مسئله حل‌شده و ۱۶۳ تصویر آموزشی، این کتاب پلی میان مباحث پیچیده ریاضی، اقتصاد و علوم کامپیوتر ایجاد کرده است که برای مطالعه عمیق مفاهیم تصمیم‌گیری هوشمند بسیار کاربردی است.

📊 ‏ استفاده از این محتوا تحت لیسانس Creative Commons امکان‌پذیر است و مطالعه آن برای افرادی که در حوزه‌های تخصصی آمار، احتمالات و طراحی مدل‌های هوشمند فعالیت می‌کنند، اکیداً توصیه می‌شود.

🔗https://arxiv.org/pdf/1512.06808

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#نظریه_بازی #Multi_Agent_Systems
@DataPlusScience__GAME THEORY.pdf
5.2 MB
🎲 کتاب جامع نظریه بازی‌ها

‏کتاب نظریه بازی‌ها (Game Theory) تألیف Giacomo Bonanno از دانشگاه کالیفرنیا، دیویس، یک منبع متن‌باز و ارزشمند برای علاقه‌مندان به مدل‌سازی‌های استراتژیک است.

🧠 ‏ این کتاب آموزشی با رویکردی آکادمیک و دقیق تدوین شده و برای درک مفاهیم کلیدی در حوزه‌های تصمیم‌گیری و بهینه‌سازی بسیار کاربردی است.

⚡️ ‏ یکی از ویژگی‌های بارز این اثر، گنجاندن ۱۶۵ تمرین حل‌شده است که به یادگیری عمیق‌تر و تسلط بر مسائل پیچیده کمک می‌کند.

‏این کتاب برای پژوهشگرانی که در زمینه‌های علوم داده و هوش مصنوعی با مباحث تئوری تصمیم و RLHF درگیر هستند، گزینه‌ای عالی برای مطالعه پایه است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#نظریه_بازی #RLHF
This media is not supported in your browser
VIEW IN TELEGRAM
📊 ۱۱ متد کلیدی ارزیابی مدل‌های هوش مصنوعی

‏ ارزیابی مدل‌های زبانی بزرگ (LLM) بسیار پیچیده است؛ چرا که معیارهای مختلف ممکن است نتایج متفاوتی ارائه دهند. برای نمونه، BLEU بر شباهت کلمات متمرکز است، در حالی که BERTScore به دنبال تطابق معنایی است. به همین دلیل، متدهای ارزیابی را بر اساس ماهیت‌شان به دسته‌های مختلف تقسیم می‌کنند.

🔬 ‏ روش‌های مرجع‌محور شامل BLEU، ROUGE و BERTScore هستند که بر اساس داده‌های از پیش تعیین‌شده کار می‌کنند. در مقابل، روش‌های قضاوت‌محور مانند G-Eval، LLM-as-Judge و هیئت‌های داوری مدل، در غیاب داده‌های دقیق به ارزیابی می‌پردازند. همچنین برای بررسی عملکرد ایجنت‌ها، Trajectory accuracy و ارزیابی‌های چندمرحله‌ای به کار می‌روند و برای کنترل ایمنی از ارزیابی‌های Safety استفاده می‌شود.

🚀 ‏ ابزار متن‌باز Opik پیاده‌سازی این معیارها را ساده کرده است تا بتوانید آن‌ها را مستقیماً روی داده‌های تولیدی اجرا کنید.

🔗GitHub

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#BERTScore #Opik
1
🇺🇸 چالش قیمت‌گذاری هوش مصنوعی آمریکا در برابر رقبا

‏ مدل‌های هوش مصنوعی آمریکایی که سال‌ها پیشگام بازار بودند، اکنون با چالش جدی قیمت‌گذاری از سوی رقبا مواجه‌اند. مدل جدید Kimi K3 محصول Moonshot AI، تنها با قیمت ۱۵ دلار به ازای هر میلیون توکن خروجی عرضه شده که تقریباً نصف هزینه مدل GPT-5.6 Sol است و سایر مدل‌های چینی نیز با هزینه‌ای بسیار کمتر در دسترس هستند.

🧠 ‏ بسیاری از مدل‌های پیشرو چینی به صورت open-weight (مدل‌هایی با وزن‌های قابل دانلود برای شخصی‌سازی) منتشر می‌شوند. این استراتژی به سازمان‌ها اجازه می‌دهد زیرساخت اختصاصی خود را داشته باشند، مدل‌ها را بهینه کنند و داده‌های حساس خود را برخلاف مدل‌های مبتنی بر API، کاملاً در محیط داخلی حفظ کنند.

🚀 ‏ شرکت‌های بزرگی مانند Airbnb، DoorDash و Microsoft به دلیل صرفه اقتصادی و عملکرد رقابتی، در حال بررسی استفاده از این مدل‌ها برای بارهای کاری خاص هستند.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Kimi_K3 #Open_Weight