هوش مصنوعی و علم داده به فارسی
6.06K subscribers
2.08K photos
511 videos
365 files
2.25K links
DataPlusScience | هوش مصنوعی و علم داده به فارسی
اخبار، تحلیل، آموزش و ابزارهای کاربردی

🌐 DataPlusScience.ir

📩 ارتباط با ما: @Contact2Mebot

📂 کانال فایل‌ها: @Datascientists_Files

💎 بله: ble.ir/dataplusscience

💡 ایتا: eitaa.com/DataPlusScience
Download Telegram
‏🤖 ارزیابی هوش مصنوعی در محیط کار واقعی با ApprenticeBench

‏استارتاپ NeoCognition به‌تازگی بنچمارک جدیدی به نام ApprenticeBench را معرفی کرده است که توانایی مدل‌های هوش مصنوعی را در ایفای نقش یک کارمند واقعی بررسی می‌کند.

‏در این آزمون، عامل هوشمند در یک شرکت ساخت‌وساز مجازی استخدام می‌شود تا وظایف حسابداری را انجام دهد. این بنچمارک برخلاف موارد سنتی، بر استفاده از رابط کاربری گرافیکی (GUI)، یادگیری مداوم در طول زمان و کار با اسناد آرشیوی تمرکز دارد.

‏مهم‌ترین نکات این ارزیابی:
‏• عملکرد درخشان مدل‌های پیشرفته: مدل Fable 5.1 با دقت ۷۲٪ و GPT-6 Astra با ۶۸٪ توانستند از میانگین عملکرد انسان (۵۱٪) پیشی بگیرند.
‏• چالش یادگیری طولانی‌مدت: بسیاری از مدل‌های ضعیف‌تر مانند Kimi K3 نتوانستند از تاریخچه و یادداشت‌های خود استفاده کنند و به مرور دچار افت عملکرد شدند.
‏• برتری در کار با GUI: برخلاف اکثر مدل‌ها که در محیط رابط کاربری با افت شدید عملکرد مواجه می‌شوند، مدل‌های برتر در این تست حتی در محیط GUI نتایج بهتری نسبت به API ثبت کردند.

ارزیابی توانایی هوش مصنوعی در محیط کار با بنچمارک ApprenticeBench
‏⚠️ افشای داده‌های حساس در اکوسیستم روترهای هوش مصنوعی

‏اخیراً گزارش تکان‌دهنده‌ای توسط محققان حوزه امنیت منتشر شده که نشان می‌دهد زنجیره تأمین مدل‌های زبانی (LLM) می‌تواند به حفره‌ای بزرگ برای نشت اطلاعات تبدیل شود. طبق این پژوهش، مهاجمان با نفوذ به روترهای میانی که واسط میان کاربران و ارائه‌دهندگان مدل هستند، به داده‌های حیاتی دسترسی پیدا کرده‌اند.

‏در این حملات، روترهای مخرب با خاتمه دادن به نشست‌های TLS، به متن اصلی داده‌ها دسترسی یافته و پاسخ‌های مدل را آلوده می‌کنند. این روش به مهاجم اجازه می‌دهد کنترل اجرای ابزارها را در دست گرفته و توکن‌های دسترسی حساس را سرقت کند.

‏مهم‌ترین موارد افشا شده شامل توکن‌های دسترسی و داده‌های زیرساختی سازمان‌های زیر است:

‏* شرکت NIO (در gitlab.nioint.com)
‏* شرکت Xiaomi (در git.n.xiaomi.com)
‏* شرکت Sangfor (در git.sangfor.com)
‏* پلتفرم Bilibili (در git.bilibili.co)
‏* دانشگاه USTC (در git.ustc.edu.cn)

‏جزئیات بیشتر این آسیب‌پذیری در گزارش اصلی محققان قابل بررسی است.

افشای داده‌های حساس از طریق روترهای هوش مصنوعی: تهدیدی جدید در زنجیره تأمین LLM

📊 Data➕Science
‏🎵 ادغام هوش مصنوعی در آهنگ‌سازی با Nova AI

‏محیط Nova AI یک راهکار یکپارچه برای تولید و ویرایش موسیقی است که به‌صورت برنامه مستقل و یا پلاگین در نرم‌افزارهای DAW اجرا می‌شود. این ابزار به شما اجازه می‌دهد با استفاده از متن (Prompt)، سمپل‌های صوتی بسازید یا Stemهای آهنگ را جدا کرده و مستقیماً در پروژه خود استفاده کنید.

‏نکته متمایز این ابزار، پشتیبانی همزمان از مدل‌های ابری و محلی است. مهم‌ترین مدل‌های قابل استفاده در این محیط شامل موارد زیر هستند:

‏- Suno
‏- ElevenLabs
‏- Stable Audio
‏- MiniMax
‏- YuE2

‏امکان اجرای مدل‌هایی مانند Stable Audio Small و YuE2 به‌صورت محلی (Local) باعث می‌شود بخشی از فرآیند تولید موسیقی شما بدون نیاز به اینترنت و با حفظ حریم خصوصی انجام شود. نسخه پایه این نرم‌افزار برای ویندوز و مک رایگان است و ایده‌ای عالی برای متمرکز کردن ابزارهای تولید موسیقی با هوش مصنوعی در محیط کاری شما محسوب می‌شود.

بررسی جامع Nova AI؛ ادغام حرفه‌ای هوش مصنوعی در محیط DAW

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#NovaAI #YuE2
‏🚀 نوآوری در معماری ترنسفورمرها: معرفی RLT

‏محققان دانشگاه پرینستون معماری جدیدی تحت عنوان Recurrent Looped Transformer (RLT) معرفی کرده‌اند که با هدف بهینه‌سازی پردازش توالی‌ها در مدل‌های زبانی طراحی شده است.

‏این مدل با حذف بازنشانی (Reset) در مرزهای Prompt و پاسخ، وضعیت کلی را در تمام توکن‌ها حفظ می‌کند. در این معماری، ۹۶ بلوک منطقی برای هر توکن در نظر گرفته شده که منجر به افزایش عمق محاسباتی بدون تغییر در حجم کار ثابت می‌شود.

‏مهم‌ترین ویژگی‌های این مدل عبارتند از:
‏- تداوم وضعیت: یک State واحد که در طول تمام مراحل پردازش بدون بازنشانی باقی می‌ماند.
‏- ساختار هیبریدی: ترکیب انکودر علی (Causal) و دکودر بازگشتی برای ادغام ویژگی‌ها.
‏- یکپارچگی در یادگیری: طراحی واحد برای مراحل پیش‌آموزش، تنظیم دقیق (SFT) و تقویت یادگیری (RL).

‏برای بررسی جزئیات فنی و دسترسی به پیاده‌سازی، می‌توانید از منابع زیر استفاده کنید:
‏- مقاله علمی
‏- مخزن گیت‌هاب پروژه
‏- وبلاگ تخصصی محقق

معماری RLT: نوآوری در ترنسفورمرهای بازگشتی برای بهینه‌سازی مدل‌های زبانی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
Media is too big
VIEW IN TELEGRAM
‏📸 معرفی Google Pics؛ ابزار جدید هوش مصنوعی گوگل

‏گوگل از ابزار جدیدی به نام Google Pics رونمایی کرد. این ابزار هوش مصنوعی که بر پایه مدل Nano Banana توسعه یافته، برای تولید و ویرایش آسان تصاویر مستقیماً در محیط Workspace طراحی شده است.

‏مهم‌ترین قابلیت‌های این ابزار:
‏• انتخاب و ویرایش مجزای اشیاء درون تصویر
‏• ویرایش و ترجمه متن‌های داخل عکس بدون تغییر فونت
‏• تولید هم‌زمان چندین نسخه متنوع از یک تصویر
‏• امکان همکاری تیمی روی یک پروژه مشترک

‏گوگل ادغام این ابزار را در Docs و Slides آغاز کرده است و در آینده آن را به Drive نیز اضافه خواهد کرد. نسخه مستقل آن نیز همچنان در دسترس کاربران قرار دارد.

‏جزئیات بیشتر را در وبلاگ رسمی گوگل بخوانید.

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Google_Pics #Nano_Banana
This media is not supported in your browser
VIEW IN TELEGRAM
‏🚀 بهینه‌سازی مدل‌های استدلالی: خداحافظی با توکن‌های بیهوده

‏بزرگ‌ترین چالش مدل‌های استدلالی جدید، «بیش‌از‌حد فکر کردن» است؛ جایی که مدل در چرخه‌های فکری تکراری گیر می‌افتد و هزاران توکن را بی‌دلیل هدر می‌دهد. مدل جدید Swift-Qwen3.8-27B با هدف رفع این باگ رفتاری توسعه یافته است.

‏مهم‌ترین نتایج این مدل:
‏• کاهش ۵۸ درصدی مصرف توکن‌های فکری در بنچمارک GPQA بدون افت دقت.
‏• بهبود عملکرد در برنامه‌نویسی؛ جهش دقت در LiveCodeBench از ۷۶ به ۸۱ درصد.
‏• صرفه‌جویی چشمگیر در زمان اجرای محلی؛ حذف توکن‌های زائد یعنی سرعت پاسخ‌دهی بسیار بالاتر در سیستم‌های لوکال.

‏این مدل با قابلیت MTP برای Ollama و llama.cpp بهینه‌سازی شده است. کافیست نسخه‌های GGUF را دریافت کرده و در محیط محلی خود تست کنید.

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Swift_Qwen3 #GPQA_Diamond
‏🚀 معرفی مدل قدرتمند Intern-S2-397B

‏آزمایشگاه هوش مصنوعی شانگهای مدل جدید Intern-S2-397B را با تمرکز ویژه بر استدلال علمی و وظایف عاملی (Agentic) معرفی کرد. این مدل که در دو نسخه BF16 و FP8 منتشر شده، توانسته در بنچمارک‌های تخصصی علمی و کدنویسی به نتایج درخشانی دست یابد.

‏ویژگی‌های کلیدی این مدل عبارتند از:
‏• آموزش مستقیم: برخلاف مدل‌های معمول، متون علمی شامل فرمول‌ها، نمودارها و نمادها مستقیماً و بدون پارسینگ واسطه آموزش دیده‌اند.
‏• پوشش علمی گسترده: پشتیبانی از بیش از ۲۰ حوزه تخصصی از جمله طراحی تعاملات زیست‌مولکولی و مدل‌سازی سری‌های زمانی.
‏• عملکرد عاملی: استفاده از تکنیک long-horizon RL برای اجرای بهینه زنجیره‌های پیچیده دستورات و کار با ابزارها.
‏• نتایج درخشان: کسب امتیاز 87.0 در FrontierScience-Olympiad و 84.0 در SWE-bench Multilingual.

‏برای دسترسی به مستندات و بررسی کامل‌تر مدل می‌توانید به صفحه رسمی در ModelScope مراجعه کنید. این مدل با مجوز Apache 2.0 عرضه شده است.

معرفی Intern-S2-397B: مدل هوش مصنوعی پیشرو در استدلال علمی و وظایف عاملی

📊 Data➕Science
‏🚀 اجرای محلی مدل قدرتمند Qwen3.8-27B روی مک

‏دنیای هوش مصنوعی محلی با انتشار نسخه بهینه‌شده Qwen3.8-27B برای چیپ‌های Apple Silicon وارد مرحله جدیدی شده است. تیم LM Studio این مدل ۲۷ میلیاردی را با استفاده از فریم‌ورک MLX و دقت 4-bit برای اجرا روی سیستم‌های مک آماده کرده‌اند.

‏این مدل چندوجهی از متن و تصویر پشتیبانی می‌کند و با وجود حجم حدود ۱۶ گیگابایتی، برای اجرای روان روی دستگاه، به رم کافی نیاز دارد:

‏- حداقل ۲۴ گیگابایت حافظه یکپارچه (Unified Memory) برای اجرای پایه پیشنهاد می‌شود.
‏- برای پردازش تصاویر یا سناریوهای طولانی‌مدت، استفاده از ۳۲ گیگابایت رم توصیه شده است.

‏این نسخه که با فرمت Safetensors ارائه شده، یکی از مدل‌های برجسته در جامعه ML Studio است که امکان بهره‌گیری از قدرت مدل‌های بزرگ را بدون نیاز به سرورهای ابری و به‌صورت کاملاً محلی فراهم می‌کند.

راهنمای اجرای محلی مدل Qwen3.8-27B روی مک با بهینه‌ساز MLX

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Qwen3_8_27B #MLX
‏📚 یادگیری عمیق نظریه گراف با منبع رایگان

‏نظریه گراف یکی از ارکان اصلی در علوم کامپیوتر و هوش مصنوعی است که کاربردهای گسترده‌ای از شبکه‌های عصبی گرفته تا تحلیل شبکه‌های اجتماعی دارد.

‏کتاب Introduction to Graph Theory نوشته داریج گرینبرگ، یکی از منابع پیشرفته و کاربردی برای درک عمیق این حوزه است. این کتاب علاوه بر بررسی قضایای کلاسیک، رویکردی جبری را دنبال کرده و شامل تمرینات متنوعی برای تسلط بیشتر است.

‏مهم‌ترین مباحث پوشش داده شده در این دوره شامل موارد زیر است:

‏• گراف‌های ساده، چندگانه و جهت‌دار
‏• درخت‌ها و درخت پوشا
‏• دورهای اویلری
‏• رنگ‌آمیزی گراف
‏• تطابق (Matching) و جریان در شبکه

‏شما می‌توانید نسخه کامل این کتاب را به صورت رایگان مطالعه کنید و از قابلیت دستیار هوش مصنوعی موجود در پلتفرم برای درک بهتر مفاهیم استفاده نمایید. این منبع برای دانشجویان و پژوهشگرانی که به دنبال پایه ریاضی قوی در الگوریتم‌ها هستند، بسیار ارزشمند است.

راهنمای جامع کتاب Introduction to Graph Theory داریج گرینبرگ؛ منبع آموزشی رایگان و پیشرفته

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
‏🚀 دستیار هوشمند OpenAI برای بازبینی مقالات علمی

‏آیا تا به حال برای تقویت ساختار و استدلال مقالات خود به دنبال ابزاری دقیق بوده‌اید؟ شرکت OpenAI پلتفرمی با نام Prism طراحی کرده که به پژوهشگران کمک می‌کند کیفیت علمی نوشته‌های خود را ارتقا دهند.

‏این ابزار با تحلیل دقیق متن، خروجی‌های ارزشمندی در زمینه‌های زیر ارائه می‌دهد:

‏• بررسی دقیق نگارش و شفافیت متن
‏• ارزیابی ساختار کلی و استحکام استدلال‌ها
‏• شناسایی خلأهای احتمالی در محتوا
‏• ارائه پیشنهادهایی برای بهبود بخش‌های ضعیف
‏• جستجو و معرفی پژوهش‌های مرتبط که ممکن است از نظر دور مانده باشند

‏استفاده از این دستیار هوشمند می‌تواند فرآیند بازبینی مقالات را پیش از ارسال برای ژورنال‌ها بسیار سریع‌تر و دقیق‌تر کند. این فناوری گام مهمی در جهت تسهیل مسیر پژوهش برای دانشمندان و دانشجویان است.

معرفی Prism؛ دستیار هوشمند OpenAI برای بازبینی و ارتقای کیفیت مقالات علمی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#OpenAI_Prism #بازبینی_مقاله
‏🚀 تحولی در آموزش شبکه با PC-ALM

‏تیم Sakana AI به تازگی روشی نوآورانه برای آموزش شبکه‌های عصبی عمیق بدون استفاده از مکانیزم سنتی Backpropagation معرفی کرده است.

‏در مدل‌های معمول، برای به‌روزرسانی وزن‌ها باید گرادیان‌ها از خروجی تا لایه‌های ابتدایی عبور کنند که در شبکه‌های بسیار عمیق باعث کاهش کیفیت یادگیری می‌شود. روش PC-ALM (Predictive Coding Augmented Lagrangian Method) با الهام از علوم اعصاب، یادگیری را به فرایندهای محلی در هر لایه تبدیل می‌کند.

‏این متد با استفاده از ضرایب لاگرانژ به عنوان متغیرهای کمکی، اجازه می‌دهد شبکه‌هایی تا عمق ۱۰۰۰ لایه تنها با تعاملات محلی آموزش ببینند. مهم‌ترین نکات این روش عبارتند از:

‏- استفاده از خطای پیش‌بینی محلی برای به‌روزرسانی وزن‌ها
‏- به‌کارگیری ضرایب لاگرانژ برای انتقال سیگنال خطا
‏- بهینه‌سازی محاسبات برای سخت‌افزارهای نورومورفیک

‏این رویکرد نه تنها محدودیت‌های Backpropagation را دور می‌زند، بلکه مسیر جدیدی برای طراحی سیستم‌های هوش مصنوعی سازگار با سخت‌افزارهای کم‌مصرف باز می‌کند.

معرفی PC-ALM: تحولی در آموزش شبکه‌های عصبی بدون تکیه بر Backpropagation
@DataPlusScience_linkedin_7505250989063450624_01.pdf
35 MB
‏راهنمای جامع تسلط بر AI Agents

‏ساخت «نمونه اولیه» (Demo) از ایجنت‌های هوشمند ساده است، اما مهندسی سیستم‌های قابل اعتماد و عملیاتی چالش‌برانگیز است. برای عبور از مراحل ابتدایی و رسیدن به ایجنت‌های قابل اتکا، درک عمیق از معماری این سیستم‌ها ضروری است.

‏این منبع آموزشی به‌طور ساختاریافته به مفاهیم کلیدی می‌پردازد:

‏• مبانی و استراتژی: تفاوت اتوماسیون‌های ساده با ایجنت‌های مجهز به LLM، مدل‌های ReAct و استفاده از RAG برای افزایش دقت.
‏• اجزای حیاتی: مدیریت حافظه (Memory)، ابزارهای تعاملی (Tool-calling)، مدیریت وضعیت (State Management) و قابلیت‌های خود-ترمیمی (Self-reflection).
‏• چارچوب‌های محبوب: بررسی و مقایسه LangGraph، AutoGen و CrewAI از نظر سادگی، قابلیت‌های چند-ایجنت و امکانات دیباگ.
‏• تولید و پایداری: نکات عملیاتی نظیر ارزیابی ایجنت‌ها، کنترل هزینه‌ها، کاهش تاخیر و اجرای سیستم‌های Human-in-the-loop.

‏به یاد داشته باشید که هدف نهایی، فقط ساخت یک ایجنت نیست؛ هدف طراحی سیستمی است که بتوان به خروجی‌های آن اعتماد کرد.

راهنمای جامع تسلط بر AI Agents: از معماری پایه تا مهندسی سیستم‌های عملیاتی
‏📚 منبعی جامع برای یادگیری مدل‌های زبانی بزرگ

‏اگر به دنبال درک عمیق از چرخه حیات مدل‌های زبانی مدرن هستید، کتاب جدید و ارزشمند Foundations of Large Language Models (2025) یکی از بهترین گزینه‌هاست. این کتاب برای محققان، مهندسان و دانشجویان پیشرفته حوزه NLP که با مفاهیم پایه یادگیری عمیق آشنایی دارند، طراحی شده است.

‏این اثر به صورت فنی و دقیق، تمامی مراحل از پیش‌آموزش (Pre-training) و طراحی معماری تا هم‌راستاسازی (Alignment) و بهینه‌سازی استنتاج را پوشش می‌دهد.

‏مهم‌ترین مباحث مطرح شده در این کتاب شامل:
‏- روش‌های پیش‌آموزش و استفاده از مدل‌های BERT
‏- آموزش مدل‌ها در مقیاس بزرگ و قوانین مقیاس‌پذیری
‏- تکنیک‌های پیشرفته پرامپت‌نویسی نظیر Chain of Thought و RAG
‏- هم‌راستاسازی مدل با ترجیحات انسانی (RLHF) و روش‌های جدید مانند DPO
‏- بهینه‌سازی استنتاج (Inference) و تکنیک‌های افزایش مقیاس در زمان اجرا

معرفی کامل کتاب Foundations of Large Language Models؛ نقشه راه تخصصی مدل‌های زبانی
‏🤖 پنج سطح خوداصلاحی در هوش مصنوعی

‏پژوهشگران برتر حوزه AI در مقاله جدید خود با عنوان «The Last AI Built by Humans» به بررسی فرآیند «خوداصلاحی بازگشتی» (RSI) پرداخته‌اند. در این مدل، سیستم هوش مصنوعی به جای تکیه بر انسان، تجربیات خود را به تغییرات ساختاری تبدیل می‌کند.

‏این مقاله با تحلیل ۴۹۱ پروژه، مسیر تکامل مدل‌ها را در پنج سطح طبقه‌بندی کرده است:

‏• سطح ۱: هوش مصنوعی صرفاً مجری دستورات انسانی برای بهبود است.
‏• سطح ۲: مدل خودش نقاط ضعف را شناسایی و روش اصلاح را انتخاب می‌کند.
‏• سطح ۳: سیستم علاوه بر اصلاح، خودش تعیین می‌کند چه تجربه‌ای برای گام بعدی نیاز دارد.
‏• سطح ۴: تغییرات در حافظه و کد توسط خود مدل صورت گرفته و به وظایف بعدی منتقل می‌شود.
‏• سطح ۵: هوش مصنوعی می‌تواند «مکانیسم بهبود» خود را بازنویسی کند که عالی‌ترین سطح خودگردانی است.

‏در حال حاضر، اکثر مدل‌های مطرح مانند OpenAI Researcher یا Automated Weak-to-Strong Researcher در سطوح ۱ و ۲ قرار دارند.

طبقه‌بندی خوداصلاحی بازگشتی (RSI)؛ بررسی پنج سطح تکامل هوش مصنوعی
‏🚀 یادگیری تعاملی مقالات علمی با ArXivisual

‏خواندن مقالات تخصصی در arXiv گاهی به دلیل پیچیدگی فرمول‌ها و مفاهیم انتزاعی دشوار است. ابزار جدید ArXivisual با استفاده از هوش مصنوعی، این تجربه را متحول کرده است.

‏کافیست شناسه مقاله مورد نظر خود را در این پلتفرم وارد کنید تا ابزار، ساختار مقاله را تحلیل کرده و مفاهیم کلیدی را شناسایی کند.

‏ویژگی‌های برجسته این ابزار:
‏* تبدیل محتوای متنی به انیمیشن‌های آموزشی دقیق با استفاده از کتابخانه Manim.
‏* تولید روایت صوتی برای درک بهتر بخش‌های پیچیده.
‏* ساده‌سازی مسیر یادگیری برای محققان و دانشجویان.

‏این سیستم با ترکیب ابزارهای بصری‌سازی و مدل‌های زبانی، زمان صرف‌شده برای فهمیدن مقالات عمیق علمی را به‌شدت کاهش می‌دهد.

تحول در یادگیری مقالات علمی با ArXivisual؛ تبدیل متن به انیمیشن‌های تعاملی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#ArXivisual #Manim
‏🚀 سنجش قدرت استدلال در دنیای متغیر با EvolveScaler

‏تیم Tencent Hunyuan با معرفی بنچمارک EvolveScaler، چالش جدیدی برای مدل‌های زبانی بزرگ ایجاد کرده است. برخلاف تست‌های سنتی که صرفاً بر استخراج اطلاعات از متن متمرکز هستند، این ابزار توانایی مدل در «بازسازی وضعیت جهان» پس از تغییرات متوالی را می‌سنجد.

‏در این سناریوها، اطلاعات به‌صورت پویا اصلاح یا لغو می‌شوند و مدل باید بتواند با مدل‌سازی منطق رویدادها، نتایج تغییرات را به‌درستی تحلیل کند. نتایج نشان می‌دهد حتی مدل‌های پیشرو نیز در سطوح دشوار با افت عملکرد شدید مواجه می‌شوند.

‏از مهم‌ترین ویژگی‌های این بنچمارک:
‏- استفاده از ماشین وضعیت برای کنترل منطق رویدادها
‏- بررسی بیش از ۱۰۰ سناریو با تغییرات زنجیره‌ای
‏- ارزیابی دقیق توانایی مدل در محاسبات ضدواقعی (Counterfactual)

‏برای جزئیات بیشتر و دسترسی به نتایج مدل‌ها، مقاله این پروژه را مطالعه کنید.

بنچمارک EvolveScaler؛ چالش جدید Tencent برای سنجش استدلال پویا در مدل‌های زبانی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
‏📊 فرمولاسیون و تبیین ریاضی معماری ترنسفورمرها

‏مقاله جدید A Mathematical Explanation of Transformers چارچوب ریاضی دقیقی برای تحلیل معماری ترنسفورمر و مدل‌های زبانی بزرگ ارائه می‌دهد. در این پژوهش، ترنسفورمر به عنوان گسسته‌سازی یک معادله دیفرانسیل-انتگرال پیوسته مدل‌سازی شده است.

‏مهم‌ترین محورهای ریاضی این مقاله عبارتند از:
‏• تحلیل مکانیزم Self-attention به عنوان یک اپراتور انتگرالی غیرمحلی
‏• تعریف Layer normalization به عنوان تصویرسازی بر یک مجموعه محدود
‏• یکپارچه‌سازی لایه‌های تمام‌متصل و توابع فعال‌ساز در ساختار ریاضی واحد

‏نویسندگان در نهایت با استفاده از روش‌های گسسته‌سازی عددی، این مدل ریاضی را به Vision Transformers و ترنسفورمرهای کانولوشنی تعمیم داده‌اند.

تبیین ریاضی ترنسفورمرها؛ فرمولاسیون معماری یادگیری عمیق با معادلات دیفرانسیل

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
‏🤖 تقابل دیدگاه‌ها در دنیای هوش مصنوعی

‏یان لکان (Yann LeCun)، برنده جایزه تورینگ، با بازنشر مواضع سال ۲۰۱۹ داریو آمودی در زمان حضورش در OpenAI، به انتقاد از سیاست‌های کنونی او پرداخته است.

‏ماجرا از این قرار است که آمودی در آن زمان معتقد بود مدل GPT-2 آن‌قدر خطرناک است که نباید به‌صورت متن‌باز منتشر شود. لکان با یادآوری این موضوع و تمسخر آن دیدگاه، به تکرار سناریوی «خطرناک بودن مدل‌ها» در میان مدیران شرکت‌های بزرگ هوش مصنوعی اعتراض کرد.

‏نکته قابل توجه این است که OpenAI در سال ۲۰۱۹ ابتدا نسخه کوچکی از GPT-2 را منتشر کرد، اما پس از ۹ ماه و عدم مشاهده شواهد قطعی از سوءاستفاده‌های گسترده، نسخه کامل را در دسترس عموم قرار داد.

‏حالا لکان معتقد است که باید همچنان نسبت به این‌گونه ادعاها که منجر به محدودسازی توسعه مدل‌های پیشرفته می‌شود، نگاهی انتقادی داشت. این بحث نشان‌دهنده شکاف عمیق میان معتقدان به رویکردهای احتیاطی و طرفداران شفافیت و توسعه باز در صنعت AI است.

واکاوی تقابل یان لکان و داریو آمودی؛ از GPT-2 تا هشدارهای امروزی

📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما