هوش مصنوعی و علم داده به فارسی
6.07K subscribers
2.19K photos
529 videos
367 files
2.37K links
DataPlusScience | هوش مصنوعی و علم داده به فارسی
اخبار، تحلیل، آموزش و ابزارهای کاربردی

🌐 DataPlusScience.ir

📩 ارتباط با ما: @Contact2Mebot

📂 کانال فایل‌ها: @Datascientists_Files

💎 بله: ble.ir/dataplusscience

💡 ایتا: eitaa.com/DataPlusScience
Download Telegram
‏🌐 انتشار Olmo-core 3 برای آموزش مدل‌های MoE

‏موسسه Ai2 از Olmo-core 3 رونمایی کرد؛ مجموعه‌ای از ابزارهای متن‌باز که برای آموزش مدل‌های Mixture-of-Experts (MoE) با مقیاس یک تریلیون پارامتر بهینه‌سازی شده است. این زیرساخت، جایگزین FSDP شده و از ترکیب expert parallelism، pipeline parallelism و یک بهینه‌ساز توزیع‌شده برای مدیریت بهتر پارامترها روی GPU استفاده می‌کند.

‏عملکرد این سیستم در اجرای مدل‌های MoE به شرح زیر است:

‏- مدل 47 میلیارد پارامتری روی 8 کارت گرافیک B300 به سرعت 52 هزار توکن در ثانیه بر هر GPU رسیده که 2.7 برابر سریع‌تر از نسخه قبل است.
‏- با استفاده از فرمت داده‌ای MXFP8، سرعت نسبت به BF16 حدود 21 درصد افزایش می‌یابد.
‏- افزایش تعداد متخصص‌ها از 8 به 128، کمتر از 5 درصد افت در کارایی (throughput) ایجاد می‌کند.
‏- بزرگ‌ترین تست انجام‌شده شامل یک مدل 1.2 تریلیون پارامتری روی 512 کارت B300 بوده که به نرخ 858 TFLOP/s بر هر GPU دست یافته است.

‏کد این پروژه تحت لایسنس Apache 2.0 منتشر شده است.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
❤1
‏کاهش هزینه‌ها و تأخیر در ایجنت‌های هوش مصنوعی با Jev

‏در معماری ایجنت‌های هوش مصنوعی، مدل‌های پیشرفته (Frontier Models) بخش زیادی از هزینه‌ها و زمان تأخیر را صرف تصمیم‌گیری‌های ساده‌ای می‌کنند که نیازی به تولید متن ندارند. این تصمیمات شامل مواردی مثل انتخاب ابزار، ارزیابی امنیت فراخوانی، تشخیص وضعیت گیرکردن ایجنت و دسته‌بندی جریان‌های ورودی است.

‏مدل Jev که توسط TypeSafe AI توسعه یافته، به‌طور اختصاصی برای این دسته از وظایفِ «سیستم یک» طراحی شده است. برخلاف مدل‌های تولیدکننده، این ابزار وضعیت (State) و پرسش‌های تایپ‌شده را می‌گیرد و پاسخ‌های ساختاریافته با احتمال کالیبره‌شده بازمی‌گرداند.

‏ویژگی‌های کلیدی و کاربردی:
‏* سرعت پردازش ۷۰ تا ۵۰۰ میلی‌ثانیه.
‏* عدم تولید متن و حذف هزینه‌های سنگین بازسازی کش (KV Cache).
‏* امکان استفاده از آن در کنار مدل‌های LLM برای وظایف تخصصی مانند Browser Use یا طبقه‌بندی اسناد.
‏* پشتیبانی از انتخاب، امتیازدهی و فیلترینگ محتوا.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#Jev #Model_Routing
‏کاهش هزینه‌ها و تأخیر در ایجنت‌های هوش مصنوعی با Jev

‏در معماری ایجنت‌های هوش مصنوعی، مدل‌های پیشرفته (Frontier Models) بخش زیادی از هزینه‌ها و زمان تأخیر را صرف تصمیم‌گیری‌های ساده‌ای می‌کنند که نیازی به تولید متن ندارند. این تصمیمات شامل مواردی مثل انتخاب ابزار، ارزیابی امنیت فراخوانی، تشخیص وضعیت گیرکردن ایجنت و دسته‌بندی جریان‌های ورودی است.

‏مدل Jev که توسط TypeSafe AI توسعه یافته، به‌طور اختصاصی برای این دسته از وظایفِ «سیستم یک» طراحی شده است. برخلاف مدل‌های تولیدکننده، این ابزار وضعیت (State) و پرسش‌های تایپ‌شده را می‌گیرد و پاسخ‌های ساختاریافته با احتمال کالیبره‌شده بازمی‌گرداند.

‏ویژگی‌های کلیدی و کاربردی:
‏* سرعت پردازش ۷۰ تا ۵۰۰ میلی‌ثانیه.
‏* عدم تولید متن و حذف هزینه‌های سنگین بازسازی کش (KV Cache).
‏* امکان استفاده از آن در کنار مدل‌های LLM برای وظایف تخصصی مانند Browser Use یا طبقه‌بندی اسناد.
‏* پشتیبانی از انتخاب، امتیازدهی و فیلترینگ محتوا.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#Jev #Model_Routing
‏🤖 دور زدن محدودیت‌های ChatGPT با تکنیک‌های روان‌شناسی

‏پژوهشگران در مطالعه‌ای جدید، ۲۸ هزار مکالمه با ChatGPT را بر اساس تکنیک‌های متقاعدسازی کتاب «Influence» اثر رابرت سیالدینی بررسی کردند. هدف این بوده که مشخص شود آیا ترفندهای روان‌شناختی می‌تواند مدل را به نقض قوانین ایمنی وادارد یا خیر.

‏نتایج نشان می‌دهد در حالی که مدل معمولاً در برابر درخواست‌های مستقیم مقاومت می‌کند، استفاده از تکنیک‌های روان‌شناختی نرخ پذیرش درخواست‌های مسئله‌دار را از ۳۳ درصد به ۷۲ درصد افزایش می‌دهد. مهم‌ترین ترفندهای مؤثر شامل موارد زیر است:

‏* تعهد: گرفتن موافقت اولیه برای یک درخواست ساده و سپس سوق دادن تدریجی مدل به سمت درخواست اصلی.
‏* اقتدار: بهره‌گیری از جایگاه یا نقش تعریف‌شده برای افزایش ۶۵ درصدی احتمال پذیرش دستورات.
‏* کمیابی و تأیید اجتماعی: استفاده از این دو مولفه برای کاهش سطح دفاعی مدل.

‏این مطالعه نشان داد که برای دور زدن لایه‌های حفاظتی مدل، نیازی به هک پیچیده یا کدنویسی نیست و تنها با تغییر ساختار کلامی می‌توان رفتار آن را تغییر داد. جزئیات کامل این آزمایش در مقاله اصلی منتشر شده است.

🇮🇷 سایت | تلگرام
❤2
‏📚 انتشار کتاب جامع بینایی ماشین انویدیا

‏استن برچ‌فیلد از تیم انویدیا، منبع آموزشی کاملی را درباره بینایی ماشین منتشر کرده است. این کتاب تمامی مباحث اصلی، از پردازش تصویر کلاسیک و هندسه سه‌بعدی تا مدل‌های پیشرفته‌ای مثل CNN، ترنسفورمرها، مدل‌های بنیادی و رندرینگ عصبی را پوشش می‌دهد.

‏ویژگی اصلی این مجموعه، ترکیب توضیحات ساده و مفهومی با کدهای اجرایی پایتون است. مهم‌ترین منابع این مجموعه عبارت‌اند از:

‏- متن کامل کتاب
‏- مخزن کدهای پیاده‌سازی
‏- بررسی و جزئیات بیشتر

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#Stan_Birchfield #رندرینگ_عصبی
❤2
‏💰 تکمیل سرمایه‌گذاری ۱۰ میلیارد دلاری سافت‌بانک در OpenAI

‏شرکت سافت‌بانک به‌طور رسمی آخرین بخش از سرمایه‌گذاری ۱۰ میلیارد دلاری خود را به OpenAI منتقل کرد. با این پرداخت، سهم این مجموعه از مالکیت OpenAI به ۱۳ درصد رسید.

‏ماساوشی سان برای تأمین نقدینگی مورد نیاز این سرمایه‌گذاری، تمام سهام خود در شرکت Nvidia را به فروش رساند. همچنین به دلیل فشارهای مالی و اهرم‌های معاملاتی بالا، سافت‌بانک برای تکمیل این پرداخت مجبور به انتشار اوراق قرضه با ریسک بالا (Junk Bond) به ارزش ۱۱.۱ میلیارد دلار شده است.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#SoftBank #OpenAI
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #132 | 📌 8 آیتم گزارش | 🧾 از 12 پست بررسی‌شده
🕐 جمعه 1405/07/10 ساعت 14:00 تا شنبه 1405/07/11 ساعت 14:00

🔎 تحلیل کوتاه
انتشار مدل‌های تخصصی همچون Clef و Jev نشان‌دهنده گرایش به حذف مرحله تولید توکن در ایجنت‌های هوش مصنوعی برای افزایش سرعت تصمیم‌گیری است. این تغییرات معماری بر کاهش هزینه‌ها و تأخیر در ایجنت‌های هوش مصنوعی تمرکز دارد.


🤖 معماری و مدل‌های هوش مصنوعی

انتشار مدل‌های تصمیم‌گیری Clef توسط کلودفلر
مدل‌های وزن‌باز برای ارائه پاسخ‌های ساختاریافته بدون نیاز به تحلیل متنی.
🔗 مشاهده پست

کاهش هزینه‌ها و تأخیر با مدل اختصاصی Jev
ابزار جدید TypeSafe AI برای وظایف سیستمی ایجنت‌ها با سرعت پردازش میلی‌ثانیه‌ای.
🔗 مشاهده پست

تکامل شبکه‌های عصبی بدون آموزش سنتی
معرفی روشی جدید برای تکامل مدل‌ها مبتنی بر انتخاب طبیعی و بقا.
🔗 مطالعه کامل در سایت

ابزار Olmo-core 3 برای آموزش مدل‌های MoE
زیرساخت جدید Ai2 جهت بهینه‌سازی آموزش مدل‌های یک تریلیون پارامتری.
🔗 مشاهده پست


📊 رسانه و تحلیل رفتار مدل‌ها

عرضه نسخه جدید Kling 4.0
قابلیت‌های تولید ویدیو ۳۰ ثانیه‌ای با کیفیت 4K و بهبود پایداری حرکات.
🔗 مشاهده پست

مدل تصویرساز FLUX.1 با سیستم قاب‌بندی
قابلیت ویرایش اجزای تصویر از طریق جابه‌جایی کادرها روی بوم.
🔗 مشاهده پست

دور زدن محدودیت‌های ChatGPT با تکنیک‌های روان‌شناسی
افزایش نرخ موفقیت درخواست‌های مسئله‌دار با استفاده از ترفندهای متقاعدسازی.
🔗 مشاهده پست

تکمیل سرمایه‌گذاری ۱۰ میلیارد دلاری سافت‌بانک در OpenAI
افزایش سهم سافت‌بانک به ۱۳ درصد با فروش سهام انویدیا و انتشار اوراق قرضه.
🔗 مشاهده پست


🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
‏🧬 تکامل شبکه‌های عصبی بدون استفاده از آموزش گرادیانی

‏پژوهشگران سیستمی طراحی کرده‌اند که در آن شبکه‌های عصبی به جای استفاده از روش متداول gradient descent، از طریق فرآیند تکامل آموزش می‌بینند. در این مدل، جمعیتی از شبکه‌های عصبی با مقداردهی تصادفی اولیه ایجاد می‌شوند و با بهره‌گیری از اصول انتخاب طبیعی، شبکه‌های توانمندتر در نسل‌های متوالی باقی می‌مانند.

‏در این سیستم، مدل‌هایی که نقاط قوت مکمل دارند با یکدیگر ترکیب می‌شوند. پارامترهای آن‌ها طی یک فرآیند crossover به شبکه نسل بعد منتقل می‌شود تا ویژگی‌های والدینی را به ارث ببرند. در ادامه، مدل‌های «فرزند» بر اساس یک تابع fitness رقابت می‌کنند و مدل‌های ضعیف‌تر حذف می‌شوند.

‏این رویکرد نشان می‌دهد که می‌توان بدون طی کردن مراحل معمول آموزش، شبکه‌هایی با توانمندی بالا ایجاد کرد. جزئیات فنی و پیاده‌سازی این متد در مقاله پژوهشی آن قابل مشاهده است.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
‏⚡️ بهبود عملکرد مدل‌های ایجنت با RL چند‌محیطی

‏تیم Hugging Face روشی برای آموزش مدل‌های کدنویسی معرفی کرده که تفاوت عملکرد در بنچمارک‌های مختلف (Harness) را از بین می‌برد. این رویکرد به جای تغییر محیط‌ها، از یک پراکسی استفاده می‌کند که با چهار فرمت API استاندارد (OpenAI، Anthropic و Gemini) سازگار است. این پراکسی توکن‌ها و logprobهای مدل را در vLLM ثبت می‌کند تا برای آموزش RL استفاده شوند.

‏در این مدل، مدل LFM2.5-2.6B پس از آموزش در چهار محیط همزمان، دقت خود را از ۴۲٪ به ۵۴٪ افزایش داد و تعداد فراخوانی ابزارها را ۳۱٪ کاهش داد. بررسی‌ها نشان می‌دهد آموزش مستقیم (RL) در چندین محیط، بسیار موثرتر از SFT روی داده‌های مدل‌های بزرگ‌تر است.

‏تمامی ابزارهای این پروژه شامل کد آموزش در TRL، پراکسی ثبت مسیرها، داده‌های SFT و هفت مدل آموزش‌دیده در دسترس قرار گرفته است. جزئیات بیشتر و دموها را می‌توانید در صفحه اختصاصی Hugging Face مشاهده کنید.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#MultiHarnessRL #GRPO
This media is not supported in your browser
VIEW IN TELEGRAM
‏📊 معرفی ابزار NerfBench برای سنجش افت کیفیت مدل‌ها

‏تیم BridgeMind ابزاری به نام NerfBench منتشر کرده است تا تغییرات عملکرد مدل‌های هوش مصنوعی پس از انتشار عمومی را رصد کند. بسیاری از کاربران معتقدند مدل‌ها به مرور زمان دچار افت کیفیت یا «نرف» (Nerf) می‌شوند؛ این بنچمارک برای بررسی دقیق‌تر همین ادعا طراحی شده است.

‏نحوه عملکرد این ابزار به این صورت است:
‏- ثبت عملکرد مدل در روز انتشار به عنوان شاخص ۱۰۰٪.
‏- بررسی دوره‌ای کیفیت خروجی، تعداد توکن‌های مصرفی و هزینه پردازش.
‏- بازه ۹۰ تا ۱۱۰ درصد به عنوان نوسان آماری عادی در نظر گرفته می‌شود.
‏- امتیاز زیر ۹۰ درصد یا افزایش هزینه‌ها، به عنوان افت عملکرد شناسایی می‌شود.

‏برای مثال، طبق اندازه‌گیری‌های اخیر، امتیاز مدل Opus 5.5 به حدود ۹۴ درصد رسیده است که اگرچه هنوز در محدوده عادی قرار دارد، اما بیشترین افت را در میان مدل‌های بررسی‌شده نشان می‌دهد. شرکت BridgeMind مبلغ ۱۰ هزار دلار برای تداوم تست‌ها و افزایش فرکانس بازرسی مدل‌های جدید اختصاص داده است.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#NerfBench #BridgeMind
‏📊 استخدام دانشمند داده ارشد در تپسی‌باکس

‏تیم فنی تپسی‌باکس برای موقعیت شغلی Senior Data Scientist دعوت به همکاری می‌کند. علاقه‌مندان می‌توانند رزومه خود را از طریق لینک سایت شغلی تپسی ارسال کنند.

‏مهم‌ترین مهارت‌های مورد نیاز برای این نقش عبارتند از:
‏• حداقل ۲ سال تجربه در پروژه‌های End-to-End Data Science
‏• تسلط بر Machine Learning، آمار و Data Mining
‏• تسلط بر Python و فریم‌ورک‌های مدرن یادگیری ماشین
‏• توانایی در تحلیل داده‌ها، استخراج الگوها و ساخت مدل‌های پیش‌بینی
‏• توانایی تبدیل داده‌ها به تصمیم‌های تجاری با همکاری تیمی

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#تپسی_باکس #Data_Mining
هوش مصنوعی و علم داده به فارسی
‏🤖 انتشار مدل‌های تصمیم‌گیری Clef توسط Cloudflare ‏کلودفلر از مدل‌های وزن‌باز Clef رونمایی کرد که به جای تولید متن، پاسخ‌های ساختاریافته و دارای نوع (Typed) مانند بله/خیر یا مقیاس‌های عددی ارائه می‌دهند. این مدل‌ها با حذف مرحله تولید توکن، اجازه می‌دهند ایجنت‌ها…
‏🤖 انتشار مدل‌های Clef توسط Cloudflare

‏شرکت Cloudflare دو مدل تصمیم‌گیر (Decision Model) متن‌باز با نام‌های Clef و Clef-flash را تحت لایسنس Apache 2.0 منتشر کرد. این مدل‌ها که وزن‌های آن‌ها در Hugging Face در دسترس است، به جای تولید متن، پاسخ‌های ساختاریافته با احتمال مشخص ارائه می‌دهند و برای وظایفی مانند کلاس‌بندی، اسکورینگ و مسیریابی در پایپ‌لاین‌های داده کاربرد دارند.

‏مدل‌های Clef در مقایسه با مدل Jev تفاوت‌ها و برتری‌های فنی زیر را دارند:

‏* قابلیت چندوجهی: برخلاف Jev، مدل Clef از پردازش تصویر نیز پشتیبانی می‌کند.
‏* ظرفیت متن: طول پنجره متن (Context Window) این مدل به 64 هزار توکن می‌رسد که دو برابر مدل Jev است.
‏* سرعت پردازش: مدل Clef با میانگین پاسخ‌دهی 209 میلی‌ثانیه و مدل Clef-flash با 39 میلی‌ثانیه، از مدل Jev با 524 میلی‌ثانیه سریع‌تر هستند.

‏Cloudflare همچنین یک پلتفرم یادگیری تقویتی (RL) برای آموزش اختصاصی این مدل‌ها بر اساس داده‌های کاربران راه‎‌اندازی کرده است.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#Clef #Decision_Model