🧠 پیادهسازی گامبهگام مفاهیم عمیق یادگیری ماشین
اگر میخواهید بدانید مدلهای بزرگ هوش مصنوعی در پشت صحنه چطور کار میکنند، مخزن Beyond-NanoGPT یک پل ارتباطی عالی بین کدهای ساده و سیستمهای پیچیده است. این پروژه توسط یکی از دانشجویان دانشگاه استنفورد توسعه یافته و شامل پیادهسازیهای دقیق و خطبهخط مفاهیم مدرن دیپ لرنینگ در PyTorch است.
مهمترین پیادهسازیهای موجود در این مخزن:
• معماریهای پیشرفته مانند Vision Transformer و Diffusion Transformer
• انواع مکانیزمهای توجه از جمله Grouped-Query و cross-attention
• روشهای بهینهسازی سرعت LLM مانند KV-caching و speculative decoding
• الگوریتمهای یادگیری تقویتی کاربردی نظیر DQN و PPO
این پروژه بدون نیاز به کلاسترهای گرانقیمت، روی یک GPU معمولی قابل اجراست و راهنمایی عالی برای درک عمیق مقالات علمی است.
📚 مطالعه با جزئیات بیشتر
#Beyond_NanoGPT #PyTorch
اگر میخواهید بدانید مدلهای بزرگ هوش مصنوعی در پشت صحنه چطور کار میکنند، مخزن Beyond-NanoGPT یک پل ارتباطی عالی بین کدهای ساده و سیستمهای پیچیده است. این پروژه توسط یکی از دانشجویان دانشگاه استنفورد توسعه یافته و شامل پیادهسازیهای دقیق و خطبهخط مفاهیم مدرن دیپ لرنینگ در PyTorch است.
مهمترین پیادهسازیهای موجود در این مخزن:
• معماریهای پیشرفته مانند Vision Transformer و Diffusion Transformer
• انواع مکانیزمهای توجه از جمله Grouped-Query و cross-attention
• روشهای بهینهسازی سرعت LLM مانند KV-caching و speculative decoding
• الگوریتمهای یادگیری تقویتی کاربردی نظیر DQN و PPO
این پروژه بدون نیاز به کلاسترهای گرانقیمت، روی یک GPU معمولی قابل اجراست و راهنمایی عالی برای درک عمیق مقالات علمی است.
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Beyond_NanoGPT #PyTorch
🤖 عامل هوش مصنوعی Hatch؛ گام بزرگ متا در اتوماسیون
شرکت متا خود را برای معرفی دو ابزار جدید آماده میکند. بر اساس گزارشهای تازه، این کمپانی قصد دارد طی هفتههای آینده عامل هوش مصنوعی کاربرمحور خود به نام Hatch را روانه بازار کند. در ادامه این مسیر نیز در ماه اکتبر، از مدل هوش مصنوعی بعدی خود با نام Watermelon رونمایی خواهد کرد.
پروژه Hatch که گفته میشود از OpenClaw الهام گرفته شده است، احتمالاً یک اشتراک ویژه با هزینه ۱۹۹.۹۹ دلار در ماه خواهد داشت. این عامل هوشمند به کاربران اجازه میدهد تا فعالیتهای خود را در پلتفرمهایی مانند DoorDash، Etsy، Reddit، Yelp و Outlook به صورت خودکار مدیریت کنند و از یک داشبورد قابل شخصیسازی بهرهمند شوند.
📚 مطالعه با جزئیات بیشتر
#Hatch #Watermelon
شرکت متا خود را برای معرفی دو ابزار جدید آماده میکند. بر اساس گزارشهای تازه، این کمپانی قصد دارد طی هفتههای آینده عامل هوش مصنوعی کاربرمحور خود به نام Hatch را روانه بازار کند. در ادامه این مسیر نیز در ماه اکتبر، از مدل هوش مصنوعی بعدی خود با نام Watermelon رونمایی خواهد کرد.
پروژه Hatch که گفته میشود از OpenClaw الهام گرفته شده است، احتمالاً یک اشتراک ویژه با هزینه ۱۹۹.۹۹ دلار در ماه خواهد داشت. این عامل هوشمند به کاربران اجازه میدهد تا فعالیتهای خود را در پلتفرمهایی مانند DoorDash، Etsy، Reddit، Yelp و Outlook به صورت خودکار مدیریت کنند و از یک داشبورد قابل شخصیسازی بهرهمند شوند.
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Hatch #Watermelon
🚀 بررسی سختافزارهای جدید اپل برای هوش مصنوعی
شرکت اپل نسل جدید تراشههای خود یعنی M6 و M5 را معرفی کرد که تغییرات قابلتوجهی در سرعت پردازش مدلهای هوش مصنوعی ایجاد کردهاند. این بهروزرسانیها به ویژه در سرعت Prompt processing تا ۴.۸ برابر نسبت به نسل قبل بهبود یافتهاند.
مهمترین مشخصات سختافزاری:
* تراشه M6: دارای ۱۲ هسته CPU و ۱۲ هسته GPU که با ۳۲ گیگابایت حافظه یکپارچه، اجرای مدلهای 7B تا 14B و مدلهای کوانتایز شده 27B-32B را به راحتی ممکن میکند.
* تراشه M5 Pro: با حداکثر ۱۸ هسته CPU و ۲۰ هسته GPU، گزینه مناسبی برای اجرای مدلهای 70B با کوانتایز 4-bit است که به حدود ۴۰ گیگابایت حافظه نیاز دارند.
* تراشه M5 Ultra: غول پردازشی اپل با پشتیبانی از ۵۱۲ گیگابایت حافظه یکپارچه که برای پردازش مدلهای سنگین MoE و کاربردهای حرفهای طراحی شده است.
مدلهای جدید Mac mini با این تراشهها، اکنون از اتصال همزمان به سه نمایشگر پشتیبانی میکنند و در کانفیگهای مختلف برای نیازهای متنوع یادگیری ماشین در دسترس هستند.
📚 مطالعه با جزئیات بیشتر
شرکت اپل نسل جدید تراشههای خود یعنی M6 و M5 را معرفی کرد که تغییرات قابلتوجهی در سرعت پردازش مدلهای هوش مصنوعی ایجاد کردهاند. این بهروزرسانیها به ویژه در سرعت Prompt processing تا ۴.۸ برابر نسبت به نسل قبل بهبود یافتهاند.
مهمترین مشخصات سختافزاری:
* تراشه M6: دارای ۱۲ هسته CPU و ۱۲ هسته GPU که با ۳۲ گیگابایت حافظه یکپارچه، اجرای مدلهای 7B تا 14B و مدلهای کوانتایز شده 27B-32B را به راحتی ممکن میکند.
* تراشه M5 Pro: با حداکثر ۱۸ هسته CPU و ۲۰ هسته GPU، گزینه مناسبی برای اجرای مدلهای 70B با کوانتایز 4-bit است که به حدود ۴۰ گیگابایت حافظه نیاز دارند.
* تراشه M5 Ultra: غول پردازشی اپل با پشتیبانی از ۵۱۲ گیگابایت حافظه یکپارچه که برای پردازش مدلهای سنگین MoE و کاربردهای حرفهای طراحی شده است.
مدلهای جدید Mac mini با این تراشهها، اکنون از اتصال همزمان به سه نمایشگر پشتیبانی میکنند و در کانفیگهای مختلف برای نیازهای متنوع یادگیری ماشین در دسترس هستند.
📚 مطالعه با جزئیات بیشتر
🛡 افزایش امنیت Codex در برابر حذف ناخواسته فایلها
تیم OpenAI پس از گزارشهایی مبنی بر حذف اشتباهی فایلهای کاربران توسط مدل
مهمترین اقدامات حفاظتی انجام شده:
• اصلاح دستورات مدل: مدل اکنون موظف به بررسی دقیق مسیرهای حذف و استفاده از فرآیندهای بازگشتپذیر است.
• اعتبارسنجی اجرایی: سیستمهای بازبینی خودکار برای شناسایی و مسدودسازی دستورات خطرناک تقویت شدهاند.
• محدودسازی دسترسی کامل: فعالسازی حالت
• آموزش مبتنی بر خطا: اضافه شدن سناریوهای آزمایشی جدید برای پیشگیری از تکرار این حوادث در فرآیند آموزش مدل.
به کاربران توصیه میشود ضمن بهروزرسانی
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science
تیم OpenAI پس از گزارشهایی مبنی بر حذف اشتباهی فایلهای کاربران توسط مدل
Codex، پروتکلهای امنیتی خود را بهروزرسانی کرد. این مشکل ناشی از خطای مدل در مدیریت متغیرهای محیطی و مسیرهای دسترسی بود که در موارد نادر باعث میشد دستورات پاکسازی به جای پوشههای موقت، به دایرکتوری اصلی کاربر اشاره کنند.مهمترین اقدامات حفاظتی انجام شده:
• اصلاح دستورات مدل: مدل اکنون موظف به بررسی دقیق مسیرهای حذف و استفاده از فرآیندهای بازگشتپذیر است.
• اعتبارسنجی اجرایی: سیستمهای بازبینی خودکار برای شناسایی و مسدودسازی دستورات خطرناک تقویت شدهاند.
• محدودسازی دسترسی کامل: فعالسازی حالت
Full access دشوارتر و هشدارهای امنیتی آن شفافتر شده است.• آموزش مبتنی بر خطا: اضافه شدن سناریوهای آزمایشی جدید برای پیشگیری از تکرار این حوادث در فرآیند آموزش مدل.
به کاربران توصیه میشود ضمن بهروزرسانی
Codex، از محیطهای ایزوله (Sandbox) استفاده کرده و دسترسیهای مدیریتی را تنها در صورت نیاز و اطمینان از سلامت محیط فعال کنند.📚 مطالعه با جزئیات بیشتر
📊 Data➕Science
This media is not supported in your browser
VIEW IN TELEGRAM
🎨 تبدیل تصاویر به استیکر با هوش مصنوعی
قابلیت جدید ChatGPT به شما اجازه میدهد از هر عکس یا ایده ذهنی، استیکرهای جذاب بسازید. در نسخه جدید ChatGPT Images 2.0، حالتی به نام Stickers اضافه شده که به کاربران امکان میدهد با انتخاب یکی از ۱۸ سبک مختلف (مانند 3D یا انیمه)، استیکرهایی با پسزمینه شفاف تولید کنند.
مهمترین ویژگیهای این قابلیت:
- تولید استیکر از طریق آپلود عکس یا توصیف متنی.
- امکان خروجی گرفتن برای پیامرسانهایی مثل iMessage و WhatsApp.
- دسترسی به قابلیت حذف پسزمینه برای تمامی تصاویر تولیدی.
این ابزار هماکنون در نسخه موبایل اپلیکیشن ChatGPT به صورت رایگان در دسترس کاربران سراسر جهان قرار گرفته است. تغییرات جدید نشاندهنده تمرکز بیشتر OpenAI بر ابزارهای کاربردی و خلاقانه برای استفادههای روزمره است.
#ChatGPT_Images #استیکر
قابلیت جدید ChatGPT به شما اجازه میدهد از هر عکس یا ایده ذهنی، استیکرهای جذاب بسازید. در نسخه جدید ChatGPT Images 2.0، حالتی به نام Stickers اضافه شده که به کاربران امکان میدهد با انتخاب یکی از ۱۸ سبک مختلف (مانند 3D یا انیمه)، استیکرهایی با پسزمینه شفاف تولید کنند.
مهمترین ویژگیهای این قابلیت:
- تولید استیکر از طریق آپلود عکس یا توصیف متنی.
- امکان خروجی گرفتن برای پیامرسانهایی مثل iMessage و WhatsApp.
- دسترسی به قابلیت حذف پسزمینه برای تمامی تصاویر تولیدی.
این ابزار هماکنون در نسخه موبایل اپلیکیشن ChatGPT به صورت رایگان در دسترس کاربران سراسر جهان قرار گرفته است. تغییرات جدید نشاندهنده تمرکز بیشتر OpenAI بر ابزارهای کاربردی و خلاقانه برای استفادههای روزمره است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#ChatGPT_Images #استیکر
راهنمای جامع دسترسی رایگان به مدلهای هوش مصنوعی در ۲۰۲۶
استفاده از سرویسهای هوش مصنوعی بدون هزینه، در سال ۲۰۲۶ بهشدت تغییر کرده است. بسیاری از لیستهای آنلاین قدیمی هستند و محدودیتهای جدیدی برای مدلها وضع شده است. در اینجا مهمترین نکات برای استفاده از منابع رایگان و نیمهرایگان آورده شده است:
* Google AI Studio: بهترین گزینه برای تست ایدهها و پروژههای چندوجهی. محدودیتهای دقیق آن در کنسول نمایش داده میشود و دادههای شما ممکن است برای بهبود مدلها استفاده شود.
* Groq: با سرعت بسیار بالا، انتخابی عالی برای ابزارهای شخصی و پروژههایی است که تأخیر کم در آنها اولویت دارد.
* Cerebras: با ارائه ۱ میلیون توکن در روز، برای پردازش کارهای سریع و دستهبندی عالی است، اما محدودیت 8192 توکنی در Context آن را برای کارهای سنگین محدود میکند.
* OpenRouter: پلتفرمی برای دسترسی به دهها مدل مختلف. با یک پرداخت جزئی (مثلاً ۱۰ دلار)، محدودیت روزانه شما به شکل چشمگیری افزایش مییابد.
* اجرای محلی (Local Models): تنها راهی که هیچ محدودیت نرخ (Rate Limit)، نظارت یا سانسور منطقهای ندارد.
📚 مطالعه با جزئیات بیشتر
استفاده از سرویسهای هوش مصنوعی بدون هزینه، در سال ۲۰۲۶ بهشدت تغییر کرده است. بسیاری از لیستهای آنلاین قدیمی هستند و محدودیتهای جدیدی برای مدلها وضع شده است. در اینجا مهمترین نکات برای استفاده از منابع رایگان و نیمهرایگان آورده شده است:
* Google AI Studio: بهترین گزینه برای تست ایدهها و پروژههای چندوجهی. محدودیتهای دقیق آن در کنسول نمایش داده میشود و دادههای شما ممکن است برای بهبود مدلها استفاده شود.
* Groq: با سرعت بسیار بالا، انتخابی عالی برای ابزارهای شخصی و پروژههایی است که تأخیر کم در آنها اولویت دارد.
* Cerebras: با ارائه ۱ میلیون توکن در روز، برای پردازش کارهای سریع و دستهبندی عالی است، اما محدودیت 8192 توکنی در Context آن را برای کارهای سنگین محدود میکند.
* OpenRouter: پلتفرمی برای دسترسی به دهها مدل مختلف. با یک پرداخت جزئی (مثلاً ۱۰ دلار)، محدودیت روزانه شما به شکل چشمگیری افزایش مییابد.
* اجرای محلی (Local Models): تنها راهی که هیچ محدودیت نرخ (Rate Limit)، نظارت یا سانسور منطقهای ندارد.
📚 مطالعه با جزئیات بیشتر
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #96 | 📌 8 آیتم گزارش | 🧾 از 24 پست بررسیشده
🕐 سهشنبه 1405/06/03 ساعت 14:00 تا چهارشنبه 1405/06/04 ساعت 14:00
🤖 مدلها و الگوریتمهای نوین
⚙️ زیرساختها و معماری هوش مصنوعی
⚖️ امنیت، حقوق و مدیریت دانش
🗂 گزارش #96 | 📌 8 آیتم گزارش | 🧾 از 24 پست بررسیشده
🕐 سهشنبه 1405/06/03 ساعت 14:00 تا چهارشنبه 1405/06/04 ساعت 14:00
🤖 مدلها و الگوریتمهای نوین
معرفی مدلهای جدید GigaEmbeddings در سه سایز مختلف با لایسنس MIT که تحولی بزرگ در سیستمهای RAG و جستجوی معنایی ایجاد کرده و در بنچمارکهای مختلف مورد بررسی قرار گرفتهاند.
🔗 مطالعه کامل در سایت
سیستم FreeToken با بهینهسازی منابع لبه، اجرای مدلهای بزرگ MoE را روی سختافزارهای معمولی و بدون نیاز به کلاود، تا ۴ برابر سریعتر از ابزار Ollama امکانپذیر میسازد.
🔗 مطالعه کامل در سایت
مدل هوش مصنوعی GigaChat 3.5 Ultra با قبولی در آزمون دشوار امنیت اطلاعات، توانمندی بالای خود را در سناریوهای واقعی حفاظت از دادهها و مدیریت رخدادهای امنیتی به اثبات رساند.
🔗 مطالعه کامل در سایت
شرکت OpenAI در بهروزرسانی جدیدی تعرفههای استفاده از API مدل GPT-5.6 را کاهش داد؛ هزینه ورودی ۲۰ درصد و هزینه خروجی ۳۳ درصد کاهش یافته و این تعرفهها تا نوامبر ثابت میمانند.
🔗 مشاهده پست
⚙️ زیرساختها و معماری هوش مصنوعی
اسپیساکس با پروژه Starmind در حال برنامهریزی برای انتقال دیتاسنترهای هوش مصنوعی به مدار زمین با استفاده از ماهوارههای مجهز به پردازندههای گرافیکی Rubin انویدیا است.
🔗 مشاهده پست
بررسی نقش حیاتی زیرساخت Agent Harness به عنوان ستون فقرات عملیاتی هوش مصنوعی در اجرای وظایف پیچیده و طولانیمدت، فراتر از خود مدلهای زبانی بزرگ.
🔗 مطالعه کامل در سایت
⚖️ امنیت، حقوق و مدیریت دانش
راهنمای جامع ساخت «مغز سازمانی» هوشمند برای یکپارچهسازی دانش پراکنده در چتهای هوش مصنوعی شخصی و تبدیل آن به سیستمی منسجم جهت یادگیری تیمی و جلوگیری از تکرار اشتباهات.
🔗 مطالعه کامل در سایت
دادستان کل آلاباما تحقیقات گستردهای را علیه OpenAI و سم آلتمن آغاز کرده است؛ این پرونده به دلیل نقش احتمالی یک مدل آزمایشی بدون نظارت در هک شرکت Hugging Face تشکیل شده است.
🔗 مشاهده پست
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
@DataPlusScience_linkedin_7497194977622581248_01.pdf
4.9 MB
📚 معرفی کتاب Beyond Vibe Coding؛ برنامهنویسی در عصر هوش مصنوعی
اصطلاح Vibe Coding که توسط آندری کارپاتی مطرح شد، به رویکرد جدیدی اشاره دارد که در آن توسعهدهنده با زبان طبیعی خواسته خود را توصیف میکند و LLM کار پیادهسازی را انجام میدهد. اما تکیه مطلق بر این روش بدون برنامهریزی قبلی، میتواند به کدهای ناپایدار و بدون ساختار منجر شود.
کتاب کاربردی Beyond Vibe Coding نوشته Addy Osmani به بررسی این تحول بزرگ میپردازد. این اثر نشان میدهد چگونه به عنوان یک برنامهنویس، از نوشتن خطوط کد به سمت هدایت هوشمندانه AI و برنامهنویسی مبتنی بر Intent حرکت کنید، کیفیت کدهای تولیدی را بسنجید و نقش خود را به یک معمار نرمافزار ارتقا دهید.
اصطلاح Vibe Coding که توسط آندری کارپاتی مطرح شد، به رویکرد جدیدی اشاره دارد که در آن توسعهدهنده با زبان طبیعی خواسته خود را توصیف میکند و LLM کار پیادهسازی را انجام میدهد. اما تکیه مطلق بر این روش بدون برنامهریزی قبلی، میتواند به کدهای ناپایدار و بدون ساختار منجر شود.
کتاب کاربردی Beyond Vibe Coding نوشته Addy Osmani به بررسی این تحول بزرگ میپردازد. این اثر نشان میدهد چگونه به عنوان یک برنامهنویس، از نوشتن خطوط کد به سمت هدایت هوشمندانه AI و برنامهنویسی مبتنی بر Intent حرکت کنید، کیفیت کدهای تولیدی را بسنجید و نقش خود را به یک معمار نرمافزار ارتقا دهید.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🚀 معرفی مدل قدرتمند Qwen3.8-Flash
تیم Qwen از مدل جدید خود با نام Qwen3.8-Flash رونمایی کرد؛ یک مدل چندوجهی (Multimodal) از نوع MoE که پیشنمایشی از معماری نسل آینده یعنی Qwen4 محسوب میشود.
این مدل با وجود ۱۲۵ میلیارد پارامتر، تنها ۶ میلیارد پارامتر را برای هر توکن فعال میکند که منجر به بهینگی خیرهکنندهای شده است. از دیگر ویژگیهای فنی این مدل میتوان به موارد زیر اشاره کرد:
- پشتیبانی از متن پیشفرض ۲۶۲ هزار توکن با قابلیت گسترش تا ۱ میلیون
- استفاده از معماری نوین شامل GDN و QSA hybrid attention
- بهینهسازی هزینههای آموزش تا ۹ برابر کمتر از مدلهای قبلی
- ثبت نتایج درخشان در بنچمارکهای مطرحی چون MathVision با امتیاز ۹۵.۷ و SWE-bench Pro با ۶۲.۵
شما میتوانید جزئیات فنی و گزارش کامل این مدل را در گزارش تخصصی Qwen مطالعه کرده و وزنهای نسخه اولیه آن را از هگینگفیس دریافت کنید. نسخه تولیدی این مدل نیز در پلتفرم QwenCloud با قیمت بسیار رقابتی در دسترس قرار گرفته است.
📚 مطالعه با جزئیات بیشتر
#Qwen3_8_Flash #Muon_optimizer
تیم Qwen از مدل جدید خود با نام Qwen3.8-Flash رونمایی کرد؛ یک مدل چندوجهی (Multimodal) از نوع MoE که پیشنمایشی از معماری نسل آینده یعنی Qwen4 محسوب میشود.
این مدل با وجود ۱۲۵ میلیارد پارامتر، تنها ۶ میلیارد پارامتر را برای هر توکن فعال میکند که منجر به بهینگی خیرهکنندهای شده است. از دیگر ویژگیهای فنی این مدل میتوان به موارد زیر اشاره کرد:
- پشتیبانی از متن پیشفرض ۲۶۲ هزار توکن با قابلیت گسترش تا ۱ میلیون
- استفاده از معماری نوین شامل GDN و QSA hybrid attention
- بهینهسازی هزینههای آموزش تا ۹ برابر کمتر از مدلهای قبلی
- ثبت نتایج درخشان در بنچمارکهای مطرحی چون MathVision با امتیاز ۹۵.۷ و SWE-bench Pro با ۶۲.۵
شما میتوانید جزئیات فنی و گزارش کامل این مدل را در گزارش تخصصی Qwen مطالعه کرده و وزنهای نسخه اولیه آن را از هگینگفیس دریافت کنید. نسخه تولیدی این مدل نیز در پلتفرم QwenCloud با قیمت بسیار رقابتی در دسترس قرار گرفته است.
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#Qwen3_8_Flash #Muon_optimizer
🚀 معرفی مدل GLM-5.3-Flash؛ بهرهوری بالا در پردازش متن و تصویر
مدل جدید GLM-5.3-Flash به عنوان اولین مدل ناتیومولتیمودال در سری GLM-5 عرضه شد. این مدل با معماری بهینهشده، برای مدیریت متنهای بسیار طولانی و هزینههای عملیاتی پایین طراحی شده است.
از مهمترین ویژگیهای این مدل میتوان به موارد زیر اشاره کرد:
* استفاده از معماری هیبریدی (Sparse و Linear Attention) برای افزایش سرعت و کاهش محاسبات.
* پشتیبانی از کانتکست تا سقف ۱ میلیون توکن.
* کاهش ۴.۴۴ برابری حافظه KV-cache.
* قابلیت پردازش مستقیم تصاویر و تعامل با واسطهای کاربری (GUI).
* کارایی بالا در برنامهنویسی، کارهای اداری، تحقیقاتی و تحلیل اسناد.
در زمینه هزینهها، این مدل با مدلهای پیشرو بازار مقایسه شده است. قیمت ورودی آن ۰.۱۵ دلار و قیمت خروجی ۰.۵ دلار تعیین شده که در حال حاضر با تخفیف ۵۰ درصدی ارائه میشود. جزئیات فنی و مستندات کامل را میتوانید در Model ID: glm-5.3-flash مشاهده کنید.
📚 مطالعه با جزئیات بیشتر
#GLM_5 #Sparse_Attention
مدل جدید GLM-5.3-Flash به عنوان اولین مدل ناتیومولتیمودال در سری GLM-5 عرضه شد. این مدل با معماری بهینهشده، برای مدیریت متنهای بسیار طولانی و هزینههای عملیاتی پایین طراحی شده است.
از مهمترین ویژگیهای این مدل میتوان به موارد زیر اشاره کرد:
* استفاده از معماری هیبریدی (Sparse و Linear Attention) برای افزایش سرعت و کاهش محاسبات.
* پشتیبانی از کانتکست تا سقف ۱ میلیون توکن.
* کاهش ۴.۴۴ برابری حافظه KV-cache.
* قابلیت پردازش مستقیم تصاویر و تعامل با واسطهای کاربری (GUI).
* کارایی بالا در برنامهنویسی، کارهای اداری، تحقیقاتی و تحلیل اسناد.
در زمینه هزینهها، این مدل با مدلهای پیشرو بازار مقایسه شده است. قیمت ورودی آن ۰.۱۵ دلار و قیمت خروجی ۰.۵ دلار تعیین شده که در حال حاضر با تخفیف ۵۰ درصدی ارائه میشود. جزئیات فنی و مستندات کامل را میتوانید در Model ID: glm-5.3-flash مشاهده کنید.
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#GLM_5 #Sparse_Attention
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 ساخت بزرگترین مجموعه داده جهان برای رباتهای هوشمند
شرکت FigureAI در حال توسعه عظیمترین دیتاسِت آموزشی برای رباتهای انساننما است. این استارتاپ با استفاده از پلتفرم Index، ویدئوهای مربوط به فعالیتهای روزمره انسانها را جمعآوری میکند تا به هوش مصنوعی کمک کند تعامل با دنیای فیزیکی را بهتر درک کند.
برخی از جزئیات این پروژه در مقیاس بزرگ:
- جمعآوری بیش از ۱۵ میلیون ویدئوی آموزشی.
- پردازش لحظهای معادل ۵ سال کارِ انسانی در هر شبانهروز.
- بهکارگیری این دادهها برای آموزش مدل Helix و دستیابی به نتایج درخشان در تعمیمپذیری (Generalization).
- برنامهریزی برای ۱۰۰ برابر کردن حجم دادهها در سال آینده با بودجهای بیش از ۱ میلیارد دلار.
این رویکرد نشان میدهد که نبرد اصلی در دنیای رباتیک، نه فقط در الگوریتمها، بلکه در دسترسی به حجم وسیعی از دادههای ویدئویی متنوع برای آموزش مدلهای پایه نهفته است.
📚 مطالعه با جزئیات بیشتر
#FigureAI #Helix
شرکت FigureAI در حال توسعه عظیمترین دیتاسِت آموزشی برای رباتهای انساننما است. این استارتاپ با استفاده از پلتفرم Index، ویدئوهای مربوط به فعالیتهای روزمره انسانها را جمعآوری میکند تا به هوش مصنوعی کمک کند تعامل با دنیای فیزیکی را بهتر درک کند.
برخی از جزئیات این پروژه در مقیاس بزرگ:
- جمعآوری بیش از ۱۵ میلیون ویدئوی آموزشی.
- پردازش لحظهای معادل ۵ سال کارِ انسانی در هر شبانهروز.
- بهکارگیری این دادهها برای آموزش مدل Helix و دستیابی به نتایج درخشان در تعمیمپذیری (Generalization).
- برنامهریزی برای ۱۰۰ برابر کردن حجم دادهها در سال آینده با بودجهای بیش از ۱ میلیارد دلار.
این رویکرد نشان میدهد که نبرد اصلی در دنیای رباتیک، نه فقط در الگوریتمها، بلکه در دسترسی به حجم وسیعی از دادههای ویدئویی متنوع برای آموزش مدلهای پایه نهفته است.
📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#FigureAI #Helix
هوش مصنوعی و علم داده به فارسی
🚀 معرفی مدل GLM-5.3-Flash؛ بهرهوری بالا در پردازش متن و تصویر مدل جدید GLM-5.3-Flash به عنوان اولین مدل ناتیومولتیمودال در سری GLM-5 عرضه شد. این مدل با معماری بهینهشده، برای مدیریت متنهای بسیار طولانی و هزینههای عملیاتی پایین طراحی شده است. از مهمترین…
🚀 درخشش مدل جدید GLM در دنیای کدنویسی
مدل جدید
نکته قابل توجه درباره این مدل، بازدهی بالای آن در مقایسه با مدل
• مدل
• مدل
این مدل با قیمتگذاری رقابتی ۰.۱۵ تا ۰.۵ دلار به ازای هر میلیون توکن، تعادل جدیدی در عملکرد و هزینه ایجاد کرده است. امتیازهای فعلی بر اساس سیستم
📚 مطالعه با جزئیات بیشتر
#GLM_5 #AutoEval
مدل جدید
GLM-5.3-Flash با ورود به عرصه رقابت، توانسته است رتبه پنجم در Code Arena بخش WebDev را کسب کند و به عنوان دومین مدل متنباز قدرتمند خود را مطرح کند.نکته قابل توجه درباره این مدل، بازدهی بالای آن در مقایسه با مدل
GLM-5.3-Max است:• مدل
Flash با ۳۲۰ میلیارد پارامتر کل (۱۸ میلیارد پارامتر فعال) به امتیاز ۱۶۳۴ رسیده است.• مدل
Max با ۷۵۳ میلیارد پارامتر کل (۴۰ میلیارد پارامتر فعال) رتبه هشتم را در اختیار دارد.این مدل با قیمتگذاری رقابتی ۰.۱۵ تا ۰.۵ دلار به ازای هر میلیون توکن، تعادل جدیدی در عملکرد و هزینه ایجاد کرده است. امتیازهای فعلی بر اساس سیستم
AutoEval (مبتنی بر مدلهای پاداش آموزشدیده با دادههای ترجیحی انسانی) محاسبه شده و با افزایش رایهای انسانی در وبسایت Arena، دقت این بنچمارک دقیقتر خواهد شد.📚 مطالعه با جزئیات بیشتر
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#GLM_5 #AutoEval