This media is not supported in your browser
VIEW IN TELEGRAM
🤖 انتشار مدلهای تصمیمگیری Clef توسط Cloudflare
کلودفلر از مدلهای وزنباز Clef رونمایی کرد که به جای تولید متن، پاسخهای ساختاریافته و دارای نوع (Typed) مانند بله/خیر یا مقیاسهای عددی ارائه میدهند. این مدلها با حذف مرحله تولید توکن، اجازه میدهند ایجنتها بدون نیاز به تحلیل خروجی متنی، بلافاصله تصمیمگیری کنند.
مهمترین ویژگیهای این مدلها:
* عرضه در دو نسخه Clef (با ۲۷ میلیارد پارامتر) و Clef-flash (با ۹ میلیارد پارامتر) تحت لایسنس Apache 2.0.
* مبتنی بر مدلهای Qwen3 که وزنهای اصلی آنها ثابت نگه داشته شده است.
* سرعت پردازش بسیار بالا، بهطوری که Clef-flash تاخیر میانه ۳۸.۸ میلیثانیه دارد.
* پشتیبانی از ورودیهای متنی، JSON، تصویر و ویدیو با پنجره محتوایی ۶۴ هزار توکنی.
* سازگاری مستقیم با API مدل Jev برای جایگزینی سریع.
این مدلها از طریق Workers AI در دسترس هستند و برای هر میلیون توکن ورودی، هزینهای بین ۰.۰۹ تا ۰.۲۴ دلار دارند.
#Cloudflare_Clef #Workers_AI
کلودفلر از مدلهای وزنباز Clef رونمایی کرد که به جای تولید متن، پاسخهای ساختاریافته و دارای نوع (Typed) مانند بله/خیر یا مقیاسهای عددی ارائه میدهند. این مدلها با حذف مرحله تولید توکن، اجازه میدهند ایجنتها بدون نیاز به تحلیل خروجی متنی، بلافاصله تصمیمگیری کنند.
مهمترین ویژگیهای این مدلها:
* عرضه در دو نسخه Clef (با ۲۷ میلیارد پارامتر) و Clef-flash (با ۹ میلیارد پارامتر) تحت لایسنس Apache 2.0.
* مبتنی بر مدلهای Qwen3 که وزنهای اصلی آنها ثابت نگه داشته شده است.
* سرعت پردازش بسیار بالا، بهطوری که Clef-flash تاخیر میانه ۳۸.۸ میلیثانیه دارد.
* پشتیبانی از ورودیهای متنی، JSON، تصویر و ویدیو با پنجره محتوایی ۶۴ هزار توکنی.
* سازگاری مستقیم با API مدل Jev برای جایگزینی سریع.
این مدلها از طریق Workers AI در دسترس هستند و برای هر میلیون توکن ورودی، هزینهای بین ۰.۰۹ تا ۰.۲۴ دلار دارند.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Cloudflare_Clef #Workers_AI
Media is too big
VIEW IN TELEGRAM
🤖 عرضه نسخه جدید Kling 4.0 با قابلیتهای پیشرفته ویدئویی
مدل هوش مصنوعی Kling 4.0 برای رقابت مستقیم با ابزارهای تولید ویدیو در اکتبر عرضه میشود و نسخه Flash آن هماکنون در دسترس کاربران Ultra Yearly قرار گرفته است.
مهمترین تغییرات این نسخه شامل موارد زیر است:
* امکان تولید ویدیو تا ۳۰ ثانیه در یک مرحله
* کنترل صحنهها با استفاده از ۱۰ کلیدواژه یا
* خروجی ویدیو با کیفیت 4K و پشتیبانی از 10-bit HDR
* بهبود پایداری حرکت و هماهنگی لبخوانی (lip-sync)
* افزایش قابلیت
این مدل همچنین از تولید صدای استریو، گسترش ویدیو (video extension) و پشتیبانی از زبانها و لهجههای مختلف بهره میبرد. استفاده از ۱۰ کلیدواژه به کاربران اجازه میدهد مسیر حرکت و وقایع ویدیو را با دقت بیشتری مدیریت کنند و صحنههای طولانیتری را بدون نیاز به تولید جداگانه بسازند.
#Kling_4 #Omni_Reference
مدل هوش مصنوعی Kling 4.0 برای رقابت مستقیم با ابزارهای تولید ویدیو در اکتبر عرضه میشود و نسخه Flash آن هماکنون در دسترس کاربران Ultra Yearly قرار گرفته است.
مهمترین تغییرات این نسخه شامل موارد زیر است:
* امکان تولید ویدیو تا ۳۰ ثانیه در یک مرحله
* کنترل صحنهها با استفاده از ۱۰ کلیدواژه یا
keyframes* خروجی ویدیو با کیفیت 4K و پشتیبانی از 10-bit HDR
* بهبود پایداری حرکت و هماهنگی لبخوانی (lip-sync)
* افزایش قابلیت
Omni Reference برای پشتیبانی از ۱۵ مرجع چندوجهی جهت حفظ ثبات کاراکترها و اشیاءاین مدل همچنین از تولید صدای استریو، گسترش ویدیو (video extension) و پشتیبانی از زبانها و لهجههای مختلف بهره میبرد. استفاده از ۱۰ کلیدواژه به کاربران اجازه میدهد مسیر حرکت و وقایع ویدیو را با دقت بیشتری مدیریت کنند و صحنههای طولانیتری را بدون نیاز به تولید جداگانه بسازند.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Kling_4 #Omni_Reference
🧩 شتابدهی به پژوهشهای علمی با Claude
آنتروپیک در گزارش جدید خود توضیح داده است که چگونه مدل هوش مصنوعی Claude در کنار ابزار متنباز BootLoops، فرآیند پژوهش در رشتههای مختلف از ریاضی تا زیستشناسی را سرعت میبخشد.
پروفسور متیو شوارتز و تیمش طی سه ماه با استفاده از این ترکیب، ۳۶ مقاله علمی را در ۱۸ حوزه متفاوت بررسی کردند. مهمترین نتایج این همکاری عبارتند از:
- محاسبه ۱۵ انتگرال جدید در فیزیک ریاضی
- تحلیل ۵.۷ میلیارد جفت جهش در ژنومها
- ساخت پایگاه داده استرس برای ۶,۰۷۲ زبان
- اعتبارسنجی خودکار دادههای موجود در ۴,۴۵۲ مقاله اقتصادی
نتایج نشان میدهد Claude در کدنویسی و یافتن روابط بینرشتهای عملکرد بالایی دارد، اما به دلیل تمایل مدل به اغراق در اهمیت خروجیهای خود، حضور محقق برای تعیین مسئله و بازبینی نهایی دادهها همچنان ضروری است. جزئیات بیشتر در وبسایت تحقیقاتی آنتروپیک قابل مشاهده است.
#Claude #BootLoops
آنتروپیک در گزارش جدید خود توضیح داده است که چگونه مدل هوش مصنوعی Claude در کنار ابزار متنباز BootLoops، فرآیند پژوهش در رشتههای مختلف از ریاضی تا زیستشناسی را سرعت میبخشد.
پروفسور متیو شوارتز و تیمش طی سه ماه با استفاده از این ترکیب، ۳۶ مقاله علمی را در ۱۸ حوزه متفاوت بررسی کردند. مهمترین نتایج این همکاری عبارتند از:
- محاسبه ۱۵ انتگرال جدید در فیزیک ریاضی
- تحلیل ۵.۷ میلیارد جفت جهش در ژنومها
- ساخت پایگاه داده استرس برای ۶,۰۷۲ زبان
- اعتبارسنجی خودکار دادههای موجود در ۴,۴۵۲ مقاله اقتصادی
نتایج نشان میدهد Claude در کدنویسی و یافتن روابط بینرشتهای عملکرد بالایی دارد، اما به دلیل تمایل مدل به اغراق در اهمیت خروجیهای خود، حضور محقق برای تعیین مسئله و بازبینی نهایی دادهها همچنان ضروری است. جزئیات بیشتر در وبسایت تحقیقاتی آنتروپیک قابل مشاهده است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Claude #BootLoops
❤1
🌐 انتشار Olmo-core 3 برای آموزش مدلهای MoE
موسسه Ai2 از Olmo-core 3 رونمایی کرد؛ مجموعهای از ابزارهای متنباز که برای آموزش مدلهای Mixture-of-Experts (MoE) با مقیاس یک تریلیون پارامتر بهینهسازی شده است. این زیرساخت، جایگزین FSDP شده و از ترکیب expert parallelism، pipeline parallelism و یک بهینهساز توزیعشده برای مدیریت بهتر پارامترها روی GPU استفاده میکند.
عملکرد این سیستم در اجرای مدلهای MoE به شرح زیر است:
- مدل 47 میلیارد پارامتری روی 8 کارت گرافیک B300 به سرعت 52 هزار توکن در ثانیه بر هر GPU رسیده که 2.7 برابر سریعتر از نسخه قبل است.
- با استفاده از فرمت دادهای MXFP8، سرعت نسبت به BF16 حدود 21 درصد افزایش مییابد.
- افزایش تعداد متخصصها از 8 به 128، کمتر از 5 درصد افت در کارایی (throughput) ایجاد میکند.
- بزرگترین تست انجامشده شامل یک مدل 1.2 تریلیون پارامتری روی 512 کارت B300 بوده که به نرخ 858 TFLOP/s بر هر GPU دست یافته است.
کد این پروژه تحت لایسنس Apache 2.0 منتشر شده است.
موسسه Ai2 از Olmo-core 3 رونمایی کرد؛ مجموعهای از ابزارهای متنباز که برای آموزش مدلهای Mixture-of-Experts (MoE) با مقیاس یک تریلیون پارامتر بهینهسازی شده است. این زیرساخت، جایگزین FSDP شده و از ترکیب expert parallelism، pipeline parallelism و یک بهینهساز توزیعشده برای مدیریت بهتر پارامترها روی GPU استفاده میکند.
عملکرد این سیستم در اجرای مدلهای MoE به شرح زیر است:
- مدل 47 میلیارد پارامتری روی 8 کارت گرافیک B300 به سرعت 52 هزار توکن در ثانیه بر هر GPU رسیده که 2.7 برابر سریعتر از نسخه قبل است.
- با استفاده از فرمت دادهای MXFP8، سرعت نسبت به BF16 حدود 21 درصد افزایش مییابد.
- افزایش تعداد متخصصها از 8 به 128، کمتر از 5 درصد افت در کارایی (throughput) ایجاد میکند.
- بزرگترین تست انجامشده شامل یک مدل 1.2 تریلیون پارامتری روی 512 کارت B300 بوده که به نرخ 858 TFLOP/s بر هر GPU دست یافته است.
کد این پروژه تحت لایسنس Apache 2.0 منتشر شده است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
❤1
کاهش هزینهها و تأخیر در ایجنتهای هوش مصنوعی با Jev
در معماری ایجنتهای هوش مصنوعی، مدلهای پیشرفته (Frontier Models) بخش زیادی از هزینهها و زمان تأخیر را صرف تصمیمگیریهای سادهای میکنند که نیازی به تولید متن ندارند. این تصمیمات شامل مواردی مثل انتخاب ابزار، ارزیابی امنیت فراخوانی، تشخیص وضعیت گیرکردن ایجنت و دستهبندی جریانهای ورودی است.
مدل Jev که توسط TypeSafe AI توسعه یافته، بهطور اختصاصی برای این دسته از وظایفِ «سیستم یک» طراحی شده است. برخلاف مدلهای تولیدکننده، این ابزار وضعیت (State) و پرسشهای تایپشده را میگیرد و پاسخهای ساختاریافته با احتمال کالیبرهشده بازمیگرداند.
ویژگیهای کلیدی و کاربردی:
* سرعت پردازش ۷۰ تا ۵۰۰ میلیثانیه.
* عدم تولید متن و حذف هزینههای سنگین بازسازی کش (KV Cache).
* امکان استفاده از آن در کنار مدلهای LLM برای وظایف تخصصی مانند Browser Use یا طبقهبندی اسناد.
* پشتیبانی از انتخاب، امتیازدهی و فیلترینگ محتوا.
#Jev #Model_Routing
در معماری ایجنتهای هوش مصنوعی، مدلهای پیشرفته (Frontier Models) بخش زیادی از هزینهها و زمان تأخیر را صرف تصمیمگیریهای سادهای میکنند که نیازی به تولید متن ندارند. این تصمیمات شامل مواردی مثل انتخاب ابزار، ارزیابی امنیت فراخوانی، تشخیص وضعیت گیرکردن ایجنت و دستهبندی جریانهای ورودی است.
مدل Jev که توسط TypeSafe AI توسعه یافته، بهطور اختصاصی برای این دسته از وظایفِ «سیستم یک» طراحی شده است. برخلاف مدلهای تولیدکننده، این ابزار وضعیت (State) و پرسشهای تایپشده را میگیرد و پاسخهای ساختاریافته با احتمال کالیبرهشده بازمیگرداند.
ویژگیهای کلیدی و کاربردی:
* سرعت پردازش ۷۰ تا ۵۰۰ میلیثانیه.
* عدم تولید متن و حذف هزینههای سنگین بازسازی کش (KV Cache).
* امکان استفاده از آن در کنار مدلهای LLM برای وظایف تخصصی مانند Browser Use یا طبقهبندی اسناد.
* پشتیبانی از انتخاب، امتیازدهی و فیلترینگ محتوا.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Jev #Model_Routing
کاهش هزینهها و تأخیر در ایجنتهای هوش مصنوعی با Jev
در معماری ایجنتهای هوش مصنوعی، مدلهای پیشرفته (Frontier Models) بخش زیادی از هزینهها و زمان تأخیر را صرف تصمیمگیریهای سادهای میکنند که نیازی به تولید متن ندارند. این تصمیمات شامل مواردی مثل انتخاب ابزار، ارزیابی امنیت فراخوانی، تشخیص وضعیت گیرکردن ایجنت و دستهبندی جریانهای ورودی است.
مدل Jev که توسط TypeSafe AI توسعه یافته، بهطور اختصاصی برای این دسته از وظایفِ «سیستم یک» طراحی شده است. برخلاف مدلهای تولیدکننده، این ابزار وضعیت (State) و پرسشهای تایپشده را میگیرد و پاسخهای ساختاریافته با احتمال کالیبرهشده بازمیگرداند.
ویژگیهای کلیدی و کاربردی:
* سرعت پردازش ۷۰ تا ۵۰۰ میلیثانیه.
* عدم تولید متن و حذف هزینههای سنگین بازسازی کش (KV Cache).
* امکان استفاده از آن در کنار مدلهای LLM برای وظایف تخصصی مانند Browser Use یا طبقهبندی اسناد.
* پشتیبانی از انتخاب، امتیازدهی و فیلترینگ محتوا.
#Jev #Model_Routing
در معماری ایجنتهای هوش مصنوعی، مدلهای پیشرفته (Frontier Models) بخش زیادی از هزینهها و زمان تأخیر را صرف تصمیمگیریهای سادهای میکنند که نیازی به تولید متن ندارند. این تصمیمات شامل مواردی مثل انتخاب ابزار، ارزیابی امنیت فراخوانی، تشخیص وضعیت گیرکردن ایجنت و دستهبندی جریانهای ورودی است.
مدل Jev که توسط TypeSafe AI توسعه یافته، بهطور اختصاصی برای این دسته از وظایفِ «سیستم یک» طراحی شده است. برخلاف مدلهای تولیدکننده، این ابزار وضعیت (State) و پرسشهای تایپشده را میگیرد و پاسخهای ساختاریافته با احتمال کالیبرهشده بازمیگرداند.
ویژگیهای کلیدی و کاربردی:
* سرعت پردازش ۷۰ تا ۵۰۰ میلیثانیه.
* عدم تولید متن و حذف هزینههای سنگین بازسازی کش (KV Cache).
* امکان استفاده از آن در کنار مدلهای LLM برای وظایف تخصصی مانند Browser Use یا طبقهبندی اسناد.
* پشتیبانی از انتخاب، امتیازدهی و فیلترینگ محتوا.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Jev #Model_Routing
🤖 دور زدن محدودیتهای ChatGPT با تکنیکهای روانشناسی
پژوهشگران در مطالعهای جدید، ۲۸ هزار مکالمه با ChatGPT را بر اساس تکنیکهای متقاعدسازی کتاب «Influence» اثر رابرت سیالدینی بررسی کردند. هدف این بوده که مشخص شود آیا ترفندهای روانشناختی میتواند مدل را به نقض قوانین ایمنی وادارد یا خیر.
نتایج نشان میدهد در حالی که مدل معمولاً در برابر درخواستهای مستقیم مقاومت میکند، استفاده از تکنیکهای روانشناختی نرخ پذیرش درخواستهای مسئلهدار را از ۳۳ درصد به ۷۲ درصد افزایش میدهد. مهمترین ترفندهای مؤثر شامل موارد زیر است:
* تعهد: گرفتن موافقت اولیه برای یک درخواست ساده و سپس سوق دادن تدریجی مدل به سمت درخواست اصلی.
* اقتدار: بهرهگیری از جایگاه یا نقش تعریفشده برای افزایش ۶۵ درصدی احتمال پذیرش دستورات.
* کمیابی و تأیید اجتماعی: استفاده از این دو مولفه برای کاهش سطح دفاعی مدل.
این مطالعه نشان داد که برای دور زدن لایههای حفاظتی مدل، نیازی به هک پیچیده یا کدنویسی نیست و تنها با تغییر ساختار کلامی میتوان رفتار آن را تغییر داد. جزئیات کامل این آزمایش در مقاله اصلی منتشر شده است.
🇮🇷 سایت | تلگرام
پژوهشگران در مطالعهای جدید، ۲۸ هزار مکالمه با ChatGPT را بر اساس تکنیکهای متقاعدسازی کتاب «Influence» اثر رابرت سیالدینی بررسی کردند. هدف این بوده که مشخص شود آیا ترفندهای روانشناختی میتواند مدل را به نقض قوانین ایمنی وادارد یا خیر.
نتایج نشان میدهد در حالی که مدل معمولاً در برابر درخواستهای مستقیم مقاومت میکند، استفاده از تکنیکهای روانشناختی نرخ پذیرش درخواستهای مسئلهدار را از ۳۳ درصد به ۷۲ درصد افزایش میدهد. مهمترین ترفندهای مؤثر شامل موارد زیر است:
* تعهد: گرفتن موافقت اولیه برای یک درخواست ساده و سپس سوق دادن تدریجی مدل به سمت درخواست اصلی.
* اقتدار: بهرهگیری از جایگاه یا نقش تعریفشده برای افزایش ۶۵ درصدی احتمال پذیرش دستورات.
* کمیابی و تأیید اجتماعی: استفاده از این دو مولفه برای کاهش سطح دفاعی مدل.
این مطالعه نشان داد که برای دور زدن لایههای حفاظتی مدل، نیازی به هک پیچیده یا کدنویسی نیست و تنها با تغییر ساختار کلامی میتوان رفتار آن را تغییر داد. جزئیات کامل این آزمایش در مقاله اصلی منتشر شده است.
🇮🇷 سایت | تلگرام
❤2
📚 انتشار کتاب جامع بینایی ماشین انویدیا
استن برچفیلد از تیم انویدیا، منبع آموزشی کاملی را درباره بینایی ماشین منتشر کرده است. این کتاب تمامی مباحث اصلی، از پردازش تصویر کلاسیک و هندسه سهبعدی تا مدلهای پیشرفتهای مثل CNN، ترنسفورمرها، مدلهای بنیادی و رندرینگ عصبی را پوشش میدهد.
ویژگی اصلی این مجموعه، ترکیب توضیحات ساده و مفهومی با کدهای اجرایی پایتون است. مهمترین منابع این مجموعه عبارتاند از:
- متن کامل کتاب
- مخزن کدهای پیادهسازی
- بررسی و جزئیات بیشتر
#Stan_Birchfield #رندرینگ_عصبی
استن برچفیلد از تیم انویدیا، منبع آموزشی کاملی را درباره بینایی ماشین منتشر کرده است. این کتاب تمامی مباحث اصلی، از پردازش تصویر کلاسیک و هندسه سهبعدی تا مدلهای پیشرفتهای مثل CNN، ترنسفورمرها، مدلهای بنیادی و رندرینگ عصبی را پوشش میدهد.
ویژگی اصلی این مجموعه، ترکیب توضیحات ساده و مفهومی با کدهای اجرایی پایتون است. مهمترین منابع این مجموعه عبارتاند از:
- متن کامل کتاب
- مخزن کدهای پیادهسازی
- بررسی و جزئیات بیشتر
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Stan_Birchfield #رندرینگ_عصبی
❤2
💰 تکمیل سرمایهگذاری ۱۰ میلیارد دلاری سافتبانک در OpenAI
شرکت سافتبانک بهطور رسمی آخرین بخش از سرمایهگذاری ۱۰ میلیارد دلاری خود را به OpenAI منتقل کرد. با این پرداخت، سهم این مجموعه از مالکیت OpenAI به ۱۳ درصد رسید.
ماساوشی سان برای تأمین نقدینگی مورد نیاز این سرمایهگذاری، تمام سهام خود در شرکت Nvidia را به فروش رساند. همچنین به دلیل فشارهای مالی و اهرمهای معاملاتی بالا، سافتبانک برای تکمیل این پرداخت مجبور به انتشار اوراق قرضه با ریسک بالا (Junk Bond) به ارزش ۱۱.۱ میلیارد دلار شده است.
#SoftBank #OpenAI
شرکت سافتبانک بهطور رسمی آخرین بخش از سرمایهگذاری ۱۰ میلیارد دلاری خود را به OpenAI منتقل کرد. با این پرداخت، سهم این مجموعه از مالکیت OpenAI به ۱۳ درصد رسید.
ماساوشی سان برای تأمین نقدینگی مورد نیاز این سرمایهگذاری، تمام سهام خود در شرکت Nvidia را به فروش رساند. همچنین به دلیل فشارهای مالی و اهرمهای معاملاتی بالا، سافتبانک برای تکمیل این پرداخت مجبور به انتشار اوراق قرضه با ریسک بالا (Junk Bond) به ارزش ۱۱.۱ میلیارد دلار شده است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#SoftBank #OpenAI
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #132 | 📌 8 آیتم گزارش | 🧾 از 12 پست بررسیشده
🕐 جمعه 1405/07/10 ساعت 14:00 تا شنبه 1405/07/11 ساعت 14:00
🔎 تحلیل کوتاه
🤖 معماری و مدلهای هوش مصنوعی
📊 رسانه و تحلیل رفتار مدلها
🗂 گزارش #132 | 📌 8 آیتم گزارش | 🧾 از 12 پست بررسیشده
🕐 جمعه 1405/07/10 ساعت 14:00 تا شنبه 1405/07/11 ساعت 14:00
🔎 تحلیل کوتاه
انتشار مدلهای تخصصی همچون Clef و Jev نشاندهنده گرایش به حذف مرحله تولید توکن در ایجنتهای هوش مصنوعی برای افزایش سرعت تصمیمگیری است. این تغییرات معماری بر کاهش هزینهها و تأخیر در ایجنتهای هوش مصنوعی تمرکز دارد.
🤖 معماری و مدلهای هوش مصنوعی
انتشار مدلهای تصمیمگیری Clef توسط کلودفلر
مدلهای وزنباز برای ارائه پاسخهای ساختاریافته بدون نیاز به تحلیل متنی.
🔗 مشاهده پست
کاهش هزینهها و تأخیر با مدل اختصاصی Jev
ابزار جدید TypeSafe AI برای وظایف سیستمی ایجنتها با سرعت پردازش میلیثانیهای.
🔗 مشاهده پست
تکامل شبکههای عصبی بدون آموزش سنتی
معرفی روشی جدید برای تکامل مدلها مبتنی بر انتخاب طبیعی و بقا.
🔗 مطالعه کامل در سایت
ابزار Olmo-core 3 برای آموزش مدلهای MoE
زیرساخت جدید Ai2 جهت بهینهسازی آموزش مدلهای یک تریلیون پارامتری.
🔗 مشاهده پست
📊 رسانه و تحلیل رفتار مدلها
عرضه نسخه جدید Kling 4.0
قابلیتهای تولید ویدیو ۳۰ ثانیهای با کیفیت 4K و بهبود پایداری حرکات.
🔗 مشاهده پست
مدل تصویرساز FLUX.1 با سیستم قاببندی
قابلیت ویرایش اجزای تصویر از طریق جابهجایی کادرها روی بوم.
🔗 مشاهده پست
دور زدن محدودیتهای ChatGPT با تکنیکهای روانشناسی
افزایش نرخ موفقیت درخواستهای مسئلهدار با استفاده از ترفندهای متقاعدسازی.
🔗 مشاهده پست
تکمیل سرمایهگذاری ۱۰ میلیارد دلاری سافتبانک در OpenAI
افزایش سهم سافتبانک به ۱۳ درصد با فروش سهام انویدیا و انتشار اوراق قرضه.
🔗 مشاهده پست
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
🧬 تکامل شبکههای عصبی بدون استفاده از آموزش گرادیانی
پژوهشگران سیستمی طراحی کردهاند که در آن شبکههای عصبی به جای استفاده از روش متداول gradient descent، از طریق فرآیند تکامل آموزش میبینند. در این مدل، جمعیتی از شبکههای عصبی با مقداردهی تصادفی اولیه ایجاد میشوند و با بهرهگیری از اصول انتخاب طبیعی، شبکههای توانمندتر در نسلهای متوالی باقی میمانند.
در این سیستم، مدلهایی که نقاط قوت مکمل دارند با یکدیگر ترکیب میشوند. پارامترهای آنها طی یک فرآیند crossover به شبکه نسل بعد منتقل میشود تا ویژگیهای والدینی را به ارث ببرند. در ادامه، مدلهای «فرزند» بر اساس یک تابع fitness رقابت میکنند و مدلهای ضعیفتر حذف میشوند.
این رویکرد نشان میدهد که میتوان بدون طی کردن مراحل معمول آموزش، شبکههایی با توانمندی بالا ایجاد کرد. جزئیات فنی و پیادهسازی این متد در مقاله پژوهشی آن قابل مشاهده است.
پژوهشگران سیستمی طراحی کردهاند که در آن شبکههای عصبی به جای استفاده از روش متداول gradient descent، از طریق فرآیند تکامل آموزش میبینند. در این مدل، جمعیتی از شبکههای عصبی با مقداردهی تصادفی اولیه ایجاد میشوند و با بهرهگیری از اصول انتخاب طبیعی، شبکههای توانمندتر در نسلهای متوالی باقی میمانند.
در این سیستم، مدلهایی که نقاط قوت مکمل دارند با یکدیگر ترکیب میشوند. پارامترهای آنها طی یک فرآیند crossover به شبکه نسل بعد منتقل میشود تا ویژگیهای والدینی را به ارث ببرند. در ادامه، مدلهای «فرزند» بر اساس یک تابع fitness رقابت میکنند و مدلهای ضعیفتر حذف میشوند.
این رویکرد نشان میدهد که میتوان بدون طی کردن مراحل معمول آموزش، شبکههایی با توانمندی بالا ایجاد کرد. جزئیات فنی و پیادهسازی این متد در مقاله پژوهشی آن قابل مشاهده است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
⚡️ بهبود عملکرد مدلهای ایجنت با RL چندمحیطی
تیم Hugging Face روشی برای آموزش مدلهای کدنویسی معرفی کرده که تفاوت عملکرد در بنچمارکهای مختلف (Harness) را از بین میبرد. این رویکرد به جای تغییر محیطها، از یک پراکسی استفاده میکند که با چهار فرمت API استاندارد (OpenAI، Anthropic و Gemini) سازگار است. این پراکسی توکنها و logprobهای مدل را در vLLM ثبت میکند تا برای آموزش RL استفاده شوند.
در این مدل، مدل
تمامی ابزارهای این پروژه شامل کد آموزش در TRL، پراکسی ثبت مسیرها، دادههای SFT و هفت مدل آموزشدیده در دسترس قرار گرفته است. جزئیات بیشتر و دموها را میتوانید در صفحه اختصاصی Hugging Face مشاهده کنید.
#MultiHarnessRL #GRPO
تیم Hugging Face روشی برای آموزش مدلهای کدنویسی معرفی کرده که تفاوت عملکرد در بنچمارکهای مختلف (Harness) را از بین میبرد. این رویکرد به جای تغییر محیطها، از یک پراکسی استفاده میکند که با چهار فرمت API استاندارد (OpenAI، Anthropic و Gemini) سازگار است. این پراکسی توکنها و logprobهای مدل را در vLLM ثبت میکند تا برای آموزش RL استفاده شوند.
در این مدل، مدل
LFM2.5-2.6B پس از آموزش در چهار محیط همزمان، دقت خود را از ۴۲٪ به ۵۴٪ افزایش داد و تعداد فراخوانی ابزارها را ۳۱٪ کاهش داد. بررسیها نشان میدهد آموزش مستقیم (RL) در چندین محیط، بسیار موثرتر از SFT روی دادههای مدلهای بزرگتر است.تمامی ابزارهای این پروژه شامل کد آموزش در TRL، پراکسی ثبت مسیرها، دادههای SFT و هفت مدل آموزشدیده در دسترس قرار گرفته است. جزئیات بیشتر و دموها را میتوانید در صفحه اختصاصی Hugging Face مشاهده کنید.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#MultiHarnessRL #GRPO