آموزش پایتون
88 subscribers
281 photos
21 videos
81 files
178 links
ارتباط با ما:
@learnpythonicyBot

لینک گروه چت:
https://t.me/learnpythonicychat

لینک چنل ایتا:
https://eitaa.com/learnpythonicy
Download Telegram
🔥Five AI articles that you really have to read!

پنج مقاله AI که واقعاً در ۲۰۲۵ باید بخوانی!

از کشف علمی مستقل تا ژنتیک و الگوریتم‌های مولد پیشرفته

✔️ اگر دنبال پیشرفت‌های واقعی در AI هستی، این اسلایدها رو از دست نده!
✔️ هر مقاله دیدی به مسیر آینده‌ی AI اشاره می‌کنه — از تحقیق تا مهندسی.

لینک دانلود مقالات:
1: https://arxiv.org/abs/2503.08979
2: https://arxiv.org/abs/2408.06292
3: https://arxiv.org/abs/2506.13131
4: https://www.biorxiv.org/content/10.1101/2025.06.25.661532v1
5: https://arxiv.org/abs/2506.17298


👇 به نظرت کدوم یکی پرقدرت‌تره؟
یا مقاله دیگه‌ای توی ۲۰۲۵ هست که ارزش خوندن داره؟
منتظر نظرات‌تون هستم!

#هوش_مصنوعی #AI #LLM #DL #AIResearch #Paper
@learnpythonicy
#carousel
🧠 GRPO — The Next Step After PPO?

همه با PPO آشنا هستیم (Policy Optimization برای RLHF)،
اما OpenAI اخیراً از GRPO استفاده کرده – و این می‌تونه آینده آموزش مدل‌های زبان باشه.

چی هست؟
GRPO = Group Relative Policy Optimization
به جای مقایسه یک پاسخ با یک پاسخ مرجع، مدل چند پاسخ تولید می‌کنه،
همه رو با هم مقایسه می‌کنه، و فقط بهترین‌ها رو تقویت می‌کنه.

🎯 چرا مهمه؟

بهینه‌تر از PPO برای یادگیری از بازخورد انسانی

می‌تونه تنوع پاسخ‌ها رو افزایش بده

پایدارتر در مقایسه با روش‌های قبلی


⚙️ به زبان ساده:
به جای اینکه مدل رو مجبور کنیم فقط یک پاسخ خوب رو تقلید کنه،
بهش یاد می‌دیم چند تا پاسخ مختلف بسازه و بعد از مقایسه بین خودش،
راه بهینه رو انتخاب کنه.

💭 سوال برای شما:
آیا فکر می‌کنید GRPO می‌تونه جایگزین PPO بشه برای RLHF در آینده؟
یا هر دو در کنار هم باقی می‌مونن؟

#AI #RLHF #ReinforcementLearning #MachineLearning #GRPO #PPO #LLM