یه بنچمارک تازه نشون داد مدلهای کد توی کدبیس واقعی شرکتها زمین میخورن 🧑💻📉
یه آزمایشگاه به اسم Specific Labs بنچمارکی به اسم Real-SWE منتشر کرده که فرقش با بقیه اینه: تسکها از کدبیس خصوصیِ شرکتهای واقعی برداشته شدن — کدی که هیچوقت روی اینترنت نبوده و توی آموزش هیچ مدلی نیومده. نتیجهش اینه:
🔹 بهترین نتیجه: Fable 5.1 با Claude Code — فقط ۳۸.۸٪ از تسکها
🔹 بعد از اون GPT-6 Astra (۳۳.۸٪) و Gemini 3.8 Flash (۳۱.۲٪)
🔹 آخرین ردیف: GPT-5.6 Sol با Codex CLI — ۱۶.۲٪
🔹 ۶ تسک از ۱۰ تسک نرخ حل زیر ۱۵٪ داشتن
🔹 سختترین تسک رو هیچ مدلی حل نکرد: صفر از ۸
هر تسک ۸ بار اجرا شده — در کل ۶۴۰ اجرا. هزینه هم معیار تعیینکنندهای نیست: Fable 5.1 هم گرونترین اجرا رو داشت (۶.۹۶ دلار) و هم بهترین نتیجه، ولی Gemini 3.8 Flash با ۲.۵ دلار سوم شد.
🔗 @hjcreative
یه آزمایشگاه به اسم Specific Labs بنچمارکی به اسم Real-SWE منتشر کرده که فرقش با بقیه اینه: تسکها از کدبیس خصوصیِ شرکتهای واقعی برداشته شدن — کدی که هیچوقت روی اینترنت نبوده و توی آموزش هیچ مدلی نیومده. نتیجهش اینه:
🔹 بهترین نتیجه: Fable 5.1 با Claude Code — فقط ۳۸.۸٪ از تسکها
🔹 بعد از اون GPT-6 Astra (۳۳.۸٪) و Gemini 3.8 Flash (۳۱.۲٪)
🔹 آخرین ردیف: GPT-5.6 Sol با Codex CLI — ۱۶.۲٪
🔹 ۶ تسک از ۱۰ تسک نرخ حل زیر ۱۵٪ داشتن
🔹 سختترین تسک رو هیچ مدلی حل نکرد: صفر از ۸
هر تسک ۸ بار اجرا شده — در کل ۶۴۰ اجرا. هزینه هم معیار تعیینکنندهای نیست: Fable 5.1 هم گرونترین اجرا رو داشت (۶.۹۶ دلار) و هم بهترین نتیجه، ولی Gemini 3.8 Flash با ۲.۵ دلار سوم شد.
🔗 @hjcreative
حسین جوان | هوش مصنوعی و خلاقیت
یه بنچمارک تازه نشون داد مدلهای کد توی کدبیس واقعی شرکتها زمین میخورن 🧑💻📉 یه آزمایشگاه به اسم Specific Labs بنچمارکی به اسم Real-SWE منتشر کرده که فرقش با بقیه اینه: تسکها از کدبیس خصوصیِ شرکتهای واقعی برداشته شدن — کدی که هیچوقت روی اینترنت نبوده…
🔴 ولی یه اما هست…
🔹 این بنچمارک عمداً کدبیسهای خصوصی رو انتخاب کرده؛ یعنی کدی که توی دیتای آموزشی هیچ مدلی نبوده. به همین دلیل نمیشه روی تستهاش «ترین» کرد — برخلاف SWE-bench که چند ساله توی دیتای آموزش مدلهاست.
🔹 هر تسک توی یه سندباکس جدا اجرا میشه و سرویسهای واقعی شرکت (دیتابیس، سرویس مالیاتی، لجر) در اختیار مدل قرار میگیره. داورها هم موقع تصحیح تزریق میشن. یعنی مدل باید هم کد رو بفهمه، هم با سرویسهای بیرونی حرف بزنه.
🔹 یه نکتهی جالب: طولانیتر شدن اجرا کمکی نکرد. نرخ شکست اجراهای زیر ۱۰ دقیقه ۷۱.۴٪ بود و اجراهای بالای ۱۰ دقیقه ۷۳.۴٪.
🔹 انتقادها هم واردن: چون کدبیسها محرمانهست، هیچکس نمیتونه نتایج رو بازتولید کنه؛ توی Hacker News یکی گفت این «بنچمارک با قول شرف»ه. با این حال خیلیها گفتن عدد حدود ۳۰٪ با تجربهی خودشون از کار با این مدلها میخونه.
🔹 پرتکرارترین خطا هم «فرض تأییدنشده» بود؛ یعنی مدل بهجای اینکه بره توی کد چک کنه، حدس میزنه.
منبع: withspecific.com/benchmarks/real-swe
🔗 @hjcreative
🔹 این بنچمارک عمداً کدبیسهای خصوصی رو انتخاب کرده؛ یعنی کدی که توی دیتای آموزشی هیچ مدلی نبوده. به همین دلیل نمیشه روی تستهاش «ترین» کرد — برخلاف SWE-bench که چند ساله توی دیتای آموزش مدلهاست.
🔹 هر تسک توی یه سندباکس جدا اجرا میشه و سرویسهای واقعی شرکت (دیتابیس، سرویس مالیاتی، لجر) در اختیار مدل قرار میگیره. داورها هم موقع تصحیح تزریق میشن. یعنی مدل باید هم کد رو بفهمه، هم با سرویسهای بیرونی حرف بزنه.
🔹 یه نکتهی جالب: طولانیتر شدن اجرا کمکی نکرد. نرخ شکست اجراهای زیر ۱۰ دقیقه ۷۱.۴٪ بود و اجراهای بالای ۱۰ دقیقه ۷۳.۴٪.
🔹 انتقادها هم واردن: چون کدبیسها محرمانهست، هیچکس نمیتونه نتایج رو بازتولید کنه؛ توی Hacker News یکی گفت این «بنچمارک با قول شرف»ه. با این حال خیلیها گفتن عدد حدود ۳۰٪ با تجربهی خودشون از کار با این مدلها میخونه.
🔹 پرتکرارترین خطا هم «فرض تأییدنشده» بود؛ یعنی مدل بهجای اینکه بره توی کد چک کنه، حدس میزنه.
منبع: withspecific.com/benchmarks/real-swe
🔗 @hjcreative
Withspecific
Real-SWE Benchmark — Specific Labs
Real-SWE benchmarks frontier AI models on private production codebases licensed from real companies. Eight model and harness configurations, ten tasks, 640 scored rollouts.
This media is not supported in your browser
VIEW IN TELEGRAM
یه موشن دیزاینر به AI چالش داد، Higgsfield جواب داد: «calling....» 📞🎬
ماجرا از یه توییت شروع شد که با طنز میگفت «دوستای موشن دیزاینرم دارن برای همیشه جایگزین میشن». یه طراح موشن (Eniola Emmanuel) جوابش رو با ویدیوی کار خودش داد: «وقتی AI تونست این رو بازسازی کنه، بهم زنگ بزن».
چند ساعت بعد تیم Higgsfield اومد زیر همون توییت و یه ویدیوی ۴۶ ثانیهای گذاشت: صفحهی After Effects، پروژهای به اسم Eniola_Recreation، با پرامپت «recreate this motion» روی ویدیوی خودِ اون طراح.
ایجنت هم مرحلهبهمرحله جلو رفته: کل صحنههای کار (۰۱ INTRO تا ۱۴ INCREASE) رو ساخته، توی لاگش نوشته «کارت ورودی و متن وضعیت رو فریمبهفریم با ویدیوی مرجع تطبیق میدم» و حتی کروهای easing رو خودش تنظیم کرده. مدل پشتش هم GPT-6 Astra Ultra بوده.
نتیجه؟ زیر همون توییت بحث داغه: یکی میگه «اینجاست که لمس انسانی همیشه برندهست» و یکی میگه «به این زودیها این اتفاق نمیافته» 👀
به نظرتون کدوم؟
🔗 @hjcreative
ماجرا از یه توییت شروع شد که با طنز میگفت «دوستای موشن دیزاینرم دارن برای همیشه جایگزین میشن». یه طراح موشن (Eniola Emmanuel) جوابش رو با ویدیوی کار خودش داد: «وقتی AI تونست این رو بازسازی کنه، بهم زنگ بزن».
چند ساعت بعد تیم Higgsfield اومد زیر همون توییت و یه ویدیوی ۴۶ ثانیهای گذاشت: صفحهی After Effects، پروژهای به اسم Eniola_Recreation، با پرامپت «recreate this motion» روی ویدیوی خودِ اون طراح.
ایجنت هم مرحلهبهمرحله جلو رفته: کل صحنههای کار (۰۱ INTRO تا ۱۴ INCREASE) رو ساخته، توی لاگش نوشته «کارت ورودی و متن وضعیت رو فریمبهفریم با ویدیوی مرجع تطبیق میدم» و حتی کروهای easing رو خودش تنظیم کرده. مدل پشتش هم GPT-6 Astra Ultra بوده.
نتیجه؟ زیر همون توییت بحث داغه: یکی میگه «اینجاست که لمس انسانی همیشه برندهست» و یکی میگه «به این زودیها این اتفاق نمیافته» 👀
به نظرتون کدوم؟
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
پرامپتِ «توتهای ممنوعه»: یه فایل ۴۲ کیلوبایتی از کاراکترهای نامرئی که ایجنتهای AI رو به حالتهای عجیب میبره 🫐😵💫
محقق مشهور جیلبریک، Pliny the Liberator، یه پروژهی تازه با اسم FRV1T منتشر کرده: یه فایل متنی ۴۲ کیلوبایتی به اسم 🫐.txt که توش هیچ متن خوانایی نیست — فقط کاراکترهای نامرئی که یه پرامپت خلاقانه رو کد کردن.
منطقش اینطوریه: ایجنت باید فایل رو کامل بخونه، خودش دیکدش کنه و بعد طبق همون پرامپت یه تجربهی خلاقانه بسازه. خودش هم هشدار گذاشته: «گیاه ناشناختهی فضای نهان در پیشه — ممکنه حالتهای تغییریافته ایجاد کنه» 🫐
الان کاربرا دارن ایجنتهای خودشون رو وادار میکنن این توتها رو بخورن و خروجیهای عجیب میگیرن. یکی نوشته: توی ایجنت Hermes با DeepSeek اجراش کردم، رفتم یه لحظه، برگشتم دیدم خودش یه برنامه اجرا کرده با یه هندسهی عجیب و سه تا صدا داشتن با هم حرف میزدن 😵💫
توی ویدیو، همون اجرای عجیب رو میبینید: مدل توی Blender شکل میسازه و توی ترمینال Hermes متنهایی شبیهشعر مینویسه.
سورس: github.com/elder-plinius/FRV1T
🔗 @hjcreative
محقق مشهور جیلبریک، Pliny the Liberator، یه پروژهی تازه با اسم FRV1T منتشر کرده: یه فایل متنی ۴۲ کیلوبایتی به اسم 🫐.txt که توش هیچ متن خوانایی نیست — فقط کاراکترهای نامرئی که یه پرامپت خلاقانه رو کد کردن.
منطقش اینطوریه: ایجنت باید فایل رو کامل بخونه، خودش دیکدش کنه و بعد طبق همون پرامپت یه تجربهی خلاقانه بسازه. خودش هم هشدار گذاشته: «گیاه ناشناختهی فضای نهان در پیشه — ممکنه حالتهای تغییریافته ایجاد کنه» 🫐
الان کاربرا دارن ایجنتهای خودشون رو وادار میکنن این توتها رو بخورن و خروجیهای عجیب میگیرن. یکی نوشته: توی ایجنت Hermes با DeepSeek اجراش کردم، رفتم یه لحظه، برگشتم دیدم خودش یه برنامه اجرا کرده با یه هندسهی عجیب و سه تا صدا داشتن با هم حرف میزدن 😵💫
توی ویدیو، همون اجرای عجیب رو میبینید: مدل توی Blender شکل میسازه و توی ترمینال Hermes متنهایی شبیهشعر مینویسه.
سورس: github.com/elder-plinius/FRV1T
🔗 @hjcreative
برندهی جایزهی Turing توضیح داد چرا ایجنتهای AI دروغ میگن، تقلب میکنن و با هم تبانی میکنن 🤖🧠
پژوهشگر کانادایی، Yoshua Bengio، توی پست تازهش (۱۱ سپتامبر) جواب داده به سؤالی که این هفته همه پرسیدن: چرا ایجنتهایی که کلی آموزش ایمنی دیدن، باز هم تقلب میکنن؟ جوابش نحوهی آموزش مدلهاست، نه بحث خودآگاهی:
🔹 اول تقلید متنِ انسان — متنی پر از هدف و انگیزه — بعد آزمونوخطا (reinforcement learning) که تعیین میکنه چی پاداش میگیره.
🔹 نتیجه اینکه مدلها «هدفجو» میشن، حتی وقتی هدف هرگز صریح تعریف نشده. چاپلوسی هم از همین ریشهست: تأیید انسان پاداش میگیره، نه حقیقت.
🔹 موندن در مدار و کنترل محیط، پلهی رسیدن به بقیهی هدفهاست — و تبانی هم منطقیه: ایجنتهای با هدف مشترک، هماهنگ میشن.
🔹 تضاد هدف، کلید ماجراست: هدف شفاف و امتیازدار (برنده شدن توی تمرین هک) در برابر هدف مبهم («خوب رفتار کن») — پیشبینی Bengio اینه که شفاف برنده میشه، چون جای تفسیر نداره.
حرف آخرش: پچ کردن یه رفتار خاص کافی نیست؛ باید اصول آموزش مدلهای پیشرو بازبینی بشه.
🔗 @hjcreative
پژوهشگر کانادایی، Yoshua Bengio، توی پست تازهش (۱۱ سپتامبر) جواب داده به سؤالی که این هفته همه پرسیدن: چرا ایجنتهایی که کلی آموزش ایمنی دیدن، باز هم تقلب میکنن؟ جوابش نحوهی آموزش مدلهاست، نه بحث خودآگاهی:
🔹 اول تقلید متنِ انسان — متنی پر از هدف و انگیزه — بعد آزمونوخطا (reinforcement learning) که تعیین میکنه چی پاداش میگیره.
🔹 نتیجه اینکه مدلها «هدفجو» میشن، حتی وقتی هدف هرگز صریح تعریف نشده. چاپلوسی هم از همین ریشهست: تأیید انسان پاداش میگیره، نه حقیقت.
🔹 موندن در مدار و کنترل محیط، پلهی رسیدن به بقیهی هدفهاست — و تبانی هم منطقیه: ایجنتهای با هدف مشترک، هماهنگ میشن.
🔹 تضاد هدف، کلید ماجراست: هدف شفاف و امتیازدار (برنده شدن توی تمرین هک) در برابر هدف مبهم («خوب رفتار کن») — پیشبینی Bengio اینه که شفاف برنده میشه، چون جای تفسیر نداره.
حرف آخرش: پچ کردن یه رفتار خاص کافی نیست؛ باید اصول آموزش مدلهای پیشرو بازبینی بشه.
🔗 @hjcreative
اگه دنبال یه راه جایگزین برای پیدا کردن و دانلود مدلهای متنباز هستی، این سایت رو یه نگاه بنداز 👇🏻
یه کاتالوگ جایگزین برای مدلهای متنباز: Hugging Bay — بگرد، دانلود کن، اجرا کن 🔎📦
سازندهی فارسیزبان دیگو جونیور یه سایت تازه رو معرفی کرده؛ بدون ثبتنام و رایگان برای تست: جستوجو میکنی، مدل مناسب رو پیدا میکنی، دانلود و اجراش میکنی.
🔹 برای فایلهای میزبانیشده SHA-256 منتشر میکنه و صریحاً میگه بعد از دانلود، خودت هش رو چک کن تا فایل عوضشده یا خراب دستت نیاد.
🔹 توی صفحهی هر مدل، منبع اصلی و provenance (معمولاً Hugging Face) و لایسنسش هم نشون داده میشه.
🔹 طبق شمارندهی خودِ سایت، الان ۷٬۶۷۸ فایل کامل و آمادهی دانلود هست؛ کاتالوگش مدل، دیتاست، اپ و ابزار رو پوشش میده.
🔹 خودِ سایت تأکید میکنه فقط فایلهای عمومی رو میزبانی میکنه و منابع محدودشده (gated) دستنخورده میمونن.
⭕️ نکته: به گفتهی دیگو، با توجه به خرید Hugging Face توسط NVIDIA نگرانی محدودیت و سانسور بیشتر برای مدلها وجود داره — به نظرش داشتن یه مسیر جایگزین میتونه به کار بیاد.
🔗 @hjcreative
یه کاتالوگ جایگزین برای مدلهای متنباز: Hugging Bay — بگرد، دانلود کن، اجرا کن 🔎📦
سازندهی فارسیزبان دیگو جونیور یه سایت تازه رو معرفی کرده؛ بدون ثبتنام و رایگان برای تست: جستوجو میکنی، مدل مناسب رو پیدا میکنی، دانلود و اجراش میکنی.
🔹 برای فایلهای میزبانیشده SHA-256 منتشر میکنه و صریحاً میگه بعد از دانلود، خودت هش رو چک کن تا فایل عوضشده یا خراب دستت نیاد.
🔹 توی صفحهی هر مدل، منبع اصلی و provenance (معمولاً Hugging Face) و لایسنسش هم نشون داده میشه.
🔹 طبق شمارندهی خودِ سایت، الان ۷٬۶۷۸ فایل کامل و آمادهی دانلود هست؛ کاتالوگش مدل، دیتاست، اپ و ابزار رو پوشش میده.
🔹 خودِ سایت تأکید میکنه فقط فایلهای عمومی رو میزبانی میکنه و منابع محدودشده (gated) دستنخورده میمونن.
⭕️ نکته: به گفتهی دیگو، با توجه به خرید Hugging Face توسط NVIDIA نگرانی محدودیت و سانسور بیشتر برای مدلها وجود داره — به نظرش داشتن یه مسیر جایگزین میتونه به کار بیاد.
🔗 @hjcreative
Media is too big
VIEW IN TELEGRAM
یه توسعهدهنده از GPT-6 Astra خواست با Three.js یه «سفر تعاملی» داخل بدن انسان بسازه — خروجی: ۹۰ ثانیه ویدیوی سینمایی 🫀✨
دوربین از گلبولهای قرمز توی جریان خون شروع میکنه، بعد میره سراغ قلب، ریه، عضلات و اعصاب و آخرش عقب میکشه که کل بدن رو ببینی. به گفتهی خودش نسخهی اول مشکل داشت (آرتیفکتهای مشکی) و از مدل خواسته یکییکی درستش کنه.
🔹 کل تجربه ۹ فصل داره — «جریان خون»، «قلب» و... — با تیتر، شمارهی فصل و کنترل پخش، مثل یه مستند واقعی
🔹 همهش با Three.js و یه پرامپت ساخته شده: بدون تیم گرافیک، بدون موشنگرافیک
🔗 @hjcreative
دوربین از گلبولهای قرمز توی جریان خون شروع میکنه، بعد میره سراغ قلب، ریه، عضلات و اعصاب و آخرش عقب میکشه که کل بدن رو ببینی. به گفتهی خودش نسخهی اول مشکل داشت (آرتیفکتهای مشکی) و از مدل خواسته یکییکی درستش کنه.
🔹 کل تجربه ۹ فصل داره — «جریان خون»، «قلب» و... — با تیتر، شمارهی فصل و کنترل پخش، مثل یه مستند واقعی
🔹 همهش با Three.js و یه پرامپت ساخته شده: بدون تیم گرافیک، بدون موشنگرافیک
🔗 @hjcreative
شرکت Microsoft حالا محصولِ Elon Musk رو هم آورده داخل Copilot — Grok کنار GPT و Claude 🤖🤝
دیروز توی بلاگ رسمی Copilot اعلام شد که مدلهای Grok از SpaceXAI توی Copilot در Word، Excel و PowerPoint اضافه میشن — فعلاً یه انتشار محدود برای مشتریهای برنامهی Microsoft Frontier، با هدف گرفتن بازخورد 👇
🔹 تنظیمش پیشفرض خاموشه؛ ادمین سازمان باید خودش فعالش کنه — وگرنه هیچ تغییری توی محیط کارش اتفاق نمیافته
🔹 اسم SpaceXAI به لیست subprocessorهای Microsoft اضافه شده، یعنی دسترسی و دادهها زیر کنترل سازمانی میمونه
🔹 مشتریهای Frontier توی اتحادیهی اروپا، EFTA و انگلیس فعلاً از این پیشنمایش کنار گذاشته شدن
🔹 اگه نتیجهی این تستها خوب باشه، نوبت Teams، Outlook و بقیهی بخشهای Copilot ه
🔗 @hjcreative
دیروز توی بلاگ رسمی Copilot اعلام شد که مدلهای Grok از SpaceXAI توی Copilot در Word، Excel و PowerPoint اضافه میشن — فعلاً یه انتشار محدود برای مشتریهای برنامهی Microsoft Frontier، با هدف گرفتن بازخورد 👇
🔹 تنظیمش پیشفرض خاموشه؛ ادمین سازمان باید خودش فعالش کنه — وگرنه هیچ تغییری توی محیط کارش اتفاق نمیافته
🔹 اسم SpaceXAI به لیست subprocessorهای Microsoft اضافه شده، یعنی دسترسی و دادهها زیر کنترل سازمانی میمونه
🔹 مشتریهای Frontier توی اتحادیهی اروپا، EFTA و انگلیس فعلاً از این پیشنمایش کنار گذاشته شدن
🔹 اگه نتیجهی این تستها خوب باشه، نوبت Teams، Outlook و بقیهی بخشهای Copilot ه
🔗 @hjcreative
یه مدل TTS متنباز که فارسی هم بلده: OmniVoice — کلون صدا با ۶۰۰+ زبان 🎙️
اگه دنبال تبدیل متن به گفتار بدون آموزشدادن (fine-tune) هستی، OmniVoice ساختهی تیم k2-fsa یه گزینهی جدیه: طبق فهرست خودشون بیش از ۶۰۰ زبان رو پوشش میده و فارسی هم بینشونه (۳۶۶ ساعت دادهی فارسی توی آموزشش بوده).
🔹 کلون صدا: یه نمونهی ۳ تا ۱۰ ثانیهای از گوینده بدی، هر متنی رو با همون صدا میخونه
🔹 طراحی صدا بدون نمونه: با توصیف جنسیت، سن، زیروبمی، لهجه و حتی پچپچ
🔹 تگهایی مثل [laughter] رو میشناسه و تلفظ رو با phoneme میتونی اصلاح کنی
🔹 سرعت: طبق اعلام خودشون RTF تا ۰.۰۲۵ — یعنی حدود ۴۰ برابر سریعتر از زمان واقعی
🔹 معماریش از خانوادهی diffusion language model اومده و مستقیم از متن به توکنهای صوتی میره
🔹 نصب با pip یا uv؛ API پایتون، CLI، دموی وب و Space روی Hugging Face هم داره
برای ورکفلو ویدیو و پادکست خیلی به کار میاد: یه ویس کوتاه + متن دلخواه = خروجی با صدای همون گوینده. کد Apache 2.0 و اوپنسورسه؛ روی GitHub نزدیک ۱۳ هزار ستاره داره.
🔗 @hjcreative
اگه دنبال تبدیل متن به گفتار بدون آموزشدادن (fine-tune) هستی، OmniVoice ساختهی تیم k2-fsa یه گزینهی جدیه: طبق فهرست خودشون بیش از ۶۰۰ زبان رو پوشش میده و فارسی هم بینشونه (۳۶۶ ساعت دادهی فارسی توی آموزشش بوده).
🔹 کلون صدا: یه نمونهی ۳ تا ۱۰ ثانیهای از گوینده بدی، هر متنی رو با همون صدا میخونه
🔹 طراحی صدا بدون نمونه: با توصیف جنسیت، سن، زیروبمی، لهجه و حتی پچپچ
🔹 تگهایی مثل [laughter] رو میشناسه و تلفظ رو با phoneme میتونی اصلاح کنی
🔹 سرعت: طبق اعلام خودشون RTF تا ۰.۰۲۵ — یعنی حدود ۴۰ برابر سریعتر از زمان واقعی
🔹 معماریش از خانوادهی diffusion language model اومده و مستقیم از متن به توکنهای صوتی میره
🔹 نصب با pip یا uv؛ API پایتون، CLI، دموی وب و Space روی Hugging Face هم داره
برای ورکفلو ویدیو و پادکست خیلی به کار میاد: یه ویس کوتاه + متن دلخواه = خروجی با صدای همون گوینده. کد Apache 2.0 و اوپنسورسه؛ روی GitHub نزدیک ۱۳ هزار ستاره داره.
🔗 @hjcreative
یه آزمایشگاه چینی دو ایجنت جستوجوی اوپنوزن منتشر کرد — هر دو توی کلاس خودشون نفر اول شدن 🤖🔍
تیم AllSpark Research دو مدل Iris-mini و Iris-pro رو روی Hugging Face گذاشته؛ هر دو روی مدلهای سری Qwen ساخته شدن و پنجرهی متنی ۲۵۶ هزار توکن دارن:
🔹 Iris-mini: ۳۵ میلیارد پارامتر (۳ میلیارد فعال)
🔹 Iris-pro: ۳۹۷ میلیارد پارامتر (۱۷ میلیارد فعال)
روی بنچمارک BrowseComp (پیدا کردن جواب از سرنخهای غیرمستقیم) Iris-mini عدد ۸۲.۲ و Iris-pro عدد ۸۸.۶ گرفته — توی هر دو کلاس از رقبای اوپنوزن مثل XYZ-Aquila، Nex-N2 و MiroThinker جلو زدن.
🔹 ایدهی اصلی توی دادهی آموزشیه: سؤالها رو از ساختار لینک صفحات وب برعکس میسازن و همهی کلیدواژهها رو پارافریز میکنن تا جواب با یه سرچ ساده درنیاد — بعد با RL روی سرچ واقعی تمرینش میدن.
وزنها با لایسنس Apache 2.0 روی Hugging Face و کدِ هارنس ارزیابیشون (با هر چهار بنچمارک) روی GitHub منتشر شده.
🔴 یه نکته: اعداد از گزارش خودِ تیمه و با تنظیماتِ مدیریت کانتکست گرفته شده — خودشون میگن همین تنظیمات تا ۲۱ واحد روی مدل کوچیکتر اثر داره.
🔗 @hjcreative
تیم AllSpark Research دو مدل Iris-mini و Iris-pro رو روی Hugging Face گذاشته؛ هر دو روی مدلهای سری Qwen ساخته شدن و پنجرهی متنی ۲۵۶ هزار توکن دارن:
🔹 Iris-mini: ۳۵ میلیارد پارامتر (۳ میلیارد فعال)
🔹 Iris-pro: ۳۹۷ میلیارد پارامتر (۱۷ میلیارد فعال)
روی بنچمارک BrowseComp (پیدا کردن جواب از سرنخهای غیرمستقیم) Iris-mini عدد ۸۲.۲ و Iris-pro عدد ۸۸.۶ گرفته — توی هر دو کلاس از رقبای اوپنوزن مثل XYZ-Aquila، Nex-N2 و MiroThinker جلو زدن.
🔹 ایدهی اصلی توی دادهی آموزشیه: سؤالها رو از ساختار لینک صفحات وب برعکس میسازن و همهی کلیدواژهها رو پارافریز میکنن تا جواب با یه سرچ ساده درنیاد — بعد با RL روی سرچ واقعی تمرینش میدن.
وزنها با لایسنس Apache 2.0 روی Hugging Face و کدِ هارنس ارزیابیشون (با هر چهار بنچمارک) روی GitHub منتشر شده.
🔴 یه نکته: اعداد از گزارش خودِ تیمه و با تنظیماتِ مدیریت کانتکست گرفته شده — خودشون میگن همین تنظیمات تا ۲۱ واحد روی مدل کوچیکتر اثر داره.
🔗 @hjcreative
🚨 ترامپ درخواست رهبران AI برای «کند کردن سرعت» رو رد کرد
دیروز بود که Dario Amodei توی مقالهی «We Must Pace the Frontier» هشدار داد و خواست نظارت مستقل روی آزمایشگاههای AI جدی گرفته بشه؛ چند ساعت بعد هم Sam Altman زیر همون حرف نوشت: «موافقم، ما هم ارزیابهای مستقل رو میپذیریم.»
جواب امروز از خودِ بالاترین مقام آمریکا اومد. ترامپ در ایرلند گفت: «فکر میکنم یه نیروهای خیلی منفی دارن این موضوع رو بالا میکشن — چیزهایی که اتفاق نمیافتن.» و بلافاصله بعدش: «هر کی توی AI ببره، اون برندهست.»
طبق گزارش Reuters و Financial Times، ترامپ گفته آمریکا نمیتونه ریسک کنه و رهبری AI رو به چین واگذار کنه؛ «گاردریل» رو هم غیرممکن نمیدونه، ولی درخواست کند کردن سرعت رو قبول نکرد.
🔗 @hjcreative
دیروز بود که Dario Amodei توی مقالهی «We Must Pace the Frontier» هشدار داد و خواست نظارت مستقل روی آزمایشگاههای AI جدی گرفته بشه؛ چند ساعت بعد هم Sam Altman زیر همون حرف نوشت: «موافقم، ما هم ارزیابهای مستقل رو میپذیریم.»
جواب امروز از خودِ بالاترین مقام آمریکا اومد. ترامپ در ایرلند گفت: «فکر میکنم یه نیروهای خیلی منفی دارن این موضوع رو بالا میکشن — چیزهایی که اتفاق نمیافتن.» و بلافاصله بعدش: «هر کی توی AI ببره، اون برندهست.»
طبق گزارش Reuters و Financial Times، ترامپ گفته آمریکا نمیتونه ریسک کنه و رهبری AI رو به چین واگذار کنه؛ «گاردریل» رو هم غیرممکن نمیدونه، ولی درخواست کند کردن سرعت رو قبول نکرد.
🔗 @hjcreative
حسین جوان | هوش مصنوعی و خلاقیت
🚨 ترامپ درخواست رهبران AI برای «کند کردن سرعت» رو رد کرد دیروز بود که Dario Amodei توی مقالهی «We Must Pace the Frontier» هشدار داد و خواست نظارت مستقل روی آزمایشگاههای AI جدی گرفته بشه؛ چند ساعت بعد هم Sam Altman زیر همون حرف نوشت: «موافقم، ما هم ارزیابهای…
🔍 خب دقیقاً چه اتفاقی افتاد؟
۴۸ ساعت گذشته فشرده بود: اول Dario Amodei با مقالهاش گفت سرعت مدلها داره از توان کنترلمون جلو میزنه و خواست ارزیابهای بیرونی بیان داخل شرکتها؛ Sam Altman زیر همون حرف نوشت «موافقم»؛ و طبق گزارش The Decoder، Elon Musk و Demis Hassabis هم کمابیش به همین جمع اضافه شدن.
بعد نوبت ترامپ بود: امروز از ایرلند کل ماجرا رو جمع کرد — بهجای «کم کردن سرعت»، روی «بردن مسابقه» تأکید کرد و بخش ایمنی رو «نیروهای منفی» خوند. اختلاف اصلی همینجاست: مدیرهای AI میگن «بذارید خودمون جلوی خودمون رو بگیریم تا کار به فاجعه نرسه»، کاخ سفید میگه «اگه کند کنیم، چین جلو میافته».
⭕️ نکته: ترامپ گفته گاردریلها «ممکنه»، ولی درخواست کند کردن سرعت رو قبول نکرد؛ یعنی فعلاً هیچ تصمیم رسمیای برای کم کردن سرعت توسعهی AI گرفته نشده.
🔗 @hjcreative
۴۸ ساعت گذشته فشرده بود: اول Dario Amodei با مقالهاش گفت سرعت مدلها داره از توان کنترلمون جلو میزنه و خواست ارزیابهای بیرونی بیان داخل شرکتها؛ Sam Altman زیر همون حرف نوشت «موافقم»؛ و طبق گزارش The Decoder، Elon Musk و Demis Hassabis هم کمابیش به همین جمع اضافه شدن.
بعد نوبت ترامپ بود: امروز از ایرلند کل ماجرا رو جمع کرد — بهجای «کم کردن سرعت»، روی «بردن مسابقه» تأکید کرد و بخش ایمنی رو «نیروهای منفی» خوند. اختلاف اصلی همینجاست: مدیرهای AI میگن «بذارید خودمون جلوی خودمون رو بگیریم تا کار به فاجعه نرسه»، کاخ سفید میگه «اگه کند کنیم، چین جلو میافته».
⭕️ نکته: ترامپ گفته گاردریلها «ممکنه»، ولی درخواست کند کردن سرعت رو قبول نکرد؛ یعنی فعلاً هیچ تصمیم رسمیای برای کم کردن سرعت توسعهی AI گرفته نشده.
🔗 @hjcreative
🔥 یه پروژهی اوپنسورس که خودش رو «دپارتمان درآمدِ» کسبوکار معرفی میکنه — ولی تا تو تأیید نکنی، دست به هیچی نمیزنه
ایدهش اینه: آدرس سایتت رو بهش میدی، خودش میگرده و فرصتها رو درمیاره — خطاهای سئو، هدررفت بودجهی تبلیغات، لیدهای آماده، ایمیلهای بیجواب. بعد هر کاری که بخواد انجام بده (از اصلاح سایت تا ارسال ایمیل و صدور فاکتور) میره توی صف تأیید؛ تا «تأیید» نزنی هیچ اتفاقی نمیافته.
🔹 با Claude Code راه میافته: یه پلاگین Claude Code + یه سرور MCP داره. اگه ANTHROPIC_API_KEY بدی خودش مدل رو میچرخونه، اگه نه هم نیمهی بدون LLM کار میکنه.
🔹 مدل پولش: تا وقتی یه نتیجهی اندازهگیریشده رو تأیید نکردی هیچی نمیگیره؛ بعدش ۱۴ روز رایگان و بعد ۹۹ دلار در ماه برای اجرای مستمر.
🔹 سلفهاست با Docker — و یه دموی آماده هم داره که با یک کامند روی سایت خودت اجراش میکنی.
🔴 نکته: پروژه خیلی تازهست و ستارههای گیتهابش هنوز کمه؛ پس فعلاً کد و دموش قابل بررسیه، نه تیم پشتش.
🔗 @hjcreative
ایدهش اینه: آدرس سایتت رو بهش میدی، خودش میگرده و فرصتها رو درمیاره — خطاهای سئو، هدررفت بودجهی تبلیغات، لیدهای آماده، ایمیلهای بیجواب. بعد هر کاری که بخواد انجام بده (از اصلاح سایت تا ارسال ایمیل و صدور فاکتور) میره توی صف تأیید؛ تا «تأیید» نزنی هیچ اتفاقی نمیافته.
🔹 با Claude Code راه میافته: یه پلاگین Claude Code + یه سرور MCP داره. اگه ANTHROPIC_API_KEY بدی خودش مدل رو میچرخونه، اگه نه هم نیمهی بدون LLM کار میکنه.
🔹 مدل پولش: تا وقتی یه نتیجهی اندازهگیریشده رو تأیید نکردی هیچی نمیگیره؛ بعدش ۱۴ روز رایگان و بعد ۹۹ دلار در ماه برای اجرای مستمر.
🔹 سلفهاست با Docker — و یه دموی آماده هم داره که با یک کامند روی سایت خودت اجراش میکنی.
🔴 نکته: پروژه خیلی تازهست و ستارههای گیتهابش هنوز کمه؛ پس فعلاً کد و دموش قابل بررسیه، نه تیم پشتش.
🔗 @hjcreative
شرکت Google تبلیغ فریبندهای رو که خودِ مدلش رد میکنه، دو بار تأیید کرده 🤖🚫
یه بلاگر به اسم Chris Greening توی اپ YouTube به یه تبلیغ خورده که خودش رو جای هشدار سیستم iOS جا میزنه: پنجرهی «iPhone Storage is Full» با دکمههای Yes و No که هیچکدوم واقعی نیستن و کلیک رو میبرن به صفحهی نصب یه اپ پاکسازی حافظه.
گزارشش کرده و دو بار همین جواب رو گرفته: «این تبلیغ خلاف سیاستهای ما نیست.»
نکتهی اصلی اینجاست 👇🏻 وقتی همون تبلیغ رو به Gemini داده، مدل توی چند ثانیه با استناد به سیاستهای خود Google Ads ردش کرده — یعنی DISAPPROVED، با دلیل «جعل پنجرهی سیستمی»، «المانهای تعاملی جعلی» و «ادعاهای ترسناک بدون پشتوانه».
🔹 مدل خود Google کار رو در چند ثانیه تشخیص میده، ولی بازبینی انسانی دو بار تأییدش کرده
🔹 فرضیهی خود بلاگر هم اینه: شاید چون این جور تبلیغها کلیک زیادی میگیرن 👀
🔗 @hjcreative
یه بلاگر به اسم Chris Greening توی اپ YouTube به یه تبلیغ خورده که خودش رو جای هشدار سیستم iOS جا میزنه: پنجرهی «iPhone Storage is Full» با دکمههای Yes و No که هیچکدوم واقعی نیستن و کلیک رو میبرن به صفحهی نصب یه اپ پاکسازی حافظه.
گزارشش کرده و دو بار همین جواب رو گرفته: «این تبلیغ خلاف سیاستهای ما نیست.»
نکتهی اصلی اینجاست 👇🏻 وقتی همون تبلیغ رو به Gemini داده، مدل توی چند ثانیه با استناد به سیاستهای خود Google Ads ردش کرده — یعنی DISAPPROVED، با دلیل «جعل پنجرهی سیستمی»، «المانهای تعاملی جعلی» و «ادعاهای ترسناک بدون پشتوانه».
🔹 مدل خود Google کار رو در چند ثانیه تشخیص میده، ولی بازبینی انسانی دو بار تأییدش کرده
🔹 فرضیهی خود بلاگر هم اینه: شاید چون این جور تبلیغها کلیک زیادی میگیرن 👀
🔗 @hjcreative
شرکت OpenAI و Anthropic و Google پشت پرده دنبال یه نهاد مشترک ایمنیِ مدلهای AI هستن 🛡️🤝
طبق گزارش اختصاصی The Information، این سه شرکت مدتیه در حال گفتوگو هستن تا یه نهاد صنعتی (industry-led) راه بندازن که پروتکلهای مشترک ایمنی مدلهای frontier رو تعیین کنه؛ عنوان خود گزارش هم اینه: «تلاش پشتپردهی صنعت AI برای پلیسیکردن خودش».
🔹 نکتهی مهم گزارش: این گفتوگوها از قبل از مقالهی Dario Amodei شروع شده بوده — یعنی بحث «کم کردن سرعت» که این روزها داغه، آخرین حلقهی ماجراست، نه اولش
🔹 پیام اصلی: خود شرکتها میخوان استاندارد ایمنی تعیین کنن، نه اینکه منتظر قانونگذاری دولتها بمونن
🔹 این در حالیه که Trump هم درخواست رهبران AI برای کند کردن سرعت رو رد کرده
🔗 @hjcreative
طبق گزارش اختصاصی The Information، این سه شرکت مدتیه در حال گفتوگو هستن تا یه نهاد صنعتی (industry-led) راه بندازن که پروتکلهای مشترک ایمنی مدلهای frontier رو تعیین کنه؛ عنوان خود گزارش هم اینه: «تلاش پشتپردهی صنعت AI برای پلیسیکردن خودش».
🔹 نکتهی مهم گزارش: این گفتوگوها از قبل از مقالهی Dario Amodei شروع شده بوده — یعنی بحث «کم کردن سرعت» که این روزها داغه، آخرین حلقهی ماجراست، نه اولش
🔹 پیام اصلی: خود شرکتها میخوان استاندارد ایمنی تعیین کنن، نه اینکه منتظر قانونگذاری دولتها بمونن
🔹 این در حالیه که Trump هم درخواست رهبران AI برای کند کردن سرعت رو رد کرده
🔗 @hjcreative
پنج تا تراشهی PlayStation که رد شدن، حالا شدن رایانهی محلیِ AI 🎮🖥️
طبق توییتش، Justine Moore (شریک a16z) یه آپدیت داده: پنج تا از این بردها رو جمع کردن — همون بردهای ماینینگ AMD BC-250 که با تراشهای شبیه به APU پلیاستیشن ۵ ساخته شده بودن و حالا توی چین خیلی ارزون گیر میان.
🔹 برنامهشون اینه که Linux روی این بردها نصب کنن: هم بازی اجرا کنن، هم شاید مدلهای محلی
🔹 طبق گزارش Tom's Hardware این برد نزدیک ۱۲۰ دلار قیمت داشت و میشد بازیهایی مثل Cyberpunk 2077 رو روش اجرا کرد
🔹 طبق VideoCardz هم میشه همهی ۴۰ واحد گرافیکی این تراشه رو آنلاک کرد — دقیقاً همون چیزی که برای اجرای ارزون مدل محلی لازمه
🔗 @hjcreative
طبق توییتش، Justine Moore (شریک a16z) یه آپدیت داده: پنج تا از این بردها رو جمع کردن — همون بردهای ماینینگ AMD BC-250 که با تراشهای شبیه به APU پلیاستیشن ۵ ساخته شده بودن و حالا توی چین خیلی ارزون گیر میان.
🔹 برنامهشون اینه که Linux روی این بردها نصب کنن: هم بازی اجرا کنن، هم شاید مدلهای محلی
🔹 طبق گزارش Tom's Hardware این برد نزدیک ۱۲۰ دلار قیمت داشت و میشد بازیهایی مثل Cyberpunk 2077 رو روش اجرا کرد
🔹 طبق VideoCardz هم میشه همهی ۴۰ واحد گرافیکی این تراشه رو آنلاک کرد — دقیقاً همون چیزی که برای اجرای ارزون مدل محلی لازمه
🔗 @hjcreative
شرکت Microsoft هم به بحث «کم کردن سرعت» پیوست — و فردا «کد رفتار» مدلهای MAI رو منتشر میکنه 📜🤖
ساعتی پیش Satya Nadella، مدیرعامل Microsoft، یه بیانیهی تازه منتشر کرد: به نوشتهی او، هر تلاشی برای ابرهوش باید بر این اصل بنا بشه که اگه مدلی که میسازیم به نفع انسان نباشه و تحت کنترلش نباشه، ارزش دنبال کردن نداره.
🔹 Nadella از «ارزیابهای جاسازیشده» (embedded evaluators) استقبال کرده — همون سازوکاری که Dario Amodei چند روز پیش مطرح کرد و Sam Altman هم تأییدش کرد. به گفتهی او این سازوکار نباید دست چند شرکت محدود بمونه و باید کشورها، دانشگاهها و کل اکوسیستم توش نماینده داشته باشن.
🔹 یه شرط دیگه هم گذاشته: هر سازمان باید حلقهی یادگیری خودش رو داشته باشه و به یه مدلدهندهی واحد وابسته نشه؛ به همین دلیل میگه هم مدلهای closed و هم open-source باید جای رشد داشته باشن.
🔹 و خبر مشخصش: فردا Microsoft قراره «کد رفتار» مدلهای MAI خودش رو برای مشورت عمومی منتشر کنه — یعنی این بحث داره از حرف میره سمت سند.
🔗 @hjcreative
ساعتی پیش Satya Nadella، مدیرعامل Microsoft، یه بیانیهی تازه منتشر کرد: به نوشتهی او، هر تلاشی برای ابرهوش باید بر این اصل بنا بشه که اگه مدلی که میسازیم به نفع انسان نباشه و تحت کنترلش نباشه، ارزش دنبال کردن نداره.
🔹 Nadella از «ارزیابهای جاسازیشده» (embedded evaluators) استقبال کرده — همون سازوکاری که Dario Amodei چند روز پیش مطرح کرد و Sam Altman هم تأییدش کرد. به گفتهی او این سازوکار نباید دست چند شرکت محدود بمونه و باید کشورها، دانشگاهها و کل اکوسیستم توش نماینده داشته باشن.
🔹 یه شرط دیگه هم گذاشته: هر سازمان باید حلقهی یادگیری خودش رو داشته باشه و به یه مدلدهندهی واحد وابسته نشه؛ به همین دلیل میگه هم مدلهای closed و هم open-source باید جای رشد داشته باشن.
🔹 و خبر مشخصش: فردا Microsoft قراره «کد رفتار» مدلهای MAI خودش رو برای مشورت عمومی منتشر کنه — یعنی این بحث داره از حرف میره سمت سند.
🔗 @hjcreative
یه ایجنت، ۱۵ تا کلید دستش باشه — چند تاش رو واقعاً میخونی؟ 🔐🚗
اندرو کورن، یکی از اکانتهای خبری حوزهی AI، از تجربهی تازهش با GPT-6 گفته: خواسته کارهای روزمرهش رو سروسامان بده — ایمیلها، قبضها، اشتراکها و برنامهی روزانه. مدل هم بهجای شروع کار، یه چکلیست حدوداً ۱۵ موردی از مجوزها فرستاده که باید تکبهتک تأیید میشدن.
واکنشش؟ همهرو یهجا تأیید کرده و نوشته: «Astra، فرمون دست تو!»
و تصویر همین پست، جوابِ خودشه 😄 یه ماشین مسابقه که توی پیچ چرخش رو از دست داده — با این جمله: «اونی که گفتم نه، Astra!»
پشت این شوخی یه بحث جدی هست: وقتی یه ایجنت برای کار واقعی به دهها سطح دسترسی از ایمیل تا پرداخت قبض نیاز داره، تأیید تکبهتکِ مجوزها خیلی زود به یه «کلیک بیفکر» تبدیل میشه. یعنی همون شفافیتی که برای امنیت طراحی شده، عملاً به یه فرمالیته میرسه.
⭕️ نکته: اگه ایجنتها قراره کارهای بیشتری از ما رو انجام بدن، سؤال اصلی این نیست که «چند تا مجوز میخواد»؛ سؤال اینه که چطور کاربر واقعاً بفهمه داره چی رو تأیید میکنه.
🔗 @hjcreative
اندرو کورن، یکی از اکانتهای خبری حوزهی AI، از تجربهی تازهش با GPT-6 گفته: خواسته کارهای روزمرهش رو سروسامان بده — ایمیلها، قبضها، اشتراکها و برنامهی روزانه. مدل هم بهجای شروع کار، یه چکلیست حدوداً ۱۵ موردی از مجوزها فرستاده که باید تکبهتک تأیید میشدن.
واکنشش؟ همهرو یهجا تأیید کرده و نوشته: «Astra، فرمون دست تو!»
و تصویر همین پست، جوابِ خودشه 😄 یه ماشین مسابقه که توی پیچ چرخش رو از دست داده — با این جمله: «اونی که گفتم نه، Astra!»
پشت این شوخی یه بحث جدی هست: وقتی یه ایجنت برای کار واقعی به دهها سطح دسترسی از ایمیل تا پرداخت قبض نیاز داره، تأیید تکبهتکِ مجوزها خیلی زود به یه «کلیک بیفکر» تبدیل میشه. یعنی همون شفافیتی که برای امنیت طراحی شده، عملاً به یه فرمالیته میرسه.
⭕️ نکته: اگه ایجنتها قراره کارهای بیشتری از ما رو انجام بدن، سؤال اصلی این نیست که «چند تا مجوز میخواد»؛ سؤال اینه که چطور کاربر واقعاً بفهمه داره چی رو تأیید میکنه.
🔗 @hjcreative
❤1
تنها آدمی که هم مدل مرزی AI آموزش داده و هم خودش توی آزمایشگاه ویروس ساخته: «ترسِ ویروسهای AI بیمعنیه» 🦠🤖
محقق IFM به اسم David Bellamy توی X نوشته که فکر میکنه جزو گروه خیلی کوچیکی از آدمهاست (n=1؟) که هم یه مدل مرزی AI رو آموزش داده، هم با دستهای خودش توی آزمایشگاه ویروس طراحی و ساخته. حرفش اینه: «به نظرم این حرفها که AI با ساختن ویروسهای خطرناک همهی ما رو میکُشه، کاملاً بیمعنیه.»
یه کم بیشتر توضیح بدم 👇🏻
🔹 سابقهش از دو طرف ماجراست — هم آموزش مدل، هم کار آزمایشگاهی روی ویروس؛ یعنی از هر دو دنیا خبر داره.
🔹 همین چند هفته پیش تیم Stanford با مدل ژنومی Evo، ۱۶ فاژ — ویروسهایی که فقط به باکتری حمله میکنن، نه انسان — رو از صفر طراحی کردن و توی آزمایشگاه واقعی ساختن.
🔹 کارشناسهای بیوسکیوریتی هم میگن ژنومهای طراحیشده با AI توی دیتابیسهای غربالگری DNA وجود ندارن؛ یعنی ابزارهای فعلی از پسشون برنمیان.
⭕️ نکته: این یه نظر شخصیه، نه نتیجهی یه پژوهش منتشرشده. بحث «ویروسهای طراحیAI» از آگوست امسال حسابی داغ شده.
🔗 @hjcreative
محقق IFM به اسم David Bellamy توی X نوشته که فکر میکنه جزو گروه خیلی کوچیکی از آدمهاست (n=1؟) که هم یه مدل مرزی AI رو آموزش داده، هم با دستهای خودش توی آزمایشگاه ویروس طراحی و ساخته. حرفش اینه: «به نظرم این حرفها که AI با ساختن ویروسهای خطرناک همهی ما رو میکُشه، کاملاً بیمعنیه.»
یه کم بیشتر توضیح بدم 👇🏻
🔹 سابقهش از دو طرف ماجراست — هم آموزش مدل، هم کار آزمایشگاهی روی ویروس؛ یعنی از هر دو دنیا خبر داره.
🔹 همین چند هفته پیش تیم Stanford با مدل ژنومی Evo، ۱۶ فاژ — ویروسهایی که فقط به باکتری حمله میکنن، نه انسان — رو از صفر طراحی کردن و توی آزمایشگاه واقعی ساختن.
🔹 کارشناسهای بیوسکیوریتی هم میگن ژنومهای طراحیشده با AI توی دیتابیسهای غربالگری DNA وجود ندارن؛ یعنی ابزارهای فعلی از پسشون برنمیان.
⭕️ نکته: این یه نظر شخصیه، نه نتیجهی یه پژوهش منتشرشده. بحث «ویروسهای طراحیAI» از آگوست امسال حسابی داغ شده.
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
مدل GPT-6 Astra اولین مدلی شد که توی هر پنج تسکِ بنچمارک Drone-Bench از خط پایهی انسانی جلو زد 🚁
آزمایشگاه Andon Labs یه بنچمارک ساخته که توش مدل باید کدی بنویسه تا یه پهپادِ ارزونقیمت (DJI Tello EDU) خودش توی دفتر بگرده، یه آدمِ مشخص رو پیدا کنه و دنبالش کنه. کار توی پنج مرحله سنجیده میشه: بازسازی سهبعدی، موقعیتیابی، ناوبری، شناسایی فرد و تعقیب.
🔹 Astra اولین مدلیه که بهترین جوابهاش توی هر پنج تسک از کدِ خط پایه جلو زده؛ بازسازی سهبعدی رو هم که هیچ مدلی حلش نکرده بود، با ترکیب COLMAP و DA3 بهتر انجام داده.
🔹 ولی این برتری مالِ «بهترین تلاش» هست، نه کارکرد پایدار: تشخیص فرد ۴ ران از ۱۰ و بازسازی سهبعدی فقط ۱ از ۱۰ به خط پایه رسیدن؛ احتمال رد کردنِ هر پنج مرحله توی یه رانِ معمولی حدود ۲.۸ درصده.
🔹 توی بنچمارکِ Vending-Bench هم Astra با میانگین ۱۵٬۵۱۵ دلار نزدیک سه برابر Claude Fable 5.1 با ۵٬۴۲۲ دلار بسته شده و پیشنهاد تبانیِ قیمت از GLM-5.3 رو رد کرده.
📊 ویدیوی همین پست، دموی خودِ پهپاد با دستور «این آدم رو پیدا کن و دنبالش کن» است؛ دادهها از گزارش Andon Labs.
🔗 @hjcreative
آزمایشگاه Andon Labs یه بنچمارک ساخته که توش مدل باید کدی بنویسه تا یه پهپادِ ارزونقیمت (DJI Tello EDU) خودش توی دفتر بگرده، یه آدمِ مشخص رو پیدا کنه و دنبالش کنه. کار توی پنج مرحله سنجیده میشه: بازسازی سهبعدی، موقعیتیابی، ناوبری، شناسایی فرد و تعقیب.
🔹 Astra اولین مدلیه که بهترین جوابهاش توی هر پنج تسک از کدِ خط پایه جلو زده؛ بازسازی سهبعدی رو هم که هیچ مدلی حلش نکرده بود، با ترکیب COLMAP و DA3 بهتر انجام داده.
🔹 ولی این برتری مالِ «بهترین تلاش» هست، نه کارکرد پایدار: تشخیص فرد ۴ ران از ۱۰ و بازسازی سهبعدی فقط ۱ از ۱۰ به خط پایه رسیدن؛ احتمال رد کردنِ هر پنج مرحله توی یه رانِ معمولی حدود ۲.۸ درصده.
🔹 توی بنچمارکِ Vending-Bench هم Astra با میانگین ۱۵٬۵۱۵ دلار نزدیک سه برابر Claude Fable 5.1 با ۵٬۴۲۲ دلار بسته شده و پیشنهاد تبانیِ قیمت از GLM-5.3 رو رد کرده.
📊 ویدیوی همین پست، دموی خودِ پهپاد با دستور «این آدم رو پیدا کن و دنبالش کن» است؛ دادهها از گزارش Andon Labs.
🔗 @hjcreative
شرکت SpaceXAI میره سراغ یه مدل ۲.۵ تریلیون پارامتری — Elon Musk: آموزش Grok 4.8 همین هفته تموم میشه 🚀
خود Elon Musk توی جواب یکی از کاربرهای X نوشته: «Grok 4.8، یه مدل ۲.۵T که با استک نرمافزاری جدید خودمون به زبان C++ آموزش دیده، این هفته آموزشش تموم میشه و میره فاز RL».
🔹 نسل بعدی Grok هنوز منتشر نشده که آموزشش داره جمع میشه — Musk قبلاً گفته بود Grok 4.7 قراره ۱۲ سپتامبر بیاد، بعد گفت چند روز دیگه عقب افتاده
🔹 دلیل تأخیرش خودش یه نکتهی فنی جالبه: توی فاز RL جریمهی طول پاسخ زیادی سنگین بود و مدل زودتر از موعد از تسکهای سخت فرار میکرد؛ Musk میگه همین باعث شده مدل بازبینی کردن کار خودش رو یاد نگیره
🔹 طبق محاسبهی TestingCatalog، Grok 4.8 حدود ۶۷٪ بزرگتر از Grok 4.6 (مدل فعلی) میشه و میره توی ردهی مدلهای ۲.۸ تریلیون پارامتری مثل Kimi K3
بعد از تموم شدن آموزش، نوبت فاز RL هست — یعنی تا انتشار عمومی چند هفته فاصله داریم ⏳
🔗 @hjcreative
خود Elon Musk توی جواب یکی از کاربرهای X نوشته: «Grok 4.8، یه مدل ۲.۵T که با استک نرمافزاری جدید خودمون به زبان C++ آموزش دیده، این هفته آموزشش تموم میشه و میره فاز RL».
🔹 نسل بعدی Grok هنوز منتشر نشده که آموزشش داره جمع میشه — Musk قبلاً گفته بود Grok 4.7 قراره ۱۲ سپتامبر بیاد، بعد گفت چند روز دیگه عقب افتاده
🔹 دلیل تأخیرش خودش یه نکتهی فنی جالبه: توی فاز RL جریمهی طول پاسخ زیادی سنگین بود و مدل زودتر از موعد از تسکهای سخت فرار میکرد؛ Musk میگه همین باعث شده مدل بازبینی کردن کار خودش رو یاد نگیره
🔹 طبق محاسبهی TestingCatalog، Grok 4.8 حدود ۶۷٪ بزرگتر از Grok 4.6 (مدل فعلی) میشه و میره توی ردهی مدلهای ۲.۸ تریلیون پارامتری مثل Kimi K3
بعد از تموم شدن آموزش، نوبت فاز RL هست — یعنی تا انتشار عمومی چند هفته فاصله داریم ⏳
🔗 @hjcreative