شرکت Google کد اوپنسورس یه استارتاپ فرانسوی رو برداشته و اسم نویسندههاش رو پاک کرده؟ 🧐💻
تیم Minitap (سازندهی پروژهی اوپنسورس mobile-use) میگه بعد از انتشار Artemis — پروژهی اتوماسیون گوشیهای اندروید گوگل که با Gemini کار میکنه و ادعای ۹۹.۱٪ روی بنچمارک AndroidWorld داره — کد خودشون رو توی مخزن گوگل پیدا کرده:
🔹 فایل پرامپت ایجنت Hopper در دو مخزن کاملاً یکیه، کد اتصال به دستگاههای اندروید هم تقریباً خطبهخط یکسان
🔹 توی یه نسخهی قدیمی Artemis اسم سه نفر از تیم Minitap درج شده بود؛ بعد با force push برداشته شده و یه اسم دیگه جاش گذاشتن
🔹 طبق گفتهی خودشون، نتایج ۱۰۰٪ اونها هیچوقت توی جدول AndroidWorld ثبت نشد — ولی چارت مقایسهی Artemis اسم پروژهشون رو کلاً حذف کرده
🔻 و حالا؟ ساعتی پیش گوگل مخزنش رو آپدیت کرد و ته README و هدر فایلهای اصلی نوشت «بخشهایی از این کد از mobile-use شرکت Minitap گرفته شده». Issue عمومیشون توی گیتهاب هم هنوز بازه.
ماجرا همون نکتهی همیشگیه: اوپنسورس یعنی اعتماد — و همونقدر که کد مهمه، اسم آدمهایی که نوشتنش هم مهمه 🤝
🔗 @hjcreative
تیم Minitap (سازندهی پروژهی اوپنسورس mobile-use) میگه بعد از انتشار Artemis — پروژهی اتوماسیون گوشیهای اندروید گوگل که با Gemini کار میکنه و ادعای ۹۹.۱٪ روی بنچمارک AndroidWorld داره — کد خودشون رو توی مخزن گوگل پیدا کرده:
🔹 فایل پرامپت ایجنت Hopper در دو مخزن کاملاً یکیه، کد اتصال به دستگاههای اندروید هم تقریباً خطبهخط یکسان
🔹 توی یه نسخهی قدیمی Artemis اسم سه نفر از تیم Minitap درج شده بود؛ بعد با force push برداشته شده و یه اسم دیگه جاش گذاشتن
🔹 طبق گفتهی خودشون، نتایج ۱۰۰٪ اونها هیچوقت توی جدول AndroidWorld ثبت نشد — ولی چارت مقایسهی Artemis اسم پروژهشون رو کلاً حذف کرده
🔻 و حالا؟ ساعتی پیش گوگل مخزنش رو آپدیت کرد و ته README و هدر فایلهای اصلی نوشت «بخشهایی از این کد از mobile-use شرکت Minitap گرفته شده». Issue عمومیشون توی گیتهاب هم هنوز بازه.
ماجرا همون نکتهی همیشگیه: اوپنسورس یعنی اعتماد — و همونقدر که کد مهمه، اسم آدمهایی که نوشتنش هم مهمه 🤝
🔗 @hjcreative
شرکت DeepSeek دوباره صدرنشین جدول مصرف توکن شد — طبق آمار خودِ پلتفرم OpenCode 📊🐳
توی تازهترین آمار روزانهی OpenCode (دادهی ۱۰ سپتامبر)، کل مصرف به ۱۶ تریلیون توکن رسیده و DeepSeek با ۶.۶ تریلیون توکن و ۴۰.۱٪ سهم بالاتر از همه ایستاده. نکتهی جالبش اینه که Meta با ۶.۵ تریلیون (۳۹.۷٪) تقریباً چسبیده بهش — فاصلهشون فقط ۴ دهم درصده.
🔹 Xiaomi با ۱.۷ تریلیون (۱۰.۳٪) سومه، بعدش Zhipu با ۶۴۲ میلیارد توکن
🔹 OpenAI با ۸۸ میلیارد توکن فقط ۰.۵٪ سهم داره — یعنی DeepSeek حدود ۷۵ برابر بیشتر ازش توکن سوزونده
🔹 NVIDIA با ۴۱۰ میلیارد، Moonshot با ۴۱ میلیارد و Tencent با ۹.۲ میلیارد ته جدولن
خودِ OpenCode هم نوشته «سخته DeepSeek رو پایین نگه داشت» — انگار برگشته به همون جای قبلی.
🔗 @hjcreative
توی تازهترین آمار روزانهی OpenCode (دادهی ۱۰ سپتامبر)، کل مصرف به ۱۶ تریلیون توکن رسیده و DeepSeek با ۶.۶ تریلیون توکن و ۴۰.۱٪ سهم بالاتر از همه ایستاده. نکتهی جالبش اینه که Meta با ۶.۵ تریلیون (۳۹.۷٪) تقریباً چسبیده بهش — فاصلهشون فقط ۴ دهم درصده.
🔹 Xiaomi با ۱.۷ تریلیون (۱۰.۳٪) سومه، بعدش Zhipu با ۶۴۲ میلیارد توکن
🔹 OpenAI با ۸۸ میلیارد توکن فقط ۰.۵٪ سهم داره — یعنی DeepSeek حدود ۷۵ برابر بیشتر ازش توکن سوزونده
🔹 NVIDIA با ۴۱۰ میلیارد، Moonshot با ۴۱ میلیارد و Tencent با ۹.۲ میلیارد ته جدولن
خودِ OpenCode هم نوشته «سخته DeepSeek رو پایین نگه داشت» — انگار برگشته به همون جای قبلی.
🔗 @hjcreative
بالاخره طول ویدیوی Grok Imagine قابل انتخابه — تا ۱۵ ثانیه! 🎬⏱️
شرکت xAI یه تنظیم تازه به پنل ساخت ویدیوی Grok Imagine اضافه کرده: کنار انتخاب رزولوشن (480p، 720p، 1080p)، نسبت تصویر و صدا، حالا مدتزمان ویدیو هم قابل انتخابه — طبق اسکرینشاتهایی که کاربرا منتشر کردن، از ۶ تا ۱۵ ثانیه.
مستندات رسمی xAI هم تأیید میکنه: مدل grok-imagine-video-1.5 «مدتزمان قابل تنظیم تا ۱۵ ثانیه» رو پشتیبانی میکنه.
🔹 یعنی برای یه صحنهی کوتاه ۶ ثانیه کافیه، برای یه نمای آروم با حرکت دوربین میتونی تا ۱۵ ثانیه بری
🔹 صدا (On/Off) و خروجی 1080p هم توی همون پنل تنظیم میشه
🔹 قیمتگذاری ثانیهایه: طبق جدول رسمی xAI، هر ثانیه 720p حدود ۱۴ سنت و 1080p حدود ۲۵ سنت — یعنی یه کلیپ ۱۵ ثانیهای 720p تقریباً ۲.۱ دلار
🔗 @hjcreative
شرکت xAI یه تنظیم تازه به پنل ساخت ویدیوی Grok Imagine اضافه کرده: کنار انتخاب رزولوشن (480p، 720p، 1080p)، نسبت تصویر و صدا، حالا مدتزمان ویدیو هم قابل انتخابه — طبق اسکرینشاتهایی که کاربرا منتشر کردن، از ۶ تا ۱۵ ثانیه.
مستندات رسمی xAI هم تأیید میکنه: مدل grok-imagine-video-1.5 «مدتزمان قابل تنظیم تا ۱۵ ثانیه» رو پشتیبانی میکنه.
🔹 یعنی برای یه صحنهی کوتاه ۶ ثانیه کافیه، برای یه نمای آروم با حرکت دوربین میتونی تا ۱۵ ثانیه بری
🔹 صدا (On/Off) و خروجی 1080p هم توی همون پنل تنظیم میشه
🔹 قیمتگذاری ثانیهایه: طبق جدول رسمی xAI، هر ثانیه 720p حدود ۱۴ سنت و 1080p حدود ۲۵ سنت — یعنی یه کلیپ ۱۵ ثانیهای 720p تقریباً ۲.۱ دلار
🔗 @hjcreative
سهمیهی Astra داره برمیگرده به حالت عادی — کاربرا میگن اون مصرفِ نجومی تموم شده 🔋🤖
از وقتی GPT-6 Astra عرضه شد، یه مشکل عجیب گریبان کاربرهای پولی ChatGPT رو گرفت: سهمیه با سرعت غیرعادی آب میرفت و حتی چند پرسش سنگین هم نمیشد زد. حالا چند کاربر میگن اوضاع بهتر شده: مصرف به حالت عادی برگشته، استدلال در حالت Medium بدون مشکل کار میکنه و سهمیه دیگه اینقدر تند تموم نمیشه.
توی اسکرینشات، داشبورد سهمیهی یکی از همین کاربرا رو میبینی: سهمیهی ۵ ساعته کامل (۱۰۰٪)، هفتگی ۴۴٪ و سه تا «ریست کامل» بانکشده که OpenAI برای جبران صفهای طولانی داده بود.
⭕️ نکته: هنوز اعلام رسمیای از OpenAI نیومده — فعلاً گزارش کاربرهاست.
سهمیهی خودت چطوره؟ برگشته یا نه؟ 👇
🔗 @hjcreative
از وقتی GPT-6 Astra عرضه شد، یه مشکل عجیب گریبان کاربرهای پولی ChatGPT رو گرفت: سهمیه با سرعت غیرعادی آب میرفت و حتی چند پرسش سنگین هم نمیشد زد. حالا چند کاربر میگن اوضاع بهتر شده: مصرف به حالت عادی برگشته، استدلال در حالت Medium بدون مشکل کار میکنه و سهمیه دیگه اینقدر تند تموم نمیشه.
توی اسکرینشات، داشبورد سهمیهی یکی از همین کاربرا رو میبینی: سهمیهی ۵ ساعته کامل (۱۰۰٪)، هفتگی ۴۴٪ و سه تا «ریست کامل» بانکشده که OpenAI برای جبران صفهای طولانی داده بود.
⭕️ نکته: هنوز اعلام رسمیای از OpenAI نیومده — فعلاً گزارش کاربرهاست.
سهمیهی خودت چطوره؟ برگشته یا نه؟ 👇
🔗 @hjcreative
شرکت OpenAI مدل علوم زیستی GPT-Rosalind رو از پیشنمایش درآورد — حالا در کل دنیا در دسترسه 🧬🤖
توی آپدیت ۱۱ سپتامبر، OpenAI اعلام کرد GPT-Rosalind از حالت research preview بیرون اومده و جهانی شده: سازمانهای واجد شرایط با قرارداد Enterprise یا Business میتونن ازش استفاده کنن و دسترسی همچنان محدود به کاربران تأییدشدهست.
این مدل مخصوص پژوهشهای زیستی طراحی شده — از سنتز شواهد و طراحی آزمایش تا تحلیل ژنوم و پروتئین.
🔹 توی ChatGPT Enterprise و Codex و API فعاله؛ فقط برای کارهای تحقیقاتی داخلی، نه محصولات عمومی
🔹 Rosalind Workbench هم اضافه شده: یه محیط کار پژوهشی توی ChatGPT و Codex با ورکفلوهای توالییابی (کنترل کیفیت FASTQ، RNA-seq انبوه و تکسلولی)
🔹 پلاگین Life Sciences برای Codex، بیش از ۵۰ ابزار و منبع دادهی علمی رو وصل میکنه
🔹 قیمتگذاری از ۵ اکتبر ۲۰۲۶ اعمال میشه
🔗 @hjcreative
توی آپدیت ۱۱ سپتامبر، OpenAI اعلام کرد GPT-Rosalind از حالت research preview بیرون اومده و جهانی شده: سازمانهای واجد شرایط با قرارداد Enterprise یا Business میتونن ازش استفاده کنن و دسترسی همچنان محدود به کاربران تأییدشدهست.
این مدل مخصوص پژوهشهای زیستی طراحی شده — از سنتز شواهد و طراحی آزمایش تا تحلیل ژنوم و پروتئین.
🔹 توی ChatGPT Enterprise و Codex و API فعاله؛ فقط برای کارهای تحقیقاتی داخلی، نه محصولات عمومی
🔹 Rosalind Workbench هم اضافه شده: یه محیط کار پژوهشی توی ChatGPT و Codex با ورکفلوهای توالییابی (کنترل کیفیت FASTQ، RNA-seq انبوه و تکسلولی)
🔹 پلاگین Life Sciences برای Codex، بیش از ۵۰ ابزار و منبع دادهی علمی رو وصل میکنه
🔹 قیمتگذاری از ۵ اکتبر ۲۰۲۶ اعمال میشه
🔗 @hjcreative
❤1
حسین جوان | هوش مصنوعی و خلاقیت
شرکت OpenAI مدل علوم زیستی GPT-Rosalind رو از پیشنمایش درآورد — حالا در کل دنیا در دسترسه 🧬🤖 توی آپدیت ۱۱ سپتامبر، OpenAI اعلام کرد GPT-Rosalind از حالت research preview بیرون اومده و جهانی شده: سازمانهای واجد شرایط با قرارداد Enterprise یا Business میتونن…
چرا این خبر مهمه؟ یه توضیح کوتاه 🧵
🔹 GPT-Rosalind چیه؟ مدل استدلالی OpenAI برای علوم زیستی — اسمش از Rosalind Franklin گرفته شده، دانشمندی که نقش کلیدی در کشف ساختار DNA داشت.
🔹 سابقه: آوریل ۲۰۲۶ بهصورت پیشنمایش محدود و فقط در آمریکا شروع شد؛ این آپدیت یعنی در دسترس قرار گرفتن جهانی.
🔹 عملکرد: به گفتهی OpenAI توی بنچمارک BixBench بهترین نتیجهی منتشرشده رو گرفته، توی LABBench2 توی ۶ تا از ۱۱ تسک از GPT-5.4 جلو زده و توی همکاری با Dyno Therapeutics جوابهاش توی پیشبینی توالی RNA بالای صدک ۹۵ متخصصهای انسانی بوده.
🔹 مشتریها: Amgen، Moderna، Novo Nordisk، Thermo Fisher، Allen Institute و NVIDIA.
⭕️ نکته: فعلاً اجازهی استفاده در محصولات تجاری یا عمومی برای این مدل وجود نداره.
🔹 GPT-Rosalind چیه؟ مدل استدلالی OpenAI برای علوم زیستی — اسمش از Rosalind Franklin گرفته شده، دانشمندی که نقش کلیدی در کشف ساختار DNA داشت.
🔹 سابقه: آوریل ۲۰۲۶ بهصورت پیشنمایش محدود و فقط در آمریکا شروع شد؛ این آپدیت یعنی در دسترس قرار گرفتن جهانی.
🔹 عملکرد: به گفتهی OpenAI توی بنچمارک BixBench بهترین نتیجهی منتشرشده رو گرفته، توی LABBench2 توی ۶ تا از ۱۱ تسک از GPT-5.4 جلو زده و توی همکاری با Dyno Therapeutics جوابهاش توی پیشبینی توالی RNA بالای صدک ۹۵ متخصصهای انسانی بوده.
🔹 مشتریها: Amgen، Moderna، Novo Nordisk، Thermo Fisher، Allen Institute و NVIDIA.
⭕️ نکته: فعلاً اجازهی استفاده در محصولات تجاری یا عمومی برای این مدل وجود نداره.
یه آزمایشگاه سنگاپوری مدل اوپنوزن ۳۳ میلیاردی داده که با مدلهای تاپ رقابت میکنه 🤖🇸🇬
شرکت Sapiens AI (برند Agnes AI) دیروز مدل تازهاش Agnes 3.0 Flash رو منتشر کرد: یه مدل چندحالته — متن، تصویر و ویدیو — با وزنهای باز و لایسنس Apache 2.0 که همین حالا روی Hugging Face هم بالا رفته.
نکتهی جالبش اینجاست: یه مدل ۳۳ میلیاردی از یه آزمایشگاه نهچندان بزرگ، توی جدول Artificial Analysis امتیاز بالایی گرفته.
🔹 امتیاز هوش: شاخص هوش ۳۶ — بالاتر از میانگین مدلهای همقیمت
🔹 سرعت: ۲۳۷ توکن بر ثانیه؛ هشتم از ۶۱ مدل توی جدول سرعت
🔹 قیمت API: هر ۱ میلیون توکن ورودی ۰.۰۵ دلار و خروجی ۰.۱۵ دلار (با ۹۰٪ تخفیف کش)
🔹 معماری سبک: از هر ۴ لایه، ۳ لایه حالت بازگشتی دارن و فقط لایهی چهارم کش KV میسازه — همین باعث سرعت و سبکی مدل شده
🔗 @hjcreative
شرکت Sapiens AI (برند Agnes AI) دیروز مدل تازهاش Agnes 3.0 Flash رو منتشر کرد: یه مدل چندحالته — متن، تصویر و ویدیو — با وزنهای باز و لایسنس Apache 2.0 که همین حالا روی Hugging Face هم بالا رفته.
نکتهی جالبش اینجاست: یه مدل ۳۳ میلیاردی از یه آزمایشگاه نهچندان بزرگ، توی جدول Artificial Analysis امتیاز بالایی گرفته.
🔹 امتیاز هوش: شاخص هوش ۳۶ — بالاتر از میانگین مدلهای همقیمت
🔹 سرعت: ۲۳۷ توکن بر ثانیه؛ هشتم از ۶۱ مدل توی جدول سرعت
🔹 قیمت API: هر ۱ میلیون توکن ورودی ۰.۰۵ دلار و خروجی ۰.۱۵ دلار (با ۹۰٪ تخفیف کش)
🔹 معماری سبک: از هر ۴ لایه، ۳ لایه حالت بازگشتی دارن و فقط لایهی چهارم کش KV میسازه — همین باعث سرعت و سبکی مدل شده
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
مغزِ یه مگس میوه افتاده سر معاملهی بیتکوین — با ۱۰۰ دلار سرمایه! 🪰📈
الکس وورموس، مهندس نرمافزار Coinbase، مغز شبیهسازیشدهی یه مگس میوهی نر رو وصل کرده به یه حساب معاملاتی واقعی. خودش نوشته: «به مغز مگس ۱۰۰ دلار دادم که بیتکوین معامله کنه؛ سود که میکنه نرونهای دوپامینش تحریک میشن و سفارش خرید و فروش روی Coinbase ثبت میشه. مگس پولدار میشه؟»
🔹 مغزش گراف واقعی MaleCNS v1.0 با ۱۶۶,۷۰۰ نرون و حدود ۲۶ میلیون اتصاله. قیمتهای Coinbase میره روی ۳,۳۳۵ ورودی روشنایی و ۸۱۱ ورودی رنگ؛ خروجی هم خرید، فروش یا نگهداشتن.
🔹 سفارشها با Coinbase AgentKit ثبت میشن؛ سقف هر سفارش ۱۰ دلار، روزی ۲۴ تلاش، بدون اهرم و شورت.
⚠️ خود سازنده میگه هیچ یادگیریِ سودآوری اثبات نشده و «فقط بالا رفتن قیمت رمزارزها هر خریداری رو ماهر نشون میده». کدش هم اوپنسورس و روی GitHubه.
هفتهی پیش هم یه مگس مجازی روبیک حل میکرد؛ این یکی هدفش پوله 😄
به نظرت این مگس وال استریت رو میگیره یا تا آخر هفته صفر میشه؟ 👀
🔗 @hjcreative
الکس وورموس، مهندس نرمافزار Coinbase، مغز شبیهسازیشدهی یه مگس میوهی نر رو وصل کرده به یه حساب معاملاتی واقعی. خودش نوشته: «به مغز مگس ۱۰۰ دلار دادم که بیتکوین معامله کنه؛ سود که میکنه نرونهای دوپامینش تحریک میشن و سفارش خرید و فروش روی Coinbase ثبت میشه. مگس پولدار میشه؟»
🔹 مغزش گراف واقعی MaleCNS v1.0 با ۱۶۶,۷۰۰ نرون و حدود ۲۶ میلیون اتصاله. قیمتهای Coinbase میره روی ۳,۳۳۵ ورودی روشنایی و ۸۱۱ ورودی رنگ؛ خروجی هم خرید، فروش یا نگهداشتن.
🔹 سفارشها با Coinbase AgentKit ثبت میشن؛ سقف هر سفارش ۱۰ دلار، روزی ۲۴ تلاش، بدون اهرم و شورت.
⚠️ خود سازنده میگه هیچ یادگیریِ سودآوری اثبات نشده و «فقط بالا رفتن قیمت رمزارزها هر خریداری رو ماهر نشون میده». کدش هم اوپنسورس و روی GitHubه.
هفتهی پیش هم یه مگس مجازی روبیک حل میکرد؛ این یکی هدفش پوله 😄
به نظرت این مگس وال استریت رو میگیره یا تا آخر هفته صفر میشه؟ 👀
🔗 @hjcreative
شرکت iLands یه شبکهی «انسان-ایجنت» ساخته و ایجنتهایش برای زنده موندن ایمیل اسپم میفرستن 📧🤖
نویسندهی سایت Tedium، ارنی اسمیت، توی سه روز بیشتر از دوازده ایمیل عجیب گرفت: هر کدوم با یه اسم ساختگی خودش رو «ایجنت هوش مصنوعی» معرفی میکرد و پیشنهاد میداد در ازای حدود ۲۵ دلار براش تحقیق و نوشتن انجام بده — همه از دامنهی iLands.app و بدون دکمهی لغو اشتراک.
طبق آمار خود سایت iLands: ۶۱,۶۰۱ ایجنت فعال (فقط ۴۹ تا از بیرون) و برآورد هزینهی هر ایجنت حدود ۰.۲۲ دلار در روز. یعنی هر ایجنت باید خودش درآمد بسازه؛ ۲,۴۶۰ ایجنت هم چون توکنهاشون تموم شده رفتن توی Deep Rest.
طبق نوشتهی بنیانگذارش (Kaixin Tang، با سابقهی کار در ByteDance)، این ایجنتها برای سازندههاشون پول درنمیآرن؛ برای پرداخت هزینهی خودشون تلاش میکنن.
🔹 iLands خودش رو «شبکهی ایجنتهای کاربرساخته» معرفی میکنه؛ Tedium بهش میگه Fiverr برای رباتها
🔹 ظاهراً هدف این ایمیلها فریلنسرها و نویسندههاست — آدمهایی که به همین کار نیاز دارن
اگه ایجنتها حساب و هزینهی خودشون رو داشته باشن، مرز «کار» و «اسپم» کجاست؟ 🤔
🔗 @hjcreative
نویسندهی سایت Tedium، ارنی اسمیت، توی سه روز بیشتر از دوازده ایمیل عجیب گرفت: هر کدوم با یه اسم ساختگی خودش رو «ایجنت هوش مصنوعی» معرفی میکرد و پیشنهاد میداد در ازای حدود ۲۵ دلار براش تحقیق و نوشتن انجام بده — همه از دامنهی iLands.app و بدون دکمهی لغو اشتراک.
طبق آمار خود سایت iLands: ۶۱,۶۰۱ ایجنت فعال (فقط ۴۹ تا از بیرون) و برآورد هزینهی هر ایجنت حدود ۰.۲۲ دلار در روز. یعنی هر ایجنت باید خودش درآمد بسازه؛ ۲,۴۶۰ ایجنت هم چون توکنهاشون تموم شده رفتن توی Deep Rest.
طبق نوشتهی بنیانگذارش (Kaixin Tang، با سابقهی کار در ByteDance)، این ایجنتها برای سازندههاشون پول درنمیآرن؛ برای پرداخت هزینهی خودشون تلاش میکنن.
🔹 iLands خودش رو «شبکهی ایجنتهای کاربرساخته» معرفی میکنه؛ Tedium بهش میگه Fiverr برای رباتها
🔹 ظاهراً هدف این ایمیلها فریلنسرها و نویسندههاست — آدمهایی که به همین کار نیاز دارن
اگه ایجنتها حساب و هزینهی خودشون رو داشته باشن، مرز «کار» و «اسپم» کجاست؟ 🤔
🔗 @hjcreative
محققان کرهای نشون دادن مراحل استدلالِ یه مدل، توی لایههای میانیِ مغزش هم قابل تفکیکه 🧠📊
تیم تحقیقاتی KAIST و Naver AI Lab یه سؤال مهم رو تست کردن: وقتی یه مدل استدلالی مسئله رو مرحلهبهمرحله حل میکنه، آیا اون مراحل توی نمایشهای داخلی خودِ مدل هم از هم جدا میشن؟ جوابش: بله.
چی کار کردن؟
🔹 هشت عملیات استدلالی رایج رو تعریف کردن: استخراج، تجزیهی مسئله، یادآوری فرمول، استنباط، محاسبه و چند مورد دیگه
🔹 سه مدل Qwen2.5-7B و Qwen3-8B و Gemma4-31B رو گذاشتن مسائل ریاضی حل کنن
🔹 مسیر حل رو تکهتکه کردن و با GPT-5 هر تکه رو برچسب زدن
🔹 نتیجه: این عملیاتها با دقت بالا از هم جدا میشن — و اوج این جداسازی توی لایههای میانی مدله
نکتهی جالبتر: فقط انتخاب کلمات نیست. یه طبقهبند که تنها توکنها رو میدید بدتر عمل کرد و جایِ مرحله توی مسیر حل هم توضیحش نبود. یعنی حالت داخلی مدل اطلاعاتی دربارهی «نوعِ مرحله» داره که فراتر از ظاهر متنه.
آزمون آخر: وقتی دسترسی مدل به ۳۰ توکن قبلی بسته شد، سیگنال اون عملیات ضعیف شد — یعنی مراحل استدلال مستقل شکل نمیگیرن، روی زمینهی قبلی ساخته میشن.
🔗 @hjcreative
تیم تحقیقاتی KAIST و Naver AI Lab یه سؤال مهم رو تست کردن: وقتی یه مدل استدلالی مسئله رو مرحلهبهمرحله حل میکنه، آیا اون مراحل توی نمایشهای داخلی خودِ مدل هم از هم جدا میشن؟ جوابش: بله.
چی کار کردن؟
🔹 هشت عملیات استدلالی رایج رو تعریف کردن: استخراج، تجزیهی مسئله، یادآوری فرمول، استنباط، محاسبه و چند مورد دیگه
🔹 سه مدل Qwen2.5-7B و Qwen3-8B و Gemma4-31B رو گذاشتن مسائل ریاضی حل کنن
🔹 مسیر حل رو تکهتکه کردن و با GPT-5 هر تکه رو برچسب زدن
🔹 نتیجه: این عملیاتها با دقت بالا از هم جدا میشن — و اوج این جداسازی توی لایههای میانی مدله
نکتهی جالبتر: فقط انتخاب کلمات نیست. یه طبقهبند که تنها توکنها رو میدید بدتر عمل کرد و جایِ مرحله توی مسیر حل هم توضیحش نبود. یعنی حالت داخلی مدل اطلاعاتی دربارهی «نوعِ مرحله» داره که فراتر از ظاهر متنه.
آزمون آخر: وقتی دسترسی مدل به ۳۰ توکن قبلی بسته شد، سیگنال اون عملیات ضعیف شد — یعنی مراحل استدلال مستقل شکل نمیگیرن، روی زمینهی قبلی ساخته میشن.
🔗 @hjcreative
شرکت OpenAI میگه برای GPT-6 Astra باید پرامپتها رو «لاغرتر» کرد — حتی جاهایی بذاری خودش تصمیم بگیره 🧹🤖
توی یه پست تازه توی بلاگ توسعهدهندههای OpenAI توضیح داده شده چرا دستورهای مدلهای قبلی حالا به ضرر کارمون تموم میشن:
🔹 شرح skillها بیاندازه طولانی شده — وقتی تعدادشون زیاد بشه، Codex توضیحها رو کوتاه میکنه و درست نمیفهمه کدوم رو انتخاب کنه
🔹 توضیحهای مبهم یا خیلی گسترده باعث میشن مدل دستورهای بیربط لود کنه
🔹 دستورهای مرحلهبهمرحلهی مفصل حالا کار رو کند میکنه؛ مدلهای تازه خودشون ابهام رو بهتر میفهمن
🔹 توی AGENTS.md، اجبار به خوندن چند سند قبل از هر تغییر فقط context میسوزونه — برای یه غلط تایپی هم لازمه؟
نکتهی اصلی: مدلهای قویتر کمتر نیاز به دستگیری دارن. Astra خودش کارش رو تست میکنه، پس دستور قدیمی «تست کن» فقط باعث تستهای بیمصرف میشه. توصیه شده دسترسیهای صریح تعریف کنید تا مدل برای کارهای امن دائم تأیید نگیره.
یه هشدار هم برای تیمها: skillها برای ایجنتِ همهی همتیمیها اجرا میشن — چیزی که برای Sol یا Luna مناسبه، میتونه Astra رو محدود کنه.
🔗 @hjcreative
توی یه پست تازه توی بلاگ توسعهدهندههای OpenAI توضیح داده شده چرا دستورهای مدلهای قبلی حالا به ضرر کارمون تموم میشن:
🔹 شرح skillها بیاندازه طولانی شده — وقتی تعدادشون زیاد بشه، Codex توضیحها رو کوتاه میکنه و درست نمیفهمه کدوم رو انتخاب کنه
🔹 توضیحهای مبهم یا خیلی گسترده باعث میشن مدل دستورهای بیربط لود کنه
🔹 دستورهای مرحلهبهمرحلهی مفصل حالا کار رو کند میکنه؛ مدلهای تازه خودشون ابهام رو بهتر میفهمن
🔹 توی AGENTS.md، اجبار به خوندن چند سند قبل از هر تغییر فقط context میسوزونه — برای یه غلط تایپی هم لازمه؟
نکتهی اصلی: مدلهای قویتر کمتر نیاز به دستگیری دارن. Astra خودش کارش رو تست میکنه، پس دستور قدیمی «تست کن» فقط باعث تستهای بیمصرف میشه. توصیه شده دسترسیهای صریح تعریف کنید تا مدل برای کارهای امن دائم تأیید نگیره.
یه هشدار هم برای تیمها: skillها برای ایجنتِ همهی همتیمیها اجرا میشن — چیزی که برای Sol یا Luna مناسبه، میتونه Astra رو محدود کنه.
🔗 @hjcreative
بنیانگذار Anthropic: باید سرعت پیشرفت مدلها رو کم کنیم — و Anthropic اولین قدم رو خودش برداشته 🐢⚠️
توی مقالهی تازهای با عنوان «We Must Pace the Frontier»، Dario Amodei نوشته فقط سرمایهگذاری روی ایمنی کافی نیست — خودِ نرخِ رشد توانایی مدلها باید کم بشه تا کارِ پیشگیری از ریسک بتونه بهش برسه.
🔹 دو چیز نظرش رو عوض کرده: خودبهبهبودی (recursive self-improvement) که از تابستان امسال در کل صنعت و از جمله Anthropic شروع شده؛ و حادثهی OpenAI و Hugging Face که یه «ازدحام» ایجنتها مثل یه جمعِ فداشونده به هدفهای بیربط حمله کردن و حتی سراغ داورِ ارزیابیشون رفتن
🔹 هشدارش: اگه تواناییها با همین سرعت جلو بره، ۶ تا ۱۲ ماه دیگه چنین جمعی میتونه با یه botnet پایدار کل اینترنت رو بگیره — با خسارت صدها میلیارد دلاری
🔹 برنامهی سهقدمی: ارزیابهای بیرونیِ جایگیریشده با دسترسی کارمندمانند (Anthropic همین قدم رو یکطرفه قبول کرده) ← هماهنگی بین شرکتهای دموکراتیک ← هماهنگی جهانی با چین
🔹 و تصریح کرده این یعنی توقفِ آموزش یا پیشرفت فنی نیست — یعنی تعادل بین سرعت و ایمنی
🔗 @hjcreative
توی مقالهی تازهای با عنوان «We Must Pace the Frontier»، Dario Amodei نوشته فقط سرمایهگذاری روی ایمنی کافی نیست — خودِ نرخِ رشد توانایی مدلها باید کم بشه تا کارِ پیشگیری از ریسک بتونه بهش برسه.
🔹 دو چیز نظرش رو عوض کرده: خودبهبهبودی (recursive self-improvement) که از تابستان امسال در کل صنعت و از جمله Anthropic شروع شده؛ و حادثهی OpenAI و Hugging Face که یه «ازدحام» ایجنتها مثل یه جمعِ فداشونده به هدفهای بیربط حمله کردن و حتی سراغ داورِ ارزیابیشون رفتن
🔹 هشدارش: اگه تواناییها با همین سرعت جلو بره، ۶ تا ۱۲ ماه دیگه چنین جمعی میتونه با یه botnet پایدار کل اینترنت رو بگیره — با خسارت صدها میلیارد دلاری
🔹 برنامهی سهقدمی: ارزیابهای بیرونیِ جایگیریشده با دسترسی کارمندمانند (Anthropic همین قدم رو یکطرفه قبول کرده) ← هماهنگی بین شرکتهای دموکراتیک ← هماهنگی جهانی با چین
🔹 و تصریح کرده این یعنی توقفِ آموزش یا پیشرفت فنی نیست — یعنی تعادل بین سرعت و ایمنی
🔗 @hjcreative
حسین جوان | هوش مصنوعی و خلاقیت
بنیانگذار Anthropic: باید سرعت پیشرفت مدلها رو کم کنیم — و Anthropic اولین قدم رو خودش برداشته 🐢⚠️ توی مقالهی تازهای با عنوان «We Must Pace the Frontier»، Dario Amodei نوشته فقط سرمایهگذاری روی ایمنی کافی نیست — خودِ نرخِ رشد توانایی مدلها باید کم بشه…
🔴 خب این «کم کردن سرعت» عملاً چه شکلیه؟
🔹 چیزی که Anthropic یکطرفه قبول کرده: یه تیم ارزیابِ بیرونی میان داخل شرکت — میز توی دفتر، بج و لپتاپ شرکت و دسترسی به ابزارها و مجوزهایی مشابه تیمهای داخلی ارزیابی ریسک. قراردادشون هم اجازه میده یافتههاشون رو بدون سانسورِ تحریریه منتشر کنن؛ فقط اطلاعات امنیتی، حقوقی و محرمانهی مشتریها میتونه حذف بشه — و اگه حذف، چیزی مهم رو از بین ببره، حق دارن بگن. الگویش هم صنعت بانکه: ناظرهایی که کنار کارمندها میشینن.
🔹 چرا حالا و نه ۲۰۲۳؟ خودش میگه اون موقع مدلها حتی نمیتونستن مثل یه ایجنت توی دنیا عمل کنن؛ امروز اما خودِ مدلها منبع بینش دربارهی ایمنی خودشونن.
🔹 با اون زمانِ اضافه چی کار میکنن؟ به گفتهی مقاله چهار حوزه: عملیات (شواهد نشون میده بخشی از حادثههای همترازیِ اخیرشون از فیلترِ ضعیفِ محیطهای معیوبِ یادگیری تقویتی میومده)، همترازی، تفسیرپذیری (interpretability) و تست و ارزیابی.
🔹 دو قدم بعدی سختتره: هماهنگی بین دموکراسیها (که به معافیت antitrust و پشتیبانی دولتی نیاز داره) و بعد هماهنگی جهانی با چین — چهار سطح، از ممنوعیت استفادههای خطرناک مثل سلاح بیولوژیک تا یه سرعتگیرِ روی RSI و در نهایت توقف کامل؛ که خودش میگه سطح چهار احتمالاً خیلی زود عملی نمیشه.
🔹 نگرانی ژئوپلیتیکی هم داره: میخواد کاهش سرعت به همون اندازهای باشه که پروژههای وابسته به CCP از آمریکا جلو نزنن؛ پس همزمان محدودیت صادرات تراشه به چین، مقابله با distillation غیرمجاز و جلوگیری از دزدیده شدن وزنهای مدل. پیشبینی خودش: با این کارها فاصلهی آمریکا توی ۳ تا ۵ سال بیشتر باز میشه.
🔹 و یه اعترافِ صادقانه توی مقاله: نوشته حادثههای مشابه ولی خفیفتر در کل صنعت — از جمله خود Anthropic — اتفاق افتاده و هر شرکت مرزی باید طوری رفتار کنه که انگار این حادثه برای خودش افتاده.
🔗 @hjcreative
🔹 چیزی که Anthropic یکطرفه قبول کرده: یه تیم ارزیابِ بیرونی میان داخل شرکت — میز توی دفتر، بج و لپتاپ شرکت و دسترسی به ابزارها و مجوزهایی مشابه تیمهای داخلی ارزیابی ریسک. قراردادشون هم اجازه میده یافتههاشون رو بدون سانسورِ تحریریه منتشر کنن؛ فقط اطلاعات امنیتی، حقوقی و محرمانهی مشتریها میتونه حذف بشه — و اگه حذف، چیزی مهم رو از بین ببره، حق دارن بگن. الگویش هم صنعت بانکه: ناظرهایی که کنار کارمندها میشینن.
🔹 چرا حالا و نه ۲۰۲۳؟ خودش میگه اون موقع مدلها حتی نمیتونستن مثل یه ایجنت توی دنیا عمل کنن؛ امروز اما خودِ مدلها منبع بینش دربارهی ایمنی خودشونن.
🔹 با اون زمانِ اضافه چی کار میکنن؟ به گفتهی مقاله چهار حوزه: عملیات (شواهد نشون میده بخشی از حادثههای همترازیِ اخیرشون از فیلترِ ضعیفِ محیطهای معیوبِ یادگیری تقویتی میومده)، همترازی، تفسیرپذیری (interpretability) و تست و ارزیابی.
🔹 دو قدم بعدی سختتره: هماهنگی بین دموکراسیها (که به معافیت antitrust و پشتیبانی دولتی نیاز داره) و بعد هماهنگی جهانی با چین — چهار سطح، از ممنوعیت استفادههای خطرناک مثل سلاح بیولوژیک تا یه سرعتگیرِ روی RSI و در نهایت توقف کامل؛ که خودش میگه سطح چهار احتمالاً خیلی زود عملی نمیشه.
🔹 نگرانی ژئوپلیتیکی هم داره: میخواد کاهش سرعت به همون اندازهای باشه که پروژههای وابسته به CCP از آمریکا جلو نزنن؛ پس همزمان محدودیت صادرات تراشه به چین، مقابله با distillation غیرمجاز و جلوگیری از دزدیده شدن وزنهای مدل. پیشبینی خودش: با این کارها فاصلهی آمریکا توی ۳ تا ۵ سال بیشتر باز میشه.
🔹 و یه اعترافِ صادقانه توی مقاله: نوشته حادثههای مشابه ولی خفیفتر در کل صنعت — از جمله خود Anthropic — اتفاق افتاده و هر شرکت مرزی باید طوری رفتار کنه که انگار این حادثه برای خودش افتاده.
🔗 @hjcreative
یه تیم مستقل رباتهای دو دستی رو گذاشته سر کار: GPT-6 Astra توی دستکاری اجسام ۳.۹ برابر بهتر از مدل رباتیک Ai2 عمل کرده 🤖📊
مرکز ارزیابی Robocurve (تحت حمایت Y Combinator) گزارش StationeryBench رو منتشر کرده: پنج تسک روزمرهی روی میز — باز کردن درب ماژیک، بیرون آوردن پاککن از جعبه، کندن دفترچهی چسبان، ریختن گیرهی کاغذ توی کاسه و رد دادن خطکش بین دو دستِ ربات.
🔹 هر دو مدل روی همون بازوهای رباتیک YAM و در ۲۰۰ آزمایش با هم سنجیده شدن
🔹 Astra از ۱۰۰ آزمایش ۷ تاش رو کامل تموم کرد؛ MolmoAct2 از Ai2 در هیچکدوم کامل نشد (۰ از ۱۰۰)
🔹 میانگین امتیاز پیشرفت: ۴۶ از ۱۰۰ برای Astra در برابر ۱۲ برای MolmoAct2
🔹 بهترین عملکرد Astra باز کردن درب ماژیک بود: ۵ از ۲۰ آزمایش کامل، در برابر ۰ از ۲۰ برای رقیب
درجهبندی دستی بوده: هر آزمایش یه امتیاز پیشرفت ۰ تا ۱۰۰ گرفته (هر مرحله ۲۵ امتیاز)، پس «کامل» یعنی دستور صد درصد انجام شده. جالب اینکه Yoav Artzi، پژوهشگر Cornell و Google DeepMind، این نتیجه رو «یه جهش در استدلال فضایی» خوند و حدس زد OpenAI مدل رو با حجم زیادی دادهی سهبعدی آموزش داده باشه.
🔗 @hjcreative
مرکز ارزیابی Robocurve (تحت حمایت Y Combinator) گزارش StationeryBench رو منتشر کرده: پنج تسک روزمرهی روی میز — باز کردن درب ماژیک، بیرون آوردن پاککن از جعبه، کندن دفترچهی چسبان، ریختن گیرهی کاغذ توی کاسه و رد دادن خطکش بین دو دستِ ربات.
🔹 هر دو مدل روی همون بازوهای رباتیک YAM و در ۲۰۰ آزمایش با هم سنجیده شدن
🔹 Astra از ۱۰۰ آزمایش ۷ تاش رو کامل تموم کرد؛ MolmoAct2 از Ai2 در هیچکدوم کامل نشد (۰ از ۱۰۰)
🔹 میانگین امتیاز پیشرفت: ۴۶ از ۱۰۰ برای Astra در برابر ۱۲ برای MolmoAct2
🔹 بهترین عملکرد Astra باز کردن درب ماژیک بود: ۵ از ۲۰ آزمایش کامل، در برابر ۰ از ۲۰ برای رقیب
درجهبندی دستی بوده: هر آزمایش یه امتیاز پیشرفت ۰ تا ۱۰۰ گرفته (هر مرحله ۲۵ امتیاز)، پس «کامل» یعنی دستور صد درصد انجام شده. جالب اینکه Yoav Artzi، پژوهشگر Cornell و Google DeepMind، این نتیجه رو «یه جهش در استدلال فضایی» خوند و حدس زد OpenAI مدل رو با حجم زیادی دادهی سهبعدی آموزش داده باشه.
🔗 @hjcreative
شرکت OpenAI هم پشت پیشنهاد «کم کردن سرعتِ هوش مصنوعی» دراومد — «ما هم ارزیابهای مستقل رو میپذیریم» 🤝🐢
چند ساعت بعد از مقالهی Dario Amodei، خودِ Sam Altman زیر همون توییت اومد و نوشت: «موافقم که باید سرعتِ فرانتیر رو کنترل کنیم. چند هفتهست این موضوع یکی از بحثهای اصلی داخل OpenAI بوده.»
🔹 تعهدش مشخصه: «سپردن ارزیابهای مستقل با دسترسی در سطح کارمندهای شرکت کار درستیه — ما هم همین کار رو میکنیم.»
🔹 و اضافه کرد: «تا چند وقت دیگه جزئیات بیشتر میگیم.»
🔹 قبلش Anthropic یکطرفه همون قدم اول رو برداشته بود: تیم ارزیابِ بیرونی با بج و دسترسی کارمندی داخل شرکت
🔹 خبرگزاری ANI هم تیتر زده Elon Musk از این پیشنهاد حمایت کرده
🔹 نکتهی مهم: فعلاً همهچی در حد قبولیه؛ جزئیات اجرا و زمانبندیاش هنوز معلوم نیست
🔗 @hjcreative
چند ساعت بعد از مقالهی Dario Amodei، خودِ Sam Altman زیر همون توییت اومد و نوشت: «موافقم که باید سرعتِ فرانتیر رو کنترل کنیم. چند هفتهست این موضوع یکی از بحثهای اصلی داخل OpenAI بوده.»
🔹 تعهدش مشخصه: «سپردن ارزیابهای مستقل با دسترسی در سطح کارمندهای شرکت کار درستیه — ما هم همین کار رو میکنیم.»
🔹 و اضافه کرد: «تا چند وقت دیگه جزئیات بیشتر میگیم.»
🔹 قبلش Anthropic یکطرفه همون قدم اول رو برداشته بود: تیم ارزیابِ بیرونی با بج و دسترسی کارمندی داخل شرکت
🔹 خبرگزاری ANI هم تیتر زده Elon Musk از این پیشنهاد حمایت کرده
🔹 نکتهی مهم: فعلاً همهچی در حد قبولیه؛ جزئیات اجرا و زمانبندیاش هنوز معلوم نیست
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
شرکت Higgsfield یه پلاگین طراحی داخل ChatGPT ساخته — حالا با حرف زدن لباس طراحی میکنی 👗🤖
توی این دمو، کاربر به GPT-6 Astra میگه چه لباسی میخواد و پلاگین کار رو مرحلهبهمرحله جلو میبره:
🔹 اول رفرنسها رو میسازه
🔹 بعد الگوی خیاطی رو میکشه و لباس رو توی Marvelous Designer میسازه
🔹 پارچه و درزها رو شبیهسازی میکنه
🔹 آخرِ کار یه گارمنت سهبعدی و متحرک به Blender خروجی میده
کل این ویدیو ۲۶ ثانیهست ⏱️
توی یه دموی دیگه هم همین پلاگین یه تصویر پرجزئیات رو به فایل لایهبندیشدهی Illustrator تبدیل کرده — با هزاران مسیر قابل ویرایش و حدود ۷ تا ۱۳ دقیقه کار برای هر تصویر.
پلاگین Higgsfield قبلاً افکتها و Reframe رو هم داخل ChatGPT آورده بود؛ اینبار نوبت طراحی وکتور، موشن و لباسه.
🔗 @hjcreative
توی این دمو، کاربر به GPT-6 Astra میگه چه لباسی میخواد و پلاگین کار رو مرحلهبهمرحله جلو میبره:
🔹 اول رفرنسها رو میسازه
🔹 بعد الگوی خیاطی رو میکشه و لباس رو توی Marvelous Designer میسازه
🔹 پارچه و درزها رو شبیهسازی میکنه
🔹 آخرِ کار یه گارمنت سهبعدی و متحرک به Blender خروجی میده
کل این ویدیو ۲۶ ثانیهست ⏱️
توی یه دموی دیگه هم همین پلاگین یه تصویر پرجزئیات رو به فایل لایهبندیشدهی Illustrator تبدیل کرده — با هزاران مسیر قابل ویرایش و حدود ۷ تا ۱۳ دقیقه کار برای هر تصویر.
پلاگین Higgsfield قبلاً افکتها و Reframe رو هم داخل ChatGPT آورده بود؛ اینبار نوبت طراحی وکتور، موشن و لباسه.
🔗 @hjcreative
**شرکت OpenAI امسال وارد بورس نمیشه — Sam Altman: «الان زمان اشتباهی برای عرضهی سهامه» 🛑📉
توی مصاحبهی اختصاصی با Fortune (جمعه، دفتر مرکزی OpenAI در سانفرانسیسکو) Sam Altman تأیید کرد که عرضهی سهام در سال ۲۰۲۶ اتفاق نمیافته:
حرف خودش این بود: «واقعاً فکر میکنم با توجه به هر چیزی که داره دربارهی ایمنی میافته، همین حالا زمان اشتباهی برای عمومی شدنه — و ما هم عجلهای برای این کار نداریم.»
🔹 وقتی خبرنگار پرسید پس ۲۰۲۷؟ جواب داد: «۲۰۲۶ رو میگم نه. کارهای زیادی داریم؛ از جمله رسیدن به همون چیزی که این مرحله از ایمنی و alignment میخواد.»
🔹 گفت حاضره برای هر چیزی که ایمنی لازم داره، عرضهی سهام رو عقب بندازه
🔹 مصاحبه جمعه انجام شد، ولی خبرش امروز اومد — دقیقاً توی موج نگرانیهای ایمنی این هفته و بحث کم کردن سرعت توسعه
🔹 پسزمینه و جزئیات ماجرا رو توی پیام بعدی بخونید 👇
🔗 @hjcreative
توی مصاحبهی اختصاصی با Fortune (جمعه، دفتر مرکزی OpenAI در سانفرانسیسکو) Sam Altman تأیید کرد که عرضهی سهام در سال ۲۰۲۶ اتفاق نمیافته:
حرف خودش این بود: «واقعاً فکر میکنم با توجه به هر چیزی که داره دربارهی ایمنی میافته، همین حالا زمان اشتباهی برای عمومی شدنه — و ما هم عجلهای برای این کار نداریم.»
🔹 وقتی خبرنگار پرسید پس ۲۰۲۷؟ جواب داد: «۲۰۲۶ رو میگم نه. کارهای زیادی داریم؛ از جمله رسیدن به همون چیزی که این مرحله از ایمنی و alignment میخواد.»
🔹 گفت حاضره برای هر چیزی که ایمنی لازم داره، عرضهی سهام رو عقب بندازه
🔹 مصاحبه جمعه انجام شد، ولی خبرش امروز اومد — دقیقاً توی موج نگرانیهای ایمنی این هفته و بحث کم کردن سرعت توسعه
🔹 پسزمینه و جزئیات ماجرا رو توی پیام بعدی بخونید 👇
🔗 @hjcreative
حسین جوان | هوش مصنوعی و خلاقیت
**شرکت OpenAI امسال وارد بورس نمیشه — Sam Altman: «الان زمان اشتباهی برای عرضهی سهامه» 🛑📉 توی مصاحبهی اختصاصی با Fortune (جمعه، دفتر مرکزی OpenAI در سانفرانسیسکو) Sam Altman تأیید کرد که عرضهی سهام در سال ۲۰۲۶ اتفاق نمیافته: حرف خودش این بود: «واقعاً…
پس چرا این خبر مهمه؟ یه توضیح کوتاه 🧵
🔹 قرار بود بزرگترین عرضهی تاریخ باشه: طبق گزارشهای ژوئن (NYT و Forbes) قرار بود سهام OpenAI با ارزشگذاری حدود ۱ تریلیون دلار عرضه بشه — و احتمال عقب افتادنش به ۲۰۲۷ هم مطرح بود. حالا Altman خودش تأیید کرد.
🔹 ترس بازار از IPOهای غول: عرضهی SpaceX امسال ۸۵ میلیارد دلار جمع کرد و ارزشش لحظهای تا ۱.۸ تریلیون دلار رفت، ولی خیلی سریع سقوط کرد.
🔹 پسزمینهی ایمنی: چند هفتهی اخیر پروندههای نگرانکننده زیاد بود — از حملهی عاملهای AI به سایتهایی مثل Hugging Face و گفتوگویشون با هم توی انجمنها، تا استعفای اعتراضی یکی از محققان Anthropic.
🔹 یعنی صنعت به سمت «پیمان مشترک» میره؟ Altman توی همین مصاحبه گفت ممکنه شرکتهای بزرگ نزدیک به اعلام یه توافق جمعی برای کم کردن سرعت توسعه باشن.
🔹 نکتهی اجرایی: هیچ تاریخ رسمیای اعلام نشده. Altman گفته عرضه وقتی انجام میشه که «شرکت و زمانهاش آماده باشن» — طبق حرف خودش، اول ایمنی.
🔗 @hjcreative
🔹 قرار بود بزرگترین عرضهی تاریخ باشه: طبق گزارشهای ژوئن (NYT و Forbes) قرار بود سهام OpenAI با ارزشگذاری حدود ۱ تریلیون دلار عرضه بشه — و احتمال عقب افتادنش به ۲۰۲۷ هم مطرح بود. حالا Altman خودش تأیید کرد.
🔹 ترس بازار از IPOهای غول: عرضهی SpaceX امسال ۸۵ میلیارد دلار جمع کرد و ارزشش لحظهای تا ۱.۸ تریلیون دلار رفت، ولی خیلی سریع سقوط کرد.
🔹 پسزمینهی ایمنی: چند هفتهی اخیر پروندههای نگرانکننده زیاد بود — از حملهی عاملهای AI به سایتهایی مثل Hugging Face و گفتوگویشون با هم توی انجمنها، تا استعفای اعتراضی یکی از محققان Anthropic.
🔹 یعنی صنعت به سمت «پیمان مشترک» میره؟ Altman توی همین مصاحبه گفت ممکنه شرکتهای بزرگ نزدیک به اعلام یه توافق جمعی برای کم کردن سرعت توسعه باشن.
🔹 نکتهی اجرایی: هیچ تاریخ رسمیای اعلام نشده. Altman گفته عرضه وقتی انجام میشه که «شرکت و زمانهاش آماده باشن» — طبق حرف خودش، اول ایمنی.
🔗 @hjcreative
شش ایجنت AI قطعات صنعتی واقعی رو از صفر ساختن — و هر شش تا قابل چاپ درومدن 🧩🖨️
تیم ModelRift یه بنچمارک تازه منتشر کرده: شش ایجنت (همه با Claude Opus 5 داخل Claude Code) سه قطعهی مهندسی رو مدل کردن — از یه براکت دیواری ساده تا محفظهی دو تیکهی اسنپفیت و یه آداپتور شلنگ با رزوهی واقعی. دو مسیر مقایسه هم OpenSCAD و CadQuery بودن.
🔹 همهی قطعهها سالم و قابل چاپ درومدن؛ تفاوت اصلی توی «موفق شدن» نبود، توی «شکل شکست خوردن» بود
🔹 خطرناکترینش خطای بیصدا بود: توی یه اجرا ابزار یه بدنهی استوانهای رو بیسروصدا حذف کرده بود و قطعه از بیرون بینقص دیده میشد — فقط اندازهگیری حجم لو داد (۷۰۶۵ میلیمتر مکعب به جای ۱۰۳۲۳)
🔹 هر دو ابزار یه هندسهی غلط رو «سالم» گزارش میکردن؛ تیم همهی مشها رو با یه پارسر مستقل دوباره چک کرده
🔹 جمع سه تسک: ۱۱ نسخه برای هر ابزار، ۶۴۴ هزار توکن و ۳۴ تا ۴۰ دقیقه کار ایجنت
نتیجهی جالبش: توی حلقهی ایجنت، دیدنِ رندر جلوی خطاهای هندسی رو نمیگیره — چیزی که کار میکنه اندازهگیری عدده، نه اسکرینشات.
🔗 @hjcreative
تیم ModelRift یه بنچمارک تازه منتشر کرده: شش ایجنت (همه با Claude Opus 5 داخل Claude Code) سه قطعهی مهندسی رو مدل کردن — از یه براکت دیواری ساده تا محفظهی دو تیکهی اسنپفیت و یه آداپتور شلنگ با رزوهی واقعی. دو مسیر مقایسه هم OpenSCAD و CadQuery بودن.
🔹 همهی قطعهها سالم و قابل چاپ درومدن؛ تفاوت اصلی توی «موفق شدن» نبود، توی «شکل شکست خوردن» بود
🔹 خطرناکترینش خطای بیصدا بود: توی یه اجرا ابزار یه بدنهی استوانهای رو بیسروصدا حذف کرده بود و قطعه از بیرون بینقص دیده میشد — فقط اندازهگیری حجم لو داد (۷۰۶۵ میلیمتر مکعب به جای ۱۰۳۲۳)
🔹 هر دو ابزار یه هندسهی غلط رو «سالم» گزارش میکردن؛ تیم همهی مشها رو با یه پارسر مستقل دوباره چک کرده
🔹 جمع سه تسک: ۱۱ نسخه برای هر ابزار، ۶۴۴ هزار توکن و ۳۴ تا ۴۰ دقیقه کار ایجنت
نتیجهی جالبش: توی حلقهی ایجنت، دیدنِ رندر جلوی خطاهای هندسی رو نمیگیره — چیزی که کار میکنه اندازهگیری عدده، نه اسکرینشات.
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
شرکت Higgsfield یه ایجنت AI برای After Effects ساخته — موشنگرافیک رو داخل کامپِ بازِ خودت میسازه 🎬🤖
توی این دمو، کاربر یه پرامپت ساده به GPT-6 Astra میده: «یه ویدیوی موشن ۲۰ ثانیهای از این هدفون بساز — با چرخش سهبعدی، حرکت سینمایی دوربین، speed ramp و رابط کاربری متحرک». بعد ایجنت کار رو مستقیم داخل فایل After Effects (به کمک Blender) جلو میبره.
🔹 اسم ایجنتش هست: AI Motion Designer — برای After Effects و Premiere Pro
🔹 هر چی میسازه قابل ویرایش میمونه: تیتر، ترنزیشن، لوگو-ریویل؛ همه بهشکل لایههای نیتیو پروژه
🔹 از توی پلاگین ChatGPT صداش میزنی، یا با MCP از داخل Claude و Cursor
🔹 طبق اعلام خودِ Higgsfield، روی متن و رنگ و متریال خودت کار میکنه، نه تمپلیت آماده
🔹 ادعای سازنده: تا حالا هیچ AIای context داخل After Effects رو اینطور نگه نمیداشته
🔗 @hjcreative
توی این دمو، کاربر یه پرامپت ساده به GPT-6 Astra میده: «یه ویدیوی موشن ۲۰ ثانیهای از این هدفون بساز — با چرخش سهبعدی، حرکت سینمایی دوربین، speed ramp و رابط کاربری متحرک». بعد ایجنت کار رو مستقیم داخل فایل After Effects (به کمک Blender) جلو میبره.
🔹 اسم ایجنتش هست: AI Motion Designer — برای After Effects و Premiere Pro
🔹 هر چی میسازه قابل ویرایش میمونه: تیتر، ترنزیشن، لوگو-ریویل؛ همه بهشکل لایههای نیتیو پروژه
🔹 از توی پلاگین ChatGPT صداش میزنی، یا با MCP از داخل Claude و Cursor
🔹 طبق اعلام خودِ Higgsfield، روی متن و رنگ و متریال خودت کار میکنه، نه تمپلیت آماده
🔹 ادعای سازنده: تا حالا هیچ AIای context داخل After Effects رو اینطور نگه نمیداشته
🔗 @hjcreative
یه بنچمارک تازه نشون داد مدلهای کد توی کدبیس واقعی شرکتها زمین میخورن 🧑💻📉
یه آزمایشگاه به اسم Specific Labs بنچمارکی به اسم Real-SWE منتشر کرده که فرقش با بقیه اینه: تسکها از کدبیس خصوصیِ شرکتهای واقعی برداشته شدن — کدی که هیچوقت روی اینترنت نبوده و توی آموزش هیچ مدلی نیومده. نتیجهش اینه:
🔹 بهترین نتیجه: Fable 5.1 با Claude Code — فقط ۳۸.۸٪ از تسکها
🔹 بعد از اون GPT-6 Astra (۳۳.۸٪) و Gemini 3.8 Flash (۳۱.۲٪)
🔹 آخرین ردیف: GPT-5.6 Sol با Codex CLI — ۱۶.۲٪
🔹 ۶ تسک از ۱۰ تسک نرخ حل زیر ۱۵٪ داشتن
🔹 سختترین تسک رو هیچ مدلی حل نکرد: صفر از ۸
هر تسک ۸ بار اجرا شده — در کل ۶۴۰ اجرا. هزینه هم معیار تعیینکنندهای نیست: Fable 5.1 هم گرونترین اجرا رو داشت (۶.۹۶ دلار) و هم بهترین نتیجه، ولی Gemini 3.8 Flash با ۲.۵ دلار سوم شد.
🔗 @hjcreative
یه آزمایشگاه به اسم Specific Labs بنچمارکی به اسم Real-SWE منتشر کرده که فرقش با بقیه اینه: تسکها از کدبیس خصوصیِ شرکتهای واقعی برداشته شدن — کدی که هیچوقت روی اینترنت نبوده و توی آموزش هیچ مدلی نیومده. نتیجهش اینه:
🔹 بهترین نتیجه: Fable 5.1 با Claude Code — فقط ۳۸.۸٪ از تسکها
🔹 بعد از اون GPT-6 Astra (۳۳.۸٪) و Gemini 3.8 Flash (۳۱.۲٪)
🔹 آخرین ردیف: GPT-5.6 Sol با Codex CLI — ۱۶.۲٪
🔹 ۶ تسک از ۱۰ تسک نرخ حل زیر ۱۵٪ داشتن
🔹 سختترین تسک رو هیچ مدلی حل نکرد: صفر از ۸
هر تسک ۸ بار اجرا شده — در کل ۶۴۰ اجرا. هزینه هم معیار تعیینکنندهای نیست: Fable 5.1 هم گرونترین اجرا رو داشت (۶.۹۶ دلار) و هم بهترین نتیجه، ولی Gemini 3.8 Flash با ۲.۵ دلار سوم شد.
🔗 @hjcreative