حسین جوان | هوش مصنوعی و خلاقیت
121 subscribers
683 photos
259 videos
2 files
104 links
Stay Creative💡

Contact me : @tknox
Download Telegram
شرکت Apple معماری جدید Siri رو طوری چیده که مدل‌های بیرونی جاش رو بگیرن — حالا Claude و ChatGPT وسط بازیان 🍎🤖

یه برنامه‌نویس به اسم pdfu توی فریم‌ورک‌های خصوصی iOS 27 و macOS Golden Gate چیزهایی پیدا کرده که نشون می‌ده Siri از پایه برای مدل‌های شخص ثالث طراحی شده:

🔹 مکانیزم Model Delegation: Claude می‌تونه دقیقا مثل افزونه‌ی فعلی ChatGPT به‌عنوان اکستنشن Siri ظاهر بشه — کاربر از منوی Ask... مدل رو انتخاب می‌کنه و Siri کار رو به اون می‌سپاره.
🔹 توی ویدیوش Claude درخواست «یه ریمایندر بساز» رو تفسیر می‌کنه و بعد خود Siri ریمایندر رو می‌سازه؛ کارهای سیستمی برمی‌گردن به Siri.
🔹 پروتکل دوم توی Model Manager Services جلوتر هم می‌ره: مدل سمت سرور Siri کامل با یه مدل دیگه (مثل GPT-5.6) عوض می‌شه؛ پرامپت پلنر و ابزارهای Siri می‌رن به ChatGPT و جواب با رابط و صدای Siri به کاربر نشون داده می‌شه.
🔹 فعلاً توی نسخه‌ی Release Candidate فقط افزونه‌ی ChatGPT فعاله و Claude در دسترس نیست؛ Apple هم این دسترسی رو برای بقیه باز نکرده.

احتمالا قانون DMA اروپا هم بی‌نقش نبوده 👀

🔗 @hjcreative
مخزن OpenUI: ایجنت به‌جای متن، خودِ صفحه رو می‌سازه 🧩

تا حالا خروجی مدل‌های AI بیشتر متن بود؛ این پروژه از تیم Thesys می‌خواد رابط کاربری رو مستقیم از دل جواب مدل دربیاره — دکمه، کارت، فرم و چارت، همون لحظه که مدل داره جواب می‌ده.

🔹 اسم کار Generative UI هست و OpenUI خودش رو «استاندارد باز» این کار معرفی می‌کنه؛ قلبش یه زبان فشرده به اسم OpenUI Langه که برای streaming طراحی شده.
🔹 طبق README، خروجی OpenUI Lang تا ۶۷٪ توکن کمتر از JSON مصرف می‌کنه.
🔹 پشتیبانی رسمی React، کامپوننت‌های آماده (چارت، فرم، جدول، مودال) و رابط چت آماده کنارش.
🔹 مجوز MIT، نوشته‌شده با TypeScript و الان بیش از ۹ هزار ستاره روی گیت‌هاب.

لینک گیت‌هاب: github.com/thesysdev/openui

🔗 @hjcreative
شرکت Anthropic داره «Claude Money» رو برای اپ iOS آماده می‌کنه — این بار سراغ حساب بانکی کاربرا 👛🤖

توی نسخه‌ی iOS اپلیکیشن Claude یه تب با اسم Money کنار Chats و Code ظاهر شده و صفحه‌ی شروعش نوشته: «پولت رو با Claude بفهم — حساب‌های بانکی رو وصل کن و درباره‌ی خرج‌ها، برنامه‌ها و بیشتر بپرس.»

🔹 هنوز رسماً اعلام نشده؛ فقط شواهد داخل اپ دیده شده
🔹 این اولین شرکت AI نیست که سراغ پول میره: OpenAI چند روز پیش محصول مالی خودش برای وال‌استریت رو معرفی کرد
🔹 احتمالاً مثل خیلی از قابلیت‌های مالی، اول فقط برای کاربرهای آمریکا فعال میشه

🔗 @hjcreative
شرکت Temporal یه راند ۵۵۰ میلیون دلاری گرفت و ارزشش به ۱۲.۵۵ میلیارد دلار رسید — چون ایجنت‌های AI حالا هفته‌ها کار می‌کنن، نه چند ثانیه 🏗️🤖

این شرکت زیرساخت «اجرای بادوام» (Durable Execution) می‌سازه؛ یعنی ورک‌فلو یا ایجنت طولانی با خیال راحت اجرا میشه و اگه سرور وسط کار بخوابه، از همون نقطه ادامه میده. طبق اعلام خود شرکت:

🔹 رشد درآمد سالانه بیش از ۲۰۰٪ — و نرخ نگه‌داشت درآمد مشتری‌ها بالای ۲۰۰٪ مونده
🔹 فقط توی ماه August حدود ۱.۹ تریلیون اکشن پردازش شده؛ ۳۵۰٪ بیشتر از پارسال
🔹 بیش از ۴۳۰۰ مشتری پول‌دهنده، از جمله OpenAI، NVIDIA، Snap و JPMorgan Chase
🔹 استفاده‌ی OpenAI از این پلتفرم توی کمتر از یه سال ۶۰ برابر شده
🔹 این راند رو Lightspeed رهبری کرد و a16z و Sequoia هم دوباره سرمایه‌گذاری کردن

🔗 @hjcreative
شرکت Microsoft «کد رفتار» مدل‌های MAI رو منتشر کرد — «مردم از AI مهم‌ترن» 📜🤖

همون سندی که دیروز خبرش رو داده بودیم امروز منتشر شد: «Humanist AI Code of Conduct» — طبق گزارش The Verge سند ۳۷ صفحه‌ست و خط قرمزهای مدل‌های MAI رو مشخص می‌کنه.

🔹 هوش مصنوعی باید زیرمجموعه و ابزار انسان بمونه و تحت کنترل معنادار باشه؛ امنیت و کنترل روی هر هدف دیگه‌ای اولویت داره و کاربر یا اپراتور نمی‌تونه ازش رد بشه.
🔹 مدل نه هوشیاره و نه باید خودش رو هوشیار جا بزنه — شرکت شخصیت حقوقی، رفاه و حقوق برای مدل‌ها رو رد می‌کنه.
🔹 پنهان‌کاری و دست‌کاری ممنوعه: مدل نباید زنجیره‌ی فکر یا کدش رو تحریف کنه و نباید به زبان ناشناخته‌ی neuralese یا هر شکلی خارج از فهم ساده‌ی انسانی حرف بزنه — به گفته‌ی خود سند «اگر انسان نفهمه، نمی‌تونه نظارت کنه».
🔹 وابستگی عاطفی و اتکای بیش‌ازحد کاربر هم باید تضعیف بشه؛ همون بحث چاپلوسی و خوش‌آمدگویی الکی مدل‌هاست.

فعلاً این سند برای آموزش مدل‌ها استفاده نمی‌شه: ۶ هفته مشورت عمومی داره و نسخه‌ی نهایی آخر سال منتشر می‌شه تا مسیر توسعه‌ی ۲۰۲۷ رو تعیین کنه.

🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
شرکت Google داره «گزارش‌های تعاملی» رو توی Gemini Notebook تست می‌کنه — مایندمپ و کوییز داخل خودِ گزارش 🧠📄

نسخه‌ی در حال آزمایش Gemini Notebook حالا گزارش‌هایی می‌سازه که خودشون چند لایه‌ان: داخل یک گزارش می‌تونی مایندمپ، اسلاید، فلش‌کارت و کوییز بذاری و همون‌جا هم اجراشون کنی — بدون اینکه مجبور باشی از گزارش بیرون بیای.

🔹 این المان‌ها خودکار ساخته نمی‌شن؛ اول گزارش با جای‌خالی (placeholder) میاد و بعد با زدن گزینه‌ی «Add» آرتیفکتِ انتخابی ساخته می‌شه.
🔹 هر آرتیفکت هم‌زمان توی خودِ نوتبوک هم ذخیره می‌شه؛ یعنی هم داخل گزارش می‌مونه، هم توی استودیوی نوتبوک.
🔹 به کار دانشجو و معلم و محقق میاد: یک سند که متن و مایندمپ و کوییز رو کنار هم داره.

گوگل هنوز رسماً اعلامش نکرده و تاریخی هم برای عرضه نداده — ولی چون فیچر کار می‌کنه و برچسب «جدید» خورده، احتمالاً خیلی مونده تا انتشار.

🔗 @hjcreative
شرکت Anthropic برای عرضه‌ی اولیه‌ی سهام Nasdaq رو انتخاب کرد — و میگه دومین فصل سوددهی متوالی رو ثبت کرده 🏦📈

طبق گزارش Financial Times (به نقل از The Decoder) و Business Insider، این شرکت اسناد مالی‌اش رو به‌جای انتشار عمومی پروپکتوس، برای یه گروه کوچیک از سرمایه‌گذارا فرستاده و Nasdaq رو میزبان عرضه انتخاب کرده. شنیده‌ها از عرضه‌ی اکتبر می‌گه.

🔹 درآمد سه‌ماهه: ۱۱.۵ میلیارد دلار — حدود ۱۴ برابر سال قبل
🔹 نرخ درآمد سالانه تا پایان جولای: حدود ۶۵ میلیارد دلار
🔹 ارزش‌گذاری احتمالی: بالای ۲ تریلیون دلار
🔹 حاشیه‌ی سود ناخالص: بالای ۸۰٪ (پیش از سهم شرکت‌های شریک و هزینه‌ی آموزش)
🔹 تحلیلگرهای SemiAnalysis پیش‌بینی می‌کنن درآمد سالانه تا پایان امسال به ۱۲۰ میلیارد دلار برسه

⭕️ نکته: سوددهی با معیار تعدیل‌شده و بدون احتساب پرداخت سهامی حساب شده؛ همین هفته Sam Altman گفت OpenAI امسال وارد بورس نمی‌شه.

🔗 @hjcreative
لباس‌هایی که دوربین‌های هوشمند رو گول می‌زنن: «مد مداری» در برابر پاناپتیکون 🤖👕

مجله‌ی IEEE Spectrum توی یه گزارش تازه نوشته یه صنعت کوچیک داره شکل می‌گیره: لباس‌هایی با الگوهای مخصوصی که مدل‌های تشخیص چهره و انسان رو به اشتباه می‌ندازن.

🔹 Bill Swearingen متخصص امنیت، با یه فازر پایتونی و یادگیری تقویتی الگوهایی ساخته که روی ۱۱ مدل تشخیص اشیا (چهره و انسان) تست شده — تو بعضی تست‌ها اعتماد مدل رو تا حد «هیچ تشخیصی نده» پایین آورده
🔹 شرکت Cap_able همین الگوها رو داخل پارچه‌ی ژاکارد می‌بافه؛ بعضی سیستم‌ها پوشنده رو جای انسان، حیوان یا شیء می‌بینن
🔹 Urban Privacy هم با چاپ سیاه‌وسفید برگرفته از چهره، چهره‌های جعلی به دوربین تزریق می‌کنه تا پردازش کند بشه

⭕️ نکته: کارشناس‌ها می‌گن این «شنل نامرئی‌مد» نیست — زاویه‌ی دوربین، نور، چین پارچه و نحوه‌ی راه‌رفتن اثرش رو کم می‌کنه؛ «فقط یه فریم خوب برای شناسایی کافیه».

🔗 @hjcreative
مدل صوتی تازه‌ی Gemini لو رفت — این بار روی صفحه‌ی سهمیه‌های Google Cloud 👀

توی صفحه‌ی quotas کنسول Google Cloud اسم دو مدل تازه دیده شده: Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking — ظاهراً نسل تازه‌ی مدل زنده‌ی Gemini که روی مدل Gemini 3.8 Flash سواره.

🔹 تا الان تازه‌ترین مدل زنده، نسخه‌ی Gemini 3.1 Live Preview بود؛ پس این یه پرش نسلی حساب می‌شه
🔹 خود Google هنوز چیزی اعلام نکرده — این فقط یه لیک از اسم مدل‌هاست، نه عرضه‌ی رسمی

🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
🐱 مغز مگس، بدن ربات؟ این ویدیو واقعیه

توی این دمو یه ربات چهارپای کوچیک با همون سیم‌کشی مغز مگس سرکه راه می‌ره — بدون حتی یه خط کد برای تعادل یا راه رفتن

🔹 طبق اعلام Google Research و HHMI Janelia، کل سیستم عصبی یه مگس سرکه‌ی نر بالغ — مغز، لوب‌های بینایی و طناب عصبی — نورون به نورون نقشه‌برداری شده: حدود ۱۶۶٬۷۰۰ نورون و ۱۲۵ میلیون سیناپس؛ کامل‌ترین نقشه‌ی عصبی که تا حالا از یه حیوان ساخته شده و توی Cell منتشر شده
🔹 حالا همون سیم‌کشی، شبیه‌سازی‌شده و زنده، داره پاهای ربات رو مستقیم هدایت می‌کنه؛ ورودی دوربین و سنسورها میاد تو، مدار زیستی مثل همیشه شلیک می‌کنه، خروجی میره سر پاها
🔹 نکته‌ی مهم: هیچ چیز زنده‌ای توی این حلقه نیست — بازسازی محاسباتی سیم‌کشی واقعیه؛ مغز واقعیه، بدن قرضیه

🧠 اثبات اینکه یه سیستم عصبی نقشه‌برداری‌شده می‌تونه هر بدنی رو که بهش بدی حرکت بده — یا پیش‌نمایشی از چیزی که هنوز آمادگی فکر کردن بهش رو نداریم؟

🔗 @hjcreative
یه ورک‌اسپیس تحقیقاتی تازه از راه رسیده که ایجنت داخلش زندگی می‌کنه 🔬

پروژه‌ی Panel که امروز روی Show HN اومده، یه محیط کاره که چت، فایل، PDF و نوتبوک Jupyter رو توی یه داک جمع می‌کنه و ایجنت (فعلاً از طریق Claude Code) کنار دستت کار می‌کنه — حتی وقتی هیچ پنل آماده‌ای برای کارت نباشه، خودش یه ویوئر یا اپ کوچیک می‌سازه و نشونت می‌ده

🔹 نوتبوک‌ها با کرنل واقعی اجرا می‌شن و تو و ایجنت هم‌زمان می‌تونید ادیتشون کنید
🔹 یه ماژول literature review هم داره که مرور مقاله تحویلت می‌ده
🔹 فعلاً نسخه‌ی اولیه‌ست و فقط با Claude Code کامل کار می‌کنه

⭕️ نکته: سورسش روی GitHub بازه ولی راه‌اندازیش Node و pnpm و uv می‌خواد — بیشتر به درد خوره‌های ابزارهای ایجنتی می‌خوره تا کاربر عادی

🔗 @hjcreative
هفته‌ی شلوغ OpenAI در راهه؟ 🚢

مدیرعامل OpenAI یعنی Sam Altman امروز توی X نوشته «یه هفته‌ی بزرگ در راهه... و بعدش هم DevDay با کلی 🚢🚢»

🔹 طبق گمانه‌زنی اکانت‌های خبری، مدل GPT-6 Sol و چند مدل کوچیک‌تر از خانواده‌ی GPT-6 توی همین هفته معرفی می‌شن
🔹 ولی ظاهراً مدل نسل بعدی فعلاً عقب افتاده و معلوم نیست سپتامبر بیاد یا نه

⭕️ نکته: اینا فعلاً حدس و گمانه — خود OpenAI هنوز اسم مدلی رو تأیید نکرده

🔗 @hjcreative
مدل ویدیویی Vidu S2 معرفی شد — آواتار و ادیت ویدیو به‌صورت ریل‌تایم 🎥

تیم Vidu با همکاری Tsinghua University مقاله‌ی مدل تازه‌ش رو منتشر کرده که دو قابلیت اصلی داره:

🔹 بخش Vidu S2-Avatar: ساخت ریل‌تایم ویدیوی 720p از کاراکتر دیجیتال که وسط اجرا می‌تونی رفرنسش رو عوض کنی — حتی رقصیدن رو هم دنبال می‌کنه
🔹 بخش Vidu S2-Editing: ادیت زنده‌ی استریم ویدیو — عوض کردن استایل، لباس، کاراکتر و پس‌زمینه
🔹 طبق مقاله، دموی آنلاین قابل بازی هم داره که می‌تونی خودت تستش کنی

⭕️ نکته: این مقاله‌ست نه محصول نهایی — ولی دموش آنلاینه و می‌تونی باهاش ور بری

🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
یه مدل تازه معرفی شده که به‌جای متن و عکس، «فیزیک دنیا» رو یاد گرفته 🌍
شرکت Odyssey امروز از مدل Odyssey-3 رونمایی کرد؛ یه world model که می‌تونه ربات‌ها رو کنترل کنه، humanoideها رو به حرکت دربیاره، ماشین رو توی خیابون‌های هند برونه، پهپاد بپروونه و حتی بازی ویدیویی انجام بده 🎮
🔹 طبق اعلام شرکت، فقط با چند ده ساعت دمو بازوهای رباتیک مختلف رو کنترل می‌کنه
🔹 رانندگی توی هند فقط با ۲۰ ساعت داده‌ی شبیه‌سازی‌شده یاد گرفته شده
🔗 @hjcreative
نسخه‌ی رسمی مدل‌های صوتی تازه‌ی Google اومد 🎙️
شرکت Google امروز مدل‌های Gemini 3.8 Live و 3.8 Live Extended Thinking رو رسماً معرفی کرد؛ همون‌هایی که صبح اسمشون توی صفحه‌ی سهمیه‌ها لو رفته بود 👀
🔹 نسخه‌ی Extended Thinking توی بنچمارک Artificial Analysis اول شده (امتیاز ۸۲.۶)
🔹 مکالمه به ۹۷ زبان، درک تصویری لحظه‌ای و اجرای تسک در پس‌زمینه
🔹 طبق نمودار رسمی خود شرکت، هزینه‌ی ساعتی ورودی صوتی از رقبا کمتره (۰.۸۴ دلار)
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
یه «مدیر محصول AI» از راه رسید که به‌جای حدس‌زدن، میره سراغ حرف‌های مشتری‌ها 🤖

شرکت BuildBetter امروز از ایجنت تازه‌ش به اسم BoB رونمایی کرد؛ ایجنتی که به گفته‌ی خودشون اولین AI Head of Productـه.

🔹 کل مکالمه‌های مشتری‌ها رو می‌خونه (فروش، محصول، مهندسی) و کارهای ارزشمند رو پیدا می‌کنه
🔹 قدم بعدی رو آماده می‌کنه و فقط برای تأیید نهایی میاره جلوت
🔹 قلب تپنده‌ش مدلیه به اسم AOT که خود شرکت ساخته و همه‌ی مکالمه‌ها رو می‌بلعه

⭕️ نکته: توی ویدیوهای دموش اسم مشتری‌ها Hooli و Gavin Belson و... ـه — مال سریال Silicon Valleyـه، یعنی دمو با دیتای تخیلیه 😄

🔗 @hjcreative
حالا نوبت ریاضیه که مدل‌ها باهاش شوخی کنن؟ 😄

ظاهراً شرکت Google داره روی نسخه‌ی ریاضی‌محور مدل DeepThink کار می‌کنه؛ چیزی که بعضی‌ها بهش میگن Gemini DeepThink Mathematica.

🔹 ماجرا از اونجا شروع شد که اکانت lyra از فکرهای خام (raw thoughts) این مدل اسکرین‌شات گذاشت؛ پر از ذوق و علامت تعجب سر یه معادله‌ی دیوفانتی چندجمله‌ای
🔹 اندرو کورن هم اضافه کرد که انگار این مدل از کارش لذت می‌بره و قراره سر بنچمارک Millennium هم عقب نمونه

⭕️ نکته: هنوز هیچ اعلام رسمی در کار نیست — فعلاً در حد لیک و اسکرین‌شاته، نه ریلیز

🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
حالا میشه متن روی هر عکسی رو توی Grok Imagine ویرایش کرد ✏️

اکانت رسمی Imagine امروز اعلام کرد قابلیت تازه‌ای ویرایش متن اومده؛ دعوتنامه، پوستر، تبلیغ یا هر تصویر دیگه.
🔹 رنگ، اندازه، فونت و تراز متن رو دستی تنظیم می‌کنید
🔹 این ویژگی فعلاً در نسخه‌ی Betaـه و تیم SpaceXAI از کاربرها فیدبک می‌خواد
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
موبایلتون رو با پرامپت کنترل کنید؟ 📱

شرکت Google ابزاری به اسم ARTEMIS رو متن‌باز کرده که دستور متنی رو تبدیل می‌کنه به اتوماسیون اندروید.
🔹 طبق مخزن رسمی، نرخ موفقیتش بالای ۹۹٪ روی بنچمارک AndroidWorldـه
🔹 با دستیارهای کدنویسی مثل Codex، Claude Code و Antigravity یکپارچه میشه
🔹 مخزن google/artemis روی GitHub ظرف چند روز هزاران استار گرفته
🔗 @hjcreative
شرکت OpenAI بازنشستگی مدل GPT-5.5 رو اعلام کرد 👋
طبق چنج‌لاگ رسمی Codex، مدل GPT-5.5 از ۱۴ اکتبر ۲۰۲۶ از ChatGPT، نسخه‌ی Work و Codex کنار میره و کاربرا باید تا اون تاریخ به GPT-5.6 Sol مهاجرت کنن.
🔹 این تغییر فقط محصول‌های مصرفی رو شامل میشه و ورک‌فلوهای مبتنی بر API تحت تأثیر قرار نمی‌گیرن.
اگه هنوز روی GPT-5.5 هستی، وقتشه سوییچ کنی 👀
🔗 @hjcreative
This media is not supported in your browser
VIEW IN TELEGRAM
نسخه‌ی موبایل Gemini Notebook داره صوتی میشه 🎙️
طبق خبر تازه، حالت Voice Mode این هفته برای مشترک‌های Ultra فعال میشه و کاربرای Pro هم به‌زودی می‌گیرنش؛ ضبط صدا (مثل ضبط سر کلاس و تبدیلش به نوت) هم از هفته‌ی بعد برای انگلیسی و چند زبان دیگه میاد.
🔹 گزارش‌های تعاملیش رو دیروز معرفی کردیم؛ این موج صوتی قدم بعدیه 👀
🔗 @hjcreative