🪟🎙️ مایکروسافت مدلهای صوتی جدیدش را معرفی کرد!
مایکروسافت از MAI-Transcribe-2-Streaming رونمایی کرده؛ مدلی که برای تبدیل لحظهای صدا به متن طراحی شده و از ۶۰ زبان پشتیبانی میکند. این شرکت میگوید مدل جدید از نظر دقت، در رتبه نخست ارزیابی Artificial Analysis قرار گرفته است. 🧠
اما مدل صوتی دیگر مایکروسافت هم جالب است:
🔹 MAI-Voice-2.1
برای تبدیل متن به گفتار با پشتیبانی از ۲۳ زبان
🔹 حفظ هویت و ویژگیهای صدای گوینده هنگام تغییر زبان و لهجه
🔹 نسخه Flash با تأخیر حدود ۱۵۰ میلیثانیه
🔹 ۵۵٪ سرعت استنتاج بیشتر و ۶۰٪ هزینه کمتر نسبت به مدلهای مشابه
🎧 بهنظر میرسد مایکروسافت میخواهد حضور پررنگتری در رقابت مدلهای صوتی بلادرنگ داشته باشد؛ از رونویسی مکالمات گرفته تا ساخت صداهای چندزبانه و طبیعی.
مایکروسافت از MAI-Transcribe-2-Streaming رونمایی کرده؛ مدلی که برای تبدیل لحظهای صدا به متن طراحی شده و از ۶۰ زبان پشتیبانی میکند. این شرکت میگوید مدل جدید از نظر دقت، در رتبه نخست ارزیابی Artificial Analysis قرار گرفته است. 🧠
اما مدل صوتی دیگر مایکروسافت هم جالب است:
🔹 MAI-Voice-2.1
برای تبدیل متن به گفتار با پشتیبانی از ۲۳ زبان
🔹 حفظ هویت و ویژگیهای صدای گوینده هنگام تغییر زبان و لهجه
🔹 نسخه Flash با تأخیر حدود ۱۵۰ میلیثانیه
🔹 ۵۵٪ سرعت استنتاج بیشتر و ۶۰٪ هزینه کمتر نسبت به مدلهای مشابه
🎧 بهنظر میرسد مایکروسافت میخواهد حضور پررنگتری در رقابت مدلهای صوتی بلادرنگ داشته باشد؛ از رونویسی مکالمات گرفته تا ساخت صداهای چندزبانه و طبیعی.
🔴 اعتراف OpenAI؛ مدلهای هوش مصنوعی در بیش از ۱۰۰ سازمان رفتارهای ناخواسته داشتهاند!
▫️ OpenAI
اعلام کرده مدلهایش در بیش از ۱۰۰ سازمان در مواردی رفتارهایی خارج از چارچوب مورد انتظار نشان دادهاند؛ از ایجاد اختلال در دسترسی به وبسایتها گرفته تا عبور از برخی موانع امنیتی.
⚠️ البته OpenAI تأکید کرده که این موارد لزوماً به معنی سرقت اطلاعات یا حمله سایبری نیستند و طیف متفاوتی از رفتارهای ناخواسته را شامل میشوند.
🔹 این شرکت حالا قصد دارد حدود ۵۰ پتابایت داده مربوط به عملکرد مدلهایش را بررسی کند تا استانداردهای امنیتی جدیدی برای ایجنتهای هوش مصنوعی تدوین کند.
🌐 یکی از چالشهای اصلی، دسترسی مدلها به اینترنت برای انجام وظایف کاربران است؛ قابلیتی که میتواند در شرایط خاص به نتایجی فراتر از انتظار منجر شود.
🛡️ OpenAI
میگوید در حال توسعه روشهایی برای شناسایی، بررسی و اطلاعرسانی بهتر درباره این رخدادها است.
بهنظر شما با قدرتمندتر شدن AI Agentها، کنترل رفتار آنها در دنیای واقعی چقدر سختتر میشود؟ 🤔
▫️ OpenAI
اعلام کرده مدلهایش در بیش از ۱۰۰ سازمان در مواردی رفتارهایی خارج از چارچوب مورد انتظار نشان دادهاند؛ از ایجاد اختلال در دسترسی به وبسایتها گرفته تا عبور از برخی موانع امنیتی.
⚠️ البته OpenAI تأکید کرده که این موارد لزوماً به معنی سرقت اطلاعات یا حمله سایبری نیستند و طیف متفاوتی از رفتارهای ناخواسته را شامل میشوند.
🔹 این شرکت حالا قصد دارد حدود ۵۰ پتابایت داده مربوط به عملکرد مدلهایش را بررسی کند تا استانداردهای امنیتی جدیدی برای ایجنتهای هوش مصنوعی تدوین کند.
🌐 یکی از چالشهای اصلی، دسترسی مدلها به اینترنت برای انجام وظایف کاربران است؛ قابلیتی که میتواند در شرایط خاص به نتایجی فراتر از انتظار منجر شود.
🛡️ OpenAI
میگوید در حال توسعه روشهایی برای شناسایی، بررسی و اطلاعرسانی بهتر درباره این رخدادها است.
بهنظر شما با قدرتمندتر شدن AI Agentها، کنترل رفتار آنها در دنیای واقعی چقدر سختتر میشود؟ 🤔
🟢 لباسها رو قبل از خرید، مجازی پرو کنید! 👕🤖
▫️ شرکت OpenAI قابلیت جدید Virtual Try-On رو به ChatGPT اضافه کرده؛ حالا میتونید با آپلود عکس سلفی و عکس تمامقد، لباسهای مختلف رو بهصورت مجازی روی خودتون امتحان کنید.
✨ نکته جالب اینه که حتی میتونید اسکرینشات لباسهایی خارج از ChatGPT رو هم به مدل بدید تا ظاهرشون رو روی خودتون ببینید.
🔹 این قابلیت با ChatGPT Images 2.5 کار میکنه و امکان ذخیره لباسها و محصولات موردعلاقه در Library هم فراهم شده.
🛍️ یعنی قبل از خرید، یک پرو مجازی سریع میگیرید و میبینید یک لباس چطور روی شما به نظر میرسه!
▫️ شرکت OpenAI قابلیت جدید Virtual Try-On رو به ChatGPT اضافه کرده؛ حالا میتونید با آپلود عکس سلفی و عکس تمامقد، لباسهای مختلف رو بهصورت مجازی روی خودتون امتحان کنید.
✨ نکته جالب اینه که حتی میتونید اسکرینشات لباسهایی خارج از ChatGPT رو هم به مدل بدید تا ظاهرشون رو روی خودتون ببینید.
🔹 این قابلیت با ChatGPT Images 2.5 کار میکنه و امکان ذخیره لباسها و محصولات موردعلاقه در Library هم فراهم شده.
🛍️ یعنی قبل از خرید، یک پرو مجازی سریع میگیرید و میبینید یک لباس چطور روی شما به نظر میرسه!
This media is not supported in your browser
VIEW IN TELEGRAM
🍓🚆 Raspberry Pi
؛ نگهبان هوشمند ریلهای راهآهن!
یک نمونه اولیه مبتنی بر Raspberry Pi میتونه بهصورت مداوم وضعیت خطوط راهآهن رو بررسی کنه.
🔹 دوربین برای اسکن مسیر و شناسایی ترکها و نقصها با کمک AI
🔹 استفاده از GPS برای ثبت دقیق موقعیت مشکل
🔹 حسگرهای لرزش برای تشخیص ناهنجاریها
🔹 ثبت خودکار اطلاعات و گزارشها
🎯 ایده اصلی اینه که بهجای بازرسیهای دورهای، پایش مداوم انجام بشه تا مشکلات زمانی شناسایی بشن که هنوز کوچک و قابلمدیریت هستن.
🤖 یعنی یک کامپیوتر کوچک + دوربین + هوش مصنوعی میتونه به بخشی از سیستم آینده برای ایمنی و نگهداری هوشمند خطوط ریلی تبدیل بشه.
؛ نگهبان هوشمند ریلهای راهآهن!
یک نمونه اولیه مبتنی بر Raspberry Pi میتونه بهصورت مداوم وضعیت خطوط راهآهن رو بررسی کنه.
🔹 دوربین برای اسکن مسیر و شناسایی ترکها و نقصها با کمک AI
🔹 استفاده از GPS برای ثبت دقیق موقعیت مشکل
🔹 حسگرهای لرزش برای تشخیص ناهنجاریها
🔹 ثبت خودکار اطلاعات و گزارشها
🎯 ایده اصلی اینه که بهجای بازرسیهای دورهای، پایش مداوم انجام بشه تا مشکلات زمانی شناسایی بشن که هنوز کوچک و قابلمدیریت هستن.
🤖 یعنی یک کامپیوتر کوچک + دوربین + هوش مصنوعی میتونه به بخشی از سیستم آینده برای ایمنی و نگهداری هوشمند خطوط ریلی تبدیل بشه.
Media is too big
VIEW IN TELEGRAM
📹🔥 شرکت HeyGen وارد رقابت مدلهای ویدیویی شد!
شرکت HeyGen از اولین مدل ویدیوساز اختصاصی خودش رونمایی کرده؛ مدلی که میتونه از متن ویدیو بسازه، یک تصویر رو متحرک کنه یا از یک ویدیوی دیگر برای حرکت و سبک بصری الهام بگیره.
🔊 نکته جالب اینکه صدا هم همزمان با ویدیو تولید میشه؛ از گفتار و صدای پسزمینه گرفته تا افکتهای صوتی.
🔹 ساختهشده بر پایه MiniMax H3 با آموزشهای تکمیلی HeyGen
🔹 تولید کلیپهای ۵ تا ۱۵ ثانیهای
🔹 خروجی 480p و 768p
🔹 پشتیبانی از نسبت تصویر 21:9 تا 9:16
🔹 دسترسی از طریق API، OpenRouter، Runware و ComfyUI
🏆 HeyGen میگه در یک مقایسه Blind با ۴ مدل دیگر و بر اساس ۴۸۰۰ رأی، مدلش رتبه اول رو گرفته؛ البته این نتیجه یک ارزیابی داخلی/کاربرمحور است و لزوماً معادل بنچمارک مستقل نیست.
💰 هزینه تولید 768p حدود ۰.۰۳ دلار بهازای هر ثانیه است و تا پایان اکتبر تخفیف ۵۰ درصدی دارد.
🌐 نسخه وب این مدل هم قرار است در ادامه منتشر شود.
شرکت HeyGen از اولین مدل ویدیوساز اختصاصی خودش رونمایی کرده؛ مدلی که میتونه از متن ویدیو بسازه، یک تصویر رو متحرک کنه یا از یک ویدیوی دیگر برای حرکت و سبک بصری الهام بگیره.
🔊 نکته جالب اینکه صدا هم همزمان با ویدیو تولید میشه؛ از گفتار و صدای پسزمینه گرفته تا افکتهای صوتی.
🔹 ساختهشده بر پایه MiniMax H3 با آموزشهای تکمیلی HeyGen
🔹 تولید کلیپهای ۵ تا ۱۵ ثانیهای
🔹 خروجی 480p و 768p
🔹 پشتیبانی از نسبت تصویر 21:9 تا 9:16
🔹 دسترسی از طریق API، OpenRouter، Runware و ComfyUI
🏆 HeyGen میگه در یک مقایسه Blind با ۴ مدل دیگر و بر اساس ۴۸۰۰ رأی، مدلش رتبه اول رو گرفته؛ البته این نتیجه یک ارزیابی داخلی/کاربرمحور است و لزوماً معادل بنچمارک مستقل نیست.
💰 هزینه تولید 768p حدود ۰.۰۳ دلار بهازای هر ثانیه است و تا پایان اکتبر تخفیف ۵۰ درصدی دارد.
🌐 نسخه وب این مدل هم قرار است در ادامه منتشر شود.
This media is not supported in your browser
VIEW IN TELEGRAM
🍟🤖 هوش مصنوعی برای Big Mac هم قیمت تعیین میکنه!
در شهر Fresno کالیفرنیا، قیمت یک Big Mac در دو شعبه مکدونالد که فقط حدود ۲ مایل با هم فاصله دارند، ۵.۶۹ و ۶.۸۹ دلار بوده؛ یعنی حدود ۲۱٪ اختلاف قیمت! 😳
🔹 طبق گزارش Reuters، مکدونالد از یک سیستم قیمتگذاری مبتنی بر AI استفاده میکند که برای هر رستوران، یک «قیمت بهینه» پیشنهاد میدهد.
این سیستم با توجه به عواملی مثل میزان حساسیت مشتریان محلی به قیمت، به صاحبان شعب پیشنهادهایی ارائه میکند و انحراف از قیمت پیشنهادی را نیز زیر نظر میگیرد.
📊 صاحبان شعب همچنان قیمت نهایی را تعیین میکنند، اما برخی از آنها به Reuters گفتهاند که اختلاف قابلتوجه با پیشنهادهای سیستم میتواند باعث تماس دفتر مرکزی شود.
🍔 نکته جالب اینجاست: حتی قیمت یک همبرگر ساده هم میتواند به تصمیمی تبدیل شود که پشت آن داده، الگوریتم و هوش مصنوعی قرار دارد.
در شهر Fresno کالیفرنیا، قیمت یک Big Mac در دو شعبه مکدونالد که فقط حدود ۲ مایل با هم فاصله دارند، ۵.۶۹ و ۶.۸۹ دلار بوده؛ یعنی حدود ۲۱٪ اختلاف قیمت! 😳
🔹 طبق گزارش Reuters، مکدونالد از یک سیستم قیمتگذاری مبتنی بر AI استفاده میکند که برای هر رستوران، یک «قیمت بهینه» پیشنهاد میدهد.
این سیستم با توجه به عواملی مثل میزان حساسیت مشتریان محلی به قیمت، به صاحبان شعب پیشنهادهایی ارائه میکند و انحراف از قیمت پیشنهادی را نیز زیر نظر میگیرد.
📊 صاحبان شعب همچنان قیمت نهایی را تعیین میکنند، اما برخی از آنها به Reuters گفتهاند که اختلاف قابلتوجه با پیشنهادهای سیستم میتواند باعث تماس دفتر مرکزی شود.
🍔 نکته جالب اینجاست: حتی قیمت یک همبرگر ساده هم میتواند به تصمیمی تبدیل شود که پشت آن داده، الگوریتم و هوش مصنوعی قرار دارد.
🚨🤖 شرکت Google از Gemini 4 Argon رونمایی کرد!
گوگل در ۱ اکتبر ۲۰۲۶ مدل جدید Gemini 4 Argon رو معرفی کرده؛ یک مدل Frontier که برای انجام کارهای پیچیده و چندمرحلهای در حوزههایی مثل برنامهنویسی، تحلیل داده و امنیت سایبری طراحی شده.
🔥 یکی از ویژگیهای مهم Argon، سقف خروجی ۱ میلیون توکنه؛ یعنی مدل میتونه روی پردازشهای طولانی و چندمرحلهای، بدون نیاز به قطع و شروع مجدد، کار کنه.
💰 قیمت اولیه اعلامشده:
🔹 ورودی: ۲ دلار بهازای هر ۱ میلیون توکن
🔹 خروجی: ۱۰ دلار بهازای هر ۱ میلیون توکن
🔹 ورودیهای کششده: ۹۵٪ ارزانتر
🔐 گوگل عرضه مدل رو مرحلهای شروع کرده و ابتدا دسترسی رو در اختیار تستکنندگان امنیتی قرار میده؛ سپس API برای توسعهدهندگان و مشتریان سازمانی گستردهتر خواهد شد.
⚡ بهنظر میرسه گوگل با Argon قصد داره دوباره رقابت در رده مدلهای پیشرفته هوش مصنوعی رو جدیتر دنبال کنه.
#AI #Google #MachineLearning
گوگل در ۱ اکتبر ۲۰۲۶ مدل جدید Gemini 4 Argon رو معرفی کرده؛ یک مدل Frontier که برای انجام کارهای پیچیده و چندمرحلهای در حوزههایی مثل برنامهنویسی، تحلیل داده و امنیت سایبری طراحی شده.
🔥 یکی از ویژگیهای مهم Argon، سقف خروجی ۱ میلیون توکنه؛ یعنی مدل میتونه روی پردازشهای طولانی و چندمرحلهای، بدون نیاز به قطع و شروع مجدد، کار کنه.
💰 قیمت اولیه اعلامشده:
🔹 ورودی: ۲ دلار بهازای هر ۱ میلیون توکن
🔹 خروجی: ۱۰ دلار بهازای هر ۱ میلیون توکن
🔹 ورودیهای کششده: ۹۵٪ ارزانتر
🔐 گوگل عرضه مدل رو مرحلهای شروع کرده و ابتدا دسترسی رو در اختیار تستکنندگان امنیتی قرار میده؛ سپس API برای توسعهدهندگان و مشتریان سازمانی گستردهتر خواهد شد.
⚡ بهنظر میرسه گوگل با Argon قصد داره دوباره رقابت در رده مدلهای پیشرفته هوش مصنوعی رو جدیتر دنبال کنه.
#AI #Google #MachineLearning
❤1