Tensorflow(@CVision)
15.1K subscribers
1.31K photos
318 videos
91 files
2.59K links
اخبار حوزه یادگیری عمیق و هوش مصنوعی
مقالات و یافته های جدید یادگیری عمیق
بینایی ماشین و پردازش تصویر

TensorFlow, Keras, Deep Learning, Computer Vision

سایت:
http://class.vision

👨‍💻👩‍💻پشتیبان دوره ها:
@classvision_support

لینک گروه:
@tf2keras
Download Telegram
Tensorflow(@CVision)
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
مدل جدید در مکالمه‌های واقعی می‌تواند مکث‌ها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را به‌صورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نام‌های خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️

یکی از جذاب‌ترین بخش‌ها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجه‌ها و جابه‌جایی بین زبان‌هاست. برای فایل‌های ضبط‌شده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل می‌تواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخه‌ی جداگانه‌ی gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشن‌های تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار می‌دهد. نسخه‌ی دیگر هم برای پردازش فایل‌های ضبط‌شده، جلسات و تماس‌ها در دسترس است. 🚀

از نظر بنچمارک هم اعداد جالب‌اند؛ طبق داده‌ای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکته‌ی مهم‌تر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمی‌بیند. این مدل در بعضی تجربه‌های Gemini می‌تواند با Context صفحه و مدل‌های دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و می‌تواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعه‌دهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio به‌صورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده می‌شود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐

به‌نظر می‌رسد رقابت مدل‌های صوتی حالا از «چه کسی دقیق‌تر صدا را متن می‌کند؟» عبور کرده و به سؤال بزرگ‌تری رسیده: چه کسی بهتر می‌تواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀

🌀 @cvision 🌀
❤9🔥3
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥

هوش مصنوعی جدید علی‌بابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقع‌گرایانه وارد رقابت شده؛ مدلی که می‌تونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.

اگه دنبال ساخت ویدیوهای حرفه‌ای با هوش مصنوعی هستی، Wan 3.0 یکی از مدل‌هاییه که ارزش امتحان کردن داره. �
@cvision
❤8👍1
Tensorflow(@CVision)
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
from google import genai

client = genai.Client()

# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")

# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)

print(interaction.output_text)


دریافت api key
❤16👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 رقابت غول‌های تولید ویدئو با هوش مصنوعی!

چند روز پیش یک رقابت جذاب بین تعدادی از مطرح‌ترین مدل‌های تولید ویدئوی AI برگزار شد:

🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5

اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:

✅ یک پرامپت مشترک
✅ ۷ تصویر مرجع یکسان
✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل
❌ بدون گزینش دستی
❌ بدون تدوین و ویرایش
❌ بدون تقویت یا اصلاح صدا

یعنی چیزی که می‌بینید، خروجی واقعی مدل‌ها در یک شرایط برابر است. 👀

حالا سؤال اصلی:

🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
👏12👍5👀3
Media is too big
VIEW IN TELEGRAM
معرفی 🚀 GPT-6 Astra

اوپن‌ای‌آی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و هم‌راستاترین مدل خود تا امروز معرفی می‌کند.
آسترا 🧠 در حوزه‌هایی مثل برنامه‌نویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفه‌ای چندمرحله‌ای پیشرفت قابل‌توجهی داشته است.
یکی از مهم‌ترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل می‌تواند با نرم‌افزارها و وب‌سایت‌ها کار کند، فرم‌ها را تکمیل کند، داده‌ها را تحلیل کند، سند و فایل اکسل بسازد، وب‌سایت ایجاد کند و بسیاری از فرایندهای چندمرحله‌ای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارک‌ها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گسترده‌تر خواهد شد.

🔗 منبع OpenAI 🔗

🌀 @cvision 🌀
❤7👀5👏2
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟

OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیق‌تر تصاویر عرضه کرده.

مهم‌ترین تغییرات 👇

⚡️ تولید تصویر تا حدود ۲ برابر سریع‌تر
🖼️ حفظ بهتر چهره، محصول و سوژه‌ی تصویر مرجع
✏️ ویرایش‌های چندمرحله‌ای با تغییر کمتر در بخش‌های دیگر تصویر
✨ نور، بافت و پس‌زمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده

در API هم دو نسخه داریم:

Flare
→ سریع‌تر و مناسب استفاده روزمره
Sunburst
→ مناسب خروجی نهایی و ویرایش‌های دقیق‌تر

نکته مهم برای توسعه‌دهنده‌ها:
اگر از API استفاده می‌کنید، مقدار quality را حتماً مشخص کنید؛ چون سطح‌های کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کرده‌اند.

در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀

🌀 @cvision 🌀
❤5👍2
Media is too big
VIEW IN TELEGRAM
🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحله‌به‌مرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدم‌به‌قدم یاد می‌گیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستم‌های چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و می‌خوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف: COUPON-8759A
👇 ثبت‌نام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیت‌هاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
❤3👍2
دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار داده میشه.

@pythony
❤6
🍂 به مناسبت شروع ماه مهر
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:

📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network

📚 3 دوره از کلاس ویژن در مکتب‌خونه

🤖 آموزش Agentic AI با پایتون

🧠 آموزش هوش مصنوعی مولد با مدل‌های زبانی بزرگ (LLM)

👁 آموزش مدل‌های زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاین‌تیون پیشرفته

⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
❤7
‏🧠 Jev از TypeSafe AI‏؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد

‏TypeSafe AI روز ۱۵ سپتامبر ۲۰۲۶ با ۴۰ میلیون دلار سرمایه معرفی شد و اولین مدلش، Jev‏، را در حالت early access‏ (با waitlist‏) عرضه کرد. بنیان‌گذار و CEO آن، Diogo Almeida‏، سابقه‌ی کار در OpenAI‏ دارد و از نویسندگان مقاله‌ی InstructGPT‏ است.

‏ایده جالب است: به‌جای ساختن یک LLM‏ بهتر برای تولید متن، مدلی بسازیم که مستقیم برای تصمیم‌گیری داخل نرم‌افزار طراحی شده.

‏مشکل کجاست؟
‏LLMها برای chat‏ عالی‌اند، ولی در automation‏ هنوز دردسر دارند: خروجی string‏ است و باید parse‏ و validate‏ شود، latency‏ بالاست و confidence‌ای که خودشان می‌دهند همیشه قابل اعتماد نیست.

‏Jev‏ چه می‌کند؟
‏Jev از دسته‌ی جدیدی به اسم System One Models‏ است (نامش از تمایز System 1‏ و System 2‏ دنیل کانمن آمده):

‏• ورودی: متن یا state‏ نامرتب (مثلاً JSON‏) + مجموعه‌ای سؤال تایپ‌شده
‏• خروجی: از قبل type‏ مشخص دارد؛ انتخاب بین گزینه‌ها (`Choice`‏)، امتیاز (`Score`‏) یا بله/خیر با احتمال (`Noul`‏)، همراه با confidence‏
‏• همه‌ی سؤال‌ها در یک query‏ و به‌صورت موازی جواب داده می‌شوند، نه توکن‌به‌توکن مثل LLMهای autoregressive‏

‏آموزش هم با روشی به اسم **RLCD**‏ (Reinforcement Learning for Calibrated Decisions‏) انجام شده. هدفش این است که احتمال‌ها واقعاً معنی داشته باشند: وقتی مدل می‌گوید ۹۰٪ مطمئنم، انتظار می‌رود تقریباً در ۹۰٪ موارد مشابه درست باشد.

‏ادعاهای شرکت:

‏• latency‏ حدود 70 تا 500 میلی‌ثانیه، یعنی 40x‏ تا 200x‏ سریع‌تر از LLMهای frontier‏ در taskهای System One‏
‏• قیمت $0.042 برای هر یک میلیون توکن ورودی؛ خروجی رایگان
‏• «no type errors‏»: چون خروجی از قبل schema‏ دارد، مدل نمی‌تواند مقداری خارج از ساختار تعریف‌شده برگرداند

‏⚠️ «no type errors‏» یعنی خروجی type-safe‏ است، نه اینکه «هیچ‌وقت اشتباه نمی‌کند». تصمیم می‌تواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خود شرکت است.

‏منبع:
‏https://typesafe.ai/blog/introducing-system-one-models-and-jev
❤4👏3
‏🎯 Jev‏ کجا به درد می‌خورد و کجا نه؟

‏Jev‏ بیشتر از اینکه جای GPT‏ یا Claude‏ را بگیرد، می‌تواند یک «لایه‌ی تصمیم‌گیری» سریع و ارزان باشد. یعنی برای کارهای کوچک و پرتعداد که الان بی‌خودی برای هرکدام یک مدل بزرگ صدا می‌زنیم.

‏تقسیم کار پیشنهادی (Separation of Concerns‏):

‏• تصمیم‌های کوچک و پرتعداد ← Jev
‏• تحلیل، reasoning‏ و تولید محتوا ← GPT / Claude / Gemini‏
‏• قوانین قطعی، محاسبات و محدودیت‌های حساس ← Code‏
‏• تصمیم‌های پرریسک ← انسان

‏نمونه کاربردها:

‏• CRM‏: دسته‌بندی مشتری‌ها بر اساس احتمال ریزش، اهمیت یا نوع درخواست
‏• Support‏ و Lead Scoring‏: تشخیص فوریت، تیم مناسب و ارزش سرنخ‌ها
‏• Agent Routing‏: انتخاب agent‏، tool‏ یا مدل مناسب قبل از شروع کار سنگین
‏• RAG‏: حذف اسناد کم‌ربط و re-rank‏ نتایج
‏• QA‏ و Moderation‏: بررسی کیفیت، ارتباط و ریسک خروجی مدل‌ها، و پرچم‌گذاری محتوای مشکوک
‏• Workflow Automation‏: تعیین شاخه‌ی فرایند برای هر درخواست
‏• باشگاه مشتریان و بازاریابی: انتخاب نوع پیشنهاد، تخفیف یا کمپین مناسب هر گروه

‏⚠️ اما Jev‏ «خیلی باهوش‌تر» نیست؛ برای یک نوع خاص از هوش بهینه شده و روی مسئله‌های مبهم افت می‌کند. دو نمونه:

‏1️⃣ Browser automation‏
‏تیم WebMCP‏ (Idan Levin‏) با ترکیب Jev‏ و WebMCP‏ همه‌ی 49 task‏ را حل کرد. ولی این ترکیب دو مدل بود: Jev‏ ابزار را انتخاب می‌کرد و یک LLM‏ سریع (Mercury 2.5‏) آرگومان‌ها را می‌نوشت، چون Jev‏ متن تولید نمی‌کند. وقتی Jev‏ مستقیم با کنترل‌های صفحه مرورگر را می‌راند، فقط 25 از 49 task‏ حل شد. خود نویسندگان می‌گویند این نتیجه‌ی harness‏ آن‌هاست و سقف عمومی Jev‏ نیست.

‏2️⃣ تشخیص phishing‏
‏در یک benchmark‏ مستقل روی 2000 ایمیل (ایمیل‌های synthetic‏)، دقت مستقیم Jev‏ فقط 62.6٪ بود و Claude Haiku 4.5‏ به 81.3٪ رسید.
‏ولی وقتی همان مسئله به 5 سؤال ساده‌تر شکسته شد (مثلاً: لینک به free hosting‏ اشاره دارد؟ فشار و فوریت دارد؟)، یک رگرسیون لجستیک روی جواب‌های Jev‏ به 95.1٪ رسید. حتی یک قانون ثابت روی یکی از این سیگنال‌ها 89.5٪ می‌داد.

‏در همین تست Jev‏ حدود 3 برابر سریع‌تر (239ms‏ در برابر 687ms‏) و حدود 12 برابر ارزان‌تر ($0.038 در برابر $0.462 برای هر هزار ایمیل) از Haiku‏ بود. یعنی در مقایسه با یک مدل سبک، ضریب‌ها خیلی کمتر از «40x‏ تا 200x‏» است.

‏پس جای درست Jev‏ «مغز کل سیستم» نیست، بلکه یک قطعه‌ی سریع برای تصمیم‌های محدود داخل یک معماری بزرگ‌تر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهم‌تر، چندمرحله‌ای‌تر یا پرریسک‌تر شود، بهتر است به یک مدل قوی‌تر یا انسان سپرده شود.

‏منابع:
‏https://madewithjev.com/builds/webmcp-benchmark
‏https://github.com/anisselbd/jev-phishing-bench
❤14👏5