Tensorflow(@CVision)
گوگل یک قدم جدیتر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفتهی گوگل، دقیقترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمهبهکلمهی…
مدل جدید در مکالمههای واقعی میتواند مکثها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را بهصورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نامهای خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️
یکی از جذابترین بخشها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجهها و جابهجایی بین زبانهاست. برای فایلهای ضبطشده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل میتواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخهی جداگانهی
از نظر بنچمارک هم اعداد جالباند؛ طبق دادهای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکتهی مهمتر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمیبیند. این مدل در بعضی تجربههای Gemini میتواند با Context صفحه و مدلهای دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و میتواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعهدهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio بهصورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده میشود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐
بهنظر میرسد رقابت مدلهای صوتی حالا از «چه کسی دقیقتر صدا را متن میکند؟» عبور کرده و به سؤال بزرگتری رسیده: چه کسی بهتر میتواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀
🌀 @cvision 🌀
یکی از جذابترین بخشها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجهها و جابهجایی بین زبانهاست. برای فایلهای ضبطشده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل میتواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧
برای کاربردهای Real-time هم گوگل نسخهی جداگانهی
gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشنهای تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار میدهد. نسخهی دیگر هم برای پردازش فایلهای ضبطشده، جلسات و تماسها در دسترس است. 🚀از نظر بنچمارک هم اعداد جالباند؛ طبق دادهای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکتهی مهمتر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمیبیند. این مدل در بعضی تجربههای Gemini میتواند با Context صفحه و مدلهای دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و میتواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعهدهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio بهصورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده میشود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐
بهنظر میرسد رقابت مدلهای صوتی حالا از «چه کسی دقیقتر صدا را متن میکند؟» عبور کرده و به سؤال بزرگتری رسیده: چه کسی بهتر میتواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀
🌀 @cvision 🌀
❤9🔥3
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥
هوش مصنوعی جدید علیبابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقعگرایانه وارد رقابت شده؛ مدلی که میتونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.
اگه دنبال ساخت ویدیوهای حرفهای با هوش مصنوعی هستی، Wan 3.0 یکی از مدلهاییه که ارزش امتحان کردن داره. �
@cvision
هوش مصنوعی جدید علیبابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقعگرایانه وارد رقابت شده؛ مدلی که میتونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره.
اگه دنبال ساخت ویدیوهای حرفهای با هوش مصنوعی هستی، Wan 3.0 یکی از مدلهاییه که ارزش امتحان کردن داره. �
@cvision
❤8👍1
Tensorflow(@CVision)
گوگل یک قدم جدیتر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفتهی گوگل، دقیقترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمهبهکلمهی…
from google import genai
client = genai.Client()
# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")
# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)
print(interaction.output_text)
دریافت api key
❤16👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 رقابت غولهای تولید ویدئو با هوش مصنوعی!
چند روز پیش یک رقابت جذاب بین تعدادی از مطرحترین مدلهای تولید ویدئوی AI برگزار شد:
🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5
اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:
✅ یک پرامپت مشترک
✅ ۷ تصویر مرجع یکسان
✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل
❌ بدون گزینش دستی
❌ بدون تدوین و ویرایش
❌ بدون تقویت یا اصلاح صدا
یعنی چیزی که میبینید، خروجی واقعی مدلها در یک شرایط برابر است. 👀
حالا سؤال اصلی:
🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
چند روز پیش یک رقابت جذاب بین تعدادی از مطرحترین مدلهای تولید ویدئوی AI برگزار شد:
🎬 Seedance 2.5
🎬 WAN 3
🎬 FLUX 3
🎬 Minimax H3
🎬 Seedance 2.0
🎬 Seedance 2.0 Mini
🎬 Kling 3 Omni
🎬 Grok Imagine 1.5
اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود:
✅ یک پرامپت مشترک
✅ ۷ تصویر مرجع یکسان
✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل
❌ بدون گزینش دستی
❌ بدون تدوین و ویرایش
❌ بدون تقویت یا اصلاح صدا
یعنی چیزی که میبینید، خروجی واقعی مدلها در یک شرایط برابر است. 👀
حالا سؤال اصلی:
🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟
🌀 @cvision 🌀
👏12👍5👀3
Media is too big
VIEW IN TELEGRAM
معرفی 🚀 GPT-6 Astra
اوپنایآی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و همراستاترین مدل خود تا امروز معرفی میکند.
آسترا 🧠 در حوزههایی مثل برنامهنویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفهای چندمرحلهای پیشرفت قابلتوجهی داشته است.
یکی از مهمترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل میتواند با نرمافزارها و وبسایتها کار کند، فرمها را تکمیل کند، دادهها را تحلیل کند، سند و فایل اکسل بسازد، وبسایت ایجاد کند و بسیاری از فرایندهای چندمرحلهای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارکها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گستردهتر خواهد شد.
🔗 منبع OpenAI 🔗
🌀 @cvision 🌀
اوپنایآی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و همراستاترین مدل خود تا امروز معرفی میکند.
آسترا 🧠 در حوزههایی مثل برنامهنویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفهای چندمرحلهای پیشرفت قابلتوجهی داشته است.
یکی از مهمترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل میتواند با نرمافزارها و وبسایتها کار کند، فرمها را تکمیل کند، دادهها را تحلیل کند، سند و فایل اکسل بسازد، وبسایت ایجاد کند و بسیاری از فرایندهای چندمرحلهای را با دخالت کمتر کاربر پیش ببرد.
عملکرد 📊 آسترا در برخی بنچمارکها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است.
دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گستردهتر خواهد شد.
🔗 منبع OpenAI 🔗
🌀 @cvision 🌀
❤7👀5👏2
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟
OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیقتر تصاویر عرضه کرده.
مهمترین تغییرات 👇
⚡️ تولید تصویر تا حدود ۲ برابر سریعتر
🖼️ حفظ بهتر چهره، محصول و سوژهی تصویر مرجع
✏️ ویرایشهای چندمرحلهای با تغییر کمتر در بخشهای دیگر تصویر
✨ نور، بافت و پسزمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده
در API هم دو نسخه داریم:
Flare → سریعتر و مناسب استفاده روزمره
Sunburst → مناسب خروجی نهایی و ویرایشهای دقیقتر
نکته مهم برای توسعهدهندهها:
اگر از API استفاده میکنید، مقدار
در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀
🌀 @cvision 🌀
OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیقتر تصاویر عرضه کرده.
مهمترین تغییرات 👇
⚡️ تولید تصویر تا حدود ۲ برابر سریعتر
🖼️ حفظ بهتر چهره، محصول و سوژهی تصویر مرجع
✏️ ویرایشهای چندمرحلهای با تغییر کمتر در بخشهای دیگر تصویر
✨ نور، بافت و پسزمینه شفاف بهتر
💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده
در API هم دو نسخه داریم:
Flare → سریعتر و مناسب استفاده روزمره
Sunburst → مناسب خروجی نهایی و ویرایشهای دقیقتر
نکته مهم برای توسعهدهندهها:
اگر از API استفاده میکنید، مقدار
quality را حتماً مشخص کنید؛ چون سطحهای کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کردهاند.در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀
🌀 @cvision 🌀
❤5👍2
Forwarded from 🚀 کلاسویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته
Media is too big
VIEW IN TELEGRAM
🤖 میخوای Agent بسازی، نه فقط با AI چت کنی؟
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحلهبهمرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدمبهقدم یاد میگیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستمهای چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و میخوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف:
👇 ثبتنام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیتهاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحلهبهمرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره.
توی دوره Agentic AI با پایتون قدمبهقدم یاد میگیری:
🔹 Workflow و Tool Use
🔹 MCP
🔹 سیستمهای چندعامله (Multi-Agent)
🔹 LangChain
اگه پایتون بلدی و میخوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده.
🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود)
🎟 کد تخفیف:
COUPON-8759A👇 ثبتنام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیتهاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm
❤3👍2
دنیایی از منابع برنامهنویسی توی این کانال بصورت دستهبندی شده با هشتگ بصورت روزانه قرار داده میشه.
@pythony
@pythony
❤6
Forwarded from 🚀 کلاسویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته
🍂 به مناسبت شروع ماه مهر
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:
📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network
📚 3 دوره از کلاس ویژن در مکتبخونه
🤖 آموزش Agentic AI با پایتون
🧠 آموزش هوش مصنوعی مولد با مدلهای زبانی بزرگ (LLM)
👁 آموزش مدلهای زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاینتیون پیشرفته
⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید:
📌 ۱ دوره از سایت کلاس ویژن
🧠 دوره آموزشی ویدیویی Graph Neural Network
📚 3 دوره از کلاس ویژن در مکتبخونه
🤖 آموزش Agentic AI با پایتون
🧠 آموزش هوش مصنوعی مولد با مدلهای زبانی بزرگ (LLM)
👁 آموزش مدلهای زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاینتیون پیشرفته
⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
❤7
🧠 Jev از TypeSafe AI؛ مدلی که متن نمینویسد، تصمیم میگیرد
TypeSafe AI روز ۱۵ سپتامبر ۲۰۲۶ با ۴۰ میلیون دلار سرمایه معرفی شد و اولین مدلش، Jev، را در حالت early access (با waitlist) عرضه کرد. بنیانگذار و CEO آن، Diogo Almeida، سابقهی کار در OpenAI دارد و از نویسندگان مقالهی InstructGPT است.
ایده جالب است: بهجای ساختن یک LLM بهتر برای تولید متن، مدلی بسازیم که مستقیم برای تصمیمگیری داخل نرمافزار طراحی شده.
مشکل کجاست؟
LLMها برای chat عالیاند، ولی در automation هنوز دردسر دارند: خروجی string است و باید parse و validate شود، latency بالاست و confidenceای که خودشان میدهند همیشه قابل اعتماد نیست.
Jev چه میکند؟
Jev از دستهی جدیدی به اسم System One Models است (نامش از تمایز System 1 و System 2 دنیل کانمن آمده):
• ورودی: متن یا state نامرتب (مثلاً JSON) + مجموعهای سؤال تایپشده
• خروجی: از قبل type مشخص دارد؛ انتخاب بین گزینهها (`Choice`)، امتیاز (`Score`) یا بله/خیر با احتمال (`Noul`)، همراه با confidence
• همهی سؤالها در یک query و بهصورت موازی جواب داده میشوند، نه توکنبهتوکن مثل LLMهای autoregressive
آموزش هم با روشی به اسم **RLCD** (Reinforcement Learning for Calibrated Decisions) انجام شده. هدفش این است که احتمالها واقعاً معنی داشته باشند: وقتی مدل میگوید ۹۰٪ مطمئنم، انتظار میرود تقریباً در ۹۰٪ موارد مشابه درست باشد.
ادعاهای شرکت:
• latency حدود 70 تا 500 میلیثانیه، یعنی 40x تا 200x سریعتر از LLMهای frontier در taskهای System One
• قیمت
• «no type errors»: چون خروجی از قبل schema دارد، مدل نمیتواند مقداری خارج از ساختار تعریفشده برگرداند
⚠️ «no type errors» یعنی خروجی type-safe است، نه اینکه «هیچوقت اشتباه نمیکند». تصمیم میتواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خود شرکت است.
منبع:
https://typesafe.ai/blog/introducing-system-one-models-and-jev
TypeSafe AI روز ۱۵ سپتامبر ۲۰۲۶ با ۴۰ میلیون دلار سرمایه معرفی شد و اولین مدلش، Jev، را در حالت early access (با waitlist) عرضه کرد. بنیانگذار و CEO آن، Diogo Almeida، سابقهی کار در OpenAI دارد و از نویسندگان مقالهی InstructGPT است.
ایده جالب است: بهجای ساختن یک LLM بهتر برای تولید متن، مدلی بسازیم که مستقیم برای تصمیمگیری داخل نرمافزار طراحی شده.
مشکل کجاست؟
LLMها برای chat عالیاند، ولی در automation هنوز دردسر دارند: خروجی string است و باید parse و validate شود، latency بالاست و confidenceای که خودشان میدهند همیشه قابل اعتماد نیست.
Jev چه میکند؟
Jev از دستهی جدیدی به اسم System One Models است (نامش از تمایز System 1 و System 2 دنیل کانمن آمده):
• ورودی: متن یا state نامرتب (مثلاً JSON) + مجموعهای سؤال تایپشده
• خروجی: از قبل type مشخص دارد؛ انتخاب بین گزینهها (`Choice`)، امتیاز (`Score`) یا بله/خیر با احتمال (`Noul`)، همراه با confidence
• همهی سؤالها در یک query و بهصورت موازی جواب داده میشوند، نه توکنبهتوکن مثل LLMهای autoregressive
آموزش هم با روشی به اسم **RLCD** (Reinforcement Learning for Calibrated Decisions) انجام شده. هدفش این است که احتمالها واقعاً معنی داشته باشند: وقتی مدل میگوید ۹۰٪ مطمئنم، انتظار میرود تقریباً در ۹۰٪ موارد مشابه درست باشد.
ادعاهای شرکت:
• latency حدود 70 تا 500 میلیثانیه، یعنی 40x تا 200x سریعتر از LLMهای frontier در taskهای System One
• قیمت
$0.042 برای هر یک میلیون توکن ورودی؛ خروجی رایگان• «no type errors»: چون خروجی از قبل schema دارد، مدل نمیتواند مقداری خارج از ساختار تعریفشده برگرداند
⚠️ «no type errors» یعنی خروجی type-safe است، نه اینکه «هیچوقت اشتباه نمیکند». تصمیم میتواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خود شرکت است.
منبع:
https://typesafe.ai/blog/introducing-system-one-models-and-jev
typesafe.ai
Introducing System One Models & Jev - TypeSafe AI Blog
TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
❤4👏3
🎯 Jev کجا به درد میخورد و کجا نه؟
Jev بیشتر از اینکه جای GPT یا Claude را بگیرد، میتواند یک «لایهی تصمیمگیری» سریع و ارزان باشد. یعنی برای کارهای کوچک و پرتعداد که الان بیخودی برای هرکدام یک مدل بزرگ صدا میزنیم.
تقسیم کار پیشنهادی (Separation of Concerns):
• تصمیمهای کوچک و پرتعداد ← Jev
• تحلیل، reasoning و تولید محتوا ← GPT / Claude / Gemini
• قوانین قطعی، محاسبات و محدودیتهای حساس ← Code
• تصمیمهای پرریسک ← انسان
نمونه کاربردها:
• CRM: دستهبندی مشتریها بر اساس احتمال ریزش، اهمیت یا نوع درخواست
• Support و Lead Scoring: تشخیص فوریت، تیم مناسب و ارزش سرنخها
• Agent Routing: انتخاب agent، tool یا مدل مناسب قبل از شروع کار سنگین
• RAG: حذف اسناد کمربط و re-rank نتایج
• QA و Moderation: بررسی کیفیت، ارتباط و ریسک خروجی مدلها، و پرچمگذاری محتوای مشکوک
• Workflow Automation: تعیین شاخهی فرایند برای هر درخواست
• باشگاه مشتریان و بازاریابی: انتخاب نوع پیشنهاد، تخفیف یا کمپین مناسب هر گروه
⚠️ اما Jev «خیلی باهوشتر» نیست؛ برای یک نوع خاص از هوش بهینه شده و روی مسئلههای مبهم افت میکند. دو نمونه:
1️⃣ Browser automation
تیم WebMCP (Idan Levin) با ترکیب Jev و WebMCP همهی 49 task را حل کرد. ولی این ترکیب دو مدل بود: Jev ابزار را انتخاب میکرد و یک LLM سریع (Mercury 2.5) آرگومانها را مینوشت، چون Jev متن تولید نمیکند. وقتی Jev مستقیم با کنترلهای صفحه مرورگر را میراند، فقط 25 از 49 task حل شد. خود نویسندگان میگویند این نتیجهی harness آنهاست و سقف عمومی Jev نیست.
2️⃣ تشخیص phishing
در یک benchmark مستقل روی 2000 ایمیل (ایمیلهای synthetic)، دقت مستقیم Jev فقط 62.6٪ بود و Claude Haiku 4.5 به 81.3٪ رسید.
ولی وقتی همان مسئله به 5 سؤال سادهتر شکسته شد (مثلاً: لینک به free hosting اشاره دارد؟ فشار و فوریت دارد؟)، یک رگرسیون لجستیک روی جوابهای Jev به 95.1٪ رسید. حتی یک قانون ثابت روی یکی از این سیگنالها 89.5٪ میداد.
در همین تست Jev حدود 3 برابر سریعتر (239ms در برابر 687ms) و حدود 12 برابر ارزانتر (
پس جای درست Jev «مغز کل سیستم» نیست، بلکه یک قطعهی سریع برای تصمیمهای محدود داخل یک معماری بزرگتر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهمتر، چندمرحلهایتر یا پرریسکتر شود، بهتر است به یک مدل قویتر یا انسان سپرده شود.
منابع:
https://madewithjev.com/builds/webmcp-benchmark
https://github.com/anisselbd/jev-phishing-bench
Jev بیشتر از اینکه جای GPT یا Claude را بگیرد، میتواند یک «لایهی تصمیمگیری» سریع و ارزان باشد. یعنی برای کارهای کوچک و پرتعداد که الان بیخودی برای هرکدام یک مدل بزرگ صدا میزنیم.
تقسیم کار پیشنهادی (Separation of Concerns):
• تصمیمهای کوچک و پرتعداد ← Jev
• تحلیل، reasoning و تولید محتوا ← GPT / Claude / Gemini
• قوانین قطعی، محاسبات و محدودیتهای حساس ← Code
• تصمیمهای پرریسک ← انسان
نمونه کاربردها:
• CRM: دستهبندی مشتریها بر اساس احتمال ریزش، اهمیت یا نوع درخواست
• Support و Lead Scoring: تشخیص فوریت، تیم مناسب و ارزش سرنخها
• Agent Routing: انتخاب agent، tool یا مدل مناسب قبل از شروع کار سنگین
• RAG: حذف اسناد کمربط و re-rank نتایج
• QA و Moderation: بررسی کیفیت، ارتباط و ریسک خروجی مدلها، و پرچمگذاری محتوای مشکوک
• Workflow Automation: تعیین شاخهی فرایند برای هر درخواست
• باشگاه مشتریان و بازاریابی: انتخاب نوع پیشنهاد، تخفیف یا کمپین مناسب هر گروه
⚠️ اما Jev «خیلی باهوشتر» نیست؛ برای یک نوع خاص از هوش بهینه شده و روی مسئلههای مبهم افت میکند. دو نمونه:
1️⃣ Browser automation
تیم WebMCP (Idan Levin) با ترکیب Jev و WebMCP همهی 49 task را حل کرد. ولی این ترکیب دو مدل بود: Jev ابزار را انتخاب میکرد و یک LLM سریع (Mercury 2.5) آرگومانها را مینوشت، چون Jev متن تولید نمیکند. وقتی Jev مستقیم با کنترلهای صفحه مرورگر را میراند، فقط 25 از 49 task حل شد. خود نویسندگان میگویند این نتیجهی harness آنهاست و سقف عمومی Jev نیست.
2️⃣ تشخیص phishing
در یک benchmark مستقل روی 2000 ایمیل (ایمیلهای synthetic)، دقت مستقیم Jev فقط 62.6٪ بود و Claude Haiku 4.5 به 81.3٪ رسید.
ولی وقتی همان مسئله به 5 سؤال سادهتر شکسته شد (مثلاً: لینک به free hosting اشاره دارد؟ فشار و فوریت دارد؟)، یک رگرسیون لجستیک روی جوابهای Jev به 95.1٪ رسید. حتی یک قانون ثابت روی یکی از این سیگنالها 89.5٪ میداد.
در همین تست Jev حدود 3 برابر سریعتر (239ms در برابر 687ms) و حدود 12 برابر ارزانتر (
$0.038 در برابر $0.462 برای هر هزار ایمیل) از Haiku بود. یعنی در مقایسه با یک مدل سبک، ضریبها خیلی کمتر از «40x تا 200x» است.پس جای درست Jev «مغز کل سیستم» نیست، بلکه یک قطعهی سریع برای تصمیمهای محدود داخل یک معماری بزرگتر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهمتر، چندمرحلهایتر یا پرریسکتر شود، بهتر است به یک مدل قویتر یا انسان سپرده شود.
منابع:
https://madewithjev.com/builds/webmcp-benchmark
https://github.com/anisselbd/jev-phishing-bench
Madewithjev
Jev on the WebMCP benchmark — built with Jev
Jev picks the tool, a fast LLM fills the arguments: 49 of 49 tasks solved.
❤14👏5