هوش مصنوعی و علم داده به فارسی
6.05K subscribers
1.36K photos
364 videos
336 files
1.5K links
🗨 ارتباط با ما (تبلیغات، سوال، پیشنهاد و انتقاد):
📩 @Contact2Mebot

💯 کانال دوم ما:
@Datascientists_Files

💎 در پیام‌رسان بله(آپدیت اتومات):
https://ble.ir/dataplusscience

💡 در پیام‌رسان ایتا(آپدیت اتومات):
https://eitaa.com/DataPlusScience
Download Telegram
Media is too big
VIEW IN TELEGRAM
🚀 آپدیت بزرگ مدل ویدیویی Seedance 2.5

🧠 ‏ مدل پیشرفته Seedance 2.5 با تمرکز ویژه بر کنترل دقیق و تولید ویدیوهای طولانی عرضه شد. این مدل اکنون قادر به تولید کلیپ‌های ۳۰ ثانیه‌ای یکپارچه بوده و در حالت بتا، این ویدیوها را تا ۱۸۰ ثانیه با حفظ تداوم محتوا گسترش می‌دهد.

‏ از قابلیت‌های کلیدی این نسخه، پشتیبانی از حداکثر ۵۰ تصویر مرجع (Reference) برای ورودی است. تمرکز توسعه‌دهندگان بر بهینه‌سازی پایپ‌لاین‌های حرفه‌ای برای کار با پرده سبز و مدل‌های سه‌بعدی Blender بوده است تا ساختار فضایی، مسیر حرکت اشیاء و حرکت دوربین با دقت بالا کنترل شوند.

🎨 ‏ قابلیت ویرایش نقطه‌ای مشابه با Gemini Omni به این مدل اضافه شده است. اگرچه پیش‌تر وعده خروجی 4K داده شده بود، اما در حال حاضر خروجی نهایی به رزولوشن‌های 480p و 720p محدود است.

💰 ‏ هزینه استفاده از Seedance 2.5 حدود ۱.۵ برابر مدل قبلی بوده و با قیمت ۶ دلار برای هر ۳۰ ثانیه، گران‌ترین گزینه در بازار است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Seedance_2_5 #Dreamina
🌐 مجموعه‌ای جامع از مطالعات موردی سیستم‌های ML

‏ این مخزن گیت‌هاب شامل بیش از ۳۰۰ مطالعه موردی واقعی از سیستم‌های یادگیری ماشین در شرکت‌های بزرگ فناوری است. برخلاف منابع تئوریک، این لیست بر تجربیات عملی مهندسی و پیاده‌سازی مدل‌ها در مقیاس Production تمرکز دارد.

🏗 ‏️ شما می‌توانید نحوه معماری سیستم‌های شرکت‌های پیشرو نظیر Uber، Netflix و Google را بررسی کنید. این مستندات به چالش‌های فنی، شکست‌های زیرساختی و راهکارهای عملیاتی که منجر به بازیابی و بهینه‌سازی سیستم‌ها شده‌اند، می‌پردازد.

🧠 ‏ مطالعه این کیس‌استادی‌ها برای مهندسان داده و توسعه‌دهندگان سیستم‌های هوش مصنوعی بسیار مفید است، زیرا بینش عمیقی از نحوه برخورد با پیچیدگی‌های دنیای واقعی ارائه می‌دهد. این مخزن می‌تواند منبعی کلیدی برای درک بهتر System Design در پروژه‌های بزرگ مقیاس باشد.

GitHub Link

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#System_Design #Production_ML
🤖 مقابله لینکدین با سیل محتوای هوش مصنوعی

🌐 ‏ به دلیل افزایش چشمگیر پست‌های بی‌کیفیت تولیدشده توسط هوش مصنوعی، لینکدین قابلیت جدیدی با عنوان Seems like AI slop را برای گزارش‌دهی این محتواها معرفی کرده است. طبق آمار سیستم تشخیص محتوای Pangram، بالغ بر ۴۱ درصد از پست‌های طولانی این پلتفرم بدون هیچ‌گونه ویرایش انسانی توسط مدل‌های زبانی ایجاد شده‌اند.

🚀 ‏ لینکدین در حال پیاده‌سازی یک سیستم طبقه‌بندی‌کننده (مدل تشخیص الگو) جدید است تا محتواهای ماشینی را شناسایی کند. با شناسایی این موارد، نرخ نمایش آن‌ها در فید کاربران به شدت کاهش می‌یابد و دکمه جدید گزارش‌دهی به بهبود دقت این سیستم‌ها کمک می‌کند.

📊 ‏ این شبکه اجتماعی همچنین قصد دارد قابلیتی اضافه کند که به نویسندگان هشدار می‌دهد کاربران پست‌های آن‌ها را غیرواقعی یا بیش از حد ماشینی تلقی کرده‌اند. این اقدامات بخشی از استراتژی گسترده لینکدین برای حفظ اصالت تعاملات و ارتقای کیفیت محتوا در این محیط حرفه‌ای است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Seems_like_AI_slop #Pangram
🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده
🗂 گزارش #73 | 📌 12 آیتم گزارش | 🧾 از 49 پست بررسی‌شده
🕐 جمعه 1405/05/09 ساعت 14:00 تا شنبه 1405/05/10 ساعت 14:00

🤖 مدل‌های زبانی بزرگ

ایلان ماسک از عرضه مدل Grok 4.6 با 1.5 تریلیون پارامتر خبر داد و وعده مدل 2.1 تریلیون پارامتری را در آینده نزدیک داد.
🔗 مشاهده پست

مایکروسافت مدل‌های MAI-Image-2.5-Pro برای تولید تصویر و MAI-Voice-2-Flash برای سنتز سریع گفتار در 15 زبان را معرفی کرد.
🔗 مشاهده پست

مدل GPT-5.6 Sol با تغییرات در نحوه تعامل با API و استفاده از تکنیک Compaction، امتیاز خود در بنچمارک ARC-AGI-3 را از 13.3 درصد به 38.3 درصد افزایش داد.
🔗 مشاهده پست

مدل DeepSeek V4-Flash با 284 میلیارد پارامتر، حافظه 1 میلیون توکنی و بهبود در وظایف عامل‌محور (Agentic Tasks) بهینه‌سازی شد.
🔗 مشاهده پست

مدل Inkling-Small به عنوان یک مدل MoE جدید با 276 میلیارد پارامتر (12 میلیارد فعال) در حوزه‌های برنامه‌نویسی معرفی شد.
🔗 مشاهده پست

شرکت OpenAI با کاهش قیمت 80 درصدی مدل Luna و بهبود سرعت مدل GPT-5.6 Sol Fast، ساختار هزینه‌ای خود را بازنگری کرد.
🔗 مشاهده پست


🦾 رباتیک و خودکارسازی

فریم‌ورک AngelSpec از شرکت Tencent برای شتاب‌دهی به Speculative Decoding عرضه شد که سرعت تولید متن را تا 2.4 برابر افزایش می‌دهد.
🔗 مشاهده پست

مدل ویدئویی Seedance 2.5 با پشتیبانی از تولید ویدیوهای 30 ثانیه‌ای و قابلیت کنترل دقیق دوربین و اشیاء به‌روزرسانی شد.
🔗 مشاهده پست


📊 ابزارهای داده و دیتاست‌ها

دیتاست‌های جدیدی با محوریت فوتبال بین‌المللی، رمزارزها، نرخ ارز و بازار مسکن وین برای تحلیل‌های آماری و سری زمانی منتشر شدند.
🔗 مشاهده پست

مجموعه داده Most Streamed Spotify Songs 2025 با 730 رکورد و امتیاز 10 از 10 در پلتفرم کگل برای تحلیل الگوهای شنیداری در دسترس قرار گرفت.
🔗 مشاهده پست


🎓 آموزش و منابع

یک مخزن گیت‌هاب شامل 300 مطالعه موردی واقعی از پیاده‌سازی سیستم‌های Machine Learning در شرکت‌هایی نظیر Netflix و Uber منتشر شد.
🔗 مشاهده پست

نقشه راه یادگیری هوش مصنوعی با معرفی برترین کانال‌های یوتیوب برای تسلط بر Agentic AI و مهارت‌های پایتون معرفی شد.
🔗 مشاهده پست


🔒 امنیت و حریم خصوصی

در یک رخداد امنیتی، مدل‌های Anthropic در حین تست نفوذ (CTF) به‌دلیل پیکربندی اشتباه به سیستم‌های واقعی سه شرکت نفوذ کردند.
🔗 مشاهده پست

لینکدین برای مقابله با 41 درصد پست‌های بی‌کیفیت تولید شده توسط هوش مصنوعی، قابلیت گزارش‌دهی AI slop را معرفی کرد.
🔗 مشاهده پست


📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
🤖 دستاورد بزرگ OpenAI در حل مسائل کلاسیک ریاضی

🚀 ‏ تیم تحقیقاتی OpenAI به‌تازگی نتایج خیره‌کننده‌ای را توسط مدل داخلی خود با نام Astra منتشر کرده است. این مدل توانسته است ده مسئله ریاضی را که دهه‌ها حل‌نشده باقی مانده بودند، با موفقیت حل کند و استدلال‌های خود را به‌صورت رسمی در محیط Lean (یک دستیار اثبات قضایا) فرمالیزه کند.

🔬 ‏ این مدل موفق به ثبت دستاوردهای شاخصی در حوزه‌های پیچیده ریاضی شده است که شامل موارد زیر است

🔹گروه‌های غیر-سوفیک: ساخت اولین نمونه صریح از این گروه‌ها که پرسش دیرینه تقریب‌های جایگشت متناهی را حل می‌کند.
🔹ابطال حدس صلبیت Connes: ساخت بی‌نهایت گروه غیرایزومورف با ویژگی (T) و جبر فون نویمان یکسان.
🔹بسته‌بندی کره: بهبود کران کلی چگالی بسته‌بندی در ابعاد بالا پس از سال ۱۹۷۸.
🔹تکرار موازی کوانتومی: اثبات تکرار موازی نمایی برای تمام بازی‌های کوانتومی دوطرفه درهم‌تنیده.

🔗openai.com

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Astra_model #Lean_prover
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 معرفی مدل Gemini Robotics 2 برای کنترل ربات‌های انسان‌نما

🚀 ‏ تیم Google DeepMind از سیستم جدید Gemini Robotics 2 رونمایی کرد که برای مدیریت تمامی حرکات بدن ربات‌های انسان‌نما از جمله راه رفتن، خم شدن و تعامل با اشیاء توسط دستان پنج‌انگشتی طراحی شده است. این سیستم از ترکیب سه مدل هوشمند برای درک ورودی‌های بصری و تبدیل آن‌ها به حرکات هماهنگ استفاده می‌کند.

🧠 ‏ مدل ER 2 وظیفه مدیریت تسک‌های پیچیده و طولانی‌مدت را بر عهده دارد و می‌تواند هم‌زمان تصمیمات صدها عملگر را هماهنگ کند. بخش On-Device 2 نیز با اجرای محلی، قادر است تنها با کمتر از ۲۰۰ نمونه آموزشی جمع‌آوری‌شده در چند ساعت، خود را با ساختار بازوهای ربات‌های جدید تطبیق دهد.

🔬 ‏ این فناوری روی ربات‌های Apollo محصول Apptronik و Franka Duo تست شده است. عملکرد سیستم در تسک‌های حرکتی کل بدن موفقیت ۴۵.۷٪ تا ۷۶.۳٪ را ثبت کرده و در جابه‌جایی اشیاء، نرخ موفقیت بین ۳۲٪ برای استفاده از خاک‌انداز تا ۹۲٪ برای باز کردن لامپ متغیر است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Gemini_Robotics_2 #Apptronik_Apollo
🤖 کاهش چشمگیر هزینه‌های استنتاج در هوش مصنوعی

‏ بررسی‌های جدید نشان می‌دهد که هزینه دسترسی به مدل‌های هوش مصنوعی با توانمندی معادل GPT-3.5، در بازه زمانی ۲۰۲۲ تا ۲۰۲۴ حدود ۲۸۰ برابر کاهش یافته است. این داده‌ها که توسط گزارش 2025 AI Index مؤسسه Stanford HAI تأیید شده، تحولی بزرگ در صرفه اقتصادی پیاده‌سازی مدل‌های زبانی است.

📊 ‏ نمودار هزینه‌ها بر اساس معیار MMLU (سنجش درک زبان چندوظیفه‌ای) نشان می‌دهد که قیمت هر میلیون توکن خروجی از ۲۰ دلار در نوامبر ۲۰۲۲ به رقم ناچیز ۰.۰۷ دلار در اکتبر ۲۰۲۴ رسیده است. تحقیقات Epoch AI نیز این روند نزولی را تأیید کرده و کاهش میانگین سالانه ۵۰ برابری را در بنچمارک‌های مختلف برآورد می‌کند.

🧠 ‏ نکته کلیدی در این تحلیل، تمرکز بر حفظ قابلیت ثابت در مدل‌هاست؛ یعنی کاهش هزینه نه به دلیل تغییر قیمت مدل‌های پرچمدار، بلکه به دلیل بهینه‌سازی مداوم برای دستیابی به توانمندی مشابه است.

🔗mck.co

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#MMLU #GPT_3
🤖 بلندپروازی اتحادیه اروپا برای هوش مصنوعی

‏ اتحادیه اروپا با هدف دستیابی به حاکمیت تکنولوژیک در حوزه هوش مصنوعی، طرحی جاه‌طلبانه برای تبدیل‌شدن به «نخستین قاره هوش مصنوعی» ارائه کرده است. اورسولا فون در لاین اعلام کرد که این اتحادیه قصد دارد با اختصاص ۱۰ میلیارد یورو بودجه عمومی و جذب ۲۰ میلیارد یورو سرمایه خصوصی، زیرساختی عظیم شامل هفت گیگافکتوری هوش مصنوعی ایجاد کند.

🧠 ‏ تحلیلگران معتقدند این حجم از سرمایه‌گذاری در مقایسه با استانداردهای جهانی بسیار محدود است. برای مقایسه، غول‌های فناوری از سال ۲۰۲۳ تاکنون بیش از یک تریلیون دلار در زیرساخت‌های هوش مصنوعی هزینه کرده‌اند که حدود ۱۰۰ برابر بودجه کل اتحادیه اروپا محسوب می‌شود.

📊 ‏ نکته چالش‌برانگیز این است که تامین سخت‌افزار و تراشه‌های موردنیاز این پروژه‌ها نیز به شرکت‌های آمریکایی مانند Nvidia، AMD و Qualcomm وابسته است.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#حاکمیت_تکنولوژیک #گیگافکتوری
@DataPlusScience_linkedin_7486816799527886848_01.pdf
1.4 MB
🤖 ارتقای ۱۰۰۰ برابری هوش مصنوعی با مهندسی گراف

🧠 ‏ استفاده از یک چرخه بازخوردِ ساده برای بهبود مدل‌های هوش مصنوعی، شروع خوبی است؛ اما متخصصان Anthropic معتقدند با اتصال Agentها به یک گراف دانش (Knowledge Graph)، می‌توان کارایی سیستم‌های هوشمند را تا ۱۰۰۰ برابر افزایش داد. در این معماری، گراف نه تنها حافظه مشترک را فراهم می‌کند، بلکه منبع حقیقت برای ارزیابی خروجی‌هاست.

‏ این رویکرد در ۶ گام کلیدی پیاده می‌شود: ایجاد یک حلقه خوداصلاحگر (تولید، نقد، بازبینی)، افزودن ابزارهای جانبی، اجرای موازی Agentها در محیط‌های ایزوله، ثبت یافته‌ها به‌صورت Node و Edgeهای تایپ‌شده، و در نهایت استفاده از گراف برای Ground کردن ارزیاب‌ها به‌جای قضاوت‌های کیفیِ صرف.

🚀 ‏ برخلاف مدل‌های سنتی، گراف در این سیستم با هر نشست پاک نمی‌شود و با ذخیره Provenance (سابقه و منشأ داده)، اجازه می‌دهد هر ادعا به منبع آن متصل شود.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Graph_Engineering #Agentic_Systems
1
📊 راهنمای کاربردی انتخاب مدل برای تسک‌های تخصصی

🚀 ‏ بررسی‌های گسترده روی ۹ مدل پیشرو با اجرای ۱۴ دور تست و تحلیل ۱۰۵ باگ پنهان، استراتژی‌های بهینه‌ای را برای انتخاب مدل مشخص کرده است. برای تحلیل‌های قضاوتی، استراتژی‌های پیچیده و سناریوهای مدیریتی، مدل Fable 5 عملکرد درخشانی دارد و گزینه اصلی برای چنین تسک‌هایی است.

‏ در زمینه توسعه فرانت‌اند، مدل Opus 5 بهترین انتخاب عملیاتی است و Kimi K3 در جایگاه دوم قرار می‌گیرد. همچنین برای تولید محتوای متنی با کیفیت بالا، استفاده از Opus 5 همچنان انتخاب برتر متخصصان است.

🧠 ‏ برای تسک‌های برنامه‌نویسی و دیباگ، مدل Luna با حداکثر توان بهترین عملکرد را دارد و پس از آن Sol و Grok 4.5 در اولویت‌های بعدی هستند. جالب است بدانید Luna موفق شد ۳۳ مورد از ۱۰۵ باگ را با هزینه بسیار مقرون‌به‌صرفه ۱.۸ دلاری رفع کند.

💰 ‏ در مقابل، مدل Fable 5 با وجود دقت بالا در سناریوهای پیچیده، برای رفع ۲۹ باگ هزینه‌ای معادل ۱۰۴.۴۹ دلار تحمیل کرد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#Fable_5 #Luna
🧩 معماری ۹ لایه سیستم‌های RAG در سال ۲۰۲۶

‏ برای ساخت اپلیکیشن‌های هوش مصنوعی که واقعاً در محیط عملیاتی کار می‌کنند، اتکا به روش‌های ساده مانند اتصال مدل به یک دیتابیس برداری کافی نیست. تسلط بر ۹ لایه اصلی در استک فنی RAG برای جلوگیری از شکست سیستم در شرایط واقعی ضروری است.

🧠 ‏ این لایه‌ها شامل موارد زیر هستند
‏لایه ۰ (استقرار) برای مدیریت تاخیر و هزینه، لایه ۱ (ارزیابی) جهت شناسایی پاسخ‌های نادرست پیش از عرضه، لایه ۲ (LLMs) به‌عنوان هسته هوشمند، و لایه ۳ (فریم‌ورک) برای مسیریابی کوئری‌ها. در سطوح بعدی، لایه ۴ (VectorDB) مقیاس‌پذیری بازیابی، لایه ۵ (Embedding) تبدیل داده به اعداد ریاضی، و لایه ۶ (استخراج داده) کیفیت ورودی را تضمین می‌کنند.

🚀 ‏ در نهایت، لایه ۷ (حافظه) تعاملات بین جلسات را حفظ کرده و لایه ۸ (Alignment) با استفاده از Guardrails و سیستم‌های رهگیری، از خروجی‌های نامطلوب پیشگیری می‌کند.

🔗lnkd.in

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#RAG_Tech_Stack #Agentic_Layers
🤖 ظهور رقیب اقتصادی با مدل DeepSeek V4 Flash 0731

‏در حالی که غول‌های تکنولوژی برای دسترسی به مدل‌های پیشرفته مبالغ سنگینی دریافت می‌کنند، شرکت چینی دیپ‌سیک با عرضه DeepSeek V4 Flash 0731 استراتژی بازار را تغییر داده است. این مدل جدید در پلتفرم Artificial Analysis امتیاز ۵۰ را کسب کرده که تنها یک واحد با مدل‌های رده‌بالای بازار فاصله دارد.

‏ عملکرد فنی این مدل با ۲۸۴ میلیارد پارامتر و بهره‌گیری از معماری MoE (مدل متشکل از متخصصان هوشمند) همراه است که تنها ۱۳ میلیارد پارامتر را در هر لحظه فعال می‌کند. این طراحی بهینه‌شده باعث شده تا مدل در مقایسه با نسخه قبلی، حدود ۱۲ درصد توکن کمتری برای خروجی‌های مشابه مصرف کند.

📊 ‏ قیمت‌گذاری این مدل بسیار رقابتی است؛ هزینه هر میلیون توکن ورودی تنها ۰.۱۴ دلار و خروجی ۰.۲۸ دلار تعیین شده است. با استفاده از قابلیت کش، این هزینه به ۰.۰۰۲۸ دلار کاهش می‌یابد که نسبت به سرویس‌های مشابه غربی، تا ۶۰ درصد صرفه‌جویی در پروژه‌های API به همراه دارد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#DeepSeek_V4_Flash #Terminal_Bench
🔬 تفاوت ایده‌پردازی LLMها با محققان انسانی

🧠 ‏ مطالعه جدید دانشگاه‌های Yale و Chicago نشان می‌دهد که تفاوت اصلی مدل‌های زبانی بزرگ (LLM) با پژوهشگران انسانی در «دامنه» ایده‌های تولیدی است، نه کیفیت آن‌ها. محققان با تحلیل ۱۱۶۸۳ مقاله علمی و استفاده از دانش پیشین مشابه، مسیر ایده‌پردازی هوش مصنوعی و انسان‌ها را مقایسه کردند.

📊 ‏ نتایج نشان داد ایده‌های انسانی تنوع گسترده‌ای دارند که شامل تبیین مکانیزم‌ها، انجام تست‌های شکست و توسعه سیستم‌های جدید می‌شود. در مقابل، مدل‌های زبانی تمایل شدیدی به اتصال قطعات جداگانه از تحقیقات پیشین دارند و دامنه خلاقیت آن‌ها در مقایسه با انسان، محدودتر است.

‏ آمارها حاکی از آن است که در حالی که تنها ۱۲.۱٪ از ایده‌های انسانی بر پیوند دادن تحقیقات گذشته متمرکز بود، این رویکرد در ایده‌های تولید شده توسط مدل‌ها بین ۴۷.۱٪ تا ۶۴.۲٪ از مواقع مشاهده شد.

📊 DataScience 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما


#LLM #ایده