Data elites
1.33K subscribers
26 photos
12 videos
39 files
126 links
📉 به نام خالق داده و الگوریتم📈
😁ما یه تیم خوش ذوق و خلاق از دانشجوهای آماری هستیم😁
ورودتون به دنیای علم داده رو خوش آمد میگیم😇
برای ارتباط با ادمین به آی دی زیر پیام بدید
@dataelite
ارتباط با پیام داخلی کانال:
https://t.me/dataelites?direct
Download Telegram
📄 شنبه‌های Data Elites را با یک مقاله تازه و متفاوت شروع می‌کنیم!
🚨 آیا Claude Code دارد مرز بین زبان‌های برنامه‌نویسی را از بین می‌برد؟
پژوهشگران فعالیت بیش از ۵ هزار برنامه‌نویس GitHub و میلیون‌ها تغییر کد را بررسی کردند و به نتیجه جالبی رسیدند:
بعد از شروع استفاده از Claude Code، برنامه‌نویس‌ها سراغ زبان‌هایی رفتند که قبلاً تقریباً با آن‌ها کار نمی‌کردند.
یعنی شاید یک برنامه‌نویس Python بتواند بدون تسلط کامل بر Rust، Swift یا Go، با کمک یک AI Agent پروژه‌ای واقعی در آن زبان‌ها بسازد.
اما یک سؤال مهم باقی می‌ماند:
آیا Claude واقعاً مهارت برنامه‌نویس را بیشتر می‌کند، یا فقط فاصله میان ایده و اجرای کد را کوتاه‌تر کرده است؟
شاید آینده برنامه‌نویسی متعلق به کسی نباشد که همه زبان‌ها را بلد است؛
بلکه متعلق به کسی باشد که بداند چطور هوش مصنوعی را درست هدایت، بررسی و اصلاح کند. 👨‍💻🤖
📄 Agentic Delegation and the Language Frontier of Software Developers
🔗 https://arxiv.org/pdf/2605.25438
🥰2🔥1
🎲 هوش مصنوعی فقط نباید پیش‌بینی کند؛ باید بداند چقدر می‌تواند به پیش‌بینی خودش اعتماد کند!
موضوع این هفته‌ی یکشنبه‌های Data Elites یکی از مهم‌ترین پایه‌های آمار، علم داده و AI است:
احتمال؛ زبان مدل‌ها برای فهم عدم‌قطعیت
چهار منبع رایگان انتخاب کردیم؛ دو مسیر نظری برای یادگیری عمیق مفاهیم و دو مسیر کاربردی برای دیدن احتمال در حل مسئله و Machine Learning🚀

🎯 مسیر نظری فارسی
آمار و احتمال مهندسی — دکتر محمدمهدی نایبی، دانشگاه صنعتی شریف ( دانشگاه صنعتی آریا مهر )
دوره‌ای کامل از اصول احتمال، بیز و متغیرهای تصادفی تا توزیع‌های مشترک، امید شرطی، انواع همگرایی، قانون اعداد بزرگ و قضیه حد مرکزی.
🔗 لینک

📊 مسیر جدید و مسئله‌محور فارسی
آمار و احتمال مهندسی — دکتر فرید آشتیانی مفرد طهرانی، دانشگاه صنعتی شریف ( دانشگاه صنعتی آریا مهر )
دوره‌ای مربوط به بهار ۱۴۰۵ با رویکرد مهندسی و حل مسئله؛ مناسب دانشجویان کامپیوتر، برق، Data Science و AI، این مجموعه دست‌کم تا جلسه ۲۵ به‌صورت رایگان منتشر شده است
🔗 لینک
🇬🇧 مسیر نظری انگلیسی — 2026
STATS 100A: Introduction to Probability — UCLA
یک دوره کامل از فضای احتمال، شمارش و بیز تا توزیع‌های مشترک، امید شرطی، Monte Carlo، قانون اعداد بزرگ و قضیه حد مرکزی؛ همراه با تمرین و شبیه‌سازی‌های Python
🔗 دوره و منابع
🔗 ویدئوهای Summer 2026

مسیر کاربردی و پیشرفته انگلیسی — 2026
CMPT 727: Statistical Machine Learning — Simon Fraser University
یک دوره برای ورود جدی‌تر به Probabilistic Machine Learning؛ شامل Maximum Likelihood، EM، Bayesian Networks، Markov Random Fields، MCMC، Variational Inference و Causal Inference. این دوره برای کسانی مناسب است که مبانی احتمال و یادگیری ماشین را از قبل می‌دانند.
🔗 صفحه کامل دوره
🔗 ویدئوهای دوره

🎁 منبع تکمیلی فارسی
ویدئوهای رایگان دوره دکتر علی شریفی زارچی دیگر در دسترس نیستند؛ اما مخزن عمومی دوره شامل Notebookهای زبان R، تمرین‌ها، آزمون‌ها و سیلابس همچنان باقی مانده است
🔗https://github.com/SharifiZarchi/Probability_Statistics

💡 مسیر پیشنهادی DE:
اگر احتمال را از پایه شروع می‌کنید:
دکتر نایبی برای ساختن پایه نظری
⬇️
دکتر آشتیانی برای حل مسئله و تثبیت مفاهیم
⬇️
UCLA STATS 100A برای مرور انگلیسی و شبیه‌سازی با Python
⬇️
CMPT 727 برای ورود به Probabilistic Machine Learning
در کنار این مسیر هم از مخزن دکتر شریفی زارچی برای تمرین‌ها و پیاده‌سازی با R استفاده کنید. 🚀
🔥21😍1
🎯 دوشنبه‌های Data Elites | مدل فقط پیش‌بینی نکند؛ بگوید چقدر مطمئن است!
فرض کنید یک مدل می‌گوید:
🏠 قیمت خانه: ۵ میلیارد
📈 فروش ماه آینده: ۱۰ هزار واحد
🩺 بیمار: پرریسک
اما سؤال مهم‌تر این است:
چقدر می‌توان به این پیش‌بینی اعتماد کرد؟
اینجاست که MAPIE وارد می‌شود؛ یک کتابخانه متن‌باز Python برای Conformal Prediction و Uncertainty Quantification که کمک می‌کند به‌جای یک پیش‌بینی خشک، عدم‌قطعیت مدل را هم ببینیم.
مثلاً به‌جای اینکه مدل فقط بگوید:
قیمت خانه = ۵ میلیارد
می‌تواند بگوید:
قیمت احتمالی با پوشش ۹۰٪ بین ۴.۳ تا ۵.۸ میلیارد تومان است.
MAPIE برای مسائل مختلفی مثل:
🔹 Regression
🔹 Classification
🔹 Time Series
🔹 Prediction Intervals
🔹 Prediction Sets
🔹 Calibration & Risk Control
قابل استفاده است.
نسخه جدید MAPIE 1.5.0 هم قابلیت‌های تازه‌ای در زمینه Conditional Conformal Prediction، Quantile Regression، Calibration و Risk Control اضافه کرده؛ یعنی ابزار دارد جدی‌تر وارد دنیای Trustworthy Machine Learning می‌شود.
و این دقیقاً همان چیزی است که در پروژه‌های واقعی اهمیت دارد:
یک مدل خوب فقط جواب نمی‌دهد؛ باید بتواند بگوید این جواب چقدر قابل اعتماد است

🔗 GitHub
🎞 YouTube
2❤‍🔥2
Audio
🎙 اولین اپیزود پادکست Data Elites منتشر شد!
برای شروع سه‌شنبه‌های DE رفتیم سراغ یکی از بهترین نقطه‌های شروع برای ورود جدی به Machine Learning:
فصل دوم کتاب An Introduction to Statistical Learning.
اما قبل از ورود به فصل دوم، یک مرور کوتاه و کاربردی از فصل اول هم داریم و مفاهیم اصلی Statistical Learning بشیم.
در ادامه، قدم‌به‌قدم می‌ریم سراغ مفاهیمی که پایه‌ی بخش بزرگی از این مسیر رو می‌سازن:
🔹 Prediction و Inference
🔹 Model Flexibility
🔹 Training vs Test Error
🔹 Overfitting
🔹 Bias–Variance Trade-Off
🔹 Regression و Classification
🔹 KNN
اگر تازه می‌خواید این مسیر رو شروع کنید، این اپیزود می‌تونه نقطه شروع خیلی خوبی باشه؛ چون از یک جمع‌بندی کوتاه از فصل اول شروع می‌کنیم و بعد وارد Chapter 2 — Statistical Learning می‌شیم تا مفاهیم کم‌کم کنار هم قرار بگیرن و تصویر بزرگ Statistical Learning ساخته بشه.
📚 Chapter 1 — Quick Review
📘 Chapter 2 — Statistical Learning
🎧 اولین اپیزود پادکست Data Elites
و اگر هنوز کتاب رو ندارید، می‌تونید نسخه رسمی و رایگان کتاب رو از لینک زیر دانلود کنید:
[لینک دانلود کتاب]
👎3❤‍🔥2👏2
🚨 یک تراکنش بزرگ همیشه Anomaly نیست.
برای چهارشنبه‌های Data Elites، زهرا اسفندیار یک پروژه کامل برای تشخیص ناهنجاری در داده‌های تراکنشی طراحی کرده؛ پروژه‌ای که از ساخت دیتاست واقعی‌نما شروع می‌شود و تا پیاده‌سازی یک Alert Engine پیش می‌رود.
در این پروژه بیش از 80 هزار تراکنش و 5 هزار مشتری حقیقی و حقوقی بررسی می‌شوند و ناهنجاری‌ها فقط بر اساس مبلغ تشخیص داده نمی‌شوند؛ بلکه Context هر تراکنش مثل رفتار تاریخی مشتری، زمان، موقعیت، Merchant و Channel هم وارد تحلیل می‌شود.
برای Detection از ترکیب PELT، CAPA، PyOD / Isolation Forest و TimeSeriesOD استفاده شده تا انواع مختلف ناهنجاری، از Level Shift تا الگوهای چندمتغیره، شناسایی شوند.
🎯 ایده اصلی پروژه:
Anomaly یعنی رفتاری که با الگوی معمول خودش سازگار نیست؛ نه صرفاً یک عدد بزرگ

💻 کد کامل پروژه و Notebookها:نیست؛ نه صرفاً یک عدد بزرگ.
https://github.com/Zahra-Esfandiar/Context-Aware-Transaction-Anomaly-Detection.git
❤‍🔥3🥰1
📊 پنجشنبه‌های DE | دیتاست هفته
اگر می‌توانستی کل دنیای پژوهش را مثل یک دیتاست تحلیل کنی، دنبال چه چیزی می‌گشتی؟ 👀
این هفته سراغ OpenAlex رفتیم؛ یک کاتالوگ باز از دنیای پژوهش که صدها میلیون مقاله و اثر علمی را به نویسندگان، دانشگاه‌ها، ژورنال‌ها، موضوعات پژوهشی، ناشران و منابع مالی پژوهش متصل می‌کند.
و اینجاست که ماجرا جذاب می‌شود؛ چون با این داده‌ها می‌توانی سؤال‌هایی را بررسی کنی که واقعاً ارزش تحلیل دارند:
🔹 کدام حوزه‌های AI و Data Science سریع‌تر در حال رشدند؟
🔹 چه موضوعاتی تازه دارند وارد جریان اصلی پژوهش می‌شوند؟
🔹 کدام دانشگاه‌ها در یک حوزه خاص بیشترین خروجی پژوهشی را دارند؟
🔹 شبکه همکاری بین پژوهشگران و کشورها چه شکلی است؟
🔹 کدام مقاله‌ها بیشترین تأثیر و citation را داشته‌اند؟
🔹 روند انتشار مقالات یک حوزه طی ۱۰ یا ۲۰ سال گذشته چطور تغییر کرده؟
حتی می‌توانی یک قدم جلوتر بروی و پروژه‌هایی مثل:
🎓 University & Professor Finder برای اپلای
📈 Research Trend Detector
🌍 Scientific Collaboration Network
🔥 Emerging Research Topics Dashboard
بسازی.
OpenAlex فقط یک فایل برای دانلود نیست؛ API رسمی هم دارد، بنابراین می‌توانی مستقیماً با Python یا R داده‌ها را بر اساس موضوع، دانشگاه، نویسنده، سال انتشار و فیلترهای مختلف دریافت کنی.
یعنی به‌جای اینکه فقط مقاله بخوانی، می‌توانی خودِ اکوسیستم پژوهش را تحلیل کنی. 🚀
🔗 OpenAlex:
https://openalex.org
🔥3🤝1
🚀 جمعه‌های DE | این هفته در دنیای Data & AI چه گذشت؟
قبل از اینکه هفته را ببندیم، بریم سراغ چند اتفاق مهمی که این هفته ارزش دنبال‌کردن داشتند 👇
📰 Top News | OpenAI
OpenAI در ۶ آگوست نسخه GPT-5.6 Sol را در ChatGPT بهبود داد و دسترسی کاربران رایگان به GPT-5.6 Luna را هم گسترش داد.
🛠 Best Tool | Positron
این هفته Posit چند آپدیت جذاب برای اکوسیستم Data Science منتشر کرد:
Posit Assistant رسماً به مرحله General Availability رسید
• فایل‌های Excel (.xlsx) حالا مستقیماً داخل Data Explorer باز و بررسی می‌شوند
• Notebook Editor در Positron تجربه یکپارچه‌تری برای Jupyter، Python و R فراهم می‌کند
برای کسانی که با R و Python کار می‌کنند، Positron دارد جدی‌تر از قبل تبدیل به یک محیط کامل Data Science می‌شود.
📄 Top Paper
یکی از مقاله‌های تازه و جذاب این هفته:
Optimal Inference with Black-box Predictions
مقاله‌ای از پژوهشگرانی از جمله Larry Wasserman و Edward Kennedy درباره اینکه چگونه می‌توان از پیش‌بینی‌های Black-box در استنباط آماری استفاده کرد، بدون اینکه اعتبار آماری تحلیل قربانی شود.
موضوعی دقیقاً در مرز:
Statistics × Machine Learning × Reliable AI
🤖 AI Highlight | GitHub Copilot
GitHub Copilot برای JetBrains این هفته دو قابلیت جالب گرفت:
Persistent Memory برای حفظ Context بین تعاملات
• پشتیبانی از Ollama برای استفاده از مدل‌های Local
یعنی امکان ترکیب Copilot با مدل‌هایی که مستقیماً روی سیستم خودتان اجرا می‌شوند.
⚡️ و یک اتفاق دیگر:
مدل MAI-Code-1.1-Flash مایکروسافت هم وارد GitHub Copilot شد؛ مدلی سبک‌تر برای Coding که علاوه بر Tool Use، از ورودی تصویری هم پشتیبانی می‌کند.
📌 جمع‌بندی این هفته؟
مرز بین محیط برنامه‌نویسی، ابزار تحلیل داده و AI Agent دارد هر هفته کم‌رنگ‌تر می‌شود.
از Positron برای تحلیل داده تا Copilot با حافظه و مدل Local؛
ابزارهایی که قبلاً فقط «کمک‌برنامه‌نویس» بودند، کم‌کم دارند بخشی از Workflow واقعی Data Scientistها می‌شوند.
🗞 جمعه‌های Data Elites
مرور کوتاه چیزهایی که این هفته ارزش دانستن داشتند.
🔥2👏2👎1
📄 شنبه‌های Data Elites را با یک مقاله تازه و واقعاً جالب شروع می‌کنیم!
🤖 این بار AI قرار نیست فقط مقاله بخواند یا خلاصه کند؛
قرار است نتیجه پژوهش را دوباره آزمایش کند.
در مقاله جدید Training AI Scientists to Replicate Research، پژوهشگران سیستمی به نام Faraday معرفی کرده‌اند؛ یک AI Scientist که مقاله علمی را می‌خواند، آزمایش‌ها را بازسازی می‌کند و تلاش می‌کند نتایج پژوهش را مستقل از نویسندگان اصلی بازتولید کند.
برای ارزیابی آن هم benchmark بزرگی به نام Replica ساخته شده: 🧪 ۳۱۰ مسئله بازتولید
📚 از ۱۰۰ مقاله Machine Learning و AI for Science
نکته جذاب‌تر؟
Faraday برای کدنویسی از Codex کمک می‌گیرد؛ یعنی یک AI نقش پژوهشگر را دارد و AI دیگری نقش برنامه‌نویس پژوهش را. 🔥
شاید آینده AI در علم فقط «تولید مقاله» نباشد؛
بلکه بررسی این باشد که کدام نتیجه علمی واقعاً قابل تکرار است.
📄 Training AI Scientists to Replicate Research
🔗 https://arxiv.org/abs/2608.13331
2🥰2👍1🔥1
Data elites
🎲 هوش مصنوعی فقط نباید پیش‌بینی کند؛ باید بداند چقدر می‌تواند به پیش‌بینی خودش اعتماد کند! موضوع این هفته‌ی یکشنبه‌های Data Elites یکی از مهم‌ترین پایه‌های آمار، علم داده و AI است: احتمال؛ زبان مدل‌ها برای فهم عدم‌قطعیت چهار منبع رایگان انتخاب کردیم؛ دو مسیر…
🔥 دوره آمار و احتمال دکتر علی شریفی زارچی؛ وقتی تئوری به R و تحلیل داده وصل می‌شود

اگر در مسیر Data Science، Machine Learning یا AI هستید، احتمال و آمار فقط یک درس دانشگاهی نیست؛ بخش مهمی از منطق پشت مدل‌ها، عدم‌قطعیت و استنباط داده‌هاست.

این دوره از دکتر علی شریفی زارچی، مدتی در مکتب‌خونه در دسترس بود، اما حالا از آنجا حذف شده.
ما ویدئوهای دوره را دوباره پیدا کردیم و برای بچه‌های Data Elites یک‌جا جمع کردیم تا این منبع ارزشمند از دسترس خارج نشود. 🔥

در این دوره مباحثی مثل:

🔹 احتمال شرطی و قضیه بیز
🔹 متغیرهای تصادفی و توزیع‌ها
🔹 امید، واریانس و قضیه حد مرکزی
🔹 برآورد و Maximum Likelihood
🔹 فاصله اطمینان و آزمون فرض
🔹 رگرسیون
🔹 استنباط بیزی

را قدم‌به‌قدم دنبال می‌کنید.

نقطه جذاب‌تر اینکه دوره فقط تئوری نیست؛ Notebookهای R، تمرین‌ها و منابع تکمیلی هم در دسترس‌اند تا مفاهیم را روی داده و با کد دنبال کنید.

🎥 ویدئوهای کامل دوره:
[لینک ویدئوها]

💻 تمرین‌ها و Notebookهای R:
https://github.com/SharifiZarchi/Probability_Statistics

📌 اگر قبلاً دنبال این دوره بودید و دیدید دیگر در مکتب‌خونه نیست، این پست را ذخیره کنید؛ براتون پیداش کردیم. 🚀
14👎10🤩2❤‍🔥1👍1🔥1
⚙️ مدل‌های Machine Learning دقیقاً چطور «یاد می‌گیرند»؟ جوابش تا حد زیادی در بهینه‌سازی است!
بعد از جبر خطی و احتمال، در این قسمت از یکشنبه‌های Data Elites می‌ریم سراغ ضلع سوم ریاضیات Data و AI:
Optimization | بهینه‌سازی
از Gradient Descent و Regularization گرفته تا آموزش شبکه‌های عصبی، تقریباً پشت هر مدل یادگیری یک مسئله بهینه‌سازی وجود دارد.
برای این هفته چهار منبع فارسی و انگلیسی انتخاب کردیم؛ از پایه نظری تا Optimization for Machine Learning.🚀
مسیر نظری فارسی
بهینه‌سازی خطی — دکتر مجید سلیمانی دامنه | دانشگاه تهران
برای ساختن پایه ریاضی Optimization؛ مناسب برای یادگیری مدل‌سازی، ساختار مسائل بهینه‌سازی خطی و منطق ریاضی پشت روش‌های حل.
🔗 ویدئوها:
[لینک دوره]
مسیر کاربردی فارسی
Optimization در دوره Machine Learning — دکتر علی شریفی زارچی
برای بخش Optimization در ML:
Gradient Descent
Adam
Newton Algorithm
Regularization
Lasso & Ridge
اگر می‌خواهید ببینید بهینه‌سازی واقعاً کجای Machine Learning وارد می‌شود، این بخش از دوره انتخاب خیلی خوبی است؛ از Gradient Descent تا Newton، Adam و Regularization
🔗 ویدئوها:
[لینک دوره]
مسیر نظری انگلیسی — 2025
EE5606: Convex Optimization — IIT Hyderabad
یک دوره دانشگاهی برای یادگیری جدی Convex Sets & Functions، Unconstrained/Constrained Optimization، Lagrange Multipliers و KKT؛ همراه با Python، CVXPY و تمرین‌های برنامه‌نویسی.
🔗
https://people.iith.ac.in/shashankvatedka/html/courses/2025/EE5606/course_details.html
مسیر کاربردی انگلیسی — 2025
CS769: Optimization in Machine Learning — IIT Bombay
اینجا Optimization مستقیماً وارد Machine Learning می‌شود:
🔹 Gradient & Proximal Methods
🔹 Accelerated Optimization
🔹 Newton & Quasi-Newton
🔹 Duality
🔹 Discrete & Submodular Optimization
🔹 Feature Selection
🔹 Data Subset Selection
🔹 Model Compression
🔗 دوره و منابع:
https://www.cse.iitb.ac.in/~ganesh/cs769/
🔗 ویدئوهای دوره:
https://www.youtube.com/playlist?list=PLyo3HAXSZD3y-tdFpfw8CZcIG-rJ6ckn9
💡 مسیر پیشنهادی DE:
دکتر سلیمانی دامنه → ساختن پایه Optimization
⬇️
EE5606 → یادگیری عمیق‌تر Convex Optimization
⬇️
دکتر شریفی زارچی → دیدن Optimization در قلب ML
⬇️
CS769 → ورود جدی به Optimization for Machine Learning
🚨 مدل بدون Optimization فقط یک ساختار ریاضی است؛ بهینه‌سازی همان چیزی است که به مدل یاد می‌دهد پارامترهایش را چگونه پیدا کند.
📚 یکشنبه‌های Data Elites؛ از ریاضیات پشت مدل‌ها تا کاربرد واقعی آن‌ها 🚀g
2❤‍🔥2👎2👏1
🚨 پژوهشگرها و بچه‌های Data Science، این ابزار رو از دست ندین!
تصور کن یک محیط داشته باشی که مسئله پژوهشی‌ات رو بهش بدی و خودش بتونه:
🐍 کد Python اجرا کنه
📊 تحلیل‌های R انجام بده
📚 مقاله و منبع علمی پیدا کنه
🌐 وب و دیتابیس‌های پژوهشی رو بگرده
📈 جدول و نمودار بسازه
📝 گزارش پژوهشی تولید کنه
🔍 و حتی مسیر رسیدن به هر نتیجه رو قابل‌ردیابی نگه داره
اسم این پروژه Open Science هست؛ یک AI Research Workbench متن‌باز و Local-first برای انجام کارهای پژوهشی و تحلیلی.
قسمت جذاب‌تر؟ 👀
Open Science به مجموعه‌ای از منابع علمی مثل PubMed، bioRxiv، Clinical Trials، ChEMBL و دیتابیس‌های ژنتیکی و Omics متصل می‌شود و Scientific Skillهای آماده‌ای برای کارهایی مثل Literature Review و تحلیل‌های محاسباتی هم دارد.
یعنی به‌جای اینکه مدام بین:
ChatGPT + RStudio + Python + مرورگر + مقاله‌ها + دیتابیس‌های مختلف
جابه‌جا بشی، می‌تونی بخش بزرگی از Workflow پژوهشت رو داخل یک محیط واحد مدیریت کنی. 🔥
🔐 Local-first
💻 Windows / macOS / Linux
🌱 Open Source
🤖 مناسب Research + Data Analysis + AI
و مهم‌تر اینکه پروژه هنوز کاملاً فعال و در حال توسعه است؛ نسخه 0.16.0 آن 16 آگوست ۲۰۲۶ منتشر شده.
اگر دانشجو، پژوهشگر یا Data Scientist هستی، این یکی واقعاً ارزش Save و امتحان‌کردن داره 👀
🔗 GitHub:
https://github.com/aipoch/open-science
🌐 Website:
https://www.aipoch.com/open-science
❤‍🔥1🔥1
Audio
🎙 اپیزود دوم پادکست Data Elites منتشر شد!
بعد از اینکه در قسمت اول با پایه‌های Statistical Learning آشنا شدیم، این بار می‌ریم سراغ اولین مدل جدی مسیر:
📘 Chapter 3 — Linear Regression
از کتاب An Introduction to Statistical Learning
در این اپیزود، رگرسیون خطی رو از صفر و مفهومی پیش می‌بریم؛ از اینکه ضرایب مدل واقعاً چه معنایی دارن تا این‌که چطور بفهمیم یک مدل قابل اعتماد هست یا نه.
قراره درباره این مفاهیم صحبت کنیم:
🔹 Simple & Multiple Linear Regression
🔹 Least Squares و Residuals
🔹 Confidence Interval و p-value
🔹 R² و تفسیر درستش
🔹 Prediction vs Inference
🔹 Interaction Effects
🔹 Multicollinearity و VIF
🔹 Model Diagnostics و خطاهای رایج مدل
این اپیزود فقط درباره «کشیدن یک خط روی داده‌ها» نیست؛
قراره بفهمیم Linear Regression واقعاً چطور فکر می‌کنه و چطور باید درست تفسیرش کنیم. 🧠
🎧 اگر قسمت اول پادکست DE درباره Chapter 2 رو هنوز گوش ندادید، بهتره اول از اون شروع کنید:
🔗 لینک قسمت اول: [لینک اپیزود اول]
کتاب رو باز کنید، هدفون رو بذارید و بریم سراغ Linear Regression🎧📚
❤‍🔥3👏1🤩1
Please open Telegram to view this post
VIEW IN TELEGRAM
🛡️ چهارشنبه‌های Data Elites | این هفته به‌جای معرفی پروژه، خودمون یکی ساختیم: DataGuard Agent
از اول ایده‌ی چهارشنبه‌های DE این بود که فقط درباره‌ی Data Science حرف نزنیم؛
چیز واقعی بسازیم، تست کنیم و منتشر کنیم.
این هفته خروجی‌مون شد DataGuard Agent؛ یک Agent برای اینکه قبل از Train کردن مدل، دیتاست واقعی رو Audit کنه و جواب بده:
آیا این داده واقعاً آماده‌ی Machine Learning هست؟
DataGuard روی CSV، Excel و Parquet کار می‌کنه و مواردی مثل Missing Value، Duplicate، Target Leakage، Class Imbalance، Split نامناسب، Data Drift و Schema Drift رو بررسی می‌کنه و در نهایت یک ML Readiness Report می‌سازه.
بخش جذاب‌تر پروژه اینه که می‌تونید Gemini API رو هم بهش وصل کنید تا در نقش یک AI Reviewer خروجی Audit رو بررسی کنه، مشکلات مهم‌تر رو اولویت‌بندی کنه و درباره‌شون توضیح بده.
البته خودِ تشخیص مشکلات به LLM سپرده نشده؛ اول Audit واقعی انجام می‌شه و AI روی شواهد استخراج‌شده تحلیل می‌ده.
Detect deterministically. Explain with AI. 🛡️
🚀 اجرای پروژه در Windows هم خیلی ساده‌ست:
1. Repo رو Clone یا Download کنید
2. install_windows.bat رو اجرا کنید
3. run_windows.bat رو اجرا کنید
4. دیتاست رو Upload کنید
5. Target / ID / Time رو در صورت نیاز انتخاب کنید
6. Run DataGuard Audit
🔗 GitHub:
github.com/Zahra-Esfandiar/DataGuard-Agent
اگر پروژه براتون مفید بود، با یک Star ازش حمایت کنید؛
و اگر ایده‌ای برای نسخه‌های بعدی دارید، خوشحال می‌شم پیشنهادتون رو بشنوم.
چهارشنبه‌های DE قراره دقیقاً همین باشه: کمتر معرفی، بیشتر ساختن 🚀
طراح و توسعه دهنده : زهرا اسفندیار
3🥰2❤‍🔥1
Please open Telegram to view this post
VIEW IN TELEGRAM
🌍 پنجشنبه‌های DE | دیتاست هفته
دنیا هر ۱۵ دقیقه یک دیتاست جدید می‌شود! 👀
جنگ، اعتراض، مذاکره، بحران، روابط بین کشورها، اتفاقات اقتصادی و حتی لحن رسانه‌ها نسبت به یک موضوع...
همه‌ی این‌ها می‌توانند تبدیل به داده قابل تحلیل شوند.
این هفته سراغ GDELT رفتیم؛ یکی از جذاب‌ترین منابع داده برای تحلیل رویدادهای جهانی.
داده‌های رویداد GDELT از سال ۱۹۷۹ تا امروز را پوشش می‌دهند و به‌صورت مداوم، تقریباً هر ۱۵ دقیقه به‌روزرسانی می‌شوند.
حالا با این حجم از داده چه کار می‌شود کرد؟ 👇
🗺 ساخت نقشه زنده رویدادهای جهان
📈 شناسایی افزایش ناگهانی اعتراض، بحران یا درگیری
📰 تحلیل تغییر لحن رسانه‌ها نسبت به یک کشور یا موضوع
🌍 مقایسه پوشش یک اتفاق در رسانه‌های کشورهای مختلف
🔗 بررسی ارتباط بین کشورها، افراد و سازمان‌ها با Network Analysis
🤖 ساخت پروژه‌های NLP، Event Detection و Anomaly Detection
📊 طراحی داشبوردهای تحلیلی با Python، R یا Power BI
قسمت جذاب‌تر ماجرا اینجاست:
GDELT فقط نمی‌گوید چه اتفاقی افتاده؛ با کمک ساختارهایی مثل Global Knowledge Graph می‌توان افراد، سازمان‌ها، مکان‌ها و موضوعات مرتبط با خبرها را هم به هم وصل کرد.
یعنی می‌توانی سؤال‌هایی مثل این را با داده واقعی بررسی کنی:
«تنش بین دو کشور در طول زمان چطور تغییر کرده؟»
یا حتی:
«قبل از یک بحران، آیا در الگوی خبرها و رویدادها نشانه‌ای دیده می‌شود؟» 👀
این فقط یک دیتاست برای تمرین نیست؛
بیش از چهار دهه از اتفاقات جهان، آماده‌ی تحلیل شدن است. 🌍📊
🔗 GDELT
https://www.gdeltproject.org/
🔥21😎1
🗞 جمعه‌های DE | این هفته در دنیای Data & AI چه گذشت؟ 🚀
یک هفته دیگر، چند اتفاق مهم در دنیای هوش مصنوعی، داده و یادگیری ماشین رقم خورد.
اما بین صدها خبر، کدام‌ها واقعاً ارزش دنبال کردن داشتند؟ 👇
🚨 1) AI Agentها؛ قدرت بیشتر، مسئولیت بیشتر
این هفته دوباره موضوع امنیت و کنترل Agentهای هوش مصنوعی به یکی از بحث‌های اصلی AI تبدیل شد.
هرچه Agentها از یک chatbot ساده فاصله می‌گیرند و توانایی:
🔹 اجرای کد
🔹 استفاده از ابزارها
🔹 دسترسی به داده‌ها
🔹 تصمیم‌گیری چندمرحله‌ای
را پیدا می‌کنند، یک سؤال مهم‌تر می‌شود:
چطور می‌توانیم به سیستم‌هایی اعتماد کنیم که خودشان تصمیم می‌گیرند؟
آینده AI فقط ساخت مدل‌های قوی‌تر نیست؛
ساخت سیستم‌هایی است که بتوانیم رفتارشان را ارزیابی، کنترل و پایش کنیم.
🔗 Reference:
https://www.axios.com/2026/08/19/openai-astra-safety-altman-anthropic
🧪 2) آیا AI می‌تواند یک پژوهشگر باشد؟
یکی از جذاب‌ترین پژوهش‌های اخیر:
📄 Training AI Scientists to Replicate Research
این مقاله بررسی می‌کند که آیا Agentهای هوش مصنوعی می‌توانند چرخه‌ای از کارهای پژوهشی را انجام دهند:
📚 خواندن مقاله
💻 اجرای کد
📊 بازتولید نتایج
🧠 تحلیل خروجی‌ها
این مسیر می‌تواند آینده همکاری انسان و AI در پژوهش را تغییر دهد.
اما چالش اصلی همچنان باقی است:
آیا AI فقط می‌تواند اجرا کند یا واقعاً می‌تواند «استدلال علمی» داشته باشد؟
🔗 Paper:
https://arxiv.org/abs/2608.13331
📄 3) مشکل جدید AI: چگونه پیشرفت را اندازه بگیریم؟
مدل‌های جدید هر روز بهتر می‌شوند، اما یک سؤال مهم‌تر مطرح شده:
آیا Benchmarkهای فعلی واقعاً توانایی مدل‌ها را اندازه می‌گیرند؟
مقاله:
Frontier AI Forecasting Has a Measurement Problem
نشان می‌دهد ارزیابی مدل‌های مرزی به دلیل تغییر داده‌ها، معیارها و روش‌های تست، روزبه‌روز پیچیده‌تر می‌شود.
یعنی در آینده فقط ساخت مدل مهم نیست؛
طراحی معیارهای ارزیابی درست هم یک مسئله تحقیقاتی بزرگ خواهد بود.
🔗 Paper:
https://arxiv.org/abs/2608.14903
🛠 4) Tool Highlight | SmolDocling
یکی از ابزارهای جذاب این هفته:
🤗 SmolDocling
یک مدل کوچک Vision-Language برای درک اسناد پیچیده.
کاربردها:
📄 PDFهای علمی
📊 استخراج جدول‌ها
🖼 تحلیل اسناد تصویری
📝 تبدیل Document به ساختار قابل استفاده
چرا مهم است؟
چون بخش بزرگی از داده‌های واقعی هنوز داخل فایل‌ها و اسناد قرار دارد، نه دیتابیس‌های تمیز.
🔗 Model:
https://huggingface.co/ibm-granite/granite-docling-258M
⭐️ 5) روند هفته | حرکت از مدل به سیستم
یکی از واضح‌ترین روندهای این هفته:
AI دیگر فقط یک مدل نیست.
مسیر جدید:
Model
⬇️
Agent
⬇️
Multi-Agent System
⬇️
Trusted AI Workflow
و برای Data Scientistهای نسل جدید، ترکیب این مهارت‌ها مهم‌تر از همیشه است:
📊 Statistics
🤖 Machine Learning
💻 Engineering
🔍 Evaluation
🚀 جمع‌بندی هفته
آینده AI فقط در ساخت مدل‌های بزرگ‌تر نیست؛
در ساخت سیستم‌هایی است که:
✔️ تصمیم می‌گیرند
✔️ ابزار استفاده می‌کنند
✔️ قابل ارزیابی هستند
✔️ قابل اعتماد باقی می‌مانند
🗞 جمعه‌های Data Elites
مرور مهم‌ترین اتفاقات Data و AI در یک نگاه
❤‍🔥21👏1
📄 شنبه‌های Data Elites را با یک مقاله جذاب از دنیای LLMها شروع می‌کنیم!
🚨 آیا ChatGPT می‌داند چه زمانی اشتباه می‌کند؟
مدل‌های زبانی بزرگ مثل ChatGPT، Claude و Gemini امروز می‌توانند پاسخ‌هایی شگفت‌انگیز تولید کنند؛ اما یک سؤال مهم هنوز باقی مانده:
چقدر می‌توان به پاسخ یک هوش مصنوعی اعتماد کرد؟
اینجاست که یک علم قدیمی اما حیاتی وارد میدان می‌شود: 📊 آمار و احتمال
در مقاله جدید:
📄 The Origins of Stochasticity: Comprehensive Investigations on Uncertainty Quantification for Large Language Models
پژوهشگران بررسی می‌کنند که چگونه می‌توان عدم‌قطعیت (Uncertainty) در LLMها را اندازه‌گیری کرد.
زیرا یک مدل هوش مصنوعی فقط نباید پاسخ بدهد؛ باید بتواند بگوید:
چقدر به این پاسخ اطمینان دارم؟
⚠️ چه زمانی احتمال اشتباه من بالاست؟
برای رسیدن به این هدف، مفاهیمی مثل:
🎲 توزیع‌های احتمالی
📈 کالیبراسیون مدل‌ها (Model Calibration)
📊 اندازه‌گیری عدم‌قطعیت
🔬 تحلیل آماری رفتار مدل
به قلب LLMها وارد می‌شوند.
این مقاله نشان می‌دهد پشت بسیاری از پیشرفت‌های جدید هوش مصنوعی، هنوز همان مفاهیم بنیادی آمار و احتمال قرار دارند.
شاید آینده AI فقط ساخت مدل‌های بزرگ‌تر نباشد؛
بلکه ساخت مدل‌هایی باشد که هم باهوش‌تر هستند و هم میزان ناآگاهی خودشان را می‌دانند. 🤖
📄 Paper of the Week
🔗 https://arxiv.org/abs/2606.22792
به‌نظر شما، آیا یک هوش مصنوعی قابل اعتماد باید فقط جواب بدهد یا باید میزان اطمینان خودش را هم اعلام کند؟
❤‍🔥3🔥1
🚀 خبر ویژه برای علاقه‌مندان Data Science و AI
📢 DataCamp Free Access Week برگشته!
از ۲۴ تا ۳۰ آگوست، دسترسی رایگان به بیش از ۷۰۰ دوره آموزشی، Career Track و Certification در DataCamp فعال می‌شود. 🎯
اگر دنبال تقویت مهارت‌های خودت در مسیر دیتا هستی، این فرصت می‌تواند زمان خوبی باشد برای شروع یا ادامه یادگیری در حوزه‌های:
🐍 Python
📊 R & Statistics
🗄 SQL
🤖 AI & Machine Learning
☁️ Cloud & Data Engineering
📈 Tableau و Visualization
یکی از ویژگی‌های جذاب DataCamp این است که آموزش‌ها کاملاً Hands-on هستند؛ یعنی از همان ابتدا با تمرین و پروژه واقعی یاد می‌گیری، نه فقط تئوری. 💻
😎پیشنهاد DE: قبل از شروع هفته رایگان، مسیر یادگیری خودت را مشخص کن؛ چون بین صدها دوره، انتخاب درست مهم‌تر از تعداد دوره‌هایی است که می‌بینی🚀
DataCamp Link
🔥2🥰1
💻 قبل از ساخت مدل‌های هوش مصنوعی، الگوریتم فکر کردن را یاد بگیر!

در یکشنبه‌های Data Elites تا اینجا مسیر پایه‌های علمی Data و AI را با هم جلو آمدیم:

📐 جبر خطی
برای فهم ساختار داده‌ها، بردارها و ماتریس‌ها

⬇️

🎲 احتمال
برای مدل‌کردن عدم‌قطعیت و رفتار داده‌ها

⬇️

⚙️ بهینه‌سازی
برای پیدا کردن بهترین پارامترها و آموزش مدل‌ها

و حالا قدم بعدی:

🧠 Algorithms & Data Structures

چون قبل از اینکه مدل‌های پیچیده بسازیم، باید یاد بگیریم چطور مسئله‌ها را تحلیل کنیم، راه‌حل طراحی کنیم و آن‌ها را به شکل بهینه پیاده‌سازی کنیم.

الگوریتم‌ها به ما یاد می‌دهند چطور مسئله‌ها را منطقی، بهینه و مقیاس‌پذیر حل کنیم؛ و ساختمان داده‌ها کمک می‌کنند اطلاعات را به بهترین شکل مدیریت کنیم.

از موتورهای جستجو و پایگاه‌های داده تا سیستم‌های هوش مصنوعی، همه به این مفاهیم وابسته‌اند. 🚀

دوره فارسی
💻 ساختمان داده و طراحی الگوریتم

دکتر علی شریفی زارچی

یک دوره ارزشمند برای یادگیری پایه‌های الگوریتم و ساختمان داده.

در این دوره با مفاهیمی مثل:

🔹 Array و Linked List
🔹 Stack و Queue
🔹 Tree و Graph
🔹 Sorting Algorithms
🔹 Dynamic Programming
🔹 طراحی و تحلیل الگوریتم‌ها
آشنا می شوید

🎥 Playlist دوره:
https://youtube.com/playlist?list=PLb9zxAaQXcchjJRdm476gz5rXduAMvgkQ

💻 GitHub دوره (کدها و منابع):
https://github.com/SharifiZarchi/Data_Structures_Algorithms

📚 کتاب‌های پیشنهادی

📘 The Algorithm Design Manual — Steven Skiena
یک کتاب کاربردی برای تقویت مهارت حل مسئله و طراحی الگوریتم.

📗 Introduction to Algorithms (CLRS)
یکی از معتبرترین منابع دنیا برای یادگیری عمیق الگوریتم‌ها و تحلیل آن‌ها.

🇬🇧 دوره‌های انگلیسی
🎓 Algorithms and Data Structures — University of Oxford | 2026

یک دوره دانشگاهی جدید برای یادگیری اصول الگوریتم و ساختمان داده.

موضوعات:

🔹 Algorithm Analysis
🔹 Data Structures
🔹 Sorting & Searching
🔹 Graph Algorithms
🔹 Dynamic Programming
🔹 Complexity Analysis

🎥 YouTube Playlist:
https://youtube.com/playlist?list=PLzZlJT-UOiwDCw7TDmww4hk5waSTkjhDh

🎓 CS50x 2026 — Harvard University

یک مسیر کاربردی و پروژه‌محور برای تقویت مهارت حل مسئله و برنامه‌نویسی.

مباحث مرتبط:

🔹 Algorithms
🔹 Data Structures
🔹 Searching
🔹 Sorting
🔹 Memory
🔹 Problem Solving

🎥 YouTube Playlist:
https://youtube.com/playlist?list=PLhQjrBD2T3839iqxqUdw7NWOCboh00vsV

🧭 مسیر پیشنهادی DE

📐 Linear Algebra
⬇️
🎲 Probability
⬇️
⚙️ Optimization
⬇️
💻 Algorithms & Data Structures
⬇️
🤖 AI / Data Systems

🚨 قبل از اینکه به ماشین یاد بدهیم، باید خودمان یاد بگیریم چطور مسئله حل کنیم. 🧠

الگوریتم‌ها فقط برای برنامه‌نویسی نیستند؛ آن‌ها پایه‌ی تفکر مهندسی، طراحی سیستم‌ها و ساخت فناوری‌های هوشمند هستند.

📚 یکشنبه‌های Data Elites؛ معرفی منابعی که واقعاً ارزش یادگیری دارند. 🚀
2🔥1🥰1
🧪 دوشنبه‌های Data Elites | وقتی AI وارد آزمایشگاه می‌شود! 🤖
تا امروز، هوش مصنوعی بیشتر برای پاسخ‌دادن، تولید محتوا و کمک به برنامه‌نویسی استفاده می‌شد.
اما سؤال بزرگ‌تر این است:
آیا یک Agent هوش مصنوعی می‌تواند بخشی از فرآیند یک پژوهش علمی را خودش انجام دهد؟
اینجاست که پروژه Safe Lab Agents وارد می‌شود؛ یک چارچوب جدید برای بررسی نقش Agentهای هوش مصنوعی در محیط‌های علمی و آزمایشگاهی.
این پروژه تلاش می‌کند Agentهایی بسازد که بتوانند:
🧠 مسئله علمی را تحلیل کنند
🧪 workflow آزمایش را طراحی کنند
💻 کد و شبیه‌سازی اجرا کنند
📊 داده‌ها و نتایج را بررسی کنند
📝 گزارش و مستندات پژوهشی تولید کنند
اما تفاوت مهم اینجاست:
Agentها در یک محیط کنترل‌شده و ایمن (Sandbox) فعالیت می‌کنند تا فرآیندهای علمی قابل بررسی، تکرار و مدیریت باشند.
یعنی مسیر آینده می‌تواند از:
👩‍🔬 پژوهشگر + ابزارهای محاسباتی
به سمت:
👩‍🔬 پژوهشگر + تیمی از Agentهای هوشمند
حرکت کند.
این نقطه اتصال چند حوزه مهم است:
🔹 Artificial Intelligence
🔹 AI Agents
🔹 Scientific Computing
🔹 Data Science
🔹 Automated Research
شاید در آینده نزدیک، AI فقط دستیار پژوهشگر نباشد؛
بلکه عضوی از تیم تحقیقاتی باشد. 🚀
🔗 Safe Lab Agents:
https://safe-lab-agents.org/
❤‍🔥21👏1