انجمن علم داده دانشگاه زنجان
115 subscribers
264 photos
41 videos
47 files
134 links
شروع فعالیت:
2024/05/07
استاد مشاور:
دکتر علی محمدیان مصمم
دبیر انجمن:
@AliKhalaji_78
Download Telegram
🎯 ۶ الگوریتم مدرن برای پیش‌بینی سری‌های زمانی
(مناسب برای تحلیل فروش، مالی، آب‌وهوا، لجستیک و…)
در دنیای پیش‌بینی سری‌های زمانی، علاوه بر مدل‌های کلاسیکی مثل ARIMA، امروزه الگوریتم‌های مدرن و مبتنی بر یادگیری عمیق به کمک ما آمده‌اند تا با دقتی بسیار بالاتر و انعطاف‌پذیری بیشتر، آینده را پیش‌بینی کنیم.
---
🔹 1.الگوریتم  Prophet

کتابخانه‌ای متن‌باز از تیم فیس‌بوک که بدون نیاز به تنظیمات پیچیده، سری‌های زمانی شامل روند، فصلیت و تعطیلات را به‌صورت خودکار مدل‌سازی می‌کند. و برای پیش بینی های سری های زمانی تک متغیره طراحی شده است.
مناسب برای تحلیل‌های تجاری (Business Forecasting)
قابل درک و تفسیر برای انسان‌ها

🔹 1.الگوریتم  LSTM (Long Short-Term Memory)

نوعی شبکه عصبی بازگشتی (RNN) است که وابستگی‌های زمانی بلندمدت را حفظ می‌کند.
📌 ایده‌آل برای داده‌های دارای الگوهای پیچیده، غیرخطی و نویزی و چند متغیره اما با حجم بالا
📌 دروازه‌های حافظه‌ای این مدل باعث یادگیری عمیق‌تر و دقیق‌تر می‌شوند.
---

🔹 3. الگوریتم DeepAR (از آمازون)

مدلی مبتنی بر RNN که برای پیش‌بینی چندین سری زمانی هم‌زمان به‌صورت احتمالاتی طراحی شده است.
📊 خروجی مدل شامل بازه‌های اطمینان (Confidence Intervals) است
📦 مناسب برای کاربردهای مقیاس‌پذیر مثل پیش‌بینی تقاضای کالا


🔹 4. مدل N-BEATS
مدلی از نوع Fully Connected Neural Network با معماری خاص و بدون نیاز به فرضیه‌سازی درباره روند یا فصل.
⚙️ یادگیری به‌صورت End-to-End
🔥 عملکرد قوی حتی روی داده‌های پرنویز و بدون ساختار مشخص
🔶مناسب برای داده های زمانی تک متغیره
---

🔹 5. مدل Temporal Fusion Transformer (TFT)

مدلی پیشرفته از گوگل که ترکیب قدرت Transformerها + قابلیت تفسیرپذیری را فراهم می‌کند.
🧠 قابلیت یادگیری از اطلاعات گذشته، حال و آینده
🔍 تشخیص متغیرهای تأثیرگذار به‌صورت خودکار
💡 انتخاب اول برای کاربردهای حساس مثل مالی، سلامت و زنجیره تأمین
---

🔹 6.مدلهای  NHiTS
نسل جدیدی از مدل‌های Deep Learning بدون وابستگی به الگوی روند یا فصل، با تمرکز روی وضوح بالا در افق‌های طولانی پیش‌بینی.
📈 بسیار سریع‌تر از TFT
🎯 مناسب برای سناریوهای Real-time
1
کسی که با مدل‌ها برای رسیدن به دقت بالا  در پروژه های یادگیری ماشین کار می‌کند، حتما میدونه که یکی از فازهای خیلی مهم در مسائل یادگیری ماشین فاز اعتبارسنجی و ارزیابی مدله. اینکه از چه معیاری و کجا رو چه نوع داده ای استفاده کنیم.
اینجا تمرکزم مدل‌های پیش بینی و رگرسیونه
مزایا و معایب هر کدوم رو نام میبرم و میگم کجا بهتره ازش استفاده کنیم:

معیار 𝗥𝗠𝗦𝗘 (𝗥𝗼𝗼𝘁 𝗠𝗲𝗮𝗻 𝗦𝗾𝘂𝗮𝗿𝗲𝗱 𝗘𝗿𝗿𝗼𝗿):
🟢 مزایا
میانگین بزرگی خطا را اندازه‌گیری می‌کند، و خطاها را به توان دو می‌رساند تا اختلافات بزرگتر را برجسته کند. مناسب برای زمانی که به حداقل رساندن خطاهای قابل توجه بسیار مهم است، زیرا انحرافات بزرگ را جریمه می‌کند.

🔴 معایب
→ خطای RMSE:
اگر هدف اولویت‌بندی خطاهای بزرگ نباشد، RMSE می‌تواند گمراه‌کننده باشد، زیرا به داده‌های پرت وزن زیادی می‌دهد.

🔶معیار شاخص MAE

یکی از ساده ترین معیارهای ارزیابی مدلهای رگرسیونی می باشد. این شاخص متوسط اندازه خطای پیش بینی را محاسبه می کند و تفسیر خوبی از میزان اثربخشی مدل فراهم میکند.

🔺معیار→ R²:

معیار ² درصد تغییرپذیری در داده‌هایی که توسط مدل ثبت می‌شوند را نشان می‌دهد و درک آن را آسان می‌کند.
🔴 معایب
به شدت تحت تأثیر مقادیر بسیار زیاد قرار دارد که می‌تواند منجر به ارائه نادرست اطلاعات شود.
مفهوم واضحی از اندازه واقعی خطا ارائه نمی‌دهد.

💥معیار MAPE

خطاها را به صورت درصد ارائه می‌دهد و این امر آن را شهودی و توضیح آن را آسان می‌کند.
کمتر حساس به داده های پرت : برخلاف RMSE، اگر مقادیر واقعی نیز بالا باشند، MAPE با یک یا دو خطای بالا از کوره در نمی‌رود.(منفجر نمیشه)

معایب: MAPE می‌تواند وقتی مقادیر واقعی نزدیک به صفر باشند، گمراه‌کننده باشد و منجر به خطاهای بسیار بالایی شود. مثلا فروش صفر باشد پایدار نیست بهتره از SMAPE استفاده بشه.
2
Media is too big
VIEW IN TELEGRAM
اولین جلسه کارگاه توانمندسازی نشریات دانشجویی دانشگاه زنجان
موضوع کارگاه : اصول خبرنویسی در رسانه
استاد کارگاه: آقای دکتر قلندری
برگزار کننده: معاونت فرهنگی و اجتماعی دانشگاه زنجان
بهار 1404
Media is too big
VIEW IN TELEGRAM
دومین جلسه کارگاه توانمندسازی نشریات دانشجویی دانشگاه زنجان
موضوع کارگاه: گزارش نویسی در رسانه دانشجویی
استاد کارگاه: آقای دکتر قلندری
برگزار کننده: معاونت فرهنگی و اجتماعی دانشگاه زنجان
بهار 1404
Media is too big
VIEW IN TELEGRAM
سومین جلسه کارگاه توانمندسازی نشریات دانشجویی دانشگاه زنجان
موضوع کارگاه: مقاله نویسی رسانه ای
استاد کارگاه: آقای دکتر قلندری
برگزار کننده: معاونت فرهنگی و اجتماعی دانشگاه زنجان
بهار 1404
Media is too big
VIEW IN TELEGRAM
چهارمین جلسه کارگاه توانمندسازی نشریات دانشجویی دانشگاه زنجان
موضوع کارگاه:اصول گرافیکی و صفحه آرایی رسانه ای
استاد کارگاه: آقای دکتر قلندری
برگزار کننده: معاونت فرهنگی و اجتماعی دانشگاه زنجان
بهار 1404
1
🔹 قدرت پنهان تابع which() در R 🔹

تابع which() برای یافتن اندیس‌هایی است که یک شرط خاص را برآورده می‌کنند. اما کاربردهای حرفه‌ای‌تری هم دارد که معمولاً کمتر شناخته شده‌اند.

🔸 نکات طلایی درباره which() که بسیاری نمی‌دانند 🔸

۱. تفاوت which با فیلتر مستقیم
تابع which اندیس می‌دهد، فیلتر مستقیم مقدار را.

x <- c(10, 20, 30, 40)

which(x > 15)       
# 2 3 4

x[x > 15]           
# 20 30 40

۲. اولین یا آخرین وقوع یک شرط
با ترکیب which با min یا max سریعاً موقعیت را پیدا کنید.

x <- c(NA, 5, 8, NA, 10)
min(which(!is.na(x)))  

# 2

max(which(x > 6))      
# 5

۳.تابع which در ماتریس — موقعیت ردیف و ستون
با
arr.ind = TRUE اندیس دو بعدی دریافت می‌کنید.

mat <- matrix(c(1,0,0,0,1,0,1,0,1), nrow=3)

which(mat == 1)
# [1] 1 5 7 9

which(mat == 1, arr.ind = TRUE)
#     row col
# [1,]   1   1
# [2,]   2   2
# [3,]   1   3
# [4,]   3   3

۴. استخراج نام عناصر منطبق
برای بردارهای نام‌دار، نام‌های مربوط به شرط را بگیرید.

v <- c(a=10, b=20, c=30)
names(v)[which(v > 15)]

# “b” “c”

۵. دقت در فاکتورها (factor)
تابع which بر اساس مقدار فاکتور عمل می‌کند، نه عدد داخلی.

f <- factor(c(“low”, “medium”, “high”))
which(f == “medium”)    

# 2

which(f == 2)           

# integer(0)

۶. سرعت بیشتر which در داده‌های بزرگ
تابع
which معمولاً از فیلتر مستقیم سریع‌تر است.

x <- sample(c(1:100, rep(NA, 1e3)), 1e8 , replace = TRUE)
  
system.time(a <- which(x > 50))
#   user  system elapsed
#  0.302   0.070   0.371
 
system.time(b <- x[x > 50])
#   user  system elapsed
#  0.491   0.366   1.122


۷. پیدا کردن موقعیت NA یا بررسی شرط کلی

which(is.na(x))
# اندیس NAها
 
any(x > 10)
# شرط برقرار است یا نه؟


@r_rstudio_pro
محدودیت مدل‌های زبانی برای سری زمانی

مدل‌های زبانی بزرگ بر پایه معماری ترنسفورمر ساخته شده‌اند. ترنسفورمرها یک پیشرفت بزرگ در یادگیری عمیق بودند که قابلیت‌های جدیدی را در پردازش زبان طبیعی، تولید تصویر و حتی مدل‌سازی مولکولی باز کردند.
قدرت آن‌ها در مکانیزم Self-Attention نهفته است — سازوکاری که به مدل اجازه می‌دهد به‌صورت پویا تصمیم بگیرد کدام بخش‌های ورودی را بیشتر مورد توجه قرار دهد.

اما ترنسفورمرها با یک‌سری فرضیات همراه‌اند. مهم‌ترین آن‌ها:

داده‌های ورودی دنباله‌ای از توکن‌های گسسته هستند.
تنها راه شرطی‌سازی مدل این است که توکن‌های بیشتری به کانتکست اضافه شود.


برای زبان، این فرضیات کاملاً مناسب‌اند. متن ذاتاً قابل توکنیزه شدن است — کلمات، زیرکلمات، علائم نگارشی. شرطی‌سازی با اضافه کردن متن اضافی («این مقاله را خلاصه کن…»، «این جمله را ترجمه کن…») به‌طور طبیعی در جریان توکن‌ها جا می‌گیرد.

اما سری‌های زمانی چطور؟ چرا ترنسفورمرها با سری‌های زمانی مشکل دارند

داده‌های سری زمانی پیوسته هستند. این داده‌ها از مقادیری مانند 93.4، 71.2، 108.0 تشکیل شده‌اند — دنباله‌ای از اعداد حقیقی که در طول زمان نمونه‌برداری شده‌اند. برای استفاده از ترنسفورمر، باید این مقادیر را به توکن‌های گسسته تبدیل کنیم. اما این فرآیند دارای افت اطلاعات، انتخاب دلخواه و در کل نامناسب برای بسیاری از سیگنال‌های واقعی است.

مشکل دیگر: شرطی‌سازی.

فرض کنید می‌خواهیم ضربان قلب یک فرد را در طول زمان پیش‌بینی کنیم. ممکن است بخواهیم مدل را با متادیتا شرطی کنیم — مثل سن، جنسیت، سابقه پزشکی و نتایج آزمایشگاه.
اما این متادیتا انواع مختلفی دارد:

باینری (مثلاً سیگاری / غیرسیگاری)

دسته‌ای (مثلاً جنسیت)

پیوسته (مثلاً سطح هموگلوبین)

یا حتی متن بدون ساختار (یادداشت پزشک)


ترنسفورمرها مجبورند همه این‌ها را به یک جریان واحد از توکن‌ها تبدیل کنند. این کار در بهترین حالت ناخوشایند و در بدترین حالت مخرب است.

به طور خلاصه:
ترنسفورمرها ما را مجبور می‌کنند سری‌های زمانی را به فرمتی درآوریم که همان اطلاعاتی را که می‌خواهیم حفظ کنیم، از بین می‌برد.
به جای آن، چه چیزی نیاز داریم؟

مسائل سری زمانی به مدل‌هایی نیاز دارند که:

ذاتاً پیوسته باشند

بتوانند هر نوع متادیتایی را بدون توجه به نوع آن وارد کنند

قادر به تولید و تحلیل سیگنال‌های چگال و چندمتغیره در طول زمان باشند.
1
فصلنامه_علم_داده_سال_اول_شماره_چهارم.pdf
36.6 MB
🍹🏖 فصلنامه علم داده | سال اول - شماره چهارم - تابستان 1404 🍹🏖
کاری از اعضای انجمن علمی دانشجویی علم داده

📖 در این شماره می‌خوانید:

🔹 یادگیری ماشین و تحلیل بقا در پیش بینی پیشرفت CKD به ESRD:
بررسی علائم، تشخیص و درمان💉
🔸 پردازش تصویر 🔭
🔹 مروری بر کاربرد علم داده در مهندسی معدن🪏
🔸معرفی کتاب📘
🔹 cheat sheet:
Data Structures-Famous CNNs📃
🔸 یادگیری ماشین:
Classification📦

📌 مشاهده آنلاین بدون نیاز به دانلود:
👈🏼 کلیک کنید

💡 انجمن علم داده دانشگاه زنجان 💡
3🔥1👏1
You aren't a Data Scientist if you never:


-> Promised to do the task in 2h then spent 2 weeks
-> Waited 3 hours appending pd.DataFrames
-> Re-created repo because you've broken it
-> Forget difference between loc and iloc
-> Done "import pandas as np"

If you did all that, you are on the right track.

Trust me, you aren't alone ❤️
📱 درخواست توسعه‌دهنده اندروید با پایتون
یک پروژه اندروید داریم و نیاز به برنامه‌نویس حرفه‌ای با پایتون هستیم. برای اطلاع از جزییات و شرایط لطفاً به آیدی زیر پیام بدهید .
@Ecersis6131
🤣🤣
😁12
كارگاه آموزشي آشنايي با پايگاه‌هاي اطلاعاتی و خدمات كتابخانه مركزي

برنامه كارگاه آموزشي آشنايي با پايگاه‌هاي اطلاعاتی و خدمات كتابخانه مركزي براي دانشجويان تحصیلات تکمیلی ورودي سال 1404

دانشکده علوم

شنبه 17 آبان‌­ماه 1404 صبح ساعت 9:30 تا 12 دانشجویان تحصیلات تکمیلی ورودي سال 1404،

دانشکده علوم انسانی

­شنبه 17 آبان­‌ماه 1404 ­ بعد از ظهر ساعت 13 تا 15 دانشجویان تحصیلات تکمیلی ورودي سال 1403،

دانشکده فنی مهندسی

یک­شنبه 18 آبان‌­ماه 1404 صبح ساعت 9:30 تا 12 دانشجویان تحصیلات تکمیلی ورودي سال 1404،

دانشکده کشاورزی

یک­شنبه18 آبان­‌ماه 1404 بعد از ظهر ساعت 13 تا 15 دانشجویان تحصیلات تکمیلی ورودي سال 1404،

دوشنبه 19 آبان‌ماه 1404 صبح ساعت 9:30 تا 12، دانشجویان تحصیلات تکمیلی ورودي سال‌های قبل و همچنین دانشجویان ورودی سال جدید که موفق به شرکت در برنامه های فوق نشده اند.

محل برگزاری: سالن سهروردی کتابخانه مرکزی

شروع برنامه: رأس ساعت 10 صبح و برنامه بعد ازظهر رأس ساعت 13:30 است.

توجه:

شرکت در این دوره جهت ثبت پروپوزال کلیه دانشجویان الزامی است و در صورت عدم شرکت در دوره فوق، دانشجو قادر به ثبت پروپوزال در سامانه گلستان و انجام مراحل بعدی تحصیلی نخواهد بود.
ضمناً ضروری است دانشجویان ورودی سال گذشته که تاکنون موفق به گذراندن دوره نشده‌اند، در اسرع وقت جهت شرکت در دوره اقدام نمایند.
جهت اطلاع از اخبار و برنامه‌های کتابخانه مرکزی به سایت کتابخانه مرکزی و سایت خبری دانشگاه زنجان مراجعه نمایید.

برخی از کتاب‌های خوب آماری که هم میتونید برای برنامه نویسی ازش استفاده کنید و هم میتونید برخی مباحث تئوری آماری رو ازش با مثال خوب یاد بگیرید:

1- کتاب "An Introduction to Statistical Learning" نوشته Gareth James ،Daniela Witten،Trevor Hastie و Robert Tibshirani.
این کتاب این کتاب مقدمه ای جامع برای یادگیری آماری شامل مبانی نظری و کاربردهای عملی ارائه می‌کنه. همچنین این کتاب شامل کدهای R برای پیاده سازی مثال‌ها و مفاهیم آماری هست که خواننده میتونه ازشون برای کارهای خودش کمک بگیره.

2- کتاب "The Elements of Statistical Learning" نوشته Trevor Hastie, Robert Tibshirani, Jerome Friedman.
این کتاب نسخه پیشرفته کتاب قبلی هست که شامل دامنه وسیعی از روش‌های یادگیری آماری است. همچنین همانند کتاب قبلی شامل مباحث نظری یادگیری آماری و مثال‌های پیاده سازی شده به زبان R هست.

3- کتاب"Probability and Statistics for Data Science" نوشته Norman Matloff.
این کتاب مقدمه‌ای جامع در مورد احتمالات و آمار برای حوزه علم داده فراهم کرده که شامل هم مباحث تئوری و هم عملی هست. این کتاب نیز برای پیاده سازی مثال‌ها و بصری سازی مفاهیم پایه از زبان R استفاده کرده و همچنین شامل چندین تمرین می‌باشد که به خواننده جهت ارتقای مهارت‌هایش کمک می‌کند.

4- کتاب "Data Science from Scratch" نوشته Joel Grus.
این کتاب مقدمه‌ای کاربردی برای علم داده محسوب میشه که شامل آمار، برنامه نویسی و یادگیری ماشین هست. این کتاب از کد‌های Python برای نوشتن مثال‌ها استفاده کرده و هر دو جنبه تئوری و عملی آمار رو پوشش میده.

5- کتاب "Think Stats" نوشته Allen B. Downey.
این کتاب مقدمه‌ای عملی از آمار برای برنامه نویسان هست که شامل هردوجنبه تئوری و عملی میشه. این کتاب از زبان Python برای مثال‌ها استفاده میکنه و شامل تمرینات زیادی هست که میتونید برای ارتقای مهارت‌هاتون انجامش بدید.

6- کتاب "R for Data Science" نوشته  Garrett Grolemund, Hadley Wickham.
این کتاب در کل از جنبه کاربردی و صرفا به دید افزایش مهارت‌های شما در برنامه نویسی و بصری سازی با زبان R پرداخته شده. کل کتاب با مثال جلو میره و هیچ مبحث تئوری گفته نمیشه ولی در کل برای ارتقای مهارت‌های شما در زمینه مرتب‌سازی داده، کشیدن نمودار، مدل‌سازی داده کتاب خوبی هست.

7- کتاب "Statistical Computing with R" نوشته Maria L. Rizzo.
این یک کتاب عالی در زمینه شبیه‌سازی‌های آماری هست که به معرفی متد‌های مخلف پرداخته است. نویسنده سعی داشته در کنار مباحث تئوری که برای انجام شبیه‌سازی‌ها لازم هست با آوردن مثال‌های کاربردی و نوشتن کد‌های آن با R تاحد ممکن مبحث رو قابل فهم کند ولی همچنان در بعضی موارد سطح کتاب بالا می‌باشد. ولی در کل برای ارشد و دکتری آمار که میخوان شبیه‌سازی انجام بدن حتما مطالعه کل یا بخشی از این کتاب رو پیشنهاد میکنم.


*تمامی کتاب‌های بالا برای سطح مبتدی و متوسط مناسب می‌باشند
1
💠پیشنهاد تبدیل دانشگاه زنجان به «نقطه منفصل شهری»

🔹استاندار زنجان گفت: توجه به جمعیت ۱۱ هزار نفری دانشگاه، این مجموعه می‌تواند در تقسیمات کشوری به‌عنوان نقطه منفصل شهری تعریف شود. در این صورت، دانشگاه شهرداری خواهد داشت و می‌تواند از منابع مالی جدیدی بهره‌مند شود.

🔹سیدمحسن صادقی شامگاه شنبه یکم آذر در نشست با هیات رئیسه دانشگاه زنجان که در جریان بازدید وی از این مرکز علمی برگزار شد با اشاره به نگاه سنتی نسبت به وظایف استانداری و فرمانداری‌ها، تصریح کرد: سال‌ها است که نگاه عمومی به استانداری، نگاهی لجستیکی و تأمین‌کننده مالی بوده است؛ درحالی‌که استانداری ماهیتاً نهاد حکمرانی است و شش وظیفه اصلی شامل نظارت، هماهنگی، راهبری، سیاست‌گذاری اجرایی، ارزیابی عملکرد و مدیریت توازن منطقه‌ای را بر عهده دارد.
👎3
🔴 اطلاعیه آموزشی

دانشجوی گرامی:
فرایند آموزش دانشگاه در روزهای سه شنبه و چهارشنبه، یازدهم و دوازدهم آذر ماه ۱۴۰۴ به صورت مجازی در سامانه lms.znu.ac.ir انجام خواهد شد‌.

- آموزش دانشگاه