#علم_داده
بسیاری از ما شنیدهایم که علم داده (Data Science) علمِ دنیای فرداست و متخصصان علم داده به سرعت توسط کسب و کارها جذب میشوند؛ اما شاید فرصتی پیش نیامده باشد تا دربارهی قلمرو علم داده و زیرمجموعههای آن مطالعه کنیم.
با این فرض، میخواهیم در این درس به صورت بسیار مختصر به تعریف علم داده و معرفی دانشها و مهارتهای وابسته به آن بپردازیم.
آیا ما هم با دستاوردهای علم داده سر و کار داریم؟
ممکن است در نگاه اول به نظر برسد که بحث علم داده، یک بحث تخصصی برای محققان است و انسانهای عادی، با دستاوردهای آن سر و کار ندارند (یا اینکه هنوز سر و کار ندارند)، اما چنین فرضی درست نیست:
هر بار که به جستجو در گوگل میپردازیم؛
هر بار که یک وبسایت را باز میکنیم و تبلیغاتی متناسب با سلیقهی ما نمایش داده میشود؛
هر بار که آمازون یا سایتهای خردهفروشی دیگر، بر اساس خریدهای قبلی و انتخابهای فعلی ما، پیشنهادهای جدیدی را مطرح میکنند (موتور توصیهگر)؛
در حال استفاده از دستاوردهای علم داده هستیم. ضمن اینکه در برخی کشورهای توسعهیافته، حق بیمه، مدیریت چراغهای راهنمایی و رانندگی و توزیع امکانات و فرصتهای شهری هم با تکیه بر علم داده انجام میشود.
واقعیت این است که علم داده به معنای خاص، چند دهه قدمت دارد و به معنای عام، ریشههای آن را میتوان در قرنهای گذشته هم جستجو کرد.
اما قدرت گرفتن چند «روند» طی سالهای اخیر، باعث شده که علم داده بیش از پیش مورد توجه قرار بگیرد. از جملهی این روندها میتوان به موارد زیر اشاره کرد:
افزایش حجم دادهها (در حدی که بیگ دیتا به مسئلهی بسیاری از کسب و کارها تبدیل شد)
افزایش قدرت محاسباتی سیستمهای سختافزاری (که پیادهسازی بسیاری از پروژههای علم داده را توجیهپذیر کرد)
افزایش حجم تولید داده در اینترنت (از اطلاعات تراکنشهای انسانها و فعالیت در شبکههای اجتماعی تا دادههای گردآوری شده توسط سنسورها، مثلاً اطلاعات موقعیت فیزیکی انسانها در لحظات مختلف)
خلق روشهای جدیدتر برای تحلیل دادهها
در حال حاضر، بسیاری از کسب و کارها برای حل مسائل خود و بهخصوص سیاستگذاری و انجام اقدامهای پیشگیرانه، از علم داده کمک میگیرند.
بسیاری از ما شنیدهایم که علم داده (Data Science) علمِ دنیای فرداست و متخصصان علم داده به سرعت توسط کسب و کارها جذب میشوند؛ اما شاید فرصتی پیش نیامده باشد تا دربارهی قلمرو علم داده و زیرمجموعههای آن مطالعه کنیم.
با این فرض، میخواهیم در این درس به صورت بسیار مختصر به تعریف علم داده و معرفی دانشها و مهارتهای وابسته به آن بپردازیم.
آیا ما هم با دستاوردهای علم داده سر و کار داریم؟
ممکن است در نگاه اول به نظر برسد که بحث علم داده، یک بحث تخصصی برای محققان است و انسانهای عادی، با دستاوردهای آن سر و کار ندارند (یا اینکه هنوز سر و کار ندارند)، اما چنین فرضی درست نیست:
هر بار که به جستجو در گوگل میپردازیم؛
هر بار که یک وبسایت را باز میکنیم و تبلیغاتی متناسب با سلیقهی ما نمایش داده میشود؛
هر بار که آمازون یا سایتهای خردهفروشی دیگر، بر اساس خریدهای قبلی و انتخابهای فعلی ما، پیشنهادهای جدیدی را مطرح میکنند (موتور توصیهگر)؛
در حال استفاده از دستاوردهای علم داده هستیم. ضمن اینکه در برخی کشورهای توسعهیافته، حق بیمه، مدیریت چراغهای راهنمایی و رانندگی و توزیع امکانات و فرصتهای شهری هم با تکیه بر علم داده انجام میشود.
واقعیت این است که علم داده به معنای خاص، چند دهه قدمت دارد و به معنای عام، ریشههای آن را میتوان در قرنهای گذشته هم جستجو کرد.
اما قدرت گرفتن چند «روند» طی سالهای اخیر، باعث شده که علم داده بیش از پیش مورد توجه قرار بگیرد. از جملهی این روندها میتوان به موارد زیر اشاره کرد:
افزایش حجم دادهها (در حدی که بیگ دیتا به مسئلهی بسیاری از کسب و کارها تبدیل شد)
افزایش قدرت محاسباتی سیستمهای سختافزاری (که پیادهسازی بسیاری از پروژههای علم داده را توجیهپذیر کرد)
افزایش حجم تولید داده در اینترنت (از اطلاعات تراکنشهای انسانها و فعالیت در شبکههای اجتماعی تا دادههای گردآوری شده توسط سنسورها، مثلاً اطلاعات موقعیت فیزیکی انسانها در لحظات مختلف)
خلق روشهای جدیدتر برای تحلیل دادهها
در حال حاضر، بسیاری از کسب و کارها برای حل مسائل خود و بهخصوص سیاستگذاری و انجام اقدامهای پیشگیرانه، از علم داده کمک میگیرند.
#علم_داده
تعریف علم داده چیست؟
میگویند علم داده گرفتارِ جنگ تعریفها است (+). به این معنا که افراد مختلف، آن را به شکلهای متفاوتی تعریف کردهاند و چون هیچکس از تعریف دیگری راضی نیست، همه مشغول نقد تعریف یکدیگر هستند.
واقعیت این است که مدعیان تخصص علم داده هم در این میان بیتقصیر نیستند. در حدی که گاهی یک نفر که صرفاً توانایی ترسیم چند نمودار در اکسل را دارد، خود را متخصص علم داده معرفی میکند و نتیجه این میشود که عدهای میگویند: «متخصص علم داده، همان کارشناس آمار است که حقوق بیشتری میخواهد.»
اگر از این اختلافنظرها و افراطها بگذریم، میتوان گفت دو تعریف زیر تقریباً در میان غالب متخصصان علم داده پذیرفته شدهاند:
تعریف علم داده توسط براشلر و همکاران (منبع)
علم داده به ترکیب منحصربهفردی از اصول و روشها، اعم از تحلیل، مهندسی، کارآفرینی و علم ارتباطات اشاره دارد که میکوشد از دادهها، ارزش اقتصادی خلق کند.
تعریف علم داده توسط کِهِلِر (منبع)
علم داده شامل مجموعهای از اصول، مسائل، الگوریتمها و فرایندهاست که برای استخراج الگوهای غیرواضح و قابلاستفاده از حجم بزرگ دادهها بهکار گرفته میشود.
این الگوها واضح نیستند؛ به این معنا که غالباً با تحلیل شهودی کارشناسان، نمیتوان آنها را یافت و درک کرد.
این الگوها کاربردی هستند؛ به این معنا که صرفاً دادههای پیش رو را توصیف نمیکنند؛ بلکه مسیری برای اقدام عملی در اختیار ما میگذارند.
تعریف علم داده چیست؟
میگویند علم داده گرفتارِ جنگ تعریفها است (+). به این معنا که افراد مختلف، آن را به شکلهای متفاوتی تعریف کردهاند و چون هیچکس از تعریف دیگری راضی نیست، همه مشغول نقد تعریف یکدیگر هستند.
واقعیت این است که مدعیان تخصص علم داده هم در این میان بیتقصیر نیستند. در حدی که گاهی یک نفر که صرفاً توانایی ترسیم چند نمودار در اکسل را دارد، خود را متخصص علم داده معرفی میکند و نتیجه این میشود که عدهای میگویند: «متخصص علم داده، همان کارشناس آمار است که حقوق بیشتری میخواهد.»
اگر از این اختلافنظرها و افراطها بگذریم، میتوان گفت دو تعریف زیر تقریباً در میان غالب متخصصان علم داده پذیرفته شدهاند:
تعریف علم داده توسط براشلر و همکاران (منبع)
علم داده به ترکیب منحصربهفردی از اصول و روشها، اعم از تحلیل، مهندسی، کارآفرینی و علم ارتباطات اشاره دارد که میکوشد از دادهها، ارزش اقتصادی خلق کند.
تعریف علم داده توسط کِهِلِر (منبع)
علم داده شامل مجموعهای از اصول، مسائل، الگوریتمها و فرایندهاست که برای استخراج الگوهای غیرواضح و قابلاستفاده از حجم بزرگ دادهها بهکار گرفته میشود.
این الگوها واضح نیستند؛ به این معنا که غالباً با تحلیل شهودی کارشناسان، نمیتوان آنها را یافت و درک کرد.
این الگوها کاربردی هستند؛ به این معنا که صرفاً دادههای پیش رو را توصیف نمیکنند؛ بلکه مسیری برای اقدام عملی در اختیار ما میگذارند.
#علم_داده
آیا علم داده همان داده کاوی است؟
گاهی اوقات علم داده (Data Science) را با داده کاوی (Data Mining) و گاه با یادگیری ماشین (Machine Learning) مترادف در نظر میگیرند.
گاهی هم پیش میآید که آن را زیرمجموعهی علم آمار فرض میکنند. اما منطقیتر است که برای علم داده تعریف گستردهتری در نظر بگیریم. زیرا:
علم داده ، بر خلاف داده کاوی، تمام فرایند مرتبط با داده، از گردآوری اولیه تا عرضهی محصول مبتنی بر دادهها را در برمیگیرد و صرفاً به تحلیل داده محدود نیست.
علم داده بر خلاف روش غالب در آمار، معمولاً از جنبهی توصیفی و استنتاجی فاصله میگیرد و میکوشد بر اساس دادههای موجود، به پیشبینی و تجویز بپردازد.
بنابراین بهتر است علم داده را به معنای عامتر در نظر بگیریم و فرض کنیم سایر شاخهها (مثل آمار، داده کاوی و یادگیری ماشینی) دستاوردهای خود را در اختیار علم داده قرار میدهند.
آیا علم داده همان داده کاوی است؟
گاهی اوقات علم داده (Data Science) را با داده کاوی (Data Mining) و گاه با یادگیری ماشین (Machine Learning) مترادف در نظر میگیرند.
گاهی هم پیش میآید که آن را زیرمجموعهی علم آمار فرض میکنند. اما منطقیتر است که برای علم داده تعریف گستردهتری در نظر بگیریم. زیرا:
علم داده ، بر خلاف داده کاوی، تمام فرایند مرتبط با داده، از گردآوری اولیه تا عرضهی محصول مبتنی بر دادهها را در برمیگیرد و صرفاً به تحلیل داده محدود نیست.
علم داده بر خلاف روش غالب در آمار، معمولاً از جنبهی توصیفی و استنتاجی فاصله میگیرد و میکوشد بر اساس دادههای موجود، به پیشبینی و تجویز بپردازد.
بنابراین بهتر است علم داده را به معنای عامتر در نظر بگیریم و فرض کنیم سایر شاخهها (مثل آمار، داده کاوی و یادگیری ماشینی) دستاوردهای خود را در اختیار علم داده قرار میدهند.
#علم_داده
آیا علم داده همان داده کاوی است؟
گاهی اوقات علم داده (Data Science) را با داده کاوی (Data Mining) و گاه با یادگیری ماشین (Machine Learning) مترادف در نظر میگیرند.
گاهی هم پیش میآید که آن را زیرمجموعهی علم آمار فرض میکنند. اما منطقیتر است که برای علم داده تعریف گستردهتری در نظر بگیریم. زیرا:
علم داده ، بر خلاف داده کاوی، تمام فرایند مرتبط با داده، از گردآوری اولیه تا عرضهی محصول مبتنی بر دادهها را در برمیگیرد و صرفاً به تحلیل داده محدود نیست.
علم داده بر خلاف روش غالب در آمار، معمولاً از جنبهی توصیفی و استنتاجی فاصله میگیرد و میکوشد بر اساس دادههای موجود، به پیشبینی و تجویز بپردازد.
بنابراین بهتر است علم داده را به معنای عامتر در نظر بگیریم و فرض کنیم سایر شاخهها (مثل آمار، داده کاوی و یادگیری ماشینی) دستاوردهای خود را در اختیار علم داده قرار میدهند.
آیا علم داده همان داده کاوی است؟
گاهی اوقات علم داده (Data Science) را با داده کاوی (Data Mining) و گاه با یادگیری ماشین (Machine Learning) مترادف در نظر میگیرند.
گاهی هم پیش میآید که آن را زیرمجموعهی علم آمار فرض میکنند. اما منطقیتر است که برای علم داده تعریف گستردهتری در نظر بگیریم. زیرا:
علم داده ، بر خلاف داده کاوی، تمام فرایند مرتبط با داده، از گردآوری اولیه تا عرضهی محصول مبتنی بر دادهها را در برمیگیرد و صرفاً به تحلیل داده محدود نیست.
علم داده بر خلاف روش غالب در آمار، معمولاً از جنبهی توصیفی و استنتاجی فاصله میگیرد و میکوشد بر اساس دادههای موجود، به پیشبینی و تجویز بپردازد.
بنابراین بهتر است علم داده را به معنای عامتر در نظر بگیریم و فرض کنیم سایر شاخهها (مثل آمار، داده کاوی و یادگیری ماشینی) دستاوردهای خود را در اختیار علم داده قرار میدهند.
This media is not supported in your browser
VIEW IN TELEGRAM
مقایسه کارکردهای پایتون و R
همواره یکی از چالشهای متخصصین علمداده، تحلیلگران داده و... انتخاب از میان دو زبان برنامهنویسی پایتون یا R براساس میزان قابلیتهای آنها میباشد. در ادامه بر اساس نظر بیش از 23 هزار نفر در سایت Kaggle برخی نکات از میزان استفاده از این دو زبان برنامه نویسی در حوزههای علومداده، توسعه دهنده نرمافزار، تحلیلگر داده، مهندسین داده و... ذکر شده است.
▪️بیش از 90 درصد از توسعهدهندگان نرمافزار و مهندسین داده از زبان پایتون استفاده میکند.
▪️ بیش از 75 درصد از متخصصین علمداده از پایتون بهعنوان زبان برنامهنویسی اول استفاده میکنند.
▪️بیشترین استفاده زبان R در حوزههای متخصص آمار، تحلیلگر داده و تحلیلگر کسبوکار بوده است.
◾️در 15 حوزه کار تنها در جایگاه متخصص آماری میزان استفاده زبان R از پایتون بیشتر میباشد.
پینوشت:
🔸اگر قصد فعالیت تخصصی در پروژههای علمداده را دارید نیازمند فراگیری هر دو زبان پایتون و R خواهید بود تا فراخور به نوع پروژه و قابلیتهای هر یک از این دو زبان برنامهنویسی بتوانید پروژه را بهصورت بهینه پیادهسازی و مدیریت نمایید.
🔸 اگر قصد انتخاب تنها یکزبان برنامهنویسی را از میان پایتون و R دارید زبان پایتون انتخاب بهتری خواهد بود.
همواره یکی از چالشهای متخصصین علمداده، تحلیلگران داده و... انتخاب از میان دو زبان برنامهنویسی پایتون یا R براساس میزان قابلیتهای آنها میباشد. در ادامه بر اساس نظر بیش از 23 هزار نفر در سایت Kaggle برخی نکات از میزان استفاده از این دو زبان برنامه نویسی در حوزههای علومداده، توسعه دهنده نرمافزار، تحلیلگر داده، مهندسین داده و... ذکر شده است.
▪️بیش از 90 درصد از توسعهدهندگان نرمافزار و مهندسین داده از زبان پایتون استفاده میکند.
▪️ بیش از 75 درصد از متخصصین علمداده از پایتون بهعنوان زبان برنامهنویسی اول استفاده میکنند.
▪️بیشترین استفاده زبان R در حوزههای متخصص آمار، تحلیلگر داده و تحلیلگر کسبوکار بوده است.
◾️در 15 حوزه کار تنها در جایگاه متخصص آماری میزان استفاده زبان R از پایتون بیشتر میباشد.
پینوشت:
🔸اگر قصد فعالیت تخصصی در پروژههای علمداده را دارید نیازمند فراگیری هر دو زبان پایتون و R خواهید بود تا فراخور به نوع پروژه و قابلیتهای هر یک از این دو زبان برنامهنویسی بتوانید پروژه را بهصورت بهینه پیادهسازی و مدیریت نمایید.
🔸 اگر قصد انتخاب تنها یکزبان برنامهنویسی را از میان پایتون و R دارید زبان پایتون انتخاب بهتری خواهد بود.
#یادگیری_ماشین
بهینه سازی مدل
تکنیک بهینهسازی مهم دیگر، انتخاب ویژگی است. همان طور که به خاطر دارید، در مرحله پاکسازی 9 ویژگی را حذف کردیم. الان زمان مناسبی است که درباره آن ویژگیها تجدید نظر کنید و تحلیل کنید. که آیا آنها بر روی صحت کلی مدل تاثیری دارند. ” SellerG ” ممکن است یک ویژگی جالب برای اضافه کردن به مدل باشد به خاطر اینکه احتمالا شرکت معاملات املاکی که ملک را میفروشد بر روی قیمت نهایی فروش تاثیر داشته باشد.
برعکس، حذف ویژگیها از مدل فعلی ممکن است زمان پردازش را، بدون کاهش چشمگیر دقت، کاهش بدهد، یا حتی دقت را بهبود ببخشد. برای انتخاب موثر ویژگیها، بهتر است که تغییرات ویژگیها را به تفکیک انجام دهید و نتایج را تحلیل کنید، به جای آنکه یک دفعه چندین تغییر را اعمال کنید.
بهینه سازی مدل
تکنیک بهینهسازی مهم دیگر، انتخاب ویژگی است. همان طور که به خاطر دارید، در مرحله پاکسازی 9 ویژگی را حذف کردیم. الان زمان مناسبی است که درباره آن ویژگیها تجدید نظر کنید و تحلیل کنید. که آیا آنها بر روی صحت کلی مدل تاثیری دارند. ” SellerG ” ممکن است یک ویژگی جالب برای اضافه کردن به مدل باشد به خاطر اینکه احتمالا شرکت معاملات املاکی که ملک را میفروشد بر روی قیمت نهایی فروش تاثیر داشته باشد.
برعکس، حذف ویژگیها از مدل فعلی ممکن است زمان پردازش را، بدون کاهش چشمگیر دقت، کاهش بدهد، یا حتی دقت را بهبود ببخشد. برای انتخاب موثر ویژگیها، بهتر است که تغییرات ویژگیها را به تفکیک انجام دهید و نتایج را تحلیل کنید، به جای آنکه یک دفعه چندین تغییر را اعمال کنید.
Forwarded from هوشیو | رسانه تخصصی هوش مصنوعی
Media is too big
VIEW IN TELEGRAM
💠محیط کار واقعیت مجازی فیسبوک و آشنایی با آن
✅با محیط کار واقعیت مجازی فیسبوک که توسط این شرکت طراحی شده و به آزمایش گذاشته شده است، افرادی که هدست Oculus Quest 2 دارند، میتوانند در قالب آواتارهایشان در جلسات کاری شرکت کنند.
⚡️فیسبوک این دستاورد را گامی در جهت ساخت همان دنیای آرمانی میداند که مارک زاکربرگ چند هفته پیش از آن سخن گفت.
📌 برای خواندن متن کامل مقاله به لینک زیر مراجعه کنید:
🔗 hooshio.com/?p=17328
جدیدترین اخبار و مقالات هوش مصنوعی را در کانال هوشیو بخوانید:
🆔@hooshio
✅با محیط کار واقعیت مجازی فیسبوک که توسط این شرکت طراحی شده و به آزمایش گذاشته شده است، افرادی که هدست Oculus Quest 2 دارند، میتوانند در قالب آواتارهایشان در جلسات کاری شرکت کنند.
⚡️فیسبوک این دستاورد را گامی در جهت ساخت همان دنیای آرمانی میداند که مارک زاکربرگ چند هفته پیش از آن سخن گفت.
📌 برای خواندن متن کامل مقاله به لینک زیر مراجعه کنید:
🔗 hooshio.com/?p=17328
جدیدترین اخبار و مقالات هوش مصنوعی را در کانال هوشیو بخوانید:
🆔@hooshio
This media is not supported in your browser
VIEW IN TELEGRAM
#یادگیری_ماشین
درختهای تصمیم
این حقیقت که شبکههای عصبی (به نسبت دیگر تکنیک ها) بر روی طیف گستردهای از مسائل یادگیری ماشین قابل اجرا است، باعث شده که برخی دانشمندان، شبکههای عصبی را، به عنوان الگوریتم یادگیری ماشین نهایی و برتر برشمارند. با این حال، این به این معنا نیست که شبکههای عصبی یک راه حل ساده و حتمی برای تمامی مسائل پیچیده است. در موارد مختلفی، شبکههای عصبی دچار مشکل شده و درختهای تصمیم به عنوان جایگزین مناسبی مطرح میشوند. نیاز شبکههای عصبی به دادههای حجیم و منابع محاسباتی قوی معضلی بزرگ است. تنها پس از آموزش بر روی میلیونها داده برچسب دار، موتور شناسایی تصاویر گوگل، امکان تشخیص اشیا ساده (مثل ماشینها) با دقت بالا را پیدا میکند. ولی چه تعداد تصویر ماشین، نیاز است تا به یک بچه چهار ساله معمولی نشان بدهید تا آن را بشناسد؟
ساخت درخت تصمیم
جنگلهای تصادفی
درختهای تصمیم
این حقیقت که شبکههای عصبی (به نسبت دیگر تکنیک ها) بر روی طیف گستردهای از مسائل یادگیری ماشین قابل اجرا است، باعث شده که برخی دانشمندان، شبکههای عصبی را، به عنوان الگوریتم یادگیری ماشین نهایی و برتر برشمارند. با این حال، این به این معنا نیست که شبکههای عصبی یک راه حل ساده و حتمی برای تمامی مسائل پیچیده است. در موارد مختلفی، شبکههای عصبی دچار مشکل شده و درختهای تصمیم به عنوان جایگزین مناسبی مطرح میشوند. نیاز شبکههای عصبی به دادههای حجیم و منابع محاسباتی قوی معضلی بزرگ است. تنها پس از آموزش بر روی میلیونها داده برچسب دار، موتور شناسایی تصاویر گوگل، امکان تشخیص اشیا ساده (مثل ماشینها) با دقت بالا را پیدا میکند. ولی چه تعداد تصویر ماشین، نیاز است تا به یک بچه چهار ساله معمولی نشان بدهید تا آن را بشناسد؟
ساخت درخت تصمیم
جنگلهای تصادفی
#یادگیری_ماشین
مدل سازی گروهی (یادگیری گروهی)
یکی از موثرترین شیوههای یادگیری ماشین، مدلسازی گروهی است. که همچنین به عنوان “گروهها” نیز شناخته می شود. مدلسازی گروهی، برای ساخت مدل پیشبینی کننده یکپارچه، تکنیکهای آماری را ترکیب میکند. مدلسازی گروهی، با ترکیب پیشبینیها و دنبال کردن دانش گروه است که یک دسته بندی نهایی یا خروجی با پیشبینی بهتر را ارائه میدهد.
مدل سازی گروهی (یادگیری گروهی)
یکی از موثرترین شیوههای یادگیری ماشین، مدلسازی گروهی است. که همچنین به عنوان “گروهها” نیز شناخته می شود. مدلسازی گروهی، برای ساخت مدل پیشبینی کننده یکپارچه، تکنیکهای آماری را ترکیب میکند. مدلسازی گروهی، با ترکیب پیشبینیها و دنبال کردن دانش گروه است که یک دسته بندی نهایی یا خروجی با پیشبینی بهتر را ارائه میدهد.
#یادگیری_ماشین
ساخت مدل با پایتون
پس از بررسی زیربنای آماری تعداد زیادی از الگوریتمها، زمان آن رسیده که یک مدل یادگیری ماشین واقعی بسازیم. با اینکه انتخابهای متنوعی برای زبان برنام هنویسی وجود دارد (همان طور که قبلاً در مورد آن بحث شد)، برای این تمرین از پایتون استفاده میکنیم چرا که یادگیری آن سریع است و برای تغییر و کار با مجموعه دادههای بزرگ، مفید و مناسب است. اگر هیچ تجربهای در برنامهنویسی با پایتون ندارید، اصلاً لازم نیست نگران باشید. هدف اصلی این فصل درک روش و قدمهای لازم برای ساخت یک مدل یادگیری ماشین ساده است.
آمادهسازی محیط کدنویسی
بارگذاری مجموعه داده
پاکسازی مجموعه داده
فرآیند پاکسازی
تقسیم مجموعه داده
انتخاب الگوریتم و تنظیم ابرپارامترها
ارزیابی نتایج
ساخت مدل با پایتون
پس از بررسی زیربنای آماری تعداد زیادی از الگوریتمها، زمان آن رسیده که یک مدل یادگیری ماشین واقعی بسازیم. با اینکه انتخابهای متنوعی برای زبان برنام هنویسی وجود دارد (همان طور که قبلاً در مورد آن بحث شد)، برای این تمرین از پایتون استفاده میکنیم چرا که یادگیری آن سریع است و برای تغییر و کار با مجموعه دادههای بزرگ، مفید و مناسب است. اگر هیچ تجربهای در برنامهنویسی با پایتون ندارید، اصلاً لازم نیست نگران باشید. هدف اصلی این فصل درک روش و قدمهای لازم برای ساخت یک مدل یادگیری ماشین ساده است.
آمادهسازی محیط کدنویسی
بارگذاری مجموعه داده
پاکسازی مجموعه داده
فرآیند پاکسازی
تقسیم مجموعه داده
انتخاب الگوریتم و تنظیم ابرپارامترها
ارزیابی نتایج
Forwarded from هشتگ تبلیغ تخصصی
🧠دوره تخصصی ((هوش مصنوعی و علوم داده با پایتون))🧠
🔷 ۵۰ ساعت آموزش آنلاین(پایتون ، هوش مصنوعی، علم داده)
✅ اساتید با تجربه و فعال در اقصاد داخل و خارج
✅ کاملا پروژه محور و مورد نیاز بازار کار روز
✅ اعطای مدرک دو زبانه قابل اعتبار سنجی از آموزشگاه
🔵🔵 استخدام دانشجویان منتخب پس از اتمام دوره
✅✅ تضمین کیفیت و قیمت دوره (بازگشت وجه در صورت نارضایتی دانشجو حتی تا آخرین جلسه کلاس)
✅ گروه پرسش و پاسخ و رفع اشکال تخصصی با استاد
✅ پشتبانی فنی ۲۴ ساعته
✅استریم وبینار با کیفیت full hd و با سرعت بالا در بستر اینترنت ملی
✅ قرار گرفتن ویدئو های هر جلسه در اختیار دانشجویان
📅 شروع دوره از دوشنبه ۸ شهریور
⏰ دوشنبه ها و پنجشنبه ها ساعت ۱۸:۰۰ الی ۲۰:۰۰
🔥🔥۳ کد تخفیف جدید ۱/۰۰۰/۰۰۰ تومانی ویژه دانشجویان
کد تخفیف را در صورت موجود بودن از پشتیبانی تهیه کنید
👩💻پشتیبانی و دریافت کد تخفیف
@bdemy_support
☎️ مشاوره رایگان:
09122956841
📡 کانال آموزشگاه
📱اینستاگرام آموزشگاه
✅برای ثبت نام کلیک کنید
https://evnd.co/0RoAM
🔷 ۵۰ ساعت آموزش آنلاین(پایتون ، هوش مصنوعی، علم داده)
✅ اساتید با تجربه و فعال در اقصاد داخل و خارج
✅ کاملا پروژه محور و مورد نیاز بازار کار روز
✅ اعطای مدرک دو زبانه قابل اعتبار سنجی از آموزشگاه
🔵🔵 استخدام دانشجویان منتخب پس از اتمام دوره
✅✅ تضمین کیفیت و قیمت دوره (بازگشت وجه در صورت نارضایتی دانشجو حتی تا آخرین جلسه کلاس)
✅ گروه پرسش و پاسخ و رفع اشکال تخصصی با استاد
✅ پشتبانی فنی ۲۴ ساعته
✅استریم وبینار با کیفیت full hd و با سرعت بالا در بستر اینترنت ملی
✅ قرار گرفتن ویدئو های هر جلسه در اختیار دانشجویان
📅 شروع دوره از دوشنبه ۸ شهریور
⏰ دوشنبه ها و پنجشنبه ها ساعت ۱۸:۰۰ الی ۲۰:۰۰
🔥🔥۳ کد تخفیف جدید ۱/۰۰۰/۰۰۰ تومانی ویژه دانشجویان
کد تخفیف را در صورت موجود بودن از پشتیبانی تهیه کنید
👩💻پشتیبانی و دریافت کد تخفیف
@bdemy_support
☎️ مشاوره رایگان:
09122956841
📡 کانال آموزشگاه
📱اینستاگرام آموزشگاه
✅برای ثبت نام کلیک کنید
https://evnd.co/0RoAM
This media is not supported in your browser
VIEW IN TELEGRAM
#یادگیری_ماشین
تحلیل رگرسیون
فرض کنید سال 2015 است و دوباره به دبیرستان برگشتهاید. سال آخر، تیتر خبری نظرتان را به بیتکوین جلب میکند. با توجه به میل طبیعیتان برای دنبال کردن موضوعات جدید و احتمالا پول ساز، درباره امید و آرزوهایتان در زمینه رمزنگاری و سودآوری آن با خانواده صحبت میکنید. ولی قبل از اینکه فرصتی داشته باشید تا روی اولین بیتکوینتان در Coinbase پیشنهاد بگذارید، پدرتان مداخله کرده و اصرار دارد تا قبل از اینکه روی پس اندازهایتان ریسک کنید، یک معامله کاغذی را تجربه کنید. “معامله کاغذی” استفاده از سرمایههای شبیهسازی شده برای خرید و فروش یا سرمایه گذاری، بدون درگیرکردن پول واقعی است. پس در طی بیست و چهار ماه آینده، ارزش بیتکوین را دنبال میکنید. و ارزش آن را در بازههای منظمی مینویسید. همچنین تعداد روزهای گذشته از زمانی که معامله کاغذی را آغاز کردید، ثبت میکنید. هرگز فکر نمیکردید که پس از دو سال همچنان مشغول معامله کاغذی باشید، ولی متاسفانه، هرگز فرصتی برای ورود به بازار رمزنگاری نیافتید. طبق پیشنهاد پدرتان، منتظر ماندید تا ارزش بیتکوین به میزانی که قادر به خرید آن باشید کاهش پیدا کند. ولی در عوض، ارزش بیتکوین رشد زیادی میکند. با این حال، امید به اینکه یک روز صاحب بیتکوین بشوید را از دست نمیدهید. برای کمک به تصمیم اینکه آیا برای سقوط ارزش بیتکوین صبر میکنید یا یک روش سرمایهگذاری جایگزین پیدا میکنید، به سراغ تحلیل آماری میروید.
مثال محاسباتی
رگرسیون منطقی
ماشین بردار پشتیبان
تحلیل رگرسیون
فرض کنید سال 2015 است و دوباره به دبیرستان برگشتهاید. سال آخر، تیتر خبری نظرتان را به بیتکوین جلب میکند. با توجه به میل طبیعیتان برای دنبال کردن موضوعات جدید و احتمالا پول ساز، درباره امید و آرزوهایتان در زمینه رمزنگاری و سودآوری آن با خانواده صحبت میکنید. ولی قبل از اینکه فرصتی داشته باشید تا روی اولین بیتکوینتان در Coinbase پیشنهاد بگذارید، پدرتان مداخله کرده و اصرار دارد تا قبل از اینکه روی پس اندازهایتان ریسک کنید، یک معامله کاغذی را تجربه کنید. “معامله کاغذی” استفاده از سرمایههای شبیهسازی شده برای خرید و فروش یا سرمایه گذاری، بدون درگیرکردن پول واقعی است. پس در طی بیست و چهار ماه آینده، ارزش بیتکوین را دنبال میکنید. و ارزش آن را در بازههای منظمی مینویسید. همچنین تعداد روزهای گذشته از زمانی که معامله کاغذی را آغاز کردید، ثبت میکنید. هرگز فکر نمیکردید که پس از دو سال همچنان مشغول معامله کاغذی باشید، ولی متاسفانه، هرگز فرصتی برای ورود به بازار رمزنگاری نیافتید. طبق پیشنهاد پدرتان، منتظر ماندید تا ارزش بیتکوین به میزانی که قادر به خرید آن باشید کاهش پیدا کند. ولی در عوض، ارزش بیتکوین رشد زیادی میکند. با این حال، امید به اینکه یک روز صاحب بیتکوین بشوید را از دست نمیدهید. برای کمک به تصمیم اینکه آیا برای سقوط ارزش بیتکوین صبر میکنید یا یک روش سرمایهگذاری جایگزین پیدا میکنید، به سراغ تحلیل آماری میروید.
مثال محاسباتی
رگرسیون منطقی
ماشین بردار پشتیبان
#یادگیری_ماشین
خوشه بندی
یکی از شیوههای تحلیل اطلاعات، خوشهبندی دادهها براساس ویژگیهای مشترکشان است. برای مثال، شرکتتان بخشی از مشتریان که در زمان مشابه خرید میکنند را بررسی کرده و عوامل موثر در رفتار خرید آنها را پیدا میکند.
درک ویژگیهای یک خوشه از مشتریان، در تصمیمگیریها مفید است.اینکه از طریق تبلیغات چه محصولی را به چه گروهی از مشتریان پیشنهاد بدهید. به جز تحقیقات بازاریابی، خوشه بندی در سناریوهای دیگر، از جمله شناسایی الگو، تشخیص تقلب و پردازش تصویر قابل استفاده است.
تحلیل خوشه بندی در هر دو دسته یادگیری بانظارت و یادگیری بدون نظارت قرار میگیرد. به عنوان یک روش یادگیری بانظارت، از خوشه بندی (به کمک الگوریتم K نزدیک ترین همسایه) برای دسته بندی نقاط داده جدید در خوشههای موجود استفاده میکند و به عنوان یک روش یادگیری بدون نظارت، خوشه بندی برای شناسایی گروههای گسسته از نقاط داده (به کمک الگوریتم K-Means) مورد استفاده قرار میگیرند. با اینکه مدلهای دیگری از تکنیکها خوشه بندی وجود دارند، ولی این دو الگوریتم، معروفترینها در هر دو زمینه یادگیری ماشین و دادهکاوی هستند.
خوشه بندی
یکی از شیوههای تحلیل اطلاعات، خوشهبندی دادهها براساس ویژگیهای مشترکشان است. برای مثال، شرکتتان بخشی از مشتریان که در زمان مشابه خرید میکنند را بررسی کرده و عوامل موثر در رفتار خرید آنها را پیدا میکند.
درک ویژگیهای یک خوشه از مشتریان، در تصمیمگیریها مفید است.اینکه از طریق تبلیغات چه محصولی را به چه گروهی از مشتریان پیشنهاد بدهید. به جز تحقیقات بازاریابی، خوشه بندی در سناریوهای دیگر، از جمله شناسایی الگو، تشخیص تقلب و پردازش تصویر قابل استفاده است.
تحلیل خوشه بندی در هر دو دسته یادگیری بانظارت و یادگیری بدون نظارت قرار میگیرد. به عنوان یک روش یادگیری بانظارت، از خوشه بندی (به کمک الگوریتم K نزدیک ترین همسایه) برای دسته بندی نقاط داده جدید در خوشههای موجود استفاده میکند و به عنوان یک روش یادگیری بدون نظارت، خوشه بندی برای شناسایی گروههای گسسته از نقاط داده (به کمک الگوریتم K-Means) مورد استفاده قرار میگیرند. با اینکه مدلهای دیگری از تکنیکها خوشه بندی وجود دارند، ولی این دو الگوریتم، معروفترینها در هر دو زمینه یادگیری ماشین و دادهکاوی هستند.
#یادگیری_ماشین
بایاس و واریانس
یک چالش همیشگی در یادگیری ماشین، زیربرازش و بیشبرازش است، که نشان میدهد یک مدل چه قدر به الگوهای واقعی مجموعه داده نزدیک است. برای درک زیربرازش و پیشبردازش، باید ابتدا بایاس و واریانس را درک کنید.
بایاس به فاصله بین مقدار پیشبینی شده با مقدار واقعی اشاره دارد. در حالتی که بایاس زیاد است، به احتمال زیاد پیشبینیها، در یک مسیر دور از مقادیر واقعی، تغییر جهت داده است. واریانس توصیف میکند.که مقادیر پیشبینی شده چه میزان پراکنده هستند
بایاس و واریانس
یک چالش همیشگی در یادگیری ماشین، زیربرازش و بیشبرازش است، که نشان میدهد یک مدل چه قدر به الگوهای واقعی مجموعه داده نزدیک است. برای درک زیربرازش و پیشبردازش، باید ابتدا بایاس و واریانس را درک کنید.
بایاس به فاصله بین مقدار پیشبینی شده با مقدار واقعی اشاره دارد. در حالتی که بایاس زیاد است، به احتمال زیاد پیشبینیها، در یک مسیر دور از مقادیر واقعی، تغییر جهت داده است. واریانس توصیف میکند.که مقادیر پیشبینی شده چه میزان پراکنده هستند
This media is not supported in your browser
VIEW IN TELEGRAM