آموزش پایتون
88 subscribers
281 photos
21 videos
81 files
178 links
ارتباط با ما:
@learnpythonicyBot

لینک گروه چت:
https://t.me/learnpythonicychat

لینک چنل ایتا:
https://eitaa.com/learnpythonicy
Download Telegram
آموزش پایتون
🐍 #Day18 — Data Cleaning & Data Preparation داده‌های واقعی همیشه تمیز و آماده تحلیل نیستند! امروز قرار است نقش یک Data Analyst را بازی کنیم و یک دیتاست خام را آماده کنیم. 🎯 Challenge: Clean a Real-World Sales Dataset در این تمرین ابتدا باید یک فایل به نام:…
بر اساس فایل sales_raw.csv، جواب چالش به این شکل میشود:
🐍 Day 18.
Data Cleaning & Data Preparation Result
📂 Dataset Analysis
ابتدا فایل sales_raw.csv با استفاده از Pandas خوانده شد.
import pandas as pd

df = pd.read_csv("sales_raw.csv")

Dataset Size:
Original rows: 15,150
Columns: 9

🔍 Data Quality Check
1. Missing Values
بررسی مقادیر خالی:
Region: 2510
Price: 23

2. Duplicate Rows
تعداد ردیف‌های تکراری:
Duplicate rows: 150

3. Data Type Check
قبل از پاکسازی:
Date      object
Price float64
Quantity int64
Revenue int64

ستون Date نیاز به تبدیل به فرمت استاندارد تاریخ داشت.
🧹 Data Cleaning Process
حذف داده‌های تکراری:
df = df.drop_duplicates()

نتیجه:
Removed duplicates: 150 rows

تبدیل تاریخ:
df["Date"] = pd.to_datetime(
df["Date"],
errors="coerce"
)

تاریخ‌های نامعتبر:
Invalid dates: 10

حذف رکوردهای ناقص:
رکوردهایی که اطلاعات ضروری مثل:
Price
Region
Date
را نداشتند حذف شدند.
ساخت ستون Revenue:
df["Revenue"] = df["Quantity"] * df["Price"]

Final Result
قبل از پاکسازی:
Rows: 15,150

بعد از پاکسازی:
Clean rows: 12,482

Missing values:
0

Duplicate rows:
0

💡 Key Learning
داده خام همیشه قابل استفاده برای Machine Learning نیست.
قبل از ساخت هر مدل AI باید:
Collect → Clean → Prepare → Train
را انجام دهیم.
یک مدل قوی با داده ضعیف نمی‌تواند نتیجه خوبی بدهد.
#Pandas #DataCleaning #DataScience #MachineLearning