Channel name was changed to Β«Data Science | Machine Learning | AI |Data_DosΒ»
π New Article: "When Algebra Meets AI β Applying Machine Learning to Group Theory"
As part of my ongoing research collaboration with the Max Planck Institute and CNRS-UniversitΓ© Paris-Saclay, I wrote a piece on one of the most fascinating intersections I've encountered in my work.
Why would a machine learning model care about abstract algebra?
Turns out β it cares a lot.
In the article I cover:
β What group theory is and why it matters
β How neural networks and RL can guide mathematical discovery
β Real-world implications: cryptography, quantum computing, drug discovery
β What this research has taught me about science at the borders of disciplines
8 min read. Written for both technical and non-technical audiences.
Link in bio π
#MachineLearning #Mathematics #GroupTheory #Research #DataScience #AI
As part of my ongoing research collaboration with the Max Planck Institute and CNRS-UniversitΓ© Paris-Saclay, I wrote a piece on one of the most fascinating intersections I've encountered in my work.
Why would a machine learning model care about abstract algebra?
Turns out β it cares a lot.
In the article I cover:
β What group theory is and why it matters
β How neural networks and RL can guide mathematical discovery
β Real-world implications: cryptography, quantum computing, drug discovery
β What this research has taught me about science at the borders of disciplines
8 min read. Written for both technical and non-technical audiences.
Link in bio π
#MachineLearning #Mathematics #GroupTheory #Research #DataScience #AI
β€22π17π₯14π13π9β‘1
Data Science | Machine Learning | AI |Data_Dos
π New Article: "When Algebra Meets AI β Applying Machine Learning to Group Theory" As part of my ongoing research collaboration with the Max Planck Institute and CNRS-UniversitΓ© Paris-Saclay, I wrote a piece on one of the most fascinating intersections I'veβ¦
article001_ml_group_theory.pdf
340.6 KB
π162
Data Science | Machine Learning | AI |Data_Dos
π New Article: "When Algebra Meets AI β Applying Machine Learning to Group Theory" As part of my ongoing research collaboration with the Max Planck Institute and CNRS-UniversitΓ© Paris-Saclay, I wrote a piece on one of the most fascinating intersections I'veβ¦
Medium
When Algebra Meets AI -Applying Machine Learning to Group Theory
In 2021, a landmark paper from DeepMind demonstrated that machine learning models could generate and verify mathematical conjectures ββ¦
β‘1
ChatGPT 1 milliard foydalanuvchiga yetdi - va bu tarix yaratdi π€―
Bir soniya to'xtab o'ylang.
3.5 yil. Noldan - 1,000,000,000 ta oylik foydalanuvchiga.
Taqqoslang:
π€ ChatGPT - 3.5 yil
πΈ Instagram - ~7 yil
π Facebook - 8 yil
π Google Search - ~20 yil
Insoniyat tarixida birorta dastur bu qadar tez bu qadar ko'p odamga yetmagan.
2022 yil noyabrda chiqdi. Birinchi hafta odamlar "qiziqarli o'yinchoq" deb o'yladi. 2023 yilda dunyo tushundi - bu o'yinchoq emas. 2024 da kompaniyalar integratsiya qila boshladi. 2025 da hukumatlar qonun chiqara boshladi. 2026 may - 1 milliard.
Men uchun eng qiziqarli raqam bu emas.
1 mlrd foydalanuvchi = 1 mlrd kunlik suhbat = insoniyatning eng katta real-time behavioral dataset i. ChatGPT shu ma'lumotlardan o'rganib, yanada aqlliroq bo'lib bormoqda. Bu - flywheel. To'xtamaydi.
O'zingiz haqingizda toΚ»gΚ»ri javob bering: ChatGPT ni ishda yoki o'qishda ishlatasizmi? π
#ChatGPT #AI #OpenAI #MachineLearning #Uzbek #Tech
Bir soniya to'xtab o'ylang.
3.5 yil. Noldan - 1,000,000,000 ta oylik foydalanuvchiga.
Taqqoslang:
π€ ChatGPT - 3.5 yil
πΈ Instagram - ~7 yil
π Facebook - 8 yil
π Google Search - ~20 yil
Insoniyat tarixida birorta dastur bu qadar tez bu qadar ko'p odamga yetmagan.
2022 yil noyabrda chiqdi. Birinchi hafta odamlar "qiziqarli o'yinchoq" deb o'yladi. 2023 yilda dunyo tushundi - bu o'yinchoq emas. 2024 da kompaniyalar integratsiya qila boshladi. 2025 da hukumatlar qonun chiqara boshladi. 2026 may - 1 milliard.
Men uchun eng qiziqarli raqam bu emas.
1 mlrd foydalanuvchi = 1 mlrd kunlik suhbat = insoniyatning eng katta real-time behavioral dataset i. ChatGPT shu ma'lumotlardan o'rganib, yanada aqlliroq bo'lib bormoqda. Bu - flywheel. To'xtamaydi.
O'zingiz haqingizda toΚ»gΚ»ri javob bering: ChatGPT ni ishda yoki o'qishda ishlatasizmi? π
#ChatGPT #AI #OpenAI #MachineLearning #Uzbek #Tech
π30π₯27π25β€24π20
O'zbekistondan global DS ish - realmi? π
Ha. Lekin "LinkedIn da apply qilish" dan ko'ra ko'proq narsa kerak.
Eng katta xato nima?
Odamlar texnik ko'nikmaga 100% vaqt sarflaydi - lekin ko'rinarlikka 0%. Holbuki recruiter sizi topa olmasa, eng yaxshi Data Scientist ham ishsiz qoladi.
Mening 6 ta tavsiyam:
1οΈβ£ GitHub ni professional qiling
Pinned repo, README, vizualizatsiya. Recruiter birinchi GitHub ni ochadi.
2οΈβ£ LinkedIn ni "Open to Work" ga o'tkazing
"Data Scientist | Python | ML | SQL" - kalit so'zlar bilan. Recruiter aynan shu so'zlarni qidiradi.
3οΈβ£ Kaggle Expert/Master bo'ling
Xalqaro e'tirof. CV da juda kuchli.
4οΈβ£ Inglizcha maqola yozing
"Data Scientist from Uzbekistan" - unique story. Men o'zim tekshirdim - bir maqola o'nlab direct message keltiradi.
5οΈβ£ Remote-first kompaniyalarga apply qiling
Remote.com, Toptal, Turing - visa kerak emas. MaΠΎΡ mahalliy bozordan 5-10x yuqori bo'lishi mumkin.
6οΈβ£ Cold outreach dan qo'rqmang
10 tadan 1-2 tasi javob beradi. Bu yetarli.
Ha. Lekin "LinkedIn da apply qilish" dan ko'ra ko'proq narsa kerak.
Eng katta xato nima?
Odamlar texnik ko'nikmaga 100% vaqt sarflaydi - lekin ko'rinarlikka 0%. Holbuki recruiter sizi topa olmasa, eng yaxshi Data Scientist ham ishsiz qoladi.
Mening 6 ta tavsiyam:
1οΈβ£ GitHub ni professional qiling
Pinned repo, README, vizualizatsiya. Recruiter birinchi GitHub ni ochadi.
2οΈβ£ LinkedIn ni "Open to Work" ga o'tkazing
"Data Scientist | Python | ML | SQL" - kalit so'zlar bilan. Recruiter aynan shu so'zlarni qidiradi.
3οΈβ£ Kaggle Expert/Master bo'ling
Xalqaro e'tirof. CV da juda kuchli.
4οΈβ£ Inglizcha maqola yozing
"Data Scientist from Uzbekistan" - unique story. Men o'zim tekshirdim - bir maqola o'nlab direct message keltiradi.
5οΈβ£ Remote-first kompaniyalarga apply qiling
Remote.com, Toptal, Turing - visa kerak emas. MaΠΎΡ mahalliy bozordan 5-10x yuqori bo'lishi mumkin.
6οΈβ£ Cold outreach dan qo'rqmang
10 tadan 1-2 tasi javob beradi. Bu yetarli.
π»75π40π₯33β€31π29π€©27π₯°25π20πΎ1
OpenAI yangi GPT-5.6 chiqardi. 3 xil model. 3 xil narx. π€―
Sol - eng aqlli flagship.
Terra - balans va narx o'rtasi.
Luna - tez, arzimas, ommaviy.
Narxlar?
Sol: $5/1M token
Terra: $2.5/1M token
Luna: $1/1M token
Taqqoslang - Claude Fable 5: $11/1M. Gemini 3.5 Pro: hali chiqmadi. π
Lekin eng muhim raqam bu emas.
2023 yilda shu darajadagi AI uchun $100 to'lardingiz.
Bugun - $1.
10x arzonlashdi. Bir yilda.
Bu nima degani?
Kichik kompaniyalar ishlatadi.
Startaplar ishlatadi.
Talabalar ishlatadi.
O'zbekistondagi developer ham ishlatadi.
AI demokratlashmoqda.
Sol - eng aqlli flagship.
Terra - balans va narx o'rtasi.
Luna - tez, arzimas, ommaviy.
Narxlar?
Sol: $5/1M token
Terra: $2.5/1M token
Luna: $1/1M token
Taqqoslang - Claude Fable 5: $11/1M. Gemini 3.5 Pro: hali chiqmadi. π
Lekin eng muhim raqam bu emas.
2023 yilda shu darajadagi AI uchun $100 to'lardingiz.
Bugun - $1.
10x arzonlashdi. Bir yilda.
Bu nima degani?
Kichik kompaniyalar ishlatadi.
Startaplar ishlatadi.
Talabalar ishlatadi.
O'zbekistondagi developer ham ishlatadi.
AI demokratlashmoqda.
π42β€29πΎ1
LinkedIn da recruiter sizni topsinmi?
Bitta narsa yetishmaydi. π―
Ko'pchilik LinkedIn profil ochadi.
Rasm qo'yadi. Ism yozadi. Kutadi.
Recruiter kelmaydi. π¦
Sababi oddiy.
LinkedIn - qidiruv tizimi.
Recruiter "Data Scientist Uzbekistan" yozmaydi.
U "Python | ML | SQL | NLP" yozadi.
Siz bu so'zlarni profilingizda yozdingizmi?
4 ta narsa - bugunoq o'zgartiring:
β Headline
"Data Scientist | Python | ML | SQL"
Ism emas - kalit so'zlar.
β About section
3 ta natija - raqam bilan.
"20% daromad o'sishiga hissa qo'shdim"
"$50K qo'shimcha daromad keltirdim"
Raqamsiz narsa - yo'q narsa.
β Skills bo'limi
Top 5 skill = top 5 qidiruv so'zi.
"Machine Learning", "Python", "SQL", "Data Analysis", "NLP"
β Open to Work - yashirin rejim
Faqat recruiterlar ko'radi.
Hozirgi ish joyingiz bilmaydi.
Hammasi bepul. Hammasi 30 daqiqa.
CV emas - kalit so'zlar ish olib keladi.
Profilingiz linkini kommentga qoldiring - ko'rib beraman π
Bitta narsa yetishmaydi. π―
Ko'pchilik LinkedIn profil ochadi.
Rasm qo'yadi. Ism yozadi. Kutadi.
Recruiter kelmaydi. π¦
Sababi oddiy.
LinkedIn - qidiruv tizimi.
Recruiter "Data Scientist Uzbekistan" yozmaydi.
U "Python | ML | SQL | NLP" yozadi.
Siz bu so'zlarni profilingizda yozdingizmi?
4 ta narsa - bugunoq o'zgartiring:
β Headline
"Data Scientist | Python | ML | SQL"
Ism emas - kalit so'zlar.
β About section
3 ta natija - raqam bilan.
"20% daromad o'sishiga hissa qo'shdim"
"$50K qo'shimcha daromad keltirdim"
Raqamsiz narsa - yo'q narsa.
β Skills bo'limi
Top 5 skill = top 5 qidiruv so'zi.
"Machine Learning", "Python", "SQL", "Data Analysis", "NLP"
β Open to Work - yashirin rejim
Faqat recruiterlar ko'radi.
Hozirgi ish joyingiz bilmaydi.
Hammasi bepul. Hammasi 30 daqiqa.
CV emas - kalit so'zlar ish olib keladi.
Profilingiz linkini kommentga qoldiring - ko'rib beraman π
π85β€29π20πΎ1
"Nima o'rganay?" deb so'rasangiz -
Javob: Python. Savol yo'q. π
Har hafta birov so'raydi:
"Python yaxshimi? R-chi? Yoki Java?"
Men har doim bir xil javob beraman.
Python - DS ning ona tili.
import pandas as pd
# 2 so'z - million imkoniyat
Boshqalar haqida:
π R - statistikchilar uchun ajoyib. Lekin ish bozori Python so'raydi.
βοΈ Java/C++ - tezkor, kuchli. Lekin ML uchun ishlatish - pichoq bilan tirnoq olish. π
π¦ Rust - kelajak, shubhasiz. Lekin hozircha Kaggle da birorta Rust notebook ko'rmadim.
Nima uchun Python?
β sklearn, pandas, numpy, torch - hammasi Python
β Kaggle da 97% notebook β Python
β Asoslarni 2-4 haftada o'rganish mumkin
β DS vakansiyalarining 90%+ - Python so'raydi
Til muhokamasi - vaqt o'ldirish.
Kod yozish - vaqt tejash.
Javob: Python. Savol yo'q. π
Har hafta birov so'raydi:
"Python yaxshimi? R-chi? Yoki Java?"
Men har doim bir xil javob beraman.
Python - DS ning ona tili.
import pandas as pd
# 2 so'z - million imkoniyat
Boshqalar haqida:
π R - statistikchilar uchun ajoyib. Lekin ish bozori Python so'raydi.
βοΈ Java/C++ - tezkor, kuchli. Lekin ML uchun ishlatish - pichoq bilan tirnoq olish. π
π¦ Rust - kelajak, shubhasiz. Lekin hozircha Kaggle da birorta Rust notebook ko'rmadim.
Nima uchun Python?
β sklearn, pandas, numpy, torch - hammasi Python
β Kaggle da 97% notebook β Python
β Asoslarni 2-4 haftada o'rganish mumkin
β DS vakansiyalarining 90%+ - Python so'raydi
Til muhokamasi - vaqt o'ldirish.
Kod yozish - vaqt tejash.
π42β€20πΎ2
Data Science ga qanday kirish mumkin? πΊ
Ko'pchilik menga shuni so'raydi: "Doston aka, qayerdan boshlashim kerak?"
Mana men tavsiya qiladigan 5 bosqich:
1οΈβ£ Python o'rgan - boshqa hamma narsa keyin
2οΈβ£ Pandas + NumPy - ma'lumot bilan ishlashni o'rgan
3οΈβ£ Statistika asoslari - chuqur emas, amaliy darajada
4οΈβ£ Machine Learning - Scikit-learn + Andrew Ng
5οΈβ£ Kaggle - real amaliyot, real portfolio
Eng ko'p qilinadigan xato: "hamma narsani o'rganib bo'lgandan keyin boshlayman" deb kutish.
Yo'q. Har bir bosqichda bitta loyiha yarating. Loyiha yo'q - bilim ham yo'q.
Men ham xuddi shunday boshlaganman - Finance foni bilan, dasturlash tajribasiz. Agar men qila olsam, siz ham qilasiz.
Ko'pchilik menga shuni so'raydi: "Doston aka, qayerdan boshlashim kerak?"
Mana men tavsiya qiladigan 5 bosqich:
1οΈβ£ Python o'rgan - boshqa hamma narsa keyin
2οΈβ£ Pandas + NumPy - ma'lumot bilan ishlashni o'rgan
3οΈβ£ Statistika asoslari - chuqur emas, amaliy darajada
4οΈβ£ Machine Learning - Scikit-learn + Andrew Ng
5οΈβ£ Kaggle - real amaliyot, real portfolio
Eng ko'p qilinadigan xato: "hamma narsani o'rganib bo'lgandan keyin boshlayman" deb kutish.
Yo'q. Har bir bosqichda bitta loyiha yarating. Loyiha yo'q - bilim ham yo'q.
Men ham xuddi shunday boshlaganman - Finance foni bilan, dasturlash tajribasiz. Agar men qila olsam, siz ham qilasiz.
π56πΎ2
Excel ustasi vs SQL biluvchi. Kim yutadi? π₯
Ofisda shu sahnani ko'rgansiz.
Biri Excel da 3 soat VLOOKUP bilan kurashadi. π€
Boshqasi SQL da 3 daqiqada shu ishni bitiradi.
Ikkalasi ham bir xil maosh oladi. Hozircha.
SELECT * FROM sales WHERE date > '2025-01-01';
β Bu - Excel da 47 ta klik.
Excel yomon emas. Lekin chegara bor.
β 1,000 qator - Excel ishlaydi
β 1,000,000 qator - Excel "javob bermayyapti" deydi π
β SQL - 100 million qatorda ham bir xil tezlikda
DS, analyst yoki PM bo'lmoqchimisiz?
SQL - birinchi o'rganadigan narsa.
Python ikkinchi.
Excel - kerak bo'lganda.
Excel - velosiped.
SQL - avtomobil.
Ikkalasini bilsangiz? Samolyot. βοΈ
Ofisda shu sahnani ko'rgansiz.
Biri Excel da 3 soat VLOOKUP bilan kurashadi. π€
Boshqasi SQL da 3 daqiqada shu ishni bitiradi.
Ikkalasi ham bir xil maosh oladi. Hozircha.
SELECT * FROM sales WHERE date > '2025-01-01';
β Bu - Excel da 47 ta klik.
Excel yomon emas. Lekin chegara bor.
β 1,000 qator - Excel ishlaydi
β 1,000,000 qator - Excel "javob bermayyapti" deydi π
β SQL - 100 million qatorda ham bir xil tezlikda
DS, analyst yoki PM bo'lmoqchimisiz?
SQL - birinchi o'rganadigan narsa.
Python ikkinchi.
Excel - kerak bo'lganda.
Excel - velosiped.
SQL - avtomobil.
Ikkalasini bilsangiz? Samolyot. βοΈ
π42π₯15πΎ1
ML_Algoritmlari_Uzbek.html
13.3 KB
ML algoritmlarini yodlash vs tushunish. Kim yutadi? π₯
Ko'pchilik shu xatoni qiladi.
Biri 14 ta algoritm nomini yodlab oladi. π€
Ammo qaysi birini qachon ishlatishni bilmaydi.
Boshqasi faqat 3 ta savolga javob beradi:
- Natija son (regressiya) yoki toifa (klassifikatsiya)mi?
- Datamda label bormi yoki yo'qmi?
- Nechta qator ma'lumotim bor?
β Shu 3 savol - 90% vaziyatda to'g'ri algoritmni tanlaydi.
Yodlash yomon emas. Lekin tushunish - kalit.
β Chiziqli Regressiya - narx bashorati uchun oddiy va tez
β XGBoost'ni har narsaga ishlatish - ortiqcha
β Random Forest - ko'pchilik holatda ishonchli boshlang'ich nuqta
Data Scientist, Analitik yoki ML muhandisi bo'lmoqchimisiz?
Regressiya va Klassifikatsiya - birinchi o'rganadigan narsa.
Klasterlash (K-Means, DBSCAN) - ikkinchi.
Boosting algoritmlari (XGBoost, LightGBM, CatBoost) - production uchun.
Oddiy model - velosiped. π²
Ensemble model - avtomobil. π
To'g'ri algoritmni tanlashni bilsangiz? Samolyot. βοΈ
Ko'pchilik shu xatoni qiladi.
Biri 14 ta algoritm nomini yodlab oladi. π€
Ammo qaysi birini qachon ishlatishni bilmaydi.
Boshqasi faqat 3 ta savolga javob beradi:
- Natija son (regressiya) yoki toifa (klassifikatsiya)mi?
- Datamda label bormi yoki yo'qmi?
- Nechta qator ma'lumotim bor?
β Shu 3 savol - 90% vaziyatda to'g'ri algoritmni tanlaydi.
Yodlash yomon emas. Lekin tushunish - kalit.
β Chiziqli Regressiya - narx bashorati uchun oddiy va tez
β XGBoost'ni har narsaga ishlatish - ortiqcha
β Random Forest - ko'pchilik holatda ishonchli boshlang'ich nuqta
Data Scientist, Analitik yoki ML muhandisi bo'lmoqchimisiz?
Regressiya va Klassifikatsiya - birinchi o'rganadigan narsa.
Klasterlash (K-Means, DBSCAN) - ikkinchi.
Boosting algoritmlari (XGBoost, LightGBM, CatBoost) - production uchun.
Oddiy model - velosiped. π²
Ensemble model - avtomobil. π
To'g'ri algoritmni tanlashni bilsangiz? Samolyot. βοΈ
π40πΎ15π€£14πΎ1
#Article1
Yaqinda Data Science bo'yicha 'Salary Prediction' loyihasi qildim. Ommaviy dataset asosida Data Scientist va Analytics mutaxassislarining maoshini bashorat qiluvchi model yaratdim.
Rostini aytsam, boshida Random Forest bemalol Linear Regressionni yutadi deb o'ylagandim.
Lekin... unday bo'lmadi. π
Avval datasetni ancha "qiynadim":
β 258 ta salary yozuvi
β 115 xil job title (ba'zilari bir xil lavozim, faqat nomi boshqacha π)
β Hammasini 8 ta asosiy guruhga ajratdim
β Missing value'larni tozaladim
β Outlier'larni tekshirdim
Shundan keyin ikkita modelni solishtirdim:
π Linear Regression
RΒ² = 0.27
MAE β $41.6k
π³ Random Forest
RΒ² = 0.24
MAE β $43.3k
Natija meni ham biroz hayron qoldirdi.
Ko'pchilik "murakkab model bo'lsa, demak yaxshiroq" deb o'ylaydi. Lekin Machine Learning'da bu har doim ham to'g'ri emas.
Dataset kichik bo'lsa, ba'zida oddiy model yaxshiroq ishlaydi. Random Forest esa bu safar qo'shimcha murakkablik qo'shdi, lekin natijani yaxshilay olmadi.
Bu loyiha menga yana bir narsani eslatdi:
π§Ή Data cleaning ko'pincha modelning o'zidan ham muhimroq.
Real hayotda vaqtning katta qismi model tanlashga emas, balki:
- ma'lumotlarni tozalashga,
- noto'g'ri yozilgan qiymatlarni tuzatishga,
- missing value'larni to'ldirishga,
- feature engineering qilishga ketadi.
Kaggle'dagi mashhur gap bor:
Bu loyiha ham aynan shuni yana bir bor isbotladi. π
π GitHub repository va to'liq maqolani izohlarda qoldiraman.
https://dev.to/dostonbek_ur/what-i-learned-predicting-data-scientist-salaries-from-a-messy-public-dataset-18p0
https://github.com/DostonUr/DataScience_Salary_Dos
https://medium.com/@urinovdostonbek/what-i-learned-predicting-data-scientist-salaries-from-a-messy-public-dataset-16e6a296ba3d
https://www.kaggle.com/dostonur/datasets?page=2
Yaqinda Data Science bo'yicha 'Salary Prediction' loyihasi qildim. Ommaviy dataset asosida Data Scientist va Analytics mutaxassislarining maoshini bashorat qiluvchi model yaratdim.
Rostini aytsam, boshida Random Forest bemalol Linear Regressionni yutadi deb o'ylagandim.
Lekin... unday bo'lmadi. π
Avval datasetni ancha "qiynadim":
β 258 ta salary yozuvi
β 115 xil job title (ba'zilari bir xil lavozim, faqat nomi boshqacha π)
β Hammasini 8 ta asosiy guruhga ajratdim
β Missing value'larni tozaladim
β Outlier'larni tekshirdim
Shundan keyin ikkita modelni solishtirdim:
π Linear Regression
RΒ² = 0.27
MAE β $41.6k
π³ Random Forest
RΒ² = 0.24
MAE β $43.3k
Natija meni ham biroz hayron qoldirdi.
Ko'pchilik "murakkab model bo'lsa, demak yaxshiroq" deb o'ylaydi. Lekin Machine Learning'da bu har doim ham to'g'ri emas.
Dataset kichik bo'lsa, ba'zida oddiy model yaxshiroq ishlaydi. Random Forest esa bu safar qo'shimcha murakkablik qo'shdi, lekin natijani yaxshilay olmadi.
Bu loyiha menga yana bir narsani eslatdi:
π§Ή Data cleaning ko'pincha modelning o'zidan ham muhimroq.
Real hayotda vaqtning katta qismi model tanlashga emas, balki:
- ma'lumotlarni tozalashga,
- noto'g'ri yozilgan qiymatlarni tuzatishga,
- missing value'larni to'ldirishga,
- feature engineering qilishga ketadi.
Kaggle'dagi mashhur gap bor:
"80% of Machine Learning is cleaning data."
Bu loyiha ham aynan shuni yana bir bor isbotladi. π
π GitHub repository va to'liq maqolani izohlarda qoldiraman.
https://dev.to/dostonbek_ur/what-i-learned-predicting-data-scientist-salaries-from-a-messy-public-dataset-18p0
https://github.com/DostonUr/DataScience_Salary_Dos
https://medium.com/@urinovdostonbek/what-i-learned-predicting-data-scientist-salaries-from-a-messy-public-dataset-16e6a296ba3d
https://www.kaggle.com/dostonur/datasets?page=2
DEV Community
What I Learned Predicting Data Scientist Salaries From a Messy Public Dataset
I've been asked some version of "how much should I expect to get paid as a data scientist" enough...
π70πΎ1
Data Science | Machine Learning | AI |Data_Dos pinned Β«#Article1 Yaqinda Data Science bo'yicha 'Salary Prediction' loyihasi qildim. Ommaviy dataset asosida Data Scientist va Analytics mutaxassislarining maoshini bashorat qiluvchi model yaratdim. Rostini aytsam, boshida Random Forest bemalol Linear Regressionniβ¦Β»
#Article2
Men GrounHog-prediction-Project-DS repo sini tekshirdim va haqiqiy 1886-2016 ma'lumotlar to'plamini oldim.
Natija:
Punxsutawney Philning bashoratlari mart oyining haqiqiy haroratiga nisbatan 52,2% aniqlikka erishdi - statistik jihatdan sodda boshlang'ich ko'rsatkichdan (49,6%) farqlanmaydi va ahamiyatli emas (p=0,72), va bu nol natija uchta mintaqa va ikki davrda doimiy ravishda saqlanib qoladi.
Bu boshqa umumiy bashorat postiga qaraganda kuchliroq va esda qolarliroq asar, chunki "hech qanday ta'sir yo'q va men bu tasodif emasligini mana shunday isbotladim" tuzilmasi haqiqiy statistik aniqlikni namoyish etadi.
https://medium.com/@urinovdostonbek/is-punxsutawney-phil-actually-any-good-at-predicting-spring-i-checked-115-years-of-data-977e29cf4127
https://github.com/DostonUr/Groundhog-Day-prediction
https://dev.to/dostonbek_ur/is-punxsutawney-phil-actually-any-good-at-predicting-spring-i-checked-115-years-of-data-13np
https://doi.org/10.5281/zenodo.21706033
Men GrounHog-prediction-Project-DS repo sini tekshirdim va haqiqiy 1886-2016 ma'lumotlar to'plamini oldim.
Natija:
Punxsutawney Philning bashoratlari mart oyining haqiqiy haroratiga nisbatan 52,2% aniqlikka erishdi - statistik jihatdan sodda boshlang'ich ko'rsatkichdan (49,6%) farqlanmaydi va ahamiyatli emas (p=0,72), va bu nol natija uchta mintaqa va ikki davrda doimiy ravishda saqlanib qoladi.
Bu boshqa umumiy bashorat postiga qaraganda kuchliroq va esda qolarliroq asar, chunki "hech qanday ta'sir yo'q va men bu tasodif emasligini mana shunday isbotladim" tuzilmasi haqiqiy statistik aniqlikni namoyish etadi.
https://medium.com/@urinovdostonbek/is-punxsutawney-phil-actually-any-good-at-predicting-spring-i-checked-115-years-of-data-977e29cf4127
https://github.com/DostonUr/Groundhog-Day-prediction
https://dev.to/dostonbek_ur/is-punxsutawney-phil-actually-any-good-at-predicting-spring-i-checked-115-years-of-data-13np
https://doi.org/10.5281/zenodo.21706033
π61πΎ1
#Article3
Yaqinda ikkita kichik Data Science loyiha qilganimda bir narsani payqadim.
Har safar modelni train qilaman, RΒ² ni tekshiraman, keyin esa ishonch hosil qilish uchun yana cross-validation ishlataman. π
Sababi oddiy: kichik datasetlarda bitta train/test split ba'zida kuchsizroq modelni ham "g'olib" qilib ko'rsatishi mumkin.
Shu ishni qayta-qayta qo'lda qilgandan keyin uni avtomatlashtirishga qaror qildim va ModelCheck package'ini yozdim.
Endi u modellarni solishtiradi, cross-validation qiladi va natijalar orasida katta farq bo'lsa, ogohlantiradi.
π GitHub: https://github.com/DostonUr/modelcheck
https://dev.to/dostonbek_ur/i-kept-doing-the-same-sanity-check-on-every-small-dataset-so-i-turned-it-into-a-package-io1
https://medium.com/@urinovdostonbek/i-kept-doing-the-same-sanity-check-on-every-small-dataset-so-i-turned-it-into-a-package-d0eda1767ede
https://www.linkedin.com/feed/update/urn:li:activity:7489677852880166912
https://www.reddit.com/u/Present-Plant5505/s/CMLihR6dI8
Yaqinda ikkita kichik Data Science loyiha qilganimda bir narsani payqadim.
Har safar modelni train qilaman, RΒ² ni tekshiraman, keyin esa ishonch hosil qilish uchun yana cross-validation ishlataman. π
Sababi oddiy: kichik datasetlarda bitta train/test split ba'zida kuchsizroq modelni ham "g'olib" qilib ko'rsatishi mumkin.
Shu ishni qayta-qayta qo'lda qilgandan keyin uni avtomatlashtirishga qaror qildim va ModelCheck package'ini yozdim.
Endi u modellarni solishtiradi, cross-validation qiladi va natijalar orasida katta farq bo'lsa, ogohlantiradi.
π GitHub: https://github.com/DostonUr/modelcheck
https://dev.to/dostonbek_ur/i-kept-doing-the-same-sanity-check-on-every-small-dataset-so-i-turned-it-into-a-package-io1
https://medium.com/@urinovdostonbek/i-kept-doing-the-same-sanity-check-on-every-small-dataset-so-i-turned-it-into-a-package-d0eda1767ede
https://www.linkedin.com/feed/update/urn:li:activity:7489677852880166912
https://www.reddit.com/u/Present-Plant5505/s/CMLihR6dI8
π40π₯26
Data Science | Machine Learning | AI |Data_Dos
Photo
#article 4
Magistrlikdagi Bank Customer Churn Prediction loyihamni yaqinda yana bir marta ko'rib chiqdim.
O'shanda natijadan xursand bo'lgandim:
π³ Random Forest
86.5% accuracy
Lekin keyin bitta savol paydo bo'ldi:
"Bu 86.5% aslida nimani anglatyapti?" π€
Ma'lum bo'ldiki, dataset nomutanosib ekan:
taxminan 80% mijoz bankda qolgan, atigi 20% ketgan.
Shuning uchun accuracy bu yerda unchalik foydali metrika emas. Model umumiy natijada yaxshi ko'ringan bo'lsa ham, bankni tark etayotgan mijozlarning yarmidan ham kamini topayotgan ekan.
Shunda modelni qayta train qilib, class_weight='balanced' va XGBoost bilan yana sinab ko'rdim.
Natija qiziq bo'ldi:
β Accuracy biroz pasaydi.
β Lekin churn qilayotgan mijozlarni aniqlash ancha yaxshilandi.
Bu menga yana bir narsani eslatdi:
Machine Learning'da eng katta raqam har doim ham eng yaxshi model degani emas.
Ba'zida 86% accuracy'dan ko'ra, ko'proq muhim mijozlarni ushlab qoladigan model biznes uchun ancha qimmatli bo'ladi.
Shu sabab eski loyihamni yangilab, xatolarimni ham ochiq qoldirdim. Menimcha, aynan shunday tahlillar haqiqiy Machine Learning jarayonini ko'rsatadi. π
https://github.com/DostonUr/bank_churn
https://dev.to/dostonbek_ur/revisiting-my-capstone-project-the-metric-i-trusted-was-hiding-a-model-that-barely-worked-4e9k
https://medium.com/@urinovdostonbek/revisiting-my-capstone-project-the-metric-i-trusted-was-hiding-a-model-that-barely-worked-f409a8227102
https://www.linkedin.com/feed/update/urn:li:activity:7489963053405425664
Magistrlikdagi Bank Customer Churn Prediction loyihamni yaqinda yana bir marta ko'rib chiqdim.
O'shanda natijadan xursand bo'lgandim:
π³ Random Forest
86.5% accuracy
Lekin keyin bitta savol paydo bo'ldi:
"Bu 86.5% aslida nimani anglatyapti?" π€
Ma'lum bo'ldiki, dataset nomutanosib ekan:
taxminan 80% mijoz bankda qolgan, atigi 20% ketgan.
Shuning uchun accuracy bu yerda unchalik foydali metrika emas. Model umumiy natijada yaxshi ko'ringan bo'lsa ham, bankni tark etayotgan mijozlarning yarmidan ham kamini topayotgan ekan.
Shunda modelni qayta train qilib, class_weight='balanced' va XGBoost bilan yana sinab ko'rdim.
Natija qiziq bo'ldi:
β Accuracy biroz pasaydi.
β Lekin churn qilayotgan mijozlarni aniqlash ancha yaxshilandi.
Bu menga yana bir narsani eslatdi:
Machine Learning'da eng katta raqam har doim ham eng yaxshi model degani emas.
Ba'zida 86% accuracy'dan ko'ra, ko'proq muhim mijozlarni ushlab qoladigan model biznes uchun ancha qimmatli bo'ladi.
Shu sabab eski loyihamni yangilab, xatolarimni ham ochiq qoldirdim. Menimcha, aynan shunday tahlillar haqiqiy Machine Learning jarayonini ko'rsatadi. π
https://github.com/DostonUr/bank_churn
https://dev.to/dostonbek_ur/revisiting-my-capstone-project-the-metric-i-trusted-was-hiding-a-model-that-barely-worked-4e9k
https://medium.com/@urinovdostonbek/revisiting-my-capstone-project-the-metric-i-trusted-was-hiding-a-model-that-barely-worked-f409a8227102
https://www.linkedin.com/feed/update/urn:li:activity:7489963053405425664
GitHub
GitHub - DostonUr/bank_churn: Predictive Analytics for Customer Churn in the Retail Banking Sector(Masters degree Capstone Project)
Predictive Analytics for Customer Churn in the Retail Banking Sector(Masters degree Capstone Project) - DostonUr/bank_churn
π101π₯29π15π1
#article5
Yaqinda eski Movie Recommendation System loyihamni qayta ko'rib chiqdim.
O'shanda model ishlardi: film nomini beraman, cosine similarity orqali 5 ta o'xshash film chiqaradi.
Men esa bir-ikkita natijani ko'rib, "ha, yomon emas" deb qo'yganman. π
Lekin bitta muammo bor edi:
Tavsiyalar haqiqatan ham yaxshimi?
Men buni umuman o'lchamagan ekanman.
Shuning uchun loyihani qayta tekshirdim va 30 ta film uchun natijalarni baholadim.
Genre overlap bo'yicha:
π² Random baseline - 30.0%
π₯ Popularity baseline - 26.1%
π¬ Content-based recommender - 76.1%
Demak, model shunchaki tasodifiy yoki mashhur filmlarni tavsiya qilmayapti. Haqiqatan ham ancha yaxshi ishlayapti.
Lekin eng qiziq natija boshqa joyda chiqdi.
TF-IDF "yaxshiroq" deb o'ylagandim.
Lekin:
CountVectorizer - 76.1%
TF-IDF - 49.5% π
Ya'ni bu safar "fancy" NLP method natijani yaxshilash o'rniga yomonlashtirdi.
Yana bir bor bir narsani ko'rdim:
Model ishlayotgani boshqa, model yaxshi ishlayotganini isbotlash esa boshqa.
Yaqinda eski Movie Recommendation System loyihamni qayta ko'rib chiqdim.
O'shanda model ishlardi: film nomini beraman, cosine similarity orqali 5 ta o'xshash film chiqaradi.
Men esa bir-ikkita natijani ko'rib, "ha, yomon emas" deb qo'yganman. π
Lekin bitta muammo bor edi:
Tavsiyalar haqiqatan ham yaxshimi?
Men buni umuman o'lchamagan ekanman.
Shuning uchun loyihani qayta tekshirdim va 30 ta film uchun natijalarni baholadim.
Genre overlap bo'yicha:
π² Random baseline - 30.0%
π₯ Popularity baseline - 26.1%
π¬ Content-based recommender - 76.1%
Demak, model shunchaki tasodifiy yoki mashhur filmlarni tavsiya qilmayapti. Haqiqatan ham ancha yaxshi ishlayapti.
Lekin eng qiziq natija boshqa joyda chiqdi.
TF-IDF "yaxshiroq" deb o'ylagandim.
Lekin:
CountVectorizer - 76.1%
TF-IDF - 49.5% π
Ya'ni bu safar "fancy" NLP method natijani yaxshilash o'rniga yomonlashtirdi.
Yana bir bor bir narsani ko'rdim:
Model ishlayotgani boshqa, model yaxshi ishlayotganini isbotlash esa boshqa.
π33
Data Science | Machine Learning | AI |Data_Dos
#article5 Yaqinda eski Movie Recommendation System loyihamni qayta ko'rib chiqdim. O'shanda model ishlardi: film nomini beraman, cosine similarity orqali 5 ta o'xshash film chiqaradi. Men esa bir-ikkita natijani ko'rib, "ha, yomon emas" deb qo'yganman.β¦
Oldin men natijani shunchaki ko'rib baholaganman. Bu safar esa baseline, metric va comparison bilan tekshirdim.
Kichkina evaluation ba'zida katta xatoni topib beradi. π€
π https://medium.com/@urinovdostonbek/my-recommendation-system-never-actually-measured-whether-its-recommendations-were-good-so-i-bcbd6acc5f26
π https://dev.to/dostonbek_ur/my-recommendation-system-never-actually-measured-whether-its-recommendations-were-good-so-i-4maa
π GitHub: github.com/DostonUr/Movie_Recommendation_Projec
π https://www.linkedin.com/posts/doston-urinov_github-dostonurmovierecommendationprojec-share-7495104623633125376-z_dv/?utm_source=social_share_send&utm_medium=member_desktop_web&rcm=ACoAADIxmskBjgr9t1WLP8XjATQxMf4QLFy29j8
π https://doi.org/10.5281/zenodo.21980390
Kichkina evaluation ba'zida katta xatoni topib beradi. π€
π https://medium.com/@urinovdostonbek/my-recommendation-system-never-actually-measured-whether-its-recommendations-were-good-so-i-bcbd6acc5f26
π https://dev.to/dostonbek_ur/my-recommendation-system-never-actually-measured-whether-its-recommendations-were-good-so-i-4maa
π GitHub: github.com/DostonUr/Movie_Recommendation_Projec
π https://www.linkedin.com/posts/doston-urinov_github-dostonurmovierecommendationprojec-share-7495104623633125376-z_dv/?utm_source=social_share_send&utm_medium=member_desktop_web&rcm=ACoAADIxmskBjgr9t1WLP8XjATQxMf4QLFy29j8
π https://doi.org/10.5281/zenodo.21980390
Medium
My Recommendation System Never Actually Measured Whether Its Recommendations Were Good -So I Checked
An earlier project of mine built a content-based movie recommender: vectorize each movieβs genre and plot summary, rank by cosineβ¦
π16