Aspiring Data Science
388 subscribers
486 photos
17 videos
12 files
2.38K links
Заметки экономиста о программировании, прогнозировании и принятии решений, научном методе познания.
Контакт: @fingoldo

I call myself a data scientist because I know just enough math, economics & programming to be dangerous.
Download Telegram
#pymc #bart

В pymc есть вот такой аналог бустинга. Интересно его сравнить с "классическими" и проверить декореллированность. Ну и узнать границы применимости в терминах числа строк и столбцов, которые он тянет.

PS. Хрень полная ((

Results:
RMSE MAE Ttrain Tinf
Model
LinearRegression 2.3551 1.9619 0.02 0.0071
CatBoost 1.0312 0.8221 6.08 0.0105
XGBoost 1.0799 0.8598 0.16 0.0122
BART 1.1591 0.9171 106.63 7.8328
EnsTreesAll 1.0461 0.8343 112.88 7.8627
EnsTreesNoBart 1.0400 0.8298 112.88 7.8627


Prediction correlations:
LinearRegression CatBoost XGBoost BART
LinearRegression 1.0000 0.8414 0.8414 0.8669
CatBoost 0.8414 1.0000 0.9959 0.9912
XGBoost 0.8414 0.9959 1.0000 0.9883
BART 0.8669 0.9912 0.9883 1.0000


https://www.youtube.com/watch?v=uS-dfZ4xYHk
#calibration #probabilistic #segments #groups #mce #mcgrad

Одна из самых полезных лекций по ML за последние годы. Каждый DS в определённый момент начинает над этими вещами задумываться, правда?

Какова структура моих ML-метрик в сегментах данных, а не просто общая метрика?

Калибрация очень наглядна в данном случае, т.к. в мэйнстриме обучения ML её считают неким приятным побочным эффектом, который можно получить наряду с "настоящими" метриками резкости классификатора (PR\ROC AUCs, Precision\Recall etc).

Авторы MCGrad проделали классную работу, от визуализации мискалибраций по сегментам до, собственно, борьбы с ней.

В примере сразу показывают на реальных данных, как изотоник примененный к логрегу улучшает глобальную калибрацию, но при этом на самом деле ухудшает MCE, вводя мискалибрацию по признаку "пол".

Но если чуть включить голову, сразу возникает вопрос, а почему ограничиваться только задачей классификации и только метрикой ECE? А что, в задаче регрессии нас не колышет что MAE по "студентам из Италии использующим Андроид" взлетает?

К методологии MCGrad есть вопросы, постараюсь их сформулировать. Но вообще сама идея классная.

Необходимость ВРУЧНУЮ определять важные подгруппы\сегменты в своих данных, замедление тренировок, непредсказуемое влияние на другие ML метрики - это все и правда (было) серьёзными блокерами.

И у меня были свои наработки, как с этим бороться, досматриваю лекцию, уже чувствую что благодаря их идеям смогу сильно улучшить свой подход.

https://www.youtube.com/watch?v=iAR0NmyS68k
1
#hardware

"По данным TechNews, оборудование автопилота Tesla четвёртого поколения подразумевало использование 32 Гбайт памяти GDDR6/LPDDR, но выходящая в этом году версия 4+ уже удваивает этот объём до 64 Гбайт. Популярная среди автопроизводителей платформа Nvidia Orin также использует 32 или 64 Гбайт оперативной памяти. Казалось бы, это не так много, но только лишь DRAM потребности бортовой электроники автомобилей не ограничиваются.

Если в начальных конфигурациях бортовые системы машины, включая развлекательную и отвечающие за помощь водителю в управлении, требуют до 40 Гбайт оперативной памяти, то в старших конфигурациях её объём может превышать 100 Гбайт. В случае с твердотельной памятью NAND, используемой для долговременного хранения информации, разбег требований ещё больше. Обновления ПО, которые поступают «по воздуху», для своего временного хранения требуют до 10 Гбайт дискового пространства в минимальном случае, а с учётом резерва можно говорить о всех 50 Гбайт.

Для хранения большого количества изображений, используемых в работе систем автопилота, требуется от 100 до 300 Гбайт памяти. Попутно прогрессируют и мультимедийные системы автомобилей, некоторые из них берут на вооружение ИИ-ассистентов, что также поднимает требования к доступному дисковому пространству. Твердотельный накопитель современного автомобиля в этом случае должен обладать объёмом от 500 Гбайт до 1,5 Тбайт, и в будущем требования будут расти практически ежегодно."

https://3dnews.ru/1145295/avtomobili-stanovyatsya-novimi-pogiratelyami-pamyati-do100-gbayt-dram-i-do-15-tbayt-ssd
#medicine #bayes

"Manrai AK, Bhatia G, Strymish J, Kohane IS, Jain SH. "Medicine's uncomfortable relationship with math: calculating positive predictive value." JAMA Intern Med. 2014;174(6):991-993. Note: this is JAMA Internal Medicine, not NEJM - the brief was widely miscited; the NEJM attribution in the brief is wrong. Question posed (replicating Casscells 1978): "If a test to detect a disease whose prevalence is 1/1000 has a false positive rate of 5%, what is the chance that a person found to have a positive result actually has the disease, assuming you know nothing about the person's symptoms or signs?" Of 61 respondents: 14 (23%) gave the correct answer of ~2%; 27 (44%) answered 95% - the modal response. Median answer 66%, i.e. 33× the true value. Original: Casscells W, Schoenberger A, Graboys TB. N Engl J Med. 1978;299(18):999-1001 (where 11/60 gave the correct answer)."

"Hoffrage U, Gigerenzer G. "Using natural frequencies to improve diagnostic inferences." Acad Med. 1998;73(5):538-540. Physicians averaging 14 years' experience, mammography problem: with natural frequencies, 16/24 found the Bayesian answer; with conditional probabilities, only 1/24 did."