Aspiring Data Science
388 subscribers
486 photos
17 videos
12 files
2.38K links
Заметки экономиста о программировании, прогнозировании и принятии решений, научном методе познания.
Контакт: @fingoldo

I call myself a data scientist because I know just enough math, economics & programming to be dangerous.
Download Telegram
#pymc #bart

В pymc есть вот такой аналог бустинга. Интересно его сравнить с "классическими" и проверить декореллированность. Ну и узнать границы применимости в терминах числа строк и столбцов, которые он тянет.

PS. Хрень полная ((

Results:
RMSE MAE Ttrain Tinf
Model
LinearRegression 2.3551 1.9619 0.02 0.0071
CatBoost 1.0312 0.8221 6.08 0.0105
XGBoost 1.0799 0.8598 0.16 0.0122
BART 1.1591 0.9171 106.63 7.8328
EnsTreesAll 1.0461 0.8343 112.88 7.8627
EnsTreesNoBart 1.0400 0.8298 112.88 7.8627


Prediction correlations:
LinearRegression CatBoost XGBoost BART
LinearRegression 1.0000 0.8414 0.8414 0.8669
CatBoost 0.8414 1.0000 0.9959 0.9912
XGBoost 0.8414 0.9959 1.0000 0.9883
BART 0.8669 0.9912 0.9883 1.0000


https://www.youtube.com/watch?v=uS-dfZ4xYHk
#calibration #probabilistic #segments #groups #mce #mcgrad

Одна из самых полезных лекций по ML за последние годы. Каждый DS в определённый момент начинает над этими вещами задумываться, правда?

Какова структура моих ML-метрик в сегментах данных, а не просто общая метрика?

Калибрация очень наглядна в данном случае, т.к. в мэйнстриме обучения ML её считают неким приятным побочным эффектом, который можно получить наряду с "настоящими" метриками резкости классификатора (PR\ROC AUCs, Precision\Recall etc).

Авторы MCGrad проделали классную работу, от визуализации мискалибраций по сегментам до, собственно, борьбы с ней.

В примере сразу показывают на реальных данных, как изотоник примененный к логрегу улучшает глобальную калибрацию, но при этом на самом деле ухудшает MCE, вводя мискалибрацию по признаку "пол".

Но если чуть включить голову, сразу возникает вопрос, а почему ограничиваться только задачей классификации и только метрикой ECE? А что, в задаче регрессии нас не колышет что MAE по "студентам из Италии использующим Андроид" взлетает?

К методологии MCGrad есть вопросы, постараюсь их сформулировать. Но вообще сама идея классная.

Необходимость ВРУЧНУЮ определять важные подгруппы\сегменты в своих данных, замедление тренировок, непредсказуемое влияние на другие ML метрики - это все и правда (было) серьёзными блокерами.

И у меня были свои наработки, как с этим бороться, досматриваю лекцию, уже чувствую что благодаря их идеям смогу сильно улучшить свой подход.

https://www.youtube.com/watch?v=iAR0NmyS68k
1
#hardware

"По данным TechNews, оборудование автопилота Tesla четвёртого поколения подразумевало использование 32 Гбайт памяти GDDR6/LPDDR, но выходящая в этом году версия 4+ уже удваивает этот объём до 64 Гбайт. Популярная среди автопроизводителей платформа Nvidia Orin также использует 32 или 64 Гбайт оперативной памяти. Казалось бы, это не так много, но только лишь DRAM потребности бортовой электроники автомобилей не ограничиваются.

Если в начальных конфигурациях бортовые системы машины, включая развлекательную и отвечающие за помощь водителю в управлении, требуют до 40 Гбайт оперативной памяти, то в старших конфигурациях её объём может превышать 100 Гбайт. В случае с твердотельной памятью NAND, используемой для долговременного хранения информации, разбег требований ещё больше. Обновления ПО, которые поступают «по воздуху», для своего временного хранения требуют до 10 Гбайт дискового пространства в минимальном случае, а с учётом резерва можно говорить о всех 50 Гбайт.

Для хранения большого количества изображений, используемых в работе систем автопилота, требуется от 100 до 300 Гбайт памяти. Попутно прогрессируют и мультимедийные системы автомобилей, некоторые из них берут на вооружение ИИ-ассистентов, что также поднимает требования к доступному дисковому пространству. Твердотельный накопитель современного автомобиля в этом случае должен обладать объёмом от 500 Гбайт до 1,5 Тбайт, и в будущем требования будут расти практически ежегодно."

https://3dnews.ru/1145295/avtomobili-stanovyatsya-novimi-pogiratelyami-pamyati-do100-gbayt-dram-i-do-15-tbayt-ssd
#medicine #bayes

"Manrai AK, Bhatia G, Strymish J, Kohane IS, Jain SH. "Medicine's uncomfortable relationship with math: calculating positive predictive value." JAMA Intern Med. 2014;174(6):991-993. Note: this is JAMA Internal Medicine, not NEJM - the brief was widely miscited; the NEJM attribution in the brief is wrong. Question posed (replicating Casscells 1978): "If a test to detect a disease whose prevalence is 1/1000 has a false positive rate of 5%, what is the chance that a person found to have a positive result actually has the disease, assuming you know nothing about the person's symptoms or signs?" Of 61 respondents: 14 (23%) gave the correct answer of ~2%; 27 (44%) answered 95% - the modal response. Median answer 66%, i.e. 33× the true value. Original: Casscells W, Schoenberger A, Graboys TB. N Engl J Med. 1978;299(18):999-1001 (where 11/60 gave the correct answer)."

"Hoffrage U, Gigerenzer G. "Using natural frequencies to improve diagnostic inferences." Acad Med. 1998;73(5):538-540. Physicians averaging 14 years' experience, mammography problem: with natural frequencies, 16/24 found the Bayesian answer; with conditional probabilities, only 1/24 did."
Forwarded from kyrillic
Как часто айтишники меняют работу. Наверное многих удивили данные Ravio (пост), что в ЕС tech специалисты меняют работу каждые 2 года. Цифра корректная, подтверждается другими источниками.

1️⃣ Заглянул в Евростат, в среднем по всем трудоустроенным (не только айтишникам), смена работы происходит раз в 10 лет. В северных странах чуть чаще - в 🇩🇰 Дании, 🇳🇱 Нидерландах, 🇸🇪 Швеции 8-9 лет, а в южных реже - 🇵🇹 Португалия, 🇬🇷 Греция, 🇮🇹 Италия 12-13 лет. То есть айтишники - это можно сказать аномалия.

При этом средняя продолжительность карьеры в ЕС - 37,2 года, то есть айтишник сегодняшними темпами может сменить до 18 работ! Хотя с ростом карьеры темп замедляется.

2️⃣ В США по данным US bureau of labor statistics в tech-секторе меняют работу чуть реже, чем в ЕС, ближе к 3 годам. Но в среднем по экономике эта цифра около 4 лет (что намного ниже Европы).

В России данные более скудные, по цифрам текучки, получается 3-5 лет у айтишников, причем с каждым годом меняют работу все реже. Как и на рынках США и ЕС (но там другие причины).

3️⃣ Частая смены работы прежде всего означает, что для айтишника лучший способ повышения дохода - это не рост внутри компании, а смена работодателя. Что подтверждает некоторые тезисы поста про "многолетний опыт".

Второй вывод - что индустрия в регионе достаточно горячая и растущая, и есть возможность повысить з/п, сменив работодателя. Не везде и не во всех индустриях она есть.

4️⃣ После ZIRP-эры (низких ставок, когда найм в айти бурно рос) нанимать стали заметно меньше, и это конечно не из-за AI (пост). Так что прыгать часто по позициям стало чуть более рискованно в последние лет пять. И это видно в статистике разных стран.

5️⃣ Очевидно, что любой айтишник должен быть почти в перманентном поиске возможностей, потому что на развитом рынке поиск работы может занимать месяцы. И не смотреть на общие тренды рынков труда - они чрезвычайно далеки от айтишных.

И не забываем про контакты с реальностью (пост) - в найме они почти все выглядят как имейлы с офферами.

@kyrillic
❤‍🔥11
#llms

"Публичные бенчмарки помогают увидеть общую картину, но плохо предсказывают, как модель поведёт себя в конкретном продукте. На реальных данных и task-specific метриках расстановка сил между моделями может заметно меняться: одни хуже работают с доменной терминологией, другие не выдерживают нужный формат ответа, третьи дают приемлемое качество, но выигрывают по стоимости или снижают зависимость от внешнего провайдера."

https://youtu.be/ES6TgMywx6g