Aspiring Data Science
388 subscribers
486 photos
17 videos
12 files
2.38K links
Заметки экономиста о программировании, прогнозировании и принятии решений, научном методе познания.
Контакт: @fingoldo

I call myself a data scientist because I know just enough math, economics & programming to be dangerous.
Download Telegram
#entropy #gravity #physics

Возможная связь информации, квантовой механики и .. гравитации. Гравитация (в форме уравнений похожих на уравнения ОТО) возникает как продукт требований к квантовым полям, как я понял.

https://youtu.be/IxmTqIkToTg
#healthcare #cv #ml

Какие же они красавчики! Вот это молодцы. Изумительно полезная система трекинга пациентов. Давно не видел настолько полезного продукта. Неужели у нас это где-то это разворачивается? Будь руководство страны не питекантропами, эта системы была бы во всех больницах.

Из ML-архитектуры интересна weakly-разметка и multi-head ANNs, дистилляция и "модельный суп", есть VLM (Vision Language Models, но не охвачено лекцией).

Интересным образом решают проблему сдвига домена (при добавлении данных новой клиники), расстояние от центроид клиник влияет на лосс.

https://www.youtube.com/watch?v=eGX5uz-6Phs

https://disk.360.yandex.ru/i/AUYlqKXabIddHA
#programming #ai #claude

Мне кажется, пока LLM-ки не способны решать сложные практические задачи в DS и программировании. Есть проблески (их много). Есть завалы (частенько). Стало ли лучше за последние полгода - неуверенное ДА. Интересно будет сравнить, а что же случится через год.

Потестил Fable и Sonnet 5 через Клода именно по АПИ - это абсолютно бессмысленное выбрасывание денег на ветер. Fable на low-medium сжёг $10 за пару минут, Sonnet доел остальные $10 за полчаса.

При этом Fable оказался не способен следовать довольно простым инструкциям.

Антропик - по-прежнему только подписка, АПИ - оверпрайс.
#pymc #bart

В pymc есть вот такой аналог бустинга. Интересно его сравнить с "классическими" и проверить декореллированность. Ну и узнать границы применимости в терминах числа строк и столбцов, которые он тянет.

PS. Хрень полная ((

Results:
RMSE MAE Ttrain Tinf
Model
LinearRegression 2.3551 1.9619 0.02 0.0071
CatBoost 1.0312 0.8221 6.08 0.0105
XGBoost 1.0799 0.8598 0.16 0.0122
BART 1.1591 0.9171 106.63 7.8328
EnsTreesAll 1.0461 0.8343 112.88 7.8627
EnsTreesNoBart 1.0400 0.8298 112.88 7.8627


Prediction correlations:
LinearRegression CatBoost XGBoost BART
LinearRegression 1.0000 0.8414 0.8414 0.8669
CatBoost 0.8414 1.0000 0.9959 0.9912
XGBoost 0.8414 0.9959 1.0000 0.9883
BART 0.8669 0.9912 0.9883 1.0000


https://www.youtube.com/watch?v=uS-dfZ4xYHk
#calibration #probabilistic #segments #groups #mce #mcgrad

Одна из самых полезных лекций по ML за последние годы. Каждый DS в определённый момент начинает над этими вещами задумываться, правда?

Какова структура моих ML-метрик в сегментах данных, а не просто общая метрика?

Калибрация очень наглядна в данном случае, т.к. в мэйнстриме обучения ML её считают неким приятным побочным эффектом, который можно получить наряду с "настоящими" метриками резкости классификатора (PR\ROC AUCs, Precision\Recall etc).

Авторы MCGrad проделали классную работу, от визуализации мискалибраций по сегментам до, собственно, борьбы с ней.

В примере сразу показывают на реальных данных, как изотоник примененный к логрегу улучшает глобальную калибрацию, но при этом на самом деле ухудшает MCE, вводя мискалибрацию по признаку "пол".

Но если чуть включить голову, сразу возникает вопрос, а почему ограничиваться только задачей классификации и только метрикой ECE? А что, в задаче регрессии нас не колышет что MAE по "студентам из Италии использующим Андроид" взлетает?

К методологии MCGrad есть вопросы, постараюсь их сформулировать. Но вообще сама идея классная.

Необходимость ВРУЧНУЮ определять важные подгруппы\сегменты в своих данных, замедление тренировок, непредсказуемое влияние на другие ML метрики - это все и правда (было) серьёзными блокерами.

И у меня были свои наработки, как с этим бороться, досматриваю лекцию, уже чувствую что благодаря их идеям смогу сильно улучшить свой подход.

https://www.youtube.com/watch?v=iAR0NmyS68k
1
#hardware

"По данным TechNews, оборудование автопилота Tesla четвёртого поколения подразумевало использование 32 Гбайт памяти GDDR6/LPDDR, но выходящая в этом году версия 4+ уже удваивает этот объём до 64 Гбайт. Популярная среди автопроизводителей платформа Nvidia Orin также использует 32 или 64 Гбайт оперативной памяти. Казалось бы, это не так много, но только лишь DRAM потребности бортовой электроники автомобилей не ограничиваются.

Если в начальных конфигурациях бортовые системы машины, включая развлекательную и отвечающие за помощь водителю в управлении, требуют до 40 Гбайт оперативной памяти, то в старших конфигурациях её объём может превышать 100 Гбайт. В случае с твердотельной памятью NAND, используемой для долговременного хранения информации, разбег требований ещё больше. Обновления ПО, которые поступают «по воздуху», для своего временного хранения требуют до 10 Гбайт дискового пространства в минимальном случае, а с учётом резерва можно говорить о всех 50 Гбайт.

Для хранения большого количества изображений, используемых в работе систем автопилота, требуется от 100 до 300 Гбайт памяти. Попутно прогрессируют и мультимедийные системы автомобилей, некоторые из них берут на вооружение ИИ-ассистентов, что также поднимает требования к доступному дисковому пространству. Твердотельный накопитель современного автомобиля в этом случае должен обладать объёмом от 500 Гбайт до 1,5 Тбайт, и в будущем требования будут расти практически ежегодно."

https://3dnews.ru/1145295/avtomobili-stanovyatsya-novimi-pogiratelyami-pamyati-do100-gbayt-dram-i-do-15-tbayt-ssd