#trading #insiders
Интересная классификация следов инсайдерских сделок
https://www.youtube.com/watch?v=UHNEm4HQjJM
Интересная классификация следов инсайдерских сделок
https://www.youtube.com/watch?v=UHNEm4HQjJM
YouTube
Рынок проговаривается раньше новостей? Что скрывают объёмы торгов - Мурад Агаев
Спикер: Мурад Агаев - "Вредный инвестор"
Можно ли заметить подготовку к крупной корпоративной сделке ещё до выхода официальной новости? В этом выступлении Мурад Агаев показывает, как анализ аномальных объёмов торгов помогает находить необычную активность…
Можно ли заметить подготовку к крупной корпоративной сделке ещё до выхода официальной новости? В этом выступлении Мурад Агаев показывает, как анализ аномальных объёмов торгов помогает находить необычную активность…
#investing
Это пока не для меня ) А потом уже будет поздно...
https://www.youtube.com/watch?v=Lfk2BBhZUks
Это пока не для меня ) А потом уже будет поздно...
https://www.youtube.com/watch?v=Lfk2BBhZUks
YouTube
Как перестать зависеть от зарплаты? Дмитрий Черемушкин о пути к жизни на пассивный доход
Спикер: Дмитрий Черёмушкин Управляющий партнер XELIUS
Можно ли действительно жить на дивиденды, купоны и доход от недвижимости? Дмитрий Черемушкин рассказывает, почему отказался делать ставку только на трейдинг и более 12 лет строил систему пассивного дохода.…
Можно ли действительно жить на дивиденды, купоны и доход от недвижимости? Дмитрий Черемушкин рассказывает, почему отказался делать ставку только на трейдинг и более 12 лет строил систему пассивного дохода.…
#pymc #bart
В pymc есть вот такой аналог бустинга. Интересно его сравнить с "классическими" и проверить декореллированность. Ну и узнать границы применимости в терминах числа строк и столбцов, которые он тянет.
PS. Хрень полная ((
Results:
Prediction correlations:
https://www.youtube.com/watch?v=uS-dfZ4xYHk
В pymc есть вот такой аналог бустинга. Интересно его сравнить с "классическими" и проверить декореллированность. Ну и узнать границы применимости в терминах числа строк и столбцов, которые он тянет.
PS. Хрень полная ((
Results:
RMSE MAE Ttrain Tinf
Model
LinearRegression 2.3551 1.9619 0.02 0.0071
CatBoost 1.0312 0.8221 6.08 0.0105
XGBoost 1.0799 0.8598 0.16 0.0122
BART 1.1591 0.9171 106.63 7.8328
EnsTreesAll 1.0461 0.8343 112.88 7.8627
EnsTreesNoBart 1.0400 0.8298 112.88 7.8627
Prediction correlations:
LinearRegression CatBoost XGBoost BART
LinearRegression 1.0000 0.8414 0.8414 0.8669
CatBoost 0.8414 1.0000 0.9959 0.9912
XGBoost 0.8414 0.9959 1.0000 0.9883
BART 0.8669 0.9912 0.9883 1.0000
https://www.youtube.com/watch?v=uS-dfZ4xYHk
YouTube
Chris Fonnesbeck - Flexible Statistical Modeling | Pydata London 26
Chris Fonnesbeck - Flexible Statistical Modeling with Bayesian Additive Regression Trees
Most machine learning methods give you a prediction but not a measure of how much to trust it. Bayesian Additive Regression Trees (BART) combine the flexibility of tree…
Most machine learning methods give you a prediction but not a measure of how much to trust it. Bayesian Additive Regression Trees (BART) combine the flexibility of tree…
#hardware
"Выкрути свой Кодекс на максимум" )
https://3dnews.ru/1145187/openai-predstavila-perviy-gadget-klaviaturu-dlya-upravleniya-iiagentami-codex
"Выкрути свой Кодекс на максимум" )
https://3dnews.ru/1145187/openai-predstavila-perviy-gadget-klaviaturu-dlya-upravleniya-iiagentami-codex
#calibration #probabilistic #segments #groups #mce #mcgrad
Одна из самых полезных лекций по ML за последние годы. Каждый DS в определённый момент начинает над этими вещами задумываться, правда?
Какова структура моих ML-метрик в сегментах данных, а не просто общая метрика?
Калибрация очень наглядна в данном случае, т.к. в мэйнстриме обучения ML её считают неким приятным побочным эффектом, который можно получить наряду с "настоящими" метриками резкости классификатора (PR\ROC AUCs, Precision\Recall etc).
Авторы MCGrad проделали классную работу, от визуализации мискалибраций по сегментам до, собственно, борьбы с ней.
В примере сразу показывают на реальных данных, как изотоник примененный к логрегу улучшает глобальную калибрацию, но при этом на самом деле ухудшает MCE, вводя мискалибрацию по признаку "пол".
Но если чуть включить голову, сразу возникает вопрос, а почему ограничиваться только задачей классификации и только метрикой ECE? А что, в задаче регрессии нас не колышет что MAE по "студентам из Италии использующим Андроид" взлетает?
К методологии MCGrad есть вопросы, постараюсь их сформулировать. Но вообще сама идея классная.
Необходимость ВРУЧНУЮ определять важные подгруппы\сегменты в своих данных, замедление тренировок, непредсказуемое влияние на другие ML метрики - это все и правда (было) серьёзными блокерами.
И у меня были свои наработки, как с этим бороться, досматриваю лекцию, уже чувствую что благодаря их идеям смогу сильно улучшить свой подход.
https://www.youtube.com/watch?v=iAR0NmyS68k
Одна из самых полезных лекций по ML за последние годы. Каждый DS в определённый момент начинает над этими вещами задумываться, правда?
Какова структура моих ML-метрик в сегментах данных, а не просто общая метрика?
Калибрация очень наглядна в данном случае, т.к. в мэйнстриме обучения ML её считают неким приятным побочным эффектом, который можно получить наряду с "настоящими" метриками резкости классификатора (PR\ROC AUCs, Precision\Recall etc).
Авторы MCGrad проделали классную работу, от визуализации мискалибраций по сегментам до, собственно, борьбы с ней.
В примере сразу показывают на реальных данных, как изотоник примененный к логрегу улучшает глобальную калибрацию, но при этом на самом деле ухудшает MCE, вводя мискалибрацию по признаку "пол".
Но если чуть включить голову, сразу возникает вопрос, а почему ограничиваться только задачей классификации и только метрикой ECE? А что, в задаче регрессии нас не колышет что MAE по "студентам из Италии использующим Андроид" взлетает?
К методологии MCGrad есть вопросы, постараюсь их сформулировать. Но вообще сама идея классная.
Необходимость ВРУЧНУЮ определять важные подгруппы\сегменты в своих данных, замедление тренировок, непредсказуемое влияние на другие ML метрики - это все и правда (было) серьёзными блокерами.
И у меня были свои наработки, как с этим бороться, досматриваю лекцию, уже чувствую что благодаря их идеям смогу сильно улучшить свой подход.
https://www.youtube.com/watch?v=iAR0NmyS68k
YouTube
Niek Tax - Practical Multicalibration with MCGrad | Pydata London 26
Niek Tax - Beyond ML Model Calibration: Hands-On Multicalibration with MCGrad
This session’s header image
Your model is well-calibrated on average, but is it calibrated for every subgroup of your users? In this hands-on tutorial you will learn what multicalibration…
This session’s header image
Your model is well-calibrated on average, but is it calibrated for every subgroup of your users? In this hands-on tutorial you will learn what multicalibration…
✍1
#hardware
"По данным TechNews, оборудование автопилота Tesla четвёртого поколения подразумевало использование 32 Гбайт памяти GDDR6/LPDDR, но выходящая в этом году версия 4+ уже удваивает этот объём до 64 Гбайт. Популярная среди автопроизводителей платформа Nvidia Orin также использует 32 или 64 Гбайт оперативной памяти. Казалось бы, это не так много, но только лишь DRAM потребности бортовой электроники автомобилей не ограничиваются.
Если в начальных конфигурациях бортовые системы машины, включая развлекательную и отвечающие за помощь водителю в управлении, требуют до 40 Гбайт оперативной памяти, то в старших конфигурациях её объём может превышать 100 Гбайт. В случае с твердотельной памятью NAND, используемой для долговременного хранения информации, разбег требований ещё больше. Обновления ПО, которые поступают «по воздуху», для своего временного хранения требуют до 10 Гбайт дискового пространства в минимальном случае, а с учётом резерва можно говорить о всех 50 Гбайт.
Для хранения большого количества изображений, используемых в работе систем автопилота, требуется от 100 до 300 Гбайт памяти. Попутно прогрессируют и мультимедийные системы автомобилей, некоторые из них берут на вооружение ИИ-ассистентов, что также поднимает требования к доступному дисковому пространству. Твердотельный накопитель современного автомобиля в этом случае должен обладать объёмом от 500 Гбайт до 1,5 Тбайт, и в будущем требования будут расти практически ежегодно."
https://3dnews.ru/1145295/avtomobili-stanovyatsya-novimi-pogiratelyami-pamyati-do100-gbayt-dram-i-do-15-tbayt-ssd
"По данным TechNews, оборудование автопилота Tesla четвёртого поколения подразумевало использование 32 Гбайт памяти GDDR6/LPDDR, но выходящая в этом году версия 4+ уже удваивает этот объём до 64 Гбайт. Популярная среди автопроизводителей платформа Nvidia Orin также использует 32 или 64 Гбайт оперативной памяти. Казалось бы, это не так много, но только лишь DRAM потребности бортовой электроники автомобилей не ограничиваются.
Если в начальных конфигурациях бортовые системы машины, включая развлекательную и отвечающие за помощь водителю в управлении, требуют до 40 Гбайт оперативной памяти, то в старших конфигурациях её объём может превышать 100 Гбайт. В случае с твердотельной памятью NAND, используемой для долговременного хранения информации, разбег требований ещё больше. Обновления ПО, которые поступают «по воздуху», для своего временного хранения требуют до 10 Гбайт дискового пространства в минимальном случае, а с учётом резерва можно говорить о всех 50 Гбайт.
Для хранения большого количества изображений, используемых в работе систем автопилота, требуется от 100 до 300 Гбайт памяти. Попутно прогрессируют и мультимедийные системы автомобилей, некоторые из них берут на вооружение ИИ-ассистентов, что также поднимает требования к доступному дисковому пространству. Твердотельный накопитель современного автомобиля в этом случае должен обладать объёмом от 500 Гбайт до 1,5 Тбайт, и в будущем требования будут расти практически ежегодно."
https://3dnews.ru/1145295/avtomobili-stanovyatsya-novimi-pogiratelyami-pamyati-do100-gbayt-dram-i-do-15-tbayt-ssd
#medicine #bayes
"Manrai AK, Bhatia G, Strymish J, Kohane IS, Jain SH. "Medicine's uncomfortable relationship with math: calculating positive predictive value." JAMA Intern Med. 2014;174(6):991-993. Note: this is JAMA Internal Medicine, not NEJM - the brief was widely miscited; the NEJM attribution in the brief is wrong. Question posed (replicating Casscells 1978): "If a test to detect a disease whose prevalence is 1/1000 has a false positive rate of 5%, what is the chance that a person found to have a positive result actually has the disease, assuming you know nothing about the person's symptoms or signs?" Of 61 respondents: 14 (23%) gave the correct answer of ~2%; 27 (44%) answered 95% - the modal response. Median answer 66%, i.e. 33× the true value. Original: Casscells W, Schoenberger A, Graboys TB. N Engl J Med. 1978;299(18):999-1001 (where 11/60 gave the correct answer)."
"Hoffrage U, Gigerenzer G. "Using natural frequencies to improve diagnostic inferences." Acad Med. 1998;73(5):538-540. Physicians averaging 14 years' experience, mammography problem: with natural frequencies, 16/24 found the Bayesian answer; with conditional probabilities, only 1/24 did."
"Manrai AK, Bhatia G, Strymish J, Kohane IS, Jain SH. "Medicine's uncomfortable relationship with math: calculating positive predictive value." JAMA Intern Med. 2014;174(6):991-993. Note: this is JAMA Internal Medicine, not NEJM - the brief was widely miscited; the NEJM attribution in the brief is wrong. Question posed (replicating Casscells 1978): "If a test to detect a disease whose prevalence is 1/1000 has a false positive rate of 5%, what is the chance that a person found to have a positive result actually has the disease, assuming you know nothing about the person's symptoms or signs?" Of 61 respondents: 14 (23%) gave the correct answer of ~2%; 27 (44%) answered 95% - the modal response. Median answer 66%, i.e. 33× the true value. Original: Casscells W, Schoenberger A, Graboys TB. N Engl J Med. 1978;299(18):999-1001 (where 11/60 gave the correct answer)."
"Hoffrage U, Gigerenzer G. "Using natural frequencies to improve diagnostic inferences." Acad Med. 1998;73(5):538-540. Physicians averaging 14 years' experience, mammography problem: with natural frequencies, 16/24 found the Bayesian answer; with conditional probabilities, only 1/24 did."