Forwarded from Hacker News
Pre-Release of Polars 2.0 (🔥 Score: 152+ in 3 hours)
Link: https://readhacker.news/s/749mt
Comments: https://readhacker.news/c/749mt
Link: https://readhacker.news/s/749mt
Comments: https://readhacker.news/c/749mt
Polars
Pre-release of Polars 2.0
Preview of Python Polars 2.0, bringing the streaming engine to all lazy queries
👍18🔥13🍌1🍾1
Нам пообещали починить Rl соревы на каггле!
Кагл стафф пообещал починить будущие RL соревнования: будут прогонять модель Бредли-Терри после периода 'охлаждения' лб. Это ответ на огромную дисперсию и шатание рейтинга в покемонах. Сейчас используют вариацию на тему Glicko score и уже многие заметили ее нестабильность.
Хочу вставить свои 5 копеек иповыпендриваться своими двумя мастерами в статах объяснить, почему это плохой фикс для Pokemon и даже Orbit Wars
Для начала вспомним, что за Бредли Терри. Подробные выкладки можно почитать тут, а я попробую объяснить на пальцах. Изначально модель придумал Эрнст Цермело для оценки силы игроков в шахматных турнирах. Сам Эрнст известен тем, что отказался приветствовать фюрера перед каждой парой в университете Фрайбурга и ушел с места почетного профессора. А еще придумал аксиому выбора. Потом модель вновь переоткрыли, как это водится, через 20 лет.
Базовая идея модели: хотим по стохастическим парным сравнениям определить ранкинг каких-то предметов. Например выяснить, не только то, кто самый крутой шахматист, а кто второй по силе, третий и тд. У нас есть статистика матчей и нам не слишком важно, чтобы каждый сыграл с каждым. Но нам очень важно, чтобы граф связей (игр/сравнений) был связный. Т.е. шагая от шахматиста к шахматисту по связям (матчам с известным исходом) мы всегда могли достичь любого шахматиста лиги.
Хотим из нашего графа побед/поражений (частично заполненного, но связного) вывести такие theta_i, theta_j, что
P(i победит j) = sigma(theta_i - theta_j).
С точки зрения моделей мы банально учим логрег на одной фиче: разнице one hot энкодингов игроков. Пусть у нас три игрока и мы их кодируем:
A. (1, 0, 0)
B. (0, 1, 0)
C. (0, 0, 1)
Тогда один матч, где A играл с C и выиграл у нас будет представлен так:
Фичи: (1, 0, -1) = (1, 0, 0) - (0, 0, 1) = A - C
Таргет: (1) (A победил)
Учим мы соответственно theta_i. Они собой и представляют 'силу' каждого участника.
Статистические предположения для такой модели следующие:
1. Попарные сравнения независимые (игра каждый раз начинается с начала игры и игры независимые)
2. Латентные качества не меняются (боты не становятся сильнее/слабее между играми)
3. Вероятность победы в паре определяется разностью сил
4. Нет никаких matchup эффектов
Сама модель потом развилась в ELO и Glicko скоры как онлайн-вариант подсчета. И именно последняя используется сейчас на каггле. Если почитаете первую ссылку, то там еще и связь с PageRank можно найти. И даже скоры силы в баскетболе тоже развитие этих идей.
Так вот, почему идея использовать Бредли-Терри для каггла довольно странная: последние RL соревнования нарушают один из асампшенов модели.
Для покемонов нарушаются два последних: у колод есть матчап эффекты и игроки заранее не равны. Т.е. сила определяется и колодой, и пилотирующим алгоритмом. А колоды работают по принципу камень-ножницы-бумага, которые по дизайну не могут быть отражены в модели.
Более того, модель еще и не поддерживает случай игры вчетвером, поэтому починить дисперсию игр в Orbit тоже не выйдет. Придется использовать какое-нибудь расширение в стиле Плакетта-Люса.
Единственный плюс: где первый фикс метрики, там и выбор разных алгоритмов формирования лб для разных соревнований. Логично силу агентов сравнивать разными способами для разных игр. А то представьте, что мы бы все челленджи по классификации меряли только с помощью Roc-Auc.
Кагл стафф пообещал починить будущие RL соревнования: будут прогонять модель Бредли-Терри после периода 'охлаждения' лб. Это ответ на огромную дисперсию и шатание рейтинга в покемонах. Сейчас используют вариацию на тему Glicko score и уже многие заметили ее нестабильность.
Хочу вставить свои 5 копеек и
Для начала вспомним, что за Бредли Терри. Подробные выкладки можно почитать тут, а я попробую объяснить на пальцах. Изначально модель придумал Эрнст Цермело для оценки силы игроков в шахматных турнирах. Сам Эрнст известен тем, что отказался приветствовать фюрера перед каждой парой в университете Фрайбурга и ушел с места почетного профессора. А еще придумал аксиому выбора. Потом модель вновь переоткрыли, как это водится, через 20 лет.
Базовая идея модели: хотим по стохастическим парным сравнениям определить ранкинг каких-то предметов. Например выяснить, не только то, кто самый крутой шахматист, а кто второй по силе, третий и тд. У нас есть статистика матчей и нам не слишком важно, чтобы каждый сыграл с каждым. Но нам очень важно, чтобы граф связей (игр/сравнений) был связный. Т.е. шагая от шахматиста к шахматисту по связям (матчам с известным исходом) мы всегда могли достичь любого шахматиста лиги.
Хотим из нашего графа побед/поражений (частично заполненного, но связного) вывести такие theta_i, theta_j, что
P(i победит j) = sigma(theta_i - theta_j).
С точки зрения моделей мы банально учим логрег на одной фиче: разнице one hot энкодингов игроков. Пусть у нас три игрока и мы их кодируем:
A. (1, 0, 0)
B. (0, 1, 0)
C. (0, 0, 1)
Тогда один матч, где A играл с C и выиграл у нас будет представлен так:
Фичи: (1, 0, -1) = (1, 0, 0) - (0, 0, 1) = A - C
Таргет: (1) (A победил)
Учим мы соответственно theta_i. Они собой и представляют 'силу' каждого участника.
Статистические предположения для такой модели следующие:
1. Попарные сравнения независимые (игра каждый раз начинается с начала игры и игры независимые)
2. Латентные качества не меняются (боты не становятся сильнее/слабее между играми)
3. Вероятность победы в паре определяется разностью сил
4. Нет никаких matchup эффектов
Сама модель потом развилась в ELO и Glicko скоры как онлайн-вариант подсчета. И именно последняя используется сейчас на каггле. Если почитаете первую ссылку, то там еще и связь с PageRank можно найти. И даже скоры силы в баскетболе тоже развитие этих идей.
Так вот, почему идея использовать Бредли-Терри для каггла довольно странная: последние RL соревнования нарушают один из асампшенов модели.
Для покемонов нарушаются два последних: у колод есть матчап эффекты и игроки заранее не равны. Т.е. сила определяется и колодой, и пилотирующим алгоритмом. А колоды работают по принципу камень-ножницы-бумага, которые по дизайну не могут быть отражены в модели.
Более того, модель еще и не поддерживает случай игры вчетвером, поэтому починить дисперсию игр в Orbit тоже не выйдет. Придется использовать какое-нибудь расширение в стиле Плакетта-Люса.
Единственный плюс: где первый фикс метрики, там и выбор разных алгоритмов формирования лб для разных соревнований. Логично силу агентов сравнивать разными способами для разных игр. А то представьте, что мы бы все челленджи по классификации меряли только с помощью Roc-Auc.
❤14🔥8🍌5🍾1
Тем временем в ферме участвует уже 8400 кагглеров. Во истину агенты дали соревнованиям новую жизнь
🔥29👍6😱4
Тем временем кагл видимо планирует наконец-то обновить парк видекарт для кернелов и скоринга.
P100 переезжают в статус 'пенсионерских'.
На AIMO3 еще в 2025 можно было использовать H100, так что я ожидаю именно их как замену p100. А это прирост по перфомансу в 7 раз
По поводу T4 ничего не известно, но интерполируя прошлый абзац, это должны быть L4 и прирост в 3.7 раза
Вероятно, нас еще ждет ротация TPU, но там все слишком закрыто. Их и так постоянно меняют, но в очереди на TPU модель выбрать нельзя и каждый раз играешь в лоторею. Для меня вся идея выдавать TPU на каггле выглядит как мертворожденный проект:
1. Новые TPU есть только у гугла
2. Старые TPU гугл разбирает и на вторичке их никак не купить
Вывод:
Скилл использования TPU- только для гуглеров и мб нейроагентов.
TLDR:
P100 (2016) -> H100 (2022)
T4 (2018)-> L4 (2023), возможно
P100 переезжают в статус 'пенсионерских'.
На AIMO3 еще в 2025 можно было использовать H100, так что я ожидаю именно их как замену p100. А это прирост по перфомансу в 7 раз
По поводу T4 ничего не известно, но интерполируя прошлый абзац, это должны быть L4 и прирост в 3.7 раза
Вероятно, нас еще ждет ротация TPU, но там все слишком закрыто. Их и так постоянно меняют, но в очереди на TPU модель выбрать нельзя и каждый раз играешь в лоторею. Для меня вся идея выдавать TPU на каггле выглядит как мертворожденный проект:
1. Новые TPU есть только у гугла
2. Старые TPU гугл разбирает и на вторичке их никак не купить
Вывод:
Скилл использования TPU- только для гуглеров и мб нейроагентов.
TLDR:
P100 (2016) -> H100 (2022)
T4 (2018)-> L4 (2023), возможно
👍27🍌9🤩5❤1
Forwarded from adapt compete evolve or die
я 10 с лишним лет занимался интерпретациями масс-спеков, дожил до соревы на каггле 😍 хоть где-то не надо долго вникать в доменную область https://www.kaggle.com/competitions/enveda-CASMI26-molecule-id-mass-spectra
Kaggle
Enveda CASMI 2026 - Molecule ID From Mass Spectra
Predict 2D chemical structures of small molecules detected in complex biological extracts
🏆9🍌4❤3😁2
🌱 Alfa Connectome ML Competition 🌱
Началось новое соревнование по машинному обучению от Wunder Fund.
Задача: Вы будете изучать исторические торговые данные для двух связанных инструментов. Нужно создать модель, которая предсказывает индикаторы движения цены одного из них по информации об ордербуке, сделках и кое-чем еще.
По сути, классическая работа кванта. Вы будете работать с реальными биржевыми данными.
Когда: 11 сентября — 15 ноября
Призовой фонд: $13,600
Победители получат денежные призы, приглашение побеседовать в Wunder Fund, а главное — большое интеллектуальное удовольствие. Сам Wunder Fund с 2014 года занимается высокочастотным трейдингом с дневным оборотом более $10 млрд.
>> Участвовать
Началось новое соревнование по машинному обучению от Wunder Fund.
Задача: Вы будете изучать исторические торговые данные для двух связанных инструментов. Нужно создать модель, которая предсказывает индикаторы движения цены одного из них по информации об ордербуке, сделках и кое-чем еще.
По сути, классическая работа кванта. Вы будете работать с реальными биржевыми данными.
Когда: 11 сентября — 15 ноября
Призовой фонд: $13,600
Победители получат денежные призы, приглашение побеседовать в Wunder Fund, а главное — большое интеллектуальное удовольствие. Сам Wunder Fund с 2014 года занимается высокочастотным трейдингом с дневным оборотом более $10 млрд.
>> Участвовать
❤20🍌4👍2
Запрети мне псевдолейблить
Вопрос гипотетический и не про меня
Еще раз. Есть ОДНО КОМАНДНОЕ ЗОЛОТО в кармане с прошлых соревнований
Одна золотая медаль в профиле, других золотых нет
Одна золотая медаль в профиле, других золотых нет
❤4🤡2🔥1😭1