This media is not supported in your browser
VIEW IN TELEGRAM
🔥54🍌31😭11🤣7🙏6❤4
Forwarded from Egor
Medals come and go bro
But you know I stay
But you know I stay
1❤40🔥5🤣5🍌1😭1
Запрети мне псевдолейблить
93 место и серебро нафармлено. Пойду спать, удачи не произошло https://www.kaggle.com/competitions/rogii-wellbore-geology-prediction/leaderboard Три золота были выиграны в лотерею 🪿, классика
Кстати медали за Rogii раздали и я позорно не вошел в топ 400 :(
Ставьте хот-доги если нужен разбор Rogii на канале
Ставьте хот-доги если нужен разбор Rogii на канале
1🌭164🍌10💊7👍1
У покемонов прошлой ночью настал дедлайн сабмитов. Через две недели будут зафиксированы финальные места, но по моей оценке вас будет шатать на +-30 вверх и вниз от текущего уровня. Разбор соревнования сделаю в текстовом виде, чтобы закрепить все находки.
Ожидаю, что мы останемся с командой на ~100 месте, так что я видимо подфармил еще одно серебро. Уже восьмое
Что у нас работало:
BC
PSRO
Поиск мата за один ход (внезапно)
Тупо скейлить модель в ширину
AUX-голова на победу в матче (так называемая value-head для бедных)
AUX-голова на взятие приза
Что не работало:
Хитрый анализ колод
PPO
MCTS
AWR (вообще никак)
QWR и прочие производные
Напишите в комментах, какое место ждете и апнули ли вы звание
Еще интересно, будете ли участвовать в спареном хакатоне, или желание прикосаться к игре полностью отбито
По моим ощущениям весь топ лб состоит из японцев, дитера собирающего дань и одного скромного flg. А еще поздравляю Азата с поднятием кгм походу
Ожидаю, что мы останемся с командой на ~100 месте, так что я видимо подфармил еще одно серебро. Уже восьмое
Что у нас работало:
BC
PSRO
Поиск мата за один ход (внезапно)
Тупо скейлить модель в ширину
AUX-голова на победу в матче (так называемая value-head для бедных)
AUX-голова на взятие приза
Что не работало:
Хитрый анализ колод
PPO
MCTS
AWR (вообще никак)
QWR и прочие производные
Напишите в комментах, какое место ждете и апнули ли вы звание
Еще интересно, будете ли участвовать в спареном хакатоне, или желание прикосаться к игре полностью отбито
По моим ощущениям весь топ лб состоит из японцев, дитера собирающего дань и одного скромного flg. А еще поздравляю Азата с поднятием кгм походу
5❤15🔥1🍌1
Forwarded from Azat
Ого, ну раз пошла такая пьянка, придется ответить. Спасибо кстати, но поздравлять пока рано...
такой вот примерно рецепт усредненный получился:
- имитация на топовых игроках, точность около 85% была на валидации, давало 950-1100 эло за день игры
- ppo с подгрузом чекпоинта из имитации, где-то 400 топовых дек, играют все против всех, но с вероятностью 90% берем и меняем часть карт на рандомные - так учим эмбеды карт которых не было в имитации (а это процентов 80) ну и учимся играть против мусора чтобы не отлетать типам с 450 эло.
- ppo с подгрузом предыдущего шага, все против всех но теперь только 10% что карты будут меняться, плюс фриз эмбедов. дальше чемпионат по итогам которого я удалил 50% дек.
Сабмиты давали 1000-1100, примерно, какие-то лучше имитации, какие-то хуже, хрен поймешь.
- грузим прошлый чекпоинт, берем top 1 деку по итогам чемпионата (flg 55456110) и опять PPO, но один из игроков всегда играет топовую деку, другой одну из оставшихся 200
на хитрые штуки типа кастомных голов и MCTS времени совсем не осталось, фактически первый сабмит последнего шага был за 4 часа до делайна. ну и я нуб в RL, так что решение довольно ванильное, разве что я потырил некоторые штуки у топов orbits
учил на 4090, за неделю до конца снял 8x5090, итоговый пайплайн со всеми шагами двое суток где-то учился.
исходя из логов надеюсь на 3-8 место, из забавного так как по-сути 50% времени я тренировал деку flg и модель училась против него играть, то на играх за сутки винрейт больше 80% против него, лол. и с luca каким-то образом 55%, этого я уже никак не могу объяснить, возможно везет пока
совет молодым кто пойдет ферму решать, если позволите:
не торопитесь идти делать RL
сначала отточите пайплайн на имитации - он должен вас сходу закидывать в золото. если не закидывает - идите ловите ошибки, досыпайте и чистите данные. я что на orbits, что тут потратил 90% времени на это. codex/claude пишут довольно странный код если детально не смотреть, типа ставят LN после GELU, weight decay на эмбеды, при том что за батч 95% карт не будет сыграна и тд. если ваш пайплайн не способен тупо скопировать стратегию, то и все остальное вряд ли поможет. /goal на ночь и оптимизация кода на трейнах по 30 минут аля nanogpt speedrun часто давала фиксы и неожиданно полезные решения.
И помните, у самурая нет цели, только путь
такой вот примерно рецепт усредненный получился:
- имитация на топовых игроках, точность около 85% была на валидации, давало 950-1100 эло за день игры
- ppo с подгрузом чекпоинта из имитации, где-то 400 топовых дек, играют все против всех, но с вероятностью 90% берем и меняем часть карт на рандомные - так учим эмбеды карт которых не было в имитации (а это процентов 80) ну и учимся играть против мусора чтобы не отлетать типам с 450 эло.
- ppo с подгрузом предыдущего шага, все против всех но теперь только 10% что карты будут меняться, плюс фриз эмбедов. дальше чемпионат по итогам которого я удалил 50% дек.
Сабмиты давали 1000-1100, примерно, какие-то лучше имитации, какие-то хуже, хрен поймешь.
- грузим прошлый чекпоинт, берем top 1 деку по итогам чемпионата (flg 55456110) и опять PPO, но один из игроков всегда играет топовую деку, другой одну из оставшихся 200
на хитрые штуки типа кастомных голов и MCTS времени совсем не осталось, фактически первый сабмит последнего шага был за 4 часа до делайна. ну и я нуб в RL, так что решение довольно ванильное, разве что я потырил некоторые штуки у топов orbits
учил на 4090, за неделю до конца снял 8x5090, итоговый пайплайн со всеми шагами двое суток где-то учился.
исходя из логов надеюсь на 3-8 место, из забавного так как по-сути 50% времени я тренировал деку flg и модель училась против него играть, то на играх за сутки винрейт больше 80% против него, лол. и с luca каким-то образом 55%, этого я уже никак не могу объяснить, возможно везет пока
совет молодым кто пойдет ферму решать, если позволите:
не торопитесь идти делать RL
сначала отточите пайплайн на имитации - он должен вас сходу закидывать в золото. если не закидывает - идите ловите ошибки, досыпайте и чистите данные. я что на orbits, что тут потратил 90% времени на это. codex/claude пишут довольно странный код если детально не смотреть, типа ставят LN после GELU, weight decay на эмбеды, при том что за батч 95% карт не будет сыграна и тд. если ваш пайплайн не способен тупо скопировать стратегию, то и все остальное вряд ли поможет. /goal на ночь и оптимизация кода на трейнах по 30 минут аля nanogpt speedrun часто давала фиксы и неожиданно полезные решения.
И помните, у самурая нет цели, только путь
5🔥23⚡7❤5👍2🍌2🏆1
Наконец-то новый образовательный RL-мем в моем любимом паблике про RL
Создано специально для Азата, который не уйдет на пенсию, пока на каггле не кончится РЛ
Я это к тому, что ждем PvE соревнование с закрытой информацией и неопредленностью на некотором среднесрочном горизонте.Ах да, точно, PvE с закрытой информацией- это же AI Agent Security - Multi-Step Tool Attacks . Буквально задача соревы: сделай что-то, а мы тебе не скажем что и какие условия. Тест и трейн вообще разные, но ты попробуй
Я это к тому, что ждем PvE соревнование с закрытой информацией и неопредленностью на некотором среднесрочном горизонте.
😁19❤3🍌3👾2
Разбор ROGII - Wellbore Geology Prediction начнем с сетапа соревнования. Мы на нем подфармили еще одно серебро, а часть подписчиков апнула золото, причем в нескольких разных командах. Горжусь и завидую.
Представьте, что Герр Дональд Трамп сказал нам 'drill, baby, drill', а мы и поверили. И вот уже бурим скважину для исследования недр где-то в Техасе: у нас есть идеальный план бурения и наш бур напичкан кучей датчиков. Буром управляет опытный оператор, который знает, что у пласта породы плотность неравномерная: встречаются камни, пустоты и включения других пород. Из-за этого бур немного (или много) поворачивает внутри скважины и отклоняется от модельной траектории. Оператор смотрит на датчики и подруливает буром, чтобы оставаться как можно ближе к модельному плану бурения- его цель как можно корректнее разведать датчиками на буре показания как можно ближе к траектории.
Наша задача- понять, как глубоко в пласте мы находимся, зная предыдущие наблюдения + текущие показатели датчиков. В общем смысле это надо, чтобы бур не выскочил в другой пласт (нам не интересный) и не насобирал ненужной информации. Ну и спланировать, как мы будем качать нефть, сжигать попутный газ и с этой бесплатной энергии майнить битки
И того, у нас есть:
1. Координаты в каждый момент времени для бура для каждой скважины. Доступна информация до тех пор, пока бур спускается в целевой пласт и для часть скважины уже внутри пласта. Это наш train кусочек для авторегрессии. Еще для каждого участка скважины знаем длину пути от поверхности и оценочное расстояние в футах до границ всех нам известных пластов (оценивается по typewell, последний пункт).
2. Значения Gamma Ray (GR) на протяжении всего пути. Работает так: у каждой породы свой уровень гамма-радиоактивности, так что регулярно снимая показатели фоновой радиации с бура, мы можем по изменениям понять, что состав породы меняется. Для каждого пласта мы знаем примерны состав и показатель радиоактивности по typewell (следующий пункт), так что можем довольно неплохо понять, что слишком близко подошли к границе пласта и рулить назад.
3. Знаем те же показатели для ближайшей измерительной скважины (typewell): глубину, значение GR на этой глубине и метку того, в каком пласте находимся. Предполагается, что она пробурена вертикально вниз.
При этом данные реальные и близкие скважины переиспользуют одни и те же typewell и вообще у них направление и траектория бурения похожа, потому что пласты породы расположены друг на друге и это сильно влияет на оптимальную траекторию.
Можно было бы сказать, что в Техасе все данные по скважинам обязательно нужно сдавать правительству, но организаторы об этом позаботились и к каждой скважине и ее координатам добавили индивидуального шума, так что относительное расстояние между скважинами исказилось. И кажется даже немного перемешались ближайшие typewell. Мало того, скважины еще и обрезали, так что матчить их долго и совсем не ясно, какие скважины попали в тест, а какие нет, потому что это Code Comp.
Как решать будете?
#RogiiWGP
Представьте, что Герр Дональд Трамп сказал нам 'drill, baby, drill', а мы и поверили. И вот уже бурим скважину для исследования недр где-то в Техасе: у нас есть идеальный план бурения и наш бур напичкан кучей датчиков. Буром управляет опытный оператор, который знает, что у пласта породы плотность неравномерная: встречаются камни, пустоты и включения других пород. Из-за этого бур немного (или много) поворачивает внутри скважины и отклоняется от модельной траектории. Оператор смотрит на датчики и подруливает буром, чтобы оставаться как можно ближе к модельному плану бурения- его цель как можно корректнее разведать датчиками на буре показания как можно ближе к траектории.
Наша задача- понять, как глубоко в пласте мы находимся, зная предыдущие наблюдения + текущие показатели датчиков. В общем смысле это надо, чтобы бур не выскочил в другой пласт (нам не интересный) и не насобирал ненужной информации. Ну и спланировать, как мы будем качать нефть
И того, у нас есть:
1. Координаты в каждый момент времени для бура для каждой скважины. Доступна информация до тех пор, пока бур спускается в целевой пласт и для часть скважины уже внутри пласта. Это наш train кусочек для авторегрессии. Еще для каждого участка скважины знаем длину пути от поверхности и оценочное расстояние в футах до границ всех нам известных пластов (оценивается по typewell, последний пункт).
2. Значения Gamma Ray (GR) на протяжении всего пути. Работает так: у каждой породы свой уровень гамма-радиоактивности, так что регулярно снимая показатели фоновой радиации с бура, мы можем по изменениям понять, что состав породы меняется. Для каждого пласта мы знаем примерны состав и показатель радиоактивности по typewell (следующий пункт), так что можем довольно неплохо понять, что слишком близко подошли к границе пласта и рулить назад.
3. Знаем те же показатели для ближайшей измерительной скважины (typewell): глубину, значение GR на этой глубине и метку того, в каком пласте находимся. Предполагается, что она пробурена вертикально вниз.
При этом данные реальные и близкие скважины переиспользуют одни и те же typewell и вообще у них направление и траектория бурения похожа, потому что пласты породы расположены друг на друге и это сильно влияет на оптимальную траекторию.
Можно было бы сказать, что в Техасе все данные по скважинам обязательно нужно сдавать правительству, но организаторы об этом позаботились и к каждой скважине и ее координатам добавили индивидуального шума, так что относительное расстояние между скважинами исказилось. И кажется даже немного перемешались ближайшие typewell. Мало того, скважины еще и обрезали, так что матчить их долго и совсем не ясно, какие скважины попали в тест, а какие нет, потому что это Code Comp.
Как решать будете?
#RogiiWGP
1🔥20🤯5🍌5❤3👍1🦄1
Нестеров получил премию Гаусса
Все, кто учился DL по слайдам постсоветской матшколы знают про Nesterov Accelerated Gradient. Статья вышла еще в 1983 году, но оценить ее реальный вклад можно только в последние лет 10-15. Производные от него методы оптимизации, к сожалению, не стали железным стандартом в индустрии, но довольно популярныу знающих людей
Так вот, за свой вклад в математику Юрий Нестеров получил премию Гаусса, с чем я его горячо поздравляю. Это буквально нобелевская премия, но для математиков и высшая форма признания вклада в науку.
О том, как работает метод оптимизации и в чем идея, лучше посмотреть вот в этом посте, а я хотел бы примерно рассказать, как так вышло, что метод с лучшей теоретической оценкой не стал стандартом.
Мои три подписчика с ММП скажут, что у Adan/NAdam не нормируют градиенты и из-за этого менее устойчивы к правильному LR -> хуже проскакивают турбулентные участки гиперповерхности лосса.Кстати, возмущенные неточностью подписчики с ммп ставьте обезьяну, узнаем сколько вас.
Но фатальным ударом для этих методов был таймлайн.
Статья про Nadam появилась в 2016, и в этот момент Attention is all you need (Aiayn) уже находилась в процессе написания, так что в ней использовали проверенный Adam как оптимизатор. После этого многие побежали воспроизводить результаты у себя и следовали рецепту, описанному в статье. У нас есть десятки тысяч статей, которые развивают идеи Aiayn и большая часть использует именно Adam. А значит у ресерчеров больше наблюдений для Adam и его имплементации более оптимизированы под современное железо.
По практике скажу, что Nesterov momentum мне буста в качестве давал ровно ноль раз, так что приглашаю попустить меня в комментах и объяснить, почему нужно всегда учить именно с Adan.
Все, кто учился DL по слайдам постсоветской матшколы знают про Nesterov Accelerated Gradient. Статья вышла еще в 1983 году, но оценить ее реальный вклад можно только в последние лет 10-15. Производные от него методы оптимизации, к сожалению, не стали железным стандартом в индустрии, но довольно популярны
Так вот, за свой вклад в математику Юрий Нестеров получил премию Гаусса, с чем я его горячо поздравляю. Это буквально нобелевская премия, но для математиков и высшая форма признания вклада в науку.
О том, как работает метод оптимизации и в чем идея, лучше посмотреть вот в этом посте, а я хотел бы примерно рассказать, как так вышло, что метод с лучшей теоретической оценкой не стал стандартом.
Мои три подписчика с ММП скажут, что у Adan/NAdam не нормируют градиенты и из-за этого менее устойчивы к правильному LR -> хуже проскакивают турбулентные участки гиперповерхности лосса.
Но фатальным ударом для этих методов был таймлайн.
Статья про Nadam появилась в 2016, и в этот момент Attention is all you need (Aiayn) уже находилась в процессе написания, так что в ней использовали проверенный Adam как оптимизатор. После этого многие побежали воспроизводить результаты у себя и следовали рецепту, описанному в статье. У нас есть десятки тысяч статей, которые развивают идеи Aiayn и большая часть использует именно Adam. А значит у ресерчеров больше наблюдений для Adam и его имплементации более оптимизированы под современное железо.
По практике скажу, что Nesterov momentum мне буста в качестве давал ровно ноль раз, так что приглашаю попустить меня в комментах и объяснить, почему нужно всегда учить именно с Adan.
👍28❤17🙉10🍌7🔥6