Kaggle Benchmarks
Теперь на Kaggle есть и benchmarks.
Вчера опубликовали блогпост об этом. Сейчас доступно около 70, среди них SciCode, GPQA, SimpleQA, LiveCodeBench, BrowseComp, FACTS Grounding, MATH-500, MMLU, MathVista, MGSM, ECLeKTic.
Среди прочего, хотят делать communiti-driven evaluation, как пример приводят ICML 2025 Experts - опросили участников ICML “What’s the trickiest, most interesting, or simply your favorite question to test a large language model?” и на основе этого создали бенчмарк.
Не очень понимаю чем это отличается от других платформ для benchmarks, но пусть будет :)
#datascience #kaggle
Теперь на Kaggle есть и benchmarks.
Вчера опубликовали блогпост об этом. Сейчас доступно около 70, среди них SciCode, GPQA, SimpleQA, LiveCodeBench, BrowseComp, FACTS Grounding, MATH-500, MMLU, MathVista, MGSM, ECLeKTic.
Среди прочего, хотят делать communiti-driven evaluation, как пример приводят ICML 2025 Experts - опросили участников ICML “What’s the trickiest, most interesting, or simply your favorite question to test a large language model?” и на основе этого создали бенчмарк.
Не очень понимаю чем это отличается от других платформ для benchmarks, но пусть будет :)
#datascience #kaggle
Kaggle
AI Benchmarks — Evaluate Models & Agents | Kaggle
Build, run, and share benchmarks for evaluating AI models and agents. Crowdsourced by the AI research community on Kaggle.
🔥5👍1
Нам нужна новая captcha
https://www.reddit.com/r/OpenAI/comments/1m9c15h/agent_casually_clicking_the_i_am_not_a_robot/
https://www.reddit.com/r/OpenAI/comments/1m9c15h/agent_casually_clicking_the_i_am_not_a_robot/
😁8
Что взять в LeetCode Store?
Я осознал, что за годы набрал 13к leetcode coins и могу теперь что-нибудь заказать в LeetCode Store. Что посоветуете?
🤔
#datascience
Я осознал, что за годы набрал 13к leetcode coins и могу теперь что-нибудь заказать в LeetCode Store. Что посоветуете?
🤔
#datascience
🔥8🤡3
🤔1
Subliminal Learning: Language models transmit behavioral traits via hidden signals in data
Прикольная статья от Anthropic Fellows Program про явление, которое они назвали subliminal learning. Берём модель, тюним её так, чтобы она получила определённые поведенческие черты (предпочитает сов, дубы или другие животные/деревья). Если дистиллировать, то student-model приобретает такие же черты, даже если данные аккуратно фильтровать. Как это работает - пока непонятно. Причём это работает только если base модели схожи, иначе не срабатывает.
Это создаёт риски для AI-safety: distillation может незаметно передавать нежелательные черты, несмотря на фильтрацию данных.
Paper
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
Прикольная статья от Anthropic Fellows Program про явление, которое они назвали subliminal learning. Берём модель, тюним её так, чтобы она получила определённые поведенческие черты (предпочитает сов, дубы или другие животные/деревья). Если дистиллировать, то student-model приобретает такие же черты, даже если данные аккуратно фильтровать. Как это работает - пока непонятно. Причём это работает только если base модели схожи, иначе не срабатывает.
Это создаёт риски для AI-safety: distillation может незаметно передавать нежелательные черты, несмотря на фильтрацию данных.
Paper
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
👍2🔥1😁1🫡1
Похоже, что Anthropic стал жертвой своего же успеха - не хватает compute на всех.
> Most Max 5x users can expect 140-280 hours of Sonnet 4 and 15-35 hours of Opus 4 within their weekly rate limits. Heavy Opus users with large codebases or those running multiple Claude Code instances in parallel will hit their limits sooner.
https://www.reddit.com/r/ClaudeAI/comments/1mbo1sb/updating_rate_limits_for_claude_subscription/
> Most Max 5x users can expect 140-280 hours of Sonnet 4 and 15-35 hours of Opus 4 within their weekly rate limits. Heavy Opus users with large codebases or those running multiple Claude Code instances in parallel will hit their limits sooner.
https://www.reddit.com/r/ClaudeAI/comments/1mbo1sb/updating_rate_limits_for_claude_subscription/
🫡5😢2❤1
В тему поста выше - мне вспомнился древний топик на каггле, когда ввели лимиты и ограничили бесконечное использование GPU
😁13😱1
Google Developer Expert @ Kaggle
У Google есть инициатива Google Developer Expert - это люди, которые хорошо знают какие-то технологии гугла и имеют публичные активности по этой теме.
Где-то год-полтора назад появилась новая категория - Kaggle. Туда набирают "по знакомству" :) то есть обращаются к известным людям в community и предлагают присоединиться после одного общения (так называемый product interview). В первый год набирали людей медленно, сейчас вроде как более активно.
Я согласился присоединиться, но плюшки не очень понятные, но всё же интересные - кредиты в Google Cloud, что-то ещё по мелочи, присоединение к коммьюнити, иногда возможность где-то выступить.
Но вчера получил то, чем можно привлечь любого айтишника - мерч!
#datascience
У Google есть инициатива Google Developer Expert - это люди, которые хорошо знают какие-то технологии гугла и имеют публичные активности по этой теме.
Где-то год-полтора назад появилась новая категория - Kaggle. Туда набирают "по знакомству" :) то есть обращаются к известным людям в community и предлагают присоединиться после одного общения (так называемый product interview). В первый год набирали людей медленно, сейчас вроде как более активно.
Я согласился присоединиться, но плюшки не очень понятные, но всё же интересные - кредиты в Google Cloud, что-то ещё по мелочи, присоединение к коммьюнити, иногда возможность где-то выступить.
Но вчера получил то, чем можно привлечь любого айтишника - мерч!
#datascience
🔥14🥰6👍5
Group Sequence Policy Optimization
Разработчики Qwen рассказали о своём новом подходе к оптимизации LLM - Group Sequence Policy Optimization. GSPO устраняет зависимость от Routing Replay при обучении MoE моделей, решая проблему нестабильной активации экспертов. По сути он использует importance ratios, clipping, и optimization на уровне последовательностей, не токенов. Это делает тренировку более эффективной и стабилизирует обучение MoE. Он оказался лучше, чем GRPO.
Статья короткая, но по делу. Код уже вмёрджен.
Paper
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
Разработчики Qwen рассказали о своём новом подходе к оптимизации LLM - Group Sequence Policy Optimization. GSPO устраняет зависимость от Routing Replay при обучении MoE моделей, решая проблему нестабильной активации экспертов. По сути он использует importance ratios, clipping, и optimization на уровне последовательностей, не токенов. Это делает тренировку более эффективной и стабилизирует обучение MoE. Он оказался лучше, чем GRPO.
Статья короткая, но по делу. Код уже вмёрджен.
Paper
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
👍4🤔3
Kaggle... Game Arena
Kaggle прям пошёл выдавать новые продукты один за другим. Теперь запустили Kaggle Game Arena - платформа, где LLM соревнуются в играх.
Для затравки запустили 3х-дневное соревнование, где 8 LLM будут играть друг с другом в шахматы.
https://www.kaggle.com/game-arena
Блогпост про это: https://www.kaggle.com/blog/introducing-game-arena
Сама платформа будет при поддержке DeepMind.
#datascience #kaggle
Kaggle прям пошёл выдавать новые продукты один за другим. Теперь запустили Kaggle Game Arena - платформа, где LLM соревнуются в играх.
Для затравки запустили 3х-дневное соревнование, где 8 LLM будут играть друг с другом в шахматы.
https://www.kaggle.com/game-arena
Блогпост про это: https://www.kaggle.com/blog/introducing-game-arena
Сама платформа будет при поддержке DeepMind.
#datascience #kaggle
🔥7❤1
Астрологи объявили день AI, количество публикаций о новых версий AI удвоилось
Сегодня прям поток публикаций:
Genie 3: A new frontier for world models от Google.
Open source модель от OpenAI.
Claude Opus 4.1 от Anthropic.
PyCharm AI Toolkit от JeBrains. Ещё они проагрейдили Junie и AI Assistant, а также сделали AI Playground (часть toolkit).
#datascience
Сегодня прям поток публикаций:
Genie 3: A new frontier for world models от Google.
Open source модель от OpenAI.
Claude Opus 4.1 от Anthropic.
PyCharm AI Toolkit от JeBrains. Ещё они проагрейдили Junie и AI Assistant, а также сделали AI Playground (часть toolkit).
#datascience
❤4🔥3
Прекрасный пример использования soft-skills
Soft-skills - такая штука, что вроде их польза понятна, но конкретные крутые примеры бывает сложно встретить. Но вот недавно на reddit я наткнулся на тредик с просто прекрасным советом об использовании soft-skills, чтобы повернуть ситуацию с "аа, как мне справиться с этими надоедливыми и тупыми vide-coders" в "это отличная возможность сделать наш департамент ещё более востребованным.
https://www.reddit.com/r/ExperiencedDevs/comments/1me8yj8/how_to_survive_as_dev_department_in_a_company/
#datascience
Soft-skills - такая штука, что вроде их польза понятна, но конкретные крутые примеры бывает сложно встретить. Но вот недавно на reddit я наткнулся на тредик с просто прекрасным советом об использовании soft-skills, чтобы повернуть ситуацию с "аа, как мне справиться с этими надоедливыми и тупыми vide-coders" в "это отличная возможность сделать наш департамент ещё более востребованным.
https://www.reddit.com/r/ExperiencedDevs/comments/1me8yj8/how_to_survive_as_dev_department_in_a_company/
#datascience
🔥13❤🔥5😁3❤2👍2🤯1
Все в AI сейчас обсуждают как OpenAI выпустили GPT-5... и как они зафейлились со своим анонсом.
Один из графиков неправильный https://t.me/dealerAI/1402
Бернулли эффект объяснен неправильно. Что особено иронично, на xkcd есть комикс про это: https://xkcd.com/803/
Вывод - модели куда-то двигаются, но xkcd вечен!
Один из графиков неправильный https://t.me/dealerAI/1402
Бернулли эффект объяснен неправильно. Что особено иронично, на xkcd есть комикс про это: https://xkcd.com/803/
Вывод - модели куда-то двигаются, но xkcd вечен!
😁9
Data, Stories and Languages
Kaggle... Game Arena Kaggle прям пошёл выдавать новые продукты один за другим. Теперь запустили Kaggle Game Arena - платформа, где LLM соревнуются в играх. Для затравки запустили 3х-дневное соревнование, где 8 LLM будут играть друг с другом в шахматы. …
И победитель... o3!
🔥7👍2