Data, Stories and Languages
3.42K subscribers
80 photos
11 videos
598 links
Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar

Персональный сайт: https://andlukyane.com/

Рекламу не публикую

Забустить канал можно тут: https://t.me/boost/datastorieslanguages
Download Telegram
Kaggle Benchmarks

Теперь на Kaggle есть и benchmarks.

Вчера опубликовали блогпост об этом. Сейчас доступно около 70, среди них SciCode, GPQA, SimpleQA, LiveCodeBench, BrowseComp, FACTS Grounding, MATH-500, MMLU, MathVista, MGSM, ECLeKTic.

Среди прочего, хотят делать communiti-driven evaluation, как пример приводят ICML 2025 Experts - опросили участников ICML “What’s the trickiest, most interesting, or simply your favorite question to test a large language model?” и на основе этого создали бенчмарк.

Не очень понимаю чем это отличается от других платформ для benchmarks, но пусть будет :)

#datascience #kaggle
🔥5👍1
​​Что взять в LeetCode Store?

Я осознал, что за годы набрал 13к leetcode coins и могу теперь что-нибудь заказать в LeetCode Store. Что посоветуете?
🤔

#datascience
🔥8🤡3
​​Subliminal Learning: Language models transmit behavioral traits via hidden signals in data

Прикольная статья от Anthropic Fellows Program про явление, которое они назвали subliminal learning. Берём модель, тюним её так, чтобы она получила определённые поведенческие черты (предпочитает сов, дубы или другие животные/деревья). Если дистиллировать, то student-model приобретает такие же черты, даже если данные аккуратно фильтровать. Как это работает - пока непонятно. Причём это работает только если base модели схожи, иначе не срабатывает.
Это создаёт риски для AI-safety: distillation может незаметно передавать нежелательные черты, несмотря на фильтрацию данных.

Paper

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

#paperreview
👍2🔥1😁1🫡1
Похоже, что Anthropic стал жертвой своего же успеха - не хватает compute на всех.

> Most Max 5x users can expect 140-280 hours of Sonnet 4 and 15-35 hours of Opus 4 within their weekly rate limits. Heavy Opus users with large codebases or those running multiple Claude Code instances in parallel will hit their limits sooner.

https://www.reddit.com/r/ClaudeAI/comments/1mbo1sb/updating_rate_limits_for_claude_subscription/
🫡5😢21
​​В тему поста выше - мне вспомнился древний топик на каггле, когда ввели лимиты и ограничили бесконечное использование GPU
😁13😱1
​​Google Developer Expert @ Kaggle

У Google есть инициатива Google Developer Expert - это люди, которые хорошо знают какие-то технологии гугла и имеют публичные активности по этой теме.

Где-то год-полтора назад появилась новая категория - Kaggle. Туда набирают "по знакомству" :) то есть обращаются к известным людям в community и предлагают присоединиться после одного общения (так называемый product interview). В первый год набирали людей медленно, сейчас вроде как более активно.

Я согласился присоединиться, но плюшки не очень понятные, но всё же интересные - кредиты в Google Cloud, что-то ещё по мелочи, присоединение к коммьюнити, иногда возможность где-то выступить.
Но вчера получил то, чем можно привлечь любого айтишника - мерч!

#datascience
🔥14🥰6👍5
​​Доказать, что ты человек, в наше время становится всё сложнее и сложнее
🫡6
​​Group Sequence Policy Optimization

Разработчики Qwen рассказали о своём новом подходе к оптимизации LLM - Group Sequence Policy Optimization. GSPO устраняет зависимость от Routing Replay при обучении MoE моделей, решая проблему нестабильной активации экспертов. По сути он использует importance ratios, clipping, и optimization на уровне последовательностей, не токенов. Это делает тренировку более эффективной и стабилизирует обучение MoE. Он оказался лучше, чем GRPO.

Статья короткая, но по делу. Код уже вмёрджен.

Paper
Code

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

#paperreview
👍4🤔3
​​Kaggle... Game Arena

Kaggle прям пошёл выдавать новые продукты один за другим. Теперь запустили Kaggle Game Arena - платформа, где LLM соревнуются в играх.
Для затравки запустили 3х-дневное соревнование, где 8 LLM будут играть друг с другом в шахматы.

https://www.kaggle.com/game-arena

Блогпост про это: https://www.kaggle.com/blog/introducing-game-arena

Сама платформа будет при поддержке DeepMind.

#datascience #kaggle
🔥71
Астрологи объявили день AI, количество публикаций о новых версий AI удвоилось

Сегодня прям поток публикаций:

Genie 3: A new frontier for world models от Google.

Open source модель от OpenAI.

Claude Opus 4.1 от Anthropic.

PyCharm AI Toolkit от JeBrains. Ещё они проагрейдили Junie и AI Assistant, а также сделали AI Playground (часть toolkit).

#datascience
4🔥3
Прекрасный пример использования soft-skills

Soft-skills - такая штука, что вроде их польза понятна, но конкретные крутые примеры бывает сложно встретить. Но вот недавно на reddit я наткнулся на тредик с просто прекрасным советом об использовании soft-skills, чтобы повернуть ситуацию с "аа, как мне справиться с этими надоедливыми и тупыми vide-coders" в "это отличная возможность сделать наш департамент ещё более востребованным.

https://www.reddit.com/r/ExperiencedDevs/comments/1me8yj8/how_to_survive_as_dev_department_in_a_company/

#datascience
🔥13❤‍🔥5😁32👍2🤯1
Data, Stories and Languages
T-Shirt
Вот так получилось
🔥16👍8
​​Все в AI сейчас обсуждают как OpenAI выпустили GPT-5... и как они зафейлились со своим анонсом.

Один из графиков неправильный https://t.me/dealerAI/1402

Бернулли эффект объяснен неправильно. Что особено иронично, на xkcd есть комикс про это: https://xkcd.com/803/
Вывод - модели куда-то двигаются, но xkcd вечен!
😁9