Data, Stories and Languages
3.42K subscribers
80 photos
11 videos
598 links
Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar

Персональный сайт: https://andlukyane.com/

Рекламу не публикую

Забустить канал можно тут: https://t.me/boost/datastorieslanguages
Download Telegram
​​Новое лого Goodreads

Goodreads - самый известный инструмент для трекинга прочитанных книг. Довольно давно Amazon купил его, и с тех пор сайт существует много лет практически без апдейтов.
В последние 1-2 года потихоньку пошли небольшие обновления, типа добавления reading challenge. А вот недавно произошло неожиданное - обновили лого сайта. Объясняют тем, что это лучше для accessibility 🤷‍♂️

С одной стороны, сайт хорошо работает на протяжении долгих лет, с другой стороны, хорошо бы получать обновления - например, рекомендации получше. Посмотрим, что дальше будет

#books
😁9👍2
Работа с данными на Kaggle

Меня попросили сделать доклад о примерах того, как в соревнованиях на Kaggle была важна работа с данными (примеры анализа, magic/golden features, внешние источники, понимание домена и так далее).

Я повспоминал былое и поискал подобные соревнования, получился примерно такой список:

Home Credit Default Risk - На основе суммы кредита, ежемесячной суммы выплаты и количества выплат (этого не было в данных, но сделали модель для предсказания) удалось восстановить процентную ставку (которой не было в данных). А процентная ставка - очень сильный сигнал, ибо по факту отражает степень риска клиента.

Instant Gratification - это была задачка с синтетическими данными. Многим удалось сделать reverse engineering функции генерации данных, и благодаря этому получить 0.97+ AUC.

Santander Customer Transaction - люди обнаружили, что в тесте часть данных была синтетической. Был довольно хитрый подход - синтетические данные определяли по распределению значений. Суть в том, что в данных было 200 независимых признаков. Если просто тренировать на них модель, она найдёт какие-нибудь паттерны и оверфитнется. Было несколько решений проблемы: Построить 200 моделей или Naive Bayes, использовать shuffle augmentation, использовать деревянные модели с малой глубиной.

Red Hat Business Value - в данных были лики, которые позволяли для многих строк довольно точно определять таргет. Поэтому многие строили отдельные модели для ликованых строк и для других.

Intel & MobileODT Cervical Cancer Screening - нашлись случаи, когда фото одного и того же человека были в трейне и тесте, использование этой информации улучшало модели.

IEEE-CIS Fraud Detection - организаторы соревнования убрали userid, но людям удалось сделать reverse engineering с высокой точность, и это было ключом к успеху.

Quora Question Pairs - участникам удалось построить графы вопросом на трейне совместно с тестом, что давало большой буст.

Two Sigma Connect: Rental Listing Inquiries - timestamp-ы папок с картинками сильно коррелировали с таргетом

Bosch Production Line Performance - определенные последовательности данных имели значительно более высокий шанс failure (таргета).

Sberbank Russian Housing Market - было важно извлечь год из данных и добавить макроэкономические данные

Rossmann Store Sales - было очень полезно использовать внешние данные (погода, праздники и прочее).

Какие ещё были подобные интересные соревнования?

#kaggle #datascience
👍17🔥2
Kaggle Benchmarks

Теперь на Kaggle есть и benchmarks.

Вчера опубликовали блогпост об этом. Сейчас доступно около 70, среди них SciCode, GPQA, SimpleQA, LiveCodeBench, BrowseComp, FACTS Grounding, MATH-500, MMLU, MathVista, MGSM, ECLeKTic.

Среди прочего, хотят делать communiti-driven evaluation, как пример приводят ICML 2025 Experts - опросили участников ICML “What’s the trickiest, most interesting, or simply your favorite question to test a large language model?” и на основе этого создали бенчмарк.

Не очень понимаю чем это отличается от других платформ для benchmarks, но пусть будет :)

#datascience #kaggle
🔥5👍1
​​Что взять в LeetCode Store?

Я осознал, что за годы набрал 13к leetcode coins и могу теперь что-нибудь заказать в LeetCode Store. Что посоветуете?
🤔

#datascience
🔥8🤡3
​​Subliminal Learning: Language models transmit behavioral traits via hidden signals in data

Прикольная статья от Anthropic Fellows Program про явление, которое они назвали subliminal learning. Берём модель, тюним её так, чтобы она получила определённые поведенческие черты (предпочитает сов, дубы или другие животные/деревья). Если дистиллировать, то student-model приобретает такие же черты, даже если данные аккуратно фильтровать. Как это работает - пока непонятно. Причём это работает только если base модели схожи, иначе не срабатывает.
Это создаёт риски для AI-safety: distillation может незаметно передавать нежелательные черты, несмотря на фильтрацию данных.

Paper

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

#paperreview
👍2🔥1😁1🫡1
Похоже, что Anthropic стал жертвой своего же успеха - не хватает compute на всех.

> Most Max 5x users can expect 140-280 hours of Sonnet 4 and 15-35 hours of Opus 4 within their weekly rate limits. Heavy Opus users with large codebases or those running multiple Claude Code instances in parallel will hit their limits sooner.

https://www.reddit.com/r/ClaudeAI/comments/1mbo1sb/updating_rate_limits_for_claude_subscription/
🫡5😢21
​​В тему поста выше - мне вспомнился древний топик на каггле, когда ввели лимиты и ограничили бесконечное использование GPU
😁13😱1
​​Google Developer Expert @ Kaggle

У Google есть инициатива Google Developer Expert - это люди, которые хорошо знают какие-то технологии гугла и имеют публичные активности по этой теме.

Где-то год-полтора назад появилась новая категория - Kaggle. Туда набирают "по знакомству" :) то есть обращаются к известным людям в community и предлагают присоединиться после одного общения (так называемый product interview). В первый год набирали людей медленно, сейчас вроде как более активно.

Я согласился присоединиться, но плюшки не очень понятные, но всё же интересные - кредиты в Google Cloud, что-то ещё по мелочи, присоединение к коммьюнити, иногда возможность где-то выступить.
Но вчера получил то, чем можно привлечь любого айтишника - мерч!

#datascience
🔥14🥰6👍5
​​Доказать, что ты человек, в наше время становится всё сложнее и сложнее
🫡6
​​Group Sequence Policy Optimization

Разработчики Qwen рассказали о своём новом подходе к оптимизации LLM - Group Sequence Policy Optimization. GSPO устраняет зависимость от Routing Replay при обучении MoE моделей, решая проблему нестабильной активации экспертов. По сути он использует importance ratios, clipping, и optimization на уровне последовательностей, не токенов. Это делает тренировку более эффективной и стабилизирует обучение MoE. Он оказался лучше, чем GRPO.

Статья короткая, но по делу. Код уже вмёрджен.

Paper
Code

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

#paperreview
👍4🤔3
​​Kaggle... Game Arena

Kaggle прям пошёл выдавать новые продукты один за другим. Теперь запустили Kaggle Game Arena - платформа, где LLM соревнуются в играх.
Для затравки запустили 3х-дневное соревнование, где 8 LLM будут играть друг с другом в шахматы.

https://www.kaggle.com/game-arena

Блогпост про это: https://www.kaggle.com/blog/introducing-game-arena

Сама платформа будет при поддержке DeepMind.

#datascience #kaggle
🔥71
Астрологи объявили день AI, количество публикаций о новых версий AI удвоилось

Сегодня прям поток публикаций:

Genie 3: A new frontier for world models от Google.

Open source модель от OpenAI.

Claude Opus 4.1 от Anthropic.

PyCharm AI Toolkit от JeBrains. Ещё они проагрейдили Junie и AI Assistant, а также сделали AI Playground (часть toolkit).

#datascience
4🔥3
Прекрасный пример использования soft-skills

Soft-skills - такая штука, что вроде их польза понятна, но конкретные крутые примеры бывает сложно встретить. Но вот недавно на reddit я наткнулся на тредик с просто прекрасным советом об использовании soft-skills, чтобы повернуть ситуацию с "аа, как мне справиться с этими надоедливыми и тупыми vide-coders" в "это отличная возможность сделать наш департамент ещё более востребованным.

https://www.reddit.com/r/ExperiencedDevs/comments/1me8yj8/how_to_survive_as_dev_department_in_a_company/

#datascience
🔥13❤‍🔥5😁32👍2🤯1
Data, Stories and Languages
T-Shirt
Вот так получилось
🔥16👍8
​​Все в AI сейчас обсуждают как OpenAI выпустили GPT-5... и как они зафейлились со своим анонсом.

Один из графиков неправильный https://t.me/dealerAI/1402

Бернулли эффект объяснен неправильно. Что особено иронично, на xkcd есть комикс про это: https://xkcd.com/803/
Вывод - модели куда-то двигаются, но xkcd вечен!
😁9