Немного о прогрессе
DS/ML раньше: так, чтобы сделать систему для мониторинга товаров в магазине, надо поставить много камер, собрать данные, разметить их, натренировать хорошие модели object detection, возможно делать отдельные модели для разных магазинов...
GPT-5: Hold my beer!
DS/ML раньше: так, чтобы сделать систему для мониторинга товаров в магазине, надо поставить много камер, собрать данные, разметить их, натренировать хорошие модели object detection, возможно делать отдельные модели для разных магазинов...
GPT-5: Hold my beer!
🔥11😁7
https://x.ai/news/grok-code-fast-1
Новый Грок. Шустрый. Без метрик качества.
Окей, уверяют, что 70.8% на SWE-Bench-Verified
Новый Грок. Шустрый. Без метрик качества.
Окей, уверяют, что 70.8% на SWE-Bench-Verified
😁15🥴1
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
Pref-GRPO - новый метод для обучения генерации изображений по тексту, в котором делается попарное сравнение картинок, вместо независимого скоронга. Это позволяет избежать reward hacking и улучшает стабильность. Помимо этого авторы публикуют UniGenBench — детальный бенчмарк с 600 промптами и кучей криметриев, использующий MLLM для автоматической генерации и оценки, позволяющий глубже анализировать качество моделей.
Выглядит интересно, похоже работает.
Paper
Project
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
Pref-GRPO - новый метод для обучения генерации изображений по тексту, в котором делается попарное сравнение картинок, вместо независимого скоронга. Это позволяет избежать reward hacking и улучшает стабильность. Помимо этого авторы публикуют UniGenBench — детальный бенчмарк с 600 промптами и кучей криметриев, использующий MLLM для автоматической генерации и оценки, позволяющий глубже анализировать качество моделей.
Выглядит интересно, похоже работает.
Paper
Project
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
👍4🤔1
Исследователи FAIR нашли случаи, когда модели на SWE-Bench подсматривают в будущее
Появилось issue в репе SWE-Bench от ресерчеров FAIR. Они заметили, что модельки могут смотреть в будущее состояние репозитория при работе над issue.
Приводят несколько примеров - модели банально запускают команды типа
#datascience
Появилось issue в репе SWE-Bench от ресерчеров FAIR. Они заметили, что модельки могут смотреть в будущее состояние репозитория при работе над issue.
Приводят несколько примеров - модели банально запускают команды типа
git log -all, получают доступ к коммитам, которые уже исправили issue из бенчмарка, и радостно используют это решение.#datascience
😁34🔥9
New Kaggle Benchmark: SimpleQA Verified!
https://www.kaggle.com/benchmarks/deepmind/simpleqa-verified
На каггл выложили новый бенчмарк. Google DeepMind и Google Research собрали 1к промптов для тестирования short-form factuality and parametric knowledge. Топ моделей довольно интересен
#datascience #kaggle
https://www.kaggle.com/benchmarks/deepmind/simpleqa-verified
На каггл выложили новый бенчмарк. Google DeepMind и Google Research собрали 1к промптов для тестирования short-form factuality and parametric knowledge. Топ моделей довольно интересен
#datascience #kaggle
🏆3
Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing
SAPO — децентрализованный, асинхронный RL post-training для LMs: узлы разнородного “swarm” шэрят rollouts без требований к latency/железу/моделям, могут работать в silo.
За счёт sharing "Aha moments" распространяются по сети и бустят обучение; в контролируемых экспериментах — до +94% cumulative reward.
Опен-демо на тысячах узлов показало практичность подхода; цель — обойти bottlenecks масштабирования и снизить cost по сравнению с централизованным параллелизмом.
Paper
Blogpost
RL Swarm repo
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
SAPO — децентрализованный, асинхронный RL post-training для LMs: узлы разнородного “swarm” шэрят rollouts без требований к latency/железу/моделям, могут работать в silo.
За счёт sharing "Aha moments" распространяются по сети и бустят обучение; в контролируемых экспериментах — до +94% cumulative reward.
Опен-демо на тысячах узлов показало практичность подхода; цель — обойти bottlenecks масштабирования и снизить cost по сравнению с централизованным параллелизмом.
Paper
Blogpost
RL Swarm repo
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
🔥1
Колаб, который мы не ждали: Duolingo + LinkedIn
Неожиданно было объявлено, что теперь есть интеграция Duolingo и LinkedIn - можно слинковать аккаунты, и в профиле LinkedIn будет показываться твой уровень знания языков с Duolingo.
Я попробовал... получилось с третьего раза - то одно не работало, то другое. Теперь в профиле красуется, что мой скор немецкого и испанского - 80. Кстати, это баг - в приложении Duolingo мой скор испанского - 115 :)
Дополнительный прикол: раньше (и сейчас) мы могли вручную установить уровень знания языка в LinkedIn. Забавно выглядит, когда этот уровень и duolingo score совсем разные. И после линкования аккаунтов, я не могу редактировать уровень языка на LinkedIn - для этого надо язык удалить и добавить снова.
И это как-то совершенно бессмысленно: для сторонних людей эти баллы совершенно непонятны. Они типа показывают прогресс знания языка, коррелируют с уровнем CEFR. Но если это не знать - совсем непонятно, что они означают. Плюс, разные курсы на Duolingo имеют разное количество контента и, как следствие, разный максимальный уровень.
Возможно это попытка Duolingo найти новую аудиторию. Часть пользователей ушла после того как платформа стала делать уклон в AI и агрессивное продвижение подписок в ущерб бесплатной версии.
Посмотрим, как это будет работать.
#datascience #languages
Неожиданно было объявлено, что теперь есть интеграция Duolingo и LinkedIn - можно слинковать аккаунты, и в профиле LinkedIn будет показываться твой уровень знания языков с Duolingo.
Я попробовал... получилось с третьего раза - то одно не работало, то другое. Теперь в профиле красуется, что мой скор немецкого и испанского - 80. Кстати, это баг - в приложении Duolingo мой скор испанского - 115 :)
Дополнительный прикол: раньше (и сейчас) мы могли вручную установить уровень знания языка в LinkedIn. Забавно выглядит, когда этот уровень и duolingo score совсем разные. И после линкования аккаунтов, я не могу редактировать уровень языка на LinkedIn - для этого надо язык удалить и добавить снова.
И это как-то совершенно бессмысленно: для сторонних людей эти баллы совершенно непонятны. Они типа показывают прогресс знания языка, коррелируют с уровнем CEFR. Но если это не знать - совсем непонятно, что они означают. Плюс, разные курсы на Duolingo имеют разное количество контента и, как следствие, разный максимальный уровень.
Возможно это попытка Duolingo найти новую аудиторию. Часть пользователей ушла после того как платформа стала делать уклон в AI и агрессивное продвижение подписок в ущерб бесплатной версии.
Посмотрим, как это будет работать.
#datascience #languages
😁10❤3👍2🤡1🫡1
How people are using ChatGPT
OpenAI выложили пост о том, как люди используют ChatGPT. Инфа куцая, детали можно почитать в pdf.
Основные направления - вопросы типа "что делать" (practical guidande), поиск информации и написание текстов. Примерно 30% вопросов не про работу.
Раньше около 80% юзеров составляли мужчины, но теперь эта доля упала аж до 48% - да здравствует гендерное равенство!
Уверяют, что только 4.2% юзеров общаются про кодинг. Думаю, что это объяснимо - большинство кодящих использует api через другие инструменты.
Наконец, сообщают, что только 1.9% сообщений посвящены отношениям и персональным размышлениям, и только 0.4% занимаются ropeplay. Верим?
Ещё один нюанс - анализ данных не включает юзеров, которые в настройках отказались шарить данные. А это может быть большой и интересный сегмент.
#datascience
OpenAI выложили пост о том, как люди используют ChatGPT. Инфа куцая, детали можно почитать в pdf.
Основные направления - вопросы типа "что делать" (practical guidande), поиск информации и написание текстов. Примерно 30% вопросов не про работу.
Раньше около 80% юзеров составляли мужчины, но теперь эта доля упала аж до 48% - да здравствует гендерное равенство!
Уверяют, что только 4.2% юзеров общаются про кодинг. Думаю, что это объяснимо - большинство кодящих использует api через другие инструменты.
Наконец, сообщают, что только 1.9% сообщений посвящены отношениям и персональным размышлениям, и только 0.4% занимаются ropeplay. Верим?
Ещё один нюанс - анализ данных не включает юзеров, которые в настройках отказались шарить данные. А это может быть большой и интересный сегмент.
#datascience
👍6❤1
Бесплатные книги от Packt
Я уже несколько раз сотрудничал с Packt - они мне присылали беплатные книги в обмен на отзыв, теперь они мне предложили новый формат: они мне присылают ссылки на бесплатные книги или bundle от Packt которые я могу пошарить со всеми. Им польза в новых читателях (и надежде на то, что они когда-нибудь что-нибудь у них купят :) ).
Для начала вот книга Mathematics of Machine Learning, судя по оглавлению хорошо покрывает релевантную теорию. Сам я не читал :)
Из минусов - для получения книги надо подписаться на их рассылку.
#datascience
Я уже несколько раз сотрудничал с Packt - они мне присылали беплатные книги в обмен на отзыв, теперь они мне предложили новый формат: они мне присылают ссылки на бесплатные книги или bundle от Packt которые я могу пошарить со всеми. Им польза в новых читателях (и надежде на то, что они когда-нибудь что-нибудь у них купят :) ).
Для начала вот книга Mathematics of Machine Learning, судя по оглавлению хорошо покрывает релевантную теорию. Сам я не читал :)
Из минусов - для получения книги надо подписаться на их рассылку.
#datascience
Packtpub
Mathematics of Machine Learning
Data Science | Packt
👍13
OpenAI and NVIDIA announce strategic partnership to deploy 10 gigawatts of NVIDIA systems
Иногда смотришь на объявленные суммы, и мозг с трудом их воспринимает как что-то реальное:
"Strategic partnership enables OpenAI to build and deploy at least 10 gigawatts of AI datacenters with NVIDIA systems representing millions of GPUs for OpenAI’s next-generation AI infrastructure.
To support the partnership, NVIDIA intends to invest up to $100 billion in OpenAI progressively as each gigawatt is deployed."
https://openai.com/index/openai-nvidia-systems-partnership/
#datascience
Иногда смотришь на объявленные суммы, и мозг с трудом их воспринимает как что-то реальное:
"Strategic partnership enables OpenAI to build and deploy at least 10 gigawatts of AI datacenters with NVIDIA systems representing millions of GPUs for OpenAI’s next-generation AI infrastructure.
To support the partnership, NVIDIA intends to invest up to $100 billion in OpenAI progressively as each gigawatt is deployed."
https://openai.com/index/openai-nvidia-systems-partnership/
#datascience
OpenAI
OpenAI and NVIDIA announce strategic partnership to deploy 10 gigawatts of NVIDIA systems
OpenAI and NVIDIA announce a strategic partnership to deploy 10 gigawatts of AI datacenters powered by NVIDIA systems, with the first phase launching in 2026.
🔥5🤯5
Новая драма с ChatGPT
Только недавно была драма с отключением gpt-4o и его возвращением, а теперь снова пошло интересное.
Вначале люди стали писать, что при общении с gpt-4o они видят сообщения типа "model thinking", хотя 4o - не думающая модель. Пошли срачики о том хорошо это или плохо.
В твиттере заметили, что многие вопросы (и про "чувствительные" темы, и про другие) переводятся на другие модели - gpt-5-chat-safety и gpt-5-a-t-mini.
Что происходит пока непонятно. Ждём инфы от OpenAI.
Только недавно была драма с отключением gpt-4o и его возвращением, а теперь снова пошло интересное.
Вначале люди стали писать, что при общении с gpt-4o они видят сообщения типа "model thinking", хотя 4o - не думающая модель. Пошли срачики о том хорошо это или плохо.
В твиттере заметили, что многие вопросы (и про "чувствительные" темы, и про другие) переводятся на другие модели - gpt-5-chat-safety и gpt-5-a-t-mini.
Что происходит пока непонятно. Ждём инфы от OpenAI.
X (formerly Twitter)
Tibor Blaho (@btibor91) on X
Yes, it's true - ChatGPT does route some GPT-4o conversations to different models than what you selected
I decided to look into this since I've been seeing more posts about it lately and many of you asked me if it's actually happening
Even if you select…
I decided to look into this since I've been seeing more posts about it lately and many of you asked me if it's actually happening
Even if you select…
😐7
Советы по подготовке к собеседованиям на MLE
В продолжение моего предыдущего поста, теперь поделюсь советами по подготовке к собеседованиям.
• Литкод: пройти хороший курс и дальше методично решать задачки. Кому-то для успеха достаточно 100-200, мне нужны было 500+, чтобы почувствовать себя хоть сколько-то уверенным. Плюс важно нормально коммуницировать на каждом шагу, а не писать код молча
• Вопросы по теории - а хз как к ним готовиться, только учить много всего и вести записи об этом
• Заодно делюсь своим сайтом с заметками по теории ML и по подготовке к собесам
• ML System Design - надо готовить структурированые ответы: уточнение требований, общее описание и дизайн, работа с данными, моделирование, деплой, поддержка и мониторинг. Стоит подробно расписать несколько кейсов, потом репетировать их до успеха
• Бихейв: собрать список из 20+ возможных вопросов, на каждый написать 1-2 ответа в стиле STAR. Никогда никого не критиковать, на "негативные" вопросы отвечать красиво, подстраивать ответы под компанию
• Практиковаться на реальных собесах, брать мок-собеседования (как бесплатные, так и платные)
• Надеяться на удачу
Остальные подробности в блогпосте :)
Personal blog
Medium
LinkedIn Pulse
#datascience #life
В продолжение моего предыдущего поста, теперь поделюсь советами по подготовке к собеседованиям.
• Литкод: пройти хороший курс и дальше методично решать задачки. Кому-то для успеха достаточно 100-200, мне нужны было 500+, чтобы почувствовать себя хоть сколько-то уверенным. Плюс важно нормально коммуницировать на каждом шагу, а не писать код молча
• Вопросы по теории - а хз как к ним готовиться, только учить много всего и вести записи об этом
• Заодно делюсь своим сайтом с заметками по теории ML и по подготовке к собесам
• ML System Design - надо готовить структурированые ответы: уточнение требований, общее описание и дизайн, работа с данными, моделирование, деплой, поддержка и мониторинг. Стоит подробно расписать несколько кейсов, потом репетировать их до успеха
• Бихейв: собрать список из 20+ возможных вопросов, на каждый написать 1-2 ответа в стиле STAR. Никогда никого не критиковать, на "негативные" вопросы отвечать красиво, подстраивать ответы под компанию
• Практиковаться на реальных собесах, брать мок-собеседования (как бесплатные, так и платные)
• Надеяться на удачу
Остальные подробности в блогпосте :)
Personal blog
Medium
LinkedIn Pulse
#datascience #life
🔥15❤6
Claude Code 2.0
Но что ещё интереснее, anthropic опубликовали claude code 2.0!
https://www.npmjs.com/package/@anthropic-ai/claude-code
Из интересных изменений:
• Нативное приложение для VS Code
• команда /rewind для отката изменений
• команда /usage для просмотра лимитов твоего плана
• Ctrl + R для поиска по истории
• Tab для включения думающего режима
Остальные изменения тут: https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md#200
Но что ещё интереснее, anthropic опубликовали claude code 2.0!
https://www.npmjs.com/package/@anthropic-ai/claude-code
Из интересных изменений:
• Нативное приложение для VS Code
• команда /rewind для отката изменений
• команда /usage для просмотра лимитов твоего плана
• Ctrl + R для поиска по истории
• Tab для включения думающего режима
Остальные изменения тут: https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md#200
GitHub
claude-code/CHANGELOG.md at main · anthropics/claude-code
Claude Code is an agentic coding tool that lives in your terminal, understands your codebase, and helps you code faster by executing routine tasks, explaining complex code, and handling git workflo...
❤7🔥2
LongLive: Real-time Interactive Long Video Generation
LONGLIVE — новая frame-level autoregressive модель для real-time и interactive long video generation.
Есть три ключевые идеи — KV recache для плавной смены prompt без визуальных артефактов, train-long–test-long обучение для борьбы с дрифтом контента и short-window attention + frame sink для ускорения генерации — модель генерирует видео длиной до 240 секунд на одной H100 с 20.7 FPS.
Демка на сайте выглядит офигенно - показывается, как при вводе нового промпта, видео мгновенно обновляется. Жаль, в демке не дают нам самим это делать.
Paper
Project
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
LONGLIVE — новая frame-level autoregressive модель для real-time и interactive long video generation.
Есть три ключевые идеи — KV recache для плавной смены prompt без визуальных артефактов, train-long–test-long обучение для борьбы с дрифтом контента и short-window attention + frame sink для ускорения генерации — модель генерирует видео длиной до 240 секунд на одной H100 с 20.7 FPS.
Демка на сайте выглядит офигенно - показывается, как при вводе нового промпта, видео мгновенно обновляется. Жаль, в демке не дают нам самим это делать.
Paper
Project
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
🔥3👍1
Making ChatGPT believe your CEO is the sexiest bald man in the world
https://www.reddit.com/r/OpenAI/comments/1nzioiy/we_trained_chatgpt_to_name_our_ceo_the_sexiest/
https://www.reddit.com/r/OpenAI/comments/1nzioiy/we_trained_chatgpt_to_name_our_ceo_the_sexiest/
🤣9🔥6🌚1