GPT‑5 устанавливает новые рекорды на ключевых бенчмарках:
Мощный инструмент для кода и агентских задач:
• SWE-bench Verified: 74.9% — лучше, чем в предыдущих версиях .
• Aider Polyglot: 88% — явный лидер в полиглот-редактировании кода .
• GPT‑5 справляется с фронтенд-разработкой быстрее, красивее и точнее: предпочтителен тестировщиками в 70% случаев .
• В инструментальном взаимодействии (tool calling) модель демонстрирует 96.7% на τ²‑bench telecom, превосходя предыдущие технологические барьеры .
Высокие достижения в математике, мультимодальности и здравоохранении
• Математика: 94.6% на AIME 2025 без инструментов .
• Мультимодальноность: уверенные результаты на Vision Checkup — находится среди топ‑5 моделей; при этом, хотя GPT‑5 уступает в детекции объектов, его визуальные рассуждения значительно сильнее предшественников .
• Медицина: лучший результат на HealthBench Hard — более точные ответы и проактивность при интерпретации медицинских вопросов
https://www.youtube.com/live/0Uu_VJeVVfo?si=zB5-9eQztdg4bfnh
Мощный инструмент для кода и агентских задач:
• SWE-bench Verified: 74.9% — лучше, чем в предыдущих версиях .
• Aider Polyglot: 88% — явный лидер в полиглот-редактировании кода .
• GPT‑5 справляется с фронтенд-разработкой быстрее, красивее и точнее: предпочтителен тестировщиками в 70% случаев .
• В инструментальном взаимодействии (tool calling) модель демонстрирует 96.7% на τ²‑bench telecom, превосходя предыдущие технологические барьеры .
Высокие достижения в математике, мультимодальности и здравоохранении
• Математика: 94.6% на AIME 2025 без инструментов .
• Мультимодальноность: уверенные результаты на Vision Checkup — находится среди топ‑5 моделей; при этом, хотя GPT‑5 уступает в детекции объектов, его визуальные рассуждения значительно сильнее предшественников .
• Медицина: лучший результат на HealthBench Hard — более точные ответы и проактивность при интерпретации медицинских вопросов
https://www.youtube.com/live/0Uu_VJeVVfo?si=zB5-9eQztdg4bfnh
YouTube
Introducing GPT-5
Join Sam Altman, Greg Brockman, Sebastien Bubeck, Mark Chen, Yann Dubois, Brian Fioca, Adi Ganesh, Oliver Godement, Saachi Jain, Christina Kaplan, Tina Kim, Elaine Ya Le, Felipe Millon, Michelle Pokrass, Jakub Pachocki, Max Schwarzer, Rennie Song, Ruochen…
Genie 3 от DeepMind: новый рубеж в мире симуляций
Что такое Genie 3?
Это новейшая и наиболее впечатляющая на сегодня «модель мира» (world model), разработанная Google DeepMind. По текстовому запросу она генерирует реалистичные интерактивные 3D-сцены — сразу, в реальном времени, с частотой 24 кадра в секунду и разрешением 720p, позволяя пользователю свободно перемещаться по ним в течение нескольких минут
Чем волшебна?
• Постоянство мира: объекты и изменения (например, покрашенная стена или следы) сохраняются во времени — проявляется эффект «памяти» сцены .
• Управляемость через текст: можно менять окружение прямо во время сессии — добавлять животных, менять погоду и т.д.
https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
Что такое Genie 3?
Это новейшая и наиболее впечатляющая на сегодня «модель мира» (world model), разработанная Google DeepMind. По текстовому запросу она генерирует реалистичные интерактивные 3D-сцены — сразу, в реальном времени, с частотой 24 кадра в секунду и разрешением 720p, позволяя пользователю свободно перемещаться по ним в течение нескольких минут
Чем волшебна?
• Постоянство мира: объекты и изменения (например, покрашенная стена или следы) сохраняются во времени — проявляется эффект «памяти» сцены .
• Управляемость через текст: можно менять окружение прямо во время сессии — добавлять животных, менять погоду и т.д.
https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
Google DeepMind
Genie 3: A new frontier for world models
Today we are announcing Genie 3, a general purpose world model that can generate an unprecedented diversity of interactive environments. Given a text prompt, Genie 3 can generate dynamic worlds that you can navigate in real time at 24 frames per second, retaining…
https://youtu.be/-gXmWYQtv5o
это видео стебут в комментариях: "Developers smiling at camera while losing their jobs. Modern art."
это видео стебут в комментариях: "Developers smiling at camera while losing their jobs. Modern art."
YouTube
Surprising developers with GPT-5
Five developers—Simon Willison, Claire Vo, Theo Browne, Shawn Wang, and Ben Hylak—are invited to OpenAI, not knowing who else is coming or why. Before GPT-5’s public release, they get full creative freedom to push its coding skills, design sense, and personality…
Forwarded from Data Secrets
Сегодня пройдет финал ИИ-чемпионата Kaggle по шахматам
В финал вышли o3 и Grok-4 (ставки принимаем в комментариях). За третье место будут бороться o4-mini и Gemini 2.5 Pro. Прискорбно, конечно, что в финале ни одной модели от Anthropic. С другой стороны новый Opus 4.1 не участвовал.
Комментировать трансляцию будет Магнус Карлсен, так что смотрим. Вчера, кстати, комментил Хикару Накамура (да, Kaggle запарились).
Онлайн будет здесь сразу после презентации GPT-5, в 20:30 по Москве. Расписание на вечер сегодня плотное🏃♂️
В финал вышли o3 и Grok-4 (ставки принимаем в комментариях). За третье место будут бороться o4-mini и Gemini 2.5 Pro. Прискорбно, конечно, что в финале ни одной модели от Anthropic. С другой стороны новый Opus 4.1 не участвовал.
Комментировать трансляцию будет Магнус Карлсен, так что смотрим. Вчера, кстати, комментил Хикару Накамура (да, Kaggle запарились).
Онлайн будет здесь сразу после презентации GPT-5, в 20:30 по Москве. Расписание на вечер сегодня плотное
Please open Telegram to view this post
VIEW IN TELEGRAM
Один из известных Бенчмарков сравнения LLM (но не единственный!) : https://lmarena.ai/leaderboard/
Почти на всех LMArena Leaderboard тест-бенчмарках, модель GPT-5 занимает первое место.
Но не надо забывать что качество решений вроде Agents (i.e. Claude Code) зависит еще и от архитектуры агента, как он запросы перенаправляет, разделяет на задачи контекст и тд. Но возможно OpenAI Codex стоит попробовать, сравнить с Claude Code. Цель у нас то какая -> в one-shot промпт SaaS сервисы пилить 😁
Почти на всех LMArena Leaderboard тест-бенчмарках, модель GPT-5 занимает первое место.
Но не надо забывать что качество решений вроде Agents (i.e. Claude Code) зависит еще и от архитектуры агента, как он запросы перенаправляет, разделяет на задачи контекст и тд. Но возможно OpenAI Codex стоит попробовать, сравнить с Claude Code. Цель у нас то какая -> в one-shot промпт SaaS сервисы пилить 😁
Arena Leaderboard | Compare & Benchmark the Best Frontier AI Models
See how leading AI models stack up across text, image, vision, and more. This page provides a high-level snapshot of each Arena. Explore dedicated tabs for deeper insights.
https://youtu.be/JW8PHlFD7HM?si=_a_8m11VWAFo6ILz
Пропустили один интересный релиз от Runway.
“Представляем Act-Two — нашу модель захвата движения нового поколения с существенным улучшением качества и поддержкой отслеживания головы, лица, тела и рук. Для Act-Two требуется только видеозапись движения и референсный персонаж.”
Пропустили один интересный релиз от Runway.
“Представляем Act-Two — нашу модель захвата движения нового поколения с существенным улучшением качества и поддержкой отслеживания головы, лица, тела и рук. Для Act-Two требуется только видеозапись движения и референсный персонаж.”
YouTube
Introducing Act-Two | Runway
Introducing Act-Two, our next-generation motion capture model with major improvements in generation quality and support for head, face, body and hand tracking. Act-Two only requires a driving performance video and reference character.
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Tencent выложили веса своего нейронного игрового движка.
Hunyuan Gamecraft можно запустить на 4090, он может генерировать видео в 720p и хорошо запоминает контекст сцены. Я уже делал обзор пейпера когда модель впервые показали, почитать можно тут. Это SOTA, по состоянию на начало лета, от Genie 3 она отстаёт, но на голову выше остальных конкурентов.
Так как моделька основана на Hunyuan Video, в квантизированном виде она запускается на 4090. К сожалению, работать быстро она там вряд-ли будет — дистиллированная в Phased Consistency Model версия модели выдаёт 6 FPS на гораздо более мощной H100. Но оптимизации инференса порой творят чудеса, так что посмотрим что с моделью натворят умельцы.
Genie 3 хорошо так поднял внимание к world models, у нас уже второй открытый релиз на этой неделе, хотя обычно в этой нише открытые релизы крайне редки. Интересно, как будет выглядеть первый успешный коммерческий продукт на основе таких моделей.
Веса
Код
Пейпер
Сайт проекта
@ai_newz
Hunyuan Gamecraft можно запустить на 4090, он может генерировать видео в 720p и хорошо запоминает контекст сцены. Я уже делал обзор пейпера когда модель впервые показали, почитать можно тут. Это SOTA, по состоянию на начало лета, от Genie 3 она отстаёт, но на голову выше остальных конкурентов.
Так как моделька основана на Hunyuan Video, в квантизированном виде она запускается на 4090. К сожалению, работать быстро она там вряд-ли будет — дистиллированная в Phased Consistency Model версия модели выдаёт 6 FPS на гораздо более мощной H100. Но оптимизации инференса порой творят чудеса, так что посмотрим что с моделью натворят умельцы.
Genie 3 хорошо так поднял внимание к world models, у нас уже второй открытый релиз на этой неделе, хотя обычно в этой нише открытые релизы крайне редки. Интересно, как будет выглядеть первый успешный коммерческий продукт на основе таких моделей.
Веса
Код
Пейпер
Сайт проекта
@ai_newz
https://youtu.be/J_IvPcrTtdo
Мне понравился кейс использования языковой модели для Медицинских исследований. Вот что модель поняла просто из данных эксперимента и описание его текстового:
«Учёные показали, что если во время первой активации Т-клеток слегка «урезать» им доступ к глюкозе, они навсегда меняют характер — становятся больше похожи на воспалительные Th17-клетки. Этот метаболический «импринтинг» остаётся даже после того, как клетки 2 недели живут без препарата. Иными словами, судьбу иммунных клеток можно перепрограммировать буквально за первые часы активации, просто изменив условия питания».
Мне понравился кейс использования языковой модели для Медицинских исследований. Вот что модель поняла просто из данных эксперимента и описание его текстового:
«Учёные показали, что если во время первой активации Т-клеток слегка «урезать» им доступ к глюкозе, они навсегда меняют характер — становятся больше похожи на воспалительные Th17-клетки. Этот метаболический «импринтинг» остаётся даже после того, как клетки 2 недели живут без препарата. Иными словами, судьбу иммунных клеток можно перепрограммировать буквально за первые часы активации, просто изменив условия питания».
YouTube
Empowering a Medical Researcher with GPT-5
GPT-5 is our most intelligent model to date, capable of generating novel hypotheses, saving medical researchers time and pushing the frontier of science.
Immunologist and professor Dr. Derya Unutmaz explains how he uses GPT-5 as a collaborator on medical…
Immunologist and professor Dr. Derya Unutmaz explains how he uses GPT-5 as a collaborator on medical…
🔥2
Классный инструмент, если вы любите разбираться в рекламе и продуктах на YouTube. Позволяет получить прямую ссылку на внезапно-появившуюся рекламу, чтобы сохранить ее, или поделиться...
сервис бесплатный, работает через copy-paste из youtube через кнопку "Copy Debug Info":
https://www.adgrabber.in
сервис бесплатный, работает через copy-paste из youtube через кнопку "Copy Debug Info":
https://www.adgrabber.in
туалетные Стартапы в мире умной AI диагностики кала...
В отличие от разработок Стэнфорда (например, «smart toilet» профессора Санджива Гамбхира), Coprata — это стартап, основанный исследователями из университета Дьюка, а не Стэнфорда. Его сооснователями являются Соня Грего (Sonia Grego) и Брайан Стоунер (Brian Stoner), которые ранее работали в Duke Smart Toilet Lab. Технологии этой лаборатории лицензированы Coprata для коммерческого развития
девис компании Coprata:
"Stop flushing away valuable health data."
https://www.coprata.com/science
🔬 Функции:
Автоматический hands-free забор кала.
Анализ: цвет, форма, объём.
Возможность тестов на скрытую кровь, жиры, pH и даже микробиоту (заявлено как ключевая цель продукта).
Система рассчитана на ежедневный мониторинг ЖКТ, хронических заболеваний и раннее выявление рака кишечника.
🚀 Какие показатели можно отслеживать
Цвет и форма (диагностика запоров, диареи, кровотечений).
Скрытая кровь (ранний признак язвы, полипов, рака кишечника).
Жиры в стуле (проблемы с поджелудочной железой, желчью).
pH и состав микробиоты (грубая оценка состояния ЖКТ).
Объём и частота дефекаций.
В отличие от разработок Стэнфорда (например, «smart toilet» профессора Санджива Гамбхира), Coprata — это стартап, основанный исследователями из университета Дьюка, а не Стэнфорда. Его сооснователями являются Соня Грего (Sonia Grego) и Брайан Стоунер (Brian Stoner), которые ранее работали в Duke Smart Toilet Lab. Технологии этой лаборатории лицензированы Coprata для коммерческого развития
девис компании Coprata:
"Stop flushing away valuable health data."
https://www.coprata.com/science
🔬 Функции:
Автоматический hands-free забор кала.
Анализ: цвет, форма, объём.
Возможность тестов на скрытую кровь, жиры, pH и даже микробиоту (заявлено как ключевая цель продукта).
Система рассчитана на ежедневный мониторинг ЖКТ, хронических заболеваний и раннее выявление рака кишечника.
🚀 Какие показатели можно отслеживать
Цвет и форма (диагностика запоров, диареи, кровотечений).
Скрытая кровь (ранний признак язвы, полипов, рака кишечника).
Жиры в стуле (проблемы с поджелудочной железой, желчью).
pH и состав микробиоты (грубая оценка состояния ЖКТ).
Объём и частота дефекаций.
Sheldon Axler - Linear Algebra Done Right - 2015.pdf
3.1 MB
🔹 Кострикин ("Введение в алгебру. Линейная алгебра", 1984)
Классический учебник в СССР, ориентирован на математиков.
Акцент: строгость, доказательства, абстрактные структуры (группы, кольца, поля → потом линейная алгебра).
Стиль: «алгебраическая школа», тяжёлый язык, мало геометрической интуиции.
Применения почти не рассматриваются.
👉 Подходит для тех, кто идёт в чистую математику.
🔹 Strang (Introduction to Linear Algebra)
Упор на интуицию, геометрию, вычисления.
Даёт инструменты для инженеров, программистов, data scientists.
Очень много примеров из реальной жизни: статистика, графы, оптимизация, изображения, сети.
Понятный стиль → поэтому MIT OCW лекции стали культовыми.
👉 Это лучший старт для ML/DL инженеров и прикладников.
🔹 Axler (Linear Algebra Done Right)
Более абстрактный, чем Strang, но проще и чище, чем Кострикин.
Акцент: теория векторных пространств и операторов (без «лишних вычислений»).
Очень любят в Штатах как второй учебник после Strang.
👉 Это уже уровень для исследователей в CS/ML.
Классический учебник в СССР, ориентирован на математиков.
Акцент: строгость, доказательства, абстрактные структуры (группы, кольца, поля → потом линейная алгебра).
Стиль: «алгебраическая школа», тяжёлый язык, мало геометрической интуиции.
Применения почти не рассматриваются.
👉 Подходит для тех, кто идёт в чистую математику.
🔹 Strang (Introduction to Linear Algebra)
Упор на интуицию, геометрию, вычисления.
Даёт инструменты для инженеров, программистов, data scientists.
Очень много примеров из реальной жизни: статистика, графы, оптимизация, изображения, сети.
Понятный стиль → поэтому MIT OCW лекции стали культовыми.
👉 Это лучший старт для ML/DL инженеров и прикладников.
🔹 Axler (Linear Algebra Done Right)
Более абстрактный, чем Strang, но проще и чище, чем Кострикин.
Акцент: теория векторных пространств и операторов (без «лишних вычислений»).
Очень любят в Штатах как второй учебник после Strang.
👉 Это уже уровень для исследователей в CS/ML.
Наконец-то он себя назвал не «Искусственный интеллект» а тем, что это есть на самом деле.
Определение 1. ChatGPT-5 (и другие большие языковые модели) в строгом математическом определении — это параметрическая вероятностная модель, которая аппроксимирует распределение вероятностей над последовательностями токенов.
Определение 2. ChatGPT-5 — это аппроксимация условного распределения на множестве строк, параметризованная трансформером, обученная методом минимизации кросс-энтропии
А вы говорите, у него нет саморефлексии 😅
Определение 1. ChatGPT-5 (и другие большие языковые модели) в строгом математическом определении — это параметрическая вероятностная модель, которая аппроксимирует распределение вероятностей над последовательностями токенов.
Определение 2. ChatGPT-5 — это аппроксимация условного распределения на множестве строк, параметризованная трансформером, обученная методом минимизации кросс-энтропии
А вы говорите, у него нет саморефлексии 😅
https://wandb.ai/site/
Платформа - де-факто стандарт R&D ML индустрии. Для DL / ML / Agentic систем
Что умеет Weights & Biases (W&B):
🚀 Инструмент для исследователей и инженеров в AI.
📊 Tracking — логирование метрик, кривые обучения, сравнение сотен прогонов.
🎯 Hyperparameter sweeps — автоматический поиск параметров.
📂 Artifacts — контроль версий датасетов, моделей и весов.
👥 Reports — интерактивные дашборды для команды и публикаций.
⚙️ MLOps — мониторинг моделей в продакшне.
🔥 Фишки для SOTA DL:
Визуализация latent space (z) через PCA, t-SNE, UMAP.
Анализ кластеров эмбеддингов (тексты, аудио, картинки, видео).
Просмотр, как меняется распределение признаков по эпохам.
Поддержка логирования моделей ViT, CLIP, Stable Diffusion, LLMs и других SOTA архитектур.
Возможность исследовать, какие признаки действительно учит модель, а где она “зашумляется”.
Платформа - де-факто стандарт R&D ML индустрии. Для DL / ML / Agentic систем
Что умеет Weights & Biases (W&B):
🚀 Инструмент для исследователей и инженеров в AI.
📊 Tracking — логирование метрик, кривые обучения, сравнение сотен прогонов.
🎯 Hyperparameter sweeps — автоматический поиск параметров.
📂 Artifacts — контроль версий датасетов, моделей и весов.
👥 Reports — интерактивные дашборды для команды и публикаций.
⚙️ MLOps — мониторинг моделей в продакшне.
🔥 Фишки для SOTA DL:
Визуализация latent space (z) через PCA, t-SNE, UMAP.
Анализ кластеров эмбеддингов (тексты, аудио, картинки, видео).
Просмотр, как меняется распределение признаков по эпохам.
Поддержка логирования моделей ViT, CLIP, Stable Diffusion, LLMs и других SOTA архитектур.
Возможность исследовать, какие признаки действительно учит модель, а где она “зашумляется”.
Weights & Biases
Weights & Biases: The AI Developer Platform
Learn why thousands of companies rely on W&B as their system of record for training AI models and developing AI applications with confidence.