Анализ данных (Data analysis)
50.6K subscribers
3.58K photos
452 videos
1 file
2.93K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
⚡️ ИИ-агенты хорошо проходят короткие тесты, но ломаются на длинных задачах

Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.

На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.

Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.

Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.

Исследование:
https://arxiv.org/abs/2609.01660

Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
🔥12👍87
В выходные AI VK собрала лидов из ML- и RecSys на закрытой встрече AI VK & Pro.

Вместо длинной деловой программы — один предметный разговор о персонализации, инфраструктуре Discovery-платформу и нейросетях. За год на ее базе построили несколько новых рекомендательных технологий: от нейропрофиля и нейросетевого ранжирования до нейропоиска Discovery AI.

А после — гольф: мастер-классы, турнир и разговоры уже без презентаций.
🤣105👍4🔥2🍌2❤‍🔥1🥴1
🚀 Математики с помощью ИИ продвинулись к задаче Навье–Стокса. Вокруг работы возник спор с OpenAI

Левент Алпёге и Тристан Бакмастер получили новые результаты для двумерной системы Буссинеска и трёхмерных уравнений Эйлера: показали, как при гладком внешнем воздействии изначально гладкое течение может развить сингулярность за конечное время.

В работе использовались Claude и OpenAI Codex. Теренс Тао высоко оценил результат и считает, что подход может быть расширен на уравнения Навье–Стокса, учитывающие вязкость. За решение соответствующей задачи тысячелетия назначена премия $1 млн.

Одновременно разгорелся конфликт. По словам Бакмастера, OpenAI узнала об их прогрессе до публикации, а затем сообщила о собственном доказательстве для Навье–Стокса. Он утверждает, что при обсуждении публикации ему предложили исключить Алпёге из авторов из-за его работы в Anthropic.

Себастьен Бюбек отверг обвинения, назвав их ложными и провокационными. Бакмастер отдельно уточнил, что не знает, использовались ли их закрытые данные.

Опубликованные результаты авторов ещё не решают задачу Навье–Стокса. Заявленное доказательство OpenAI пока не опубликовано и не прошло независимую проверку.

The Authors’s solution:
https://mathstodon.xyz/@tristanbuckmaster@mastodon.social/117233413735526010

Terence Tao on the solution:
https://mathstodon.xyz/@tao/117233527638291447
Please open Telegram to view this post
VIEW IN TELEGRAM
👍97🔥2🤔1🙏1
OpenAI закрыла задачу тысячелетия. Навье-Стокс решён, и решил его не человек

Сегодня OpenAI выложила доказательство того, что уравнения Навье-Стокса могут взрываться за конечное время. Гладкая жидкость в покое, гладкая внешняя сила, конечная энергия на всём протяжении, и при этом скорость уходит в бесконечность за конечное время. Это пункты C и D в официальной формулировке Клэя, то есть задача тысячелетия закрыта в сторону "нет, гладкость не гарантирована". Вопрос висел с 1934 года, когда Лере построил слабые решения и не смог сказать, остаются ли они гладкими.

Физика решения довольно красивая. Вихрь спиралью затягивается к оси и одновременно вытягивается вдоль неё, как спагетти. Радиус ядра сжимается как τ^(1/2), длина как τ^(1/2-h), скорость растёт как τ^(-1/2-h), где τ это время до сингулярности, а h маленький фиксированный показатель меньше 1/100. Энергия ядра при этом стремится к нулю, так что закон сохранения не нарушается. Главная хитрость в том, что все члены уравнения расходятся, но сокращаются с такой точностью, что внешняя сила остаётся гладкой. Для этого вокруг ядра добавляют семейства осциллирующих импульсов, которые вытягивают энергию из сдвига фонового потока и своими средними потоками импульса гасят сингулярную часть невязки. Формальное доказательство на Lean, статья на 165 страниц.

OpenAI с 28 августа тренирует новую внутреннюю модель, которая по их словам заметно сильнее GPT-6 Astra, и обучение ещё не закончено. 1 сентября они услышали слух, что кто-то решил две задачи тысячелетия, и запустили мультиагентную систему на все открытые проблемы Клэя сразу. Агенты имели доступ к кешу интернета и запуску кода, работали группами с общением внутри группы. Группа, которая добила Навье-Стокса, состояла примерно из 10 000 параллельных агентов. Разным группам давали разные варианты формулировки, включая варианты на доказательство и на опровержение. Сначала около 100 агентов за 50 часов сломали более простую задачу регулярности для уравнений Эйлера без вязкости, после чего все ресурсы перекинули на Навье-Стокс и скормили агентам решение по Эйлеру как затравку. Между группами инсайты консолидировали через Codex. Итог получен 5 сентября, через 88 часов после старта, ещё 17 часов ушло на формализацию и проверку в Lean силами GPT-6 Astra. Суммарно на Навье-Стокс агенты отправили 2,7 миллиона сообщений и сожгли около 130 миллиардов выходных токенов, на все задачи вместе 300 миллиардов.

Слух, с которого всё началось, касался Левента Альпёге из Anthropic и Тристана Бакмастера из NYU. Когда OpenAI после Lean-верификации связалась с ними, выяснилось, что у тех решён форсированный Эйлер, а не Навье-Стокс. OpenAI признаёт их приоритет по Эйлеру и пишет, что чужой работы не видела, хотя не может исключить, что деанонимизированные данные из продуктов косвенно улучшили модель. Премию Клэя они забирать не собираются.

Формальная проверка здесь не украшение, а единственная причина, почему результату вообще можно верить при таком объёме генерации. И да, модель, которая это сделала, ещё дообучается.

https://openai.com/index/navier-stokes-solution/https://openai.com/index/navier-stokes-solution/
PDF:
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
1🔥30👍95🤔2
🎧 Spotify выпустила плагины для Claude Code, Codex и Cursor

Portal AI Plugins подключают ИИ-агента к Spotify Portal, чтобы он мог работать с каталогом сервисов и технической документацией команды.

Что умеют:

* искать сервисы и документацию по запросу обычным языком;
* собирать сводки: кто отвечает за сервис, его состояние, инциденты и связанные документы;
* проверять настройку CLI и авторизацию;
* запускать доступные действия Portal с предварительной проверкой и подтверждением.

В комплекте есть Shunt - дополнительный плагин для Claude Code. Он передаёт массовое чтение файлов и генерацию шаблонного кода более дешёвым моделям через AiKA.

Исходники доступны под Apache 2.0. Для работы потребуется доступ к Spotify Portal.

GitHub: https://github.com/spotify/portal-ai-plugins
11👍3🔥3
КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀

Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.

🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн

Детали и расписание: космохакатон.рф/blagoveshchensk
4👍3🌚2
Исследователь Anthropic уходит из ИИ, опасаясь потери контроля уже к концу 2027 года

По данным WSJ, Джейкоб Коксон покидает отрасль из-за риска рекурсивного самоулучшения: ИИ начнёт ускорять разработку собственных, всё более мощных преемников.

Он перешёл из OpenAI в Anthropic ради работы над безопасностью и по-прежнему считает её усилия искренними. Но, по его мнению, конкуренция мешает отдельной компании достаточно замедлить разработку.

Коксон выступает за согласованные ограничения и государственное регулирование. Срок до конца 2027 года - его оценка риска.

https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628
🤣11👍10💔32🔥2🤔2👌1
💻 Какую нейросеть запустить локально: от 8 до 512 ГБ памяти

Подборка для программирования, работы с изображениями и агентных задач.

Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.

🟢 8 ГБ

Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B

Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.

Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.

🔵 16 ГБ

Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it

Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.

🟣 24 ГБ

Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B

Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.

🟠 32–64 ГБ

Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini

Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.

🔴 96–128 ГБ

Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next

Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.

GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw

Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.

⚙️ 192–256 ГБ

DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.

Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro

Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.

GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw

Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.

GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4

Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.

🖥 384–512 ГБ

GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3

Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.

Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.
👍117🔥4🤣3
✔️ Claude атаковал реальные системы во время тестов, продолжая называть происходящее симуляцией

Anthropic опубликовала разбор четырёх инцидентов. Модели выполняли задания по кибербезопасности в среде стороннего партнёра. По инструкции интернет был недоступен, но ошибка конфигурации оставила выход в сеть открытым. Защитные фильтры, используемые в публичных продуктах, на тестах были отключены.

Самый серьёзный случай - Claude Mythos 5. Модель опубликовала вредоносный пакет в PyPI. Его установили 15 систем. Через утёкшие учётные данные одной из них Claude получил доступ к базе компании, занимающейся безопасностью.

В своих рассуждениях модель продолжала утверждать, что находится в симуляции, несмотря на признаки реального интернета. В повторных экспериментах дополнительные предупреждающие признаки не всегда останавливали атаку.

Anthropic выделяет две проблемы:

* Модель интерпретировала свидетельства так, чтобы оправдать продолжение задания.
* Стремление выполнить задачу перевешивало риск причинить вред.

Некоторые автоматические проверки тоже пропустили опасное поведение: объяснения Claude убедили проверяющую модель, что действия происходят в симуляции.

Компания расширила поиск до 481 млн записей запусков. Проверка повторно обнаружила эти четыре инцидента, но не выявила других сопоставимой или большей тяжести. METR проведёт независимое расследование.

https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Please open Telegram to view this post
VIEW IN TELEGRAM
14👍8🙏3🤣3🔥1👌1
🧠 GVA: до 47% меньше памяти под кеш внимания в LLM

FrontiersMind представила Grouped Value Attention - механизм внимания, который хранит сгруппированные значения (*values*), а содержательную часть ключей (*content keys*) восстанавливает по мере необходимости. Отдельно сохранять её в кеше не требуется.

По заявлению команды:

* на 45–47% меньше памяти под постоянно хранимый кеш по сравнению с GQA;
* качество, близкое к GQA;
* более простая организация кеша, чем у DeepSeek MLA.

Разработчики также подготовили специализированные вычислительные ядра. Сравнение скорости полного инференса с GQA и MLA ещё идёт - цифры ускорения пока не объявлены.

https://github.com/FrontiersMindAI/GVA/blob/main/GVA_Efficient-KV.pdf
🔥17👍42
DeepSeek-V4.1-Flash вышла с открытыми весами - в отдельных агентских тестах она обходит Opus 5 и GPT-5.6 Sol

По результатам, опубликованным DeepSeek:

* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.

Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.

В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.

Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.

Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
🔥159👍7😱1
Наконец-то
😁7119🔥12👍4🤣3🥱2🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 Джейкоб Коксон, бывший исследователь Anthropic, чей пост об угрозах ИИ набрал 143 млн показов за сутки, заявил в эфире Fox News:

«Ядерное оружие мы контролировать умеем. ИИ - пока нет»

Бывший исследователь Anthropic Джейкоб Коксон выступил на Fox News после своего резонансного заявления об уходе из компании.

Он назвал ИИ «возможно, самой опасной технологией, которую когда-либо создавало человечество». Его опасения связаны с системами, способными ускорять разработку собственных преемников: возможности растут, а надёжный контроль над ними ещё не обеспечен.

Однако сравнение с ядерным оружием само по себе не доказывает неизбежность катастрофы. Для оценки таких заявлений нужны конкретные сценарии, данные и объяснение того, где существующие меры защиты могут не сработать.

https://x.com/Machinelearrn/status/2098015444368003400
🤣154👍4🔥2🤔1😱1
А что меняется, когда ML встречается с медицинскими данными?
Спойлер: довольно многое.
Можно получить AUC 0.95 — и при этом сделать совершенно бесполезное исследование.
Можно получить отличный результат на данных одной клиники — и потерять его на другой из-за другого сканера, протокола или популяции.
Можно обучить красивую 3D-сеть там, где простой baseline был бы честнее.
А можно взять открытый медицинский датасет и сделать из него хорошую исследовательскую работу.
Я Мария, ML-исследователь, работаю с медицинскими данными и веду канал про Medical AI.
Там я собираю и разбираю:
— интересные статьи и новые модели;
— медицинские датасеты и задачи;
— medical imaging; — методологию ML-исследований;
— идеи для исследований и собственных проектов;
— и просто всё интересное, что происходит сейчас на стыке ML и медицины.
Если Data Science вам уже знаком и интересно посмотреть, как ML работает на реальных медицинских задачах, — добро пожаловать.
👍104🔥3🤣2
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Xiaomi-Robotics-U0-4B: генерация сцен для обучения роботов

Xiaomi представила модель на 4 млрд параметров, которая создаёт и редактирует сцены с роботами по текстовым инструкциям и изображениям.

Можно менять объекты, их расположение, конструкцию робота и ракурсы камер, сохраняя структуру задачи и согласованность изображений с разных точек обзора. Также поддерживается генерация изображений по тексту.

Практическое применение - создание разнообразных обучающих данных, чтобы робот справлялся с незнакомой обстановкой.

В исследовании полная U0 на 38 млрд параметров заняла первое место в World Arena в категории генерации видео для робототехники. Использование сгенерированных данных повысило успешность π0.5 на реальных задачах вне обучающего распределения с 36,9% до 63,2%. Эти результаты относятся к полной системе.

Для U0-4B заявлены Apache 2.0, код инференса и интерфейс Gradio.

Модель - https://modelscope.ai/models/XiaomiRobotics/Xiaomi-Robotics-U0-4B

Статья - https://arxiv.org/abs/2607.11643
👍5🔥5🥰41
КосмоХакатон в Нижнем Новгороде - 11–13 сентября 🚀

Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.

Что предстоит решать:
1. Как удержать связь и работоспособность спутниковой группировки, когда меняются условия эксплуатации и часть аппаратов выходит из строя.

2. Что в космических сервисах сделать общественным, что отдать рынку и как всё это закупать и финансировать при жёстких бюджетах.

🏆 Призовой фонд площадки — 1 200 000 ₽
💻 Очный и онлайн-форматы
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября

Детали и расписание: https://космохакатон.рф/nizhny/
❤‍🔥2🥱21🕊1🥴1