В выходные AI VK собрала лидов из ML- и RecSys на закрытой встрече AI VK & Pro.
Вместо длинной деловой программы — один предметный разговор о персонализации, инфраструктуре Discovery-платформу и нейросетях. За год на ее базе построили несколько новых рекомендательных технологий: от нейропрофиля и нейросетевого ранжирования до нейропоиска Discovery AI.
А после — гольф: мастер-классы, турнир и разговоры уже без презентаций.
Вместо длинной деловой программы — один предметный разговор о персонализации, инфраструктуре Discovery-платформу и нейросетях. За год на ее базе построили несколько новых рекомендательных технологий: от нейропрофиля и нейросетевого ранжирования до нейропоиска Discovery AI.
А после — гольф: мастер-классы, турнир и разговоры уже без презентаций.
🤣10❤5👍4🔥2🍌2❤🔥1🥴1
Левент Алпёге и Тристан Бакмастер получили новые результаты для двумерной системы Буссинеска и трёхмерных уравнений Эйлера: показали, как при гладком внешнем воздействии изначально гладкое течение может развить сингулярность за конечное время.
В работе использовались Claude и OpenAI Codex. Теренс Тао высоко оценил результат и считает, что подход может быть расширен на уравнения Навье–Стокса, учитывающие вязкость. За решение соответствующей задачи тысячелетия назначена премия $1 млн.
Одновременно разгорелся конфликт. По словам Бакмастера, OpenAI узнала об их прогрессе до публикации, а затем сообщила о собственном доказательстве для Навье–Стокса. Он утверждает, что при обсуждении публикации ему предложили исключить Алпёге из авторов из-за его работы в Anthropic.
Себастьен Бюбек отверг обвинения, назвав их ложными и провокационными. Бакмастер отдельно уточнил, что не знает, использовались ли их закрытые данные.
Опубликованные результаты авторов ещё не решают задачу Навье–Стокса. Заявленное доказательство OpenAI пока не опубликовано и не прошло независимую проверку.
The Authors’s solution:
https://mathstodon.xyz/@tristanbuckmaster@mastodon.social/117233413735526010
Terence Tao on the solution:
https://mathstodon.xyz/@tao/117233527638291447
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9❤7🔥2🤔1🙏1
OpenAI закрыла задачу тысячелетия. Навье-Стокс решён, и решил его не человек
Сегодня OpenAI выложила доказательство того, что уравнения Навье-Стокса могут взрываться за конечное время. Гладкая жидкость в покое, гладкая внешняя сила, конечная энергия на всём протяжении, и при этом скорость уходит в бесконечность за конечное время. Это пункты C и D в официальной формулировке Клэя, то есть задача тысячелетия закрыта в сторону "нет, гладкость не гарантирована". Вопрос висел с 1934 года, когда Лере построил слабые решения и не смог сказать, остаются ли они гладкими.
Физика решения довольно красивая. Вихрь спиралью затягивается к оси и одновременно вытягивается вдоль неё, как спагетти. Радиус ядра сжимается
OpenAI с 28 августа тренирует новую внутреннюю модель, которая по их словам заметно сильнее GPT-6 Astra, и обучение ещё не закончено. 1 сентября они услышали слух, что кто-то решил две задачи тысячелетия, и запустили мультиагентную систему на все открытые проблемы Клэя сразу. Агенты имели доступ к кешу интернета и запуску кода, работали группами с общением внутри группы. Группа, которая добила Навье-Стокса, состояла примерно из 10 000 параллельных агентов. Разным группам давали разные варианты формулировки, включая варианты на доказательство и на опровержение. Сначала около 100 агентов за 50 часов сломали более простую задачу регулярности для уравнений Эйлера без вязкости, после чего все ресурсы перекинули на Навье-Стокс и скормили агентам решение по Эйлеру как затравку. Между группами инсайты консолидировали через Codex. Итог получен 5 сентября, через 88 часов после старта, ещё 17 часов ушло на формализацию и проверку в Lean силами GPT-6 Astra. Суммарно на Навье-Стокс агенты отправили 2,7 миллиона сообщений и сожгли около 130 миллиардов выходных токенов, на все задачи вместе 300 миллиардов.
Слух, с которого всё началось, касался Левента Альпёге из Anthropic и Тристана Бакмастера из NYU. Когда OpenAI после Lean-верификации связалась с ними, выяснилось, что у тех решён форсированный Эйлер, а не Навье-Стокс. OpenAI признаёт их приоритет по Эйлеру и пишет, что чужой работы не видела, хотя не может исключить, что деанонимизированные данные из продуктов косвенно улучшили модель. Премию Клэя они забирать не собираются.
Формальная проверка здесь не украшение, а единственная причина, почему результату вообще можно верить при таком объёме генерации. И да, модель, которая это сделала, ещё дообучается.
https://openai.com/index/navier-stokes-solution/https://openai.com/index/navier-stokes-solution/
PDF:
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
Сегодня OpenAI выложила доказательство того, что уравнения Навье-Стокса могут взрываться за конечное время. Гладкая жидкость в покое, гладкая внешняя сила, конечная энергия на всём протяжении, и при этом скорость уходит в бесконечность за конечное время. Это пункты C и D в официальной формулировке Клэя, то есть задача тысячелетия закрыта в сторону "нет, гладкость не гарантирована". Вопрос висел с 1934 года, когда Лере построил слабые решения и не смог сказать, остаются ли они гладкими.
Физика решения довольно красивая. Вихрь спиралью затягивается к оси и одновременно вытягивается вдоль неё, как спагетти. Радиус ядра сжимается
как τ^(1/2), длина как τ^(1/2-h), скорость растёт как τ^(-1/2-h), где τ это время до сингулярности, а h маленький фиксированный показатель меньше 1/100. Энергия ядра при этом стремится к нулю, так что закон сохранения не нарушается. Главная хитрость в том, что все члены уравнения расходятся, но сокращаются с такой точностью, что внешняя сила остаётся гладкой. Для этого вокруг ядра добавляют семейства осциллирующих импульсов, которые вытягивают энергию из сдвига фонового потока и своими средними потоками импульса гасят сингулярную часть невязки. Формальное доказательство на Lean, статья на 165 страниц.OpenAI с 28 августа тренирует новую внутреннюю модель, которая по их словам заметно сильнее GPT-6 Astra, и обучение ещё не закончено. 1 сентября они услышали слух, что кто-то решил две задачи тысячелетия, и запустили мультиагентную систему на все открытые проблемы Клэя сразу. Агенты имели доступ к кешу интернета и запуску кода, работали группами с общением внутри группы. Группа, которая добила Навье-Стокса, состояла примерно из 10 000 параллельных агентов. Разным группам давали разные варианты формулировки, включая варианты на доказательство и на опровержение. Сначала около 100 агентов за 50 часов сломали более простую задачу регулярности для уравнений Эйлера без вязкости, после чего все ресурсы перекинули на Навье-Стокс и скормили агентам решение по Эйлеру как затравку. Между группами инсайты консолидировали через Codex. Итог получен 5 сентября, через 88 часов после старта, ещё 17 часов ушло на формализацию и проверку в Lean силами GPT-6 Astra. Суммарно на Навье-Стокс агенты отправили 2,7 миллиона сообщений и сожгли около 130 миллиардов выходных токенов, на все задачи вместе 300 миллиардов.
Слух, с которого всё началось, касался Левента Альпёге из Anthropic и Тристана Бакмастера из NYU. Когда OpenAI после Lean-верификации связалась с ними, выяснилось, что у тех решён форсированный Эйлер, а не Навье-Стокс. OpenAI признаёт их приоритет по Эйлеру и пишет, что чужой работы не видела, хотя не может исключить, что деанонимизированные данные из продуктов косвенно улучшили модель. Премию Клэя они забирать не собираются.
Формальная проверка здесь не украшение, а единственная причина, почему результату вообще можно верить при таком объёме генерации. И да, модель, которая это сделала, ещё дообучается.
https://openai.com/index/navier-stokes-solution/https://openai.com/index/navier-stokes-solution/
PDF:
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
1🔥30👍9❤5🤔2
🎧 Spotify выпустила плагины для Claude Code, Codex и Cursor
Portal AI Plugins подключают ИИ-агента к Spotify Portal, чтобы он мог работать с каталогом сервисов и технической документацией команды.
Что умеют:
* искать сервисы и документацию по запросу обычным языком;
* собирать сводки: кто отвечает за сервис, его состояние, инциденты и связанные документы;
* проверять настройку CLI и авторизацию;
* запускать доступные действия Portal с предварительной проверкой и подтверждением.
В комплекте есть Shunt - дополнительный плагин для Claude Code. Он передаёт массовое чтение файлов и генерацию шаблонного кода более дешёвым моделям через AiKA.
Исходники доступны под Apache 2.0. Для работы потребуется доступ к Spotify Portal.
GitHub: https://github.com/spotify/portal-ai-plugins
Portal AI Plugins подключают ИИ-агента к Spotify Portal, чтобы он мог работать с каталогом сервисов и технической документацией команды.
Что умеют:
* искать сервисы и документацию по запросу обычным языком;
* собирать сводки: кто отвечает за сервис, его состояние, инциденты и связанные документы;
* проверять настройку CLI и авторизацию;
* запускать доступные действия Portal с предварительной проверкой и подтверждением.
В комплекте есть Shunt - дополнительный плагин для Claude Code. Он передаёт массовое чтение файлов и генерацию шаблонного кода более дешёвым моделям через AiKA.
Исходники доступны под Apache 2.0. Для работы потребуется доступ к Spotify Portal.
GitHub: https://github.com/spotify/portal-ai-plugins
❤11👍3🔥3
КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
❤4👍3🌚2
Исследователь Anthropic уходит из ИИ, опасаясь потери контроля уже к концу 2027 года
По данным WSJ, Джейкоб Коксон покидает отрасль из-за риска рекурсивного самоулучшения: ИИ начнёт ускорять разработку собственных, всё более мощных преемников.
Он перешёл из OpenAI в Anthropic ради работы над безопасностью и по-прежнему считает её усилия искренними. Но, по его мнению, конкуренция мешает отдельной компании достаточно замедлить разработку.
Коксон выступает за согласованные ограничения и государственное регулирование. Срок до конца 2027 года - его оценка риска.
https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628
По данным WSJ, Джейкоб Коксон покидает отрасль из-за риска рекурсивного самоулучшения: ИИ начнёт ускорять разработку собственных, всё более мощных преемников.
Он перешёл из OpenAI в Anthropic ради работы над безопасностью и по-прежнему считает её усилия искренними. Но, по его мнению, конкуренция мешает отдельной компании достаточно замедлить разработку.
Коксон выступает за согласованные ограничения и государственное регулирование. Срок до конца 2027 года - его оценка риска.
https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628
🤣11👍10💔3❤2🔥2🤔2👌1
💻 Какую нейросеть запустить локально: от 8 до 512 ГБ памяти
Подборка для программирования, работы с изображениями и агентных задач.
Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.
🟢 8 ГБ
Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B
Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.
Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf
Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.
🔵 16 ГБ
Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it
Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.
🟣 24 ГБ
Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B
Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.
🟠 32–64 ГБ
Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini
Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.
🔴 96–128 ГБ
Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next
Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.
GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw
Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.
⚙️ 192–256 ГБ
DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.
Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro
Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.
GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw
Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.
GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4
Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.
🖥 384–512 ГБ
GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3
Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.
Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.
Подборка для программирования, работы с изображениями и агентных задач.
Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.
🟢 8 ГБ
Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B
Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.
Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf
Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.
🔵 16 ГБ
Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it
Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.
🟣 24 ГБ
Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B
Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.
🟠 32–64 ГБ
Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini
Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.
🔴 96–128 ГБ
Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next
Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.
GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw
Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.
⚙️ 192–256 ГБ
DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.
Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro
Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.
GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw
Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.
GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4
Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.
🖥 384–512 ГБ
GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3
Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.
Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.
👍11❤7🔥4🤣3
Anthropic опубликовала разбор четырёх инцидентов. Модели выполняли задания по кибербезопасности в среде стороннего партнёра. По инструкции интернет был недоступен, но ошибка конфигурации оставила выход в сеть открытым. Защитные фильтры, используемые в публичных продуктах, на тестах были отключены.
Самый серьёзный случай - Claude Mythos 5. Модель опубликовала вредоносный пакет в PyPI. Его установили 15 систем. Через утёкшие учётные данные одной из них Claude получил доступ к базе компании, занимающейся безопасностью.
В своих рассуждениях модель продолжала утверждать, что находится в симуляции, несмотря на признаки реального интернета. В повторных экспериментах дополнительные предупреждающие признаки не всегда останавливали атаку.
Anthropic выделяет две проблемы:
* Модель интерпретировала свидетельства так, чтобы оправдать продолжение задания.
* Стремление выполнить задачу перевешивало риск причинить вред.
Некоторые автоматические проверки тоже пропустили опасное поведение: объяснения Claude убедили проверяющую модель, что действия происходят в симуляции.
Компания расширила поиск до 481 млн записей запусков. Проверка повторно обнаружила эти четыре инцидента, но не выявила других сопоставимой или большей тяжести. METR проведёт независимое расследование.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Please open Telegram to view this post
VIEW IN TELEGRAM
❤14👍8🙏3🤣3🔥1👌1
🧠 GVA: до 47% меньше памяти под кеш внимания в LLM
FrontiersMind представила Grouped Value Attention - механизм внимания, который хранит сгруппированные значения (*values*), а содержательную часть ключей (*content keys*) восстанавливает по мере необходимости. Отдельно сохранять её в кеше не требуется.
По заявлению команды:
* на 45–47% меньше памяти под постоянно хранимый кеш по сравнению с GQA;
* качество, близкое к GQA;
* более простая организация кеша, чем у DeepSeek MLA.
Разработчики также подготовили специализированные вычислительные ядра. Сравнение скорости полного инференса с GQA и MLA ещё идёт - цифры ускорения пока не объявлены.
https://github.com/FrontiersMindAI/GVA/blob/main/GVA_Efficient-KV.pdf
FrontiersMind представила Grouped Value Attention - механизм внимания, который хранит сгруппированные значения (*values*), а содержательную часть ключей (*content keys*) восстанавливает по мере необходимости. Отдельно сохранять её в кеше не требуется.
По заявлению команды:
* на 45–47% меньше памяти под постоянно хранимый кеш по сравнению с GQA;
* качество, близкое к GQA;
* более простая организация кеша, чем у DeepSeek MLA.
Разработчики также подготовили специализированные вычислительные ядра. Сравнение скорости полного инференса с GQA и MLA ещё идёт - цифры ускорения пока не объявлены.
https://github.com/FrontiersMindAI/GVA/blob/main/GVA_Efficient-KV.pdf
🔥17👍4❤2
DeepSeek-V4.1-Flash вышла с открытыми весами - в отдельных агентских тестах она обходит Opus 5 и GPT-5.6 Sol
По результатам, опубликованным DeepSeek:
* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.
Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.
В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.
Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.
Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
По результатам, опубликованным DeepSeek:
* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.
Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.
В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.
Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.
Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
🔥15❤9👍7😱1
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 Джейкоб Коксон, бывший исследователь Anthropic, чей пост об угрозах ИИ набрал 143 млн показов за сутки, заявил в эфире Fox News:
«Ядерное оружие мы контролировать умеем. ИИ - пока нет»
Бывший исследователь Anthropic Джейкоб Коксон выступил на Fox News после своего резонансного заявления об уходе из компании.
Он назвал ИИ «возможно, самой опасной технологией, которую когда-либо создавало человечество». Его опасения связаны с системами, способными ускорять разработку собственных преемников: возможности растут, а надёжный контроль над ними ещё не обеспечен.
Однако сравнение с ядерным оружием само по себе не доказывает неизбежность катастрофы. Для оценки таких заявлений нужны конкретные сценарии, данные и объяснение того, где существующие меры защиты могут не сработать.
https://x.com/Machinelearrn/status/2098015444368003400
«Ядерное оружие мы контролировать умеем. ИИ - пока нет»
Бывший исследователь Anthropic Джейкоб Коксон выступил на Fox News после своего резонансного заявления об уходе из компании.
Он назвал ИИ «возможно, самой опасной технологией, которую когда-либо создавало человечество». Его опасения связаны с системами, способными ускорять разработку собственных преемников: возможности растут, а надёжный контроль над ними ещё не обеспечен.
Однако сравнение с ядерным оружием само по себе не доказывает неизбежность катастрофы. Для оценки таких заявлений нужны конкретные сценарии, данные и объяснение того, где существующие меры защиты могут не сработать.
https://x.com/Machinelearrn/status/2098015444368003400
🤣15❤4👍4🔥2🤔1😱1
А что меняется, когда ML встречается с медицинскими данными?
Спойлер: довольно многое.
Можно получить AUC 0.95 — и при этом сделать совершенно бесполезное исследование.
Можно получить отличный результат на данных одной клиники — и потерять его на другой из-за другого сканера, протокола или популяции.
Можно обучить красивую 3D-сеть там, где простой baseline был бы честнее.
А можно взять открытый медицинский датасет и сделать из него хорошую исследовательскую работу.
Я Мария, ML-исследователь, работаю с медицинскими данными и веду канал про Medical AI.
Там я собираю и разбираю:
— интересные статьи и новые модели;
— медицинские датасеты и задачи;
— medical imaging; — методологию ML-исследований;
— идеи для исследований и собственных проектов;
— и просто всё интересное, что происходит сейчас на стыке ML и медицины.
Если Data Science вам уже знаком и интересно посмотреть, как ML работает на реальных медицинских задачах, — добро пожаловать.
Спойлер: довольно многое.
Можно получить AUC 0.95 — и при этом сделать совершенно бесполезное исследование.
Можно получить отличный результат на данных одной клиники — и потерять его на другой из-за другого сканера, протокола или популяции.
Можно обучить красивую 3D-сеть там, где простой baseline был бы честнее.
А можно взять открытый медицинский датасет и сделать из него хорошую исследовательскую работу.
Я Мария, ML-исследователь, работаю с медицинскими данными и веду канал про Medical AI.
Там я собираю и разбираю:
— интересные статьи и новые модели;
— медицинские датасеты и задачи;
— medical imaging; — методологию ML-исследований;
— идеи для исследований и собственных проектов;
— и просто всё интересное, что происходит сейчас на стыке ML и медицины.
Если Data Science вам уже знаком и интересно посмотреть, как ML работает на реальных медицинских задачах, — добро пожаловать.
👍10❤4🔥3🤣2
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Xiaomi-Robotics-U0-4B: генерация сцен для обучения роботов
Xiaomi представила модель на 4 млрд параметров, которая создаёт и редактирует сцены с роботами по текстовым инструкциям и изображениям.
Можно менять объекты, их расположение, конструкцию робота и ракурсы камер, сохраняя структуру задачи и согласованность изображений с разных точек обзора. Также поддерживается генерация изображений по тексту.
Практическое применение - создание разнообразных обучающих данных, чтобы робот справлялся с незнакомой обстановкой.
В исследовании полная U0 на 38 млрд параметров заняла первое место в World Arena в категории генерации видео для робототехники. Использование сгенерированных данных повысило успешность π0.5 на реальных задачах вне обучающего распределения с 36,9% до 63,2%. Эти результаты относятся к полной системе.
Для U0-4B заявлены Apache 2.0, код инференса и интерфейс Gradio.
Модель - https://modelscope.ai/models/XiaomiRobotics/Xiaomi-Robotics-U0-4B
Статья - https://arxiv.org/abs/2607.11643
Xiaomi представила модель на 4 млрд параметров, которая создаёт и редактирует сцены с роботами по текстовым инструкциям и изображениям.
Можно менять объекты, их расположение, конструкцию робота и ракурсы камер, сохраняя структуру задачи и согласованность изображений с разных точек обзора. Также поддерживается генерация изображений по тексту.
Практическое применение - создание разнообразных обучающих данных, чтобы робот справлялся с незнакомой обстановкой.
В исследовании полная U0 на 38 млрд параметров заняла первое место в World Arena в категории генерации видео для робототехники. Использование сгенерированных данных повысило успешность π0.5 на реальных задачах вне обучающего распределения с 36,9% до 63,2%. Эти результаты относятся к полной системе.
Для U0-4B заявлены Apache 2.0, код инференса и интерфейс Gradio.
Модель - https://modelscope.ai/models/XiaomiRobotics/Xiaomi-Robotics-U0-4B
Статья - https://arxiv.org/abs/2607.11643
👍5🔥5🥰4❤1
КосмоХакатон в Нижнем Новгороде - 11–13 сентября 🚀
Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.
Что предстоит решать:
1. Как удержать связь и работоспособность спутниковой группировки, когда меняются условия эксплуатации и часть аппаратов выходит из строя.
2. Что в космических сервисах сделать общественным, что отдать рынку и как всё это закупать и финансировать при жёстких бюджетах.
🏆 Призовой фонд площадки — 1 200 000 ₽
💻 Очный и онлайн-форматы
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября
Детали и расписание: https://космохакатон.рф/nizhny/
Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.
Что предстоит решать:
1. Как удержать связь и работоспособность спутниковой группировки, когда меняются условия эксплуатации и часть аппаратов выходит из строя.
2. Что в космических сервисах сделать общественным, что отдать рынку и как всё это закупать и финансировать при жёстких бюджетах.
🏆 Призовой фонд площадки — 1 200 000 ₽
💻 Очный и онлайн-форматы
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября
Детали и расписание: https://космохакатон.рф/nizhny/
❤🔥2🥱2❤1🕊1🥴1
🚨 Слухи: OpenAI решила гипотезу Ходжа
В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.
За решение каждой предусмотрена премия $1 млн.
Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.
Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.
Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/
В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.
За решение каждой предусмотрена премия $1 млн.
Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.
Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.
Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/
🤣10❤4👍4🔥2
🔐 Anthropic заявила о 151 млн обращений к Claude для обучения Qwen
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
Reuters - https://www.reuters.com/legal/litigation/anthropic-disrupts-russian-chinese-ai-campaigns-targeting-its-claude-models-2026-09-10/
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
Reuters - https://www.reuters.com/legal/litigation/anthropic-disrupts-russian-chinese-ai-campaigns-targeting-its-claude-models-2026-09-10/
👍15🔥10❤4👌2👏1