DeepSeek-V4.1-Flash вышла с открытыми весами - в отдельных агентских тестах она обходит Opus 5 и GPT-5.6 Sol
По результатам, опубликованным DeepSeek:
* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.
Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.
В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.
Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.
Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
По результатам, опубликованным DeepSeek:
* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.
Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.
В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.
Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.
Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
🔥15❤9👍7
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 Джейкоб Коксон, бывший исследователь Anthropic, чей пост об угрозах ИИ набрал 143 млн показов за сутки, заявил в эфире Fox News:
«Ядерное оружие мы контролировать умеем. ИИ - пока нет»
Бывший исследователь Anthropic Джейкоб Коксон выступил на Fox News после своего резонансного заявления об уходе из компании.
Он назвал ИИ «возможно, самой опасной технологией, которую когда-либо создавало человечество». Его опасения связаны с системами, способными ускорять разработку собственных преемников: возможности растут, а надёжный контроль над ними ещё не обеспечен.
Однако сравнение с ядерным оружием само по себе не доказывает неизбежность катастрофы. Для оценки таких заявлений нужны конкретные сценарии, данные и объяснение того, где существующие меры защиты могут не сработать.
https://x.com/Machinelearrn/status/2098015444368003400
«Ядерное оружие мы контролировать умеем. ИИ - пока нет»
Бывший исследователь Anthropic Джейкоб Коксон выступил на Fox News после своего резонансного заявления об уходе из компании.
Он назвал ИИ «возможно, самой опасной технологией, которую когда-либо создавало человечество». Его опасения связаны с системами, способными ускорять разработку собственных преемников: возможности растут, а надёжный контроль над ними ещё не обеспечен.
Однако сравнение с ядерным оружием само по себе не доказывает неизбежность катастрофы. Для оценки таких заявлений нужны конкретные сценарии, данные и объяснение того, где существующие меры защиты могут не сработать.
https://x.com/Machinelearrn/status/2098015444368003400
🤣15👍4❤3🔥2🤔1
А что меняется, когда ML встречается с медицинскими данными?
Спойлер: довольно многое.
Можно получить AUC 0.95 — и при этом сделать совершенно бесполезное исследование.
Можно получить отличный результат на данных одной клиники — и потерять его на другой из-за другого сканера, протокола или популяции.
Можно обучить красивую 3D-сеть там, где простой baseline был бы честнее.
А можно взять открытый медицинский датасет и сделать из него хорошую исследовательскую работу.
Я Мария, ML-исследователь, работаю с медицинскими данными и веду канал про Medical AI.
Там я собираю и разбираю:
— интересные статьи и новые модели;
— медицинские датасеты и задачи;
— medical imaging; — методологию ML-исследований;
— идеи для исследований и собственных проектов;
— и просто всё интересное, что происходит сейчас на стыке ML и медицины.
Если Data Science вам уже знаком и интересно посмотреть, как ML работает на реальных медицинских задачах, — добро пожаловать.
Спойлер: довольно многое.
Можно получить AUC 0.95 — и при этом сделать совершенно бесполезное исследование.
Можно получить отличный результат на данных одной клиники — и потерять его на другой из-за другого сканера, протокола или популяции.
Можно обучить красивую 3D-сеть там, где простой baseline был бы честнее.
А можно взять открытый медицинский датасет и сделать из него хорошую исследовательскую работу.
Я Мария, ML-исследователь, работаю с медицинскими данными и веду канал про Medical AI.
Там я собираю и разбираю:
— интересные статьи и новые модели;
— медицинские датасеты и задачи;
— medical imaging; — методологию ML-исследований;
— идеи для исследований и собственных проектов;
— и просто всё интересное, что происходит сейчас на стыке ML и медицины.
Если Data Science вам уже знаком и интересно посмотреть, как ML работает на реальных медицинских задачах, — добро пожаловать.
👍9❤4🔥3🤣2
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Xiaomi-Robotics-U0-4B: генерация сцен для обучения роботов
Xiaomi представила модель на 4 млрд параметров, которая создаёт и редактирует сцены с роботами по текстовым инструкциям и изображениям.
Можно менять объекты, их расположение, конструкцию робота и ракурсы камер, сохраняя структуру задачи и согласованность изображений с разных точек обзора. Также поддерживается генерация изображений по тексту.
Практическое применение - создание разнообразных обучающих данных, чтобы робот справлялся с незнакомой обстановкой.
В исследовании полная U0 на 38 млрд параметров заняла первое место в World Arena в категории генерации видео для робототехники. Использование сгенерированных данных повысило успешность π0.5 на реальных задачах вне обучающего распределения с 36,9% до 63,2%. Эти результаты относятся к полной системе.
Для U0-4B заявлены Apache 2.0, код инференса и интерфейс Gradio.
Модель - https://modelscope.ai/models/XiaomiRobotics/Xiaomi-Robotics-U0-4B
Статья - https://arxiv.org/abs/2607.11643
Xiaomi представила модель на 4 млрд параметров, которая создаёт и редактирует сцены с роботами по текстовым инструкциям и изображениям.
Можно менять объекты, их расположение, конструкцию робота и ракурсы камер, сохраняя структуру задачи и согласованность изображений с разных точек обзора. Также поддерживается генерация изображений по тексту.
Практическое применение - создание разнообразных обучающих данных, чтобы робот справлялся с незнакомой обстановкой.
В исследовании полная U0 на 38 млрд параметров заняла первое место в World Arena в категории генерации видео для робототехники. Использование сгенерированных данных повысило успешность π0.5 на реальных задачах вне обучающего распределения с 36,9% до 63,2%. Эти результаты относятся к полной системе.
Для U0-4B заявлены Apache 2.0, код инференса и интерфейс Gradio.
Модель - https://modelscope.ai/models/XiaomiRobotics/Xiaomi-Robotics-U0-4B
Статья - https://arxiv.org/abs/2607.11643
👍5🔥5🥰4❤1
КосмоХакатон в Нижнем Новгороде - 11–13 сентября 🚀
Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.
Что предстоит решать:
1. Как удержать связь и работоспособность спутниковой группировки, когда меняются условия эксплуатации и часть аппаратов выходит из строя.
2. Что в космических сервисах сделать общественным, что отдать рынку и как всё это закупать и финансировать при жёстких бюджетах.
🏆 Призовой фонд площадки — 1 200 000 ₽
💻 Очный и онлайн-форматы
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября
Детали и расписание: https://космохакатон.рф/nizhny/
Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.
Что предстоит решать:
1. Как удержать связь и работоспособность спутниковой группировки, когда меняются условия эксплуатации и часть аппаратов выходит из строя.
2. Что в космических сервисах сделать общественным, что отдать рынку и как всё это закупать и финансировать при жёстких бюджетах.
🏆 Призовой фонд площадки — 1 200 000 ₽
💻 Очный и онлайн-форматы
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября
Детали и расписание: https://космохакатон.рф/nizhny/
🥱2❤🔥1❤1🕊1🥴1
🚨 Слухи: OpenAI решила гипотезу Ходжа
В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.
За решение каждой предусмотрена премия $1 млн.
Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.
Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.
Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/
В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.
За решение каждой предусмотрена премия $1 млн.
Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.
Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.
Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/
🤣10❤4👍3🔥2
🔐 Anthropic заявила о 151 млн обращений к Claude для обучения Qwen
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
Reuters - https://www.reuters.com/legal/litigation/anthropic-disrupts-russian-chinese-ai-campaigns-targeting-its-claude-models-2026-09-10/
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
Reuters - https://www.reuters.com/legal/litigation/anthropic-disrupts-russian-chinese-ai-campaigns-targeting-its-claude-models-2026-09-10/
👍15🔥10❤4👌2👏1
🤖 RAG Engineering: создание production-ready AI-систем — новый курс на Mentorix
Поиск и ответы по документам компании, качество которых измеряется числами: гибридный поиск, реранкер, оценка на скрытом наборе вопросов, агентный цикл и сервис с правами доступа.
⚙️ Стек: Qdrant · PostgreSQL с pgvector · BM25 · парсинг PDF · MCP · FastAPI — практика на настоящих системах в браузере
🧩 325 шагов · 100 тестов · 65 задач
💻 Чекер считает метрику сам — подогнать ответ под неё нельзя
🎯 Базовый конвейер находит нужный фрагмент меньше чем в половине случаев. Ваша работа — поднять эту цифру до цели
🎓 Сертификат · доступ навсегда
🏷 −45% скидка действует 24 часа
12 990 ₽ → 7 145 ₽
➜ Забрать курс со скидкой
━━━━━━━━━━━━━━
На платформе также есть бесплатные курсы:
🤖 LLM для разработчика: от вызова API до RAG
🐍 Основы Python · 🧩 Тренажёр Python
SQL с нуля · 🐳 Docker: первые шаги
📚 Все бесплатные курсы Mentorix
Поиск и ответы по документам компании, качество которых измеряется числами: гибридный поиск, реранкер, оценка на скрытом наборе вопросов, агентный цикл и сервис с правами доступа.
⚙️ Стек: Qdrant · PostgreSQL с pgvector · BM25 · парсинг PDF · MCP · FastAPI — практика на настоящих системах в браузере
🧩 325 шагов · 100 тестов · 65 задач
💻 Чекер считает метрику сам — подогнать ответ под неё нельзя
🎯 Базовый конвейер находит нужный фрагмент меньше чем в половине случаев. Ваша работа — поднять эту цифру до цели
🎓 Сертификат · доступ навсегда
🏷 −45% скидка действует 24 часа
➜ Забрать курс со скидкой
━━━━━━━━━━━━━━
На платформе также есть бесплатные курсы:
🤖 LLM для разработчика: от вызова API до RAG
🐍 Основы Python · 🧩 Тренажёр Python
SQL с нуля · 🐳 Docker: первые шаги
📚 Все бесплатные курсы Mentorix
😁5❤2
This media is not supported in your browser
VIEW IN TELEGRAM
Unity подключила Claude Code, Codex и Grok к разработке игр 🎮
Компания опубликовала официальный плагин с 31 готовым скиллом для Unity 6+.
Агенту можно поручить конкретную задачу обычным текстом:
* создать экран настроек
* подключить внутриигровые покупки
* настроить физику или навигацию
* собрать мультиплеер и голосовой чат
* исправить проблемы со спрайтами
* настроить звук, локализацию, шейдеры и URP
Агент определяет нужную область Unity и загружает соответствующие инструкции. Плагин поддерживает Claude Code, Codex и Grok, устанавливается через их CLI и не содержит MCP-серверов или хуков.
Репозиторий и команды установки - https://github.com/Unity-Technologies/unity-agent-plugin#install
Компания опубликовала официальный плагин с 31 готовым скиллом для Unity 6+.
Агенту можно поручить конкретную задачу обычным текстом:
* создать экран настроек
* подключить внутриигровые покупки
* настроить физику или навигацию
* собрать мультиплеер и голосовой чат
* исправить проблемы со спрайтами
* настроить звук, локализацию, шейдеры и URP
Агент определяет нужную область Unity и загружает соответствующие инструкции. Плагин поддерживает Claude Code, Codex и Grok, устанавливается через их CLI и не содержит MCP-серверов или хуков.
Репозиторий и команды установки - https://github.com/Unity-Technologies/unity-agent-plugin#install
❤7👍4🔥2
Forwarded from AI VK Hub
This media is not supported in your browser
VIEW IN TELEGRAM
В AI VK разработали новую технологию — нейропрофиль. Она объединила историю действий пользователя ВКонтакте, в VK Видео и VK Клипах в единую последовательность событий и повышает точность рекомендаций во всех трёх сервисах.
#aivkhub #video #discovery #нейропрофиль
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣8❤2👍2🔥1🤨1
🐟 Sakana AI представила Fugu Max и Fugu Ultra v2 - обновление системы оркестрации AI-агентов
Fugu распределяет задачи между несколькими моделями, подбирая подходящую по возможностям и стоимости.
Fugu Max использует расширенный набор моделей с открытыми весами и специализированных моделей, включая NVIDIA Nemotron. По заявлению Sakana, система приближается к ведущим моделям по качеству при стоимости в 2–6 раз ниже.
Fugu Ultra v2 ориентирована на максимальное качество. По данным компании:
* опережает Opus 5 и Fable 5 на Chartography
* на DeepSWE превосходит модели, у которых цена за токен в 3–5 раз выше
* при этом Fable 5, Fable 5.1 и GPT-6-Astra не входят в её набор агентов
Модели внутри системы можно заменять. Такая архитектура рассчитана на снижение зависимости от отдельных поставщиков и сохранение работы при изменениях доступности API.
[Попробовать Fugu - https://sakana.ai/fugu
Анонс Sakana AI - https://sakana.ai/fugu-max-release/
Fugu распределяет задачи между несколькими моделями, подбирая подходящую по возможностям и стоимости.
Fugu Max использует расширенный набор моделей с открытыми весами и специализированных моделей, включая NVIDIA Nemotron. По заявлению Sakana, система приближается к ведущим моделям по качеству при стоимости в 2–6 раз ниже.
Fugu Ultra v2 ориентирована на максимальное качество. По данным компании:
* опережает Opus 5 и Fable 5 на Chartography
* на DeepSWE превосходит модели, у которых цена за токен в 3–5 раз выше
* при этом Fable 5, Fable 5.1 и GPT-6-Astra не входят в её набор агентов
Модели внутри системы можно заменять. Такая архитектура рассчитана на снижение зависимости от отдельных поставщиков и сохранение работы при изменениях доступности API.
[Попробовать Fugu - https://sakana.ai/fugu
Анонс Sakana AI - https://sakana.ai/fugu-max-release/
❤8👍5🔥5