Xiaomi MiMo-V2.6-Pro вышла в лидеры среди моделей с открытыми весами по индексу Artificial Analysis.
Её результат - 46 баллов против 47 у GPT-5.6 Sol (max).
При этом расчётная стоимость задачи в этом тесте - $0,13 против $1,99. Это сравнение в рамках методики бенчмарка, а не цена любой задачи в API.
Модель принимает текст, изображения, видео и аудио; контекст — 1 млн токенов. Весá доступны под MIT. Xiaomi также опубликовала технический отчёт, код RL-обучения и более 7000 учебных сред. Цены API остались на уровне V2.5.
Модель - https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL
Релиз Xiaomi - https://mimo.mi.com/docs/en-US/news/latest/v2-6
Её результат - 46 баллов против 47 у GPT-5.6 Sol (max).
При этом расчётная стоимость задачи в этом тесте - $0,13 против $1,99. Это сравнение в рамках методики бенчмарка, а не цена любой задачи в API.
Модель принимает текст, изображения, видео и аудио; контекст — 1 млн токенов. Весá доступны под MIT. Xiaomi также опубликовала технический отчёт, код RL-обучения и более 7000 учебных сред. Цены API остались на уровне V2.5.
Модель - https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL
Релиз Xiaomi - https://mimo.mi.com/docs/en-US/news/latest/v2-6
👍5❤3⚡1🤔1
Opus 5.5 пишет код, Fable подсказывает: в Claude Code появился советник
Если основная модель у тебя Opus 5.5, квоту на Fable можно пустить в дело. Команда `/advisor fable` подключает Fable как советника, к которому Opus обращается сам.
Происходит это в три ключевых момента: перед тем как взяться за план, когда одна и та же ошибка повторяется и перед тем как сказать «готово». Fable видит всю сессию целиком со всеми вызовами инструментов и даёт совет, а код по-прежнему пишет Opus.
По деньгам это выгоднее, чем держать сильную модель на каждом шаге: советник включается только в точках принятия решений. Кэш промпта при включении советника не сбрасывается.
Работает только через Anthropic API, на Bedrock, Vertex и Foundry недоступно. На части подписок Fable списывается с usage credits, и перед первым запуском нужно дать согласие через
Рабочая схема: Opus 5.5 на high ведёт сессию, три сабагента на medium читают код, правят с тестами и ищут документацию, а Fable ждёт в стороне и включается, когда нужен второй взгляд.
https://code.claude.com/docs/en/advisor
Если основная модель у тебя Opus 5.5, квоту на Fable можно пустить в дело. Команда `/advisor fable` подключает Fable как советника, к которому Opus обращается сам.
Происходит это в три ключевых момента: перед тем как взяться за план, когда одна и та же ошибка повторяется и перед тем как сказать «готово». Fable видит всю сессию целиком со всеми вызовами инструментов и даёт совет, а код по-прежнему пишет Opus.
По деньгам это выгоднее, чем держать сильную модель на каждом шаге: советник включается только в точках принятия решений. Кэш промпта при включении советника не сбрасывается.
Работает только через Anthropic API, на Bedrock, Vertex и Foundry недоступно. На части подписок Fable списывается с usage credits, и перед первым запуском нужно дать согласие через
/model fable. Если советник молчит, проверь переменные CLAUDE_CODE_DISABLE_ADVISOR_TOOL и DISABLE_TELEMETRY: они его отключают.Рабочая схема: Opus 5.5 на high ведёт сессию, три сабагента на medium читают код, правят с тестами и ищут документацию, а Fable ждёт в стороне и включается, когда нужен второй взгляд.
https://code.claude.com/docs/en/advisor
❤19👍10🔥3
🚨 Claude признали риском для нацбезопасности США и выкинули из военной цепочки поставок
Апелляционный суд США решением 2–1 отклонил жалобу Anthropic и признал, что Пентагон мог считать использование Claude риском для национальной безопасности в рамках закона о безопасности цепочек поставок.
Причина конфликта: Anthropic отказалась снять ограничения на использование Claude для полностью автономного летального оружия и массовой слежки внутри США.
В решении суд отдельно отметил, что встроенные ограничения Claude уже мешали выполнению некоторых государственных запросов. В частности, коммерческая версия модели отказывалась обрабатывать отдельные задачи с секретными материалами и запросы CDC по исследованиям инфекционных заболеваний.
Позиция большинства суда: важно не то, почему Anthropic ограничивает модель, а то, что компания технически способна менять её поведение и запрещать определённые сценарии использования. Для военной инфраструктуры этого оказалось достаточно, чтобы квалифицировать ситуацию как supply-chain risk.
При этом дело ещё не обязательно закончено: Anthropic заявила, что не согласна с решением и рассматривает дальнейший пересмотр. Отдельный федеральный суд ранее признал параллельное ограничение по другому закону незаконным.
Апелляционный суд США решением 2–1 отклонил жалобу Anthropic и признал, что Пентагон мог считать использование Claude риском для национальной безопасности в рамках закона о безопасности цепочек поставок.
Причина конфликта: Anthropic отказалась снять ограничения на использование Claude для полностью автономного летального оружия и массовой слежки внутри США.
В решении суд отдельно отметил, что встроенные ограничения Claude уже мешали выполнению некоторых государственных запросов. В частности, коммерческая версия модели отказывалась обрабатывать отдельные задачи с секретными материалами и запросы CDC по исследованиям инфекционных заболеваний.
Позиция большинства суда: важно не то, почему Anthropic ограничивает модель, а то, что компания технически способна менять её поведение и запрещать определённые сценарии использования. Для военной инфраструктуры этого оказалось достаточно, чтобы квалифицировать ситуацию как supply-chain risk.
При этом дело ещё не обязательно закончено: Anthropic заявила, что не согласна с решением и рассматривает дальнейший пересмотр. Отдельный федеральный суд ранее признал параллельное ограничение по другому закону незаконным.
👍19❤9🔥3😁1🙏1
⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU
Supersonic Labs представила Julia 1 - компактную мультиязычную модель для принятия решений без генерации длинного текста.
Она получает контекст, вопрос и от 2 до 20 вариантов, после чего выбирает лучший и возвращает оценки для каждого варианта.
Главное:
- всего 144,3 млн параметров;
- работает полностью на CPU;
- построена на базе
- 73,15% на Typed Decisions против 72,7% у Jev reference;
- 71,5% на MASSIVE сразу по 52 языкам;
- на Apple M4 — до 51,2 решения/с в batch-режиме;
- запускается даже на Android-планшете;
- обучение и эксперименты обошлись команде примерно в $104.
Модель подходит для routing, классификации, yes/no решений, ранжирования и выбора действий.
Веса открыты под Apache 2.0.
Проект:
https://supersoniclabs.ia.br/julia-1/
Supersonic Labs представила Julia 1 - компактную мультиязычную модель для принятия решений без генерации длинного текста.
Она получает контекст, вопрос и от 2 до 20 вариантов, после чего выбирает лучший и возвращает оценки для каждого варианта.
Главное:
- всего 144,3 млн параметров;
- работает полностью на CPU;
- построена на базе
mmBERT-small;- 73,15% на Typed Decisions против 72,7% у Jev reference;
- 71,5% на MASSIVE сразу по 52 языкам;
- на Apple M4 — до 51,2 решения/с в batch-режиме;
- запускается даже на Android-планшете;
- обучение и эксперименты обошлись команде примерно в $104.
Модель подходит для routing, классификации, yes/no решений, ранжирования и выбора действий.
Веса открыты под Apache 2.0.
Проект:
https://supersoniclabs.ia.br/julia-1/
👍33❤11🔥6🤣6🥴2⚡1
⚡ Polars обработал 1,5 ТБ биржевых данных чуть больше чем за 3 минуты
BMLL показала, как Polars справляется с масштабными market-data нагрузками, где pandas уже начинает тормозить.
Главное из тестов:
- один день торгов по 11 000+ американских бумаг: 4,3 секунды на загрузку против примерно 3,5 минут у pandas;
- это около 48× быстрее;
- 94 ГБ данных Шанхайской биржи: загрузка,
- более 1,5 ТБ данных за 16 торговых дней: финальная агрегация примерно за 3 минуты.
Почему Polars так хорошо масштабируется:
- lazy execution;
- эффективные
- использование всех CPU-ядер;
- работа с полным датасетом без необходимости заранее вырезать выборку.
Все тесты запускались на одной машине с 192 CPU cores и 1,5 ТБ RAM.
Для quant и data engineering это хороший пример того, насколько сильно выбор dataframe-движка влияет на время анализа.
Статья:
https://pola.rs/posts/case-bmll/
BMLL показала, как Polars справляется с масштабными market-data нагрузками, где pandas уже начинает тормозить.
Главное из тестов:
- один день торгов по 11 000+ американских бумаг: 4,3 секунды на загрузку против примерно 3,5 минут у pandas;
- это около 48× быстрее;
- 94 ГБ данных Шанхайской биржи: загрузка,
as-of join и классификация примерно за 36 секунд;- более 1,5 ТБ данных за 16 торговых дней: финальная агрегация примерно за 3 минуты.
Почему Polars так хорошо масштабируется:
- lazy execution;
- эффективные
as-of join;- использование всех CPU-ядер;
- работа с полным датасетом без необходимости заранее вырезать выборку.
Все тесты запускались на одной машине с 192 CPU cores и 1,5 ТБ RAM.
Для quant и data engineering это хороший пример того, насколько сильно выбор dataframe-движка влияет на время анализа.
Статья:
https://pola.rs/posts/case-bmll/
❤23👍8🔥3🤔2🥰1
🔎 Hyperresearch превращает Claude Code и Codex в полноценного Deep Research-агента
Hyperresearch - open-source harness для глубоких исследований поверх Claude Code и OpenAI Codex.
Что умеет:
- запускать 16-шаговый research pipeline из одного запроса;
- собирать сотни источников за один запуск;
- проверять, действительно ли каждая цитата подтверждает утверждение;
- выявлять дубли и перепечатки, чтобы не считать их независимыми источниками;
- прогонять черновик через несколько критиков;
- сохранять все найденные материалы в постоянное searchable-хранилище;
- восстанавливать исследование после падения с нужного шага;
- искать статьи, книги, clinical trials, SEC filings и макроданные через единый интерфейс.
Есть режимы от быстрых исследований примерно на 30 минут до экспериментальных «dissertation runs» на десятки тысяч слов и сотни источников.
Автор также заявляет лидерство в собственных тестах на DeepResearch-Bench, но независимая валидация пока ожидается.
Работает с Claude Code и Codex.
GitHub: https://github.com/jordan-gibbs/hyperresearch
Hyperresearch - open-source harness для глубоких исследований поверх Claude Code и OpenAI Codex.
Что умеет:
- запускать 16-шаговый research pipeline из одного запроса;
- собирать сотни источников за один запуск;
- проверять, действительно ли каждая цитата подтверждает утверждение;
- выявлять дубли и перепечатки, чтобы не считать их независимыми источниками;
- прогонять черновик через несколько критиков;
- сохранять все найденные материалы в постоянное searchable-хранилище;
- восстанавливать исследование после падения с нужного шага;
- искать статьи, книги, clinical trials, SEC filings и макроданные через единый интерфейс.
Есть режимы от быстрых исследований примерно на 30 минут до экспериментальных «dissertation runs» на десятки тысяч слов и сотни источников.
Автор также заявляет лидерство в собственных тестах на DeepResearch-Bench, но независимая валидация пока ожидается.
Работает с Claude Code и Codex.
GitHub: https://github.com/jordan-gibbs/hyperresearch
🔥15👍11❤3🥰2
🚨 Китайские AI-модели обработали в 4,4 раза больше токенов на OpenRouter, чем американские
За неделю с 21 по 27 сентября модели китайских разработчиков обработали на OpenRouter 62,22 трлн токенов против 14,2 трлн у американских моделей.
Китай сохраняет лидерство уже 22 недели подряд.
Топ недели:
- DeepSeek V4.1 Flash — 19,6T токенов, +24%;
- GLM 5.3 Flash — 16,3T, +16%;
- Space Bunny Alpha — 13,9T, новая модель;
- Tencent Hy4 — 9,64T;
- MiMo-V2.6-Flash от Xiaomi — 5,51T.
Особенно выделяется Space Bunny Alpha: анонимная модель появилась на OpenRouter всего несколько дней назад и уже заняла третье место. Независимый анализ токенизатора показал совпадение с семейством MiniMax на всех 50 тестовых строках, но разработчик модели официально не подтверждён.
https://openrouter.ai/rankings
#openrouter
За неделю с 21 по 27 сентября модели китайских разработчиков обработали на OpenRouter 62,22 трлн токенов против 14,2 трлн у американских моделей.
Китай сохраняет лидерство уже 22 недели подряд.
Топ недели:
- DeepSeek V4.1 Flash — 19,6T токенов, +24%;
- GLM 5.3 Flash — 16,3T, +16%;
- Space Bunny Alpha — 13,9T, новая модель;
- Tencent Hy4 — 9,64T;
- MiMo-V2.6-Flash от Xiaomi — 5,51T.
Особенно выделяется Space Bunny Alpha: анонимная модель появилась на OpenRouter всего несколько дней назад и уже заняла третье место. Независимый анализ токенизатора показал совпадение с семейством MiniMax на всех 50 тестовых строках, но разработчик модели официально не подтверждён.
https://openrouter.ai/rankings
#openrouter
👍13❤6🔥4🐳1
📊Платформа данных в корпоративном контуре компании
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
👍6❤2⚡1
🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
🔥14❤6❤🔥3
Forwarded from Machinelearning
Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
https://www.anthropic.com/claude-sonnet-5-5
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
claude-sonnet-5-5https://www.anthropic.com/claude-sonnet-5-5
👍15❤4❤🔥3