Forwarded from Анализ данных (Data analysis)
⚡️ ERNIE 5.0 - официальный релиз.
Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.
Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.
То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.
Самое интересное - результаты на бенчмарках (по графикам Baidu):
- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.
Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.
Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)
https://ernie.baidu.com
Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.
Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.
То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.
Самое интересное - результаты на бенчмарках (по графикам Baidu):
- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.
Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.
Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)
https://ernie.baidu.com
У меня тут вчера случился шок контент. Некоторое время назад Антропики выпустили к Claude надстройку для браузера Chrome. Ну, вроде ничего нового, у ChatGPT есть отдельный браузер Atlas, у Perplexity - Comet. Повозился немного и бросил, как то показалось - не очень.
Но тут вчера вернулся к этой задачке - надо было с сайта вытащить информацию. И оно работает, работает хорошо.
Клод, правда ленится, надо его пинать и заставлять, но этому я уже более-менее научился.
Весь вечер ходил под впечатлением. Ох, много чего можно с этой штукой делать…
Но тут вчера вернулся к этой задачке - надо было с сайта вытащить информацию. И оно работает, работает хорошо.
Клод, правда ленится, надо его пинать и заставлять, но этому я уже более-менее научился.
Весь вечер ходил под впечатлением. Ох, много чего можно с этой штукой делать…
Forwarded from Dealer.AI
Вайбовый STT с часом контекста от 📱
Microsoft выпустила VibeVoice-ASR на Hugging Face для тех, кто хочет в свой пайп агентов закинуть транскрибацию звука.
Модель умеет расшифровывать длинные аудио до 60 минут за один проход и без нарезки на короткие куски.
Что есть в функционале:
- Single-pass транскрипция дает меньше потерь контекста и стабильную речь по всей дорожке.
- Встроенная диарризация по принципу "кто говорит + таймкоды".
- Custom hotwords + user context. На вход можно подать список имён, терминов или контекст. Это позволяет работать со специфичными текстами.
Знаю, что много кто в своих пайпах с LLM используют ASR, OCR и тп. Вот вам новый кандидат на замену в аудио. До кучи. Приятно, что лицензия MIT. И код есть с поддержкой vLLM-asr.
Microsoft выпустила VibeVoice-ASR на Hugging Face для тех, кто хочет в свой пайп агентов закинуть транскрибацию звука.
Модель умеет расшифровывать длинные аудио до 60 минут за один проход и без нарезки на короткие куски.
Что есть в функционале:
- Single-pass транскрипция дает меньше потерь контекста и стабильную речь по всей дорожке.
- Встроенная диарризация по принципу "кто говорит + таймкоды".
- Custom hotwords + user context. На вход можно подать список имён, терминов или контекст. Это позволяет работать со специфичными текстами.
Знаю, что много кто в своих пайпах с LLM используют ASR, OCR и тп. Вот вам новый кандидат на замену в аудио. До кучи. Приятно, что лицензия MIT. И код есть с поддержкой vLLM-asr.
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
microsoft/VibeVoice-ASR · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Супер-популярный в последнее время агент. ClawdBot. Попробуйте, лучше установить на свой сервер
Tencent обновила свою топовую модельку по рисованию картинок
Клод код научился работать асинхронно - например, теперь сможет доделывать какие-то свои задачи, пока общается с вами
Кстати, Клод начал работать в Excel на дешевой подписке. Надо пробовать
Tencent обновила свою топовую модельку по рисованию картинок
Клод код научился работать асинхронно - например, теперь сможет доделывать какие-то свои задачи, пока общается с вами
Кстати, Клод начал работать в Excel на дешевой подписке. Надо пробовать
GitHub
Release Clawdbot 2026.1.24 · openclaw/openclaw
2026.1.24
Highlights
Providers: Ollama discovery + docs; Venice guide upgrades + cross-links. (#1606) Thanks @abhaymundhara. https://docs.clawd.bot/providers/ollama https://docs.clawd.bot/provider...
Highlights
Providers: Ollama discovery + docs; Venice guide upgrades + cross-links. (#1606) Thanks @abhaymundhara. https://docs.clawd.bot/providers/ollama https://docs.clawd.bot/provider...
Все-равно буду сидеть на опусе )) разве что в опенкоде можно попробовать )
https://t.me/data_secrets/8660
https://t.me/data_secrets/8660
Telegram
Data Secrets
Вышла Qwen3-Max-Thinking, и модель заслуживает внимания
Метрики говорят сами за себя:
– HLE 30.2 (примерно уровень Claude-Opus 4.5), с test-time-scaling техниками еще больше
– SWE Verified 75.3 (чуть хуже опуса, примерно Gemini 3 Pro)
– IMO 83.9 (бьет…
Метрики говорят сами за себя:
– HLE 30.2 (примерно уровень Claude-Opus 4.5), с test-time-scaling техниками еще больше
– SWE Verified 75.3 (чуть хуже опуса, примерно Gemini 3 Pro)
– IMO 83.9 (бьет…
Forwarded from Machine learning Interview
🚀 PageIndex - умный индекс документов для reasoning-RAG (без векторов)
PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.
В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.
📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска
🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа
🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев
PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.
▪ Github: https://github.com/VectifyAI/PageIndex
▪ Blog post: https://vectify.ai/blog/Mafin2.5
PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.
В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.
📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска
🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа
🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев
PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.
▪ Github: https://github.com/VectifyAI/PageIndex
▪ Blog post: https://vectify.ai/blog/Mafin2.5
Qwen вместе с моделью max thinking запустили тему Deep reasoning. За счет таких историй модель должна еще чуточку приблизиться к лидерам. По апи она стоит 1,2/6 баксов, что в 2 раза дешевле chatGPT (но честно говоря, не так уж и дешево)
X (formerly Twitter)
Qwen (@Alibaba_Qwen) on X
🚀 Introducing DeepPlanning — a new benchmark for long-horizon agent planning in real-world scenarios.
Unlike step-by-step reasoning tasks, we focus on verifiable global constraints: time budgets, cost limits, and combinatorial optimization that must hold…
Unlike step-by-step reasoning tasks, we focus on verifiable global constraints: time budgets, cost limits, and combinatorial optimization that must hold…
Forwarded from Machinelearning
🐋 DeepSeek выпустили DeepSeek-OCR 2 - новое поколение OCR с SOTA качеством
DeepSeek представили DeepSeek-OCR 2 - 3B модель для продвинутого понимания изображений, документов и OCR, которая выходит на уровень SOTA.
Ключевая новинка - DeepEncoder V2.
В отличие от классических vision LLM, которые «читают» картинку как сетку (слева-направо, сверху-вниз), DeepEncoder V2 работает ближе к тому, как читает человек:
- Сначала формируется глобальное понимание изображения
- Затем модель определяет логический порядок чтения — что важно первым, что дальше
Что это даёт на практике
📄 Лучше работает со сложными макетами документов
📊 Корректно читает таблицы
🧾 Связывает подписи и значения
📰 Понимает колонки и структурированный текст
🔀 Надёжнее обрабатывает смесь текста и визуальной структуры
По качеству
- Обходит Gemini 3 Pro на ряде бенчмарков
- Даёт >4% прироста по сравнению с прошлой версией DeepSeek-OCR
И это при размере модели всего 3B параметров.
Можно запускать и дообучать
Теперь DeepSeek-OCR 2 можно удобно запускать и fine-tune через Unsloth по готовому гайду.
🔗 Guide: https://unsloth.ai/docs/models/deepseek-ocr-2
🔗 Model: https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
🔗 Github: https://github.com/deepseek-ai/DeepSeek-OCR-2/tree/main
🔗 Paper: https://github.com/deepseek-ai/DeepSeek-OCR-2/blob/main/DeepSeek_OCR2_paper.pdf
@ai_machinelearning_big_data
#DeepSeek #ocr #opensource
DeepSeek представили DeepSeek-OCR 2 - 3B модель для продвинутого понимания изображений, документов и OCR, которая выходит на уровень SOTA.
Ключевая новинка - DeepEncoder V2.
В отличие от классических vision LLM, которые «читают» картинку как сетку (слева-направо, сверху-вниз), DeepEncoder V2 работает ближе к тому, как читает человек:
- Сначала формируется глобальное понимание изображения
- Затем модель определяет логический порядок чтения — что важно первым, что дальше
Что это даёт на практике
📄 Лучше работает со сложными макетами документов
📊 Корректно читает таблицы
🧾 Связывает подписи и значения
📰 Понимает колонки и структурированный текст
🔀 Надёжнее обрабатывает смесь текста и визуальной структуры
По качеству
- Обходит Gemini 3 Pro на ряде бенчмарков
- Даёт >4% прироста по сравнению с прошлой версией DeepSeek-OCR
И это при размере модели всего 3B параметров.
Можно запускать и дообучать
Теперь DeepSeek-OCR 2 можно удобно запускать и fine-tune через Unsloth по готовому гайду.
🔗 Guide: https://unsloth.ai/docs/models/deepseek-ocr-2
🔗 Model: https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
🔗 Github: https://github.com/deepseek-ai/DeepSeek-OCR-2/tree/main
🔗 Paper: https://github.com/deepseek-ai/DeepSeek-OCR-2/blob/main/DeepSeek_OCR2_paper.pdf
@ai_machinelearning_big_data
#DeepSeek #ocr #opensource
Даже в арабов есть свои ллмки)) и неплохие.
Кстати, пишут, что новая ктийская моделька Kimi K2.5 в кодинге очень даже хороша
Кстати, пишут, что новая ктийская моделька Kimi K2.5 в кодинге очень даже хороша
X (formerly Twitter)
Artificial Analysis (@ArtificialAnlys) on X
Further analysis on Artificial Analysis:
https://t.co/crjfL2idYc
HuggingFace 🤗 link:
https://t.co/3aiJebDAQM
https://t.co/crjfL2idYc
HuggingFace 🤗 link:
https://t.co/3aiJebDAQM
Forwarded from Неискусственный интеллект (Илья Склюев)
Нейросети осваивают законотворчество
Пока наши депутаты отрицают факт работы с ChatGPT, ссылаясь на вердикт «рекомендованного» GigaChat, за океаном всё смелее говорят о постановке законопроектов "на поток". СМИ выяснили, что в администрации Трампа начали использовать ИИ для подготовки нормативных актов на федеральном уровне.
Первыми освоить технологию решили в американском Минтрансе. Там начали использовать Gemini для помощи в разработке новых правил, касающихся безопасности в авиации, автомобилестроении, на железных дорогах и на море.
Юрист ведомства Дэниел Коэн написал коллегам, что ИИ «способен кардинально изменить процесс разработки нормативных актов». Грегори Зерзан, главный юрисконсульт, сообщил, что президент Дональд Трамп «очень воодушевлён этой инициативой».
Аргументацию, при этом, привели прекрасную. «Нам не нужно идеальное правило для XYZ. Нам даже не нужно очень хорошее правило для XYZ». Достаточно черновика, с которым разработать новое постановление всего за 30 дней или меньше.
В России на государственном уровне ИИ для работы с документами внедряют как в рамках общей платформы для чиновников (Минцифры), так и в отдельных ведомствах (Минфин). Ну и в системе электронного документооборота ИИ-ассистенты уже есть (про это говорил вице-премьер Дмитрий Григоренко).
@anti_agi
Пока наши депутаты отрицают факт работы с ChatGPT, ссылаясь на вердикт «рекомендованного» GigaChat, за океаном всё смелее говорят о постановке законопроектов "на поток". СМИ выяснили, что в администрации Трампа начали использовать ИИ для подготовки нормативных актов на федеральном уровне.
Первыми освоить технологию решили в американском Минтрансе. Там начали использовать Gemini для помощи в разработке новых правил, касающихся безопасности в авиации, автомобилестроении, на железных дорогах и на море.
Юрист ведомства Дэниел Коэн написал коллегам, что ИИ «способен кардинально изменить процесс разработки нормативных актов». Грегори Зерзан, главный юрисконсульт, сообщил, что президент Дональд Трамп «очень воодушевлён этой инициативой».
Шесть сотрудников Минтранса США, которые анонимно пообщались с ProPublica, рассказали, что на составление типичного нормативного акта могут уйти месяцы, а иногда и годы из-за сопутствующих сложностей. Но на демонстрации в декабре ведущий сказал им, что Gemini от Google может сократить этот срок до «минут или даже секунд».
Аргументацию, при этом, привели прекрасную. «Нам не нужно идеальное правило для XYZ. Нам даже не нужно очень хорошее правило для XYZ». Достаточно черновика, с которым разработать новое постановление всего за 30 дней или меньше.
В России на государственном уровне ИИ для работы с документами внедряют как в рамках общей платформы для чиновников (Минцифры), так и в отдельных ведомствах (Минфин). Ну и в системе электронного документооборота ИИ-ассистенты уже есть (про это говорил вице-премьер Дмитрий Григоренко).
@anti_agi
ProPublica
Government by AI? Trump Administration Plans to Write Regulations Using Artificial Intelligence
The Transportation Department, which oversees the safety of airplanes, cars and pipelines, plans to use Google Gemini to draft new regulations. “We don’t need the perfect rule,” said DOT’s top lawyer. “We want good enough.”
Google посмотрел на конкурентов и тоже сделал автобраузинг - отдельную панель в хроме, в которой живет Джемини, нано-банана и агенты, и в которой можно давать им задачки для самостоятельной работы с браузером. Работает на платных подписках в Америке, но скоро будет везде.
И скоро ждем Gemini 3.5, про которую обещают, что будет точно круче GPT 5.2 и Opus 4.5.
И скоро ждем Gemini 3.5, про которую обещают, что будет точно круче GPT 5.2 и Opus 4.5.
А xAI Илона Маска неожиданно выдал Grok imagine - сейчас это лучшая модель по генерации видео из текста или картинок.
X (formerly Twitter)
xAI (@xai) on X
Try the all new Grok Imagine API: https://t.co/tqQwQVhaug
Forwarded from Machinelearning
Пока индустрия одержима гигантоманией и соревнуется, у кого больше параметров, Stepfun решили пойти против течения.
Встречайте, Step3-VL-10B - компактная VL-модель, которая по заявлениям разработчиков не просто конкурирует, а буквально уделывает модели в 10–20 раз тяжелее, включая таких титанов, как Gemini 2.5 Pro и GLM-4.6V.
Звучит как маркетинговый хайп, но под капотом есть интересные инженерные решения, хоть и с хитринкой.
Конструкция из кастомного визуального PE-lang энкодера на 1.8B параметров и Qwen3-8B (что уже половина успеха, учитывая мощь Qwen) в качестве декодера.
В отличие от многих, кто замораживает визуальную часть, Stepfun разморозили все и тренировали модель в один прогон на 1,2 трлн. токенов. Это позволило визуальной и языковой частям модели не просто сосуществовать, а реально срастись и притереться друг к другу.
После этого модель прогнали через адский RL-цикл (RLVR+RLHF) на 1400+ итераций, чтобы модель научилась жестко ризонить.
В бенчмарках цифры действительно страшные (в хорошем смысле) для такого размера:
Для сравнения: GLM-4.6V на 106B выдает на MMMU только 75.20.
Инженерная хитринка кроется в методологии тестирования. Видите в результатах тестов пометку PaCoRe?
PaCoRe (Parallel Coordinated Reasoning):
Чтобы получить топовые цифры, модель использует test-time compute. Она запускает 16 параллельных роллаутов, собирает доказательства из разных веток и синтезирует ответ.
На инференсе это будет стоить вам в 16 раз "дороже" по ресурсам, чем обычный прогон. В стандартном режиме (SeRe) модель все еще хороша, но уже не выглядит как "убийца всех топов".
Кстати, Stepfun честно признались, что в отчетах накосячили с бенчмарками конкурента Qwen3VL-8B из-за неверного
max_tokens. Извинились, обещают пересчитать. Это добавляет доверия, но напоминает, что бенчмарки - дело тонкое.В общем, модель - отличный кандидат для локального использования: есть OpenAI-compatible API и vLLM поддерживается (PR вмержили).
⚠️ Если модель зацикливается при генерации - обновите конфиг, там был баг с
eos_token_id, который уже пофиксили.@ai_machinelearning_big_data
#AI #ML #VLM #STEP3 #StepFunAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
🎙️🚀 Qwen3-ASR и Qwen3-ForcedAligner- open source ASR модели
Мощный, стриминговый speech AI продакшн-уровня для 52 языков и диалектов.
ASR-1.7B - флагманская open-source модель распознавания речи. По качеству конкурирует с очень сильными решениями и обходит многие популярные open-модели прошлого поколения.
ASR-0.6B - компактная и очень быстрая версия.Cтавка на эффективность и низкую задержку, подходит для real-time сценариев.
ForcedAligner-0.6B - модель для точного сопоставления текста и аудио. Дает аккуратные таймкоды на уровне слов и фраз для 11 языков.
Целый открытый стек для разработчиков. Все это можно встраивать в свои системы без закрытых зависимостей.
Лицензия Apache 2.0 - можно использовать в коммерческих продуктах.
GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
Blog: https://qwen.ai/blog?id=qwen3asr
Paper: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
Мощный, стриминговый speech AI продакшн-уровня для 52 языков и диалектов.
ASR-1.7B - флагманская open-source модель распознавания речи. По качеству конкурирует с очень сильными решениями и обходит многие популярные open-модели прошлого поколения.
ASR-0.6B - компактная и очень быстрая версия.Cтавка на эффективность и низкую задержку, подходит для real-time сценариев.
ForcedAligner-0.6B - модель для точного сопоставления текста и аудио. Дает аккуратные таймкоды на уровне слов и фраз для 11 языков.
Целый открытый стек для разработчиков. Все это можно встраивать в свои системы без закрытых зависимостей.
Лицензия Apache 2.0 - можно использовать в коммерческих продуктах.
GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
Blog: https://qwen.ai/blog?id=qwen3asr
Paper: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf