Qwen выкатила Audio 3.1 — один стек, который закрывает разом ASR, TTS и realtime-аудио.
ASR стал лучше разбирать языки и диалекты, а заодно вычищает повторы и слова-паразиты. ASR-Next уже раскидывает, кто из говорящих кто, проставляет таймкоды, ловит эмоции и звуки вокруг.
TTS умеет переносить голос с языка на язык и крутить стиль, скорость и эмоцию. TTS-Next выдаёт голос, эффекты и фон одним заходом — через связку LM + diffusion. Realtime слушает и говорит одновременно, с нормальными живыми перебиваниями.
И цены срезали прилично: TTS ~−70%, Realtime ~−85%, ASR до −95%.
Qwen-Audio-3.1-ASR
Qwen-Audio-3.1-Realtime
👉 About Python
ASR стал лучше разбирать языки и диалекты, а заодно вычищает повторы и слова-паразиты. ASR-Next уже раскидывает, кто из говорящих кто, проставляет таймкоды, ловит эмоции и звуки вокруг.
TTS умеет переносить голос с языка на язык и крутить стиль, скорость и эмоцию. TTS-Next выдаёт голос, эффекты и фон одним заходом — через связку LM + diffusion. Realtime слушает и говорит одновременно, с нормальными живыми перебиваниями.
И цены срезали прилично: TTS ~−70%, Realtime ~−85%, ASR до −95%.
Qwen-Audio-3.1-ASR
Qwen-Audio-3.1-Realtime
Please open Telegram to view this post
VIEW IN TELEGRAM
Джунам только и делают, что раздают советы: учись, не молчи, задавай вопросы, копайся в чужом коде (ну или хотя бы в своём…), расти без остановки. А сам джун в этот момент сидит с единственной мыслью: ну когда уже просто придут те деньги, которые на курсе обещали?
Но есть и другой вариант. Без роста через боль, без признания косяков и прочих радостей трудоустройства. Только вера в себя и шесть незамысловатых правил, с которыми статус новичка можно удержать надолго.
Читать далее
👉 About Python
Но есть и другой вариант. Без роста через боль, без признания косяков и прочих радостей трудоустройства. Только вера в себя и шесть незамысловатых правил, с которыми статус новичка можно удержать надолго.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM