Распознавание и синтез речи
157 subscribers
53 photos
2 videos
16 files
109 links
Распознавание и синтез речи
Download Telegram
говорят есть такие микрофоны, интересные
Forwarded from Sergei Igoshin
Есть аналогичные 4mic круговые от HAOKAI и SiPeed. Вторые явная копия на seedstudio. Цены ниже на 25 и 30% соответственно. Не говоря о том что даже те излишне функциональны.
Вот такого решения в 4 раза дешевле будет достаточно.
Forwarded from Sergei Igoshin
【淘宝】https://e.tb.cn/h.8Mh2n5TNEwjqn2m?tk=opVETUr2Ujk CZ356 「USB 数字4阵列AI 降噪算法 远场拾音模组PCBA大模型语音拾取器」
点击链接直接打开 或者 淘宝搜索直接打开

【淘宝】7天无理由退货 https://e.tb.cn/h.8N23mOb95dGuIiC?tk=ND0ITUr3tjt HU926 「Sipeed 6+1Mic Array麦克风阵列 声源定位 波束成形 USB 免驱声卡」
点击链接直接打开 或者 淘宝搜索直接打开

【淘宝】假一赔四 https://e.tb.cn/h.8nddd13thqkSi0N?tk=0My1TUr3uHE HU293 「HAOKAI 声源定位麦适用于虚拟人智能交互服务机器人智能音箱设备」
点击链接直接打开 或者 淘宝搜索直接打开
https://www.linkedin.com/feed/update/urn:li:activity:7500799549712580608/

В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения
Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же уровне
Что ещё смотрим:
- задержку и стабильность под нагрузкой
- возможность развернуть в контуре банка (on-prem)
- поддержку стриминга
- естественность голоса в TTS
Если у вас есть такое решение - пишите в Telegram: @akoshkimbay
Большая просьба: сразу присылайте демо. Ссылку на сайт, где можно попробовать самому, аудиозаписи, любой доступный тест-режим. Хочу сначала послушать результат, а обсуждать всё остальное уже после этого.
Рассматриваем и зрелые продукты, и команды, которые сильны именно в этой задаче
😁3
🎤Анонс докладов на AsterConf 2026

Голосовой AI в реальном мире: задержки, перебивания и другие грабли

Описание

Практический разбор разработки голосового AI-оператора с архитектурой:
MTT/Exolve → Asterisk → AudioSocket → STT → LLM → TTS
На примере работающего проекта расскажу, как мы создавали роботов для холодного обзвона на базе локального AI и масштабировали систему до 30+ одновременных разговоров.
Поговорим о том, как боролись с задержкой голоса, шумами и перебиваниями, снижали нагрузку на серверы, выбирали LLM и настраивали промты. Отдельно разберём решения, которые хорошо выглядели на бумаге, но не выдержали реальной эксплуатации, и подходы, которые сначала казались «костылями», но в итоге помогли довести проект до продакшена.
Также расскажу, как полученный опыт мы использовали при создании IP-звонилки для Windows с AI-суфлёром для менеджеров продаж.

Тезисы
- Архитектура голосового AI-оператора: от телефонии до STT, LLM и TTS.
- Как уменьшить задержки, бороться с перебиваниями и шумами.
- Как выбирать LLM и настраивать промты без потери скорости.
- Как снизить нагрузку на серверы при 30+ одновременных разговорах.
- Какие решения сработали в продакшене, а какие пришлось отбросить.
- Почему временные «костыли» иногда оказываются лучшим практическим решением.


Купить билет пока можно по цене прошлого года
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from xVibeNot
xVibePocketTTS v0.1.0

Обещал отдать модельку на публичное растерзание - держите

Как оно обучалось и что получилось:
https://t.me/xVibeNot/96

Если пропустили: full finetune Pocket TTS от Kyutai на русский. Около 90M параметров, клонирование голоса по короткому референсу и синтез быстрее реалтайма даже на CPU.

В репо собрал все для запуска:
- Локальная веб-морда, cli и api
- Потоковая генерация
- RUAccent для автоматических ударений
- Три готовых голоса и WAV для примера клонирования

Ручные ударения тоже работают: з+амок и зам+ок.
CPU и GPU отдельно проверил, даже запускается)

Кто не хочет ничего ставить - есть демка с загрузкой своего голоса.

Пробуйте, кидайте примеры.
Особенно где получилось криво - интересно посмотреть, на чем ломается.

Github:
https://github.com/GenVoice/xVibePocketTTS
HF:
https://huggingface.co/genvoice/xVibePocketTTS
HF демка:
https://huggingface.co/spaces/Brakanier/xVibePocketTTS
🔥1
Метрики такие
🔥1
Forwarded from Speech Technology
Suplime results on Russian telephony data, good results actually second after Diarizen Large

A bit slow though
❤1
На хабре написали, что вышли такие файнтюны

https://huggingface.co/coriollon/whisper-large-v3-turbo-russian

https://huggingface.co/coriollon/whisper-large-v3-turbo-russian-codeswitch

надо бы протестировать.

по описанию тренировки (2000 примеров) слабо верится в результат
😁1
Потестировал Nemotron3, лучшая модель, хорошие улучшения + 8 голосов разделяет
👍3🔥3
Протестировал пару новых моделей для идентификации голоса на аудиокнигах

https://huggingface.co/lab260/redimnet2-plus

и

https://huggingface.co/AntResearch/AntSpeaker

В целом хорошие модели, но, как видно, всё зависит от данных, у моделей на voxblilnk2 примерно одинаковые результаты

UPD: добавил число параметров для каждой модели
Forwarded from Fedya Volkov
tl;dr: Senior ML Engineers (TTS or ASR), Python / C++, $80k-150k/year + equity, remote

Вас тоже бесит, что в русском кино все вечно бормочут, хоть субтитры включай? Скоро их получится нормально переозвучить 🎞

На самом деле, Palabra разрабатывает AI для синхронного перевода созвонов, стримов и вебинаров, который сохраняет оригинальный голос. Но кто нам запретит?

🐗 Деньги есть, речь идет о семизначных цифрах. А именно — $8.4M с пресида; среди инвесторов: фонд сооснователя Реддита, бывший руководитель продукта в DeepMind и ранний бэкер ElevenLabs. 

🔉 Что делает TTS Engineer:

‣ Обучает собственную TTS-модель на кластерах H100;
‣ Разрабатывает zero-shot клонирование голоса между языками;
‣ Снижает задержку стриминга для realtime-перевода (недавно модель была №1 по минимальной задержке, сейчас №2 по скорости синтеза).

🎤 Что делает ASR Engineer:

‣ Строит speech-to-text модели;
‣ Улучшает конвейер перевода speech-to-speech.

От обоих ждут:

🧙+ лет опыта ML-инженером (конкретно для TTS важно 3+ в speech tech);
💅 Hands-on опыт с LLM;
🎓 Степень в CS или смежной области.

Обещают $80k-150k/year + equity, никуда не перевозят, зато в команде один из авторов ReDimNet.

В любое время дня и ночи: @skaterina_64 🦉
Please open Telegram to view this post
VIEW IN TELEGRAM
Стартуем наше ежегодное исследование дата-специалистов!

Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри:

🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач.

🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей.

📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления.

💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались.

И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов

⏱ Опрос займет 12–15 минут
📬 Отчет опубликуем в ноябре

👉 https://survey.devcrowd.ru/data-2026

🔁 Пересылайте коллегам из data-направления - добавим больше данных!
Многие коллеги дообучают PocketTTS, xVibe пока получше, но Storm уже почти похож по характеристикам.
🔥1
Forwarded from Conversations Club
Привет, комьюнити! До Conversations ровно 2 месяца! И у нас к вам два дела. Одним как раз можно заняться на выходных!

😱 Дело № 1. Опен-колл для спикеров продлен

В последний день перед дедлайном нас накрыла лавина заявок, и мы решили — гулять так гулять.🕙 Ждем заявок от опаздывающих до 11 октября (это воскресенье). Если вы не успели, шанс все еще есть. Программный комитет разбирает ваши питчи не покладая рук. Несколько слотов в программе еще ждут своих героев!

❗️ Дело № 2. Разыгрываем билет!

Те из вас, кто бывал или регулярно бывает на Conversations, знают, как трепетно мы относимся к качеству контента и подбору спикеров и докладов ✅✅❎ Мы держим руку на пульсе генеративного AI, но... знаем, что и вы тоже!

Конференций, митапов, вебинаров по AI проходит миллион. Расскажите, как вы решаете, на какое событие действительно стоит потратить время?

Мы составили удобный опросник (клик сюда). Поделитесь мнением — какие задачи и вопросы про GenAI волнуют вас прямо сейчас? Кого / о чем вам хотелось бы послушать?

🌟 Между теми, кто ответит на все четыре вопроса (по возможности подробно), 12 октября мы разыграем 1️⃣ офлайн-билет и 2️⃣ онлайн-билета на зимнюю Conversations! 🌟

Погнали!
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from SpeechAI Pro
Коллега по предыдущей работе Саша опубликовал свой замечательный инструмент анализа качества распознавания и датасет аудио в телефонном канале, а также сравнение нескольких открытых моделей на этом датасете!
Инструмент крутой, нам очень помогал анализировать что конкретно происходит и показывать нашим потребителям. И хабростатья, кмк, хорошая получилась.
❤1👍1
Пересчитал метрики PocketTTS Storm, оказывается там ударения надо было ставить через u301, стало лучше

Вообще тяжело оценивать. Mimi и результаты ASR ломает, CER не особо отражает произношение. И FAD ломает сильно, пришлось даже посчитать отдельный FAD по сравнению с траскодированным через Mimi референсом

Спектр режет сильно на самом деле, на слух тяжёлые звуковые комбинации съезжают в шум. Надо либо дотренировывать, либо вообще от этого Mimi отказываться. Не совсем понятно, зачем такая тяжёлая модель (100m, 300m) если кодек всё портит.

По клонированию тоже вопросы, голос получается чётко из базы, интерполяции нет. Если голоса в базе нет, клонирует его очень плохо.
👍2