Forwarded from Sergei Igoshin
【淘宝】https://e.tb.cn/h.8Mh2n5TNEwjqn2m?tk=opVETUr2Ujk CZ356 「USB 数字4阵列AI 降噪算法 远场拾音模组PCBA大模型语音拾取器」
点击链接直接打开 或者 淘宝搜索直接打开
【淘宝】7天无理由退货 https://e.tb.cn/h.8N23mOb95dGuIiC?tk=ND0ITUr3tjt HU926 「Sipeed 6+1Mic Array麦克风阵列 声源定位 波束成形 USB 免驱声卡」
点击链接直接打开 或者 淘宝搜索直接打开
【淘宝】假一赔四 https://e.tb.cn/h.8nddd13thqkSi0N?tk=0My1TUr3uHE HU293 「HAOKAI 声源定位麦适用于虚拟人智能交互服务机器人智能音箱设备」
点击链接直接打开 或者 淘宝搜索直接打开
点击链接直接打开 或者 淘宝搜索直接打开
【淘宝】7天无理由退货 https://e.tb.cn/h.8N23mOb95dGuIiC?tk=ND0ITUr3tjt HU926 「Sipeed 6+1Mic Array麦克风阵列 声源定位 波束成形 USB 免驱声卡」
点击链接直接打开 或者 淘宝搜索直接打开
【淘宝】假一赔四 https://e.tb.cn/h.8nddd13thqkSi0N?tk=0My1TUr3uHE HU293 「HAOKAI 声源定位麦适用于虚拟人智能交互服务机器人智能音箱设备」
点击链接直接打开 或者 淘宝搜索直接打开
https://www.linkedin.com/feed/update/urn:li:activity:7500799549712580608/
В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения
Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же уровне
Что ещё смотрим:
- задержку и стабильность под нагрузкой
- возможность развернуть в контуре банка (on-prem)
- поддержку стриминга
- естественность голоса в TTS
Если у вас есть такое решение - пишите в Telegram: @akoshkimbay
Большая просьба: сразу присылайте демо. Ссылку на сайт, где можно попробовать самому, аудиозаписи, любой доступный тест-режим. Хочу сначала послушать результат, а обсуждать всё остальное уже после этого.
Рассматриваем и зрелые продукты, и команды, которые сильны именно в этой задаче
В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения
Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же уровне
Что ещё смотрим:
- задержку и стабильность под нагрузкой
- возможность развернуть в контуре банка (on-prem)
- поддержку стриминга
- естественность голоса в TTS
Если у вас есть такое решение - пишите в Telegram: @akoshkimbay
Большая просьба: сразу присылайте демо. Ссылку на сайт, где можно попробовать самому, аудиозаписи, любой доступный тест-режим. Хочу сначала послушать результат, а обсуждать всё остальное уже после этого.
Рассматриваем и зрелые продукты, и команды, которые сильны именно в этой задаче
LinkedIn
В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения
Главный акцент - казахский язык. Нужно качество…
Главный акцент - казахский язык. Нужно качество…
В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения
Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же…
Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же…
😁3
Ещё одно интересное приложение с использованием Воска, не решающее, конечно, проблемы
https://github.com/qwertyzipe/SwearBeeper
https://github.com/qwertyzipe/SwearBeeper
GitHub
GitHub - qwertyzipe/SwearBeeper: Пикает маты в (почти) реальном времени
Пикает маты в (почти) реальном времени. Contribute to qwertyzipe/SwearBeeper development by creating an account on GitHub.
Forwarded from Анастасия Грушко
Голосовой AI в реальном мире: задержки, перебивания и другие грабли
Описание
Практический разбор разработки голосового AI-оператора с архитектурой:
MTT/Exolve → Asterisk → AudioSocket → STT → LLM → TTS
На примере работающего проекта расскажу, как мы создавали роботов для холодного обзвона на базе локального AI и масштабировали систему до 30+ одновременных разговоров.
Поговорим о том, как боролись с задержкой голоса, шумами и перебиваниями, снижали нагрузку на серверы, выбирали LLM и настраивали промты. Отдельно разберём решения, которые хорошо выглядели на бумаге, но не выдержали реальной эксплуатации, и подходы, которые сначала казались «костылями», но в итоге помогли довести проект до продакшена.
Также расскажу, как полученный опыт мы использовали при создании IP-звонилки для Windows с AI-суфлёром для менеджеров продаж.
Тезисы
- Архитектура голосового AI-оператора: от телефонии до STT, LLM и TTS.
- Как уменьшить задержки, бороться с перебиваниями и шумами.
- Как выбирать LLM и настраивать промты без потери скорости.
- Как снизить нагрузку на серверы при 30+ одновременных разговорах.
- Какие решения сработали в продакшене, а какие пришлось отбросить.
- Почему временные «костыли» иногда оказываются лучшим практическим решением.
Купить билет пока можно по цене прошлого года
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from xVibeNot
xVibePocketTTS v0.1.0
Обещал отдать модельку на публичное растерзание - держите
Как оно обучалось и что получилось:
https://t.me/xVibeNot/96
Если пропустили: full finetune Pocket TTS от Kyutai на русский. Около 90M параметров, клонирование голоса по короткому референсу и синтез быстрее реалтайма даже на CPU.
В репо собрал все для запуска:
- Локальная веб-морда, cli и api
- Потоковая генерация
- RUAccent для автоматических ударений
- Три готовых голоса и WAV для примера клонирования
Ручные ударения тоже работают:
CPU и GPU отдельно проверил, даже запускается)
Кто не хочет ничего ставить - есть демка с загрузкой своего голоса.
Пробуйте, кидайте примеры.
Особенно где получилось криво - интересно посмотреть, на чем ломается.
Github:
https://github.com/GenVoice/xVibePocketTTS
HF:
https://huggingface.co/genvoice/xVibePocketTTS
HF демка:
https://huggingface.co/spaces/Brakanier/xVibePocketTTS
Обещал отдать модельку на публичное растерзание - держите
Как оно обучалось и что получилось:
https://t.me/xVibeNot/96
Если пропустили: full finetune Pocket TTS от Kyutai на русский. Около 90M параметров, клонирование голоса по короткому референсу и синтез быстрее реалтайма даже на CPU.
В репо собрал все для запуска:
- Локальная веб-морда, cli и api
- Потоковая генерация
- RUAccent для автоматических ударений
- Три готовых голоса и WAV для примера клонирования
Ручные ударения тоже работают:
з+амок и зам+ок.CPU и GPU отдельно проверил, даже запускается)
Кто не хочет ничего ставить - есть демка с загрузкой своего голоса.
Пробуйте, кидайте примеры.
Особенно где получилось криво - интересно посмотреть, на чем ломается.
Github:
https://github.com/GenVoice/xVibePocketTTS
HF:
https://huggingface.co/genvoice/xVibePocketTTS
HF демка:
https://huggingface.co/spaces/Brakanier/xVibePocketTTS
🔥1
Forwarded from Speech Technology
Suplime results on Russian telephony data, good results actually second after Diarizen Large
A bit slow though
A bit slow though
❤1
На хабре написали, что вышли такие файнтюны
https://huggingface.co/coriollon/whisper-large-v3-turbo-russian
https://huggingface.co/coriollon/whisper-large-v3-turbo-russian-codeswitch
надо бы протестировать.
по описанию тренировки (2000 примеров) слабо верится в результат
https://huggingface.co/coriollon/whisper-large-v3-turbo-russian
https://huggingface.co/coriollon/whisper-large-v3-turbo-russian-codeswitch
надо бы протестировать.
по описанию тренировки (2000 примеров) слабо верится в результат
huggingface.co
coriollon/whisper-large-v3-turbo-russian · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
😁1
Протестировал пару новых моделей для идентификации голоса на аудиокнигах
https://huggingface.co/lab260/redimnet2-plus
и
https://huggingface.co/AntResearch/AntSpeaker
В целом хорошие модели, но, как видно, всё зависит от данных, у моделей на voxblilnk2 примерно одинаковые результаты
UPD: добавил число параметров для каждой модели
https://huggingface.co/lab260/redimnet2-plus
и
https://huggingface.co/AntResearch/AntSpeaker
В целом хорошие модели, но, как видно, всё зависит от данных, у моделей на voxblilnk2 примерно одинаковые результаты
UPD: добавил число параметров для каждой модели
Forwarded from Fedya Volkov
tl;dr: Senior ML Engineers (TTS or ASR), Python / C++, $80k-150k/year + equity, remote
Вас тоже бесит, что в русском кино все вечно бормочут, хоть субтитры включай? Скоро их получится нормально переозвучить🎞
На самом деле, Palabra разрабатывает AI для синхронного перевода созвонов, стримов и вебинаров, который сохраняет оригинальный голос. Но кто нам запретит?
🐗 Деньги есть, речь идет о семизначных цифрах. А именно — $8.4M с пресида; среди инвесторов: фонд сооснователя Реддита, бывший руководитель продукта в DeepMind и ранний бэкер ElevenLabs.
🔉 Что делает TTS Engineer:
‣ Обучает собственную TTS-модель на кластерах H100;
‣ Разрабатывает zero-shot клонирование голоса между языками;
‣ Снижает задержку стриминга для realtime-перевода(недавно модель была №1 по минимальной задержке, сейчас №2 по скорости синтеза).
🎤 Что делает ASR Engineer:
‣ Строит speech-to-text модели;
‣ Улучшает конвейер перевода speech-to-speech.
От обоих ждут:
🧙 + лет опыта ML-инженером (конкретно для TTS важно 3+ в speech tech);
💅 Hands-on опыт с LLM;
🎓 Степень в CS или смежной области.
Обещают $80k-150k/year + equity, никуда не перевозят, зато в команде один из авторов ReDimNet.
В любое время дня и ночи: @skaterina_64🦉
Вас тоже бесит, что в русском кино все вечно бормочут, хоть субтитры включай? Скоро их получится нормально переозвучить
На самом деле, Palabra разрабатывает AI для синхронного перевода созвонов, стримов и вебинаров, который сохраняет оригинальный голос. Но кто нам запретит?
‣ Обучает собственную TTS-модель на кластерах H100;
‣ Разрабатывает zero-shot клонирование голоса между языками;
‣ Снижает задержку стриминга для realtime-перевода
‣ Строит speech-to-text модели;
‣ Улучшает конвейер перевода speech-to-speech.
От обоих ждут:
Обещают $80k-150k/year + equity, никуда не перевозят, зато в команде один из авторов ReDimNet.
В любое время дня и ночи: @skaterina_64
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from DevCrowd - недушные рисерчи IT-отрасли
Стартуем наше ежегодное исследование дата-специалистов!
Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри:
🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач.
🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей.
📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления.
💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались.
И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов
⏱ Опрос займет 12–15 минут
📬 Отчет опубликуем в ноябре
👉 https://survey.devcrowd.ru/data-2026
🔁 Пересылайте коллегам из data-направления - добавим больше данных!
Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри:
🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач.
🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей.
📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления.
💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались.
И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов
⏱ Опрос займет 12–15 минут
📬 Отчет опубликуем в ноябре
👉 https://survey.devcrowd.ru/data-2026
🔁 Пересылайте коллегам из data-направления - добавим больше данных!
Forwarded from Conversations Club
Привет, комьюнити! До Conversations ровно 2 месяца! И у нас к вам два дела. Одним как раз можно заняться на выходных!
😱 Дело № 1. Опен-колл для спикеров продлен
В последний день перед дедлайном нас накрыла лавина заявок, и мы решили — гулять так гулять.🕙 Ждем заявок от опаздывающих до 11 октября (это воскресенье) . Если вы не успели, шанс все еще есть. Программный комитет разбирает ваши питчи не покладая рук. Несколько слотов в программе еще ждут своих героев!
❗️ Дело № 2. Разыгрываем билет!
Те из вас, кто бывал или регулярно бывает на Conversations, знают, как трепетно мы относимся к качеству контента и подбору спикеров и докладов✅ ✅ ❎ Мы держим руку на пульсе генеративного AI, но... знаем, что и вы тоже!
Конференций, митапов, вебинаров по AI проходит миллион. Расскажите, как вы решаете, на какое событие действительно стоит потратить время?
Мы составили удобный опросник (клик сюда). Поделитесь мнением — какие задачи и вопросы про GenAI волнуют вас прямо сейчас? Кого / о чем вам хотелось бы послушать?
🌟 Между теми, кто ответит на все четыре вопроса (по возможности подробно), 12 октября мы разыграем 1️⃣ офлайн-билет и 2️⃣ онлайн-билета на зимнюю Conversations! 🌟
Погнали!
В последний день перед дедлайном нас накрыла лавина заявок, и мы решили — гулять так гулять.
Те из вас, кто бывал или регулярно бывает на Conversations, знают, как трепетно мы относимся к качеству контента и подбору спикеров и докладов
Конференций, митапов, вебинаров по AI проходит миллион. Расскажите, как вы решаете, на какое событие действительно стоит потратить время?
Мы составили удобный опросник (клик сюда). Поделитесь мнением — какие задачи и вопросы про GenAI волнуют вас прямо сейчас? Кого / о чем вам хотелось бы послушать?
Погнали!
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from SpeechAI Pro
Коллега по предыдущей работе Саша опубликовал свой замечательный инструмент анализа качества распознавания и датасет аудио в телефонном канале, а также сравнение нескольких открытых моделей на этом датасете!
Инструмент крутой, нам очень помогал анализировать что конкретно происходит и показывать нашим потребителям. И хабростатья, кмк, хорошая получилась.
Инструмент крутой, нам очень помогал анализировать что конкретно происходит и показывать нашим потребителям. И хабростатья, кмк, хорошая получилась.
❤1👍1
Пересчитал метрики PocketTTS Storm, оказывается там ударения надо было ставить через u301, стало лучше
Вообще тяжело оценивать. Mimi и результаты ASR ломает, CER не особо отражает произношение. И FAD ломает сильно, пришлось даже посчитать отдельный FAD по сравнению с траскодированным через Mimi референсом
Спектр режет сильно на самом деле, на слух тяжёлые звуковые комбинации съезжают в шум. Надо либо дотренировывать, либо вообще от этого Mimi отказываться. Не совсем понятно, зачем такая тяжёлая модель (100m, 300m) если кодек всё портит.
По клонированию тоже вопросы, голос получается чётко из базы, интерполяции нет. Если голоса в базе нет, клонирует его очень плохо.
Вообще тяжело оценивать. Mimi и результаты ASR ломает, CER не особо отражает произношение. И FAD ломает сильно, пришлось даже посчитать отдельный FAD по сравнению с траскодированным через Mimi референсом
Спектр режет сильно на самом деле, на слух тяжёлые звуковые комбинации съезжают в шум. Надо либо дотренировывать, либо вообще от этого Mimi отказываться. Не совсем понятно, зачем такая тяжёлая модель (100m, 300m) если кодек всё портит.
По клонированию тоже вопросы, голос получается чётко из базы, интерполяции нет. Если голоса в базе нет, клонирует его очень плохо.
👍2