И так, у нас новый релиз - OmniVoice.
Внутри:
- Заявлена поддержка 600+ языков.
- Клонирование конечно же
- Создание голосов, так называемый - voice design
- Поддержка тегов
- Быстрый инференс
- Диффузия
Моделька многим понравилась и по скорости, и по качеству, но есть особенности, о них и хочу дальше написать подробнее.
VoiceDesign
Сразу коснемся создания кастомных голосов, пока еще не добрался пощупать подробнее, но точно могу сказать что он отличается от Qwen voice design.
Тут ты не можешь свободным текстом описать какой голос тебе нужен, в омни ты выбираешь:
- пол
- возраст
- тон
- стиль (можно указать только шепот, либо не указывать)
- акцент для английского
- диалект для китайского
Стриминг
У нас тут диффузия и как с llm, дать текст и получать результат постепенно - не получится.
А значит надо резать текст на чанки.
А какого размера?
Сделал очень простой тест, взял несколько текстов, 4 референса голосов, и разную нарезку от 40 символов на чанк до 200.
Тут мы получаем классический трейд оф, при 40 чанках получаем минимальный TTFB (время до первого чанка со звуком), при 200 получаем максимальный RTF (больше пропускная способность).
Равновесие нашлось где-то на 80-120-150 символах. Но 80 кажется слишком мало, в аудио слышны границы и изменения интонации, поэтому я бы брал 120 символов на чанк и не резал бы тексты < 150 символов.
С pytorch.compile (без flash attn) и в 16 шагов я получил такие метрики на 3090:
TTFB: 500ms
RTF: 0.11
При этом съедает всего 2-3 gb VRAM.
Ударения
Используя разные голоса и тексты, по ощущениям, промахивается в ударениях чаще чем Сosy, но меньше чем Qwen.
Но понимает акут, в коментах будут демки с ударениями в омографе.
Не знаю как поведет себя если расставить акут в каждом слове, Cosy к примеру ломается при таком.
Теги
Тут кратко - у меня большинство не завелось с русским текстом.
Сработали
Качество
На этот раз я решил провести прям бенчмарк, у меня были замеры для Cosy, решил их же прогнать на Omni. Методика тестирование немного странная, в общем щас расскажу.
Я взял 3000 синтезов от обычных пользователей.
Это значит, что текст не подготовлен под синтез, там часто встречаются цифры, никакой нормализации, иногда текст вообще мусор и его нереально озвучить.
Но это реальные запросы обычных людей, которым надо озвучить какой-то текст.
Прогнал синтез с Omni на этих же текстах и с теми же референсами голосов на 16-ти и 32-ух шагах.
Синтез прогонял без чанкинга, ну точнее с встроенным, если аудио > 30 секунд, оригинальный код бьет на чанки по 15 секунд.
Посчитал WER, CER, nWER, nCER, SpkSim, UTMOS, DNSMOS, NISQA, SNR.
В итоге Omni vs Cosy:
- Побеждает в точности речи WER, CER на любых срезах лучше.
- Проигрывает в натуральности и копировании UTMOS, SpkSim хуже почти везде.
И есть одна особенность, Omni не хватает контекста на коротких фразах < 5-10 секунд, тут Cosy чувствует себя лучше по части UTMOS, SpkSim.
Дальше, чем длиннее аудио, тем все становится лучше, где-то на фразах от 25 секунд Omni часто обходит Cosy.
Табличка сравнений по каждой метрике будет в коментах.
Стоит учитывать, что среди 3000 синтезов 70% до 10 секунд.
Итог
Модель хорошая, а если учитывать размеры и скорости без особых оптимизаций, то может и отличная.
Если вам нужна генерация длинных текстов - точно стоит попробовать в первую очередь.
Если вам нужны короткие реплики - тут стоит тестировать на своих данных.
Github:
https://github.com/k2-fsa/OmniVoice
HF веса:
https://huggingface.co/k2-fsa/OmniVoice
HF демка:
https://huggingface.co/spaces/k2-fsa/OmniVoice
Внутри:
- Заявлена поддержка 600+ языков.
- Клонирование конечно же
- Создание голосов, так называемый - voice design
- Поддержка тегов
- Быстрый инференс
- Диффузия
Моделька многим понравилась и по скорости, и по качеству, но есть особенности, о них и хочу дальше написать подробнее.
VoiceDesign
Сразу коснемся создания кастомных голосов, пока еще не добрался пощупать подробнее, но точно могу сказать что он отличается от Qwen voice design.
Тут ты не можешь свободным текстом описать какой голос тебе нужен, в омни ты выбираешь:
- пол
- возраст
- тон
- стиль (можно указать только шепот, либо не указывать)
- акцент для английского
- диалект для китайского
Стриминг
У нас тут диффузия и как с llm, дать текст и получать результат постепенно - не получится.
А значит надо резать текст на чанки.
А какого размера?
Сделал очень простой тест, взял несколько текстов, 4 референса голосов, и разную нарезку от 40 символов на чанк до 200.
Тут мы получаем классический трейд оф, при 40 чанках получаем минимальный TTFB (время до первого чанка со звуком), при 200 получаем максимальный RTF (больше пропускная способность).
Равновесие нашлось где-то на 80-120-150 символах. Но 80 кажется слишком мало, в аудио слышны границы и изменения интонации, поэтому я бы брал 120 символов на чанк и не резал бы тексты < 150 символов.
С pytorch.compile (без flash attn) и в 16 шагов я получил такие метрики на 3090:
TTFB: 500ms
RTF: 0.11
При этом съедает всего 2-3 gb VRAM.
Ударения
Используя разные голоса и тексты, по ощущениям, промахивается в ударениях чаще чем Сosy, но меньше чем Qwen.
Но понимает акут, в коментах будут демки с ударениями в омографе.
Не знаю как поведет себя если расставить акут в каждом слове, Cosy к примеру ломается при таком.
Теги
Тут кратко - у меня большинство не завелось с русским текстом.
Сработали
[laughter] и [sigh]Качество
На этот раз я решил провести прям бенчмарк, у меня были замеры для Cosy, решил их же прогнать на Omni. Методика тестирование немного странная, в общем щас расскажу.
Я взял 3000 синтезов от обычных пользователей.
Это значит, что текст не подготовлен под синтез, там часто встречаются цифры, никакой нормализации, иногда текст вообще мусор и его нереально озвучить.
Но это реальные запросы обычных людей, которым надо озвучить какой-то текст.
Прогнал синтез с Omni на этих же текстах и с теми же референсами голосов на 16-ти и 32-ух шагах.
Синтез прогонял без чанкинга, ну точнее с встроенным, если аудио > 30 секунд, оригинальный код бьет на чанки по 15 секунд.
Посчитал WER, CER, nWER, nCER, SpkSim, UTMOS, DNSMOS, NISQA, SNR.
В итоге Omni vs Cosy:
- Побеждает в точности речи WER, CER на любых срезах лучше.
- Проигрывает в натуральности и копировании UTMOS, SpkSim хуже почти везде.
И есть одна особенность, Omni не хватает контекста на коротких фразах < 5-10 секунд, тут Cosy чувствует себя лучше по части UTMOS, SpkSim.
Дальше, чем длиннее аудио, тем все становится лучше, где-то на фразах от 25 секунд Omni часто обходит Cosy.
Табличка сравнений по каждой метрике будет в коментах.
Стоит учитывать, что среди 3000 синтезов 70% до 10 секунд.
Итог
Модель хорошая, а если учитывать размеры и скорости без особых оптимизаций, то может и отличная.
Если вам нужна генерация длинных текстов - точно стоит попробовать в первую очередь.
Если вам нужны короткие реплики - тут стоит тестировать на своих данных.
Github:
https://github.com/k2-fsa/OmniVoice
HF веса:
https://huggingface.co/k2-fsa/OmniVoice
HF демка:
https://huggingface.co/spaces/k2-fsa/OmniVoice
❤6👍1
https://habr.com/ru/articles/1027934/
Подкинули статью, как готовить Сosy поверх llama.cpp, а там внутри форк знакомый 😏
Подкинули статью, как готовить Сosy поверх llama.cpp, а там внутри форк знакомый 😏
😁6🤝2🌚1
Обычно тут про TTS, но модельки мы же крутим не просто так, на них хочется что-то строить.
Пет проекты и не только
Сейчас, в эру кодинг-агентов (а до них Cursor и Copilot), сложно удержаться и не запилить что-нибудь своё. Тул, опенсорс-либу, мини-продукт или просто повайбкодить выходные и выкинуть.
Канал у нас конечно небольшой, но все же - стало интересно, а что пилят другие.
Skillmost
Я начну, примерно год назад друг начал пилить проект/продукт - Skillmost
Алексей, тут могла бы быть ссылка на твой тг канал, но ты его дропнул 😁
Суть кратко: платформа для HR скринингов
Чуть позже после старта позвал меня заняться asr и llm частью.
Работало так:
- Добавляешь резюме кандидата
- Загружаешь запись видео/аудио скрининга
- Мы автоматом распознаем диалог
- Получаешь репорт по кандидату, который можешь пошарить команде или просто вернуться к нему на финальных стадиях
Внутри, просто распознавание + диаризация + таймстемпы.
Дальше несколько llm вызовов, один строил SWOT анализ, второй искал совпадения/расхождения с резюме и опытом.
Таймстемпы, чтобы разбить звонок на основные темы и возможность перемотать к нужному моменту.
Просто текст для экспорта/копирования тоже доступен.
Мы такие посчитали, сколько часов можем прогонять, прикинули цену на openai whisper и получилось не очень выгодно, whisper съедал большую часть экономики. Но это же был только старт, потом что-нибудь придумали бы.
Прикрутили даже attendee.dev - бот, который в митинги сам запрыгивает, open-source, но есть и облако с API.
Тут кстати еще проблема есть, как синкнуть календари и найти нужные миты, мы этого так и не сделали, бот запрыгивал по ссылке на звонок.
Чуть покрутили рекламу в директе, выхлоп - 0
Чуть пообщались со знакомыми HR, выхлоп - 0
Один фидбек - дороговато
В этом моменте надо было сделать какие-то выводы.
Мы сделали, каждый свои и тихо забросили проект 🤡
На все ушло 2-3 месяца и 20-30к рублей.
А что пошло не так?
А тут все так как и должно быть - дофамин первое время, едешь на нем, потом он пропадает - никуда не едешь.
Что с этим делать?
Ничего, привыкать, в какой-то момент такой проект станет обычной работой.
Хорошо, если добежишь до первых оплат - получишь еще дозу, продержишься дольше.
Отдельная боль - продажи.
Сейчас конечно из каждого угла говорят об этом, что написать любой тул не проблема, проблема его потом продать.
Сегодня с этим чуть проще, если есть спрос через поиск, можно отправить клод/кодекс провести ресерч, собрать ключи, настроить объявления в директе и это в целом работает, и работает лучше, чем делать руками с полностью отсутствующим опытом.
Вот так вот
Домен уже протух, поэтому наковырял скриншотов из переписок, закину в комментарии, чтобы вы могли посмотреть как это примерно выглядело.
Рассказывайте тоже, что пилите, что получилось, что нет.
Ссылки, демки, цифры - приветствуются.
Пет проекты и не только
Сейчас, в эру кодинг-агентов (а до них Cursor и Copilot), сложно удержаться и не запилить что-нибудь своё. Тул, опенсорс-либу, мини-продукт или просто повайбкодить выходные и выкинуть.
Канал у нас конечно небольшой, но все же - стало интересно, а что пилят другие.
Skillmost
Я начну, примерно год назад друг начал пилить проект/продукт - Skillmost
Алексей, тут могла бы быть ссылка на твой тг канал, но ты его дропнул 😁
Суть кратко: платформа для HR скринингов
Чуть позже после старта позвал меня заняться asr и llm частью.
Работало так:
- Добавляешь резюме кандидата
- Загружаешь запись видео/аудио скрининга
- Мы автоматом распознаем диалог
- Получаешь репорт по кандидату, который можешь пошарить команде или просто вернуться к нему на финальных стадиях
Внутри, просто распознавание + диаризация + таймстемпы.
Дальше несколько llm вызовов, один строил SWOT анализ, второй искал совпадения/расхождения с резюме и опытом.
Таймстемпы, чтобы разбить звонок на основные темы и возможность перемотать к нужному моменту.
Просто текст для экспорта/копирования тоже доступен.
Мы такие посчитали, сколько часов можем прогонять, прикинули цену на openai whisper и получилось не очень выгодно, whisper съедал большую часть экономики. Но это же был только старт, потом что-нибудь придумали бы.
Прикрутили даже attendee.dev - бот, который в митинги сам запрыгивает, open-source, но есть и облако с API.
Тут кстати еще проблема есть, как синкнуть календари и найти нужные миты, мы этого так и не сделали, бот запрыгивал по ссылке на звонок.
Чуть покрутили рекламу в директе, выхлоп - 0
Чуть пообщались со знакомыми HR, выхлоп - 0
Один фидбек - дороговато
В этом моменте надо было сделать какие-то выводы.
Мы сделали, каждый свои и тихо забросили проект 🤡
На все ушло 2-3 месяца и 20-30к рублей.
А что пошло не так?
А тут все так как и должно быть - дофамин первое время, едешь на нем, потом он пропадает - никуда не едешь.
Что с этим делать?
Ничего, привыкать, в какой-то момент такой проект станет обычной работой.
Хорошо, если добежишь до первых оплат - получишь еще дозу, продержишься дольше.
Отдельная боль - продажи.
Сейчас конечно из каждого угла говорят об этом, что написать любой тул не проблема, проблема его потом продать.
Сегодня с этим чуть проще, если есть спрос через поиск, можно отправить клод/кодекс провести ресерч, собрать ключи, настроить объявления в директе и это в целом работает, и работает лучше, чем делать руками с полностью отсутствующим опытом.
Вот так вот
Домен уже протух, поэтому наковырял скриншотов из переписок, закину в комментарии, чтобы вы могли посмотреть как это примерно выглядело.
Рассказывайте тоже, что пилите, что получилось, что нет.
Ссылки, демки, цифры - приветствуются.
1❤5
На первую сотню ушло 90 дней: 18 ноября - 16 февраля
На вторую 106 дней: 16 февраля - 2 июня
Клод говорит на "16 дней дольше (~18% медленнее)", а все потому что регулярно посты надо писать, а не вот это вот, пропадать на месяц.
А еще это 30-й пост из тех, которые подготовлены и написаны сначала в обсидиане, перечитаны и потом опубликованы.
Где посты
С постами все ок, они просто не пишутся
На самом деле есть много чего рассказать, например:
А почему не пишутся
Немного не хватает времени, не хочется лить воды, или генерить, хочется собрать все цифры, данные, таймлайн и показывать. От этого какие-то требования завышенные что-ли у самого себя к постам. Типо, вот это сделал, можно написать, но ты же не попробовал еще вот так, а значит какой-то неполный эксперимент.
Предполагаю, что это больше вредно, чем полезно.
Попробуем исправить, но сейчас лето, говорят иногда стоит выходить на улицу, трогать траву, думаю врут.
TTS/ASR/Voice
Кажется начинает хайповать speech-to-speech подход, удобно, круто, молодежно, но пока не верю в него, по одной простой причине - как это замерять?
Именно вот продакшн сценарии, тут просто текстовую llm следовать всему и делать то, что тебе надо, не так то просто приручить, а с голосом вообще думаю мрак.
А значит пока еще остаются и хорошо себя чувствуют пайплайн подходы:
Audio - VAD - EPD - ASR - LLM - TTS - Audio
Если кому-то что-то интересно из всего выше, пишите в комменты - соберу полноценные посты.
Если не интересно, тоже пишите - будем репостить мемасы и делать обзоры на аниме опенинги (нет).
Всем спасибо, за предоставленное место в куче каналов на которые вы подписаны!
И ты, вот да, именно ты, который вдруг вспомнил, что когда-то подписался и сейчас забыл зачем, и тянешься отписаться - не надо, будешь потом страдать от AI FOMO, вдруг что-то важное пропустишь
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10🔥5👍1
Flash attention
Раньше был такой сайт на vercel - flashattn.dev
Но он умер, видимо год прокрутился и все
Билдить flash-attn самому больно, держите альтернативу:
https://mjunya.com/flash-attention-prebuild-wheels/
Оригинальное репо с pre-build wheels:
https://github.com/mjun0812/flash-attention-prebuild-wheels
Раньше был такой сайт на vercel - flashattn.dev
Но он умер, видимо год прокрутился и все
Билдить flash-attn самому больно, держите альтернативу:
https://mjunya.com/flash-attention-prebuild-wheels/
Оригинальное репо с pre-build wheels:
https://github.com/mjun0812/flash-attention-prebuild-wheels
🔥5👍1
Что-то интересное
- 100+ языков, эмоции, стиль, звуки/эффекты, произношение
- По метрикам авторов лучше чем Qwen и OmniVoice почти везде
- SGLang-Omni поддержка из коробки
- Клонирование голоса
HF:
https://huggingface.co/bosonai/higgs-audio-v3-tts-4b
- 100+ языков, эмоции, стиль, звуки/эффекты, произношение
- По метрикам авторов лучше чем Qwen и OmniVoice почти везде
- SGLang-Omni поддержка из коробки
- Клонирование голоса
HF:
https://huggingface.co/bosonai/higgs-audio-v3-tts-4b
🔥8❤2👍1
Еще интересного
- 24 языка, 19 хорошего уровня, ру язык в комплекте
- 2B параметров, а не 4B как выше
- Без тегов для управления эмоциями/стилем/произношением
- 48kHz на выходе
- Клонирование
- Обещают выложить фулл треин код
Github:
https://github.com/rednote-hilab/dots.tts
HF:
https://huggingface.co/collections/rednote-hilab/dotstts
Демки от авторов:
https://rednote-hilab.github.io/dots.tts-demo/
- 24 языка, 19 хорошего уровня, ру язык в комплекте
- 2B параметров, а не 4B как выше
- Без тегов для управления эмоциями/стилем/произношением
- 48kHz на выходе
- Клонирование
- Обещают выложить фулл треин код
Github:
https://github.com/rednote-hilab/dots.tts
HF:
https://huggingface.co/collections/rednote-hilab/dotstts
Демки от авторов:
https://rednote-hilab.github.io/dots.tts-demo/
❤1
xVibeNot
Что-то интересное - 100+ языков, эмоции, стиль, звуки/эффекты, произношение - По метрикам авторов лучше чем Qwen и OmniVoice почти везде - SGLang-Omni поддержка из коробки - Клонирование голоса HF: https://huggingface.co/bosonai/higgs-audio-v3-tts-4b
sing_joy__1.wav
888.8 KB
Включать на свой страх и риск, возможны минус уши
😁3
Forwarded from AI4Dev — AI for Development
Media is too big
VIEW IN TELEGRAM
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).
Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.
В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.
В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍5🔥1
Наконец-то я добрался пощупать/дощупать higgs tts v3
Интро
4B autoregressive decoder
sample rate 24 kHz
Звучит вкусно.
Токены для управления произношением <|category:value|>:
- эмоции - anger, amusement, и тд.
- стиль - singing, shouting, whispering
- звуковые эффекты - cough, laughter, sigh
- просодия - скорость (0.65-1.4x), паузы, pitch, выразительность
Запускаем
Из коробки стартует в SGLang-Omni и vLLM-Omni, я брал sglang.
Сразу съедает 23 GB VRAM, с дефолтными настройками - большой кеш под 64 запроса, стандартные параметры для h100.
Укручиваем батчинг, получаем 16 GB VRAM в простое, и 16.5 с одним юзером.
RTX 3090 24gb BF16
10 фраз по 5 раз синтеза
Важное уточнение - первый чанк в тестах был минимального размера в 1 фрейм, а это 40ms.
Кванты
Кванты не щупал, видел на hf GGUF, ссылки будут внизу.
Но есть теоретический расчет, где в целом базовые веса совпадают с реальностью, вероятно кванты тоже.
Базовые веса 7.6 GB (BF16, tied embeddings) + ~8 GB оверхед движка.
Текущая - 15-16 GB
FP8 weights + FP8 KV (4090) - 10 GB
NVFP4 weights (5090) - 7 GB
Все варианты поддерживает SGLang.
Тэги
Тут в целом как обычно, не все и не всегда работает.
Но точно можно управлять эмоциями и стилем - примеры будут в комментах.
Эффекты типо кашля и вздохов в целом работают, но мне показалось что через раз или не всегда выражено, вероятно зависят от референса.
Скорость речи вообще у меня никак не влияла на результат.
Заставить петь не получилось, хотя тег такой есть, выше был пример)
Дообучить
А вот с этим проблема, треин кода нет, есть остатки от v2 в chatml_dataset.py, что вероятно просто мусор.
Итог
Моделька кажется годная, по крайней мере среди остальных кажется самая масштабная по управлению речью и по железкам относительно норм.
HF:
https://huggingface.co/bosonai/higgs-tts-3-4b
vLLM:
https://github.com/vllm-project/vllm-omni/blob/main/recipes/BosonAI/Higgs-Audio-V3-TTS.md
SGLang:
https://sgl-project.github.io/sglang-omni/cookbook/higgs_tts.html
Кванты GGUF и реализация:
https://huggingface.co/NeemaShioSe/HiggsTTS3.gguf
https://github.com/Rafa00127/HiggsTTS.cpp
Интро
4B autoregressive decoder
sample rate 24 kHz
Higgs TTS 3 is built for voice chat: it speaks, not just reads. It turns model responses into expressive conversational speech across 100+ languages, with zero-shot voice cloning and inline control over emotion, style, prosody, pauses, and sound effects.
Звучит вкусно.
Токены для управления произношением <|category:value|>:
- эмоции - anger, amusement, и тд.
- стиль - singing, shouting, whispering
- звуковые эффекты - cough, laughter, sigh
- просодия - скорость (0.65-1.4x), паузы, pitch, выразительность
Запускаем
Из коробки стартует в SGLang-Omni и vLLM-Omni, я брал sglang.
Сразу съедает 23 GB VRAM, с дефолтными настройками - большой кеш под 64 запроса, стандартные параметры для h100.
Укручиваем батчинг, получаем 16 GB VRAM в простое, и 16.5 с одним юзером.
RTX 3090 24gb BF16
10 фраз по 5 раз синтеза
# Full audio
latency_s: mean=2.190 median=2.270 min=1.445 max=2.863
audio_dur_s: mean=5.19 median=5.36 min=3.20 max=6.88
RTF: mean=0.423 median=0.420 min=0.403 max=0.465
xRT: mean=2.4×
# Streaming
TTFA_s: mean=0.252 median=0.251 min=0.233 max=0.278
total_s: mean=2.237 median=2.291 min=1.424 max=3.033
RTF: mean=0.429
Важное уточнение - первый чанк в тестах был минимального размера в 1 фрейм, а это 40ms.
Кванты
Кванты не щупал, видел на hf GGUF, ссылки будут внизу.
Но есть теоретический расчет, где в целом базовые веса совпадают с реальностью, вероятно кванты тоже.
Базовые веса 7.6 GB (BF16, tied embeddings) + ~8 GB оверхед движка.
Текущая - 15-16 GB
FP8 weights + FP8 KV (4090) - 10 GB
NVFP4 weights (5090) - 7 GB
Все варианты поддерживает SGLang.
Тэги
Тут в целом как обычно, не все и не всегда работает.
Но точно можно управлять эмоциями и стилем - примеры будут в комментах.
Эффекты типо кашля и вздохов в целом работают, но мне показалось что через раз или не всегда выражено, вероятно зависят от референса.
Скорость речи вообще у меня никак не влияла на результат.
Заставить петь не получилось, хотя тег такой есть, выше был пример)
Дообучить
А вот с этим проблема, треин кода нет, есть остатки от v2 в chatml_dataset.py, что вероятно просто мусор.
Итог
Моделька кажется годная, по крайней мере среди остальных кажется самая масштабная по управлению речью и по железкам относительно норм.
HF:
https://huggingface.co/bosonai/higgs-tts-3-4b
vLLM:
https://github.com/vllm-project/vllm-omni/blob/main/recipes/BosonAI/Higgs-Audio-V3-TTS.md
SGLang:
https://sgl-project.github.io/sglang-omni/cookbook/higgs_tts.html
Кванты GGUF и реализация:
https://huggingface.co/NeemaShioSe/HiggsTTS3.gguf
https://github.com/Rafa00127/HiggsTTS.cpp
❤3🔥1
почему то доставка и платежка не подгружается 😅
https://openai.com/ru-RU/supply/co-lab/work-louder/
https://openai.com/ru-RU/supply/co-lab/work-louder/
😁6
vc.ru - ВСЁ !!1!
Как всем известно тг не имеет органики почти, поэтому у меня есть клон канала на vc.ru, чтобы канал хоть как-то рос снаружи.
Сегодня с утра закинул пост с higgs tts.
И поймал вот такую плашку.
Видимо ссылки на тг в постах это уже сервис, услуга, коммерция, хотят 39к в месяц.
Линк на блог вот:
https://vc.ru/id4918115
Подписываться можно не нужно, ибо он вероятно мертв.
Написал в поддержку, посмотрим что ответят, из альтернатив вижу только идти в тиктоки танцевать🕺
Как всем известно тг не имеет органики почти, поэтому у меня есть клон канала на vc.ru, чтобы канал хоть как-то рос снаружи.
Сегодня с утра закинул пост с higgs tts.
И поймал вот такую плашку.
Видимо ссылки на тг в постах это уже сервис, услуга, коммерция, хотят 39к в месяц.
Линк на блог вот:
https://vc.ru/id4918115
Подписываться можно не нужно, ибо он вероятно мертв.
Написал в поддержку, посмотрим что ответят, из альтернатив вижу только идти в тиктоки танцевать
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔4😁2😢1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁8🔥5❤1🤔1
А что если...
Берем дота реп
Аниме
VRM модельку
Немного mixamo
И сверху немного токенов
Берем дота реп
Аниме
VRM модельку
Немного mixamo
И сверху немного токенов
Media is too big
VIEW IN TELEGRAM
❤3🔥1😭1
Media is too big
VIEW IN TELEGRAM
Вчера codex сбросил лимиты, я сжег еще 30% от подписки за 100 баксов, тиктоки все ближе
😁2
За пределами коммерции, вот где нет вот этой корпоративной духоты - существует пласт проектов так называемых "Нейро девушка/тян/вайфу".
Начали набирать популярность они примерно с релиза ChatGPT, напомню он был 30 ноября 2022 года.
Походить на человека стало гораздо проще и доступнее.
А сейчас с прогрессом и популярностью нейронок, не только текстовых, но и картинки, видео, звук - обычный человек и не заметит разницы, если так задумано авторами.
Да даже кто с этим работает постоянно уже может не заметить (пример будет ниже, в разделе NSFW, который мы чатом с друзьями не сразу распознали, хотя все обвязаны нейронками, агентами и тд).
А пока в качестве пруфа ссылка на старый опрос:
https://t.me/xVibeNot/60
Что там делают в итоге
Я бы разделил на 4 вида такие проекты:
Личный друг, девушка, персонаж
Это то что дали всем chatacter.ai и silly tavern.
Изначально обычный чат, можешь создать персонажа или взять готового, у него своя карточка, есть библиотеки карточек. Карточка персонажа по сути набор промптов, инструкций с описанием характера, поведения и тд.
Отдельно прикручивают abliterated модельки, это те которым сломали фильтры цензуры, либо же используют специальные файнтюны на всяких фанфиках и прочем.
Сюда бы еще отнес различных тг ботов, как просто про общения, так и с nsfw механиками (обычно генерация артов).
Один из интересных вариантов будет в ссылках.
Стримеры
Тут самый заметный представитель - Neuro-sama и ее создатель vedal.
Сейчас они топ 3 по пиковым оплаченным подпискам, в январе собрали под евент.
В общем топе 407 место в мире (по всем языкам).
Конкретно у нейросамы много инженерии, разные кастомные нейронки, адаптеры к играм и все работает в реалтайме, или выглядит так что в реалтайме.
Обычно такие стримеры представлены в паре: создатель + нейро.
Ведут стримы, развлекают кожаных, поют песни, чат общается с нейро.
Модельки чаще локальные на личном железе, часто файнтюны на своеобразное поведение.
Есть так же и представители среди ру стримеров, некоторые тут в чатике сидят)
Приложения
Главный представитель конечно - Ani от grok (x.ai).
Конечно там есть еще мужской персонаж и красная панда, но мы то понимаем что они существуют для галочки 😏
Тут мы подходим ближе к nsfw.
Суть примерно такая, общайся, делай комплименты Ani, поднимаешь уровень общения/близости - тебе разрешают ее переодеть в чуть более откровенный наряд, и реплики смещаются в ту же сторону.
На последних уровнях (их вроде 10 было) творится совсем мрак (или нет), от обычных тем она быстро уходит в сторону nsfw.
Тут если честно я не особо видел подобных реализаций, но собирал свою, правда с live2d моделькой - видосик будет в комментах.
Пока собирал понял почему не видел других реализаций, нужно много инференса для реалтайма и массового пользователя.
NSWF
Тут все достаточно просто и много ручного труда🙂
Видео генерация для инсты и тиктоков, обычно Comfy пайплайны.
Ссылка в профиле ведет заинтересованных в 2 места, для ру это тг, для международного рынка на fanvue.com
Почему не онлик? Потому что онлик странно себя ведет с AI контентом, часто банит.
Фанвью как раз место для AI-ных, и с одной стороны кажется что тогда там не будет подписчиков, но нет, это никого не останавливает.
Тут мало ai, ну точнее он есть, для генерации видео, фото, а так же голосовых сообщений, но это все делается вручную, подгоняется, полируется и тд.
А для переписок (чтобы греть гоев) взяты лучшие практики онлифанса - нанимают отдельных людей за дешево, чтобы они общались в чате.
Из полезного тут - civitai.com и civitai.red
З.Ы.
Ничего кстати не мешает из вашего опенкло/гермеса сделать подобное.
Закинуть в SOUL.md инструкций, дать тул на генерацию фото, видео, голоса, и слить всю зп на оплату api и подписок.
У гермеса есть даже пресеты на всякие кавайные стили ответа.
Во всех кейсах выше часто используются опенсорсные нейронки, а местами только их и получится использовать, ибо цензура, фильтры и тд.
Ставь 🔥 если не знал
Ставь ⭐️ если уже знал и скипнул пост)
Чаты:
https://character.ai/
https://github.com/sillytavern/SillyTavern
Пример тг бота:
https://github.com/alex2772/kuni
t.me/kunii_chan - работает под юзер аккаунтом
Нейросама:
https://www.twitch.tv/vedal987
Фото и видео:
https://civitai.com/
NSFW фото и видео:
https://civitai.red/
NSFW AI тг канал:
https://t.me/zolokriss
https://t.me/zolokriss/138 - тут палится, ломается нога в середине ролика
Начали набирать популярность они примерно с релиза ChatGPT, напомню он был 30 ноября 2022 года.
Походить на человека стало гораздо проще и доступнее.
А сейчас с прогрессом и популярностью нейронок, не только текстовых, но и картинки, видео, звук - обычный человек и не заметит разницы, если так задумано авторами.
Да даже кто с этим работает постоянно уже может не заметить (пример будет ниже, в разделе NSFW, который мы чатом с друзьями не сразу распознали, хотя все обвязаны нейронками, агентами и тд).
А пока в качестве пруфа ссылка на старый опрос:
https://t.me/xVibeNot/60
Что там делают в итоге
Я бы разделил на 4 вида такие проекты:
Личный друг, девушка, персонаж
Это то что дали всем chatacter.ai и silly tavern.
Изначально обычный чат, можешь создать персонажа или взять готового, у него своя карточка, есть библиотеки карточек. Карточка персонажа по сути набор промптов, инструкций с описанием характера, поведения и тд.
Отдельно прикручивают abliterated модельки, это те которым сломали фильтры цензуры, либо же используют специальные файнтюны на всяких фанфиках и прочем.
Сюда бы еще отнес различных тг ботов, как просто про общения, так и с nsfw механиками (обычно генерация артов).
Один из интересных вариантов будет в ссылках.
Стримеры
Тут самый заметный представитель - Neuro-sama и ее создатель vedal.
Сейчас они топ 3 по пиковым оплаченным подпискам, в январе собрали под евент.
В общем топе 407 место в мире (по всем языкам).
Конкретно у нейросамы много инженерии, разные кастомные нейронки, адаптеры к играм и все работает в реалтайме, или выглядит так что в реалтайме.
Обычно такие стримеры представлены в паре: создатель + нейро.
Ведут стримы, развлекают кожаных, поют песни, чат общается с нейро.
Модельки чаще локальные на личном железе, часто файнтюны на своеобразное поведение.
Есть так же и представители среди ру стримеров, некоторые тут в чатике сидят)
Приложения
Главный представитель конечно - Ani от grok (x.ai).
Конечно там есть еще мужской персонаж и красная панда, но мы то понимаем что они существуют для галочки 😏
Тут мы подходим ближе к nsfw.
Суть примерно такая, общайся, делай комплименты Ani, поднимаешь уровень общения/близости - тебе разрешают ее переодеть в чуть более откровенный наряд, и реплики смещаются в ту же сторону.
На последних уровнях (их вроде 10 было) творится совсем мрак (или нет), от обычных тем она быстро уходит в сторону nsfw.
Тут если честно я не особо видел подобных реализаций, но собирал свою, правда с live2d моделькой - видосик будет в комментах.
Пока собирал понял почему не видел других реализаций, нужно много инференса для реалтайма и массового пользователя.
NSWF
Тут все достаточно просто и много ручного труда
Видео генерация для инсты и тиктоков, обычно Comfy пайплайны.
Ссылка в профиле ведет заинтересованных в 2 места, для ру это тг, для международного рынка на fanvue.com
Почему не онлик? Потому что онлик странно себя ведет с AI контентом, часто банит.
Фанвью как раз место для AI-ных, и с одной стороны кажется что тогда там не будет подписчиков, но нет, это никого не останавливает.
Тут мало ai, ну точнее он есть, для генерации видео, фото, а так же голосовых сообщений, но это все делается вручную, подгоняется, полируется и тд.
А для переписок (чтобы греть гоев) взяты лучшие практики онлифанса - нанимают отдельных людей за дешево, чтобы они общались в чате.
Из полезного тут - civitai.com и civitai.red
З.Ы.
Ничего кстати не мешает из вашего опенкло/гермеса сделать подобное.
Закинуть в SOUL.md инструкций, дать тул на генерацию фото, видео, голоса, и слить всю зп на оплату api и подписок.
У гермеса есть даже пресеты на всякие кавайные стили ответа.
Во всех кейсах выше часто используются опенсорсные нейронки, а местами только их и получится использовать, ибо цензура, фильтры и тд.
Ставь 🔥 если не знал
Ставь ⭐️ если уже знал и скипнул пост)
Чаты:
https://character.ai/
https://github.com/sillytavern/SillyTavern
Пример тг бота:
https://github.com/alex2772/kuni
t.me/kunii_chan - работает под юзер аккаунтом
Нейросама:
https://www.twitch.tv/vedal987
Фото и видео:
https://civitai.com/
NSFW фото и видео:
https://civitai.red/
NSFW AI тг канал:
https://t.me/zolokriss
https://t.me/zolokriss/138 - тут палится, ломается нога в середине ролика
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥7👍2🍓2❤1🌭1🍌1👀1
Кодех
Пересел на кодекс 3 недели назад с курсора.
На курсоре сидел чисто из-за одной фичи, ssh remote, удобно подключиться к runpod и там что-нибудь гонять агентом, при этом видеть все артефакты.
Ну ладно, еще из-за одной, rules - эт те штуки, что подключаются только при работе с определенным видом файла.
Ресеты
Тут сыграло еще FOMO, ведь с весны кодекс начал хайповать своими ресетами.
Но фомо прошло, потому что за 2 недели было 6 ресетов:
19.07
21.07
26.07
28.07
29.07
1.08
У меня тариф за 100, брал за 20, за вечер сжег 90% (сначала подумал что сжег 10% и обрадовался), на следующий день прогрейдил до 100, думал будет не хватать.
За вечер сжигаю где-то 20-30%, на выходных 30-40% за день.
Но чисто на ресетах пока хватает.
Отличия
Раньше сидел на опусе в курсоре, заметил пару отличий.
Фронтенд
Кодекс с этим хуже справляется, надо лишний раз пинать, смотреть что пишет не надо конечно же, прост лишний раз пнуть чтоб перепроверил. Иногда кинуть скриншотом и сказать тут криво.
Следование инструкциям
GPT-Sol сильнее следует инструкциям, а я привык к опусу - это больно регулярно.
Опус больше отталкивается от контекста и задачи, сам (обычно правильно) додумывает что надо.
Кодекс часто идет по правилам, сказано нельзя - значит нельзя и его не волнует что он прочитал это в скилле, который для текущей задачи не используется, но был пару итераций выше.
Генерация картинок
А это плюс, для всяких пайплайнов, для блогов и подобного, он сам вполне успешно сгенерирует всякие og-image, у курсора генерации были хуже, хотя я даже не знаю чем курсор их генерит, но генерит.
Нативный ремоут мод
Это когда ты оставляешь включенный пк, уходишь трогать траву, но продолжаешь вайбкодить с телефона, потому что у тебя шиза, надо дожечь лимиты и фомо когда агенты простаивают.
Хотя кому я вру, выходить из дома, что?
Сетап
Юзаю через их десктоп апку (тут можно подраться с терминальщиками), потому что лень поднимать терминалы каждый раз с нуля, а решение какое-то для лечения этого лень ставить. Хотя вроде neuraldeep недавно что-то делал для такого, но эт не точно, возможно видел в другом месте.
И куда же без костылей, ведь я все еще сижу на win + wsl.
В целом апка нативно переключается на режим агентов в wsl, а не в винде, но при этом отваливается часть фишек. Главная из них - нативный worktree в десктоп апке.
Итог
Мне пока нравится, но wsl все больнее и больнее, надо уезжать на линух.
Factorio и там есть, а что еще надо)
Пересел на кодекс 3 недели назад с курсора.
На курсоре сидел чисто из-за одной фичи, ssh remote, удобно подключиться к runpod и там что-нибудь гонять агентом, при этом видеть все артефакты.
Ну ладно, еще из-за одной, rules - эт те штуки, что подключаются только при работе с определенным видом файла.
Ресеты
Тут сыграло еще FOMO, ведь с весны кодекс начал хайповать своими ресетами.
Но фомо прошло, потому что за 2 недели было 6 ресетов:
19.07
21.07
26.07
28.07
29.07
1.08
У меня тариф за 100, брал за 20, за вечер сжег 90% (сначала подумал что сжег 10% и обрадовался), на следующий день прогрейдил до 100, думал будет не хватать.
За вечер сжигаю где-то 20-30%, на выходных 30-40% за день.
Но чисто на ресетах пока хватает.
Отличия
Раньше сидел на опусе в курсоре, заметил пару отличий.
Фронтенд
Кодекс с этим хуже справляется, надо лишний раз пинать, смотреть что пишет не надо конечно же, прост лишний раз пнуть чтоб перепроверил. Иногда кинуть скриншотом и сказать тут криво.
Следование инструкциям
GPT-Sol сильнее следует инструкциям, а я привык к опусу - это больно регулярно.
Опус больше отталкивается от контекста и задачи, сам (обычно правильно) додумывает что надо.
Кодекс часто идет по правилам, сказано нельзя - значит нельзя и его не волнует что он прочитал это в скилле, который для текущей задачи не используется, но был пару итераций выше.
Генерация картинок
А это плюс, для всяких пайплайнов, для блогов и подобного, он сам вполне успешно сгенерирует всякие og-image, у курсора генерации были хуже, хотя я даже не знаю чем курсор их генерит, но генерит.
Нативный ремоут мод
Это когда ты оставляешь включенный пк, уходишь трогать траву, но продолжаешь вайбкодить с телефона, потому что у тебя шиза, надо дожечь лимиты и фомо когда агенты простаивают.
Хотя кому я вру, выходить из дома, что?
Сетап
Юзаю через их десктоп апку (тут можно подраться с терминальщиками), потому что лень поднимать терминалы каждый раз с нуля, а решение какое-то для лечения этого лень ставить. Хотя вроде neuraldeep недавно что-то делал для такого, но эт не точно, возможно видел в другом месте.
И куда же без костылей, ведь я все еще сижу на win + wsl.
В целом апка нативно переключается на режим агентов в wsl, а не в винде, но при этом отваливается часть фишек. Главная из них - нативный worktree в десктоп апке.
Итог
Мне пока нравится, но wsl все больнее и больнее, надо уезжать на линух.
Factorio и там есть, а что еще надо)
4🔥10😁3❤1👍1
TeraTTSv2
Маленькая моделька, без клона, с поддержкой ударений
Заводится на CPU
HF:
https://huggingface.co/TeraSpace/TeraTTSv2
HF демка:
https://huggingface.co/spaces/TeraTTS/TTS
Автор:
https://t.me/teraspace_news
Маленькая моделька, без клона, с поддержкой ударений
Заводится на CPU
HF:
https://huggingface.co/TeraSpace/TeraTTSv2
HF демка:
https://huggingface.co/spaces/TeraTTS/TTS
Автор:
https://t.me/teraspace_news
1❤5