VF | Science 2
Какая красота! Я поднял LLM локально, передаю данные по Wi-Fi на ESP, ответы моментальные. Сегодня придёт буст-конвертер и преобразователь звука, и всё будет готово. Также увеличу память ESP: сегодня подключу SD-карту на 2 ГБ.
йа сломал 5V пин и доставил себе достаточно много трудностей) Теперь мне надо искать место, куда вели контакты, и напрямую паять.
VF | Science 2
йа сломал 5V пин и доставил себе достаточно много трудностей) Теперь мне надо искать место, куда вели контакты, и напрямую паять.
короче, я когда паял случайно перепаял так, что у меня железное окантовка отпала вместе с припоем)
ps; медная*
изменено; у меня он заработал!!!!! я не спалил его себе все же
ps; медная*
изменено; у меня он заработал!!!!! я не спалил его себе все же
VF | Science 2
Пу пи пу, получаем опыт на хакатоне. Название команды — это искусство.
чтож, я все продумал и мне нужно 2 человека в команду (можно даже в афк постоять) @VF_danil напишите кто хочет в команду круглого тензора 😚
VF | Science 2
Припаял, всё работает. Кстати, а пайка очень даже расслабляет
Ах, я чуть не спалил себе хату, хы) нечаянно припой упал и совместил 2 провода, ну и замыкание произошло, я там нафиг провод отрезал, ах-ха-ха, всё вроде в норме работает, но я уже боюсь заниматься этим
VF | Science 2
Пу пи пу, получаем опыт на хакатоне. Название команды — это искусство.
пу пи пу быстренько навайбкодил мою задумку вышло 71.9 процентов успешных сделок на брокер бирже. как думаете нормально? 🔥 да 👎 нет
уже 82
уже 82
🔥4👎3
VF | Science 2
релизим датасет (аниме речь) на 135 часов речи Частота: 48 кГц Формат: opus 48kbps Сегменты: 1-25 секунд мужские голоса (75.83 часов) женские голоса (57.41 часов) (в научных целях разумеется) сбор был выполнен с использованием⬇️ Удаление фоновой музыки…
Мою датку скачали уже 1 к раз ❤️
🔥1
sample_G28000.wav
248.1 KB
после 6 часов обучения на RTX PRO 4000
6 эпох. поставил еще 10 думаю что то уже будет по окончанию.
6 эпох. поставил еще 10 думаю что то уже будет по окончанию.
🤗1
Вчера ездил на Святую ручку, горный хребет, где много источников, красивые горы, и... енот? Вообще там кого только нет, даже павлин был) Батюшка там водой меня обрызгал, хаха. Хороший день был. А еще я не туда пошел и поднялся на самый верх горы, почти, но источника не нашел, а оказывается, я не туда свернул. Хы 😗
совсем скоро запускаю сервис для озвучки и переозвучки видео на основе своей tts
совсем скоро запускаю сервис для озвучки и переозвучки видео на основе своей tts
VF | Science 2
Пу пи пу, получаем опыт на хакатоне. Название команды — это искусство.
А меня не взяли, хы)
1. У хакатона упал сайт, данные потеряли.
2. В спешке опять надо было писать большую идею.
3. Отбор проходит чисто по описанию идеи, что для меня странно.
4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт, но да ладно, там такой себе хакатон.
1. У хакатона упал сайт, данные потеряли.
2. В спешке опять надо было писать большую идею.
3. Отбор проходит чисто по описанию идеи, что для меня странно.
4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт, но да ладно, там такой себе хакатон.
👍1
VF | Science 2
А меня не взяли, хы) 1. У хакатона упал сайт, данные потеряли. 2. В спешке опять надо было писать большую идею. 3. Отбор проходит чисто по описанию идеи, что для меня странно. 4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт…
1 битка так как у них серверов нет стоит процессор только
Ну, уже есть прогресс: кодовая книга постепенно адаптируется. Для аудио с речью модели требуется заметно меньше токенов, а шум, наоборот, требует большей ёмкости кодбука. Получается, что латентное пространство для шума менее стабильное, а речь — более структурированная, компактная и повторяемая.
Сейчас я пытаюсь сделать модель, которая будет не искать отдельно речь и музыку, а изначально считать речь самой важной частью сигнала и автоматически игнорировать всё остальное: шумы, музыку, фон и т.д.
Идея в том, чтобы модель сама училась speech-centric representation (представление, ориентированное на речь) когда почти вся ёмкость latent space уходит именно в речь, а шум кодируется очень грубо или почти игнорируется.
Если это нормально заработает, то для обучения tts/asr моделей больше не понадобится долго подготавливать датасеты: чистить аудио, делать шумоподавление и вручную фильтровать шумы. Можно будет просто брать сырые стримы, подкасты или видео и напрямую обучать модели на необработанной речи.
Сейчас я пытаюсь сделать модель, которая будет не искать отдельно речь и музыку, а изначально считать речь самой важной частью сигнала и автоматически игнорировать всё остальное: шумы, музыку, фон и т.д.
Идея в том, чтобы модель сама училась speech-centric representation (представление, ориентированное на речь) когда почти вся ёмкость latent space уходит именно в речь, а шум кодируется очень грубо или почти игнорируется.
Если это нормально заработает, то для обучения tts/asr моделей больше не понадобится долго подготавливать датасеты: чистить аудио, делать шумоподавление и вручную фильтровать шумы. Можно будет просто брать сырые стримы, подкасты или видео и напрямую обучать модели на необработанной речи.