VF | Science 2
68 subscribers
88 photos
17 videos
4 files
24 links
Немного о себе, изучаю nlp интересуюсь audio и дизайном.
Из увлечений баскетбол, ювилирия, фотографии, песни и стихи)
Веду стартап для чтения тайтлов


на видеокарту https://pay.cloudtips.ru/p/a550b36f
Автор: @VF_danil
Download Telegram
Почему бы мне не попробовать стать тем самым «иркутским школьником»?

Последние дни я углублённо изучаю работу компьютера и создаю собственную материнскую плату.
(Пока чертеж.) Покумекал и принял решение создать 3D AI-ассистента на основе своего синтеза речи и LLM, которую я также недавно обучил. (Дообучать буду точно, а может вообще забью на нее и подключу локально готовую LLM.) Этот чудо-механизм будет работать на деталях из фото.

Для работы этой шайтан-машины надо будет сделать это⬇️

1. Перепрошить устройство.
2. Добавить множество голосов. (Их уже около 20.)
3. Поднять сервер для всего в целом.
4. Настроить голограмму.

Голограмму я создаю самостоятельно) А ну-ка все реакции поставили, я тут стараюсь) 🔥
P. S.: возможно, я сделаю розыгрыш на это чудо изобретение
Буду рад если поделитесь постом
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥3💩3🔥1🌚1
пост знакомство спустя год 🌷

Меня зовут Данил Варфоломеев, мне 15 лет. Около года в сфере IT, изучаю NLP/audio и компьютерную инженерию. сейчас делаю собственную материнскую плату.

Мои увлечения: баскетбол, ювелирия, дизайн, а также написание стихов и песен. было бы славно посещать конференции ежедневно, но я был лишь на одной из них летом. (этим летом точно схожу на парочку)

Ранее была попытка запустить стартап, анимации и озвучки манги. На пике проект ежемесячно посещали около 600 пользователей, но я так и не заработал)

из целей создать сильное сообщество и развивать связи. Если у вас возникнут вопросы по машинному обучению или дизайну, добро пожаловать в личные сообщения. Не гарантирую успешное решение, но постараюсь помочь. 🤝

vq vae кажется наследие) мне очень зашла эта тема брат тоже изучал ее углубленно. 🍷
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
VF | Science 2
Photo
Детали заказал.
Метро Люблино работаем)))
релизим датасет (аниме речь) на 135 часов речи
Частота: 48 кГц
Формат: opus 48kbps
Сегменты: 1-25 секунд
мужские голоса (75.83 часов)
женские голоса (57.41 часов)
(в научных целях разумеется)

сбор был выполнен с использованием⬇️
Удаление фоновой музыки - ClearerVoice-studio speech enhancment
Разделение кто где говорит - https://github.com/BUTSpeechFIT/DiariZen
Перевод речи в текст - GigaAM3-E2E-RNNT
pyannote vad
автор

поддержать https://pay.cloudtips.ru/p/a550b36f
👍3🔥2❤‍🔥1👀1
VF | Science 2 pinned «релизим датасет (аниме речь) на 135 часов речи Частота: 48 кГц Формат: opus 48kbps Сегменты: 1-25 секунд мужские голоса (75.83 часов) женские голоса (57.41 часов) (в научных целях разумеется) сбор был выполнен с использованием⬇️ Удаление фоновой музыки…»
Пу пи пу, получаем опыт на хакатоне. Название команды — это искусство.
2
VF | Science 2
победа?
Сегодня много постов, но я уже не могу. Я пять часов настраиваю это! Кракозябры мне будут сниться. ПОЧЕМУ НЕ СОВПАДАЕТ СКОРОСТЬ???????
🌚1
пов указал навыки в It
😁1
Мне очень понравилось изучать сжатие данных, давайте разложим автоэнкодер. Объясняю на примере картинки и аудио.

Энкодер, или сжатие. Берём исходные данные например изображение. Прогоняем его через свёрточную нейросеть, потому что она лучше всего работает с картинками. На выходе получаем тензор. Повторяем операцию свёртка - тензор несколько раз, пока не останутся только самые важные, абстрактные признаки объекта. Для аудио принцип тот же, но вместо свёрточной сети чаще используют рекуррентные сети. Аудиодорожка разбивается на фрагменты, каждый прогоняется через сеть, и в итоге мы получаем сжатое представление звука - набор ключевых характеристик, например тембр, громкость или частотные паттерны.

Декодер, или восстановление. Теперь берём этот сжатый тензор и делаем обратные операции. Важный момент: энкодер и декодер не обязаны быть симметричными. Декодер может иметь другую архитектуру, больше слоёв или наоборот, меньше. Для изображения это обычно транспонированные свёртки, которые постепенно возвращают картинке детали, но их количество и порядок не обязаны зеркально отражать энкодер. Для аудио обратные преобразования, тоже с возможной другой структурой.

Это и есть автоэнкодер. Любой тип данных, который можно представить в виде вектора или тензора, можно сжать и восстановить.
(к слову, я наконец-то разобрался в теме достаточно хорошо, чтобы меня разбудили в 3 ночи, спросили, что такое автоэнкодер? а я такой мол, это бла бла бла и правильно объяснил.
🔥1🗿1🆒1
This media is not supported in your browser
VIEW IN TELEGRAM
🔥1