sample_G28000.wav
248.1 KB
после 6 часов обучения на RTX PRO 4000
6 эпох. поставил еще 10 думаю что то уже будет по окончанию.
6 эпох. поставил еще 10 думаю что то уже будет по окончанию.
🤗1
Вчера ездил на Святую ручку, горный хребет, где много источников, красивые горы, и... енот? Вообще там кого только нет, даже павлин был) Батюшка там водой меня обрызгал, хаха. Хороший день был. А еще я не туда пошел и поднялся на самый верх горы, почти, но источника не нашел, а оказывается, я не туда свернул. Хы 😗
совсем скоро запускаю сервис для озвучки и переозвучки видео на основе своей tts
совсем скоро запускаю сервис для озвучки и переозвучки видео на основе своей tts
VF | Science 2
Пу пи пу, получаем опыт на хакатоне. Название команды — это искусство.
А меня не взяли, хы)
1. У хакатона упал сайт, данные потеряли.
2. В спешке опять надо было писать большую идею.
3. Отбор проходит чисто по описанию идеи, что для меня странно.
4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт, но да ладно, там такой себе хакатон.
1. У хакатона упал сайт, данные потеряли.
2. В спешке опять надо было писать большую идею.
3. Отбор проходит чисто по описанию идеи, что для меня странно.
4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт, но да ладно, там такой себе хакатон.
👍1
VF | Science 2
А меня не взяли, хы) 1. У хакатона упал сайт, данные потеряли. 2. В спешке опять надо было писать большую идею. 3. Отбор проходит чисто по описанию идеи, что для меня странно. 4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт…
1 битка так как у них серверов нет стоит процессор только
Ну, уже есть прогресс: кодовая книга постепенно адаптируется. Для аудио с речью модели требуется заметно меньше токенов, а шум, наоборот, требует большей ёмкости кодбука. Получается, что латентное пространство для шума менее стабильное, а речь — более структурированная, компактная и повторяемая.
Сейчас я пытаюсь сделать модель, которая будет не искать отдельно речь и музыку, а изначально считать речь самой важной частью сигнала и автоматически игнорировать всё остальное: шумы, музыку, фон и т.д.
Идея в том, чтобы модель сама училась speech-centric representation (представление, ориентированное на речь) когда почти вся ёмкость latent space уходит именно в речь, а шум кодируется очень грубо или почти игнорируется.
Если это нормально заработает, то для обучения tts/asr моделей больше не понадобится долго подготавливать датасеты: чистить аудио, делать шумоподавление и вручную фильтровать шумы. Можно будет просто брать сырые стримы, подкасты или видео и напрямую обучать модели на необработанной речи.
Сейчас я пытаюсь сделать модель, которая будет не искать отдельно речь и музыку, а изначально считать речь самой важной частью сигнала и автоматически игнорировать всё остальное: шумы, музыку, фон и т.д.
Идея в том, чтобы модель сама училась speech-centric representation (представление, ориентированное на речь) когда почти вся ёмкость latent space уходит именно в речь, а шум кодируется очень грубо или почти игнорируется.
Если это нормально заработает, то для обучения tts/asr моделей больше не понадобится долго подготавливать датасеты: чистить аудио, делать шумоподавление и вручную фильтровать шумы. Можно будет просто брать сырые стримы, подкасты или видео и напрямую обучать модели на необработанной речи.
Существует X видео о ML/DS.
-Я не нашел норм гайда, сделаю свой!
Существует X+1 видео о ML/DS.
ахахах баян но смешной баян.
-Я не нашел норм гайда, сделаю свой!
Существует X+1 видео о ML/DS.
ахахах баян но смешной баян.
This media is not supported in your browser
VIEW IN TELEGRAM
Вот почему нет постов. Ну на деле я проектом занят не по ml
OpenWeb — Open-Source MCP-сервер для полноценного управления Chrome, Firefox и Edge силами AI-агентов.
Если вы пишите автоматизацию или используете автономных агентов, вы знаете, как быстро ломаются скрипты на Puppeteer/Playwright при малейшем изменении верстки.
OpenWeb решает эту проблему на уровне архитектуры:
Accessibility-Native: Работа через дерево доступности вместо DOM. ИИ видит страницу глазами незрячего пользователя (только семантика), что гарантирует 100% стабильность работы.
Hybrid CDP/OS Clicks: Эмуляция реальных физических действий для обхода хитрых JS-перехватчиков событий и работы с Canvas/WebGL.
Security scan & Audits: Локальный запуск аудитов безопасности (CSP, CORS, XSS), SEO-оптимизации, битых ссылок и Core Web Vitals силами ИИ-агента.
Load-Aware Routing: Автоматическая балансировка нагрузки (Round-Robin) между несколькими активными вкладками/расширениями.
Может полностью автономно работать, выполняет любые поручения в вашем браузере
⭐️ Исходный код и документация на GitHub: github.com/QWKiks/openweb
Автор @SABIR_DZH
Если вы пишите автоматизацию или используете автономных агентов, вы знаете, как быстро ломаются скрипты на Puppeteer/Playwright при малейшем изменении верстки.
OpenWeb решает эту проблему на уровне архитектуры:
Accessibility-Native: Работа через дерево доступности вместо DOM. ИИ видит страницу глазами незрячего пользователя (только семантика), что гарантирует 100% стабильность работы.
Hybrid CDP/OS Clicks: Эмуляция реальных физических действий для обхода хитрых JS-перехватчиков событий и работы с Canvas/WebGL.
Security scan & Audits: Локальный запуск аудитов безопасности (CSP, CORS, XSS), SEO-оптимизации, битых ссылок и Core Web Vitals силами ИИ-агента.
Load-Aware Routing: Автоматическая балансировка нагрузки (Round-Robin) между несколькими активными вкладками/расширениями.
Может полностью автономно работать, выполняет любые поручения в вашем браузере
⭐️ Исходный код и документация на GitHub: github.com/QWKiks/openweb
Автор @SABIR_DZH
GitHub
GitHub - QWKiks/openweb: Open-source browser automation for AI agents. Control Chrome from Claude Code, Cursor, Windsurf, OpenCode…
Open-source browser automation for AI agents. Control Chrome from Claude Code, Cursor, Windsurf, OpenCode, or any MCP-compatible tool. - QWKiks/openweb