VF | Science 2
68 subscribers
88 photos
17 videos
4 files
24 links
Немного о себе, изучаю nlp интересуюсь audio и дизайном.
Из увлечений баскетбол, ювилирия, фотографии, песни и стихи)
Веду стартап для чтения тайтлов


на видеокарту https://pay.cloudtips.ru/p/a550b36f
Автор: @VF_danil
Download Telegram
уже рутиной скоро будет, второй раз пойду на янг кон
🔥2
Ну, уже есть прогресс: кодовая книга постепенно адаптируется. Для аудио с речью модели требуется заметно меньше токенов, а шум, наоборот, требует большей ёмкости кодбука. Получается, что латентное пространство для шума менее стабильное, а речь — более структурированная, компактная и повторяемая.
Сейчас я пытаюсь сделать модель, которая будет не искать отдельно речь и музыку, а изначально считать речь самой важной частью сигнала и автоматически игнорировать всё остальное: шумы, музыку, фон и т.д.
Идея в том, чтобы модель сама училась speech-centric representation (представление, ориентированное на речь) когда почти вся ёмкость latent space уходит именно в речь, а шум кодируется очень грубо или почти игнорируется.
Если это нормально заработает, то для обучения tts/asr моделей больше не понадобится долго подготавливать датасеты: чистить аудио, делать шумоподавление и вручную фильтровать шумы. Можно будет просто брать сырые стримы, подкасты или видео и напрямую обучать модели на необработанной речи.
Обучаю модель понимать мир гитары хы)

Похожие музыкальные фрагменты начинают собираться рядом в латентном пространстве.
Модель ещё не знает аккорды и ноты. Она учится находить музыкальную структуру внутри аудио.

теперь надо превратить latent space в музыкальные токены через VQ VAE.
Существует X видео о ML/DS.
-Я не нашел норм гайда, сделаю свой!
Существует X+1 видео о ML/DS.
ахахах баян но смешной баян.
This media is not supported in your browser
VIEW IN TELEGRAM
Вот почему нет постов. Ну на деле я проектом занят не по ml
куда мы летим вопрос. 700 запросов за 10 секунд...
OpenWeb — Open-Source MCP-сервер для полноценного управления Chrome, Firefox и Edge силами AI-агентов.

Если вы пишите автоматизацию или используете автономных агентов, вы знаете, как быстро ломаются скрипты на Puppeteer/Playwright при малейшем изменении верстки.

OpenWeb решает эту проблему на уровне архитектуры:

Accessibility-Native: Работа через дерево доступности вместо DOM. ИИ видит страницу глазами незрячего пользователя (только семантика), что гарантирует 100% стабильность работы.
Hybrid CDP/OS Clicks: Эмуляция реальных физических действий для обхода хитрых JS-перехватчиков событий и работы с Canvas/WebGL.
Security scan & Audits: Локальный запуск аудитов безопасности (CSP, CORS, XSS), SEO-оптимизации, битых ссылок и Core Web Vitals силами ИИ-агента.
Load-Aware Routing: Автоматическая балансировка нагрузки (Round-Robin) между несколькими активными вкладками/расширениями.

Может полностью автономно работать, выполняет любые поручения в вашем браузере

⭐️ Исходный код и документация на GitHub: github.com/QWKiks/openweb

Автор @SABIR_DZH
Я это все в одном
2
This media is not supported in your browser
VIEW IN TELEGRAM
1
Работаем на ВДНХ
Не успел насладиться
еще посидим еще посидим) поддержка яндекса тупо 20 мин смотрит на сообщение и молчит.
1
VF | Science 2
уже рутиной скоро будет, второй раз пойду на янг кон
Вот думаю, ехать или нет, потому что Яндекс, как обычно, находится в 7 км от станции метро) или в 20 минутах пешком от 1-го диаметра... (А до того еще 2 часа надо ехать)
Хвхв вот это мем)))