VF | Science 2
68 subscribers
88 photos
17 videos
4 files
24 links
Немного о себе, изучаю nlp интересуюсь audio и дизайном.
Из увлечений баскетбол, ювилирия, фотографии, песни и стихи)
Веду стартап для чтения тайтлов


на видеокарту https://pay.cloudtips.ru/p/a550b36f
Автор: @VF_danil
Download Telegram
С 9 мая всех!
31 мая я в Москве, обещаю, будет много контента с конференций.
🌭1
sample_G28000.wav
248.1 KB
после 6 часов обучения на RTX PRO 4000

6 эпох. поставил еще 10 думаю что то уже будет по окончанию.
🤗1
Вчера ездил на Святую ручку, горный хребет, где много источников, красивые горы, и... енот? Вообще там кого только нет, даже павлин был) Батюшка там водой меня обрызгал, хаха. Хороший день был. А еще я не туда пошел и поднялся на самый верх горы, почти, но источника не нашел, а оказывается, я не туда свернул. Хы 😗

совсем скоро запускаю сервис для озвучки и переозвучки видео на основе своей tts
VF | Science 2
Пу пи пу, получаем опыт на хакатоне. Название команды — это искусство.
А меня не взяли, хы)
1. У хакатона упал сайт, данные потеряли.
2. В спешке опять надо было писать большую идею.
3. Отбор проходит чисто по описанию идеи, что для меня странно.
4. Я им сделал такую офигенную идею: я делал 1 битку, у которой был неплохой винтрейт, но да ладно, там такой себе хакатон.
👍1
учим матан вместе с чат гпт)
уже рутиной скоро будет, второй раз пойду на янг кон
🔥2
Ну, уже есть прогресс: кодовая книга постепенно адаптируется. Для аудио с речью модели требуется заметно меньше токенов, а шум, наоборот, требует большей ёмкости кодбука. Получается, что латентное пространство для шума менее стабильное, а речь — более структурированная, компактная и повторяемая.
Сейчас я пытаюсь сделать модель, которая будет не искать отдельно речь и музыку, а изначально считать речь самой важной частью сигнала и автоматически игнорировать всё остальное: шумы, музыку, фон и т.д.
Идея в том, чтобы модель сама училась speech-centric representation (представление, ориентированное на речь) когда почти вся ёмкость latent space уходит именно в речь, а шум кодируется очень грубо или почти игнорируется.
Если это нормально заработает, то для обучения tts/asr моделей больше не понадобится долго подготавливать датасеты: чистить аудио, делать шумоподавление и вручную фильтровать шумы. Можно будет просто брать сырые стримы, подкасты или видео и напрямую обучать модели на необработанной речи.
Обучаю модель понимать мир гитары хы)

Похожие музыкальные фрагменты начинают собираться рядом в латентном пространстве.
Модель ещё не знает аккорды и ноты. Она учится находить музыкальную структуру внутри аудио.

теперь надо превратить latent space в музыкальные токены через VQ VAE.
Существует X видео о ML/DS.
-Я не нашел норм гайда, сделаю свой!
Существует X+1 видео о ML/DS.
ахахах баян но смешной баян.
This media is not supported in your browser
VIEW IN TELEGRAM
Вот почему нет постов. Ну на деле я проектом занят не по ml
куда мы летим вопрос. 700 запросов за 10 секунд...
OpenWeb — Open-Source MCP-сервер для полноценного управления Chrome, Firefox и Edge силами AI-агентов.

Если вы пишите автоматизацию или используете автономных агентов, вы знаете, как быстро ломаются скрипты на Puppeteer/Playwright при малейшем изменении верстки.

OpenWeb решает эту проблему на уровне архитектуры:

Accessibility-Native: Работа через дерево доступности вместо DOM. ИИ видит страницу глазами незрячего пользователя (только семантика), что гарантирует 100% стабильность работы.
Hybrid CDP/OS Clicks: Эмуляция реальных физических действий для обхода хитрых JS-перехватчиков событий и работы с Canvas/WebGL.
Security scan & Audits: Локальный запуск аудитов безопасности (CSP, CORS, XSS), SEO-оптимизации, битых ссылок и Core Web Vitals силами ИИ-агента.
Load-Aware Routing: Автоматическая балансировка нагрузки (Round-Robin) между несколькими активными вкладками/расширениями.

Может полностью автономно работать, выполняет любые поручения в вашем браузере

⭐️ Исходный код и документация на GitHub: github.com/QWKiks/openweb

Автор @SABIR_DZH
Я это все в одном
2
This media is not supported in your browser
VIEW IN TELEGRAM
1
Работаем на ВДНХ