Покращую бібліотеку для нормалізації текстів вже другий день.
Я її початково створив на С++ щоб перевірити те як працює pybind11 для створення python-розширень.
Із проблемних частин - це використання https://github.com/hanickadot/compile-time-regular-expressions який компілюється довго на Windows (2.5 години).
Codex який є великою мовною моделлю працює натурально в задачі перевірки нормалізованих речень щоб знайти крайові приклади, тому оця "доводка" до вигляду коли бібліотека працює стабільно на більшості вхідних речень, потребує часу.
#python #cpp
Я її початково створив на С++ щоб перевірити те як працює pybind11 для створення python-розширень.
Із проблемних частин - це використання https://github.com/hanickadot/compile-time-regular-expressions який компілюється довго на Windows (2.5 години).
Codex який є великою мовною моделлю працює натурально в задачі перевірки нормалізованих речень щоб знайти крайові приклади, тому оця "доводка" до вигляду коли бібліотека працює стабільно на більшості вхідних речень, потребує часу.
#python #cpp
Відкрив для публічного перегляду/використання бібліотеку на Rust/Python щоб робити аналіз аудіо сигналу на людське мовлення.
Інтегравані 6 різних моделей для цієї задачі.
Репо: https://github.com/RustedBytes/extract-speech
#rust #python
Інтегравані 6 різних моделей для цієї задачі.
Репо: https://github.com/RustedBytes/extract-speech
#rust #python
GitHub
GitHub - RustedBytes/extract-speech: Extract speech from audio using Voice Activity Detection models
Extract speech from audio using Voice Activity Detection models - RustedBytes/extract-speech
👍2