This is result of today's work on optimizing training process for different ASR architectures
The bottleneck was older version of torchaudio where OPUS decoder was not able to load some corrupted files and feature extraction time was not OK
Dataset size: 1200 hours, around 35GB of data
I have solved this by rewriting this pipeline using Rust
Parallelism using rayon helped to utilize all the cores and features are here in 20 minutes (~140GB)
#asr #ml #rust
The bottleneck was older version of torchaudio where OPUS decoder was not able to load some corrupted files and feature extraction time was not OK
Dataset size: 1200 hours, around 35GB of data
I have solved this by rewriting this pipeline using Rust
Parallelism using rayon helped to utilize all the cores and features are here in 20 minutes (~140GB)
#asr #ml #rust
❤4
Forwarded from Yehor Smoliakov
Всім привіт!
Запрошую бажаючих долучитись до тестування https://github.com/RustedBytes/pyregistry
Що це: це легка альтернатива PyPI з вбудованими функціями по скануванню пайтонівських пакетів та коду в них на наявні CVE або інші неприємні штуки.
Всередині вбудований механізм дзеркалення інших пакетів, тому Pyregistry можна використати навіть для закритої мережі. Якщо з'являється якась CVE - проєкт відправить вебхук на вказану адресу.
Також є вбудований чекер на віруси в файлах.
Сам проєкт поширюється як бінарик (бо написаний на Rust), скачати під свою ОС можна тут: https://github.com/RustedBytes/pyregistry/releases/tag/v0.1.1
Цього буде достатньо для початку роботи:
Буду радий конструктивній критиці та зірочці на GitHub, якщо проєкт є корисним для Вас.
Запрошую бажаючих долучитись до тестування https://github.com/RustedBytes/pyregistry
Що це: це легка альтернатива PyPI з вбудованими функціями по скануванню пайтонівських пакетів та коду в них на наявні CVE або інші неприємні штуки.
Всередині вбудований механізм дзеркалення інших пакетів, тому Pyregistry можна використати навіть для закритої мережі. Якщо з'являється якась CVE - проєкт відправить вебхук на вказану адресу.
Також є вбудований чекер на віруси в файлах.
Сам проєкт поширюється як бінарик (бо написаний на Rust), скачати під свою ОС можна тут: https://github.com/RustedBytes/pyregistry/releases/tag/v0.1.1
Цього буде достатньо для початку роботи:
./pyregistry init-config
./pyregistry serve
Буду радий конструктивній критиці та зірочці на GitHub, якщо проєкт є корисним для Вас.
GitHub
GitHub - RustedBytes/pyregistry: PyPI alternative for local usage with package vulnerability scanning
PyPI alternative for local usage with package vulnerability scanning - RustedBytes/pyregistry
🔥7🌚1👨💻1
https://gitlab.com/esr/reposurgeon
really cool tool that ESR made, it gives (a) editing past comments and metadata,
(b) excising commits, (c) coalescing commits, and (d) removing files and
subtrees from repo history
#go
really cool tool that ESR made, it gives (a) editing past comments and metadata,
(b) excising commits, (c) coalescing commits, and (d) removing files and
subtrees from repo history
#go
GitLab
Eric S. Raymond / reposurgeon · GitLab
A tool for editing version-control repositories and translating among different vwersion-control systems. Supports git, bzr, Subversion, darcs, and fossil directly, also hg, SCCS, CVS, RCS, and src through...
Forwarded from пехаде блог
Змагання з розпізнавання українського рукописного тексту стартує вже 16 квітня і триватиме до 15 червня 2026 р. 🔥 🔥 🔥
Приєднуйтесь командою чи самотужки!
* Отримайте доступ до різножанрових проанотованих рукописних текстів 🖋️
* Долучіться до розробки відкритих рішень для цифрової трансформації України 🤖
* Виграйте грошовий приз від спонсорів змагання 💰
➡️ Реєстрація та всі деталі тут: https://aihouse.org.ua/event/handwritten-to-data/
Приєднуйтесь командою чи самотужки!
* Отримайте доступ до різножанрових проанотованих рукописних текстів 🖋️
* Долучіться до розробки відкритих рішень для цифрової трансформації України 🤖
* Виграйте грошовий приз від спонсорів змагання 💰
➡️ Реєстрація та всі деталі тут: https://aihouse.org.ua/event/handwritten-to-data/
aihouse.org.ua
Handwritten to Data
doing something
This is result of today's work on optimizing training process for different ASR architectures The bottleneck was older version of torchaudio where OPUS decoder was not able to load some corrupted files and feature extraction time was not OK Dataset size:…
I also rewrote data loader in Rust because torch has became a crazy man and ate all 120 gb of RAM
😨3🔥1
Forwarded from Українська Rust Спільнота (Kostiantyn M)
🦀 Спільното, збираємось!
Вже за пів години, о 18:00, наші випускники презентуватимуть свої фінальні проєкти. Це буде цікаво! Заварюйте чай і приєднуйтесь до нас.
Посилання на Meet
Вже за пів години, о 18:00, наші випускники презентуватимуть свої фінальні проєкти. Це буде цікаво! Заварюйте чай і приєднуйтесь до нас.
Посилання на Meet
🤗3🔥1
Люди бояться Клод.
Що сталося:
Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота.
Як було:
Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала структурні та архітектурні помилки в Раст коді в якійсь мірі.
Сам код створений був з чистою архітектурою але явно без особливого залучення пальців автора.
Після деяких експериментів я побачив false-positive детекції і вирішив покращити інструмент аби їх усунути. Зробив 4 пул-реквести і якість суттєво покращилась.
Далі вирішив поділитись з товариством світовим на Реддіті і пост був живим десь годину: 2 тисячі переглядів, 10 коментів які в основному про те що це ШІ-слоп.
Чому?
Тому що всі бачать в історії комітів невелику їх кількість та у співавторах акаунт Клода.
І це лякає людей і в якійсь мірі їх конфузить і спонукає закривати сторінку з проєктом. По факту, ШІ їх лякає і це, на жаль, сьогодення і змінена реальність.
Отакий ранковий пост.
Що сталося:
Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота.
Як було:
Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала структурні та архітектурні помилки в Раст коді в якійсь мірі.
Сам код створений був з чистою архітектурою але явно без особливого залучення пальців автора.
Після деяких експериментів я побачив false-positive детекції і вирішив покращити інструмент аби їх усунути. Зробив 4 пул-реквести і якість суттєво покращилась.
Далі вирішив поділитись з товариством світовим на Реддіті і пост був живим десь годину: 2 тисячі переглядів, 10 коментів які в основному про те що це ШІ-слоп.
Чому?
Тому що всі бачать в історії комітів невелику їх кількість та у співавторах акаунт Клода.
І це лякає людей і в якійсь мірі їх конфузить і спонукає закривати сторінку з проєктом. По факту, ШІ їх лякає і це, на жаль, сьогодення і змінена реальність.
Отакий ранковий пост.
👍5😱4
doing something
Люди бояться Клод. Що сталося: Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота. Як було: Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала…
Продовжую історію по цьому проєкту.
Вчора зробив розширення для VS Code яке перевіряє помилки в Rust коді автоматично через цю програму та додає їх у таб Problems.
Зараз він працює на рівні файлу, але вже бачу деякі сторони для покращення:
1) аналіз всього проєкту після відкриття проєкту
2) додавання коментів ігнорування якоїсь знахідки
3) Сама програма має метод —how-fix з підказкою щодо поліпшення коду, її теж треба додати в інформацію
PS: Під кожний проєкт треба тюнити конфіг, звісно. Бо як виявилось не всім це зрозуміло.
Вчора зробив розширення для VS Code яке перевіряє помилки в Rust коді автоматично через цю програму та додає їх у таб Problems.
Зараз він працює на рівні файлу, але вже бачу деякі сторони для покращення:
1) аналіз всього проєкту після відкриття проєкту
2) додавання коментів ігнорування якоїсь знахідки
3) Сама програма має метод —how-fix з підказкою щодо поліпшення коду, її теж треба додати в інформацію
PS: Під кожний проєкт треба тюнити конфіг, звісно. Бо як виявилось не всім це зрозуміло.
❤2
Також у того автора (bivex) натрапив на початковий вайб-код інструменту перенесення виділеного коду в окрему функцію (звичайна операція в редакторі коду) на Rust.
Сама стаття - https://arxiv.org/abs/2601.19207v1
Як воно працює:
• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.
Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.
Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
Сама стаття - https://arxiv.org/abs/2601.19207v1
Як воно працює:
• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.
Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.
Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
https://cloud.google.com/blog/products/compute/inside-the-ironwood-tpu-codesigned-ai-stack?e=48754805
#ml
#ml
Google Cloud Blog
Inside the Ironwood TPU codesigned AI stack | Google Cloud Blog
Learn about the core components of Google's AI software stack woven into the Ironwood TPU, including JAX and PyTorch ecosystems, the XLA compiler.
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо.
Це класична задача Automatic Speech Recognition або Speech to Text.
Що нового в третій версії:
• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust
Факти:
• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.
Спробувати можна тут:
https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3
Скачати ваги тут:
https://huggingface.co/speech-uk/w2v-bert-v3
Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:
https://send.monobank.ua/jar/3Saxixsdua
#asr #ml
Це класична задача Automatic Speech Recognition або Speech to Text.
Що нового в третій версії:
• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust
Факти:
• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.
Спробувати можна тут:
https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3
Скачати ваги тут:
https://huggingface.co/speech-uk/w2v-bert-v3
Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:
https://send.monobank.ua/jar/3Saxixsdua
#asr #ml
🔥7👍1