https://gitlab.com/esr/reposurgeon
really cool tool that ESR made, it gives (a) editing past comments and metadata,
(b) excising commits, (c) coalescing commits, and (d) removing files and
subtrees from repo history
#go
really cool tool that ESR made, it gives (a) editing past comments and metadata,
(b) excising commits, (c) coalescing commits, and (d) removing files and
subtrees from repo history
#go
GitLab
Eric S. Raymond / reposurgeon · GitLab
A tool for editing version-control repositories and translating among different vwersion-control systems. Supports git, bzr, Subversion, darcs, and fossil directly, also hg, SCCS, CVS, RCS, and src through...
Forwarded from пехаде блог
Змагання з розпізнавання українського рукописного тексту стартує вже 16 квітня і триватиме до 15 червня 2026 р. 🔥 🔥 🔥
Приєднуйтесь командою чи самотужки!
* Отримайте доступ до різножанрових проанотованих рукописних текстів 🖋️
* Долучіться до розробки відкритих рішень для цифрової трансформації України 🤖
* Виграйте грошовий приз від спонсорів змагання 💰
➡️ Реєстрація та всі деталі тут: https://aihouse.org.ua/event/handwritten-to-data/
Приєднуйтесь командою чи самотужки!
* Отримайте доступ до різножанрових проанотованих рукописних текстів 🖋️
* Долучіться до розробки відкритих рішень для цифрової трансформації України 🤖
* Виграйте грошовий приз від спонсорів змагання 💰
➡️ Реєстрація та всі деталі тут: https://aihouse.org.ua/event/handwritten-to-data/
aihouse.org.ua
Handwritten to Data
doing something
This is result of today's work on optimizing training process for different ASR architectures The bottleneck was older version of torchaudio where OPUS decoder was not able to load some corrupted files and feature extraction time was not OK Dataset size:…
I also rewrote data loader in Rust because torch has became a crazy man and ate all 120 gb of RAM
😨3🔥1
Forwarded from Українська Rust Спільнота (Kostiantyn M)
🦀 Спільното, збираємось!
Вже за пів години, о 18:00, наші випускники презентуватимуть свої фінальні проєкти. Це буде цікаво! Заварюйте чай і приєднуйтесь до нас.
Посилання на Meet
Вже за пів години, о 18:00, наші випускники презентуватимуть свої фінальні проєкти. Це буде цікаво! Заварюйте чай і приєднуйтесь до нас.
Посилання на Meet
🤗3🔥1
Люди бояться Клод.
Що сталося:
Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота.
Як було:
Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала структурні та архітектурні помилки в Раст коді в якійсь мірі.
Сам код створений був з чистою архітектурою але явно без особливого залучення пальців автора.
Після деяких експериментів я побачив false-positive детекції і вирішив покращити інструмент аби їх усунути. Зробив 4 пул-реквести і якість суттєво покращилась.
Далі вирішив поділитись з товариством світовим на Реддіті і пост був живим десь годину: 2 тисячі переглядів, 10 коментів які в основному про те що це ШІ-слоп.
Чому?
Тому що всі бачать в історії комітів невелику їх кількість та у співавторах акаунт Клода.
І це лякає людей і в якійсь мірі їх конфузить і спонукає закривати сторінку з проєктом. По факту, ШІ їх лякає і це, на жаль, сьогодення і змінена реальність.
Отакий ранковий пост.
Що сталося:
Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота.
Як було:
Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала структурні та архітектурні помилки в Раст коді в якійсь мірі.
Сам код створений був з чистою архітектурою але явно без особливого залучення пальців автора.
Після деяких експериментів я побачив false-positive детекції і вирішив покращити інструмент аби їх усунути. Зробив 4 пул-реквести і якість суттєво покращилась.
Далі вирішив поділитись з товариством світовим на Реддіті і пост був живим десь годину: 2 тисячі переглядів, 10 коментів які в основному про те що це ШІ-слоп.
Чому?
Тому що всі бачать в історії комітів невелику їх кількість та у співавторах акаунт Клода.
І це лякає людей і в якійсь мірі їх конфузить і спонукає закривати сторінку з проєктом. По факту, ШІ їх лякає і це, на жаль, сьогодення і змінена реальність.
Отакий ранковий пост.
👍5😱4
doing something
Люди бояться Клод. Що сталося: Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота. Як було: Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала…
Продовжую історію по цьому проєкту.
Вчора зробив розширення для VS Code яке перевіряє помилки в Rust коді автоматично через цю програму та додає їх у таб Problems.
Зараз він працює на рівні файлу, але вже бачу деякі сторони для покращення:
1) аналіз всього проєкту після відкриття проєкту
2) додавання коментів ігнорування якоїсь знахідки
3) Сама програма має метод —how-fix з підказкою щодо поліпшення коду, її теж треба додати в інформацію
PS: Під кожний проєкт треба тюнити конфіг, звісно. Бо як виявилось не всім це зрозуміло.
Вчора зробив розширення для VS Code яке перевіряє помилки в Rust коді автоматично через цю програму та додає їх у таб Problems.
Зараз він працює на рівні файлу, але вже бачу деякі сторони для покращення:
1) аналіз всього проєкту після відкриття проєкту
2) додавання коментів ігнорування якоїсь знахідки
3) Сама програма має метод —how-fix з підказкою щодо поліпшення коду, її теж треба додати в інформацію
PS: Під кожний проєкт треба тюнити конфіг, звісно. Бо як виявилось не всім це зрозуміло.
❤2
Також у того автора (bivex) натрапив на початковий вайб-код інструменту перенесення виділеного коду в окрему функцію (звичайна операція в редакторі коду) на Rust.
Сама стаття - https://arxiv.org/abs/2601.19207v1
Як воно працює:
• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.
Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.
Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
Сама стаття - https://arxiv.org/abs/2601.19207v1
Як воно працює:
• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.
Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.
Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
https://cloud.google.com/blog/products/compute/inside-the-ironwood-tpu-codesigned-ai-stack?e=48754805
#ml
#ml
Google Cloud Blog
Inside the Ironwood TPU codesigned AI stack | Google Cloud Blog
Learn about the core components of Google's AI software stack woven into the Ironwood TPU, including JAX and PyTorch ecosystems, the XLA compiler.
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо.
Це класична задача Automatic Speech Recognition або Speech to Text.
Що нового в третій версії:
• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust
Факти:
• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.
Спробувати можна тут:
https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3
Скачати ваги тут:
https://huggingface.co/speech-uk/w2v-bert-v3
Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:
https://send.monobank.ua/jar/3Saxixsdua
#asr #ml
Це класична задача Automatic Speech Recognition або Speech to Text.
Що нового в третій версії:
• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust
Факти:
• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.
Спробувати можна тут:
https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3
Скачати ваги тут:
https://huggingface.co/speech-uk/w2v-bert-v3
Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:
https://send.monobank.ua/jar/3Saxixsdua
#asr #ml
🔥7👍1
doing something
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо. Це класична задача Automatic Speech Recognition або Speech to Text. Що нового в третій версії: • більше даних: 1200 годин • новий токенізатор SentencePiece на 512…
Ось тут оптимізований онікс в FP16:
https://huggingface.co/speech-uk/w2v-bert-v3-onnx
Також, пізніше сьогодні буде реліз бібліотеки на Rust та Python для використання цієї моделі.
https://huggingface.co/speech-uk/w2v-bert-v3-onnx
Також, пізніше сьогодні буде реліз бібліотеки на Rust та Python для використання цієї моделі.
doing something
Ось тут оптимізований онікс в FP16: https://huggingface.co/speech-uk/w2v-bert-v3-onnx Також, пізніше сьогодні буде реліз бібліотеки на Rust та Python для використання цієї моделі.
Доречі, код трейну та інференсу відкритий:
https://github.com/PositiveLoss/squeezeformer-ukrainian
Можете тюнити як завгодно.
https://github.com/PositiveLoss/squeezeformer-ukrainian
Можете тюнити як завгодно.
GitHub
GitHub - PositiveLoss/squeezeformer-ukrainian: Squeezeformer, Zipformer, Paraformer and W2V-BERT architectures: training and inference…
Squeezeformer, Zipformer, Paraformer and W2V-BERT architectures: training and inference code - PositiveLoss/squeezeformer-ukrainian
❤2
doing something
Доречі, код трейну та інференсу відкритий: https://github.com/PositiveLoss/squeezeformer-ukrainian Можете тюнити як завгодно.
Опубліковано:
https://github.com/RustedBytes/w2v-bert-uk
В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+.
• Доступні як біндінги на Rust, так і сам крейт для використання.
• Можна брати FP16 або FP32
• Доступний реранкер для слів на основі KenLM
• Beam Search за замовчуванням
• ONNX Runtime з CPU, CUDA, CoreML бекендами
• Аудіо не треба семплити до 16 kHz, фічарайзер сам зробить це
Якщо знайшли баг, створіть тікет на GitHub
• Колаб з прикладом використання: тиць
• Код із скриптами тренування для файн-тюну: тиць
• Банка для підтримки опен сорсу: тиць
Підписуйтесь на мій тг-блог @doing_something щоб отримувати оновлення. Планується додати ще кілька невеликих моделей для мобільних девайсів, бо цей реліз розрахований на сервери.
Також підписуйтесь на ініціативу на HF: speech-uk
#asr #ml
https://github.com/RustedBytes/w2v-bert-uk
В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+.
• Доступні як біндінги на Rust, так і сам крейт для використання.
• Можна брати FP16 або FP32
• Доступний реранкер для слів на основі KenLM
• Beam Search за замовчуванням
• ONNX Runtime з CPU, CUDA, CoreML бекендами
• Аудіо не треба семплити до 16 kHz, фічарайзер сам зробить це
Якщо знайшли баг, створіть тікет на GitHub
• Колаб з прикладом використання: тиць
• Код із скриптами тренування для файн-тюну: тиць
• Банка для підтримки опен сорсу: тиць
Підписуйтесь на мій тг-блог @doing_something щоб отримувати оновлення. Планується додати ще кілька невеликих моделей для мобільних девайсів, бо цей реліз розрахований на сервери.
Також підписуйтесь на ініціативу на HF: speech-uk
#asr #ml
👍1🔥1
doing something
Опубліковано: https://github.com/RustedBytes/w2v-bert-uk В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+. • Доступні як біндінги на Rust, так і сам крейт для використання. • Можна брати FP16 або FP32 • Доступний…
Додав код для генерації біндінгів для:
• NodeJS
• C#, C, C++
• Java, Kotlin, Scala
• Swift
• Ruby
• Go
• PHP
Інтеграція в інші застосунки стане тривіальною справою.
• NodeJS
• C#, C, C++
• Java, Kotlin, Scala
• Swift
• Ruby
• Go
• PHP
Інтеграція в інші застосунки стане тривіальною справою.
🔥2❤1
Теж спробував Літаюче колесо після вчорашнього прочитання посту у Задухи.
У мене невеликий тест цього сервісу, що дає свій MCP для вашого агента (умовний Клодекс), на задачі автоматичного розпізнавання мови.
Код який був створений з цим MCP: https://github.com/PositiveLoss/paraformer-v2-enhanced
Використовував їх скіл flywheel-reproduce. По відчуттях: доволі швидко зробило репродюс статті https://arxiv.org/abs/2409.17746 та дало список покращень до архітектури яка реалізована в better_model.py файлі
Я допиляв трохи інженерного: покращив вітербі CTC-алайнер.
Враження залишилось позитивне, вивантаження результатів в ноди дійсно покращує розуміння роботи цього ко-саєнтиста.
#autoscience
У мене невеликий тест цього сервісу, що дає свій MCP для вашого агента (умовний Клодекс), на задачі автоматичного розпізнавання мови.
Код який був створений з цим MCP: https://github.com/PositiveLoss/paraformer-v2-enhanced
Використовував їх скіл flywheel-reproduce. По відчуттях: доволі швидко зробило репродюс статті https://arxiv.org/abs/2409.17746 та дало список покращень до архітектури яка реалізована в better_model.py файлі
Я допиляв трохи інженерного: покращив вітербі CTC-алайнер.
Враження залишилось позитивне, вивантаження результатів в ноди дійсно покращує розуміння роботи цього ко-саєнтиста.
#autoscience
🔥2