Також у того автора (bivex) натрапив на початковий вайб-код інструменту перенесення виділеного коду в окрему функцію (звичайна операція в редакторі коду) на Rust.
Сама стаття - https://arxiv.org/abs/2601.19207v1
Як воно працює:
• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.
Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.
Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
Сама стаття - https://arxiv.org/abs/2601.19207v1
Як воно працює:
• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.
Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.
Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
https://cloud.google.com/blog/products/compute/inside-the-ironwood-tpu-codesigned-ai-stack?e=48754805
#ml
#ml
Google Cloud Blog
Inside the Ironwood TPU codesigned AI stack | Google Cloud Blog
Learn about the core components of Google's AI software stack woven into the Ironwood TPU, including JAX and PyTorch ecosystems, the XLA compiler.
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо.
Це класична задача Automatic Speech Recognition або Speech to Text.
Що нового в третій версії:
• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust
Факти:
• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.
Спробувати можна тут:
https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3
Скачати ваги тут:
https://huggingface.co/speech-uk/w2v-bert-v3
Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:
https://send.monobank.ua/jar/3Saxixsdua
#asr #ml
Це класична задача Automatic Speech Recognition або Speech to Text.
Що нового в третій версії:
• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust
Факти:
• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.
Спробувати можна тут:
https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3
Скачати ваги тут:
https://huggingface.co/speech-uk/w2v-bert-v3
Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:
https://send.monobank.ua/jar/3Saxixsdua
#asr #ml
🔥7👍1
doing something
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо. Це класична задача Automatic Speech Recognition або Speech to Text. Що нового в третій версії: • більше даних: 1200 годин • новий токенізатор SentencePiece на 512…
Ось тут оптимізований онікс в FP16:
https://huggingface.co/speech-uk/w2v-bert-v3-onnx
Також, пізніше сьогодні буде реліз бібліотеки на Rust та Python для використання цієї моделі.
https://huggingface.co/speech-uk/w2v-bert-v3-onnx
Також, пізніше сьогодні буде реліз бібліотеки на Rust та Python для використання цієї моделі.
doing something
Ось тут оптимізований онікс в FP16: https://huggingface.co/speech-uk/w2v-bert-v3-onnx Також, пізніше сьогодні буде реліз бібліотеки на Rust та Python для використання цієї моделі.
Доречі, код трейну та інференсу відкритий:
https://github.com/PositiveLoss/squeezeformer-ukrainian
Можете тюнити як завгодно.
https://github.com/PositiveLoss/squeezeformer-ukrainian
Можете тюнити як завгодно.
GitHub
GitHub - PositiveLoss/squeezeformer-ukrainian: Squeezeformer, Zipformer, Paraformer and W2V-BERT architectures: training and inference…
Squeezeformer, Zipformer, Paraformer and W2V-BERT architectures: training and inference code - PositiveLoss/squeezeformer-ukrainian
❤2
doing something
Доречі, код трейну та інференсу відкритий: https://github.com/PositiveLoss/squeezeformer-ukrainian Можете тюнити як завгодно.
Опубліковано:
https://github.com/RustedBytes/w2v-bert-uk
В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+.
• Доступні як біндінги на Rust, так і сам крейт для використання.
• Можна брати FP16 або FP32
• Доступний реранкер для слів на основі KenLM
• Beam Search за замовчуванням
• ONNX Runtime з CPU, CUDA, CoreML бекендами
• Аудіо не треба семплити до 16 kHz, фічарайзер сам зробить це
Якщо знайшли баг, створіть тікет на GitHub
• Колаб з прикладом використання: тиць
• Код із скриптами тренування для файн-тюну: тиць
• Банка для підтримки опен сорсу: тиць
Підписуйтесь на мій тг-блог @doing_something щоб отримувати оновлення. Планується додати ще кілька невеликих моделей для мобільних девайсів, бо цей реліз розрахований на сервери.
Також підписуйтесь на ініціативу на HF: speech-uk
#asr #ml
https://github.com/RustedBytes/w2v-bert-uk
В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+.
• Доступні як біндінги на Rust, так і сам крейт для використання.
• Можна брати FP16 або FP32
• Доступний реранкер для слів на основі KenLM
• Beam Search за замовчуванням
• ONNX Runtime з CPU, CUDA, CoreML бекендами
• Аудіо не треба семплити до 16 kHz, фічарайзер сам зробить це
Якщо знайшли баг, створіть тікет на GitHub
• Колаб з прикладом використання: тиць
• Код із скриптами тренування для файн-тюну: тиць
• Банка для підтримки опен сорсу: тиць
Підписуйтесь на мій тг-блог @doing_something щоб отримувати оновлення. Планується додати ще кілька невеликих моделей для мобільних девайсів, бо цей реліз розрахований на сервери.
Також підписуйтесь на ініціативу на HF: speech-uk
#asr #ml
👍1🔥1
doing something
Опубліковано: https://github.com/RustedBytes/w2v-bert-uk В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+. • Доступні як біндінги на Rust, так і сам крейт для використання. • Можна брати FP16 або FP32 • Доступний…
Додав код для генерації біндінгів для:
• NodeJS
• C#, C, C++
• Java, Kotlin, Scala
• Swift
• Ruby
• Go
• PHP
Інтеграція в інші застосунки стане тривіальною справою.
• NodeJS
• C#, C, C++
• Java, Kotlin, Scala
• Swift
• Ruby
• Go
• PHP
Інтеграція в інші застосунки стане тривіальною справою.
🔥2❤1
Теж спробував Літаюче колесо після вчорашнього прочитання посту у Задухи.
У мене невеликий тест цього сервісу, що дає свій MCP для вашого агента (умовний Клодекс), на задачі автоматичного розпізнавання мови.
Код який був створений з цим MCP: https://github.com/PositiveLoss/paraformer-v2-enhanced
Використовував їх скіл flywheel-reproduce. По відчуттях: доволі швидко зробило репродюс статті https://arxiv.org/abs/2409.17746 та дало список покращень до архітектури яка реалізована в better_model.py файлі
Я допиляв трохи інженерного: покращив вітербі CTC-алайнер.
Враження залишилось позитивне, вивантаження результатів в ноди дійсно покращує розуміння роботи цього ко-саєнтиста.
#autoscience
У мене невеликий тест цього сервісу, що дає свій MCP для вашого агента (умовний Клодекс), на задачі автоматичного розпізнавання мови.
Код який був створений з цим MCP: https://github.com/PositiveLoss/paraformer-v2-enhanced
Використовував їх скіл flywheel-reproduce. По відчуттях: доволі швидко зробило репродюс статті https://arxiv.org/abs/2409.17746 та дало список покращень до архітектури яка реалізована в better_model.py файлі
Я допиляв трохи інженерного: покращив вітербі CTC-алайнер.
Враження залишилось позитивне, вивантаження результатів в ноди дійсно покращує розуміння роботи цього ко-саєнтиста.
#autoscience
🔥2
В школах та університетах будуть писати про цих піонерів перших українських ЛЛМок:
https://youtu.be/gX5jg2yWRww
Рекомендую до перегляду, технічно та цікаво
Доречі, блог Ганни отут: https://t.me/potuzhno_llm
#llm #nlp
https://youtu.be/gX5jg2yWRww
Рекомендую до перегляду, технічно та цікаво
Доречі, блог Ганни отут: https://t.me/potuzhno_llm
#llm #nlp
YouTube
MamayLM: як працює перша адаптована українська LLM? | Ганна Юхименко | AI&I подкаст
Другий випуск AI&I подкасту про створення MamayLM — першої відкритої адаптованої моделі для української мови. Гостя епізоду — Ганна Юхименко, розробниця MamayLM, Research Engineer у ETH AI Center та INSAIT: https://www.linkedin.com/in/hanna-yukhymenko/
…
…
❤7
Кодекс побачив що треба перекласти 500 аттерансів на 4 мови і вирішив написати пайтон скрипт для цього.
Тобто автоматизація^2.
#vibe_coding
Тобто автоматизація^2.
#vibe_coding
😁10
Навіяне після теми автоматичного наукового дослідження ака ко-саєнтистів та чату архітекторів @swarchua
Якщо AI так гарно захоплює контекст (exploiter) та вигадує нові підходи (researcher), то я трошки пошаманив над архітектурою ПЗ яку використовують самі агенти для його створення.
Вилилось в цей документ:
https://gist.github.com/egorsmkv/1008d028cb2e8d3a346c3231b446dcc1
#experiment
Якщо AI так гарно захоплює контекст (exploiter) та вигадує нові підходи (researcher), то я трошки пошаманив над архітектурою ПЗ яку використовують самі агенти для його створення.
Вилилось в цей документ:
https://gist.github.com/egorsmkv/1008d028cb2e8d3a346c3231b446dcc1
#experiment
Gist
ambidextrous-agentic-software-factory.md
GitHub Gist: instantly share code, notes, and snippets.
👀2