doing something
709 subscribers
906 photos
36 videos
36 files
1.93K links
@smlkw doing something, just my notes to keep updates
Download Telegram
Також у того автора (bivex) натрапив на початковий вайб-код інструменту перенесення виділеного коду в окрему функцію (звичайна операція в редакторі коду) на Rust.

Сама стаття - https://arxiv.org/abs/2601.19207v1

Як воно працює:

• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.

Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.

Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
Forwarded from Tech Crimes (Tailen)
😁11🌚2🙈2🤗1
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо.

Це класична задача Automatic Speech Recognition або Speech to Text.

Що нового в третій версії:

• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust

Факти:

• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.

Спробувати можна тут:

https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3

Скачати ваги тут:

https://huggingface.co/speech-uk/w2v-bert-v3

Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:

https://send.monobank.ua/jar/3Saxixsdua

#asr #ml
🔥7👍1
❤3😁2
doing something
Доречі, код трейну та інференсу відкритий: https://github.com/PositiveLoss/squeezeformer-ukrainian Можете тюнити як завгодно.
Опубліковано:

https://github.com/RustedBytes/w2v-bert-uk

В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+.

• Доступні як біндінги на Rust, так і сам крейт для використання.
• Можна брати FP16 або FP32
• Доступний реранкер для слів на основі KenLM
• Beam Search за замовчуванням
• ONNX Runtime з CPU, CUDA, CoreML бекендами
• Аудіо не треба семплити до 16 kHz, фічарайзер сам зробить це

Якщо знайшли баг, створіть тікет на GitHub

• Колаб з прикладом використання: тиць
• Код із скриптами тренування для файн-тюну: тиць
• Банка для підтримки опен сорсу: тиць

Підписуйтесь на мій тг-блог @doing_something щоб отримувати оновлення. Планується додати ще кілька невеликих моделей для мобільних девайсів, бо цей реліз розрахований на сервери.

Також підписуйтесь на ініціативу на HF: speech-uk

#asr #ml
👍1🔥1
Повайбкодили...
😁4😭2
Теж спробував Літаюче колесо після вчорашнього прочитання посту у Задухи.

У мене невеликий тест цього сервісу, що дає свій MCP для вашого агента (умовний Клодекс), на задачі автоматичного розпізнавання мови.

Код який був створений з цим MCP: https://github.com/PositiveLoss/paraformer-v2-enhanced

Використовував їх скіл flywheel-reproduce. По відчуттях: доволі швидко зробило репродюс статті https://arxiv.org/abs/2409.17746 та дало список покращень до архітектури яка реалізована в better_model.py файлі

Я допиляв трохи інженерного: покращив вітербі CTC-алайнер.

Враження залишилось позитивне, вивантаження результатів в ноди дійсно покращує розуміння роботи цього ко-саєнтиста.

#autoscience
🔥2
Forwarded from Serhii
переписав хату на Rust
😁33🤣3
Кодекс побачив що треба перекласти 500 аттерансів на 4 мови і вирішив написати пайтон скрипт для цього.

Тобто автоматизація^2.

#vibe_coding
😁10
Щось швидко GPT 5.5 "видихся"
😁3
Навіяне після теми автоматичного наукового дослідження ака ко-саєнтистів та чату архітекторів @swarchua

Якщо AI так гарно захоплює контекст (exploiter) та вигадує нові підходи (researcher), то я трошки пошаманив над архітектурою ПЗ яку використовують самі агенти для його створення.

Вилилось в цей документ:

https://gist.github.com/egorsmkv/1008d028cb2e8d3a346c3231b446dcc1

#experiment
👀2