doing something
709 subscribers
906 photos
36 videos
36 files
1.94K links
@smlkw doing something, just my notes to keep updates
Download Telegram
Люди бояться Клод.

Що сталося:

Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота.

Як було:

Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала структурні та архітектурні помилки в Раст коді в якійсь мірі.

Сам код створений був з чистою архітектурою але явно без особливого залучення пальців автора.

Після деяких експериментів я побачив false-positive детекції і вирішив покращити інструмент аби їх усунути. Зробив 4 пул-реквести і якість суттєво покращилась.

Далі вирішив поділитись з товариством світовим на Реддіті і пост був живим десь годину: 2 тисячі переглядів, 10 коментів які в основному про те що це ШІ-слоп.

Чому?

Тому що всі бачать в історії комітів невелику їх кількість та у співавторах акаунт Клода.

І це лякає людей і в якійсь мірі їх конфузить і спонукає закривати сторінку з проєктом. По факту, ШІ їх лякає і це, на жаль, сьогодення і змінена реальність.

Отакий ранковий пост.
👍5😱4
doing something
Люди бояться Клод. Що сталося: Модератори хаба /р/раст вчора видалили пост через те, що нібито проєкт який був там мною опублікований є лоу-еффорт робота. Як було: Я побачив гарну ідею яка була реалізована через Клода і просто компілювалася та показувала…
Продовжую історію по цьому проєкту.

Вчора зробив розширення для VS Code яке перевіряє помилки в Rust коді автоматично через цю програму та додає їх у таб Problems.

Зараз він працює на рівні файлу, але вже бачу деякі сторони для покращення:

1) аналіз всього проєкту після відкриття проєкту
2) додавання коментів ігнорування якоїсь знахідки
3) Сама програма має метод —how-fix з підказкою щодо поліпшення коду, її теж треба додати в інформацію

PS: Під кожний проєкт треба тюнити конфіг, звісно. Бо як виявилось не всім це зрозуміло.
❤2
Також у того автора (bivex) натрапив на початковий вайб-код інструменту перенесення виділеного коду в окрему функцію (звичайна операція в редакторі коду) на Rust.

Сама стаття - https://arxiv.org/abs/2601.19207v1

Як воно працює:

• REM2.0 бере оригінальну функцію і версію після виділення.
• Створює ізольовані віртуальні крейти (мінімально компільована частинка), щоб перевірка не залежала від змін у відкритому проекті.
• CHARON перекладає Rust/MIR у LLBC - Low-Level Borrow Calculus, де borrow/ownership інформація явно представлена.
• AENEAS перетворює LLBC у чисту функціональну модель.
• Coq отримує дві версії програми та автоматично перевіряє лемму про еквівалентність.

Це дозволяє гарантувати, що рефакторинг не змінив поведінку програми, що є критично важливим для підтримки надійності та безпеки коду. Такий підхід може значно знизити ризик введення помилок під час рефакторингу та забезпечити більш високий рівень довіри до змін у коді.

Спробував окремо реалізувати статтю і вийшло деякий підсет мови зробити (всі приклади із статті коректно виділяються в окрему функцію). Поки що це лише proof of concept, але вже можна побачити потенціал такого підходу для автоматизації рефакторингу та забезпечення безпеки коду. В еру ШІ та агентів, які можуть виконувати складні завдання, такі інструменти можуть стати незамінними для Rust розробників при складних завданнях.
Forwarded from Tech Crimes (Tailen)
😁11🌚2🙈2🤗1
Оновив демонстрацію для нової версії W2V-BERT моделі по розпізнаванню українських аудіо.

Це класична задача Automatic Speech Recognition або Speech to Text.

Що нового в третій версії:

• більше даних: 1200 годин
• новий токенізатор SentencePiece на 512 токенів
• виділення фіч відбувається через розширення на Rust

Факти:

• Трейн був початий з попередньої моделі щоб пришвидшити процес навчання.
• Тренування відбувається на двох відеокартах 3090 по 24 гб кожна.
• Гарно підійде для файн тюну, бо дані в навчанні дуже різноманітні та здебільшого шумні.

Спробувати можна тут:

https://huggingface.co/spaces/Yehor/w2v-bert-uk-v3

Скачати ваги тут:

https://huggingface.co/speech-uk/w2v-bert-v3

Якщо бажаєте підтримати донатом ініціативу speech-uk, ось посилання на монобанку:

https://send.monobank.ua/jar/3Saxixsdua

#asr #ml
🔥7👍1
❤3😁2
doing something
Доречі, код трейну та інференсу відкритий: https://github.com/PositiveLoss/squeezeformer-ukrainian Можете тюнити як завгодно.
Опубліковано:

https://github.com/RustedBytes/w2v-bert-uk

В релізах wheels для Linux, macOS, Windows систем які можна використати в Python проєктах: 3.10+.

• Доступні як біндінги на Rust, так і сам крейт для використання.
• Можна брати FP16 або FP32
• Доступний реранкер для слів на основі KenLM
• Beam Search за замовчуванням
• ONNX Runtime з CPU, CUDA, CoreML бекендами
• Аудіо не треба семплити до 16 kHz, фічарайзер сам зробить це

Якщо знайшли баг, створіть тікет на GitHub

• Колаб з прикладом використання: тиць
• Код із скриптами тренування для файн-тюну: тиць
• Банка для підтримки опен сорсу: тиць

Підписуйтесь на мій тг-блог @doing_something щоб отримувати оновлення. Планується додати ще кілька невеликих моделей для мобільних девайсів, бо цей реліз розрахований на сервери.

Також підписуйтесь на ініціативу на HF: speech-uk

#asr #ml
👍1🔥1
Повайбкодили...
😁4😭2
Теж спробував Літаюче колесо після вчорашнього прочитання посту у Задухи.

У мене невеликий тест цього сервісу, що дає свій MCP для вашого агента (умовний Клодекс), на задачі автоматичного розпізнавання мови.

Код який був створений з цим MCP: https://github.com/PositiveLoss/paraformer-v2-enhanced

Використовував їх скіл flywheel-reproduce. По відчуттях: доволі швидко зробило репродюс статті https://arxiv.org/abs/2409.17746 та дало список покращень до архітектури яка реалізована в better_model.py файлі

Я допиляв трохи інженерного: покращив вітербі CTC-алайнер.

Враження залишилось позитивне, вивантаження результатів в ноди дійсно покращує розуміння роботи цього ко-саєнтиста.

#autoscience
🔥2
Forwarded from Serhii
переписав хату на Rust
😁33🤣3
Кодекс побачив що треба перекласти 500 аттерансів на 4 мови і вирішив написати пайтон скрипт для цього.

Тобто автоматизація^2.

#vibe_coding
😁10
Щось швидко GPT 5.5 "видихся"
😁3