Fine-tuned Whisper model for Multilingual Speech-to-Phonemes recognition:
https://colab.research.google.com/drive/1cJD_yQMM71IaLxkC0mEgYLOb2DX7p_LA?usp=sharing
#audio #ai
https://colab.research.google.com/drive/1cJD_yQMM71IaLxkC0mEgYLOb2DX7p_LA?usp=sharing
#audio #ai
Google
Speech-to-Phonemes, test with Whisper-PPT.ipynb
Colab notebook
Made a simple Containerfile to run llamafile using podman/docker:
https://github.com/crs-org/multilingual-pii-detection/blob/main/containers/llamafile/Containerfile
Size of the image: 6.68 GB
#ai #llm
https://github.com/crs-org/multilingual-pii-detection/blob/main/containers/llamafile/Containerfile
Size of the image: 6.68 GB
#ai #llm
GitHub
multilingual-pii-detection/containers/llamafile/Containerfile at main · crs-org/multilingual-pii-detection
An API for the Personally Identifiable Information detection task - crs-org/multilingual-pii-detection
I think I've seen it before but let's write here as well about this model - https://huggingface.co/osmosis-ai/Osmosis-Structure-0.6B
This model gives an ability to extract information in text using JSON schema
Quantized model (8-bit) requires about 1602MiB of GPU
#ai #llm
This model gives an ability to extract information in text using JSON schema
Quantized model (8-bit) requires about 1602MiB of GPU
#ai #llm
👍2🤯1
Forwarded from Hacker News
Forwarded from Задуха
Новий, найкращий і, мабуть, останній токенізатор із цієї лінійки, призначення якої — закласти важливу підвалину для створення української LLM.
Tereshchenko Blue Tokenizer
За основу було взято токенізатор Gemma-3, і для його українізації справді довелося виконати ювелірну роботу. Вдалося додати більше ніж 80 тисяч українських токенів, не змінюючи розмір оригінального словника (262 тисячі) та не видаливши зі словника Gemma-3 жодного англійського токена, жодного токена мов Європейського Союзу й навіть жодного турецького, вірменського чи грузинського)
Як це можливо?
Оригінальний словник Gemma-3 було проаналізовано на перетин з більш ніж 16-ма найбільш уживаними системами письма світу — від Сходу та арабських країн до Африки й племен Південної Америки. Це дало змогу вилучити потрібну кількість токенів (близько третини від розміру словника) що відносяться до мовних груп, культурно й географічно віддалених від України, і замінити лише їх!
Що маємо:
♣️ 81 492 нових кириличних сабвордів.
Навчені на 3 млн текстів з корпусу Malyuk + кириличній частині QIRIM — за допомогою «рідної» для Gemma-3 бібліотеки SentencePiece (ох, і мороки з нею було!).
♣️ Системи письма, що стали «донорами», видалялися лише частково. Повний перелік того, що прибрано і що залишилося, можна переглянути тут.
♣️ Усі незмінені токени зберегли свої ID, для них ембеддинги Gemma-3 підходять з коробки.
♣️ Розмір словника, спецтокени, пре/пост-процесинг і формат виходу — 1-в-1 із оригінальним токенізатором.
Вся ця краса вже доступна за посиланням:
https://huggingface.co/transhumanist-already-exists/tereshchenkoblue-tokenizer
За метрики традиційна подяка @Sofetory!
Tereshchenko Blue Tokenizer
За основу було взято токенізатор Gemma-3, і для його українізації справді довелося виконати ювелірну роботу. Вдалося додати більше ніж 80 тисяч українських токенів, не змінюючи розмір оригінального словника (262 тисячі) та не видаливши зі словника Gemma-3 жодного англійського токена, жодного токена мов Європейського Союзу й навіть жодного турецького, вірменського чи грузинського)
Як це можливо?
Оригінальний словник Gemma-3 було проаналізовано на перетин з більш ніж 16-ма найбільш уживаними системами письма світу — від Сходу та арабських країн до Африки й племен Південної Америки. Це дало змогу вилучити потрібну кількість токенів (близько третини від розміру словника) що відносяться до мовних груп, культурно й географічно віддалених від України, і замінити лише їх!
Що маємо:
♣️ 81 492 нових кириличних сабвордів.
Навчені на 3 млн текстів з корпусу Malyuk + кириличній частині QIRIM — за допомогою «рідної» для Gemma-3 бібліотеки SentencePiece (ох, і мороки з нею було!).
♣️ Системи письма, що стали «донорами», видалялися лише частково. Повний перелік того, що прибрано і що залишилося, можна переглянути тут.
♣️ Усі незмінені токени зберегли свої ID, для них ембеддинги Gemma-3 підходять з коробки.
♣️ Розмір словника, спецтокени, пре/пост-процесинг і формат виходу — 1-в-1 із оригінальним токенізатором.
Вся ця краса вже доступна за посиланням:
https://huggingface.co/transhumanist-already-exists/tereshchenkoblue-tokenizer
За метрики традиційна подяка @Sofetory!
🔥3❤1