Forwarded from Hacker News
Forwarded from Задуха
Новий, найкращий і, мабуть, останній токенізатор із цієї лінійки, призначення якої — закласти важливу підвалину для створення української LLM.
Tereshchenko Blue Tokenizer
За основу було взято токенізатор Gemma-3, і для його українізації справді довелося виконати ювелірну роботу. Вдалося додати більше ніж 80 тисяч українських токенів, не змінюючи розмір оригінального словника (262 тисячі) та не видаливши зі словника Gemma-3 жодного англійського токена, жодного токена мов Європейського Союзу й навіть жодного турецького, вірменського чи грузинського)
Як це можливо?
Оригінальний словник Gemma-3 було проаналізовано на перетин з більш ніж 16-ма найбільш уживаними системами письма світу — від Сходу та арабських країн до Африки й племен Південної Америки. Це дало змогу вилучити потрібну кількість токенів (близько третини від розміру словника) що відносяться до мовних груп, культурно й географічно віддалених від України, і замінити лише їх!
Що маємо:
♣️ 81 492 нових кириличних сабвордів.
Навчені на 3 млн текстів з корпусу Malyuk + кириличній частині QIRIM — за допомогою «рідної» для Gemma-3 бібліотеки SentencePiece (ох, і мороки з нею було!).
♣️ Системи письма, що стали «донорами», видалялися лише частково. Повний перелік того, що прибрано і що залишилося, можна переглянути тут.
♣️ Усі незмінені токени зберегли свої ID, для них ембеддинги Gemma-3 підходять з коробки.
♣️ Розмір словника, спецтокени, пре/пост-процесинг і формат виходу — 1-в-1 із оригінальним токенізатором.
Вся ця краса вже доступна за посиланням:
https://huggingface.co/transhumanist-already-exists/tereshchenkoblue-tokenizer
За метрики традиційна подяка @Sofetory!
Tereshchenko Blue Tokenizer
За основу було взято токенізатор Gemma-3, і для його українізації справді довелося виконати ювелірну роботу. Вдалося додати більше ніж 80 тисяч українських токенів, не змінюючи розмір оригінального словника (262 тисячі) та не видаливши зі словника Gemma-3 жодного англійського токена, жодного токена мов Європейського Союзу й навіть жодного турецького, вірменського чи грузинського)
Як це можливо?
Оригінальний словник Gemma-3 було проаналізовано на перетин з більш ніж 16-ма найбільш уживаними системами письма світу — від Сходу та арабських країн до Африки й племен Південної Америки. Це дало змогу вилучити потрібну кількість токенів (близько третини від розміру словника) що відносяться до мовних груп, культурно й географічно віддалених від України, і замінити лише їх!
Що маємо:
♣️ 81 492 нових кириличних сабвордів.
Навчені на 3 млн текстів з корпусу Malyuk + кириличній частині QIRIM — за допомогою «рідної» для Gemma-3 бібліотеки SentencePiece (ох, і мороки з нею було!).
♣️ Системи письма, що стали «донорами», видалялися лише частково. Повний перелік того, що прибрано і що залишилося, можна переглянути тут.
♣️ Усі незмінені токени зберегли свої ID, для них ембеддинги Gemma-3 підходять з коробки.
♣️ Розмір словника, спецтокени, пре/пост-процесинг і формат виходу — 1-в-1 із оригінальним токенізатором.
Вся ця краса вже доступна за посиланням:
https://huggingface.co/transhumanist-already-exists/tereshchenkoblue-tokenizer
За метрики традиційна подяка @Sofetory!
🔥3❤1