💫 Статтю Model-Aware Tokenizer Transfer (MATT) Микола Гальтюка 👑 (з нашої команди) прийняли на NeurIPS 2026!
🧑💻Код: https://github.com/Goader/matt
📖 Стаття: https://arxiv.org/abs/2510.21954
Багато LLMs уже досить добре розуміють такі мови, як українська, але їхні токенайзери розбивають цей текст на набагато більшу кількість частин, ніж потрібно. Gemma 3 використовує приблизно в 1.5 раза більше токенів для української мови, ніж використовував би український токенізатор, тому кожен запит є повільнішим і дорожчим, ніж мав би бути.
Перейти на кращий токенізатор легко, але тоді модель не може розуміти свої нові токени, а її перетренування, як це роблять зазвичай - це повільно і дорого.
Оскільки модель уже добре володіє мовою, ми даємо їй змогу самій навчитися читати нові токени і розглядаємо tokenizer transfer як self-distillation. Оригінальна модель є вчителем, а та сама модель із новим токенізатором - студентом. Ми зіставляємо їхній attention, оскільки attention - це єдине місце, де токени обмінюються інформацією. Якщо нові токени впливають на решту тексту так само, як і старі, уся інша частина моделі продовжує працювати без змін.
Тренуються лише ембедінги нових токенів, і для цього достатньо кількох GPU-годин. Микола протестував це на Gemma 3 та Qwen 3 для української, арабської, німецької, японської мов та суахілі.
Завдяки MATT ми замінили 80 000 токенів на українські при створенні Lapa LLM, тож тепер український текст займає приблизно в 1.5 раза менше токенів і обробляється відповідно у стільки ж разів швидше.
🧑💻Код: https://github.com/Goader/matt
📖 Стаття: https://arxiv.org/abs/2510.21954
Багато LLMs уже досить добре розуміють такі мови, як українська, але їхні токенайзери розбивають цей текст на набагато більшу кількість частин, ніж потрібно. Gemma 3 використовує приблизно в 1.5 раза більше токенів для української мови, ніж використовував би український токенізатор, тому кожен запит є повільнішим і дорожчим, ніж мав би бути.
Перейти на кращий токенізатор легко, але тоді модель не може розуміти свої нові токени, а її перетренування, як це роблять зазвичай - це повільно і дорого.
Оскільки модель уже добре володіє мовою, ми даємо їй змогу самій навчитися читати нові токени і розглядаємо tokenizer transfer як self-distillation. Оригінальна модель є вчителем, а та сама модель із новим токенізатором - студентом. Ми зіставляємо їхній attention, оскільки attention - це єдине місце, де токени обмінюються інформацією. Якщо нові токени впливають на решту тексту так само, як і старі, уся інша частина моделі продовжує працювати без змін.
Тренуються лише ембедінги нових токенів, і для цього достатньо кількох GPU-годин. Микола протестував це на Gemma 3 та Qwen 3 для української, арабської, німецької, японської мов та суахілі.
Завдяки MATT ми замінили 80 000 токенів на українські при створенні Lapa LLM, тож тепер український текст займає приблизно в 1.5 раза менше токенів і обробляється відповідно у стільки ж разів швидше.
❤28❤🔥4
borscht.png
319.7 KB
🤔 Що думає Лапа? Артем Орловський з нашої команди натренував J-Lens (Jacobian Lens) — метод інтерпретації мовних моделей, який дозволяє побачити, які поняття представлені в їхніх внутрішніх активаціях під час обробки тексту. Він використовує усереднені матриці Якобі, щоб пов’язати активації різних шарів із токенами, появі яких вони можуть сприяти під час генерації. Це допомагає простежити формування проміжних понять, зокрема тих, які не з’являються у фінальній відповіді.
На демо можна подивитись, які концепти спрацьовують на якому шарі моделі, відповідно що впливає на її відповідь. Наводите мишкою і бачите що впливає на генерацію того чи іншого токена.
🕹 Have fun: https://huggingface.co/spaces/lapa-llm/lapa-j-lens-demo
На демо можна подивитись, які концепти спрацьовують на якому шарі моделі, відповідно що впливає на її відповідь. Наводите мишкою і бачите що впливає на генерацію того чи іншого токена.
🕹 Have fun: https://huggingface.co/spaces/lapa-llm/lapa-j-lens-demo
🔥20