27.06.2024 ⚜️ Большое обновление Google Translate: добавлено 110 новых языков!
Google Translate совершил своё крупнейшее обновление, добавив поддержку 110 новых языков.
🇷🇺 Добавленные языки народов России:
Abkhaz *, Avar, Bashkir, Buryat, Chechen, Chuvash, Crimean Tatar *, Komi, Meadow mari, Ossetian, Tuvan, Udmurt, Yakut
🧩 Как это работает?
Обновление стало возможным благодаря использованию модели PaLM 2, которая позволила более эффективно изучать родственные языки. Кроме того, Google активно сотрудничает с лингвистами и носителями языков, чтобы поддерживать разнообразие языковых вариантов и правописаний.
Это обновление является частью инициативы Google по поддержке 1000 наиболее распространённых языков в мире, и мы можем ожидать ещё больше обновлений в будущем.
Google Translate совершил своё крупнейшее обновление, добавив поддержку 110 новых языков.
🇷🇺 Добавленные языки народов России:
Abkhaz *, Avar, Bashkir, Buryat, Chechen, Chuvash, Crimean Tatar *, Komi, Meadow mari, Ossetian, Tuvan, Udmurt, Yakut
🧩 Как это работает?
Обновление стало возможным благодаря использованию модели PaLM 2, которая позволила более эффективно изучать родственные языки. Кроме того, Google активно сотрудничает с лингвистами и носителями языков, чтобы поддерживать разнообразие языковых вариантов и правописаний.
Это обновление является частью инициативы Google по поддержке 1000 наиболее распространённых языков в мире, и мы можем ожидать ещё больше обновлений в будущем.
❤11❤🔥4👍3🔥2
⚜️ Два диалекта черкесского языка присутствуют в Google Translate.
❗️Оказалось, что если ввести текст на кабардинском или адыгейском диалектах черкесского языка и выбрать один из нововведенных языков (абхазский, чеченский, осетинский, башкирский и т.д.), то текст будет переведен на выбранный язык. Переводчик справляется на "четверку", есть некоторые недоработки.
Вот что пишет Isaac R Caswell (инженер, курирующий проект по добавлению новых языков):
Источник: https://x.com/iseeaswell/
На данный момент нет официальных переводчиков переводящих с Черкесского на другие языки (не наоборот), и это неплохой инструмент для перевода текстов, однако в конечном итоге их надо форматировать. Разработки Google по добавлению новых языков, включая языки народов России, — отличная новость. Будем следить за дальнейшими обновлениями.
❗️Оказалось, что если ввести текст на кабардинском или адыгейском диалектах черкесского языка и выбрать один из нововведенных языков (абхазский, чеченский, осетинский, башкирский и т.д.), то текст будет переведен на выбранный язык. Переводчик справляется на "четверку", есть некоторые недоработки.
Вот что пишет Isaac R Caswell (инженер, курирующий проект по добавлению новых языков):
Я очень старался для Адыгейского и Кабардинского, но качество оказалось недостаточно высоким для запуска :( Я буду продолжать стараться!
Источник: https://x.com/iseeaswell/
На данный момент нет официальных переводчиков переводящих с Черкесского на другие языки (не наоборот), и это неплохой инструмент для перевода текстов, однако в конечном итоге их надо форматировать. Разработки Google по добавлению новых языков, включая языки народов России, — отличная новость. Будем следить за дальнейшими обновлениями.
❤12👍4🔥3
⚜️ Объявляем о начале работы над добавлением Кабардино-Черкесского и Карачаево-Балкарского языков в Яндекс.Переводчик. ⚜️
При поддержке Министерства по делам национальностей КБР КБРОО "Черкесский Ренессанс" приступает к реализации проекта по добавлению титульных языков Кабардино-Балкарской Республики в Яндекс.Переводчик. Для достижения этой цели нам необходимо собрать большую базу данных — корпус параллельных предложений на этих языках.
Руководителем программной части проекта буду я — Алим Мамхегов. На канале буду выкладывать процесс работы над этим и другими проектами, актуальные новости в мире информационных технологий и нейронных сетей. В ходе реализации проекта мы будем работать над большим спектром разных задач, об этом всём буду писать здесь.
Есть ещё одна цель, которую мы должны достичь, о ней распишу позже. А пока предлагаю ознакомиться с моими проектами:
🏮 Zədzək | Черкесский переводчик
🏮 Sezluk | Карачаево-Балкарский переводчик
При поддержке Министерства по делам национальностей КБР КБРОО "Черкесский Ренессанс" приступает к реализации проекта по добавлению титульных языков Кабардино-Балкарской Республики в Яндекс.Переводчик. Для достижения этой цели нам необходимо собрать большую базу данных — корпус параллельных предложений на этих языках.
Руководителем программной части проекта буду я — Алим Мамхегов. На канале буду выкладывать процесс работы над этим и другими проектами, актуальные новости в мире информационных технологий и нейронных сетей. В ходе реализации проекта мы будем работать над большим спектром разных задач, об этом всём буду писать здесь.
Есть ещё одна цель, которую мы должны достичь, о ней распишу позже. А пока предлагаю ознакомиться с моими проектами:
🏮 Zədzək | Черкесский переводчик
🏮 Sezluk | Карачаево-Балкарский переводчик
❤43👏16👍10❤🔥6🔥4🤔3👀3😁1
✨ Новая модель от OpenAI
OpenAI выпустила новую версию своей языковой модели ChatGPT -- она получила название GPT-4o mini. По словам компании, это самая функциональная и экономически эффективная малая модель, доступная на сегодняшний день. Эта модель пришла на замену GPT-3.5, её уже можно попробовать на официальном сайте. (Не забудьте включить VPN.)
🏮Проверил модель на знание двух диалектов Черкесского и Карачаево-Балкарского языков. Результат нулевой, чего и стоило ожидать. Пока нейросетям от OpenAI ещё далеко по знанию языков по сравнению с моделями Google и Anthropic.
OpenAI выпустила новую версию своей языковой модели ChatGPT -- она получила название GPT-4o mini. По словам компании, это самая функциональная и экономически эффективная малая модель, доступная на сегодняшний день. Эта модель пришла на замену GPT-3.5, её уже можно попробовать на официальном сайте. (Не забудьте включить VPN.)
🏮Проверил модель на знание двух диалектов Черкесского и Карачаево-Балкарского языков. Результат нулевой, чего и стоило ожидать. Пока нейросетям от OpenAI ещё далеко по знанию языков по сравнению с моделями Google и Anthropic.
❤15🔥8👍5❤🔥3
⚜️ Новая модель от компании MetaAI* Признана экстремистской организацией и запрещена в РФ
Meta* выпустила самую большую языковую модель с открытым кодом Llama 3.1 с 405 миллиардами параметров.
Источник: https://habr.com/
Проверил модель на знание кабардино-черкесского, карачаево-балкарского, абхазского, осетинского и чеченского языков. Есть некоторые намеки на то, что модель что-то понимает.
Llama 3.1 в большинстве случаев определяет язык текста, но правильно перевести не может.
Meta* выпустила самую большую языковую модель с открытым кодом Llama 3.1 с 405 миллиардами параметров.
Согласно текущим данным, Meta Llama 3.1 405B превзошла текущего лидера GPT-4o от OpenAI в нескольких ключевых тестах искусственного интеллекта.
Источник: https://habr.com/
Проверил модель на знание кабардино-черкесского, карачаево-балкарского, абхазского, осетинского и чеченского языков. Есть некоторые намеки на то, что модель что-то понимает.
Llama 3.1 в большинстве случаев определяет язык текста, но правильно перевести не может.
🔥13❤5❤🔥4
Дообучаю нейросеть m2m100 для перевода на кабардино-черкесский язык. Эта модель, специализированная для перевода текстов с одного языка на другой, находится в открытом доступе и позволяет обучать ее новым языкам. В процессе дообучения я использую параллельный корпус кабардино-черкесского языка, который состоит из 60 тысяч пар предложений. Однако этого объема недостаточно для достижения высокого качества перевода.
Существующая «Адыгэ» версия m2m100 неплохо переводит с множества языков на кабардино-черкесский, но я сосредоточен на обучении модели для обратного перевода — с кабардино-черкесского на другие языки. Для создания действительно качественного переводчика нам потребуется значительно больше данных, собирать их мы будем в ходе реализации проекта.
После завершения сбора и создания качественного корпуса параллельных данных, можно будет дообучать новое поколение модели m2m100 — nllb-200. Я уже пробовал дообучать её на имеющемся корпусе, попробовать можно по ссылке — https://huggingface.co/spaces/alimboff/nllb-200-kbd
Существующая «Адыгэ» версия m2m100 неплохо переводит с множества языков на кабардино-черкесский, но я сосредоточен на обучении модели для обратного перевода — с кабардино-черкесского на другие языки. Для создания действительно качественного переводчика нам потребуется значительно больше данных, собирать их мы будем в ходе реализации проекта.
После завершения сбора и создания качественного корпуса параллельных данных, можно будет дообучать новое поколение модели m2m100 — nllb-200. Я уже пробовал дообучать её на имеющемся корпусе, попробовать можно по ссылке — https://huggingface.co/spaces/alimboff/nllb-200-kbd
🔥16❤7👍6❤🔥2
Media is too big
VIEW IN TELEGRAM
⚜️ Презентовали проект по включению кабардино-черкесского языка в Яндекс.Переводчик в Министерстве просвещения и науки КБР перед министром по делам национальностей и общественным проектам КБР Курашиновым Анзором Владимировичем, заместителем министра просвещения и науки КБР Мисостовой Екатериной Николаевной, сотрудниками Кабардино-Балкарского филиала Российской Академии Наук, сотрудниками кафедры кабардино-черкесского языка и литературы КБГУ, преподавателями родных языков с районов КБР.
🏮 Поделились предысторией проекта и исторической важностью ее реализации. В современных реалиях недостаточен тот объем контента и использования традиционных инструментов на родном языке для полноценного владения и общения молодежью.
🏮 Показали разработанную систему перевода и проверки предложений для составления параллельного корпуса данных из 100.000 строк для Яндекс.Переводчика. Система максимально упрощает работу специалистов и ускоряет процесс сбора и обработки необходимых данных.
🏮 Поделились предысторией проекта и исторической важностью ее реализации. В современных реалиях недостаточен тот объем контента и использования традиционных инструментов на родном языке для полноценного владения и общения молодежью.
🏮 Показали разработанную систему перевода и проверки предложений для составления параллельного корпуса данных из 100.000 строк для Яндекс.Переводчика. Система максимально упрощает работу специалистов и ускоряет процесс сбора и обработки необходимых данных.
🔥32❤14❤🔥7👍6🤩2
⚜️ Обучил модель Zehedz на архитектуре BERT для классификации текстов на три языка: русский, черкесский и карачаево-балкарский. Модель предсказывает язык с точностью 99,8% (от 4 слов в предложении), что является отличным результатом. Среднее время предсказания составляет 0,008 секунд.
Для обучения использовалась база данных, состоящая из 36К предложений, по 12 тысяч на каждый язык.
🏮 Модель будет полезна для определения исходного языка в переводчиках, что позволяет автоматически выбирать целевой язык. Также модель хорошо подходит для задач, связанных с классификацией большого объёма перемешанных данных. Её размер составляет 47 МБ, что позволяет запускать модель почти мгновенно и не занимать оперативную память.
Пример кода для работы с моделью через API платформы Hugging Face:
⚜️ Ссылки ⚜️
🏮 Попробовать модель
🏮 База данных
🏮 Исходный файл модели
Для обучения использовалась база данных, состоящая из 36К предложений, по 12 тысяч на каждый язык.
🏮 Модель будет полезна для определения исходного языка в переводчиках, что позволяет автоматически выбирать целевой язык. Также модель хорошо подходит для задач, связанных с классификацией большого объёма перемешанных данных. Её размер составляет 47 МБ, что позволяет запускать модель почти мгновенно и не занимать оперативную память.
Пример кода для работы с моделью через API платформы Hugging Face:
from gradio_client import Client
client = Client("alimboff/zehedz")
result = client.predict(
text="Добрый день!",
api_name="/predict")
print(result)
⚜️ Ссылки ⚜️
🏮 Попробовать модель
🏮 База данных
🏮 Исходный файл модели
🔥14❤🔥7❤5👍3
Media is too big
VIEW IN TELEGRAM
⚜️ Представляю Вашему вниманию бота BzeGame для игры "Элиас (Крокодил)" на Кабардино-Черкесском языке!
Чтобы начать игру, добавьте бота в группу и предоставьте ему права администратора. Игрок, который запускает игру, становится ведущим и объясняет слова. В видеоролике подробно показано, как проходит игра.
Эта игра — отличный способ изучать новые слова и практиковать родной язык.
🏮 В будущих обновлениях планируется добавление новых языков!
Бот BzeGame для игры — https://t.me/BzeGameBot
| itbze |
Чтобы начать игру, добавьте бота в группу и предоставьте ему права администратора. Игрок, который запускает игру, становится ведущим и объясняет слова. В видеоролике подробно показано, как проходит игра.
Эта игра — отличный способ изучать новые слова и практиковать родной язык.
🏮 В будущих обновлениях планируется добавление новых языков!
Бот BzeGame для игры — https://t.me/BzeGameBot
| itbze |
🔥13❤10❤🔥9👍3
Существующие модели не умеют генерировать национальные костюмы и атрибуты, они изображают костюмы дальневосточных и северных народов.
Вдохновление идеей канала @qunash_anzor
| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥18❤11❤🔥7 1