⚜️ Объявляем о начале работы над добавлением Кабардино-Черкесского и Карачаево-Балкарского языков в Яндекс.Переводчик. ⚜️
При поддержке Министерства по делам национальностей КБР КБРОО "Черкесский Ренессанс" приступает к реализации проекта по добавлению титульных языков Кабардино-Балкарской Республики в Яндекс.Переводчик. Для достижения этой цели нам необходимо собрать большую базу данных — корпус параллельных предложений на этих языках.
Руководителем программной части проекта буду я — Алим Мамхегов. На канале буду выкладывать процесс работы над этим и другими проектами, актуальные новости в мире информационных технологий и нейронных сетей. В ходе реализации проекта мы будем работать над большим спектром разных задач, об этом всём буду писать здесь.
Есть ещё одна цель, которую мы должны достичь, о ней распишу позже. А пока предлагаю ознакомиться с моими проектами:
🏮 Zədzək | Черкесский переводчик
🏮 Sezluk | Карачаево-Балкарский переводчик
При поддержке Министерства по делам национальностей КБР КБРОО "Черкесский Ренессанс" приступает к реализации проекта по добавлению титульных языков Кабардино-Балкарской Республики в Яндекс.Переводчик. Для достижения этой цели нам необходимо собрать большую базу данных — корпус параллельных предложений на этих языках.
Руководителем программной части проекта буду я — Алим Мамхегов. На канале буду выкладывать процесс работы над этим и другими проектами, актуальные новости в мире информационных технологий и нейронных сетей. В ходе реализации проекта мы будем работать над большим спектром разных задач, об этом всём буду писать здесь.
Есть ещё одна цель, которую мы должны достичь, о ней распишу позже. А пока предлагаю ознакомиться с моими проектами:
🏮 Zədzək | Черкесский переводчик
🏮 Sezluk | Карачаево-Балкарский переводчик
❤43👏16👍10❤🔥6🔥4🤔3👀3😁1
✨ Новая модель от OpenAI
OpenAI выпустила новую версию своей языковой модели ChatGPT -- она получила название GPT-4o mini. По словам компании, это самая функциональная и экономически эффективная малая модель, доступная на сегодняшний день. Эта модель пришла на замену GPT-3.5, её уже можно попробовать на официальном сайте. (Не забудьте включить VPN.)
🏮Проверил модель на знание двух диалектов Черкесского и Карачаево-Балкарского языков. Результат нулевой, чего и стоило ожидать. Пока нейросетям от OpenAI ещё далеко по знанию языков по сравнению с моделями Google и Anthropic.
OpenAI выпустила новую версию своей языковой модели ChatGPT -- она получила название GPT-4o mini. По словам компании, это самая функциональная и экономически эффективная малая модель, доступная на сегодняшний день. Эта модель пришла на замену GPT-3.5, её уже можно попробовать на официальном сайте. (Не забудьте включить VPN.)
🏮Проверил модель на знание двух диалектов Черкесского и Карачаево-Балкарского языков. Результат нулевой, чего и стоило ожидать. Пока нейросетям от OpenAI ещё далеко по знанию языков по сравнению с моделями Google и Anthropic.
❤15🔥8👍5❤🔥3
⚜️ Новая модель от компании MetaAI* Признана экстремистской организацией и запрещена в РФ
Meta* выпустила самую большую языковую модель с открытым кодом Llama 3.1 с 405 миллиардами параметров.
Источник: https://habr.com/
Проверил модель на знание кабардино-черкесского, карачаево-балкарского, абхазского, осетинского и чеченского языков. Есть некоторые намеки на то, что модель что-то понимает.
Llama 3.1 в большинстве случаев определяет язык текста, но правильно перевести не может.
Meta* выпустила самую большую языковую модель с открытым кодом Llama 3.1 с 405 миллиардами параметров.
Согласно текущим данным, Meta Llama 3.1 405B превзошла текущего лидера GPT-4o от OpenAI в нескольких ключевых тестах искусственного интеллекта.
Источник: https://habr.com/
Проверил модель на знание кабардино-черкесского, карачаево-балкарского, абхазского, осетинского и чеченского языков. Есть некоторые намеки на то, что модель что-то понимает.
Llama 3.1 в большинстве случаев определяет язык текста, но правильно перевести не может.
🔥13❤5❤🔥4
Дообучаю нейросеть m2m100 для перевода на кабардино-черкесский язык. Эта модель, специализированная для перевода текстов с одного языка на другой, находится в открытом доступе и позволяет обучать ее новым языкам. В процессе дообучения я использую параллельный корпус кабардино-черкесского языка, который состоит из 60 тысяч пар предложений. Однако этого объема недостаточно для достижения высокого качества перевода.
Существующая «Адыгэ» версия m2m100 неплохо переводит с множества языков на кабардино-черкесский, но я сосредоточен на обучении модели для обратного перевода — с кабардино-черкесского на другие языки. Для создания действительно качественного переводчика нам потребуется значительно больше данных, собирать их мы будем в ходе реализации проекта.
После завершения сбора и создания качественного корпуса параллельных данных, можно будет дообучать новое поколение модели m2m100 — nllb-200. Я уже пробовал дообучать её на имеющемся корпусе, попробовать можно по ссылке — https://huggingface.co/spaces/alimboff/nllb-200-kbd
Существующая «Адыгэ» версия m2m100 неплохо переводит с множества языков на кабардино-черкесский, но я сосредоточен на обучении модели для обратного перевода — с кабардино-черкесского на другие языки. Для создания действительно качественного переводчика нам потребуется значительно больше данных, собирать их мы будем в ходе реализации проекта.
После завершения сбора и создания качественного корпуса параллельных данных, можно будет дообучать новое поколение модели m2m100 — nllb-200. Я уже пробовал дообучать её на имеющемся корпусе, попробовать можно по ссылке — https://huggingface.co/spaces/alimboff/nllb-200-kbd
🔥16❤7👍6❤🔥2
Media is too big
VIEW IN TELEGRAM
⚜️ Презентовали проект по включению кабардино-черкесского языка в Яндекс.Переводчик в Министерстве просвещения и науки КБР перед министром по делам национальностей и общественным проектам КБР Курашиновым Анзором Владимировичем, заместителем министра просвещения и науки КБР Мисостовой Екатериной Николаевной, сотрудниками Кабардино-Балкарского филиала Российской Академии Наук, сотрудниками кафедры кабардино-черкесского языка и литературы КБГУ, преподавателями родных языков с районов КБР.
🏮 Поделились предысторией проекта и исторической важностью ее реализации. В современных реалиях недостаточен тот объем контента и использования традиционных инструментов на родном языке для полноценного владения и общения молодежью.
🏮 Показали разработанную систему перевода и проверки предложений для составления параллельного корпуса данных из 100.000 строк для Яндекс.Переводчика. Система максимально упрощает работу специалистов и ускоряет процесс сбора и обработки необходимых данных.
🏮 Поделились предысторией проекта и исторической важностью ее реализации. В современных реалиях недостаточен тот объем контента и использования традиционных инструментов на родном языке для полноценного владения и общения молодежью.
🏮 Показали разработанную систему перевода и проверки предложений для составления параллельного корпуса данных из 100.000 строк для Яндекс.Переводчика. Система максимально упрощает работу специалистов и ускоряет процесс сбора и обработки необходимых данных.
🔥32❤14❤🔥7👍6🤩2
⚜️ Обучил модель Zehedz на архитектуре BERT для классификации текстов на три языка: русский, черкесский и карачаево-балкарский. Модель предсказывает язык с точностью 99,8% (от 4 слов в предложении), что является отличным результатом. Среднее время предсказания составляет 0,008 секунд.
Для обучения использовалась база данных, состоящая из 36К предложений, по 12 тысяч на каждый язык.
🏮 Модель будет полезна для определения исходного языка в переводчиках, что позволяет автоматически выбирать целевой язык. Также модель хорошо подходит для задач, связанных с классификацией большого объёма перемешанных данных. Её размер составляет 47 МБ, что позволяет запускать модель почти мгновенно и не занимать оперативную память.
Пример кода для работы с моделью через API платформы Hugging Face:
⚜️ Ссылки ⚜️
🏮 Попробовать модель
🏮 База данных
🏮 Исходный файл модели
Для обучения использовалась база данных, состоящая из 36К предложений, по 12 тысяч на каждый язык.
🏮 Модель будет полезна для определения исходного языка в переводчиках, что позволяет автоматически выбирать целевой язык. Также модель хорошо подходит для задач, связанных с классификацией большого объёма перемешанных данных. Её размер составляет 47 МБ, что позволяет запускать модель почти мгновенно и не занимать оперативную память.
Пример кода для работы с моделью через API платформы Hugging Face:
from gradio_client import Client
client = Client("alimboff/zehedz")
result = client.predict(
text="Добрый день!",
api_name="/predict")
print(result)
⚜️ Ссылки ⚜️
🏮 Попробовать модель
🏮 База данных
🏮 Исходный файл модели
🔥14❤🔥7❤5👍3
Media is too big
VIEW IN TELEGRAM
⚜️ Представляю Вашему вниманию бота BzeGame для игры "Элиас (Крокодил)" на Кабардино-Черкесском языке!
Чтобы начать игру, добавьте бота в группу и предоставьте ему права администратора. Игрок, который запускает игру, становится ведущим и объясняет слова. В видеоролике подробно показано, как проходит игра.
Эта игра — отличный способ изучать новые слова и практиковать родной язык.
🏮 В будущих обновлениях планируется добавление новых языков!
Бот BzeGame для игры — https://t.me/BzeGameBot
| itbze |
Чтобы начать игру, добавьте бота в группу и предоставьте ему права администратора. Игрок, который запускает игру, становится ведущим и объясняет слова. В видеоролике подробно показано, как проходит игра.
Эта игра — отличный способ изучать новые слова и практиковать родной язык.
🏮 В будущих обновлениях планируется добавление новых языков!
Бот BzeGame для игры — https://t.me/BzeGameBot
| itbze |
🔥13❤10❤🔥9👍3
Существующие модели не умеют генерировать национальные костюмы и атрибуты, они изображают костюмы дальневосточных и северных народов.
Вдохновление идеей канала @qunash_anzor
| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥18❤11❤🔥7 1
Lezghian Community дообучили(fine-tune) нейросеть на корпусе из 13.8К параллельных предложений. В качестве базовой модели используется NLLB-200, о которой писал ранее.
По итогам тестирования метрика BLEU показывает отметку в 27 единиц точности перевода с двух сторон (Русский, Лезгинский), что является достойным результатом для столь малого количества данных.
Эти результаты указывают на то, что модель может производить точные переводы для обеих языковых пар. Однако есть планы по дальнейшему улучшению модели путем параллельного выравнивания корпусов для улучшения сопоставления пар предложений. Кроме того, будут предприняты усилия по сбору большего количества обучающих данных для повышения производительности модели, особенно при обработке более разнообразных и сложных лингвистических структур.
— пишут авторы.
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
Lezghian Nllb 200 Distilled 600M - a Hugging Face Space by leks-forever
Discover amazing ML apps made by the community
⚜️ Обновление Zədzək — Черкесский переводчик ⚜️
Главное изменение: появилась возможность переводить предложения с Кабардино-Черкесского языка на Русский.
🏮 Теперь бот автоматически определяет язык введенного предложения и переводит на целевой. Почему раньше это не было возможным? Проблема заключалась в отсутствии качественного параллельного корпуса, что не позволяло добиться хороших результатов при переводе на русский язык.
🏮Новая версия нейросети — дообученная на 120 тыс. параллельных предложений модель nllb-200. По итогам тестирования метрики BLEU и CHRF++ показывают 26,5 и 48,6 соответственно. Это лучший результат, которого удалось достигнуть после множества попыток обучения. За этот месяц я попробовал десятки подходов к обучению и наконец могу заявить, что нашел оптимальный. Теперь остается только собирать и дальше параллельный корпус.
В настоящий момент ведется работа над глобальным обновлением — ожидайте в ближайшее время...
⚜️ Zədzək — Черкесский переводчик
| itbze |
Главное изменение: появилась возможность переводить предложения с Кабардино-Черкесского языка на Русский.
🏮 Теперь бот автоматически определяет язык введенного предложения и переводит на целевой. Почему раньше это не было возможным? Проблема заключалась в отсутствии качественного параллельного корпуса, что не позволяло добиться хороших результатов при переводе на русский язык.
🏮Новая версия нейросети — дообученная на 120 тыс. параллельных предложений модель nllb-200. По итогам тестирования метрики BLEU и CHRF++ показывают 26,5 и 48,6 соответственно. Это лучший результат, которого удалось достигнуть после множества попыток обучения. За этот месяц я попробовал десятки подходов к обучению и наконец могу заявить, что нашел оптимальный. Теперь остается только собирать и дальше параллельный корпус.
В настоящий момент ведется работа над глобальным обновлением — ожидайте в ближайшее время...
⚜️ Zədzək — Черкесский переводчик
| itbze |
Telegram
Zədzək | Черкесский переводчик
Zədzək | Черкесский переводчик с искусственным интеллектом
Канал — https://t.me/itbze
Для связи — @itbzefeedbackbot
Канал — https://t.me/itbze
Для связи — @itbzefeedbackbot
1❤🔥38👍18🔥13❤3👏1
⚜️ 2 новых языка в BzeGame ⚜️
Черкесский (Кабардинский и Адыгейский)🗡
Карачаево-Балкарский🗡 🗡
Осетинский (Иронский)🤩
☄️ Бот для игры в Элиас(Крокодил) на родном языке, в котором уже был представлен Кабардинский диалект, показал хорошую активность и продемонстрировал интерес людей к играм на родном языке. Они играют, тренируют письменную речь, учатся объяснять слова на родном языке и расширяют словарный запас.
Теперь при добавлении бота в группу он сам предложит выбрать язык. Если захотите сменить язык игры — просто введите /lang
😉 Бот BzeGame — https://t.me/BzeGameBot
| itbze |
Черкесский (Кабардинский и Адыгейский)
Карачаево-Балкарский
Осетинский (Иронский)
Теперь при добавлении бота в группу он сам предложит выбрать язык. Если захотите сменить язык игры — просто введите /lang
| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤🔥18🔥9❤5👍3 2
По запросу Caucasian Culture рисует весьма неплохие шахматные фигуры, стилизованные под национальные костюмы. Оппонента ИИ выбирает сам, в данном случае выбрал Японскую культуру со своими особенностями.
Игра в шахматы со своим стилем — labs.google/genchess
Рекомендуется использовать VPN США
| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥21❤🔥10 9❤2👍1
⚜️ В 2024 году совместно с КБРОО "Черкесский ренессанс" при поддержке Министерства по делам национальностей КБР и Министерства просвещения КБР реализовали проекты: «Кабардинский язык для Яндекс.Переводчика» и «Нейросеть как инструмент межнационального общения».
В рамках данных проектов при участии специалистов, преподавателей кабардино-черкесского и карачаево-балкарского языков, были переведены корпуса из 100.000 предложений на два титульных языках КБР для добавления в Яндекс.Переводчик. В предстоящем году оба языка будут включены в платформу.
Параллельно с этим шла работа по обучению нейронных сетей вида LLM (Большая языковая модель), способных генерировать тексты на русском, кабардино-черкесском и балкарском языках.
Проект был презентован в 6 образовательных учреждениях города Нальчик.
⚜️ Данный проект имеет потенциал не только для сохранения титульных языков Кабардино-Балкарии, но и для их развития.
В рамках данных проектов при участии специалистов, преподавателей кабардино-черкесского и карачаево-балкарского языков, были переведены корпуса из 100.000 предложений на два титульных языках КБР для добавления в Яндекс.Переводчик. В предстоящем году оба языка будут включены в платформу.
Параллельно с этим шла работа по обучению нейронных сетей вида LLM (Большая языковая модель), способных генерировать тексты на русском, кабардино-черкесском и балкарском языках.
Проект был презентован в 6 образовательных учреждениях города Нальчик.
⚜️ Данный проект имеет потенциал не только для сохранения титульных языков Кабардино-Балкарии, но и для их развития.
2❤🔥16❤13🔥8👍2
Media is too big
VIEW IN TELEGRAM
СircassianAI — бета-версия модели нейронной сети, способной генерировать текст на русском и кабардино-черкесском языках.
Обучение CircassianAI проводилось на большом массиве данных, включающем как моноязычные тексты, так и параллельные корпусы на русском и кабардино-черкесском языках, что позволяет модели обеспечивать высокий уровень понимания контекста и точность генерации текста на обоих языках.
Обучалась нейронная сеть на 10.000 объемных текстах и 180.000 параллельных предложений на кабардино-черкесском языке. Благодарность хочется выразить преподавателям, помогающим в составлении и проверке корпуса. На основе данных так же был обновлен переводчик @zedzekbot
🏮Основной функционал CircassianAI:
Модель способна отвечать на любые вопросы, включая сложные темы, касающиеся языка, традиций, истории и культуры адыгов. Она станет незаменимым помощником для всех, кто интересуется черкесским наследием.
CircassianAI может составлять тексты на различные темы, будь то статьи, эссе, рассказы или даже деловая переписка. Тексты создаются с учётом заданной тематики и стилистики.
Модель выступает в роли интеллектуального помощника, способного помогать с обучением, переводом, созданием учебных материалов или решением повседневных задач, связанных с языком.
| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
3❤🔥29❤19🔥12👍4😁1
This media is not supported in your browser
VIEW IN TELEGRAM
TauluAI — бета-версия модели нейронной сети, способной генерировать текст на русском и балкарском языках.
Обучалась нейронная сеть на 4.000 объемных текстах и 135.000 параллельных предложений на балкарском языке. Благодарность хочется выразить преподавателям, помогающим в составлении и проверке корпуса.
🏮Примеры использования TauluAI:
Качество генерации на балкарском языке среднее, ввиду нехватки объёма данных, однако модель передает смысл написанного текста. В настоящий момент ведется работа по сбору данных для улучшения качества.
| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥36❤19😁12👍5❤🔥2🤯1👀1
Media is too big
VIEW IN TELEGRAM
Tərməsh | Circassian translator | Черкесский переводчик
Для перевода одиночных слов, добавлены 4 словаря (kbd - eng; ady - eng)
Tərməsh | бот | miniapp
| itbze | IT & язык |
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥22❤13 13🔥6👍4🤔1