itbze | IT & язык
1.29K subscribers
18 photos
8 videos
20 links
👋🏻 Добро пожаловать!

Здесь мы публикуем интересные новости из мира IT, NLP, AI и делимся прогрессом в наших проектах.
Download Telegram
⚜️ Объявляем о начале работы над добавлением Кабардино-Черкесского и Карачаево-Балкарского языков в Яндекс.Переводчик. ⚜️

При поддержке Министерства по делам национальностей КБР КБРОО "Черкесский Ренессанс" приступает к реализации проекта по добавлению титульных языков Кабардино-Балкарской Республики в Яндекс.Переводчик. Для достижения этой цели нам необходимо собрать большую базу данных — корпус параллельных предложений на этих языках.

Руководителем программной части проекта буду я — Алим Мамхегов. На канале буду выкладывать процесс работы над этим и другими проектами, актуальные новости в мире информационных технологий и нейронных сетей. В ходе реализации проекта мы будем работать над большим спектром разных задач, об этом всём буду писать здесь.

Есть ещё одна цель, которую мы должны достичь, о ней распишу позже. А пока предлагаю ознакомиться с моими проектами:

🏮 Zədzək | Черкесский переводчик

🏮
Sezluk | Карачаево-Балкарский переводчик
❤43👏16👍10❤‍🔥6🔥4🤔3👀3😁1
✨ Новая модель от OpenAI

OpenAI выпустила новую версию своей языковой модели ChatGPT -- она получила название GPT-4o mini. По словам компании, это самая функциональная и экономически эффективная малая модель, доступная на сегодняшний день. Эта модель пришла на замену GPT-3.5, её уже можно попробовать на официальном сайте. (Не забудьте включить VPN.)

🏮Проверил модель на знание двух диалектов Черкесского и Карачаево-Балкарского языков. Результат нулевой, чего и стоило ожидать. Пока нейросетям от OpenAI ещё далеко по знанию языков по сравнению с моделями Google и Anthropic.
❤15🔥8👍5❤‍🔥3
⚜️ Новая модель от компании MetaAI* Признана экстремистской организацией и запрещена в РФ

Meta* выпустила самую большую языковую модель с открытым кодом Llama 3.1 с 405 миллиардами параметров.

Согласно текущим данным, Meta Llama 3.1 405B превзошла текущего лидера GPT-4o от OpenAI в нескольких ключевых тестах искусственного интеллекта.

Источник: https://habr.com/

Проверил модель на знание кабардино-черкесского, карачаево-балкарского, абхазского, осетинского и чеченского языков. Есть некоторые намеки на то, что модель что-то понимает.
Llama 3.1 в большинстве случаев определяет язык текста, но правильно перевести не может.
🔥13❤5❤‍🔥4
Дообучаю нейросеть m2m100 для перевода на кабардино-черкесский язык. Эта модель, специализированная для перевода текстов с одного языка на другой, находится в открытом доступе и позволяет обучать ее новым языкам. В процессе дообучения я использую параллельный корпус кабардино-черкесского языка, который состоит из 60 тысяч пар предложений. Однако этого объема недостаточно для достижения высокого качества перевода.

Существующая «Адыгэ» версия m2m100 неплохо переводит с множества языков на кабардино-черкесский, но я сосредоточен на обучении модели для обратного перевода — с кабардино-черкесского на другие языки. Для создания действительно качественного переводчика нам потребуется значительно больше данных, собирать их мы будем в ходе реализации проекта.

После завершения сбора и создания качественного корпуса параллельных данных, можно будет дообучать новое поколение модели m2m100 — nllb-200. Я уже пробовал дообучать её на имеющемся корпусе, попробовать можно по ссылке — https://huggingface.co/spaces/alimboff/nllb-200-kbd
🔥16❤7👍6❤‍🔥2
Media is too big
VIEW IN TELEGRAM
⚜️ Презентовали проект по включению кабардино-черкесского языка в Яндекс.Переводчик в Министерстве просвещения и науки КБР перед министром по делам национальностей и общественным проектам КБР Курашиновым Анзором Владимировичем, заместителем министра просвещения и науки КБР Мисостовой Екатериной Николаевной, сотрудниками Кабардино-Балкарского филиала Российской Академии Наук, сотрудниками кафедры кабардино-черкесского языка и литературы КБГУ, преподавателями родных языков с районов КБР.

🏮 Поделились предысторией проекта и исторической важностью ее реализации. В современных реалиях недостаточен тот объем контента и использования традиционных инструментов на родном языке для полноценного владения и общения молодежью.

🏮 Показали разработанную систему перевода и проверки предложений для составления параллельного корпуса данных из 100.000 строк для Яндекс.Переводчика. Система максимально упрощает работу специалистов и ускоряет процесс сбора и обработки необходимых данных.
🔥32❤14❤‍🔥7👍6🤩2
⚜️ Обучил модель Zehedz на архитектуре BERT для классификации текстов на три языка: русский, черкесский и карачаево-балкарский. Модель предсказывает язык с точностью 99,8% (от 4 слов в предложении), что является отличным результатом. Среднее время предсказания составляет 0,008 секунд.

Для обучения использовалась база данных, состоящая из 36К предложений, по 12 тысяч на каждый язык.

🏮 Модель будет полезна для определения исходного языка в переводчиках, что позволяет автоматически выбирать целевой язык. Также модель хорошо подходит для задач, связанных с классификацией большого объёма перемешанных данных. Её размер составляет 47 МБ, что позволяет запускать модель почти мгновенно и не занимать оперативную память.

Пример кода для работы с моделью через API платформы Hugging Face:

from gradio_client import Client

client = Client("alimboff/zehedz")

result = client.predict(
text="Добрый день!",
api_name="/predict")

print(result)


⚜️ Ссылки ⚜️

🏮 Попробовать модель
🏮 База данных
🏮 Исходный файл модели
🔥14❤‍🔥7❤5👍3
Media is too big
VIEW IN TELEGRAM
⚜️ Представляю Вашему вниманию бота BzeGame для игры "Элиас (Крокодил)" на Кабардино-Черкесском языке!

Чтобы начать игру, добавьте бота в группу и предоставьте ему права администратора. Игрок, который запускает игру, становится ведущим и объясняет слова. В видеоролике подробно показано, как проходит игра.

Эта игра — отличный способ изучать новые слова и практиковать родной язык.

🏮 В будущих обновлениях планируется добавление новых языков!

Бот BzeGame для игры — https://t.me/BzeGameBot

| itbze |
🔥13❤10❤‍🔥9👍3
⚡️ Первые шаги по дообучению нейросети для генерации изображений.

Существующие модели не умеют генерировать национальные костюмы и атрибуты, они изображают костюмы дальневосточных и северных народов.

☄️ Обучение проводилось на базе модели FLUX, которая сейчас активно набирает популярность и показывает отличные результаты. Данные для обучения составлены из 110 выборочных изображений открытого датасета и дополнительных фотографий из интернета, изображающих национальные костюмы и атрибуты с текстовым описанием каждого из них.

☄️ Для обучения и использования моделей по генерации изображений требуется большое количество вычислительных ресурсов. Релиз модели в открытый доступ пока невозможен, так как необходимо установить цензуру и ограничения по содержанию запросов, которые исходят из этических норм народов Кавказа.

Вдохновление идеей канала @qunash_anzor

| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥18❤11❤‍🔥71
🗡 Первый Лезгинский переводчик

Lezghian Community дообучили(fine-tune) нейросеть на корпусе из 13.8К параллельных предложений. В качестве базовой модели используется NLLB-200, о которой писал ранее.

По итогам тестирования метрика BLEU показывает отметку в 27 единиц точности перевода с двух сторон (Русский, Лезгинский), что является достойным результатом для столь малого количества данных.

Эти результаты указывают на то, что модель может производить точные переводы для обеих языковых пар. Однако есть планы по дальнейшему улучшению модели путем параллельного выравнивания корпусов для улучшения сопоставления пар предложений. Кроме того, будут предприняты усилия по сбору большего количества обучающих данных для повышения производительности модели, особенно при обработке более разнообразных и сложных лингвистических структур.

— пишут авторы.

☄️ Попробовать модель
Please open Telegram to view this post
VIEW IN TELEGRAM
15❤‍🔥9🔥8❤3
⚜️ Обновление Zədzək — Черкесский переводчик ⚜️

Главное изменение: появилась возможность переводить предложения с Кабардино-Черкесского языка на Русский.

🏮 Теперь бот автоматически определяет язык введенного предложения и переводит на целевой. Почему раньше это не было возможным? Проблема заключалась в отсутствии качественного параллельного корпуса, что не позволяло добиться хороших результатов при переводе на русский язык.

🏮Новая версия нейросети — дообученная на 120 тыс. параллельных предложений модель nllb-200. По итогам тестирования метрики BLEU и CHRF++ показывают 26,5 и 48,6 соответственно. Это лучший результат, которого удалось достигнуть после множества попыток обучения. За этот месяц я попробовал десятки подходов к обучению и наконец могу заявить, что нашел оптимальный. Теперь остается только собирать и дальше параллельный корпус.

В настоящий момент ведется работа над глобальным обновлением — ожидайте в ближайшее время...

⚜️ Zədzək — Черкесский переводчик

| itbze |
1❤‍🔥38👍18🔥13❤3👏1
⚜️ 2 новых языка в BzeGame ⚜️

Черкесский (Кабардинский и Адыгейский) 🗡
Карачаево-Балкарский 🗡🗡
Осетинский (Иронский) 🤩

☄️ Бот для игры в Элиас(Крокодил) на родном языке, в котором уже был представлен Кабардинский диалект, показал хорошую активность и продемонстрировал интерес людей к играм на родном языке. Они играют, тренируют письменную речь, учатся объяснять слова на родном языке и расширяют словарный запас.

Теперь при добавлении бота в группу он сам предложит выбрать язык. Если захотите сменить язык игры — просто введите /lang

😉 Бот BzeGame — https://t.me/BzeGameBot

| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤‍🔥18🔥9❤5👍32
♟ В честь матча за звание чемпиона мира по шахматам Google запустили в Google Labs возможность поиграть в шахматы с Gemini, стилизовав их по текстовому запросу.

По запросу Caucasian Culture рисует весьма неплохие шахматные фигуры, стилизованные под национальные костюмы. Оппонента ИИ выбирает сам, в данном случае выбрал Японскую культуру со своими особенностями.

☄️ Интересно, что популярная модель по генерации изображений теперь корректно обрабатывает запросы, связанные с Кавказскими национальными костюмами.

Игра в шахматы со своим стилем — labs.google/genchess
Рекомендуется использовать VPN США

| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥21❤‍🔥109❤2👍1
⚜️ В 2024 году совместно с КБРОО "Черкесский ренессанс" при поддержке Министерства по делам национальностей КБР и Министерства просвещения КБР реализовали проекты: «Кабардинский язык для Яндекс.Переводчика» и «Нейросеть как инструмент межнационального общения».

В рамках данных проектов при участии специалистов, преподавателей кабардино-черкесского и карачаево-балкарского языков, были переведены корпуса из 100.000 предложений на два титульных языках КБР для добавления в Яндекс.Переводчик. В предстоящем году оба языка будут включены в платформу.

Параллельно с этим шла работа по обучению нейронных сетей вида LLM (Большая языковая модель), способных генерировать тексты на русском, кабардино-черкесском и балкарском языках.

Проект был презентован в 6 образовательных учреждениях города Нальчик.

⚜️ Данный проект имеет потенциал не только для сохранения титульных языков Кабардино-Балкарии, но и для их развития.
2❤‍🔥16❤13🔥8👍2
Media is too big
VIEW IN TELEGRAM
🌟 CircassianAI — Черкесский Искусственный Интеллект 🌟

СircassianAI — бета-версия модели нейронной сети, способной генерировать текст на русском и кабардино-черкесском языках.

Обучение CircassianAI проводилось на большом массиве данных, включающем как моноязычные тексты, так и параллельные корпусы на русском и кабардино-черкесском языках, что позволяет модели обеспечивать высокий уровень понимания контекста и точность генерации текста на обоих языках.

Обучалась нейронная сеть на 10.000 объемных текстах и 180.000 параллельных предложений на кабардино-черкесском языке. Благодарность хочется выразить преподавателям, помогающим в составлении и проверке корпуса. На основе данных так же был обновлен переводчик @zedzekbot

🏮Основной функционал CircassianAI:

☄️Ответы на вопросы:
Модель способна отвечать на любые вопросы, включая сложные темы, касающиеся языка, традиций, истории и культуры адыгов. Она станет незаменимым помощником для всех, кто интересуется черкесским наследием.

☄️ Генерация текстов:
CircassianAI может составлять тексты на различные темы, будь то статьи, эссе, рассказы или даже деловая переписка. Тексты создаются с учётом заданной тематики и стилистики.

☄️Ассистирование:
Модель выступает в роли интеллектуального помощника, способного помогать с обучением, переводом, созданием учебных материалов или решением повседневных задач, связанных с языком.

🌟 CircassianAI — это не просто модель искусственного интеллекта, это вклад в сохранение уникального культурного наследия адыгов. Благодаря своей гибкости и функциональности она станет незаменимым помощником для носителей языка, исследователей, преподавателей и всех, кто интересуется черкесской культурой.

❗️Это бета-версия. Возможны ошибки, о которых просим писать сюда @itbzefeedbackbot

👍 Telegram бот — @circassianAIbot

✅ Web сайт — https://circassian.ai

| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
3❤‍🔥29❤19🔥12👍4😁1
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 TauluAI — Балкарский Искусственный Интеллект 🌟

TauluAI — бета-версия модели нейронной сети, способной генерировать текст на русском и балкарском языках.

Обучалась нейронная сеть на 4.000 объемных текстах и 135.000 параллельных предложений на балкарском языке. Благодарность хочется выразить преподавателям, помогающим в составлении и проверке корпуса.

🤩 Обновлен бот @sezlukbot — Карачаево-Балкарский переводчик. Добавлен режим перевода полноценных предложений. Четверть взятого корпуса принадлежит Али Берберову и Богдану Теунаеву, который они собирали на протяжении трех лет. Их первый в мире Карачаево-Балкарский переводчик. Результаты их научной работы опубликованные в статье.

☄️ Модель способна отвечать на любые вопросы, включая сложные темы, касающиеся языка, традиций, истории и культуры балкарцев.
☄️ TauluAI может составлять тексты на различные темы, будь то статьи, эссе, рассказы или даже деловая переписка.

🏮Примеры использования TauluAI:

🔵Создание текстов на темы традиций, культуры и истории балкарцев.
🔵Перевод текстов с русского на балкарский и обратно.
🔵Разработка обучающих материалов для изучения языка.
🔵Помощь в подготовке публичных выступлений, написании статей и научных работ.

Качество генерации на балкарском языке среднее, ввиду нехватки объёма данных, однако модель передает смысл написанного текста. В настоящий момент ведется работа по сбору данных для улучшения качества.

❗️Это бета-версия. Возможны ошибки, о которых просим писать сюда @itbzefeedbackbot

👍 Telegram бот — @tauluAIbot

✅ Web сайт — https://taulu.ai

| itbze |
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥36❤19😁12👍5❤‍🔥2🤯1👀1
Media is too big
VIEW IN TELEGRAM
☄️ Возвращаемся с хорошими новостями.

Tərməsh | Circassian translator | Черкесский переводчик

☄️ Добавлен английский язык, как язык интерфейса. Включает словарь, перевод и голосовой режим. Для переключения языка нужно нажать на меню (слева от ввода) и выбрать /lang.

🙃 Добавление английского языка позволит адыгам со всего мира пользоваться переводчиком и изучать родной язык.

Для перевода одиночных слов, добавлены 4 словаря (kbd - eng; ady - eng)

🖥 Новое окно MiniApp(миниприложения) для удобного использования переводчика с графическим интерфейсом. Перевод осуществляется с минимальной задержкой, а при переводе одиночных слов снизу появляются вариации из словаря без переключения режимов. Работает пока только на русском языке. Голосовой режим находится в разработке.

⚠️ При возникновении ошибок или вопросов, просим обращаться в поддержку — @itbzefeedbackbot

Tərməsh | бот | miniapp

| itbze | IT & язык |
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥22❤1313🔥6👍4🤔1