Local Ai
443 subscribers
895 photos
250 videos
4 files
811 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
Local Ai
🔈 LoopMaker — музыкальный генератор на основе ИИ для Mac (офлайн, безлимитный) LoopMaker - это нативное приложение для macOS, использующее современную музыкальную модель с ИИ. Опишите, что вы хотите, и LoopMaker создаст это локально, конфиденциально, за считанные…
This media is not supported in your browser
VIEW IN TELEGRAM
🎶 [Обновление] Качество звука в LoopMaker значительно улучшилось с момента этого поста. Сравнение в режиме реального времени.

Уже было о LoopMaker — нативном приложении для Mac, которое генерирует музыку локально на устройстве с помощью фреймворка Apple MLX. Вот что изменилось с тех пор.
Что улучшилось:
Самое большое изменение — переход на ACE-Step 1.5, новейшую музыкальную модель с открытым исходным кодом от ACE Studio. Эта модель по результатам тестирования на SongEval показала результаты между Suno v4.5 и v5, что является огромным скачком по сравнению с тем, на каком уровне находилась генерация локальной музыки еще месяц назад.

Конкретные улучшения качества:
- Разделение инструментов стало намного чище. Треки больше не звучат размыто или сжато
- Значительно улучшилась четкость и естественность вокала. Все еще не на уровне Suno v5, но теперь действительно приятно слушать
- Бас стал более плотным. 808-е и низкие частоты звучат как надо
- Высокочастотные детали (хай-хэты, тарелки, обертоны струнных) звучат более реалистично
- Структура песни на более длинных сессиях стала более целостной. Меньше случайных отклонений

Чем отличается архитектура новой модели:

В ACE-Step 1.5 используется гибридный подход, который отделяет планирование от рендеринга:

1) Языковая модель (на основе Qwen, 0,6–4 млрд параметров) отвечает за планирование песни с помощью метода Chain-of-Thought. Она принимает текстовое описание и создает полный план: темп, тональность, аранжировку, текст, стилистические характеристики.

2) Diffusion Transformer отвечает за синтез звука на основе этого шаблона

Такое разделение означает, что DiT не пытается одновременно понять ваш запрос и сгенерировать звук. Каждый компонент фокусируется на том, что у него получается лучше всего. Аналогичным образом разделение кодировщика текста и декодировщика изображений повысило качество SD-изображений.

Модель также использует внутреннее обучение с подкреплением для выравнивания, а не внешние модели вознаграждения. Без предвзятости в пользу RLHF. Это помогает обеспечить единообразие подсказок на более чем 50 языках.

Технические детали, которые важны для этого сабреддита:
- Модель работает через Apple MLX + графический процессор через Metal
- Требуется менее 8 ГБ памяти. Работает на базе M1/M2 с 16 ГБ памяти
- В модели реализована поддержка тонкой настройки LoRA (пока не в приложении, но в планах)
- Лицензия MIT, обучение на лицензионных и бесплатных данных

Над чем еще нужно поработать:
- Скорость генерации на MLX ниже, чем на CUDA. Минуты, а не секунды. Компромисс ради нативного интерфейса Mac
- Согласованность вокала может варьироваться в зависимости от поколения. Чувствительность к начальным данным по-прежнему высока (проблема «гача»)
- В приложении пока нет обучения с учителем. Если вы хотите провести тонкую настройку, вам нужно будет запустить необработанную модель через Python
- Некоторые жанры (особенно китайский рэп) проигрывают по сравнению с другими

🔗 https://3422223166764.gumroad.com/l/loopmaker
(Обсуждение)
#LoopMaker #ACEStep15 #ACEStep #Suno #AiMusic #AiSong #AiAudio #MacOS #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Holotron-12B — высокопроизводительную модель для эпохи компьютерных агентов

Это высокопроизводительная мультимодальная модель с открытым исходным кодом, разработанная совместно с NVIDIA специально для эпохи компьютерных агентов. (По производительности не уступает Holo2/Qwen, но в два раза превосходит их по пропускной способности)
Holotron-12B, обученная на основе открытой модели NVIDIA Nemotron-Nano-2 VL на собственной смеси данных H Company, является результатом тесного сотрудничества исследовательских лабораторий в разработке нового типа модели, оптимизированной в первую очередь для масштабирования и производительности в производственных условиях.

Почему создали Holotron-12B?:
Большинство современных мультимодальных моделей оптимизированы в первую очередь для статического зрения или выполнения инструкций. Однако у Holotron-12B, как и у модели Holo2, другая цель: служить в качестве модели принятия решений для компьютерных агентов, которые должны эффективно воспринимать, анализировать и действовать в интерактивных средах.

При разработке Holotron-12B стремились создать модель, которая могла бы эффективно масштабироваться в производственной среде, обрабатывая длинные контексты с несколькими изображениями, и при этом показывать хорошие результаты в тестах.

🤗Hugging Face: https://huggingface.co/Hcompany/Holotron-12B

📖Подробное техническое описание: https://hcompany.ai/holotron-12b
Пост: https://x.com/hcompany_ai/status/2033851052714320083
(Обсуждение)
#Holotron12B #NVIDIA #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎬 Переводчик в реальном времени — локальный ИИ-переводчик

Локальный инструмент для перевода в режиме реального времени с использованием ИИ и плавающим интерфейсом на базе Whisper и Qwen.
Realtime Interpreter — это полностью локальный инструмент для синхронного перевода с использованием искусственного интеллекта. Он может прослушивать системный звук или микрофонный ввод в режиме реального времени, использовать Whisper для распознавания речи, а затем задействовать локальную большую языковую модель (например, Qwen) для потокового перевода и, наконец, отображать двуязычные субтитры в независимом плавающем окне, которое всегда находится поверх других окон.

Ключевые особенности:
🏠 Полностью локальное приложение: не требует подключения к интернету, что обеспечивает конфиденциальность и исключает утечку данных.
⚡️ Перевод в режиме реального времени с низкой задержкой: от распознавания речи до перевода обычно проходит 2–4 секунды.
🪟 Независимое плавающее окно Always-On-Top: Субтитры с переводом отображаются поверх всех остальных окон, не мешая вашей работе (иногда оно может вести себя нестабильно, но просто перезапустите его, если оно исчезнет 🫠).
🌍 Поддержка 29 языков: от китайского до венгерского, включая большинство основных языков мира.
🎭 Оптимизация для конкретных сценариев: вводите подсказки для конкретных областей (например, «Нейронаука Массачусетского технологического института», «Корейские дорамы», «Непринужденный чат») для оптимизации качества перевода.
🔄 Горячая перезагрузка во время работы: переключайте языки, сценарии и источники аудиовхода на лету, без перезапуска.

🔗 https://github.com/GlitchyBlep/Realtime-AI-Translator
(Обсуждение)
#RealtimeInterpreter #Interpreter #Whisper #AiПеревод #Перевод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎙 Offline Voice Input - Локальная транскрибация!

Голосовой ввод в автономном режиме обеспечивает профессиональный уровень преобразования речи в текст, работая полностью на вашем устройстве. Пишете ли вы электронные письма, делаете заметки или общаетесь в чате, ваши голосовые данные никогда не покидают ваш телефон.
Характеристики:
- Автономная транскрипция: использует модели глубокого обучения (Parakeet TDT) для полной расшифровки речи на устройстве.
- Поддерживаемые языки: болгарский, хорватский, чешский, датский, нидерландский, английский, эстонский, финский, французский, немецкий, греческий, венгерский, итальянский, латышский, литовский, мальтийский, польский, португальский, румынский, словацкий, словенский, испанский, шведский, русский, украинский
- Клавиатура с голосовым вводом Используйте свой голос для ввода текста.
- Субтитры в реальном времени: субтитры для любого аудио/видео, воспроизводимого на вашем устройстве.
- Конфиденциальность превыше всего: аудиоданные не покидают ваше устройство.

📱 https://play.google.com/store/apps/details?id=dev.notune.transcribe
⬇️ Скачать .APK v0.1.14
Проект: https://github.com/notune/android_transcribe_app

Еще есть: parakeet_transcribe https://github.com/RastislavKish/parakeet_transcribe
Многоязычная транскрипция аудио в текст с помощью Parakeet TDT (Восторг тут)
Аналоги по тегу: #Диктовка
#OfflineVoiceInput #transcribe #App #Android #Parakeet #транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💬 RTranslator — Приложение для локального перевода в реальном времени с открытым исходным кодом для Android

Это (почти) бесплатное офлайн-приложение для перевода в режиме реального времени с открытым исходным кодом для Android.

Подключитесь к тому, у кого есть это приложение, наденьте Bluetooth-наушники, положите телефон в карман, и вы сможете разговаривать так, будто собеседник говорит на вашем языке.
👉 Режим разговора
Режим «Разговор» — главная функция RTranslator. В этом режиме вы можете подключиться к другому телефону, на котором установлено это приложение. Если пользователь примет ваш запрос на подключение:

- Когда вы говорите, ваш телефон (или Bluetooth-гарнитура, если она подключена) записывает звук.
- Записанный звук преобразуется в текст и отправляется на телефон собеседника.
- Телефон собеседника переводит полученный текст на его язык.
- Телефон собеседника преобразует переведенный текст в аудио и воспроизводит его через динамик (или через Bluetooth-гарнитуру собеседника, если она подключена к его телефону).

Все это работает в обоих направлениях.

У каждого пользователя может быть несколько подключенных телефонов, что позволяет переводить разговоры между более чем двумя людьми в любой комбинации.

👉 Режим рации
Если режим разговора удобен для длительных бесед, то этот режим предназначен для коротких разговоров, например для того, чтобы узнать что-то на улице или поговорить с продавцом в магазине.

Этот режим переводит только разговоры между двумя людьми, он не работает с Bluetooth-гарнитурами, и вам придется говорить по очереди. Это не настоящий синхронный перевод, но он может работать с только одним телефоном.

В этом режиме микрофон смартфона будет одновременно прослушивать два языка (их можно выбрать на том же экране, что и режим рации).
Приложение определит, на каком языке говорит собеседник, переведет аудио на другой язык, преобразует текст в аудио и воспроизведет его через динамик телефона. После завершения преобразования текста в речь прослушивание возобновится автоматически.

👉 Режим перевода текста
Этот режим — обычный текстовый переводчик, но он всегда пригодится.

Поддерживаются следующие языки:
Арабский, болгарский, каталанский, китайский, хорватский, чешский, датский, нидерландский, английский, финский, французский, галисийский, немецкий, греческий, итальянский, японский, корейский, македонский, польский, португальский, румынский, русский, словацкий, испанский, шведский, тамильский, тайский, турецкий, украинский, урду, вьетнамский.

Скоро выйдет RTranslator 3.0!
🔗 https://github.com/niedev/RTranslator
⬇️ Скачать: https://github.com/niedev/RTranslator/releases/
Скачать .APK 2.1.5
#RTranslator #Android #AiTranslate #App #AiПеревод #Перевод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Qwen3.5-9B в тестах на распознавание документов: в чем он превосходит передовые модели, а в чем уступает.

Рейтинг систем интеллектуальной обработки документов https://idp-leaderboard.org

📊 Сравнение модель к модели Qwen3.5-9B vs Gemini 3.1 Pro: https://idp-leaderboard.org/compare/?models=qwen3-5-9b,gemini-3-1-pro
Во всех победах или матчах Qwen:

OlmOCR (извлечение текста из беспорядочных сканирований, плотных PDF-файлов, макетов с несколькими столбцами):

Qwen3.5-9B: 78.1
Qwen3.5-4B: 77.2
Gemini 3.1 Pro: 74.6
Клод Сонет 4.6: 74.4
Qwen3.5-2B: 73.7
GPT-5.4: 73.4

9B и 4B опережают все модели frontier по извлечению необработанного текста. Модель 2B соответствует GPT-5.4.

VQA (ответы на вопросы о содержании документов, диаграммах, таблицах):

Gemini 3.1 Pro: 85,0
Qwen3.5-9B: 79,5

GPT-5.4: 78,2
Qwen3.5-4B: 72,4
Claude Sonnet 4.6: 65,2
GPT-5.2: 63,5
Gemini 3 Flash: 63,5

Это больше всего удивило. По результатам VQA 9B уступает только Gemini 3.1 Pro. Она опережает GPT-5.4. Она на 14 баллов опережает Claude Sonnet и на 16 баллов опережает Gemini Flash. Такой результат VQA для открытой модели 9B сложно объяснить.

KIE (извлечение номеров счетов, дат, сумм):

Gemini 3 Flash: 91,1
Claude Opus 4.6: 89,8
Claude Sonnet 4.6: 89,5
GPT-5.2: 87,5
Gemini 3.1 Pro: 86,8
Qwen3.5-9B: 86,5
Qwen3.5-4B: 86,0
GPT-5.4: 85,7

Qwen-9B соответствует уровню Gemini 3.1 Pro.
Qwen-4B соответствует уровню GPT-5.4.
Оба опережают GPT-5-Mini (85,7), Claude Haiku (85,6) и Ministral-8B (85,7).

Там, где передовые модели явно лучше.

Извлечение данных из таблиц (GrITS):

Gemini 3.1 Pro: 96,4
Claude Sonnet: 96,3
GPT-5.4: 94,8
Gemini 3 Pro: 95,8
GPT-5.2: 86,0
Gemini 3 Flash: 85,6
Qwen3.5-4B: 76,7
Qwen3.5-9B: 76,6

Модели Frontier имеют от 85 до 96 баллов по шкале Qwen. Независимо от размера, Qwen у моделей 4B и 9B составляет от 76 до 77 баллов. По сути, эти модели идентичны. Похоже, это ограничение связано с архитектурой, а не с масштабом.

Распознавание рукописного текста:

Gemini 3.1 Pro: 82,8
Gemini 3 Flash: 81,7
GPT-4.1: 75,6
Claude Opus: 74,0
Claude Sonnet: 73,7
GPT-5.4: 69,1
Ministral-8B: 67,8
Qwen3.5-9B: 65,5
Qwen3.5-4B: 64,7

Gemini лучше распознает рукописный текст. Qwen отстает, но не сильно, от GPT-5.4 (69,1 против 65,5).

Масштабирование в рамках семейства Qwen:

В целом: 0,8B 58,0, 2B 63,2, 4B 73,1, 9B 77,0

Резюме:
Извлечение с помощью оптического распознавания символов: Qwen 4B/9B опережает все передовые модели
Рассуждения с помощью VQA: Qwen-9B занимает второе место, уступая только Gemini 3.1 Pro. Опережает GPT-5.4.
Извлечение полей KIE: Qwen 4B/9B не уступает передовым моделям
Извлечение таблиц: передовые модели опережают на 10–20 баллов

(Обсуждение)
#Qwen359B #OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Механизм логического вывода Bodega
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine

Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
💬 Переводчик LiveCaptions
Легкий и мощный инструмент для перевода аудио и речи в режиме реального времени на основе Windows LiveCaptions.

Встроенная в Windows функция LiveCaptions проста в использовании, не требует много ресурсов и обеспечивает чрезвычайно высокую точность распознавания. Если дополнить ее потрясающими возможностями перевода больших языковых моделей, вы получите... возможно, лучший на сегодняшний день переводчик в режиме реального времени!

🔗 https://github.com/SakiRinn/LiveCaptions-Translator
#Перевод #LiveCaptions #Translator #Windows #App #AiTranslate #AiПеревод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ️Модель: Fish Audio S2 — open-source модель для синтеза речи с живыми эмоциями

Fish Audio выпустили S2 — модель для синтеза речи, которая воспроизводит естественные эмоции. Всё открыто: можно запустить локально или протестировать бесплатно онлайн.

Работает просто: пишешь текст и вставляешь теги вроде [смеётся], [шёпот], [грустно], [удивлённо] — голос отыгрывает их как живой человек. Поддерживается больше 15 000 тегов. Модель обучена на 10+ миллионах часов аудио и понимает около 80 языков.

Для клонирования голоса хватит образца длиной до 30 секунд.

По тестам S2 обошла закрытые модели Google и OpenAI: в Audio Turing Test набрала 0.515 против 0.417 у Seed-TTS, а в EmergentTTS-Eval выиграла у GPT-4o-mini-TTS в 81.88% случаев.

Модель полностью открыта — доступны веса, код для дообучения и стриминговый движок на SGLang.
🔗 https://fish.audio/ru/s2/
https://github.com/fishaudio/fish-speech
https://huggingface.co/fishaudio/s2-pro
#FishAudioS2 #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ️Модель: 🎥 NVIDIA выпустила мультимодалку для видео на 8B параметров

NVILA-HD-Video обрабатывает видео в 4K с тысячей кадров. Технология AutoGaze вырезает из ролика повторяющиеся фрагменты — это ускоряет работу в 19 раз для ViT и в 10 раз для LLM.

Часовое 4K-видео модель обработала за 3,2 секунды. Ближайший конкурент Nemotron Nano 12B v2 VL потратил на это 61 секунду.

Результаты: лидирует на бенчмарке HLVid и показывает хорошую производительность на VideoMME.

🔗 https://autogaze.github.io/
https://github.com/NVlabs/VILA/tree/main/vila_hd/nvila_hd_video
https://huggingface.co/nvidia/NVILA-8B-HD-Video
https://huggingface.co/spaces/bfshi/AutoGaze
#NVILA8BHDVideo #NVIDIA #AiVideo #AutoGaze #VideoMME #HLVid #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍 Qavrn — это локальный механизм RAG (Retrieval-Augmented Generation), который индексирует ваши документы и позволяет задавать вопросы о них на естественном языке. Ответы основаны на реальных файлах с указанием источников и оценкой релевантности, а не на данных, полученных в результате обучения облачной модели. Данные не покидают ваш компьютер: никаких API-ключей, никакой телеметрии, никакого подключения к интернету после первоначальной настройки.
Возможности:
- Более 30 типов файлов: PDF, DOCX, Markdown, код, электронные письма, электронные книги, файлы конфигурации
- Семантический векторный поиск с помощью ChromaDB + преобразователи предложений
- Потоковая передача ответов с указанием источников и оценкой релевантности
- Файловый наблюдатель для автоматической переиндексации при изменениях
- Веб-интерфейс на localhost:8000 + нативное десктопное приложение через Tauri
- Никаких внешних зависимостей после первоначальной настройки
Стек: Python/FastAPI, React/TypeScript, ChromaDB, Ollama, Tauri

Настройка: клонирование, установка через pip, загрузка модели Ollama, запуск. Вот и всё.

🔗 https://github.com/mussussu/Qavrn
(Обсуждение)
Есть похожее и как готовое приложение: Hyperlink
#Qavrn #RAG #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 PersonaLLM - приложение для общения с персонажами (для ролевых игр) на iOS, которое поддерживает локальные модели, BYOK и RAG на устройстве!
Текстовые, графические и видеосервисы работают отдельно, так что вы можете комбинировать их по своему усмотрению. Подойдет любая API, совместимая с OpenAI, так что вы можете подключить свою систему Ollama/vLLM/LM Studio. Кроме того, есть модели MLX для полностью автономного чата. Qwen 3.5 на iPhone работает на удивление хорошо!

Другие локальные фишки:
- Встроенная память RAG — персонажи все запоминают, ничего не пропадает с вашего телефона
- Локальный ComfyUI для создания изображений и видео
- Встроенная система преобразования текста в речь Kokoroинтернет не нужен!
- Полный доступ к системным подсказкам, импорт TavernAI/SillyTavern, разветвленные диалоги!

Это бесплатно, никаких платных функций.

(Забавная штука: подключите свою локальную модель, выберите или создайте персонажа, включите автопилот и просто наблюдайте за развитием диалога.

Обратите внимание: генерация персонажей лучше всего работает с более мощной моделью. Вы можете использовать встроенные облачные кредиты (500 бесплатных, работают на Opus) или собственный ключ API для подключения подходящей модели. Более слабые локальные модели, скорее всего, не справятся с анализом выходного формата.)

🔗 https://personallm.app
⬇️ https://apps.apple.com/us/app/personallm/id6759881719
(Обсуждение)
#PersonaLLM #iPhone #App #Kokoro #SillyTavern #TavernAI #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM