Local Ai
443 subscribers
895 photos
250 videos
4 files
811 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
🎙 Offline Voice Input - Локальная транскрибация!

Голосовой ввод в автономном режиме обеспечивает профессиональный уровень преобразования речи в текст, работая полностью на вашем устройстве. Пишете ли вы электронные письма, делаете заметки или общаетесь в чате, ваши голосовые данные никогда не покидают ваш телефон.
Характеристики:
- Автономная транскрипция: использует модели глубокого обучения (Parakeet TDT) для полной расшифровки речи на устройстве.
- Поддерживаемые языки: болгарский, хорватский, чешский, датский, нидерландский, английский, эстонский, финский, французский, немецкий, греческий, венгерский, итальянский, латышский, литовский, мальтийский, польский, португальский, румынский, словацкий, словенский, испанский, шведский, русский, украинский
- Клавиатура с голосовым вводом Используйте свой голос для ввода текста.
- Субтитры в реальном времени: субтитры для любого аудио/видео, воспроизводимого на вашем устройстве.
- Конфиденциальность превыше всего: аудиоданные не покидают ваше устройство.

📱 https://play.google.com/store/apps/details?id=dev.notune.transcribe
⬇️ Скачать .APK v0.1.14
Проект: https://github.com/notune/android_transcribe_app

Еще есть: parakeet_transcribe https://github.com/RastislavKish/parakeet_transcribe
Многоязычная транскрипция аудио в текст с помощью Parakeet TDT (Восторг тут)
Аналоги по тегу: #Диктовка
#OfflineVoiceInput #transcribe #App #Android #Parakeet #транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💬 RTranslator — Приложение для локального перевода в реальном времени с открытым исходным кодом для Android

Это (почти) бесплатное офлайн-приложение для перевода в режиме реального времени с открытым исходным кодом для Android.

Подключитесь к тому, у кого есть это приложение, наденьте Bluetooth-наушники, положите телефон в карман, и вы сможете разговаривать так, будто собеседник говорит на вашем языке.
👉 Режим разговора
Режим «Разговор» — главная функция RTranslator. В этом режиме вы можете подключиться к другому телефону, на котором установлено это приложение. Если пользователь примет ваш запрос на подключение:

- Когда вы говорите, ваш телефон (или Bluetooth-гарнитура, если она подключена) записывает звук.
- Записанный звук преобразуется в текст и отправляется на телефон собеседника.
- Телефон собеседника переводит полученный текст на его язык.
- Телефон собеседника преобразует переведенный текст в аудио и воспроизводит его через динамик (или через Bluetooth-гарнитуру собеседника, если она подключена к его телефону).

Все это работает в обоих направлениях.

У каждого пользователя может быть несколько подключенных телефонов, что позволяет переводить разговоры между более чем двумя людьми в любой комбинации.

👉 Режим рации
Если режим разговора удобен для длительных бесед, то этот режим предназначен для коротких разговоров, например для того, чтобы узнать что-то на улице или поговорить с продавцом в магазине.

Этот режим переводит только разговоры между двумя людьми, он не работает с Bluetooth-гарнитурами, и вам придется говорить по очереди. Это не настоящий синхронный перевод, но он может работать с только одним телефоном.

В этом режиме микрофон смартфона будет одновременно прослушивать два языка (их можно выбрать на том же экране, что и режим рации).
Приложение определит, на каком языке говорит собеседник, переведет аудио на другой язык, преобразует текст в аудио и воспроизведет его через динамик телефона. После завершения преобразования текста в речь прослушивание возобновится автоматически.

👉 Режим перевода текста
Этот режим — обычный текстовый переводчик, но он всегда пригодится.

Поддерживаются следующие языки:
Арабский, болгарский, каталанский, китайский, хорватский, чешский, датский, нидерландский, английский, финский, французский, галисийский, немецкий, греческий, итальянский, японский, корейский, македонский, польский, португальский, румынский, русский, словацкий, испанский, шведский, тамильский, тайский, турецкий, украинский, урду, вьетнамский.

Скоро выйдет RTranslator 3.0!
🔗 https://github.com/niedev/RTranslator
⬇️ Скачать: https://github.com/niedev/RTranslator/releases/
Скачать .APK 2.1.5
#RTranslator #Android #AiTranslate #App #AiПеревод #Перевод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Qwen3.5-9B в тестах на распознавание документов: в чем он превосходит передовые модели, а в чем уступает.

Рейтинг систем интеллектуальной обработки документов https://idp-leaderboard.org

📊 Сравнение модель к модели Qwen3.5-9B vs Gemini 3.1 Pro: https://idp-leaderboard.org/compare/?models=qwen3-5-9b,gemini-3-1-pro
Во всех победах или матчах Qwen:

OlmOCR (извлечение текста из беспорядочных сканирований, плотных PDF-файлов, макетов с несколькими столбцами):

Qwen3.5-9B: 78.1
Qwen3.5-4B: 77.2
Gemini 3.1 Pro: 74.6
Клод Сонет 4.6: 74.4
Qwen3.5-2B: 73.7
GPT-5.4: 73.4

9B и 4B опережают все модели frontier по извлечению необработанного текста. Модель 2B соответствует GPT-5.4.

VQA (ответы на вопросы о содержании документов, диаграммах, таблицах):

Gemini 3.1 Pro: 85,0
Qwen3.5-9B: 79,5

GPT-5.4: 78,2
Qwen3.5-4B: 72,4
Claude Sonnet 4.6: 65,2
GPT-5.2: 63,5
Gemini 3 Flash: 63,5

Это больше всего удивило. По результатам VQA 9B уступает только Gemini 3.1 Pro. Она опережает GPT-5.4. Она на 14 баллов опережает Claude Sonnet и на 16 баллов опережает Gemini Flash. Такой результат VQA для открытой модели 9B сложно объяснить.

KIE (извлечение номеров счетов, дат, сумм):

Gemini 3 Flash: 91,1
Claude Opus 4.6: 89,8
Claude Sonnet 4.6: 89,5
GPT-5.2: 87,5
Gemini 3.1 Pro: 86,8
Qwen3.5-9B: 86,5
Qwen3.5-4B: 86,0
GPT-5.4: 85,7

Qwen-9B соответствует уровню Gemini 3.1 Pro.
Qwen-4B соответствует уровню GPT-5.4.
Оба опережают GPT-5-Mini (85,7), Claude Haiku (85,6) и Ministral-8B (85,7).

Там, где передовые модели явно лучше.

Извлечение данных из таблиц (GrITS):

Gemini 3.1 Pro: 96,4
Claude Sonnet: 96,3
GPT-5.4: 94,8
Gemini 3 Pro: 95,8
GPT-5.2: 86,0
Gemini 3 Flash: 85,6
Qwen3.5-4B: 76,7
Qwen3.5-9B: 76,6

Модели Frontier имеют от 85 до 96 баллов по шкале Qwen. Независимо от размера, Qwen у моделей 4B и 9B составляет от 76 до 77 баллов. По сути, эти модели идентичны. Похоже, это ограничение связано с архитектурой, а не с масштабом.

Распознавание рукописного текста:

Gemini 3.1 Pro: 82,8
Gemini 3 Flash: 81,7
GPT-4.1: 75,6
Claude Opus: 74,0
Claude Sonnet: 73,7
GPT-5.4: 69,1
Ministral-8B: 67,8
Qwen3.5-9B: 65,5
Qwen3.5-4B: 64,7

Gemini лучше распознает рукописный текст. Qwen отстает, но не сильно, от GPT-5.4 (69,1 против 65,5).

Масштабирование в рамках семейства Qwen:

В целом: 0,8B 58,0, 2B 63,2, 4B 73,1, 9B 77,0

Резюме:
Извлечение с помощью оптического распознавания символов: Qwen 4B/9B опережает все передовые модели
Рассуждения с помощью VQA: Qwen-9B занимает второе место, уступая только Gemini 3.1 Pro. Опережает GPT-5.4.
Извлечение полей KIE: Qwen 4B/9B не уступает передовым моделям
Извлечение таблиц: передовые модели опережают на 10–20 баллов

(Обсуждение)
#Qwen359B #OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Механизм логического вывода Bodega
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine

Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
💬 Переводчик LiveCaptions
Легкий и мощный инструмент для перевода аудио и речи в режиме реального времени на основе Windows LiveCaptions.

Встроенная в Windows функция LiveCaptions проста в использовании, не требует много ресурсов и обеспечивает чрезвычайно высокую точность распознавания. Если дополнить ее потрясающими возможностями перевода больших языковых моделей, вы получите... возможно, лучший на сегодняшний день переводчик в режиме реального времени!

🔗 https://github.com/SakiRinn/LiveCaptions-Translator
#Перевод #LiveCaptions #Translator #Windows #App #AiTranslate #AiПеревод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ️Модель: Fish Audio S2 — open-source модель для синтеза речи с живыми эмоциями

Fish Audio выпустили S2 — модель для синтеза речи, которая воспроизводит естественные эмоции. Всё открыто: можно запустить локально или протестировать бесплатно онлайн.

Работает просто: пишешь текст и вставляешь теги вроде [смеётся], [шёпот], [грустно], [удивлённо] — голос отыгрывает их как живой человек. Поддерживается больше 15 000 тегов. Модель обучена на 10+ миллионах часов аудио и понимает около 80 языков.

Для клонирования голоса хватит образца длиной до 30 секунд.

По тестам S2 обошла закрытые модели Google и OpenAI: в Audio Turing Test набрала 0.515 против 0.417 у Seed-TTS, а в EmergentTTS-Eval выиграла у GPT-4o-mini-TTS в 81.88% случаев.

Модель полностью открыта — доступны веса, код для дообучения и стриминговый движок на SGLang.
🔗 https://fish.audio/ru/s2/
https://github.com/fishaudio/fish-speech
https://huggingface.co/fishaudio/s2-pro
#FishAudioS2 #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ️Модель: 🎥 NVIDIA выпустила мультимодалку для видео на 8B параметров

NVILA-HD-Video обрабатывает видео в 4K с тысячей кадров. Технология AutoGaze вырезает из ролика повторяющиеся фрагменты — это ускоряет работу в 19 раз для ViT и в 10 раз для LLM.

Часовое 4K-видео модель обработала за 3,2 секунды. Ближайший конкурент Nemotron Nano 12B v2 VL потратил на это 61 секунду.

Результаты: лидирует на бенчмарке HLVid и показывает хорошую производительность на VideoMME.

🔗 https://autogaze.github.io/
https://github.com/NVlabs/VILA/tree/main/vila_hd/nvila_hd_video
https://huggingface.co/nvidia/NVILA-8B-HD-Video
https://huggingface.co/spaces/bfshi/AutoGaze
#NVILA8BHDVideo #NVIDIA #AiVideo #AutoGaze #VideoMME #HLVid #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍 Qavrn — это локальный механизм RAG (Retrieval-Augmented Generation), который индексирует ваши документы и позволяет задавать вопросы о них на естественном языке. Ответы основаны на реальных файлах с указанием источников и оценкой релевантности, а не на данных, полученных в результате обучения облачной модели. Данные не покидают ваш компьютер: никаких API-ключей, никакой телеметрии, никакого подключения к интернету после первоначальной настройки.
Возможности:
- Более 30 типов файлов: PDF, DOCX, Markdown, код, электронные письма, электронные книги, файлы конфигурации
- Семантический векторный поиск с помощью ChromaDB + преобразователи предложений
- Потоковая передача ответов с указанием источников и оценкой релевантности
- Файловый наблюдатель для автоматической переиндексации при изменениях
- Веб-интерфейс на localhost:8000 + нативное десктопное приложение через Tauri
- Никаких внешних зависимостей после первоначальной настройки
Стек: Python/FastAPI, React/TypeScript, ChromaDB, Ollama, Tauri

Настройка: клонирование, установка через pip, загрузка модели Ollama, запуск. Вот и всё.

🔗 https://github.com/mussussu/Qavrn
(Обсуждение)
Есть похожее и как готовое приложение: Hyperlink
#Qavrn #RAG #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 PersonaLLM - приложение для общения с персонажами (для ролевых игр) на iOS, которое поддерживает локальные модели, BYOK и RAG на устройстве!
Текстовые, графические и видеосервисы работают отдельно, так что вы можете комбинировать их по своему усмотрению. Подойдет любая API, совместимая с OpenAI, так что вы можете подключить свою систему Ollama/vLLM/LM Studio. Кроме того, есть модели MLX для полностью автономного чата. Qwen 3.5 на iPhone работает на удивление хорошо!

Другие локальные фишки:
- Встроенная память RAG — персонажи все запоминают, ничего не пропадает с вашего телефона
- Локальный ComfyUI для создания изображений и видео
- Встроенная система преобразования текста в речь Kokoroинтернет не нужен!
- Полный доступ к системным подсказкам, импорт TavernAI/SillyTavern, разветвленные диалоги!

Это бесплатно, никаких платных функций.

(Забавная штука: подключите свою локальную модель, выберите или создайте персонажа, включите автопилот и просто наблюдайте за развитием диалога.

Обратите внимание: генерация персонажей лучше всего работает с более мощной моделью. Вы можете использовать встроенные облачные кредиты (500 бесплатных, работают на Opus) или собственный ключ API для подключения подходящей модели. Более слабые локальные модели, скорее всего, не справятся с анализом выходного формата.)

🔗 https://personallm.app
⬇️ https://apps.apple.com/us/app/personallm/id6759881719
(Обсуждение)
#PersonaLLM #iPhone #App #Kokoro #SillyTavern #TavernAI #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Omnicoder-Claude-4.6-Opus-Uncensored-GGUF

Представляем модель OmniClaw, созданную на основе реальных Claude Code / Codex агентских сессий из коллекции наборов данных DataClaw.
🔗 https://huggingface.co/LuffyTheFox/OmniClaw-Claude-4.6-Opus-Uncensored-GGUF

Omnicoder в интерпретации Claude-4.6-Opus:
🔗 https://huggingface.co/LuffyTheFox/Omnicoder-Claude-4.6-Opus-Uncensored-GGUF

И модель OmniRP для литературного творчества и создания историй:
🔗 https://huggingface.co/LuffyTheFox/OmniRP-Claude-4.6-Opus-Uncensored-GGUF

❗️Все модели полностью без цензуры, ни один запрос не был отклонен!
Для всех моделей доступны только кванты Q8_0. Другие кванты имеют очень низкое качество.

Слияние моделей выполнено с помощью этого скрипта на Python: https://pastebin.com/xEP68vss
Сохранили структуру заголовка и метаданных GGUF для обеспечения совместимости.

Для Omnicoder объединили данные с помощью следующих моделей:

Последнее обновление для модели Jackrong, обученной на дистиллированном наборе данных от Claude-4.6-Opu:
🔗 https://huggingface.co/Jackrong/Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF

Модель HauhauCS Qwen 3.5 9B без цензуры
🔗 https://huggingface.co/HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive

Омникодер производства Tesslate:
🔗 https://huggingface.co/Tesslate/OmniCoder-9B-GGUF

Использовали квант Бартовски в качестве основы:
🔗 https://huggingface.co/bartowski/Qwen_Qwen3.5-9B-GGUF

Для OmniClaw объединили свой Omnicoder с этой моделью от empero-ai:
🔗 https://huggingface.co/empero-ai/Qwen3.5-9B-Claude-Code-GGUF

Для OmniRP объединили свой Omnicoder с моделью от nbeerbower:
🔗 https://huggingface.co/nbeerbower/Qwen3.5-9B-Writing-DPO

Считают, что это лучшее из того, что у нас есть на данный момент в плане UGI (Uncensored General Intelligence) для небольшой модели 9B на базе архитектуры Qwen 3.5 9B.

Модель не звучит как робот, у него хорошая система подсказок и обширные знания для модели 9B.

(Обсуждение)
#Omnicoder #Uncensored #OmniRP #OmniClaw #Qwen359B #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Lore readme-query-demo.gif
21.3 MB
📺 Lore - Захват и воспроизведение мыслей с помощью ИИ — полностью на вашем ПК.

Вызовите его одним нажатием клавиши, введите любую информацию, которую хотите запомнить, или обратитесь к своей памяти. Локальный агент LLM, который преобразует ваши знания в векторизованную базу данных. Полностью приватный, без использования облачных технологий. Создан для разработчиков.
Три вещи, которые нужно знать:
- Не отвлекайтесь. Нажмите глобальную комбинацию клавиш (Ctrl+Shift+Пробел), печатайте как обычно. Никакого форматирования, никаких папок, никаких решений. Просто записывайте.

- Он понимает, что вы имеете в виду. Lore автоматически классифицирует вводимые вами данные: сохраняет мысль, задает вопрос, управляет задачами или дает инструкции. Вам не нужно об этом думать.

- Все остается локальным. Конвейер RAG, векторный поиск и логический вывод на основе больших языковых моделей работают на вашем устройстве. Ничего не покидает пределы вашего компьютера.

Под капотом: Ollama обрабатывает большие языковые модели, а LanceDB обеспечивает локальное хранение векторных данных.

Lore — это лёгкое настольное приложение, которое находится в системном трее и позволяет одним нажатием кнопки открыть всплывающий чат для быстрого обмена мыслями. Оно использует локальную языковую модель (через Ollama) и локальную векторную базу данных (LanceDB) для хранения, обработки и извлечения вашей информации — никаких облачных сервисов, никаких API-ключей, полная конфиденциальность.

Считайте, что это ваша личная вторая память — место, где можно хранить все, что может понадобиться в будущем. От подробных инструкций, которые вы написали для себя, до списков дел, кратких описаний принятых решений, URL-адресов и даже того самого curl-запроса, который вы использовали для воспроизведения ошибки в продакшене. Все это можно упорядочить и мгновенно найти, просто описав на понятном языке — даже по дате или теме.

Ключевые особенности:
- Быстрый захват — нажмите глобальную комбинацию клавиш, чтобы открыть панель чата, введите мысль, и она будет мгновенно сохранена
- Умное воспроизведение — задавайте вопросы на естественном языке и получайте ответы на основе сохраненных мыслей
- Классификация ИИ — вводимые данные автоматически классифицируются как мысль, вопрос, команда или инструкция
- Управление задачами — добавляйте, составляйте списки, выполняйте и систематизируйте задачи с учетом приоритета и категорий
- Конвейер RAG — генерация с использованием извлеченных данных находит нужный контекст в ваших заметках, прежде чем дать ответ
- Полностью локальная обработка — все данные и обработка с помощью ИИ выполняются на вашем устройстве

Для Windows, macOS, Linux
🔗 https://github.com/ErezShahaf/Lore
⬇️ Скачать v0.1.0
(Обсуждение)
#Lore #LanceDB #Ollama #Windows #macOS #Linux #SoftAi #AiSoft #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Text-Generation-WebUi - локальный интерфейс LLM. Работа с текстом, визуализация, вызов инструментов, обучение и многое другое. 100 % автономная работа.

Выпущена версия text-generation-webui 4.1 с поддержкой вызова инструментов в пользовательском интерфейсе! Каждый инструмент — это всего лишь один файл .py. Установите флажок и нажмите «Отправить». Это так просто, что вы сами сможете создавать и использовать собственные функции.

🔗 https://github.com/oobabooga/text-generation-webui
🌐 Веб-интерфейс для генерации текста — расширение Deep Reason https://oobabooga.gumroad.com/l/deep_reason
(Обсуждение) (Обсуждение 2)
#TextGenerationWebUi #DeepReason #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM