Local Ai
443 subscribers
909 photos
251 videos
4 files
813 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
Модель: Qwen3.5-9B в тестах на распознавание документов: в чем он превосходит передовые модели, а в чем уступает.

Рейтинг систем интеллектуальной обработки документов https://idp-leaderboard.org

📊 Сравнение модель к модели Qwen3.5-9B vs Gemini 3.1 Pro: https://idp-leaderboard.org/compare/?models=qwen3-5-9b,gemini-3-1-pro
Во всех победах или матчах Qwen:

OlmOCR (извлечение текста из беспорядочных сканирований, плотных PDF-файлов, макетов с несколькими столбцами):

Qwen3.5-9B: 78.1
Qwen3.5-4B: 77.2
Gemini 3.1 Pro: 74.6
Клод Сонет 4.6: 74.4
Qwen3.5-2B: 73.7
GPT-5.4: 73.4

9B и 4B опережают все модели frontier по извлечению необработанного текста. Модель 2B соответствует GPT-5.4.

VQA (ответы на вопросы о содержании документов, диаграммах, таблицах):

Gemini 3.1 Pro: 85,0
Qwen3.5-9B: 79,5

GPT-5.4: 78,2
Qwen3.5-4B: 72,4
Claude Sonnet 4.6: 65,2
GPT-5.2: 63,5
Gemini 3 Flash: 63,5

Это больше всего удивило. По результатам VQA 9B уступает только Gemini 3.1 Pro. Она опережает GPT-5.4. Она на 14 баллов опережает Claude Sonnet и на 16 баллов опережает Gemini Flash. Такой результат VQA для открытой модели 9B сложно объяснить.

KIE (извлечение номеров счетов, дат, сумм):

Gemini 3 Flash: 91,1
Claude Opus 4.6: 89,8
Claude Sonnet 4.6: 89,5
GPT-5.2: 87,5
Gemini 3.1 Pro: 86,8
Qwen3.5-9B: 86,5
Qwen3.5-4B: 86,0
GPT-5.4: 85,7

Qwen-9B соответствует уровню Gemini 3.1 Pro.
Qwen-4B соответствует уровню GPT-5.4.
Оба опережают GPT-5-Mini (85,7), Claude Haiku (85,6) и Ministral-8B (85,7).

Там, где передовые модели явно лучше.

Извлечение данных из таблиц (GrITS):

Gemini 3.1 Pro: 96,4
Claude Sonnet: 96,3
GPT-5.4: 94,8
Gemini 3 Pro: 95,8
GPT-5.2: 86,0
Gemini 3 Flash: 85,6
Qwen3.5-4B: 76,7
Qwen3.5-9B: 76,6

Модели Frontier имеют от 85 до 96 баллов по шкале Qwen. Независимо от размера, Qwen у моделей 4B и 9B составляет от 76 до 77 баллов. По сути, эти модели идентичны. Похоже, это ограничение связано с архитектурой, а не с масштабом.

Распознавание рукописного текста:

Gemini 3.1 Pro: 82,8
Gemini 3 Flash: 81,7
GPT-4.1: 75,6
Claude Opus: 74,0
Claude Sonnet: 73,7
GPT-5.4: 69,1
Ministral-8B: 67,8
Qwen3.5-9B: 65,5
Qwen3.5-4B: 64,7

Gemini лучше распознает рукописный текст. Qwen отстает, но не сильно, от GPT-5.4 (69,1 против 65,5).

Масштабирование в рамках семейства Qwen:

В целом: 0,8B 58,0, 2B 63,2, 4B 73,1, 9B 77,0

Резюме:
Извлечение с помощью оптического распознавания символов: Qwen 4B/9B опережает все передовые модели
Рассуждения с помощью VQA: Qwen-9B занимает второе место, уступая только Gemini 3.1 Pro. Опережает GPT-5.4.
Извлечение полей KIE: Qwen 4B/9B не уступает передовым моделям
Извлечение таблиц: передовые модели опережают на 10–20 баллов

(Обсуждение)
#Qwen359B #OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Механизм логического вывода Bodega
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine

Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
💬 Переводчик LiveCaptions
Легкий и мощный инструмент для перевода аудио и речи в режиме реального времени на основе Windows LiveCaptions.

Встроенная в Windows функция LiveCaptions проста в использовании, не требует много ресурсов и обеспечивает чрезвычайно высокую точность распознавания. Если дополнить ее потрясающими возможностями перевода больших языковых моделей, вы получите... возможно, лучший на сегодняшний день переводчик в режиме реального времени!

🔗 https://github.com/SakiRinn/LiveCaptions-Translator
#Перевод #LiveCaptions #Translator #Windows #App #AiTranslate #AiПеревод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ️Модель: Fish Audio S2 — open-source модель для синтеза речи с живыми эмоциями

Fish Audio выпустили S2 — модель для синтеза речи, которая воспроизводит естественные эмоции. Всё открыто: можно запустить локально или протестировать бесплатно онлайн.

Работает просто: пишешь текст и вставляешь теги вроде [смеётся], [шёпот], [грустно], [удивлённо] — голос отыгрывает их как живой человек. Поддерживается больше 15 000 тегов. Модель обучена на 10+ миллионах часов аудио и понимает около 80 языков.

Для клонирования голоса хватит образца длиной до 30 секунд.

По тестам S2 обошла закрытые модели Google и OpenAI: в Audio Turing Test набрала 0.515 против 0.417 у Seed-TTS, а в EmergentTTS-Eval выиграла у GPT-4o-mini-TTS в 81.88% случаев.

Модель полностью открыта — доступны веса, код для дообучения и стриминговый движок на SGLang.
🔗 https://fish.audio/ru/s2/
https://github.com/fishaudio/fish-speech
https://huggingface.co/fishaudio/s2-pro
#FishAudioS2 #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
ℹ️Модель: 🎥 NVIDIA выпустила мультимодалку для видео на 8B параметров

NVILA-HD-Video обрабатывает видео в 4K с тысячей кадров. Технология AutoGaze вырезает из ролика повторяющиеся фрагменты — это ускоряет работу в 19 раз для ViT и в 10 раз для LLM.

Часовое 4K-видео модель обработала за 3,2 секунды. Ближайший конкурент Nemotron Nano 12B v2 VL потратил на это 61 секунду.

Результаты: лидирует на бенчмарке HLVid и показывает хорошую производительность на VideoMME.

🔗 https://autogaze.github.io/
https://github.com/NVlabs/VILA/tree/main/vila_hd/nvila_hd_video
https://huggingface.co/nvidia/NVILA-8B-HD-Video
https://huggingface.co/spaces/bfshi/AutoGaze
#NVILA8BHDVideo #NVIDIA #AiVideo #AutoGaze #VideoMME #HLVid #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍 Qavrn — это локальный механизм RAG (Retrieval-Augmented Generation), который индексирует ваши документы и позволяет задавать вопросы о них на естественном языке. Ответы основаны на реальных файлах с указанием источников и оценкой релевантности, а не на данных, полученных в результате обучения облачной модели. Данные не покидают ваш компьютер: никаких API-ключей, никакой телеметрии, никакого подключения к интернету после первоначальной настройки.
Возможности:
- Более 30 типов файлов: PDF, DOCX, Markdown, код, электронные письма, электронные книги, файлы конфигурации
- Семантический векторный поиск с помощью ChromaDB + преобразователи предложений
- Потоковая передача ответов с указанием источников и оценкой релевантности
- Файловый наблюдатель для автоматической переиндексации при изменениях
- Веб-интерфейс на localhost:8000 + нативное десктопное приложение через Tauri
- Никаких внешних зависимостей после первоначальной настройки
Стек: Python/FastAPI, React/TypeScript, ChromaDB, Ollama, Tauri

Настройка: клонирование, установка через pip, загрузка модели Ollama, запуск. Вот и всё.

🔗 https://github.com/mussussu/Qavrn
(Обсуждение)
Есть похожее и как готовое приложение: Hyperlink
#Qavrn #RAG #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 PersonaLLM - приложение для общения с персонажами (для ролевых игр) на iOS, которое поддерживает локальные модели, BYOK и RAG на устройстве!
Текстовые, графические и видеосервисы работают отдельно, так что вы можете комбинировать их по своему усмотрению. Подойдет любая API, совместимая с OpenAI, так что вы можете подключить свою систему Ollama/vLLM/LM Studio. Кроме того, есть модели MLX для полностью автономного чата. Qwen 3.5 на iPhone работает на удивление хорошо!

Другие локальные фишки:
- Встроенная память RAG — персонажи все запоминают, ничего не пропадает с вашего телефона
- Локальный ComfyUI для создания изображений и видео
- Встроенная система преобразования текста в речь Kokoroинтернет не нужен!
- Полный доступ к системным подсказкам, импорт TavernAI/SillyTavern, разветвленные диалоги!

Это бесплатно, никаких платных функций.

(Забавная штука: подключите свою локальную модель, выберите или создайте персонажа, включите автопилот и просто наблюдайте за развитием диалога.

Обратите внимание: генерация персонажей лучше всего работает с более мощной моделью. Вы можете использовать встроенные облачные кредиты (500 бесплатных, работают на Opus) или собственный ключ API для подключения подходящей модели. Более слабые локальные модели, скорее всего, не справятся с анализом выходного формата.)

🔗 https://personallm.app
⬇️ https://apps.apple.com/us/app/personallm/id6759881719
(Обсуждение)
#PersonaLLM #iPhone #App #Kokoro #SillyTavern #TavernAI #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Omnicoder-Claude-4.6-Opus-Uncensored-GGUF

Представляем модель OmniClaw, созданную на основе реальных Claude Code / Codex агентских сессий из коллекции наборов данных DataClaw.
🔗 https://huggingface.co/LuffyTheFox/OmniClaw-Claude-4.6-Opus-Uncensored-GGUF

Omnicoder в интерпретации Claude-4.6-Opus:
🔗 https://huggingface.co/LuffyTheFox/Omnicoder-Claude-4.6-Opus-Uncensored-GGUF

И модель OmniRP для литературного творчества и создания историй:
🔗 https://huggingface.co/LuffyTheFox/OmniRP-Claude-4.6-Opus-Uncensored-GGUF

❗️Все модели полностью без цензуры, ни один запрос не был отклонен!
Для всех моделей доступны только кванты Q8_0. Другие кванты имеют очень низкое качество.

Слияние моделей выполнено с помощью этого скрипта на Python: https://pastebin.com/xEP68vss
Сохранили структуру заголовка и метаданных GGUF для обеспечения совместимости.

Для Omnicoder объединили данные с помощью следующих моделей:

Последнее обновление для модели Jackrong, обученной на дистиллированном наборе данных от Claude-4.6-Opu:
🔗 https://huggingface.co/Jackrong/Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF

Модель HauhauCS Qwen 3.5 9B без цензуры
🔗 https://huggingface.co/HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive

Омникодер производства Tesslate:
🔗 https://huggingface.co/Tesslate/OmniCoder-9B-GGUF

Использовали квант Бартовски в качестве основы:
🔗 https://huggingface.co/bartowski/Qwen_Qwen3.5-9B-GGUF

Для OmniClaw объединили свой Omnicoder с этой моделью от empero-ai:
🔗 https://huggingface.co/empero-ai/Qwen3.5-9B-Claude-Code-GGUF

Для OmniRP объединили свой Omnicoder с моделью от nbeerbower:
🔗 https://huggingface.co/nbeerbower/Qwen3.5-9B-Writing-DPO

Считают, что это лучшее из того, что у нас есть на данный момент в плане UGI (Uncensored General Intelligence) для небольшой модели 9B на базе архитектуры Qwen 3.5 9B.

Модель не звучит как робот, у него хорошая система подсказок и обширные знания для модели 9B.

(Обсуждение)
#Omnicoder #Uncensored #OmniRP #OmniClaw #Qwen359B #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Lore readme-query-demo.gif
21.3 MB
📺 Lore - Захват и воспроизведение мыслей с помощью ИИ — полностью на вашем ПК.

Вызовите его одним нажатием клавиши, введите любую информацию, которую хотите запомнить, или обратитесь к своей памяти. Локальный агент LLM, который преобразует ваши знания в векторизованную базу данных. Полностью приватный, без использования облачных технологий. Создан для разработчиков.
Три вещи, которые нужно знать:
- Не отвлекайтесь. Нажмите глобальную комбинацию клавиш (Ctrl+Shift+Пробел), печатайте как обычно. Никакого форматирования, никаких папок, никаких решений. Просто записывайте.

- Он понимает, что вы имеете в виду. Lore автоматически классифицирует вводимые вами данные: сохраняет мысль, задает вопрос, управляет задачами или дает инструкции. Вам не нужно об этом думать.

- Все остается локальным. Конвейер RAG, векторный поиск и логический вывод на основе больших языковых моделей работают на вашем устройстве. Ничего не покидает пределы вашего компьютера.

Под капотом: Ollama обрабатывает большие языковые модели, а LanceDB обеспечивает локальное хранение векторных данных.

Lore — это лёгкое настольное приложение, которое находится в системном трее и позволяет одним нажатием кнопки открыть всплывающий чат для быстрого обмена мыслями. Оно использует локальную языковую модель (через Ollama) и локальную векторную базу данных (LanceDB) для хранения, обработки и извлечения вашей информации — никаких облачных сервисов, никаких API-ключей, полная конфиденциальность.

Считайте, что это ваша личная вторая память — место, где можно хранить все, что может понадобиться в будущем. От подробных инструкций, которые вы написали для себя, до списков дел, кратких описаний принятых решений, URL-адресов и даже того самого curl-запроса, который вы использовали для воспроизведения ошибки в продакшене. Все это можно упорядочить и мгновенно найти, просто описав на понятном языке — даже по дате или теме.

Ключевые особенности:
- Быстрый захват — нажмите глобальную комбинацию клавиш, чтобы открыть панель чата, введите мысль, и она будет мгновенно сохранена
- Умное воспроизведение — задавайте вопросы на естественном языке и получайте ответы на основе сохраненных мыслей
- Классификация ИИ — вводимые данные автоматически классифицируются как мысль, вопрос, команда или инструкция
- Управление задачами — добавляйте, составляйте списки, выполняйте и систематизируйте задачи с учетом приоритета и категорий
- Конвейер RAG — генерация с использованием извлеченных данных находит нужный контекст в ваших заметках, прежде чем дать ответ
- Полностью локальная обработка — все данные и обработка с помощью ИИ выполняются на вашем устройстве

Для Windows, macOS, Linux
🔗 https://github.com/ErezShahaf/Lore
⬇️ Скачать v0.1.0
(Обсуждение)
#Lore #LanceDB #Ollama #Windows #macOS #Linux #SoftAi #AiSoft #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Text-Generation-WebUi - локальный интерфейс LLM. Работа с текстом, визуализация, вызов инструментов, обучение и многое другое. 100 % автономная работа.

Выпущена версия text-generation-webui 4.1 с поддержкой вызова инструментов в пользовательском интерфейсе! Каждый инструмент — это всего лишь один файл .py. Установите флажок и нажмите «Отправить». Это так просто, что вы сами сможете создавать и использовать собственные функции.

🔗 https://github.com/oobabooga/text-generation-webui
🌐 Веб-интерфейс для генерации текста — расширение Deep Reason https://oobabooga.gumroad.com/l/deep_reason
(Обсуждение) (Обсуждение 2)
#TextGenerationWebUi #DeepReason #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 "LocalAI – Offline AI Chat LLM"

LocalAI: Ваш Полностью Офлайн, Приватный AI Ассистент
Полностью on-device через llama.cpp. Поддерживает GGUF-модели (Llama, Qwen, Phi, Gemma и т.д.). Хороший UI, загрузка документов/фото, приватность 100%.
Превратите свой Android в мощную рабочую станцию с ИИ. LocalAI запускает большие языковые модели полностью на вашем устройстве, используя движок Llama.cpp. Никакого облака, никаких подписок, никакого сбора данных. Ваши запросы, документы и фотографии никогда не покинут ваш телефон.

⬇️ https://play.google.com/store/apps/details?id=com.ApexCreator.localaiapp&hl=ru
Весь список аналогов: https://t.me/Ai2Local/22

Еще:
- Private AI: https://play.google.com/store/apps/details?id=us.valkon.privateai
- Offline AI Chat - Local LLM https://play.google.com/store/apps/details?id=com.freeai.chat
- Llamatik – ИИ-бот локальный https://play.google.com/store/apps/details?id=com.llamatik.app.android
- Local and Private AI: MyLocAI https://play.google.com/store/apps/details?id=in.isunny.mylocai
- Llamao — Private & Offline AI https://play.google.com/store/apps/details?id=com.sandoche.llamao
#App #Android #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Reins : Чат для Олламы - Приватный чат с ИИ

Reins — это мультиплатформенное приложение с открытым исходным кодом, ориентированное на конфиденциальность и разработанное для пользователей Ollama. Оно упрощает настройку чата благодаря удобному интерфейсу, позволяющему настраивать системные подсказки, менять модель чата и корректировать параметры для каждого диалога в отдельности. Reins обеспечивает удобство и широкие возможности настройки для всех, кто работает с собственными языковыми моделями.

Исследователи и энтузиасты больших языковых моделей получают полный контроль над собственными моделями. Удаленное подключение, настройка подсказок, управление чатами и тонкая настройка конфигураций. Все в одном интуитивно понятном приложении.
Клиент Ollama для iOS, Android, macOS, Linux и Windows упрощает эксперименты с большими языковыми моделями.

🔗 https://github.com/ibrahimcetin/reins
AppStore: https://apps.apple.com/us/app/reins-chat-for-ollama/id6739738501
Для #MacOS , #iPhone , #iPad
⬇️ Скачать для Android .APK v1.3.0 и Reins-macOS.dmg
#Reins #App #Ollama #Android #Linux #Windows #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Ollama App - Современный и простой в использовании клиент для Ollama

Современный и простой в использовании клиент для Ollama. Наслаждайтесь работой, сохраняя конфиденциальность и работая в локальной сети.
🔗 https://github.com/JHubi1/ollama-app
⬇️ Скачать:
#Android - ollama-android-v1.2.0.apk
#Windows - ollama-windows-x64-v1.2.0.exe
#Ollama #App #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM