Рейтинг систем интеллектуальной обработки документов https://idp-leaderboard.org
Во всех победах или матчах Qwen:
OlmOCR (извлечение текста из беспорядочных сканирований, плотных PDF-файлов, макетов с несколькими столбцами):
Qwen3.5-9B: 78.1
Qwen3.5-4B: 77.2
Gemini 3.1 Pro: 74.6
Клод Сонет 4.6: 74.4
Qwen3.5-2B: 73.7
GPT-5.4: 73.4
9B и 4B опережают все модели frontier по извлечению необработанного текста. Модель 2B соответствует GPT-5.4.
VQA (ответы на вопросы о содержании документов, диаграммах, таблицах):
Gemini 3.1 Pro: 85,0
Qwen3.5-9B: 79,5
GPT-5.4: 78,2
Qwen3.5-4B: 72,4
Claude Sonnet 4.6: 65,2
GPT-5.2: 63,5
Gemini 3 Flash: 63,5
Это больше всего удивило. По результатам VQA 9B уступает только Gemini 3.1 Pro. Она опережает GPT-5.4. Она на 14 баллов опережает Claude Sonnet и на 16 баллов опережает Gemini Flash. Такой результат VQA для открытой модели 9B сложно объяснить.
KIE (извлечение номеров счетов, дат, сумм):
Gemini 3 Flash: 91,1
Claude Opus 4.6: 89,8
Claude Sonnet 4.6: 89,5
GPT-5.2: 87,5
Gemini 3.1 Pro: 86,8
Qwen3.5-9B: 86,5
Qwen3.5-4B: 86,0
GPT-5.4: 85,7
Qwen-9B соответствует уровню Gemini 3.1 Pro.
Qwen-4B соответствует уровню GPT-5.4.
Оба опережают GPT-5-Mini (85,7), Claude Haiku (85,6) и Ministral-8B (85,7).
Там, где передовые модели явно лучше.
Извлечение данных из таблиц (GrITS):
Gemini 3.1 Pro: 96,4
Claude Sonnet: 96,3
GPT-5.4: 94,8
Gemini 3 Pro: 95,8
GPT-5.2: 86,0
Gemini 3 Flash: 85,6
Qwen3.5-4B: 76,7
Qwen3.5-9B: 76,6
Модели Frontier имеют от 85 до 96 баллов по шкале Qwen. Независимо от размера, Qwen у моделей 4B и 9B составляет от 76 до 77 баллов. По сути, эти модели идентичны. Похоже, это ограничение связано с архитектурой, а не с масштабом.
Распознавание рукописного текста:
Gemini 3.1 Pro: 82,8
Gemini 3 Flash: 81,7
GPT-4.1: 75,6
Claude Opus: 74,0
Claude Sonnet: 73,7
GPT-5.4: 69,1
Ministral-8B: 67,8
Qwen3.5-9B: 65,5
Qwen3.5-4B: 64,7
Gemini лучше распознает рукописный текст. Qwen отстает, но не сильно, от GPT-5.4 (69,1 против 65,5).
Масштабирование в рамках семейства Qwen:
В целом: 0,8B 58,0, 2B 63,2, 4B 73,1, 9B 77,0
Резюме:
Извлечение с помощью оптического распознавания символов: Qwen 4B/9B опережает все передовые модели
Рассуждения с помощью VQA: Qwen-9B занимает второе место, уступая только Gemini 3.1 Pro. Опережает GPT-5.4.
Извлечение полей KIE: Qwen 4B/9B не уступает передовым моделям
Извлечение таблиц: передовые модели опережают на 10–20 баллов
(Обсуждение)
#Qwen359B #OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Механизм логического вывода Bodega
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine
Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine
Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
Легкий и мощный инструмент для перевода аудио и речи в режиме реального времени на основе Windows LiveCaptions.
Встроенная в Windows функция LiveCaptions проста в использовании, не требует много ресурсов и обеспечивает чрезвычайно высокую точность распознавания. Если дополнить ее потрясающими возможностями перевода больших языковых моделей, вы получите... возможно, лучший на сегодняшний день переводчик в режиме реального времени!
#Перевод #LiveCaptions #Translator #Windows #App #AiTranslate #AiПеревод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - SakiRinn/LiveCaptions-Translator: Lightweight and powerful real-time audio/speech translation tool based on Windows LiveCaptions.
Lightweight and powerful real-time audio/speech translation tool based on Windows LiveCaptions. - SakiRinn/LiveCaptions-Translator
Fish Audio выпустили S2 — модель для синтеза речи, которая воспроизводит естественные эмоции. Всё открыто: можно запустить локально или протестировать бесплатно онлайн.
Работает просто: пишешь текст и вставляешь теги вроде [смеётся], [шёпот], [грустно], [удивлённо] — голос отыгрывает их как живой человек. Поддерживается больше 15 000 тегов. Модель обучена на 10+ миллионах часов аудио и понимает около 80 языков.
Для клонирования голоса хватит образца длиной до 30 секунд.
По тестам S2 обошла закрытые модели Google и OpenAI: в Audio Turing Test набрала 0.515 против 0.417 у Seed-TTS, а в EmergentTTS-Eval выиграла у GPT-4o-mini-TTS в 81.88% случаев.
Модель полностью открыта — доступны веса, код для дообучения и стриминговый движок на SGLang.
🔗 https://fish.audio/ru/s2/
https://github.com/fishaudio/fish-speech
https://huggingface.co/fishaudio/s2-pro
#FishAudioS2 #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
NVILA-HD-Video обрабатывает видео в 4K с тысячей кадров. Технология AutoGaze вырезает из ролика повторяющиеся фрагменты — это ускоряет работу в 19 раз для ViT и в 10 раз для LLM.
Часовое 4K-видео модель обработала за 3,2 секунды. Ближайший конкурент Nemotron Nano 12B v2 VL потратил на это 61 секунду.
Результаты: лидирует на бенчмарке HLVid и показывает хорошую производительность на VideoMME.
🔗 https://autogaze.github.io/
https://github.com/NVlabs/VILA/tree/main/vila_hd/nvila_hd_video
https://huggingface.co/nvidia/NVILA-8B-HD-Video
https://huggingface.co/spaces/bfshi/AutoGaze
#NVILA8BHDVideo #NVIDIA #AiVideo #AutoGaze #VideoMME #HLVid #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Возможности:
- Более 30 типов файлов: PDF, DOCX, Markdown, код, электронные письма, электронные книги, файлы конфигурации
- Семантический векторный поиск с помощью ChromaDB + преобразователи предложений
- Потоковая передача ответов с указанием источников и оценкой релевантности
- Файловый наблюдатель для автоматической переиндексации при изменениях
- Веб-интерфейс на localhost:8000 + нативное десктопное приложение через Tauri
- Никаких внешних зависимостей после первоначальной настройки
Стек: Python/FastAPI, React/TypeScript, ChromaDB, Ollama, Tauri
Настройка: клонирование, установка через pip, загрузка модели Ollama, запуск. Вот и всё.
(Обсуждение)
Есть похожее и как готовое приложение: Hyperlink
#Qavrn #RAG #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - mussussu/Qavrn: Your private AI research assistant. Fully local. Fully yours.
Your private AI research assistant. Fully local. Fully yours. - mussussu/Qavrn
📱 PersonaLLM - приложение для общения с персонажами (для ролевых игр) на iOS, которое поддерживает локальные модели, BYOK и RAG на устройстве!
🔗 https://personallm.app
⬇️ https://apps.apple.com/us/app/personallm/id6759881719
(Обсуждение)
#PersonaLLM #iPhone #App #Kokoro #SillyTavern #TavernAI #AiLocal #LocalAi
Текстовые, графические и видеосервисы работают отдельно, так что вы можете комбинировать их по своему усмотрению. Подойдет любая API, совместимая с OpenAI, так что вы можете подключить свою систему Ollama/vLLM/LM Studio. Кроме того, есть модели MLX для полностью автономного чата. Qwen 3.5 на iPhone работает на удивление хорошо!
Другие локальные фишки:
- Встроенная память RAG — персонажи все запоминают, ничего не пропадает с вашего телефона
- Локальный ComfyUI для создания изображений и видео
- Встроенная система преобразования текста в речь Kokoro — интернет не нужен!
- Полный доступ к системным подсказкам, импорт TavernAI/SillyTavern, разветвленные диалоги!
Это бесплатно, никаких платных функций.
(Забавная штука: подключите свою локальную модель, выберите или создайте персонажа, включите автопилот и просто наблюдайте за развитием диалога.
Обратите внимание: генерация персонажей лучше всего работает с более мощной моделью. Вы можете использовать встроенные облачные кредиты (500 бесплатных, работают на Opus) или собственный ключ API для подключения подходящей модели. Более слабые локальные модели, скорее всего, не справятся с анализом выходного формата.)
(Обсуждение)
#PersonaLLM #iPhone #App #Kokoro #SillyTavern #TavernAI #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Представляем модель OmniClaw, созданную на основе реальных Claude Code / Codex агентских сессий из коллекции наборов данных DataClaw.
Omnicoder в интерпретации Claude-4.6-Opus:
И модель OmniRP для литературного творчества и создания историй:
Для всех моделей доступны только кванты Q8_0. Другие кванты имеют очень низкое качество.
Слияние моделей выполнено с помощью этого скрипта на Python: https://pastebin.com/xEP68vss
Сохранили структуру заголовка и метаданных GGUF для обеспечения совместимости.
Для Omnicoder объединили данные с помощью следующих моделей:
Последнее обновление для модели Jackrong, обученной на дистиллированном наборе данных от Claude-4.6-Opu:🔗 https://huggingface.co/Jackrong/Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
Модель HauhauCS Qwen 3.5 9B без цензуры🔗 https://huggingface.co/HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive
Омникодер производства Tesslate:🔗 https://huggingface.co/Tesslate/OmniCoder-9B-GGUF
Использовали квант Бартовски в качестве основы:🔗 https://huggingface.co/bartowski/Qwen_Qwen3.5-9B-GGUF
Для OmniClaw объединили свой Omnicoder с этой моделью от empero-ai:🔗 https://huggingface.co/empero-ai/Qwen3.5-9B-Claude-Code-GGUF
Для OmniRP объединили свой Omnicoder с моделью от nbeerbower:🔗 https://huggingface.co/nbeerbower/Qwen3.5-9B-Writing-DPO
Считают, что это лучшее из того, что у нас есть на данный момент в плане UGI (Uncensored General Intelligence) для небольшой модели 9B на базе архитектуры Qwen 3.5 9B.
Модель не звучит как робот, у него хорошая система подсказок и обширные знания для модели 9B.
(Обсуждение)
#Omnicoder #Uncensored #OmniRP #OmniClaw #Qwen359B #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Lore readme-query-demo.gif
21.3 MB
Вызовите его одним нажатием клавиши, введите любую информацию, которую хотите запомнить, или обратитесь к своей памяти. Локальный агент LLM, который преобразует ваши знания в векторизованную базу данных. Полностью приватный, без использования облачных технологий. Создан для разработчиков.
Три вещи, которые нужно знать:
- Не отвлекайтесь. Нажмите глобальную комбинацию клавиш (Ctrl+Shift+Пробел), печатайте как обычно. Никакого форматирования, никаких папок, никаких решений. Просто записывайте.
- Он понимает, что вы имеете в виду. Lore автоматически классифицирует вводимые вами данные: сохраняет мысль, задает вопрос, управляет задачами или дает инструкции. Вам не нужно об этом думать.
- Все остается локальным. Конвейер RAG, векторный поиск и логический вывод на основе больших языковых моделей работают на вашем устройстве. Ничего не покидает пределы вашего компьютера.
Под капотом: Ollama обрабатывает большие языковые модели, а LanceDB обеспечивает локальное хранение векторных данных.
Lore — это лёгкое настольное приложение, которое находится в системном трее и позволяет одним нажатием кнопки открыть всплывающий чат для быстрого обмена мыслями. Оно использует локальную языковую модель (через Ollama) и локальную векторную базу данных (LanceDB) для хранения, обработки и извлечения вашей информации — никаких облачных сервисов, никаких API-ключей, полная конфиденциальность.
Считайте, что это ваша личная вторая память — место, где можно хранить все, что может понадобиться в будущем. От подробных инструкций, которые вы написали для себя, до списков дел, кратких описаний принятых решений, URL-адресов и даже того самого curl-запроса, который вы использовали для воспроизведения ошибки в продакшене. Все это можно упорядочить и мгновенно найти, просто описав на понятном языке — даже по дате или теме.
Ключевые особенности:
- Быстрый захват — нажмите глобальную комбинацию клавиш, чтобы открыть панель чата, введите мысль, и она будет мгновенно сохранена
- Умное воспроизведение — задавайте вопросы на естественном языке и получайте ответы на основе сохраненных мыслей
- Классификация ИИ — вводимые данные автоматически классифицируются как мысль, вопрос, команда или инструкция
- Управление задачами — добавляйте, составляйте списки, выполняйте и систематизируйте задачи с учетом приоритета и категорий
- Конвейер RAG — генерация с использованием извлеченных данных находит нужный контекст в ваших заметках, прежде чем дать ответ
- Полностью локальная обработка — все данные и обработка с помощью ИИ выполняются на вашем устройстве
Для Windows, macOS, Linux
⬇️ Скачать v0.1.0
(Обсуждение)
#Lore #LanceDB #Ollama #Windows #macOS #Linux #SoftAi #AiSoft #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
✨ Text-Generation-WebUi - локальный интерфейс LLM. Работа с текстом, визуализация, вызов инструментов, обучение и многое другое. 100 % автономная работа.
Выпущена версия text-generation-webui 4.1 с поддержкой вызова инструментов в пользовательском интерфейсе! Каждый инструмент — это всего лишь один файл .py. Установите флажок и нажмите «Отправить». Это так просто, что вы сами сможете создавать и использовать собственные функции.
🔗 https://github.com/oobabooga/text-generation-webui
🌐 Веб-интерфейс для генерации текста — расширение Deep Reason https://oobabooga.gumroad.com/l/deep_reason
(Обсуждение) (Обсуждение 2)
#TextGenerationWebUi #DeepReason #AiLocal #LocalAi
Выпущена версия text-generation-webui 4.1 с поддержкой вызова инструментов в пользовательском интерфейсе! Каждый инструмент — это всего лишь один файл .py. Установите флажок и нажмите «Отправить». Это так просто, что вы сами сможете создавать и использовать собственные функции.
(Обсуждение) (Обсуждение 2)
#TextGenerationWebUi #DeepReason #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 "LocalAI – Offline AI Chat LLM"
LocalAI: Ваш Полностью Офлайн, Приватный AI Ассистент
Полностью on-device через llama.cpp. Поддерживает GGUF-модели (Llama, Qwen, Phi, Gemma и т.д.). Хороший UI, загрузка документов/фото, приватность 100%.
⬇️ https://play.google.com/store/apps/details?id=com.ApexCreator.localaiapp&hl=ru
Весь список аналогов: https://t.me/Ai2Local/22
Еще:
- Private AI: https://play.google.com/store/apps/details?id=us.valkon.privateai
- Offline AI Chat - Local LLM https://play.google.com/store/apps/details?id=com.freeai.chat
- Llamatik – ИИ-бот локальный https://play.google.com/store/apps/details?id=com.llamatik.app.android
- Local and Private AI: MyLocAI https://play.google.com/store/apps/details?id=in.isunny.mylocai
- Llamao — Private & Offline AI https://play.google.com/store/apps/details?id=com.sandoche.llamao
#App #Android #LocalAi #AiLocal
LocalAI: Ваш Полностью Офлайн, Приватный AI Ассистент
Полностью on-device через llama.cpp. Поддерживает GGUF-модели (Llama, Qwen, Phi, Gemma и т.д.). Хороший UI, загрузка документов/фото, приватность 100%.
Превратите свой Android в мощную рабочую станцию с ИИ. LocalAI запускает большие языковые модели полностью на вашем устройстве, используя движок Llama.cpp. Никакого облака, никаких подписок, никакого сбора данных. Ваши запросы, документы и фотографии никогда не покинут ваш телефон.
Весь список аналогов: https://t.me/Ai2Local/22
Еще:
- Private AI: https://play.google.com/store/apps/details?id=us.valkon.privateai
- Offline AI Chat - Local LLM https://play.google.com/store/apps/details?id=com.freeai.chat
- Llamatik – ИИ-бот локальный https://play.google.com/store/apps/details?id=com.llamatik.app.android
- Local and Private AI: MyLocAI https://play.google.com/store/apps/details?id=in.isunny.mylocai
- Llamao — Private & Offline AI https://play.google.com/store/apps/details?id=com.sandoche.llamao
#App #Android #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Reins : Чат для Олламы - Приватный чат с ИИ
🔗 https://github.com/ibrahimcetin/reins
AppStore: https://apps.apple.com/us/app/reins-chat-for-ollama/id6739738501
Для #MacOS , #iPhone , #iPad
⬇️ Скачать для Android .APK v1.3.0 и Reins-macOS.dmg
#Reins #App #Ollama #Android #Linux #Windows #AiLocal #LocalAi
Reins — это мультиплатформенное приложение с открытым исходным кодом, ориентированное на конфиденциальность и разработанное для пользователей Ollama. Оно упрощает настройку чата благодаря удобному интерфейсу, позволяющему настраивать системные подсказки, менять модель чата и корректировать параметры для каждого диалога в отдельности. Reins обеспечивает удобство и широкие возможности настройки для всех, кто работает с собственными языковыми моделями.
Исследователи и энтузиасты больших языковых моделей получают полный контроль над собственными моделями. Удаленное подключение, настройка подсказок, управление чатами и тонкая настройка конфигураций. Все в одном интуитивно понятном приложении.
Клиент Ollama для iOS, Android, macOS, Linux и Windows упрощает эксперименты с большими языковыми моделями.
AppStore: https://apps.apple.com/us/app/reins-chat-for-ollama/id6739738501
Для #MacOS , #iPhone , #iPad
#Reins #App #Ollama #Android #Linux #Windows #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
📱 Ollama App - Современный и простой в использовании клиент для Ollama
Современный и простой в использовании клиент для Ollama. Наслаждайтесь работой, сохраняя конфиденциальность и работая в локальной сети.
🔗 https://github.com/JHubi1/ollama-app
⬇️ Скачать:
#Android - ollama-android-v1.2.0.apk
#Windows - ollama-windows-x64-v1.2.0.exe
#Ollama #App #AiLocal #LocalAi
Современный и простой в использовании клиент для Ollama. Наслаждайтесь работой, сохраняя конфиденциальность и работая в локальной сети.
#Android - ollama-android-v1.2.0.apk
#Windows - ollama-windows-x64-v1.2.0.exe
#Ollama #App #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM