Local Ai
452 subscribers
936 photos
264 videos
4 files
831 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
🦙 Armored Llama - запускает последние сборки llama.cpp и загружает подходящие для вашего устройства файлы gguf с Hugging Face.
Запустите llama.cpp в качестве реального сервера на своем Android-смартфоне — загрузите модели с Hugging Face, общайтесь с ними локально и наблюдайте за работой аппаратного обеспечения прямо на устройстве.
Armored Llama — это не оболочка для облачного API и не повторная реализация логического вывода. Он запускает реальный llama-server бинарный файл llama.cpp из репозитория на процессоре вашего телефона, предоставляя конечную точку, совместимую с OpenAI, на 127.0.0.1, и оборачивает его в нативное приложение Jetpack Compose: аппаратную панель мониторинга в реальном времени, браузер моделей Hugging Face, чат в приложении и обновление среды выполнения в одно касание. Все данные остаются на устройстве — никаких сетевых запросов для логического вывода, никаких учетных записей.

🔗 https://github.com/guarismo/armored-llama
⬇️ Скачать: https://github.com/guarismo/armored-llama/releases/latest
(Обсуждение)
#ArmoredLlama #llamacpp #Android #App #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Статья: Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском
https://habr.com/ru/companies/mts_ai/articles/1065182/
👎1
💡 Kimi K3 — 2,78 триллиона параметров — работает на обычном ноутбуке.

Запускайте полную модель Kimi K3 с 2,78 триллионами параметров, не ограничиваясь доступной оперативной памятью, за счет потоковой передачи активированных весов непосредственно с NVMe.
На данный момент его доказанная работоспособность подтверждена на полной модели Kimi K3 с открытыми весами: 2,78 триллиона параметров, упакованных в контейнер размером 982 ГБ, который работает на MacBook Pro с 64 ГБ оперативной памяти со скоростью 0,49–0,54 токена в секунду. Это не упрощенный, не урезаннный и не сокращенный вариант.
🔗 https://github.com/sqliteai/waste
(Обсуждение)
#KimiK3 #waste #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
✈️ llama.cpp - ИИ, который живет на вашем компьютере. С открытым исходным кодом, приватный и всегда локальный.
llama.app - приложение для Mac и сервис llama от llama.cpp
Запускайте frontier AI полностью на своем компьютере. Никаких API-ключей, никакой телеметрии, никаких ограничений. Владейте своими моделями и диалоговыми данными.
🔗 https://llama.app
Проект: https://github.com/ggml-org/llama.cpp
(Обсуждение)
#llama #llamacpp #llamaapp #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek V4 Flash в LM Studio (Mac)
Внедрение форка DeepSeek V4 Flash llama.cpp от antirez в LM Studio (Mac, 128 ГБ объединенной памяти). Патчи для устранения дрейфа ABI/структуры данных, пакетного слияния, рецепта подписи кода.
Установите форк deepseek_v4 llama.cpp от antirez в LM Studio, чтобы запустить DeepSeek V4 Flash — 256-экспертный MoE, ~80 ГБ резидентной памяти, до 1 М контекста токенов — на Mac с 128 ГБ объединенной памяти.
Это обходной путь. Upstream llama.cpp пока не поддерживает deepseek_v4 архитектуру (дискуссия #22376). Среда выполнения MLX в LM Studio отклоняет GGUF V4 (ошибка #1872). Пока эти изменения не внедрены, это единственный рабочий способ запустить V4-Flash из пользовательского интерфейса LM Studio / сервера, совместимого с OpenAI.
Что вы получаете:
- DeepSeek V4 Flash загружена как обычная модель в LM Studio
- API, совместимый с OpenAI, на http://localhost:1234
- Полный контекст из 1 048 576 токенов
- ~190 токенов в секунду при обработке подсказок, ~26 токенов в секунду при генерации
- Работает с любым клиентом OpenAI-API (в т. ч. pi, Open WebUI, вашими собственными скриптами)
Протестировано на MacBook Pro M5 Max, 128 ГБ, macOS 26.4. Должно работать и на M2/M3/M4 Max с 128 ГБ.

🔗 https://github.com/noreff/lmstudio-dsv4-patch
(Обсуждение)
#LMStudio #DeepSeekV4Flash #llamacpp #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek-V4-Flash 284B на 5.3GB памяти!
💥 Mference - Большие модели MoE в "малом" объеме оперативной памяти!
Механизм логического вывода Swift + Metal для любых компьютеров Apple Silicon Mac, даже с 8 ГБ оперативной памяти.
Перевод поста:
Продолжая работу над портом Qwen 3.6, я хотел продолжать добавлять модели и в итоге по пути исправил кучу вещей, так что теперь у него есть собственный движок: Mference.

Основная идея та же, что и в TurboFieldfare: модели MoE активируют несколько параметров B для каждого токена, поэтому можно оставить общее ядро и кэш KV, а выбранные эксперты будут загружаться с SSD.

Что работает сейчас:
- Gemma 4 26B-A4B — ~2 ГБ, 31–35 tok/s на M5 Pro 24 ГБ
- Qwen 3.6 35B-A3B — ~1,45 ГБ, 19–23 tok/s
- DeepSeek-V4-Flash 284B-A13B — новинка. ~6,8 ГБ пиковой памяти, на практике в основном ~5,3 ГБ, до 4,8 ток/с на том же M5 с 24 ГБ памяти. 2-битное динамическое квантование, ~91 ГБ на диске.

🙂 Кроме того, мы добавили собственное приложение для Mac с многопоточным чатом, совместимым с OpenAI сервером и локальными вложениями в формате PDF/DOCX/PPTX/XLSX.

Отсюда я хочу продолжать добавлять семейства моделей, сократить время ожидания при экспертном чтении (сейчас декодирование занимает ~53 % времени ввода-вывода и выполняется последовательно с вычислениями) и увеличить размер контекста до 4 КБ.

Это не очень полезно после нескольких ходов, но технически вы можете запустить «пригодный для использования» dsv4f на Mac с 8 ГБ памяти. Дальше будет только лучше.

🔗 https://github.com/NeelM0906/Mference
(Обсуждение)
#DeepSeekV4Flash #Mference #TurboFieldfare #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
✨ WinterMix — Qwen3.5-122B-A10B в native MLX: сборка на 82 Гб, которая превосходит 94-95 Гб квантов, плюс сборка на 68 Гб для agent swarms [Релиз]
Перевод поста:
Зачем напрягаться, если GGUF лучше?
MLX на Apple Silicon работает значительно быстрее, чем llama.cpp на том же оборудовании — на моем M5 Max я заметил, что предварительное заполнение происходит примерно в 9 раз быстрее, а генерация токенов — примерно на 20% быстрее. Для задач с длинным контекстом и большим количеством поворотов этот разрыв увеличивается.

Проблема в том, что существующие кванты MLX с разрядностью менее 6 бит не очень хороши, и это видно из приведенной ниже таблицы: oQ4 уступает исходному GGUF примерно на 3,8 % по перплексии при коротком контексте и примерно на 4,2 % при длинном контексте. На практике это проявляется в виде бессвязных логических цепочек и ошибок округления, которые накапливаются до тех пор, пока модель не начинает выдавать ложные результаты.

Таким образом, более совершенный метод квантования MLX дает реальные преимущества для агентных рабочих процессов и локального ИИ на Apple Silicon. В то же время я принял осознанное решение потребовать нативной поддержки MLX. imatrix на MLX не является нативным форматом — для него нужны пользовательские ядра. Кванты WinterMix являются нативным форматом и могут использоваться как замена.

Квантованные модели WinterMix — это нативные модели MLX с открытыми весами (Apache 2.0). Никаких пользовательских ядер, никакой форк-версии среды выполнения, никаких флагов. Они загружаются везде, где работает MLX — в LM Studio, mlx-vlm и других — со стандартной скоростью, с полностью функциональной «башней видения» и связными следами мышления.

Ссылки HuggingFace:
- WinterMix58 — 82 ГБ, ~6,0 бит/с: лучший показатель MLX для этой модели, который мне известен, при любом размере, в том числе по сравнению с 6-битными сборками oMLX размером 94–95 ГиБ (с небольшим отрывом при 2 КБ, с большим отрывом при 16 КБ).

- WinterMix48 — 68 ГБ, ~5,0 б/с: на Mac с 128 ГБ остается ~35–40 ГБ свободного места = 5–8 параллельных сессий агента с 100-килобайтными токенами одновременно (архитектура GDN поддерживает кэш сессий с 100-килобайтными токенами объемом ~5–10 ГБ). Превосходит своего прямого конкурента по размеру (oQ4, 67 ГиБ) примерно на 1,4–1,5 % при обоих размерах контекста.

Пост: https://www.reddit.com/r/LocalLLaMA/comments/1vdcs8e/release_wintermix_qwen35122ba10b_in_native_mlx_an/
#Qwen35 #Qwen35122B #WinterMix #MLX #AppleSilicon #GGUF #MacOS #LocalAi #AiLocal
🎙 VibeVoice-ASR-BitNet — распознавание речи на CPU

Microsoft выпустила сжатую версию VibeVoice-ASR для работы в реальном времени без GPU. Качество ниже, чем у полной модели VibeVoice-ASR-7B, но зато можно запустить на обычном процессоре.

💻 Модель работает на x86 с AVX2 и ARM с NEON, поддерживает несколько языков. Размер — 1.58 ГБ против исходных 4.62 ГБ. По скорости обгоняет Whisper.cpp в 1.6–2.3 раза.
🔗 https://github.com/microsoft/VibeASR.cpp
🔗 https://huggingface.co/microsoft/VibeVoice-ASR-BitNet
🔗 https://huggingface.co/spaces/microsoft/vibevoice-asr-bitnet-demo
#VibeVoiceASR #VibeASR #ASR #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎙 VoiceSwitch - Локальная диктовка и редактура текста для macOS.

Локальная диктовка в macOS с использованием GigaAM, Whisper, Qwen и Apple Speech — автономная транскрипция и очистка локального текста.
- GigaAM v3 E2E RNNT — основной режим для русской речи;
- Whisper Large V3 Turbo (MLX) — для смешанной русско-английской речи;
- Qwen3-ASR 1.7B (MLX) — международный многоязычный режим;
- Apple SpeechAnalyzer — системная локальная диктовка на macOS 26+;
- Qwen3-4B (MLX) — локально исправляет или конвертирует расшифровку;
- режимы текста Дословно , Исправить и Кратко ;
- fn + ⌥ Option— начать или остановить запись;
- HUD показывает запись, расшифровку, локальную редактуру и результат;
- аудио и текст не отправляются во внешний API;
- Журнал сравнения помогает выбрать модель под собственную речь.

Системные требования:
- Mac с Apple Silicon ( M1или новее);
- macOS 14 Sonoma или новее;
- рекомендуется 16 ГБ оперативной памяти;
- около 12 ГБ свободного места для Python, зависимостей и четырех загружаемых моделей;
- Интернет только во время первоначальной установки модели.

🔗 https://github.com/mitimaicode/VoiceSwitch
⬇️ Скачать: https://github.com/mitimaicode/VoiceSwitch/releases
(Статья Автора на Хабр)
#VoiceSwitch #MacOS #GigaAM #GigaAMV3 #Whisper #Qwen #ASR #Транскрибация #Диктовка #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💬 Witsy - настольный помощник по ИИ / универсальный MCP-клиент
Witsy — это приложение с ИИ-технологией BYOK (Bring Your Own Keys): это значит, что вам нужны API-ключи для провайдеров больших языковых моделей, которых вы хотите использовать. Кроме того, вы можете использовать Ollama, чтобы бесплатно запускать модели локально на своем компьютере и использовать их в Witsy.
Это первый из очень немногих (единственных?) универсальных MCP-клиентов:
Witsy позволяет запускать MCP-серверы практически с любой большой языковой моделью!

Неполный список функций:
- дополнение чата с поддержкой визуальных моделей (описание изображения)
- преобразование текста в изображение и видео
- преобразование изображения в изображение (редактирование изображений) и видео
- плагины LLM для расширения возможностей LLM: выполнение кода Python, поиск в интернете...
- поддержка сервера Anthropic MCP
- Scratchpad для интерактивного создания лучшего контента с помощью любой модели!
- Prompt anywhere позволяет генерировать контент непосредственно в любом приложении
- Команды искусственного интеллекта, которые можно запускать с выделенным текстом практически в любом приложении
- Подсказки экспертов специализируют вашего бота на определенной теме
- Плагин долговременной памяти для повышения релевантности ответов LLM
- Чтение вслух сообщений помощника
- Чтение вслух любого текста в других приложениях
- Общение в чате с вашими локальными файлами и документами (RAG)
- Транскрипция / диктовка (преобразование речи в текст)
- Чат в реальном времени, также известный как голосовой режим
- Поддержка использования антропного компьютера
- Локальная история разговоров (с автоматическими заголовками)
- Форматирование и копирование сгенерированного кода в буфер обмена
- Экспорт беседы в PDF
- Скопируйте и загрузите изображение

🔗 https://github.com/Kochava-Studios/witsy
⬇️Скачать: https://github.com/Kochava-Studios/witsy/releases
(Рассмотрен в статье про RAG-системы)
#Witsy #Ollama #MCP #RAG #MacOS #Windows #Linux #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💬 Альтернативы LM Studio:
👉 Nativ — это передовой искусственный интеллект у вас на столе. Скачивайте и запускайте открытые модели на Apple Silicon — никаких аккаунтов, подписок и облачных сервисов.
🔗 https://blaizzy.github.io/nativ/

👉 Llama GUI - Удобный графический интерфейс для Llama.cpp, упрощающий настройку и запуск. Легкий локальный лаунчер и панель управления для llama.cpp в Windows, macOS и Linux.
🔗 https://github.com/thomas9120/LLama-GUI

👉 Unsloth Studio - веб-интерфейс с открытым исходным кодом и без программирования для обучения, запуска и экспорта открытых моделей в одном унифицированном локальном интерфейсе.
🔗 https://t.me/Ai2Local/982 - тут подробнее!

👉 oMLX - Локальный ИИ
🔗 https://omlx.ai
Пост: https://t.me/Ai2Local/490 и https://t.me/Ai2Local/604

👉 MTPLX - Запускайте локальные языковые модели
в два раза быстрее.
MTPLX — это нативное приложение для Mac с локальным ИИ. Чат, агенты и локальный сервер — все в два раза быстрее.
🔗 https://mtplx.com
Подробнее: https://t.me/Ai2Local/1014

👉 KoboldCpp - это легкое автономное приложение, которое позволяет запускать большие языковые модели (LLM) локально на вашем компьютере. Он основан на проекте llama.cpp и особенно популярен для генерации текстов ИИ и ролевых игр.
🔗 https://koboldcpp.com
🔗 https://github.com/LostRuins/koboldcpp - v1.118 released!

👉 llama.cpp - ИИ, который живет на вашем компьютере. С открытым исходным кодом, приватный и всегда локальный.
🔗 https://llama.app
Пост: https://t.me/Ai2Local/937

👉 LM Studio Bionic — это новейшая версия LM Studio. У Bionic то же ядро LM Studio, и, кроме того, теперь он может сделать намного больше с агентом!
🔗 https://lmstudio.ai/blog/introducing-lm-studio-bionic

И другие приложения из этого Канала! (Их много!)
#LMStudio #Nativ #LlamaGUI #Llamacpp #UnslothStudio #oMLX #MTPLX #KoboldCpp #Bionic #MacOS #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
🔈 Speechfony — настольное приложение для чтения PDF-файлов (и EPUB) с функцией преобразования текста в речь в автономном режиме.
Speechfony - это локальное настольное приложение, которое читает ваши PDF-файлы вслух и превращает их в аудиокниги - полностью автономно, на базе Kokoro 82M и local LLMs via llama.cpp.

Функции:
- Чтение PDF — прокрутка страниц с помощью PDF.js, настраиваемые поля для чтения и возможность продолжить с того места, на котором вы остановились
- Прослушивание во время чтения — построчное воспроизведение с синхронизацией выделения
- Экспорт аудиокниги — пакетный синтез выбранных страниц в MP3 (только для настольного приложения)
- Автономная TTS — Kokoro работает на устройстве; модели загружаются при первом запуске
- Аппаратное ускорение — CoreML в macOS, DirectML/CUDA в Windows, CUDA в Linux (при наличии)
- Последние документы — быстрый доступ к ранее открытым PDF-файлам

Платформы
: macOS Apple Silicon, Windows x64, Linux x64 (glibc ≥ 2.38). Сборки для Intel Mac пока недоступны.
При первом запуске загружается голосовая модель (~130 МБ с Hugging Face). После этого приложение работает без подключения к сети.

🔗 https://github.com/pguso/speechfony
⬇️Скачать: https://github.com/pguso/speechfony/releases
(Обсуждение)
#Speechfony #Kokoro #llamacpp #TTS #MacOS #Windows #Linux #SoftAi #AiSoft #eBook #EPUB #PDF #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔈 Chatterbox TTS Server: OpenAI-совместимый API с веб-интерфейсом, поддержкой больших объемов текста и встроенными голосами
Этот сервер основан на архитектуре и пользовательском интерфейсе нашего проекта Dia-TTS-Server, но использует собственный chatterbox-tts движок. Работает с ускорением на графических процессорах NVIDIA (CUDA), AMD (ROCm) и Apple Silicon (MPS), а в случае сбоя — на центральном процессоре.

Multilingual поддерживает 23 языка, включая арабский, китайский, датский, голландский, английский, финский, французский, немецкий, греческий, иврит, хинди, итальянский, японский, корейский, малайский, норвежский, польский, португальский, русский, испанский, шведский, суахили и турецкий.
📦 Портативный режим (Windows): Это приложение поддерживает полностью автономную установку — вся папка, включая Python и все зависимости, является самодостаточной. Скопируйте ее на USB-накопитель, отправьте в виде zip-архива или переместите куда угодно. Просто дважды щелкните start.bat — установка Python на целевом компьютере не требуется. Подробнее →

🔗 https://github.com/devnen/Chatterbox-TTS-Server
(Обсуждение TTS)

📖 Chatterbox-Audiobook
SoTA с открытым исходным кодом TTS для создания аудиокниг и подкастов
🔗 https://github.com/psdwizzard/chatterbox-Audiobook
#ChatterboxTTSServer #Chatterbox #TTS #Windows #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM