Local Ai
443 subscribers
895 photos
250 videos
4 files
811 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
💬 Kerlig - Приложение для написания текстов с помощью ИИ для Mac
Экономьте часы на письменном общении на работе


Пишите электронные письма, ответы в Slack, тикеты в Jira, редактируйте тексты, общайтесь с документами...
Kerlig интересен совершенно другим сценарием: локальная модель становится частью macOS. Вы выделяете текст практически в любом приложении и можете переписать, сократить, перевести, ответить и т. д. В качестве backend поддерживается Ollama, включая добавление собственных моделей.
То есть это не конкурент LM Studio, а полезный front-end поверх него/Ollama.
🔗 https://www.kerlig.com
⬇️ Скачать: Mac Intel , Mac Silicon (от 19 августа 2026 г.)
#Kerlig #Ollama #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
gmlx - Самый быстрый способ запустить модели GGUF на Apple Silicon.

Главная идея необычная: взять обычные GGUF-файлы с K-quants/IQ-quants, которые обычно запускаются через llama.cpp, и исполнять их через специализированные MLX/Metal kernels. То есть не нужно выбирать между огромной экосистемой GGUF и высокой эффективностью MLX.
gmlx умеет сервер OpenAI + Anthropic API, tool calling, structured output, VLM, embeddings, reranking, STT/TTS, RAG и LoRA. Ещё интереснее — есть disk streaming MoE-моделей, которые физически больше RAM. Авторы пишут, что таким способом 200B-класс моделей может запускаться даже на 64 GB Mac. Для 128 GB это открывает очень необычные варианты.
Авторы также публикуют собственные тесты, где на одинаковом GGUF gmlx обгоняет llama.cpp, особенно при длинном контексте.

gmlx — это локальная платформа для логического вывода. Вы можете общаться с открытой моделью в терминале или в браузере, предоставлять к ней доступ через API, совместимые с OpenAI и Anthropic, подключить к ней агента кодирования, общаться с ней голосом, создать на ее основе локальный стек RAG и дообучить ее с помощью LoRA.
Она работает с опубликованными версиями K-quant и IQ-quant GGUF. Эти форматы являются наиболее точными открытыми квантовыми моделями при заданном размере файла, а сопутствующий проект mlx-kquant предоставляет ядра Metal, которые запускают их на платформе MLX от Apple.
В том же файле gmlx работает быстрее, чем llama.cpp, и разрыв наиболее заметен при использовании длинных контекстов, которые применяются в агентах кодирования и длительных сессиях. Модель на основе смеси экспертов, размер которой превышает объем оперативной памяти, все равно работает, загружая экспертов с диска.

Поддерживаемые архитектуры:
- Llama, Mistral, Phi-3, SmolLM3, Seed-OSS и ERNIE-4.5
- Qwen со 2 по 3.8, dense и MoE, с гибридными семействами attention
- Gemma с 1 по 4, за исключением варианта 3n, GGUF которого разбиты выше по течению.
- DeepSeek V3, R1 и V4-Flash
- GLM с 4 по 5.2, Kimi-K3, MiniMax M2 и M3 и gpt-oss
- Hunyuan, Hy3, HY4 и Muse Glimmer
- Granite, Nemotron-H и Falcon-H1

🔗 https://github.com/asher/gmlx
#gmlx #RAG #MLX #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👎2
Rapid-MLX — самый быстрый локальный ИИ-движок для Apple Silicon

Встроенный API OpenAI / Anthropic · пропускная способность до 3 раз выше, чем у Ollama (измерено) · Работает на любом Mac серии M.
Общайтесь без интернета или диктуйте текст в любое приложение с помощью Whisper, Qwen3-ASR, SenseVoice или Parakeet, запущенных локально. Есть: Генерация изображений и Видео!
❗️ В 4,2 раза быстрее Ollama, время до первого ответа с кэшированием 0,08 с, 100% вызов инструментов. 17 парсеров инструментов, кэш подсказок, разделение рассуждений, облачная маршрутизация. Полная замена OpenAI. Работает с Claude Code, Cursor, Aider.

Rapid-MLX специализируется именно на быстрой работе Apple Silicon и предоставляет OpenAI-compatible API, tool calling, prompt caching, reasoning separation и интеграцию с агентами.
Особенно показательно, что разработчики уже отдельно ориентируют продукт на большие машины: в их опубликованной таблице есть Qwen 3.5 122B для 96+ GB и даже DeepSeek V4 Flash 158B-A13B для 128+ GB. Для Qwen 122B заявлено около 57 tok/s.

🔗 https://github.com/xinqiyang/rapid-mlx
🔗 https://pypi.org/project/rapid-mlx/
⬇️ Скачать Rapid-MLX Desktop: https://rapidmlx.com/desktop
Посмотреть подписанные релизы Desktop
#RapidMLX #AppleSilicon #MLX #Whisper #Qwen3ASR #ASR #STT #Parakeet #SenseVoice #Транскрибация #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👎2
🎞 VPIPE - Мультимодальные конвейеры ИИ в реальном времени на Apple Silicon

Легкие локальные мультимодальные ИИ-конвейеры и пользовательский Metal-вывод для компьютеров Apple Silicon Mac.
- Мультимодальный граф: видео, аудио, изображения, текст и действия с инструментами в одном конвейере.
- Собственный Metal-вывод: пользовательские ядра и отсутствие сторонних тензорных фреймворков для оптимальной скорости.
- Базовая модель для Mac: потоковая передача весов и подготовка 4-битной модели для генерации изображений/видео на компьютерах с 16 ГБ памяти.
- Готовые рабочие процессы: редактирование изображений, видео в MiniMax H3, чат Qwen, VQA в реальном времени, ASR/TTS и вызов локальных инструментов.
- Воспроизводимый Composer: сохранение макетов, подсказок, параметров и конфигурации модели для каждой спецификации пайплайна.
- Простота в использовании: приложение для macOS, управление через веб-интерфейс и удаленный доступ через браузер на телефоне.

Почему VPIPE:
- Запускает MiniMax H3 FL2VA и REF2VA на Apple Silicon Mac — модели 33B, которая генерирует видео и его звуковое сопровождение на накопителе объемом всего 16 ГБ. Теперь с поддержкой Turbo LoRA!
- Работает LTX-2.5 на Apple Silicon Mac — модель 22B генерирует видео и саундтрек одновременно, опять же на 16 ГБ, с помощью плагина vpipe-ltx-2.5.
- Использует Krea-2 Turbo — модель преобразования текста в изображение, оптимизированную для 12B CFG, — на опубликованных весах bf16, без этапа квантования. 
- Генерация изображений и видео на компьютерах Mac с базовой моделью.
- Мультимодальные конвейеры в реальном времени для VQA, ASR, чата, TTS, редактирования изображений, генерации видео и использования инструментов. Теперь с поддержкой Qwen 3.8 27B!

Это не LLM-чат, а локальная мультимодальная pipeline-система с собственными Metal kernels.
Видео → аудио → изображения → VLM → ASR → TTS → инструменты можно соединять в единый граф. Есть image generation / editing, MiniMax H3 video+audio, LTX-2.5, Krea, realtime VQA, Qwen chat и локальные tools.
И что особенно приятно — на официальном сайте разработчики прямо относят M4 Max 48–128 GB к классу машин для:
Video generation + Video/Audio + Batch runs.
Если Draw Things — удобный генератор, то VPIPE — скорее локальная лаборатория мультимодального AI.

🔗 https://vpipe.ai
🔗 https://github.com/tgo-app-dev/vpipe
⬇️ Скачать: VpipeManager-0.1.46-с-ffmpeg.dmg
#VPIPE #AiVideo #ASR #TTS #MiniMaxH3 #LTX25 #Krea #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1👎1
📊 Anubis -Локальное тестирование и бенчмаркинг больших языковых моделей для Apple Silicon

Anubis — это нативное приложение для macOS, предназначенное для тестирования, сравнения и управления локальными большими языковыми моделями с использованием любой конечной точки, совместимой с OpenAI: Ollama, MLX, oMLX, LM Studio Server, OpenWebUI, Docker Models и т. д. 
Это не ещё один inference engine. Это инструмент, который позволит понять, какой из всех этих движков реально лучше работает на вашем конкретном M4 Max.
С версии 3.0 он умеет также тестировать Apple Intelligence / Foundation Model.
Anubis подключается к Ollama, LM Studio, MLX, oMLX и любому OpenAI-compatible серверу и одновременно измеряет output tok/s, prefill tok/s, TTFT, GPU, CPU, process/model memory, энергопотребление, частоту GPU и thermal state. Есть сохранение результатов и Arena Mode.
Приложение создано на SwiftUI для Apple Silicon и предоставляет аппаратную телеметрию в режиме реального времени, сопоставленную с полной производительностью логического вывода с сохранением истории — такого нет ни в одном инструменте командной строки или чат-обёртке. Экспортируйте результаты тестов напрямую, без скриншотов, а необработанные данные — в формате .MD или .CSV из истории. Вы даже можете OLLAMA PULL моделировать прямо в приложении.
Можно поставить его до начала сравнений gmlx / Rapid-MLX / oMLX / LM Studio / MLX Studio.

🔗 https://github.com/uncSoft/anubis-oss
📊 Рейтинг сообщества
🎞 Демо: https://www.youtube.com/watch?v=SGgSmVn-IlE
#Anubis #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Swama — очень чистая Mac-архитектура
Одним приложением закрываются:
LLM → VLM → embeddings → STT → экспериментальный TTS → tool calling.
Для распознавания речи используются локальные MLX-модели вроде Qwen3-ASR.
Swama — это высокопроизводительная среда выполнения для машинного обучения, написанная на чистом Swift, разработанная специально для macOS и основанная на фреймворке Apple MLX. Она представляет собой мощное и простое в использовании решение для локального логического вывода в больших языковых моделях (Large Language Model, LLM) и визуальных языковых моделях (Vision Language Model, VLM).

Возможности:
🚀 Высокая производительность: построено на фреймворке Apple MLX, оптимизировано для Apple Silicon
🔌 API, совместимый с OpenAI: стандартная поддержка конечных точек /v1/chat/completions, /v1/embeddings, /v1/audio/transcriptions и /v1/audio/speech (экспериментальная) с вызовом инструментов
📱 Приложение в строке меню: элегантная интеграция с собственной строкой меню macOS
💻 Инструменты командной строки: полная поддержка интерфейса командной строки для управления моделями и логического вывода
🖼 Мультимодальная поддержка: поддержка текстового и графического ввода
🎤 Локальная аудиотранскрипция: встроенное распознавание речи на основе Qwen3-ASR и других моделей MLX ASR (без использования облачных сервисов)
🔍 Текстовые эмбеддинги: встроенная генерация эмбеддингов для семантического поиска и приложений RAG
📦 Умное управление моделями: автоматическая загрузка, кэширование и управление версиями
🔄 Потоковые ответы: поддержка потоковой генерации текста в реальном времени
🌍 Интеграция с HuggingFace: прямая загрузка моделей из HuggingFace Hub

🔗 https://github.com/Trans-N-ai/swama
⬇️ Скачать: Swama.dmg (v2.4.0 от 09.09.2026)
#Swama #Qwen3ASR #ASR #STT #TTS #RAG #Parakeet #Whisper #MOSS #Voxtral #SenseVoice #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤖 Klee - Собственный ИИ-агент для macOS, который работает исключительно на вашем Mac.
Никаких облачных сервисов, аккаунтов и подписок.
Klee — чрезвычайно простой путь к моделям 122B!
Klee использует MLX для запуска больших языковых моделей непосредственно на Apple Silicon, поэтому ваши диалоги никогда не покинут ваше устройство.

Возможности:
- 100% локальный вывод - ваши данные остаются на вашем Mac
- Учетная запись или ключ API не требуются - скачайте и начните общаться в чате
- Загрузка модели в один клик - выберите модель, Klee сделает все остальное
- Вызов встроенного инструмента - искусственный интеллект может читать / записывать файлы, искать в Интернете и запускать команды командной оболочки
- Поддержка Vision - прикрепляйте изображения к вашим сообщениям с помощью поддерживаемых моделей VLM
- Поиск в Интернете - выполняйте поиск в Интернете с помощью Jina AI (бесплатный ключ API, настраивается на боковой панели)
- Потоковые ответы - токены отображаются по мере их создания
- Встроенное мышление - смотрите процесс рассуждений модели на складной карточке
- Платформенные модули - расширяйте искусственный интеллект с помощью встроенных интеграций Swift (скоро появятся)
- Легкий - ~ 75 МБ встроенного приложения SwiftUI, без Electron, без Docker, без фоновых служб

Klee — небольшой нативный SwiftUI AI-agent с MLX. Есть файловые инструменты, shell, web, vision и tool calling.
Что интересно именно вам: разработчики дают прямую аппаратную градацию и для 96 GB+ рекомендуют Qwen 3.5 122B MoE, примерно 70 GB в 4-bit.
Это хороший вариант, если хочется посмотреть, как 122B работает без настройки серверов, Python, портов и API.
(проект пока существенно моложе Osaurus; первая большая версия вышла в марте 2026 года.)

🔗 https://github.com/signerlabs/Klee
Скачать: Klee-v1.0.0.zip
#Klee #AiAgent #AgentAi #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM