Собственное приложение для чата в macOS, позволяющее запускать большие языковые модели прямо на устройстве. Локальные модели запускаются на Apple Silicon с помощью MLX; Apple Intelligence доступна в качестве встроенного движка в macOS 26+.
Интеллект в одном приложении.
Запускайте мощные языковые модели и модели на основе смеси экспертов полностью на своем Mac. Используйте MLX, потоковую передачу больших моделей на основе смеси экспертов с SSD или Apple Intelligence — и все это в одном собственном приложении для чата.
MLX Chat. Очень свежий нативный проект. Работает непосредственно с MLX, умеет импортировать MLX-репозитории Hugging Face, управлять моделями, освобождать RAM после простоя, показывать reasoning и даже использовать Apple Intelligence как отдельный движок. Есть интересный экспериментальный режим SSD-streaming для MoE. Требуется Apple Silicon и macOS 26+. По функциональности пока уступает LM Studio, но как чистый нативный MLX-клиент за ним стоит следить.
#MLXChat #MLX #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Без облака, без отслеживания, без входа в систему.
Очень простое нативное решение для пользователя, которому не хочется знать, что такое GGUF, сервер, endpoint и порт 11434. Купили один раз, скачали модель — Mac/iPhone/iPad работают полностью offline.
LM Studio / macMLX дают гораздо больше контроля. Но для обычного пользователя Mac — отличная рекомендация.
#PrivateLLM #iOS #iPhone #iPad #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Экономьте часы на письменном общении на работе
Пишите электронные письма, ответы в Slack, тикеты в Jira, редактируйте тексты, общайтесь с документами...
Kerlig интересен совершенно другим сценарием: локальная модель становится частью macOS. Вы выделяете текст практически в любом приложении и можете переписать, сократить, перевести, ответить и т. д. В качестве backend поддерживается Ollama, включая добавление собственных моделей.
То есть это не конкурент LM Studio, а полезный front-end поверх него/Ollama.
#Kerlig #Ollama #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
✨ gmlx - Самый быстрый способ запустить модели GGUF на Apple Silicon.
Главная идея необычная: взять обычные GGUF-файлы с K-quants/IQ-quants, которые обычно запускаются через llama.cpp, и исполнять их через специализированные MLX/Metal kernels. То есть не нужно выбирать между огромной экосистемой GGUF и высокой эффективностью MLX.
🔗 https://github.com/asher/gmlx
#gmlx #RAG #MLX #MacOS #LocalAi #AiLocal
Главная идея необычная: взять обычные GGUF-файлы с K-quants/IQ-quants, которые обычно запускаются через llama.cpp, и исполнять их через специализированные MLX/Metal kernels. То есть не нужно выбирать между огромной экосистемой GGUF и высокой эффективностью MLX.
gmlx умеет сервер OpenAI + Anthropic API, tool calling, structured output, VLM, embeddings, reranking, STT/TTS, RAG и LoRA. Ещё интереснее — есть disk streaming MoE-моделей, которые физически больше RAM. Авторы пишут, что таким способом 200B-класс моделей может запускаться даже на 64 GB Mac. Для 128 GB это открывает очень необычные варианты.
Авторы также публикуют собственные тесты, где на одинаковом GGUF gmlx обгоняет llama.cpp, особенно при длинном контексте.
gmlx — это локальная платформа для логического вывода. Вы можете общаться с открытой моделью в терминале или в браузере, предоставлять к ней доступ через API, совместимые с OpenAI и Anthropic, подключить к ней агента кодирования, общаться с ней голосом, создать на ее основе локальный стек RAG и дообучить ее с помощью LoRA.
Она работает с опубликованными версиями K-quant и IQ-quant GGUF. Эти форматы являются наиболее точными открытыми квантовыми моделями при заданном размере файла, а сопутствующий проект mlx-kquant предоставляет ядра Metal, которые запускают их на платформе MLX от Apple.
В том же файле gmlx работает быстрее, чем llama.cpp, и разрыв наиболее заметен при использовании длинных контекстов, которые применяются в агентах кодирования и длительных сессиях. Модель на основе смеси экспертов, размер которой превышает объем оперативной памяти, все равно работает, загружая экспертов с диска.
Поддерживаемые архитектуры:
- Llama, Mistral, Phi-3, SmolLM3, Seed-OSS и ERNIE-4.5
- Qwen со 2 по 3.8, dense и MoE, с гибридными семействами attention
- Gemma с 1 по 4, за исключением варианта 3n, GGUF которого разбиты выше по течению.
- DeepSeek V3, R1 и V4-Flash
- GLM с 4 по 5.2, Kimi-K3, MiniMax M2 и M3 и gpt-oss
- Hunyuan, Hy3, HY4 и Muse Glimmer
- Granite, Nemotron-H и Falcon-H1
#gmlx #RAG #MLX #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👎2
✨ Rapid-MLX — самый быстрый локальный ИИ-движок для Apple Silicon
Встроенный API OpenAI / Anthropic · пропускная способность до 3 раз выше, чем у Ollama (измерено) · Работает на любом Mac серии M.
Общайтесь без интернета или диктуйте текст в любое приложение с помощью Whisper, Qwen3-ASR, SenseVoice или Parakeet, запущенных локально. Есть: Генерация изображений и Видео!
🔗 https://github.com/xinqiyang/rapid-mlx
🔗 https://pypi.org/project/rapid-mlx/
⬇️ Скачать Rapid-MLX Desktop: https://rapidmlx.com/desktop
Посмотреть подписанные релизы Desktop
#RapidMLX #AppleSilicon #MLX #Whisper #Qwen3ASR #ASR #STT #Parakeet #SenseVoice #Транскрибация #MacOS #LocalAi #AiLocal
Встроенный API OpenAI / Anthropic · пропускная способность до 3 раз выше, чем у Ollama (измерено) · Работает на любом Mac серии M.
Общайтесь без интернета или диктуйте текст в любое приложение с помощью Whisper, Qwen3-ASR, SenseVoice или Parakeet, запущенных локально. Есть: Генерация изображений и Видео!
❗️ В 4,2 раза быстрее Ollama, время до первого ответа с кэшированием 0,08 с, 100% вызов инструментов. 17 парсеров инструментов, кэш подсказок, разделение рассуждений, облачная маршрутизация. Полная замена OpenAI. Работает с Claude Code, Cursor, Aider.
Rapid-MLX специализируется именно на быстрой работе Apple Silicon и предоставляет OpenAI-compatible API, tool calling, prompt caching, reasoning separation и интеграцию с агентами.
Особенно показательно, что разработчики уже отдельно ориентируют продукт на большие машины: в их опубликованной таблице есть Qwen 3.5 122B для 96+ GB и даже DeepSeek V4 Flash 158B-A13B для 128+ GB. Для Qwen 122B заявлено около 57 tok/s.
⬇️ Скачать Rapid-MLX Desktop: https://rapidmlx.com/desktop
Посмотреть подписанные релизы Desktop
#RapidMLX #AppleSilicon #MLX #Whisper #Qwen3ASR #ASR #STT #Parakeet #SenseVoice #Транскрибация #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👎2
Легкие локальные мультимодальные ИИ-конвейеры и пользовательский Metal-вывод для компьютеров Apple Silicon Mac.
- Мультимодальный граф: видео, аудио, изображения, текст и действия с инструментами в одном конвейере.
- Собственный Metal-вывод: пользовательские ядра и отсутствие сторонних тензорных фреймворков для оптимальной скорости.
- Базовая модель для Mac: потоковая передача весов и подготовка 4-битной модели для генерации изображений/видео на компьютерах с 16 ГБ памяти.
- Готовые рабочие процессы: редактирование изображений, видео в MiniMax H3, чат Qwen, VQA в реальном времени, ASR/TTS и вызов локальных инструментов.
- Воспроизводимый Composer: сохранение макетов, подсказок, параметров и конфигурации модели для каждой спецификации пайплайна.
- Простота в использовании: приложение для macOS, управление через веб-интерфейс и удаленный доступ через браузер на телефоне.
Почему VPIPE:
- Запускает MiniMax H3 FL2VA и REF2VA на Apple Silicon Mac — модели 33B, которая генерирует видео и его звуковое сопровождение на накопителе объемом всего 16 ГБ. Теперь с поддержкой Turbo LoRA!
- Работает LTX-2.5 на Apple Silicon Mac — модель 22B генерирует видео и саундтрек одновременно, опять же на 16 ГБ, с помощью плагина vpipe-ltx-2.5.
- Использует Krea-2 Turbo — модель преобразования текста в изображение, оптимизированную для 12B CFG, — на опубликованных весах bf16, без этапа квантования.
- Генерация изображений и видео на компьютерах Mac с базовой моделью.
- Мультимодальные конвейеры в реальном времени для VQA, ASR, чата, TTS, редактирования изображений, генерации видео и использования инструментов. Теперь с поддержкой Qwen 3.8 27B!
Это не LLM-чат, а локальная мультимодальная pipeline-система с собственными Metal kernels.
Видео → аудио → изображения → VLM → ASR → TTS → инструменты можно соединять в единый граф. Есть image generation / editing, MiniMax H3 video+audio, LTX-2.5, Krea, realtime VQA, Qwen chat и локальные tools.
И что особенно приятно — на официальном сайте разработчики прямо относят M4 Max 48–128 GB к классу машин для:
Video generation + Video/Audio + Batch runs.
Если Draw Things — удобный генератор, то VPIPE — скорее локальная лаборатория мультимодального AI.
#VPIPE #AiVideo #ASR #TTS #MiniMaxH3 #LTX25 #Krea #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👎1
Anubis — это нативное приложение для macOS, предназначенное для тестирования, сравнения и управления локальными большими языковыми моделями с использованием любой конечной точки, совместимой с OpenAI: Ollama, MLX, oMLX, LM Studio Server, OpenWebUI, Docker Models и т. д.
Это не ещё один inference engine. Это инструмент, который позволит понять, какой из всех этих движков реально лучше работает на вашем конкретном M4 Max.
С версии 3.0 он умеет также тестировать Apple Intelligence / Foundation Model.
Anubis подключается к Ollama, LM Studio, MLX, oMLX и любому OpenAI-compatible серверу и одновременно измеряет output tok/s, prefill tok/s, TTFT, GPU, CPU, process/model memory, энергопотребление, частоту GPU и thermal state. Есть сохранение результатов и Arena Mode.
Приложение создано на SwiftUI для Apple Silicon и предоставляет аппаратную телеметрию в режиме реального времени, сопоставленную с полной производительностью логического вывода с сохранением истории — такого нет ни в одном инструменте командной строки или чат-обёртке. Экспортируйте результаты тестов напрямую, без скриншотов, а необработанные данные — в формате .MD или .CSV из истории. Вы даже можете OLLAMA PULL моделировать прямо в приложении.
Можно поставить его до начала сравнений gmlx / Rapid-MLX / oMLX / LM Studio / MLX Studio.
📊 Рейтинг сообщества
#Anubis #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
✨ Swama — очень чистая Mac-архитектура
Одним приложением закрываются:
LLM → VLM → embeddings → STT → экспериментальный TTS → tool calling.
Для распознавания речи используются локальные MLX-модели вроде Qwen3-ASR.
🔗 https://github.com/Trans-N-ai/swama
⬇️ Скачать: Swama.dmg (v2.4.0 от 09.09.2026)
#Swama #Qwen3ASR #ASR #STT #TTS #RAG #Parakeet #Whisper #MOSS #Voxtral #SenseVoice #MacOS #LocalAi #AiLocal
Одним приложением закрываются:
LLM → VLM → embeddings → STT → экспериментальный TTS → tool calling.
Для распознавания речи используются локальные MLX-модели вроде Qwen3-ASR.
Swama — это высокопроизводительная среда выполнения для машинного обучения, написанная на чистом Swift, разработанная специально для macOS и основанная на фреймворке Apple MLX. Она представляет собой мощное и простое в использовании решение для локального логического вывода в больших языковых моделях (Large Language Model, LLM) и визуальных языковых моделях (Vision Language Model, VLM).
✨ Возможности:
🚀 Высокая производительность: построено на фреймворке Apple MLX, оптимизировано для Apple Silicon
🔌 API, совместимый с OpenAI: стандартная поддержка конечных точек /v1/chat/completions, /v1/embeddings, /v1/audio/transcriptions и /v1/audio/speech (экспериментальная) с вызовом инструментов
📱 Приложение в строке меню: элегантная интеграция с собственной строкой меню macOS
💻 Инструменты командной строки: полная поддержка интерфейса командной строки для управления моделями и логического вывода
🖼 Мультимодальная поддержка: поддержка текстового и графического ввода
🎤 Локальная аудиотранскрипция: встроенное распознавание речи на основе Qwen3-ASR и других моделей MLX ASR (без использования облачных сервисов)
🔍 Текстовые эмбеддинги: встроенная генерация эмбеддингов для семантического поиска и приложений RAG
📦 Умное управление моделями: автоматическая загрузка, кэширование и управление версиями
🔄 Потоковые ответы: поддержка потоковой генерации текста в реальном времени
🌍 Интеграция с HuggingFace: прямая загрузка моделей из HuggingFace Hub
#Swama #Qwen3ASR #ASR #STT #TTS #RAG #Parakeet #Whisper #MOSS #Voxtral #SenseVoice #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM