llama.app - приложение для Mac и сервис llama от llama.cpp
Запускайте frontier AI полностью на своем компьютере. Никаких API-ключей, никакой телеметрии, никаких ограничений. Владейте своими моделями и диалоговыми данными.
Проект: https://github.com/ggml-org/llama.cpp
(Обсуждение)
#llama #llamacpp #llamaapp #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek V4 Flash в LM Studio (Mac)
Внедрение форка DeepSeek V4 Flash llama.cpp от antirez в LM Studio (Mac, 128 ГБ объединенной памяти). Патчи для устранения дрейфа ABI/структуры данных, пакетного слияния, рецепта подписи кода.
🔗 https://github.com/noreff/lmstudio-dsv4-patch
(Обсуждение)
#LMStudio #DeepSeekV4Flash #llamacpp #MacOS #LocalAi #AiLocal
Внедрение форка DeepSeek V4 Flash llama.cpp от antirez в LM Studio (Mac, 128 ГБ объединенной памяти). Патчи для устранения дрейфа ABI/структуры данных, пакетного слияния, рецепта подписи кода.
Установите форк deepseek_v4 llama.cpp от antirez в LM Studio, чтобы запустить DeepSeek V4 Flash — 256-экспертный MoE, ~80 ГБ резидентной памяти, до 1 М контекста токенов — на Mac с 128 ГБ объединенной памяти.
Это обходной путь. Upstream llama.cpp пока не поддерживает deepseek_v4 архитектуру (дискуссия #22376). Среда выполнения MLX в LM Studio отклоняет GGUF V4 (ошибка #1872). Пока эти изменения не внедрены, это единственный рабочий способ запустить V4-Flash из пользовательского интерфейса LM Studio / сервера, совместимого с OpenAI.
Что вы получаете:
- DeepSeek V4 Flash загружена как обычная модель в LM Studio
- API, совместимый с OpenAI, на http://localhost:1234
- Полный контекст из 1 048 576 токенов
- ~190 токенов в секунду при обработке подсказок, ~26 токенов в секунду при генерации
- Работает с любым клиентом OpenAI-API (в т. ч. pi, Open WebUI, вашими собственными скриптами)
Протестировано на MacBook Pro M5 Max, 128 ГБ, macOS 26.4. Должно работать и на M2/M3/M4 Max с 128 ГБ.
(Обсуждение)
#LMStudio #DeepSeekV4Flash #llamacpp #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek-V4-Flash 284B на 5.3GB памяти!
💥 Mference - Большие модели MoE в "малом" объеме оперативной памяти!
Механизм логического вывода Swift + Metal для любых компьютеров Apple Silicon Mac, даже с 8 ГБ оперативной памяти.
🔗 https://github.com/NeelM0906/Mference
(Обсуждение)
#DeepSeekV4Flash #Mference #TurboFieldfare #MacOS #LocalAi #AiLocal
💥 Mference - Большие модели MoE в "малом" объеме оперативной памяти!
Механизм логического вывода Swift + Metal для любых компьютеров Apple Silicon Mac, даже с 8 ГБ оперативной памяти.
Перевод поста:
Продолжая работу над портом Qwen 3.6, я хотел продолжать добавлять модели и в итоге по пути исправил кучу вещей, так что теперь у него есть собственный движок: Mference.
Основная идея та же, что и в TurboFieldfare: модели MoE активируют несколько параметров B для каждого токена, поэтому можно оставить общее ядро и кэш KV, а выбранные эксперты будут загружаться с SSD.
Что работает сейчас:
- Gemma 4 26B-A4B — ~2 ГБ, 31–35 tok/s на M5 Pro 24 ГБ
- Qwen 3.6 35B-A3B — ~1,45 ГБ, 19–23 tok/s
- DeepSeek-V4-Flash 284B-A13B — новинка. ~6,8 ГБ пиковой памяти, на практике в основном ~5,3 ГБ, до 4,8 ток/с на том же M5 с 24 ГБ памяти. 2-битное динамическое квантование, ~91 ГБ на диске.🙂 Кроме того, мы добавили собственное приложение для Mac с многопоточным чатом, совместимым с OpenAI сервером и локальными вложениями в формате PDF/DOCX/PPTX/XLSX.
Отсюда я хочу продолжать добавлять семейства моделей, сократить время ожидания при экспертном чтении (сейчас декодирование занимает ~53 % времени ввода-вывода и выполняется последовательно с вычислениями) и увеличить размер контекста до 4 КБ.
Это не очень полезно после нескольких ходов, но технически вы можете запустить «пригодный для использования» dsv4f на Mac с 8 ГБ памяти. Дальше будет только лучше.
(Обсуждение)
#DeepSeekV4Flash #Mference #TurboFieldfare #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
✨ WinterMix — Qwen3.5-122B-A10B в native MLX: сборка на 82 Гб, которая превосходит 94-95 Гб квантов, плюс сборка на 68 Гб для agent swarms [Релиз]
Пост: https://www.reddit.com/r/LocalLLaMA/comments/1vdcs8e/release_wintermix_qwen35122ba10b_in_native_mlx_an/
#Qwen35 #Qwen35122B #WinterMix #MLX #AppleSilicon #GGUF #MacOS #LocalAi #AiLocal
Перевод поста:
Зачем напрягаться, если GGUF лучше?
MLX на Apple Silicon работает значительно быстрее, чем llama.cpp на том же оборудовании — на моем M5 Max я заметил, что предварительное заполнение происходит примерно в 9 раз быстрее, а генерация токенов — примерно на 20% быстрее. Для задач с длинным контекстом и большим количеством поворотов этот разрыв увеличивается.
Проблема в том, что существующие кванты MLX с разрядностью менее 6 бит не очень хороши, и это видно из приведенной ниже таблицы: oQ4 уступает исходному GGUF примерно на 3,8 % по перплексии при коротком контексте и примерно на 4,2 % при длинном контексте. На практике это проявляется в виде бессвязных логических цепочек и ошибок округления, которые накапливаются до тех пор, пока модель не начинает выдавать ложные результаты.
Таким образом, более совершенный метод квантования MLX дает реальные преимущества для агентных рабочих процессов и локального ИИ на Apple Silicon. В то же время я принял осознанное решение потребовать нативной поддержки MLX. imatrix на MLX не является нативным форматом — для него нужны пользовательские ядра. Кванты WinterMix являются нативным форматом и могут использоваться как замена.
Квантованные модели WinterMix — это нативные модели MLX с открытыми весами (Apache 2.0). Никаких пользовательских ядер, никакой форк-версии среды выполнения, никаких флагов. Они загружаются везде, где работает MLX — в LM Studio, mlx-vlm и других — со стандартной скоростью, с полностью функциональной «башней видения» и связными следами мышления.
Ссылки HuggingFace:
- WinterMix58 — 82 ГБ, ~6,0 бит/с: лучший показатель MLX для этой модели, который мне известен, при любом размере, в том числе по сравнению с 6-битными сборками oMLX размером 94–95 ГиБ (с небольшим отрывом при 2 КБ, с большим отрывом при 16 КБ).
- WinterMix48 — 68 ГБ, ~5,0 б/с: на Mac с 128 ГБ остается ~35–40 ГБ свободного места = 5–8 параллельных сессий агента с 100-килобайтными токенами одновременно (архитектура GDN поддерживает кэш сессий с 100-килобайтными токенами объемом ~5–10 ГБ). Превосходит своего прямого конкурента по размеру (oQ4, 67 ГиБ) примерно на 1,4–1,5 % при обоих размерах контекста.
Пост: https://www.reddit.com/r/LocalLLaMA/comments/1vdcs8e/release_wintermix_qwen35122ba10b_in_native_mlx_an/
#Qwen35 #Qwen35122B #WinterMix #MLX #AppleSilicon #GGUF #MacOS #LocalAi #AiLocal
Microsoft выпустила сжатую версию VibeVoice-ASR для работы в реальном времени без GPU. Качество ниже, чем у полной модели VibeVoice-ASR-7B, но зато можно запустить на обычном процессоре.
💻 Модель работает на x86 с AVX2 и ARM с NEON, поддерживает несколько языков. Размер — 1.58 ГБ против исходных 4.62 ГБ. По скорости обгоняет Whisper.cpp в 1.6–2.3 раза.
#VibeVoiceASR #VibeASR #ASR #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Локальная диктовка в macOS с использованием GigaAM, Whisper, Qwen и Apple Speech — автономная транскрипция и очистка локального текста.
- GigaAM v3 E2E RNNT — основной режим для русской речи;
- Whisper Large V3 Turbo (MLX) — для смешанной русско-английской речи;
- Qwen3-ASR 1.7B (MLX) — международный многоязычный режим;
- Apple SpeechAnalyzer — системная локальная диктовка на macOS 26+;
- Qwen3-4B (MLX) — локально исправляет или конвертирует расшифровку;
- режимы текста Дословно , Исправить и Кратко ;
- fn + ⌥ Option— начать или остановить запись;
- HUD показывает запись, расшифровку, локальную редактуру и результат;
- аудио и текст не отправляются во внешний API;
- Журнал сравнения помогает выбрать модель под собственную речь.
Системные требования:
- Mac с Apple Silicon ( M1или новее);
- macOS 14 Sonoma или новее;
- рекомендуется 16 ГБ оперативной памяти;
- около 12 ГБ свободного места для Python, зависимостей и четырех загружаемых моделей;
- Интернет только во время первоначальной установки модели.
(Статья Автора на Хабр)
#VoiceSwitch #MacOS #GigaAM #GigaAMV3 #Whisper #Qwen #ASR #Транскрибация #Диктовка #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Witsy — это приложение с ИИ-технологией BYOK (Bring Your Own Keys): это значит, что вам нужны API-ключи для провайдеров больших языковых моделей, которых вы хотите использовать. Кроме того, вы можете использовать Ollama, чтобы бесплатно запускать модели локально на своем компьютере и использовать их в Witsy.
Это первый из очень немногих (единственных?) универсальных MCP-клиентов:
Witsy позволяет запускать MCP-серверы практически с любой большой языковой моделью!
Неполный список функций:
- дополнение чата с поддержкой визуальных моделей (описание изображения)
- преобразование текста в изображение и видео
- преобразование изображения в изображение (редактирование изображений) и видео
- плагины LLM для расширения возможностей LLM: выполнение кода Python, поиск в интернете...
- поддержка сервера Anthropic MCP
- Scratchpad для интерактивного создания лучшего контента с помощью любой модели!
- Prompt anywhere позволяет генерировать контент непосредственно в любом приложении
- Команды искусственного интеллекта, которые можно запускать с выделенным текстом практически в любом приложении
- Подсказки экспертов специализируют вашего бота на определенной теме
- Плагин долговременной памяти для повышения релевантности ответов LLM
- Чтение вслух сообщений помощника
- Чтение вслух любого текста в других приложениях
- Общение в чате с вашими локальными файлами и документами (RAG)
- Транскрипция / диктовка (преобразование речи в текст)
- Чат в реальном времени, также известный как голосовой режим
- Поддержка использования антропного компьютера
- Локальная история разговоров (с автоматическими заголовками)
- Форматирование и копирование сгенерированного кода в буфер обмена
- Экспорт беседы в PDF
- Скопируйте и загрузите изображение
(Рассмотрен в статье про RAG-системы)
#Witsy #Ollama #MCP #RAG #MacOS #Windows #Linux #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👉 Nativ — это передовой искусственный интеллект у вас на столе. Скачивайте и запускайте открытые модели на Apple Silicon — никаких аккаунтов, подписок и облачных сервисов.
👉 Llama GUI - Удобный графический интерфейс для Llama.cpp, упрощающий настройку и запуск. Легкий локальный лаунчер и панель управления для llama.cpp в Windows, macOS и Linux.
👉 Unsloth Studio - веб-интерфейс с открытым исходным кодом и без программирования для обучения, запуска и экспорта открытых моделей в одном унифицированном локальном интерфейсе.
👉 oMLX - Локальный ИИ
Пост: https://t.me/Ai2Local/490 и https://t.me/Ai2Local/604
👉 MTPLX - Запускайте локальные языковые модели
в два раза быстрее.
MTPLX — это нативное приложение для Mac с локальным ИИ. Чат, агенты и локальный сервер — все в два раза быстрее.
Подробнее: https://t.me/Ai2Local/1014
👉 KoboldCpp - это легкое автономное приложение, которое позволяет запускать большие языковые модели (LLM) локально на вашем компьютере. Он основан на проекте llama.cpp и особенно популярен для генерации текстов ИИ и ролевых игр.
👉 llama.cpp - ИИ, который живет на вашем компьютере. С открытым исходным кодом, приватный и всегда локальный.
Пост: https://t.me/Ai2Local/937
👉 LM Studio Bionic — это новейшая версия LM Studio. У Bionic то же ядро LM Studio, и, кроме того, теперь он может сделать намного больше с агентом!
И другие приложения из этого Канала! (Их много!)
#LMStudio #Nativ #LlamaGUI #Llamacpp #UnslothStudio #oMLX #MTPLX #KoboldCpp #Bionic #MacOS #SoftAi #AiSoft #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Speechfony - это локальное настольное приложение, которое читает ваши PDF-файлы вслух и превращает их в аудиокниги - полностью автономно, на базе Kokoro 82M и local LLMs via llama.cpp.
Функции:
- Чтение PDF — прокрутка страниц с помощью PDF.js, настраиваемые поля для чтения и возможность продолжить с того места, на котором вы остановились
- Прослушивание во время чтения — построчное воспроизведение с синхронизацией выделения
- Экспорт аудиокниги — пакетный синтез выбранных страниц в MP3 (только для настольного приложения)
- Автономная TTS — Kokoro работает на устройстве; модели загружаются при первом запуске
- Аппаратное ускорение — CoreML в macOS, DirectML/CUDA в Windows, CUDA в Linux (при наличии)
- Последние документы — быстрый доступ к ранее открытым PDF-файлам
Платформы: macOS Apple Silicon, Windows x64, Linux x64 (glibc ≥ 2.38). Сборки для Intel Mac пока недоступны.
При первом запуске загружается голосовая модель (~130 МБ с Hugging Face). После этого приложение работает без подключения к сети.
(Обсуждение)
#Speechfony #Kokoro #llamacpp #TTS #MacOS #Windows #Linux #SoftAi #AiSoft #eBook #EPUB #PDF #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Этот сервер основан на архитектуре и пользовательском интерфейсе нашего проекта Dia-TTS-Server, но использует собственный chatterbox-tts движок. Работает с ускорением на графических процессорах NVIDIA (CUDA), AMD (ROCm) и Apple Silicon (MPS), а в случае сбоя — на центральном процессоре.
Multilingual поддерживает 23 языка, включая арабский, китайский, датский, голландский, английский, финский, французский, немецкий, греческий, иврит, хинди, итальянский, японский, корейский, малайский, норвежский, польский, португальский, русский, испанский, шведский, суахили и турецкий.
📦 Портативный режим (Windows): Это приложение поддерживает полностью автономную установку — вся папка, включая Python и все зависимости, является самодостаточной. Скопируйте ее на USB-накопитель, отправьте в виде zip-архива или переместите куда угодно. Просто дважды щелкните start.bat — установка Python на целевом компьютере не требуется. Подробнее →
(Обсуждение TTS)
SoTA с открытым исходным кодом TTS для создания аудиокниг и подкастов
#ChatterboxTTSServer #Chatterbox #TTS #Windows #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
MOSS-Transcribe-Diarize Pro — более мощная модель с более высокими общими показателями, доступная на онлайн-платформе.
MOSS-Transcribe-Diarize 0.9B поддерживает более 50 языков.
#MOSS #Transcribe #Diarize #ASR #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek V4 Flash-0731 можно запустить на одном Mac!
На Hugging Face выложили GGUF-сборку DeepSeek-V4-Flash-0731 для Apple Silicon со 128 ГБ памяти. Модель содержит 304 млрд параметров, поддерживает контекст до 1 млн токенов и после квантизации занимает 97,6 ГБ.
Квантизация смешанная: attention и общие эксперты сохранены в высокой точности, остальные MoE-эксперты сжаты агрессивнее — до 2 и 4 бит.
Запуск через специальный движок ds4 / DwarfStar:
⚠️ Это нестандартный GGUF — не загрузится в Ollama, LM Studio или llama.cpp из-за особой структуры тензоров. Работает медленно и требует мощное железо, зато полностью локально.
🔗 https://huggingface.co/ox-ox/DeepSeek-V4-Flash-0731-gguf-ds4
#DeepSeekV4 #DeepSeekV4Flash0731 #DSV4 #DS4 #DwarfStar #MacOS #AiModel #ModelAi #GGUF #LocalAi #AiLocal
На Hugging Face выложили GGUF-сборку DeepSeek-V4-Flash-0731 для Apple Silicon со 128 ГБ памяти. Модель содержит 304 млрд параметров, поддерживает контекст до 1 млн токенов и после квантизации занимает 97,6 ГБ.
Квантизация смешанная: attention и общие эксперты сохранены в высокой точности, остальные MoE-эксперты сжаты агрессивнее — до 2 и 4 бит.
Запуск через специальный движок ds4 / DwarfStar:
git clone https://github.com/antirez/ds4
cd ds4
make
./ds4 -m gguf/DeepSeek-V4-Flash-0731-....gguf -p "Напиши распределённый кеш на Go"
#DeepSeekV4 #DeepSeekV4Flash0731 #DSV4 #DS4 #DwarfStar #MacOS #AiModel #ModelAi #GGUF #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🎤 NVIDIA выпустила Nemotron VoiceChat — первую открытую голосовую модель с поддержкой инструментов
Модель на 11B параметров работает в полнодуплексном режиме: разговор идёт без пауз, с естественной сменой реплик. Можно перебивать систему на полуслове — она адаптируется на лету.
Ключевые возможности: вызов внешних инструментов прямо в диалоге, генерация речи с эмоциональной окраской, мультимодальные сценарии взаимодействия и файнтюн под разные стили голоса. Первая открытая модель такого класса с интеграцией инструментов.
🔗 https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat
🔗 https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
#VoiceChat11B #VoiceChat #AiVoice #nemotron #AiModel #ModelAi #LocalAi #AiLocal
Модель на 11B параметров работает в полнодуплексном режиме: разговор идёт без пауз, с естественной сменой реплик. Можно перебивать систему на полуслове — она адаптируется на лету.
Ключевые возможности: вызов внешних инструментов прямо в диалоге, генерация речи с эмоциональной окраской, мультимодальные сценарии взаимодействия и файнтюн под разные стили голоса. Первая открытая модель такого класса с интеграцией инструментов.
#VoiceChat11B #VoiceChat #AiVoice #nemotron #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Benchmarks:
Mean retention, 12 benchmarks
- Mach-1 Small - 95.0%
- Ternary Bonsai 27B (PrismML) - 93.6%
- Gemma 4 Q2_K_XL (Unsloth) - 85.6%
Карточка: https://huggingface.co/SyzygyResearch/Mach-1-Additive-35B
Демо прямо в браузере: mach-1-small-additive · Скачает: 7,8 ГБ ·
на webgpu https://withsyzygy.com/mach-1
(Обсуждение)
#Mach1 #Mach1Additive #Qwen36 #webgpu #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenWorker — ассистент, который работает локально и автоматизирует рутину: собирает документы, синхронизирует календари, разбирает почту. Всё это без отправки данных на внешние серверы.
Ассистент подключается к 25+ сервисам: GitHub, Slack, Jira, Notion, Google-приложения. Умеет работать по расписанию и запрашивает подтверждение перед серьёзными действиями — например, перед отправкой письма или удалением файла.
Как это работает:
- Укажите OpenWorker желаемый результат — «подготовить техническое задание для клиента», «разложить по полочкам мой календарь», «набросать отчет», «проверить статус релиза в Jira и GitHub».
- Приложение разбивает задачу на этапы и работает с вашим рабочим столом, файлами и подключенными приложениями.
- Прежде чем выполнить что-то важное — отправить сообщение, изменить календарь, выполнить команду, — приложение запрашивает подтверждение, и вы утверждаете его или перенаправляете.
- Вы получаете готовый результат, а не список дел.
Поддерживает разные модели через API-ключи — можно использовать как облачные, так и локальные варианты.
Поддерживается «из коробки»:
OpenAI · Anthropic · Google Gemini · Inkling (Thinking Machines) · GLM (Z.ai) · DeepSeek · Kimi (Moonshot) · Qwen · MiniMax · Mistral · Grok (xAI) — а также модели с открытым исходным кодом через Together и Fireworks и полностью локальные модели через Ollama.
Работает на macOS и Windows, данные хранятся только на твоём компьютере.
#OpenWorker #MacOS #Windows #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM