9 subscribers
9 photos
2 links
Download Telegram
Channel created
Проект Monarch уже в рабочем,и стабильном состоянии
2
Предварительные системные требования Monarch / Oscar

Monarch — локальная AI-платформа с агентом Oscar, работающая на локальных моделях Gemma. Система рассчитана на запуск без облака, без API-лимитов и без обязательной подписки: все основные вычисления происходят на компьютере пользователя.

На текущем этапе Monarch использует несколько уровней моделей:

Fast — лёгкая модель для быстрых ответов.
Balanced — основной повседневный режим.
DeepThinking — тяжёлый режим для сложных задач, кода, архитектурного анализа и глубокого reasoning.
Vision — локальная обработка изображений и скриншотов.

Минимальные требования

Подойдут для запуска базового локального чата, Fast/Balanced-режима и простых задач.

CPU: 6 ядер / 12 потоков или лучше
RAM: 16 GB
GPU: NVIDIA GPU с 6 GB VRAM, желательно с CUDA
SSD: от 50 GB свободного места
OS: Windows 10/11 Рекомендуемый тип диска: NVMe SSD

На минимальной конфигурации система сможет работать, но тяжёлые модели будут либо недоступны, либо очень медленны. DeepThinking на 26B/31B-моделях для такой конфигурации не рекомендуется.

Рекомендованные требования

Оптимальный вариант для нормальной повседневной работы Monarch с локальными моделями.

CPU: современный 8-ядерный процессор
RAM: 32 GB
GPU: NVIDIA RTX 4060 / RTX 3060 12GB / RTX 4070 или лучше
VRAM: от 8 GB
SSD: 100–150 GB свободного места
OS: Windows 11
Рекомендуемый тип диска: быстрый NVMe SSD

Такая конфигурация уже позволяет комфортно использовать Fast и Balanced-режимы, запускать локальное Vision и включать DeepThinking для отдельных тяжёлых задач.

Для DeepThinking

DeepThinking — это не быстрый чат, а тяжёлый режим для задач, где важнее качество ответа, чем скорость. Например: анализ кода, поиск багов, архитектурные решения, проверка планов и сложные технические вопросы.

Практически проверенная конфигурация:

RAM: 32 GB
GPU: RTX 4060 8 GB
CPU: Ryzen 7-класса
SSD: NVMe
Модель: Gemma 4 31B Q4_K_S

На такой системе 31B-модель запускается и работает локально, но потребление RAM может доходить примерно до 28–29 GB. Поэтому для DeepThinking желательно закрывать лишние тяжёлые программы и держать запас оперативной памяти.

Комфортная конфигурация для тяжёлых моделей

Для более спокойной работы с 26B/31B-моделями:

RAM: 64 GB
GPU: NVIDIA GPU с 12–16 GB VRAM или больше
SSD: 200+ GB свободного места
CPU: 8–12 современных ядер

Это уже позволит использовать тяжёлые модели с меньшим риском упора в оперативную память и с более стабильной скоростью.

Важно

Monarch не требует облака для базовой работы. Основная идея проекта — локальный AI-агент, который работает на своём железе, с собственным роутингом моделей, локальной памятью, инструментами, Vision и режимом DeepThinking.

Скорость зависит от выбранной модели. Лёгкие режимы отвечают быстро, а DeepThinking может отвечать десятки секунд или несколько минут — это ожидаемая цена за запуск тяжёлой модели полностью локально.
4🔥1
Monarch теперь можно управлять через Telegram!
3🔥1🤩1👾1
MONARCH VOICE

Короче, я наконец-то нормально выделил голосовой режим в отдельный модуль.

И важный момент: Voice — это не обычный Oscar, которому просто прикрутили микрофон и озвучку.

Это полностью отдельный контур, который сделан конкретно под быстрые голосовые команды, короткие вопросы и нормальное живое взаимодействие без задержек в полминуты.

Работает всё примерно так:

Микрофон → локальное распознавание речи → отдельный router → нужная модель или готовый сценарий → локальная озвучка.

Voice не отправляет аудио в облако, не пишет каждую реплику в историю обычного чата, не подмешивает память Oscar и не получает автоматически доступ ко всем его инструментам.

То есть это не ситуация, где я спросил время, а Monarch ради этого поднял большую модель, загрузил всю память, историю диалога и начал рассуждать над тем, который сейчас час.

Сначала запрос проходит через детерминированный router.

Простые вещи вроде времени, арифметики, проверки громкости, изменения громкости, погоды или веб-поиска могут выполняться вообще без LLM.

Короткие обычные реплики идут в локальный Qwen2.5 0.5B Micro.

Для небольшого диалога и более нормальных ответов используется Qwen3 1.7B Lite.

Обе модели постоянно работают на CPU и не занимают видеокарту, потому что GPU в этот момент нужен для локального TTS.

Если запрос уже сложнее, он отправляется в отдельный Fast-контур с коротким prompt и ограничением ответа.

А если задача вообще не подходит для голосового режима, Voice не будет пытаться пять минут пересказывать огромный документ или имитировать выполнение того, чего он не умеет. Он просто предложит продолжить уже в обычном текстовом чате.

Распознавание речи тоже полностью локальное. Сейчас используется постоянный Vosk worker, который не перезагружает модель после каждой фразы.

В fullscreen-режиме работает VAD: Monarch сам определяет, когда я начал говорить и когда закончил.

При этом никакого постоянно включённого фонового микрофона нет. Voice начинает слушать только после того, как пользователь сам открыл голосовой режим.

Озвучка работает через локальный Qwen3-TTS.

Модель, voice reference и CUDA graphs держатся в памяти, чтобы не загружать всё заново перед каждой фразой.

И да, орб в интерфейсе реагирует не на заранее заготовленную анимацию. В него передаются реальные данные громкости воспроизводимого голоса, поэтому визуализация действительно совпадает с речью.

По сути, Monarch Voice — это отдельный продукт внутри Monarch.

Не голосовая кнопка для чата, а самостоятельный быстрый и полностью локальный режим взаимодействия.
❤‍🔥21
MONARCH SAFE

Ещё один новый модуль — Monarch Safe.

Это отдельное защищённое хранилище для файлов внутри Monarch.

Но я сразу не хотел делать очередную обычную папку, на которую сверху просто повесили PIN-код и красивую иконку замка.

Safe физически отделён от основной части Monarch.

У него отдельный Electron utility process, свой sandboxed renderer и приватный IPC-канал.

Обычный интерфейс Monarch, Oscar, общий HTTP API и остальные модули не получают содержимое файлов, названия, метаданные, ключи или manifest Safe.

То есть Oscar не может просто взять и залезть в Safe, потому что он находится внутри одного приложения.

Данные хранятся вне репозитория в отдельной директории. Внутри нет обычных файлов в открытом виде — только зашифрованные blobs, конфигурация и ключевой материал.

Каждый файл и manifest шифруются через AES-256-GCM.

При создании новой версии файла генерируется отдельный случайный 256-битный ключ и создаётся новое поколение blob. Старая версия не удаляется, пока новая полностью не записана и не подтверждена.

Manifest также имеет собственную последовательную версию и умеет восстановиться после прерванной записи, выбрав последний валидный вариант.

PIN защищён через scrypt и дополнительно привязан к секрету конкретного устройства через Windows safeStorage.

То есть просто скопировать папку Safe на другой компьютер и подобрать PIN недостаточно.

Также создаются три recovery key. Каждый из них может независимо восстановить доступ к vault, но после использования конкретный ключ удаляется из активной конфигурации и второй раз уже не работает.

После трёх неправильных попыток ввода PIN активные key envelopes уничтожаются.

И только после этого начинается попытка физической очистки зашифрованных данных.

Главное здесь именно криптографическое стирание: даже если ciphertext физически остался на SSD, без ключей открыть его уже невозможно.

Удаление файла или запись поверх существующего требуют отдельного одноразового capability token.

Он создаётся только после нативного подтверждения пользователя и привязывается к конкретному действию и конкретному файлу.

Обычный renderer не может сам взять и удалить содержимое Safe.

Также внутри Safe полностью запрещены сеть, загрузки, переходы по ссылкам, popups, запуск внешних приложений, clipboard и произвольные permissions.

При блокировке Windows, suspend, скрытии окна или автоматическом lock процесс уничтожается, а ключи, object URLs, открытые метаданные и состояние редактора очищаются.

При этом я не хочу рассказывать сказки про абсолютную безопасность.

Safe не может гарантировать, что данные физически исчезли из ячеек SSD, резервных копий, snapshots или pagefile.

Он также не сможет защитить данные от malware, которое уже работает с правами текущего пользователя в тот момент, когда Safe разблокирован.

Но в рамках реальной desktop-системы я постарался максимально отделить его от всего остального Monarch.

Monarch Safe — это не папка с паролем.

Это отдельная изолированная зона, к которой по умолчанию не имеет доступа даже сам Oscar.
2🔥1
MONARCH SHARING

Короче, я сделал в Monarch собственную альтернативу Ollama для уже установленных локальных моделей.
Теперь любую GGUF-модель, которая подключена к Monarch, можно использовать в других программах через обычный OpenAI-compatible API.
То есть можно взять Python, Node.js, PowerShell, OpenAI SDK или практически любой сервис, который умеет работать с OpenAI API, и подключить его напрямую к локальным моделям Monarch.
Базовый адрес:
http://127.0.0.1:7861/v1
По умолчанию API доступен только на самом компьютере через loopback.
Доступ из локальной сети я специально пока не добавлял, потому что для MVP в этом нет нормальной необходимости, а потенциальных проблем с безопасностью становится сильно больше.
Сейчас поддерживаются:
GET /v1/models
GET /v1/models/{model}
POST /v1/chat/completions
И обычный OpenAI-style streaming через SSE.
Для авторизации используется Bearer token.
Он не возвращается через status или capabilities, не попадает в DOM и может быть скопирован только через отдельное действие в desktop-приложении.
Наружу доступны несколько профилей:
monarch-auto
monarch-fast
monarch-balanced
monarch-deep
monarch-extra
Но Sharing показывает только те уровни, для которых на компьютере реально есть установленная и доступная модель.
То есть он не будет показывать monarch-extra, если соответствующей модели физически нет.
Самое важное — Sharing не запускает второй runtime.
Он использует тот же LocalModelRuntime, который уже работает для Oscar.
То есть сохраняются общий inference lock, контроль оперативной памяти, отмена генерации и нормальная загрузка и выгрузка моделей.
Второй llama.cpp процесс не создаётся, и вторая копия GGUF не занимает ещё раз RAM и VRAM.
Но при этом внешнее приложение не получает доступ к самому Oscar.
В запрос не подмешиваются память, история Monarch, веб-поиск, инструменты Workspace, agent skills или системный prompt Oscar.
Клиент отправляет свои messages и получает чистый inference от локальной модели.
Без приватного контекста и без скрытой агентской логики.
Поддерживаются основные поля chat completions: messages, temperature, top_p, ограничение токенов, streaming и reasoning_effort для автоматического маршрута.
Пока не поддерживаются tools, function calling, embeddings, vision, JSON schema mode, /v1/responses и Ollama-native endpoints.
В самом Monarch уже есть отдельная Sharing-панель.
Там отображается реальный статус runtime, можно запустить managed backend, скопировать Base URL и token, выбрать модель и сразу получить готовый пример подключения для Python, Node.js или PowerShell.
По сути, Monarch Sharing превращает локальные модели Monarch в общий сервис для других программ.
Без облака, без второго экземпляра модели и без передачи сторонним приложениям памяти или возможностей Oscar.
🔥31
Начал реализовывать новый режим

Monarch Coder

Режим полностью заточенный под код,2 локальные модели так же заточенные полностью под код
Вечером надеюсь увидеть первые результаты
1
Первая тестовая задача
1
Мне всегда нравилось смотреть, как Codex или Claude Code используют Computer Use. Лично меня это впечатляет, а что если локально?
5💯1
Я почти месяц работаю над одной новой версией 0.2.5, которая сама по себе очень немаленькая: новая память, опять переделанная система, благодаря которой ИИ может взаимодействовать с твоим компьютером... И прямо сейчас я снова её переделываю, да.
Я уже успел улучшить память, сделал третью версию реального Computer Use, ну как в реальном Codex или Claude Code. Конечно, да, он действительно СИЛЬНО пока что уступает в общих возможностях, стабильности и ОСОБЕННО в скорости. И знаешь, пока я создавал Computer Use, я очень много думал о надёжности и стабильности, и, к сожалению, я пока не могу реализовать достойную систему, которая будет меня устраивать по всем параметрам, но при этом на маленькой LLM-модели. Поэтому я принял решение, в целом ограничить агентский функционал для моделей Fast и Medium, ну которые теперь просто Basic...
А вот полный функционал оставил под новую модель Qwen 3.8, всё так же полностью локально, и интеллект практически такой же, как у топовой, хоть уже и старенькой модели Claude Opus 4.6. Да, ей нужно почти 20 ГБ твоей видеопамяти или 20 ГБ твоей оперативной памяти, но ты получаешь на своём компьютере, полностью локально и приватно, модель с интеллектом, для которого раньше требовалась серверная стойка. Это впечатляет лично меня.
Вообще, обновление 0.2.5 объективно очень большое: я переработал UI, кое-как даже сделал генерацию изображений. Да, это не локально (пока что), но, конечно же, абсолютно бесплатно и проверено лично мной, но всё же решение просто экспериментальное.
Я сделал очень много, делал бы и дальше, но слишком затягиваю уже. Для морального спокойствия надо выпустить первую версию, которую уже действительно можно установить. Наконец-то я это исправил.
Может, как-нибудь и с Coder снова займусь.
🔥21
Я уже и забыл,как давно тут есть змейка?
3👀1
Наконец,впервые,хоть и такая базовая задача,но он дал верный ответ
Я смог это реализовать
🔥2