Local Ai
📱 Inferencer - Private AI Studio Inferencer позволяет запускать, размещать и глубоко контролировать последние модели SOTA AI (OSS, DeepSeek, Qwen, Kimi, GLM, MiniMax и другие) с вашего собственного компьютера или телефона. Никакие данные не отправляются…
В этом обновлении:
+ Anthropic API and Claude Code support, including cache optimisations + Thinking limit improvements and enforcer option (disabled by default)
+ Thinking limits for Server API
+ OpenCode support for Server API date override + Missed tool call detection (enabled by default)
+ HTML/JS validator tool + File tool improvements
+ Cache re-use improvements
+ Vision cache support and tool call improvements for DeepSeek V4.1
+ Bug fixes and performance improvements
Also, in case you missed the last updates:
+ Support for DeepSeek V4.1, GLM-5.3, GLM-5.3-Flash, Qwen3.8-Flash + File Attachments including support for Code, PDF, Word, and ePub + Multiprocessing engine for inferencing multiple models at the same time + Multi-computer clustering for inferencing larger models + MTP and DSpark Speculative Decoding for DeepSeek V4, Gemma4, and Qwen3.6 (up to 2x faster)
+ Persistent prompt caching (enable in Settings - up to ~99x faster for cache hits)
+ MCP Server support including arc-1 SAP, Playwright, MindsDB, Microsoft Learn, and DeepWiki
#Inferencer #MacOS #iPhone #iPad #App #SoftAI #AiSoft #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
✨ Inco Splash — механизм логического вывода с открытым исходным кодом, созданный на основе модели и процессора Apple.
Скорость декодирования в 3 раза выше, чем у Ollama, в 2 раза выше, чем у oMLX, и почти в 4 раза выше, когда агент разветвляется на субагентов.
Qwen3.8-27B со скоростью 144 ток/ с на MacBook Pro M5 Max!
Требования: M3 или новее, macOS 26.4+, 36 ГБ
Начните работу с помощью одной команды:
Вот и вся настройка. Укажите на него своего агента, он работает с Claude Code, OpenCode, Codex или Hermes
❓ Предпочитаете приложение?
Также доступно в LM Studio
Получите последнюю версию LM Studio Bionic: https://lmstudio.ai
Настройки> Среда выполнения, загрузите Splash, затем загрузите модель. Тот же движок внутри приложения для работы локального агента на вашем Mac.
🔗 https://github.com/incoai/splash
📖 Статья: https://inco.ai/blog/splash/
(Обсуждение)
#IncoSplash #Splash #LMStudioBionic #LMStudio #MacOS #LocalAi #AiLocal
Скорость декодирования в 3 раза выше, чем у Ollama, в 2 раза выше, чем у oMLX, и почти в 4 раза выше, когда агент разветвляется на субагентов.
Qwen3.8-27B со скоростью 144 ток/ с на MacBook Pro M5 Max!
Требования: M3 или новее, macOS 26.4+, 36 ГБ
Начните работу с помощью одной команды:
brew install incoai/tap/splashsplash serve --model incoai/Qwen3.8-27B-SplashВот и вся настройка. Укажите на него своего агента, он работает с Claude Code, OpenCode, Codex или Hermes
❓ Предпочитаете приложение?
Также доступно в LM Studio
Получите последнюю версию LM Studio Bionic: https://lmstudio.ai
Настройки> Среда выполнения, загрузите Splash, затем загрузите модель. Тот же движок внутри приложения для работы локального агента на вашем Mac.
(Обсуждение)
#IncoSplash #Splash #LMStudioBionic #LMStudio #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Это работает, потому что маршрутизируемые эксперты хранятся на SSD и считываются только тогда, когда к ним обращается токен.
модель: https://huggingface.co/nitinpanj/qwen38-flash-next-v3
форк: https://github.com/npanj/llama.cpp
Это не будет работать на стандартной версии llama.cpp. В основной ветке есть архитектура, но нет флага экспертной потоковой обработки, поэтому программа просто пытается загрузить все 95,5 ГиБ и падает.
Скорость на M5 Pro (64 ГБ):
- обработка подсказок ~367 токенов в секунду
- генерация, черновик включен ~27,6 токенов в секунду
- генерация, черновик выключен 18–18,6 токенов в секунду
- при 29 тысячах контекстов, использование реального чата ~20,6 токенов в секунду!
Подробнее и Обсуждение: https://www.reddit.com/r/LocalLLaMA/comments/1wk14il/qwen38flashnext_955_gib_on_a_64gb_mac_at_27_toks/
#Qwen38FlashNext #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Агент для написания кода в терминале с помощью MiniMax, ваших собственных моделей и инструментов, не связанных с кодом.
Что входит в пакет:
- Терминальный пользовательский интерфейс
- Безголовый интерфейс командной строки
- Поддержка протокола агент-клиент
- BYOK и пользовательские провайдеры
- API, совместимые с OpenAI и Anthropic
- Режим планирования и возобновляемые сеансы
- Субагенты, MCP, плагины и навыки
- Редактирование кода, выполнение команд и проверка тестов
Лицензия по умолчанию для исходного кода — MIT. Исходный код включает в себя терминальный пользовательский интерфейс, CLI без графического интерфейса и ACP, но не включает настольное приложение.
(Обсуждение)
#MiniMaxCode #MiniMax #Windows #MacOS
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель превращает страницу 📄 в структурированный текст с LaTeX-формулами и HTML-таблицами. Основа — дообученный Qwen3-VL, доступны версии 2B и 4B параметров.
На вход подаёшь PNG, JPEG или WebP, на выходе получаешь чистый Markdown. По бенчмаркам WeVisDoc лидирует среди сквозных парсеров документов. Запускается через vLLM с OpenAI-совместимым API или локально через Transformers.
Демо: https://huggingface.co/spaces/hugging-apps/wevisdoc-4b-demo
#WeVisDoc #Qwen3VL #OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
AliceAI-T5 — базовая языковая модель с архитектурой encoder-decoder и разреженными MoE-слоями: 34,35 млрд уникальных параметров, 512 экспертов в каждом MoE-слое, из которых для каждого токена выбираются 8.
Подробно про эту модель можно прочитать в статье на Хабре.
#AliceAIT535BA06BBase #AliceAIT5 #AliceAISearch #AliceAI #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Общайтесь на любые темы, анализируйте самые конфиденциальные документы. Ничего не покидает ваше устройство, и он работает полностью в автономном режиме. Все необходимое находится на USB-накопителе: подключите его и приступайте.
HilbertRaum - приложение с открытым исходным кодом, которое хранит ваши модели, среду выполнения, документы и чаты на USB-накопителе или твердотельном накопителе. Идея в том, чтобы подключить накопитель к любому компьютеру, разблокировать рабочее пространство и продолжить с того места, на котором вы остановились.
Вот несколько функций, которые он уже поддерживает:
- Чат и документирование вопросов и ответов с цитатами, позволяющими проверить источник.
- Шифрует неактивное рабочее пространство с помощью AES-256-GCM и Argon2id.
- Работает в автономном режиме, без резервного подключения к облаку, веб-поиска или телеметрии.
- Проверяет оборудование и предлагает подходящую модель.
- Включает рабочие процессы для работы с документами, такими как банковские выписки, счета-фактуры, краткие описания договоров и анонимизация.
(Обсуждение)
#HilbertRaum #AiPortable #Portable #USBAI #AIUSB #Windows #macOS #Linux #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM