Local Ai
448 subscribers
936 photos
262 videos
4 files
828 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
🔈 Traart - Транскрибация моделью GigaAM v3
Traart — бесплатное офлайн-приложение для macOS, специально предназначенное для транскрибации аудио/видео и использующее модель GigaAM v3 (RNNT от Sber).
Основные характеристики Traart:
- Модель: GigaAM v3 (WER ≈ 8.3 % на русском — заметно лучше Whisper-large-v3 на русскоязычных данных).
- Полностью локальная работа: аудио не уходит в облако; интернет нужен только при первом запуске для скачивания моделей (~2 ГБ).
- Диаризация спикеров (через pyannote).
- Поддержка аудио и видео (MP3, WAV, M4A, FLAC, MP4, MKV и др.).
- Вывод в TXT / Markdown / JSON с таймкодами и метками спикеров.
- Автоматический мониторинг папки (новые файлы транскрибируются сами).

Требования: macOS 13 (Ventura)+, Apple Silicon (M1/M2/M3/M4), от 8 ГБ RAM.

⬇️ Скачать: https://traart.ru
Сравнение: https://traart.ru/comparison
#Traart #GigaAM #GigaAMv3 #MacOS #Whisper #Транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🤮1
🎙 Говорун — офлайн голосовой ввод на русском для macOS (GigaAM-v3 + Silero VAD)

Зажал клавишу → сказал → отпустил → чистый текст в активном поле.
Возможности:
- Полностью офлайн — данные не покидают ваш Mac
- GigaAM-v3 (ONNX) — распознавание речи с пунктуацией
- Silero VAD — нарезка длинных записей на сегменты
- Говорун Super — локальная нейросеть (GigaChat 3.1) для глубокой обработки текста
- Скачивание ИИ-модели прямо из приложения (5.8 ГБ, с паузой и докачкой)
- Умный контекст — стиль текста подстраивается под приложение
- Настраиваемая клавиша активации — ⌥, любая клавиша, или комбинация (⌘K, ⇧F5, ...)
- Два режима: Push to Talk (удерживай) и Toggle (нажми — нажми)
- Сниппеты — "мой имейл" → подставляет email
- Словарь замен — "жира" → "Jira"
- Списки в диктовке — "первое молоко второе хлеб" → нумерованный список
- Нормализация чисел — "двадцать пять процентов" → "25%"
- Вставка через Accessibility API с clipboard fallback
- Автообновление через Sparkle
- Apple Silicon (M1+), macOS 14 Sonoma+

🔗 https://github.com/sanyasamineva0x/govorun-app
⬇️ Скачать: https://github.com/sanyasamineva0x/govorun-app/releases
#Говорун #GigaAM #GigaAMv3 #MacOS #Whisper #Транскрибация #Диктовка #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🥴1
🔈 GigaAM v3 Transcriber на базе GigaAM-v3.

Транскрибация русской речи из аудио и видео на базе GigaAM-v3. Один сервисный уровень, пять интерфейсов: графический интерфейс для настольных компьютеров, интерфейс командной строки, REST API, веб-интерфейс и терминальный пользовательский интерфейс.
GigaAM Transcriber — это полноценный рабочий процесс для расшифровки, экспорта, диаризации и постобработки с помощью больших языковых моделей, а не просто оболочка для модели.

Возможности:
- Пакетная обработка файлов и папок, рекурсивный поиск, перетаскивание, загрузка через yt-dlp.
- Экспорт: txt, txt_timecodes, txt_diarize, txt_diarize_timecodes, md, srt, vtt.
- SRT/VTT делятся на короткие фразы по пунктуации и временным меткам слов; количество строк и максимальная длина строки настраиваются отдельно, не затрагивая TXT/MD.
- При диаризации SRT называет говорящего только при смене говорящего (Спикер №1:), а VTT сохраняет стандартный диапазон голоса <v Спикер №1> на каждом сигнале.
- Выбираемая диаризация: pyannote, ONNX PyAnnote + WeSpeaker или NVIDIA Streaming Sortformer v2.1.
- Автоматическая диагностика качества, консервативная очистка и safe fallback без сдвига таймкодов.
- Ускорение MLX RNN-T на Apple Silicon; CPU, CUDA, Intel XPU и MPS.
- LLM-постобработка: выжимки, задачи и свои промпты.
- Провайдеры LLM: OpenAI-compatible API, Claude Code, Codex, OpenCode, Pi и произвольный CLI.
- RU/EN, светлая/тёмная тема, журнал, stage-aware progress и отмена очереди.
- Веб-интерфейс с авторизацией, отслеживанием прогресса, восстановлением задач и усилением защиты Docker.

🔗 https://github.com/dubr1k/GigaAMGUI
⬇ Скачать: https://github.com/dubr1k/GigaAMGUI/releases - Под все ОС: Windows, MacOS, Linux и есть оффлайн версия уже с моделями!
#GigaAMTranscriber #GigaAM #Transcriber #GigaAMv3 #MacOS #Whisper #Транскрибация #Windows #Linux #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🖕1
✨ TurboFieldfare - Запуск Gemma 4 26B-A4B в ~ 2 ГБ оперативной памяти на любом MacBook серии M!

Вычисления Gemma 4 26B-A4B занимают около 2 ГБ оперативной памяти! (Память стала дорогой.)
TurboFieldfare использует оптимизированную под инструкции Gemma 4 26B-A4B модель, не загружая в память всю модель размером 14,3 ГБ. Она сохраняет в памяти общее ядро размером 1,35 ГБ и кэш FP16 KV, а затем считывает с SSD только экспертов, необходимых для каждого токена. Именно это позволяет использовать модель на компьютерах Mac с 8 ГБ оперативной памяти.
🔗 https://github.com/drumih/turbo-fieldfare
(Обсуждение)
============
Портировали TurboFieldfare на Qwen 3.6 35B, и он работает с 1,4 ГБ оперативной памяти!
#TurboFieldfare #Gemma4 #Qwen36 #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
ℹ Модель: Macaron-V1 Venti и Tall

💻 Две версии под лицензией MIT:

- Venti — 748 млрд параметров: 744 млрд замороженной GLM-5.2 и четыре адаптера по 1 млрд. Контекст миллион токенов, первое дообучение поверх GLM-5.2.

- Tall — 50 млрд параметров на базе Qwen3.6-35B-A3B с четырьмя адаптерами по 3,7 млрд. Контекст 262 тысячи токенов, заточена под локальный запуск. Сегодня её развернули на Novita.
Бенчмарки авторские:
TerminalBench 2.1 — 87,6, UI4ABench — 87,8, SWE Verified — 85,6 против 88,6 у Opus 4.8. По кодингу лаборатория сама пишет, что идёт вровень с топом, а не обгоняет. Заодно открыли LongStraw — систему обучения на длинном контексте до 2,1 млн токенов через GRPO на восьми H20.

Небольшая лаборатория Mind Lab на 30 человек известна приложением Macaron — персональным агентом для бытовых задач. Теперь выкатили собственную модель с открытыми весами.

Архитектура называется Mixture-of-LoRA: база заморожена, поверх неё четыре специализированных адаптера — для чата, агента, кодинга и генеративного интерфейса. Роутер отправляет запрос нужному специалисту, тот работает внутри своей LoRA, остальным передаёт краткий итог. База не трогается, новые навыки добавляются подключением адаптера без переобучения. Это позволяет дообучать модель после релиза и собирать специалистов от разных команд.

🔗 https://macaron.im/mindlab/research/introducing-macaron-v1
🔗 https://huggingface.co/mindlab-research/Macaron-V1-Tall
🔗 https://novita.ai/models/llm/mindai-macaron-v1-tall
🔗 https://github.com/MindLab-Research/longstraw
#MacaronV1 #Venti #Tall #GLM52 #Qwen36 #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🦙 Armored Llama - запускает последние сборки llama.cpp и загружает подходящие для вашего устройства файлы gguf с Hugging Face.
Запустите llama.cpp в качестве реального сервера на своем Android-смартфоне — загрузите модели с Hugging Face, общайтесь с ними локально и наблюдайте за работой аппаратного обеспечения прямо на устройстве.
Armored Llama — это не оболочка для облачного API и не повторная реализация логического вывода. Он запускает реальный llama-server бинарный файл llama.cpp из репозитория на процессоре вашего телефона, предоставляя конечную точку, совместимую с OpenAI, на 127.0.0.1, и оборачивает его в нативное приложение Jetpack Compose: аппаратную панель мониторинга в реальном времени, браузер моделей Hugging Face, чат в приложении и обновление среды выполнения в одно касание. Все данные остаются на устройстве — никаких сетевых запросов для логического вывода, никаких учетных записей.

🔗 https://github.com/guarismo/armored-llama
⬇️ Скачать: https://github.com/guarismo/armored-llama/releases/latest
(Обсуждение)
#ArmoredLlama #llamacpp #Android #App #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Статья: Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском
https://habr.com/ru/companies/mts_ai/articles/1065182/
👎1
💡 Kimi K3 — 2,78 триллиона параметров — работает на обычном ноутбуке.

Запускайте полную модель Kimi K3 с 2,78 триллионами параметров, не ограничиваясь доступной оперативной памятью, за счет потоковой передачи активированных весов непосредственно с NVMe.
На данный момент его доказанная работоспособность подтверждена на полной модели Kimi K3 с открытыми весами: 2,78 триллиона параметров, упакованных в контейнер размером 982 ГБ, который работает на MacBook Pro с 64 ГБ оперативной памяти со скоростью 0,49–0,54 токена в секунду. Это не упрощенный, не урезаннный и не сокращенный вариант.
🔗 https://github.com/sqliteai/waste
(Обсуждение)
#KimiK3 #waste #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
✈️ llama.cpp - ИИ, который живет на вашем компьютере. С открытым исходным кодом, приватный и всегда локальный.
llama.app - приложение для Mac и сервис llama от llama.cpp
Запускайте frontier AI полностью на своем компьютере. Никаких API-ключей, никакой телеметрии, никаких ограничений. Владейте своими моделями и диалоговыми данными.
🔗 https://llama.app
Проект: https://github.com/ggml-org/llama.cpp
(Обсуждение)
#llama #llamacpp #llamaapp #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek V4 Flash в LM Studio (Mac)
Внедрение форка DeepSeek V4 Flash llama.cpp от antirez в LM Studio (Mac, 128 ГБ объединенной памяти). Патчи для устранения дрейфа ABI/структуры данных, пакетного слияния, рецепта подписи кода.
Установите форк deepseek_v4 llama.cpp от antirez в LM Studio, чтобы запустить DeepSeek V4 Flash — 256-экспертный MoE, ~80 ГБ резидентной памяти, до 1 М контекста токенов — на Mac с 128 ГБ объединенной памяти.
Это обходной путь. Upstream llama.cpp пока не поддерживает deepseek_v4 архитектуру (дискуссия #22376). Среда выполнения MLX в LM Studio отклоняет GGUF V4 (ошибка #1872). Пока эти изменения не внедрены, это единственный рабочий способ запустить V4-Flash из пользовательского интерфейса LM Studio / сервера, совместимого с OpenAI.
Что вы получаете:
- DeepSeek V4 Flash загружена как обычная модель в LM Studio
- API, совместимый с OpenAI, на http://localhost:1234
- Полный контекст из 1 048 576 токенов
- ~190 токенов в секунду при обработке подсказок, ~26 токенов в секунду при генерации
- Работает с любым клиентом OpenAI-API (в т. ч. pi, Open WebUI, вашими собственными скриптами)
Протестировано на MacBook Pro M5 Max, 128 ГБ, macOS 26.4. Должно работать и на M2/M3/M4 Max с 128 ГБ.

🔗 https://github.com/noreff/lmstudio-dsv4-patch
(Обсуждение)
#LMStudio #DeepSeekV4Flash #llamacpp #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DeepSeek-V4-Flash 284B на 5.3GB памяти!
💥 Mference - Большие модели MoE в "малом" объеме оперативной памяти!
Механизм логического вывода Swift + Metal для любых компьютеров Apple Silicon Mac, даже с 8 ГБ оперативной памяти.
Перевод поста:
Продолжая работу над портом Qwen 3.6, я хотел продолжать добавлять модели и в итоге по пути исправил кучу вещей, так что теперь у него есть собственный движок: Mference.

Основная идея та же, что и в TurboFieldfare: модели MoE активируют несколько параметров B для каждого токена, поэтому можно оставить общее ядро и кэш KV, а выбранные эксперты будут загружаться с SSD.

Что работает сейчас:
- Gemma 4 26B-A4B — ~2 ГБ, 31–35 tok/s на M5 Pro 24 ГБ
- Qwen 3.6 35B-A3B — ~1,45 ГБ, 19–23 tok/s
- DeepSeek-V4-Flash 284B-A13B — новинка. ~6,8 ГБ пиковой памяти, на практике в основном ~5,3 ГБ, до 4,8 ток/с на том же M5 с 24 ГБ памяти. 2-битное динамическое квантование, ~91 ГБ на диске.

🙂 Кроме того, мы добавили собственное приложение для Mac с многопоточным чатом, совместимым с OpenAI сервером и локальными вложениями в формате PDF/DOCX/PPTX/XLSX.

Отсюда я хочу продолжать добавлять семейства моделей, сократить время ожидания при экспертном чтении (сейчас декодирование занимает ~53 % времени ввода-вывода и выполняется последовательно с вычислениями) и увеличить размер контекста до 4 КБ.

Это не очень полезно после нескольких ходов, но технически вы можете запустить «пригодный для использования» dsv4f на Mac с 8 ГБ памяти. Дальше будет только лучше.

🔗 https://github.com/NeelM0906/Mference
(Обсуждение)
#DeepSeekV4Flash #Mference #TurboFieldfare #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
✨ WinterMix — Qwen3.5-122B-A10B в native MLX: сборка на 82 Гб, которая превосходит 94-95 Гб квантов, плюс сборка на 68 Гб для agent swarms [Релиз]
Перевод поста:
Зачем напрягаться, если GGUF лучше?
MLX на Apple Silicon работает значительно быстрее, чем llama.cpp на том же оборудовании — на моем M5 Max я заметил, что предварительное заполнение происходит примерно в 9 раз быстрее, а генерация токенов — примерно на 20% быстрее. Для задач с длинным контекстом и большим количеством поворотов этот разрыв увеличивается.

Проблема в том, что существующие кванты MLX с разрядностью менее 6 бит не очень хороши, и это видно из приведенной ниже таблицы: oQ4 уступает исходному GGUF примерно на 3,8 % по перплексии при коротком контексте и примерно на 4,2 % при длинном контексте. На практике это проявляется в виде бессвязных логических цепочек и ошибок округления, которые накапливаются до тех пор, пока модель не начинает выдавать ложные результаты.

Таким образом, более совершенный метод квантования MLX дает реальные преимущества для агентных рабочих процессов и локального ИИ на Apple Silicon. В то же время я принял осознанное решение потребовать нативной поддержки MLX. imatrix на MLX не является нативным форматом — для него нужны пользовательские ядра. Кванты WinterMix являются нативным форматом и могут использоваться как замена.

Квантованные модели WinterMix — это нативные модели MLX с открытыми весами (Apache 2.0). Никаких пользовательских ядер, никакой форк-версии среды выполнения, никаких флагов. Они загружаются везде, где работает MLX — в LM Studio, mlx-vlm и других — со стандартной скоростью, с полностью функциональной «башней видения» и связными следами мышления.

Ссылки HuggingFace:
- WinterMix58 — 82 ГБ, ~6,0 бит/с: лучший показатель MLX для этой модели, который мне известен, при любом размере, в том числе по сравнению с 6-битными сборками oMLX размером 94–95 ГиБ (с небольшим отрывом при 2 КБ, с большим отрывом при 16 КБ).

- WinterMix48 — 68 ГБ, ~5,0 б/с: на Mac с 128 ГБ остается ~35–40 ГБ свободного места = 5–8 параллельных сессий агента с 100-килобайтными токенами одновременно (архитектура GDN поддерживает кэш сессий с 100-килобайтными токенами объемом ~5–10 ГБ). Превосходит своего прямого конкурента по размеру (oQ4, 67 ГиБ) примерно на 1,4–1,5 % при обоих размерах контекста.

Пост: https://www.reddit.com/r/LocalLLaMA/comments/1vdcs8e/release_wintermix_qwen35122ba10b_in_native_mlx_an/
#Qwen35 #Qwen35122B #WinterMix #MLX #AppleSilicon #GGUF #MacOS #LocalAi #AiLocal