Local Ai
443 subscribers
895 photos
250 videos
4 files
811 links
Все про Локальные ИИ на ПК и Смартфонах - программы и модели, которые можно запустить на 96Gb VRAM. (Как сайт: https://t.me/s/ai2local )
ИИ для Здоровья: @Ai2Health
Download Telegram
Модель: ICE-012 Audio от DarkPs — многоязычная модель для синтеза речи. Поддерживает 590 языков и диалектов, включая русский.

🎙 Открытая TTS-модель с клонированием голоса по 2 секундам!
Умеет клонировать голос по двухсекундному образцу. Можно настроить пол, возраст, высоту, акцент, стиль речи (включая шепот) и скорость. Генерация работает в режиме стриминга — не нужно ждать полного файла.

В архитектуре используется активный акустический адаптер: обрабатывает кодек-эмбеддинги до и после основного блока. Может пригодиться для озвучки на редких языках, где коммерческие TTS пока не добрались.

🔗 https://huggingface.co/darkps/ice-012-audio
#ICE012Audio #DarkPs #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ DSv4-streaming - Запуск DeepSeek-V4-Flash (284B MoE) на компьютере Mac объемом 64 ГБ экспертами по потоковой передаче данных из SSD

Экспертная потоковая передача данных на SSD для DeepSeek-V4-Flash (284B разреженных матричных элементов) на MacBook M5 Pro с 64 ГБ памяти.
DeepSeek-V4-Flash занимает 165 ГБ на диске, поэтому не помещается в 64 ГБ памяти. Но она все равно работает, потому что модель использует лишь небольшую часть своих весов для каждого токена. Неиспользуемые части остаются на SSD и загружаются только при необходимости.
dsv4-streaming запускает модель с 284B параметрами, наименьший опубликованный квант которой составляет 83 ГБ, на ноутбуке с 64 ГБ памяти, сохраняя неэкспертные веса на диске и передавая экспертные веса с SSD по запросу. Он содержит два движка: быстрый движок, построенный на среде выполнения ds4 от antirez (декодирование ~ 11 ток / с за 2 квартала) и полнокачественный движок, созданный с нуля стек MLX / Python, который запускает смешанную 4/8-битную контрольную точку с недоумением, сопоставляющим опубликованное число с -0.02%. Веб-приложение локального чата поддерживает оба движка с сеансами, потоковой передачей и API, совместимым с OpenAI. 

Качество не падает. Проверили качество вывода с помощью стандартного теста (перплексия, чем ниже, тем лучше). Настройка показала результат 6,1250. Официальный показатель для этого файла модели — 6,1262. Такое же качество.

Скорость: около 11 токенов в секунду при использовании 2-битного файла модели меньшего размера или 1–2 токена в секунду при более высоком качестве. Для сравнения: 11 токенов в секунду — это быстрее, чем читает большинство людей.

Кэш меньшего размера работал быстрее, чем кэш большего размера. Автор выделил программе 8 ГБ памяти для кэша и получил 2,04 токена в секунду. При 32 ГБ показатель упал до 1,23. Причина: macOS уже кэширует файлы самостоятельно и делает это лучше. Выделение программе большего объема памяти привело к тому, что macOS стала использовать меньше памяти. То же самое произошло в отдельном движке (ds4 от antirez), так что это не ошибка этого кода.

Популярные приемы для повышения скорости здесь не помогли. Спекулятивное декодирование и предварительная выборка данных в этой конфигурации только замедляли работу. Узким местом является диск, а эти приемы увеличивают объем считываемых данных, а не уменьшают его.

🔗 https://github.com/kk-r/dsv4-streaming
(Обсуждение)
#dsv4streaming #DeepSeekV4Flash #DSV4 #MacOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
1
🤖 Vyact — это персональное рабочее пространство с открытым исходным кодом для llama.cpp, RAG, ИИ-агентов, анализа документов и Google Workspace.

Ваше личное рабочее пространство для общения, обмена знаниями и выполнения работы.
Превратите свои файлы, заметки, электронную почту и повседневные инструменты в полезный контекст для ИИ, не прерывая рабочий процесс.

Модели могут меняться. Ваш контекст должен оставаться неизменным.
Большинство диалогов с ИИ начинаются с одного и того же утомительного ритуала: найти файл, скопировать электронное письмо, еще раз объяснить предысторию и надеяться, что ответ не будет оторван от контекста. Vyact объединяет полезные элементы вашей работы, чтобы вы могли задавать более качественные вопросы с меньшими трудозатратами.
✔️ Он объединяет чат с ИИ, аналитику документов, заметки и инструменты, которые вы уже используете, в одном рабочем пространстве. Прикрепите документ, изучите источник ответа, превратите заметку в базу знаний с возможностью поиска или перенесите тот же контекст в Gmail, Диск, Календарь и Chrome.
Vyact, созданный на основе локальных языковых моделей с помощью llama.cpp и MLX, помогает хранить диалоги, документы и рабочий контекст в вашей собственной среде. Используйте локальную модель как практичное рабочее пространство — а не просто еще одну вкладку чат-бота — и подключайте облачные сервисы или собственную конечную точку языковой модели, совместимой с OpenAI, когда это необходимо.
Для macOS доступен файл DMG, для Windows — установщик EXE, а для Linux — пакеты AppImage и DEB. Компьютеры Mac на базе процессоров Intel в настоящее время не поддерживаются.

Используйте расширение для Chrome
🔗 https://github.com/vyact/vyact
⬇️ Скачать: https://github.com/vyact/vyact/releases
(Подробнее и Обсуждение)
#Vyact #AiAgent #AgentAi #MacOS #Windows #Linux #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Pocket TTS:
🎙 Русская версия Pocket TTS: клонирование голоса на процессоре

Лёгкий синтезатор речи, который работает без видеокарты. Клонирует голос по записи 10–20 секунд чистой речи.

Модель компактная — 6-слойный ученик, дистиллированный из 24-слойной версии. Быстрее и легче на инференсе.

На вход: текст + референс-аудио голоса. На выходе: WAV-файл речи.

Лицензия CC-BY-NC-4.0 — бесплатно для некоммерческого использования.

Текст нужно готовить: ударения обозначаются знаком «+» перед ударной гласной, числа раскрываются вручную. Длинные фразы лучше резать по предложениям. Качество зависит от промпта: шумная запись голоса даст шумную речь.

🔈Демо: https://kyutai.org/blog/2026-01-13-pocket-tts/
🔗https://huggingface.co/kyutai/pocket-tts
🔗 https://huggingface.co/amekhrishvili/pocket-tts-ru
🔗https://github.com/kyutai-labs/pocket-tts
🔗 https://vk.ru/greenneuralrobots
#PocketTTS #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
📊 Обновление AA!
- Вот как выглядит рейтинг Frontier. (1 фото)
Вместе с всеобщим любимцем, qwen3.8-27B!
(Обсуждение)
- Вот как оценивают маленькие модели. (2 фото)
Ling 3.0 Tiny, похоже, по-прежнему лидирует, несмотря на то, что у него всего 1,3 миллиарда активных пользователей.
(Обсуждение)
#FrontierRanks #ModelsScore #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤖 Eidon — это мощный ИИ-помощник для повседневной работы, упакованный в один простой образ Docker для самостоятельного развертывания.

Собственный чат с искусственным интеллектом, агентами и автоматизацией.
Один образ Docker. Ваши собственные ключи модели. Ваши данные остаются на вашем сервере.
Создайте собственную ИИ-платформу для решения любых задач за считаные минуты.
Платформа состоит из трех частей
Чат для обычного общения, Агенты для ботов, которые работают автономно (как Grok Bot), и Автоматизация для задач, выполняемых по расписанию.

🔗 https://github.com/Quack6765/Eidon-AI
(Обсуждение)
#Eidon #EidonAI #Docker #AiAgent #AgentAi #MCP #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💬 Otaku — интерфейс LLM для roleplay
Otaku — это LLM-интерфейс для ролевых игр (похожий на SillyTavern, Janitor AI и т. д.).

Он бесплатный, работает на вашем компьютере и позволяет играть как в веб-интерфейсе, так и в терминале. LLM могут быть локальными (через llama.cpp, KoboldCpp, Ollama и другие) или подключаться через API (OpenRouter, NanoGPT). Для Otaku не нужна инфраструктура — ни Docker, ни сервер баз данных. Он устанавливается одной командой и требует минимальной настройки.
Платформа: #macOS / #Linux / #Windows
🔗 https://otaku.sh
🔗 https://github.com/enclavum/otaku
Демоверсии доступны на веб-сайте:
Демо веб-интерфейса: https://otaku.sh/demo-web/
Демо терминала: https://otaku.sh/demo-terminal/
(Обсуждение)
#Otaku #roleplay #RP #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Microsoft VibeVoice-ASR-Streaming
🎙 Microsoft Research выпустила VibeVoice-ASR-Streaming

Потоковое распознавание речи, которое сразу определяет спикеров — без отдельного этапа диаризации. Модель обрабатывает звук кусками с небольшим заглядыванием вперёд и выдаёт реплики с метками говорящих по ходу разговора.

Можно передать список имён и терминов, чтобы модель их не коверкала. Поддерживает десять языков, включая русский.

По доле ошибок распознавания (WER для слов, CER для китайских иероглифов) версия 7B в среднем обходит Gemini 3.5 Transcribe Live, ElevenLabs Scribe v2 Realtime и потоковые модели OpenAI на пяти наборах записей встреч. Хотя на двух датасетах Gemini впереди. По атрибуции спикеров — лучший или равный лучшему результат в 12 из 13 настроек.

Веса версий с бэкбонами 1,5B и 7B под лицензией MIT, код открыт, есть демо.

🔗 https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B
🔗 https://github.com/microsoft/VibeVoice
🔗 https://arxiv.org/abs/2609.02812
🔗 https://aka.ms/vibeasr
(Обсуждение)
#Microsoft #VibeVoiceASRStreaming #VibeVoice #ASR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 TensorSharp - Qwen3.5 9B работает как полностью локальный агент ИИ на телефоне, включая выполнение кода и генерацию PDF—файлов!

На видео: Запуск полностью локального агента 9B AI на телефоне — LLM, инструменты, выполнение кода и генерация файлов.
TensorSharp - Собственный механизм логического вывода .NET для моделей GGUF. TensorSharp предоставляет консольное приложение, веб-интерфейс чат-бота и HTTP API, совместимые с Ollama/OpenAI, для программного доступа. Он поддерживает Windows/MacOS/iOS/Linux с использованием всех возможностей графического процессора.

Собственный движок вывода .NET LLM для моделей GGUF — авторегрессионные LLM и распространение текста в стиле DiffusionGemma, плюс редактирование изображений Qwen-Image-Edit и видео MiniMax-H3 с собственным стереозвуком 32 кГц (и Wan 2.1 / 2.2 только для видео). Включает консольное приложение, интерфейс чата в браузере и HTTP API, совместимые с Ollama/OpenAI. Движок на чистом .NET, который выигрывает по сравнению с C++ llama.cpp на идентичных файлах GGUF и с тем же графическим процессором. Дополнительный TensorSharp.AgentHost уровень добавляет навыки агента и ограниченный внутрипроцессный цикл преобразования модели в инструмент для работы с файлами и оболочкой в изолированной среде.

🔗 https://tensorsharp.ai
🔗 https://github.com/zhongkaifu/TensorSharp
(Обсуждение)
#TensorSharp #MacOS #Windows #Linux #GGUF #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель: Ling-3.0-flash-Fin, финансовая модель для реальных рабочих процессов

💸 Ling-3.0-flash-Fin - первая модель с улучшенными финансовыми возможностями в семействе Ant Ling. Разработанный Ant Group совместно с ведущими финансовыми институтами и экспертами в предметной области, он расширяет возможности Ling-3.0-flash за счет непрерывного обучения работе с высококачественными финансовыми данными.
Имея 124B общих параметров, 5.1B активированных параметров и контекстное окно объемом 256K, модель сочетает в себе финансовую экспертизу с эффективным выводом для долгосрочных рабочих процессов агентов.

🔗 https://huggingface.co/inclusionAI/Ling-3.0-flash-Fin
Анонс: https://x.com/AntLingAGI/status/2093022087069958492
 OpenRouter
(Обсуждение)
#Ling30flashFin #Ling30 #Финансы #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔭 LibreJyotish - MCP-сервер для расчетов по ведической астрологии!

Бесплатный MCP-сервер с открытым исходным кодом для ведической астрологии, который выступает в роли детерминированного астрономического калькулятора для больших языковых моделей — натальных карт, даш, панчангов и многого другого, рассчитанных с помощью Swiss Ephemeris.
Положение светил, дома, даши и панчанги, рассчитанные по швейцарским эфемеридам.
Ведическая астрология в значительной степени опирается на реальные астрономические расчеты — положение планет, разделение домов, временные рамки даши (планетарного периода), панчанг, — чтобы получить хоть какой-то результат. Большие языковые модели отлично справляются с объяснением и обобщением этих данных на понятном языке, но просить их на самом деле вычислить их на основе обучающих данных — плохая идея. Они сделают это уверенно, но ошибутся.
Большинство существующих инструментов/API для этого либо имеют закрытый исходный код, либо оплачиваются за каждый вызов, поэтому я создал свой собственный — честно говоря, в основном из любопытства. В процессе я многое узнал о ведической астрологии и архитектуре серверов MCP, и мне было очень интересно этим заниматься.

Что он делает: натальные карты, карты диспозиций (D1–D60), вимшоттари-даша, панчанг, шадбала, аштакаварга, транзиты, затмения, совместимость. Все расчеты производятся с помощью швейцарских эфемерид, в автономном режиме после установки — никаких затрат на API, никаких сетевых запросов во время выполнения запроса.

🔗 https://github.com/anhadlamba30/librejyotish
PyPI: https://pypi.org/project/librejyotish/
(Обсуждение)
#LibreJyotish #MCP #Астрология #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
📊 Интересное сравнение моделей: Сравнительный анализ оценки калорийности с помощью больших языковых моделей

Нужен был быстрый счетчик калорий для себя, который с помощью больших языковых моделей оценивал бы калорийность блюд по фотографиям и описаниям.
Мне нужно было выбрать модель, поэтому я провел быстрый сравнительный анализ.

Условия были следующими:
- Фотографии Nutrition5k для фото + калорийность: https://github.com/google-research-datasets/Nutrition5k
- Инструмент с доступом к информации о калорийности из USDA FoodData Central + MEXT
- Я оценивал модели по тому, в скольких случаях погрешность не превышала 20%
- Все модели тестировались на одних и тех же 25 случайно выбранных блюдах.
Модели, которые были слишком большими для моего компьютера, были запущены через OpenCode Go/OpenRouter. Я также подключил Spark 1.3, так как предполагается, что его веса будут открытыми.
Самое интересное — это то, как Muse Glimmer 30b обходит Qwen 3.8 27b. Думаю, это показывает, что «лучшая» модель для потребительского оборудования (~32 ГБ видеопамяти) на самом деле зависит от задачи.

🔗 https://www.reddit.com/r/LocalLLaMA/comments/1w9jmo8/benchmarking_calories_evaluation_with_llms/

Ранее было: 🍽 Flog - AI Food tracker https://t.me/Ai2Local/120
#AiFood #AiTracker #calories #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM