Media is too big
VIEW IN TELEGRAM
Persona Engine слушает вас через микрофон, генерирует мысли с помощью большой языковой модели, ориентируясь на файл с описанием личности, озвучивает их с помощью технологии преобразования текста в речь в реальном времени (при желании с клонированием голоса) и управляет аватаром Live2D в режиме синхронизации. Вы можете наблюдать за персонажем через встроенное прозрачное наложение или транслировать его в OBS через Spout.
Входящая в комплект модель Aria уже настроена для работы с функцией синхронизации губ и мимики в движке. Вы также можете использовать свою собственную модель! Стандартные модели, совместимые с OpenAI (Groq, OpenAI, Ollama и т. д.), тоже работают!
Важно: Требуется графический процессор NVIDIA с CUDA (Windows x64). ASR, TTS и RVC работают на CUDA через среду выполнения ONNX — процессоры CPU/AMD/Intel не поддерживаются.
(Обсуждение)
#PersonaEngine #Windows #ASR #TTS #Qwen3TTS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Вот содержимое этого поста:
Лучшие модели с открытым исходным кодом для генерации звука
Преобразование текста в речь (TTS)
Qwen3-TTS → Лучший баланс (качество + скорость)
Kimi-Audio → Сильные мультимодальные + выразительные голоса
Fish Speech / Fish Audio S2 → Отлично подходит для реалистичного клонирования голоса
CosyVoice 3.0 → Очень надежный многоязычный + потоковая передача
VibeVoice Realtime → Лучше всего подходит для приложений реального времени
Клонирование голоса
VoxCPM2 → Высококачественное клонирование + поддержка многих языков
IndexTTS2 → Чистый звук + хорошая стабильность
Kokoro / KokoClone → Легкое и быстрое клонирование
Генерация музыки
ACE-Step 1.5 → Лучший музыкальный генератор с открытым исходным кодом на данный момент
Magenta Realtime → Музыкальные эксперименты в реальном времени
Uni-MoE (аудио) → Многоцелевой генератор аудио
Мультимодальный звук (Anything → Audio)
AudioX / Audio-Omni → Самый полный мультимодальный аудиостек
MMAudio → Поддерживает преобразование текста, изображений и видео в аудио
Woosh / ThinkSound → Хорошие экспериментальные модели
Улучшение звука
NVIDIA A2SB → Лучше всего подходит для восстановления и ретуширования
AudioSR / NovaSR → Качественное масштабирование и улучшение звука
Распознавание речи (ASR)
FunASR → мощная многоязычная система + потоковая передача
VibeVoice-ASR → хорошая производительность в режиме реального времени
Cohere Transcribe (ОС) → чистая и надежная система
Лучшие модели с открытым исходным кодом для создания изображений
FLUX.1 [schnell]
Самая быстрая модель с открытым исходным кодом, обеспечивающая баланс качества и скорости для потребительских графических процессоров.
FLUX.1 [dev]
Лидер по результатам тестов для высокоточных сложных сцен от Black Forest Labs.
Stable Diffusion 3.5 Large
Универсальная экосистема для тонкой настройки и редактирования.
GLM-Image
Специалист по типографике для двуязычной инфографики под лицензией Apache 2.0.
Qwen-Image-2512
Мощный инструмент для многоязычного редактирования и переноса креативных стилей.
Z-Image-Turbo
Легкий генератор 6B в режиме реального времени для периферийных вычислений и пакетной обработки.
HiDream-I1-Full
Эксперт по необработанному фотореализму для высококачественных изображений.
SANA-Sprint 1.6B
Сверхэффективный вариант с низким объемом видеопамяти для быстрых экспериментов.
HunyuanImage-3.0
Исследовательский вариант для повышения согласованности и разнообразия.
Лучшие модели с открытым исходным кодом для преобразования изображений в видео
LTX-2.3
Ведущая модель с открытым исходным кодом для преобразования изображений в видео с поддержкой 4K, 50 кадров в секунду и синхронизированным звуком https://huggingface.co/Lightricks/LTX-2.3.
LTX-2.3-GGUF
Квантованный вариант LTX-2.3 с 21 миллиардом параметров для эффективного логического вывода на потребительском оборудовании https://huggingface.co/unsloth/LTX-2.3-GGUF.
LTX-2.3-Workflows
Рабочие процессы ComfyUI, оптимизированные для конвейеров создания видео LTX-2.https://huggingface.co/RuneXX/LTX-2.3-Workflowshttps://huggingface.co/RuneXX/LTX-2.3-Workflows.
WAN2.2-14B-Rapid-AllInOne
Универсальная модель 14B для преобразования изображений в видео с архитектурой MoE для быстрого локального запуска https://huggingface.co/Phr00t/WAN2.2-14B-Rapid-AllInOne.
VBVR-LTX2.3-diffsynth
Интеграция Diffsynth для LTX-2.3, обеспечивающая расширенные возможности синтеза видео https://huggingface.co/Video-Reason/VBVR-LTX2.3-diffsynth.
BFS-Best-Face-Swap-Video
Специализированная модель LTX для замены лиц в видео для реалистичной замены персонажей https://huggingface.co/Alissonerdx/BFS-Best-Face-Swap-Video.
Wan2.2-I2V-A14B-GGUF
Квантованная модель Wan2.2 для преобразования изображений в видео с разрешением 480p/720p на графических процессорах среднего уровня https://huggingface.co/QuantStack/Wan2.2-I2V-A14B-GGUF.
Please open Telegram to view this post
VIEW IN TELEGRAM
LTX-2
Предыдущая версия LTX, получившая широкое распространение в сообществе для коммерческого создания видео https://huggingface.co/Lightricks/LTX-2.
LTX-2.3-Transition-LORA
Точная настройка LoRA для плавных переходов между сценами в видео LTX-2.3 https://huggingface.co/valiantcat/LTX-2.3-Transition-LORA.
HY-OmniWeaving
Мультимодальная технология Tencent для преобразования изображений в видео с возможностью создания многослойных композиций https://huggingface.co/tencent/HY-OmniWeaving.
Лучшие модели преобразования изображения в текст с открытым исходным кодом
GLM-OCR
Лучшая модель оптического распознавания символов с открытым исходным кодом в 2026 году по скорости и точности распознавания сложных документов https://huggingface.co/zai-org/GLM-OCR.
nemotron-ocr-v2
Высокоточная система оптического распознавания символов от NVIDIA отлично справляется с распознаванием текста на изображениях и многоязычным распознаванием https://huggingface.co/nvidia/nemotron-ocr-v2.
Falcon-OCR
Эффективная система оптического распознавания символов от TII UAE для извлечения текста в реальных условиях при различных обстоятельствах https://huggingface.co/tiiuae/Falcon-OCR.
RationalRewards-8B-T2I
Модель вознаграждения 9B, специализированная для оценки преобразования текста в изображение и создания субтитров https://huggingface.co/TIGER-Lab/RationalRewards-8B-T2I.
RationalRewards-8B-Edit
Вариант 9B, оптимизированный для обратной связи при редактировании изображений и описательных задач https://huggingface.co/TIGER-Lab/RationalRewards-8B-Edit.
HiVG-3B-Base
4-битная визуальная модель для точного совмещения и описания изображений и текста https://huggingface.co/xingxm/HiVG-3B-Base.
trocr-base-handwritten
База TrOCR от Microsoft для точной расшифровки рукописного текста https://huggingface.co/microsoft/trocr-base-handwritten.
blip-image-captioning-large
Salesforce BLIP large для подробного и качественного описания изображений https://huggingface.co/Salesforce/blip-image-captioning-large.
manga-ocr-base
Специализированное оптическое распознавание символов для извлечения текста из японской манги и комиксов https://huggingface.co/kha-white/manga-ocr-base.
blip-image-captioning-base
Эффективная базовая модель BLIP для преобразования изображений в текст общего назначения https://huggingface.co/Salesforce/blip-image-captioning-base.
Модели с открытым исходным кодом для генерации текста
GLM-5.1
Флагманский модуль 744B MoE (40B в рабочем состоянии) от Zhipu AI, ведущий специалист в области агентирования и задач долгосрочного кодирования https://huggingface.co/zai-org/GLM-5.1
Qwen3.5-397B-A17B
MoE от Alibaba 397B (17B активен) с мультимодальным анализом и контекстом более 1 МЛН токенов для универсальных агентов https://huggingface.co/Qwen/Qwen3.5-397B-A17B
Gemma 4
Гибридное семейство приложений Google attention (2B-31B), превосходящее в рассуждениях, программировании и мультимодальном использовании на устройстве https://huggingface.co/google/gemma-4-31b-it
DeepSeek-V3.2
MOE, ориентированный на рассуждения, с ограниченным вниманием для эффективных агентов с большим контекстом и математикой уровня GPT-5 https://huggingface.co/deepseek-ai/DeepSeek-V3.2
Kimi-K2.5
Мультимодальная модель Moonshot 1T MoE (32B активная) для визуального кодирования и роения агентов до 100 субагентов https://huggingface.co/moonshotai/Kimi-K2.5
Минимакс-М2.7
Самосовершенствующийся agentic LLM, превосходящий тесты SWE-Pro для реальных рабочих процессов разработки программного обеспечения https://huggingface.co/MiniMaxAI/MiniMax-M2.7
MiMo-V2-Flash
Высокопроизводительный модуль MoE 309B от Xiaomi (15B активный) с пропускной способностью 150 т / с для кодирования большого объема https://huggingface.co/XiaomiMiMo/MiMo-V2-Flash
#AiModel #ModelAi #LocalAi #AiLocal
Основана на gemma 4 31b от TheDrummer
supports thinking in two modes:
- standard thinking gemma template or
- <thinking></thinking> blocks on non-thinking gemma template
- <think></think> should work too, along with tricks like <evil_think></evil_think> etc.
- custom thinking can be described in the system prompt
Artemis-31B-v1.1
Разница между версиями 1 и 1.1 довольно проста: версия 1 была первой попыткой, запоздалым релизом, который отличался проработанной прозой и стилем, но требовал некоторой доработки, чтобы избавиться от таких особенностей, как заикание. Версия 1.1 — это более совершенный подход, в котором стабильность сочетается с качеством. (Обсуждение)
И есть еще такая Еретик версия: (на Heretic v1.2.0)
#Artemis31B #gemma431b #TheDrummer #Heretic #БезЦензуры #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🌎 Eurora - Ваш ИИ-помощник полностью интегрирован в ваш браузер!
Задавайте вопросы о любом видео, статье или твите на YouTube. Eurora сохраняет расшифровку, контент и метаданные, так что вам не придется ничего копировать и вставлять.
🔗 https://www.eurora-labs.com
🔗 https://github.com/eurora-labs/eurora
🎞 Демо: https://www.youtube.com/watch?v=fj8cmNu_c5Y
(Обсуждение)
#Eurora #LocalAi #AiLocal
Задавайте вопросы о любом видео, статье или твите на YouTube. Eurora сохраняет расшифровку, контент и метаданные, так что вам не придется ничего копировать и вставлять.
Eurora
подключается напрямую к вашему браузеру. Когда вы задаете вопрос, ИИ анализирует контекст страницы вашего браузера, чтобы мгновенно дать правильный ответ.
Добро пожаловать в Eurora — кроссплатформенного, полностью приватного помощника с ИИ и открытым исходным кодом, который учитывает контекст.
Eurora обеспечивает бесшовную интеграцию с операционной системой и значительно упрощает процесс задавания вопросов. Облачные серверы расположены в Нидерландах, а все данные хранятся в европейских суверенных центрах обработки данных, что обеспечивает полную конфиденциальность для пользователей по всему миру в соответствии с высочайшими стандартами, установленными Европейским союзом. Мы предоставляем поддержку при локальном развертывании и обширную документацию для установки на ваш домашний сервер.
(Обсуждение)
#Eurora #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🤔 Google показали, как запускать 10 копий Gemma 4 одновременно на MacBook
Google выложили в открытый доступ демо для параллельного запуска нескольких инстансов Gemma 4 на локальном железе.
Gemma 4 26B A4B справляется с 10+ одновременными запросами на MacBook Pro M4 Max. Скорость генерации — 18 токенов в секунду на каждый запрос. Можно запускать 3, 5 или даже 10 копий модели бок о бок без просадок по производительности.
🔗 https://github.com/google-gemma/cookbook/tree/main/apps/concurrent
#Gemma4 #Gemma426B #AiLocal #LocalAi
Google выложили в открытый доступ демо для параллельного запуска нескольких инстансов Gemma 4 на локальном железе.
Gemma 4 26B A4B справляется с 10+ одновременными запросами на MacBook Pro M4 Max. Скорость генерации — 18 токенов в секунду на каждый запрос. Можно запускать 3, 5 или даже 10 копий модели бок о бок без просадок по производительности.
#Gemma4 #Gemma426B #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Год наза назад был создан маленький SearXNG-Tavily-адаптер дроп-ин замена платного Tavily для LLM-пайплайнов на базе SearXNG
На днях развили его в полноценный self-hosted deep research stack + sandbox agent per task
Что получилось:
3 независимых сервиса за одним API:
- /search — Tavily-совместимый поиск через SearXNG (100+ движков)
- /extract — URL → чистый markdown через trafilatura, с пресетами размера (s/m/l/f) и пагинацией для длинных статей
- /research — deep research агент(Hermes) даёшь вопрос, получаешь markdown-отчёт с цитатами
Агент-ядро — Hermes (Nous Research, 109k ⭐️), эфемерно спавнится на каждый /research запрос, --rm после exit
Видит три наших скилла: search, extract, deep-research (последний чистая методичка без кода, описывает 5 фаз:
plan → gather → gap-check → synthesise → verify
Стек: SearXNG + FastAPI + trafilatura + Hermes + docker-socket-proxy (для безопасного спавна)
Всё в одном docker compose up
LLM-агностик gpt-oss-120b(на ней делал тесты на vLLM, OpenAI, Anthropic, Ollama, что угодно OpenAI-совместимое)
Старый adapter был тактической заплаткой на Tavily
Новый стек полноценная альтернатива Perplexity/Exa/You.com для self-hosted agentic deep research system setup, и при этом каждый из трёх сервисов полезен сам по себе
РЕПО: https://github.com/vakovalskii/searcharvester
Источник:
#searcharvester #Tavily #Perplexity #Exa #SearXNG #AiAgeny #AgentAi #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Отличная статья: Выжать больше из локальных LLM. Ollama медленнее llama.cpp в 3 раза. UD_Q4_K_XL лучше чем Q4_K_M, а вес тот же и т.д
https://habr.com/ru/articles/1025132/
https://habr.com/ru/articles/1025132/
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
OpenShorts делает из длинных видео готовые для публикации тиктоки, рилсы и шортсы.
OpenShorts генерирует:
• Клипы — вырезает ключевые фрагменты, подгоняет под формат 9:16, добавляет субтитры, названия и даже дубляж.
• UGC-видео — по описанию ролика пишет сценарий, делает озвучку и добавляет говорящую голову.
• Продакшен — генерирует кастомные обложки для YouTube, заголовки и описания, а также публикует ролик в один клик в любую соцсеть.
Самое главное — никаких подписок, рекламы, вотермарок и лимитов, а всё работает локально через Docker.💬 Бесплатный генератор клипов с открытым исходным кодом Clip Generator и создатель пользовательского контента с ИИ!
Три инструмента в одном.
- Генератор клипов: превращайте длинные видео с YouTube в вирусные ролики с помощью функции распознавания моментов с помощью искусственного интеллекта, интеллектуальной обрезки под формат 9:16 и автоматических субтитров.
- AI Shorts: создавайте маркетинговые видео с пользовательским контентом с помощью искусственного интеллекта и функции синхронизации губ для любого бизнеса.
- YouTube Studio: бесплатный генератор миниатюр с помощью ИИ, 10 вариантов вирусных заголовков с возможностью доработки в чате и автоматические описания с главами. Собственный хостинг, открытый исходный код, без ограничений.
Демо: https://www.youtube.com/watch?v=xlyjD1qCaX0
#OpenShorts #AIShorts #YouTube #ClipGenerator
Please open Telegram to view this post
VIEW IN TELEGRAM
Подробная инструкция: Open WebUI (с веб-поиском) + llama.cpp
https://habr.com/ru/articles/1027676/
https://habr.com/ru/articles/1027676/
Local Ai
⚡️ hyperlink.nexa.ai - Безопасный ИИ-агент для работы с документами и скриншотами локально! Работает прямо на вашем ПК - без отправки данных в облако и без регистрации, может работать вообще офлайн! 🪼 В обзоре - загрузили все снимки экрана с рабочего стола…
Но версию для #Windows можно найти тут: https://apps.microsoft.com/detail/xpfftx8v2dg9j9?hl=ru-RU&gl=FI
Hyperlink был простым «Perplexity для твоих документов» — полностью оффлайн, индексирует PDF, Word, изображения и т.д. и отвечает с цитатами.
Ниже — самые близкие по духу desktop-приложения, которые работают 100% локально (без облака и отправки файлов).
1. AnythingLLM Desktop — лучший прямой аналог (рекомендуют начать с него)
Полноценный RAG: загружаешь папки/файлы → чатишь с ними как с Perplexity.
Поддержка агентов, коллекций документов, локальных LLM (Ollama, LM Studio и встроенные).
Есть даже Desktop Assistant (оверлей поверх окон).
Добавили функцию создания заметок (транскрибацию) о совещаниях с помощью ИИ, чтобы заменить платные решения!
3-часовое аудио на MacBook M4 за 3 минуты.
https://t.me/Ai2Local/132
2. GPT4All — самый простой и «родной» desktop-клиент
Встроенная функция LocalDocs — именно чат по твоим локальным файлам (RAG).
Красивый интерфейс, как обычное Windows-приложение.
Тысячи моделей, быстрое скачивание, полностью приватно.
Скачать: https://gpt4all.io → Windows Installer (есть версия для ARM).
3. Private Document Chat (из Microsoft Store)
Прямо в стиле Hyperlink: «спроси у своих документов».
Полностью на устройстве, простая загрузка файлов, ответы с цитатами.
Устанавливается как обычное приложение из Store.
Ссылка: Microsoft Store → Private Document Chat
Другие достойные варианты (если первые не зайдут):
- Jan.ai — ещё один красивый desktop-клиент с RAG-поддержкой.
- LM Studio — мощный, но чуть больше ориентирован на модели + документ-чат.
- NVIDIA ChatRTX — если у тебя видеокарта RTX (очень быстрый, но только с NVIDIA).
Что выбрать?
- Хочешь максимально похоже на Hyperlink по простоте → AnythingLLM или GPT4All.
- Любишь Microsoft Store → Private Document Chat.
Все они бесплатные, работают оффлайн и не отправляют твои файлы никуда!
#NexaAI #Hyperlink #RAG #GPT4All #SoftAi #AiSoft #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Работает с передовыми моделями, но при этом стремится быть максимально надежным и с менее крупными моделями, в том числе локальными. Предназначен для работы в условиях ограниченного контекста и ресурсов. Бесплатный, с открытым исходным кодом и простой в настройке.
Swival — это агент для написания кода с интерфейсом командной строки, созданный для практичных, надежных и простых в использовании задач. Он работает с фронтенд-моделями, но его главная цель — обеспечить максимальную надежность при работе с небольшими моделями, в том числе локальными. Он с самого начала разрабатывался с учетом жестких ограничений по времени и ресурсов.
Он подключается к LM Studio, llama.cpp, HuggingFace Inference API, OpenRouter, Google Gemini, ChatGPT Plus/Pro, любому серверу, совместимому с OpenAI (ollama, mlx_lm.server, vLLM и т. д.), или любой внешней команде (codex exec, пользовательским оболочкам и т. д.), отправляет вашу задачу и запускает автономный цикл обработки до тех пор, пока не выдаст ответ. При использовании LM Studio и llama.cpp он автоматически определяет загруженную модель, поэтому настраивать ничего не нужно. Чистый Python, без фреймворков.
#Swival #AiAgent #AgentAi #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Aggressive = без отказов; никаких изменений/альтернатив личности и прочего, это ОРИГИНАЛЬНАЯ версия Qwen без цензуры! 0/465 отказов*. Полностью разблокирована без потери возможностей.
(Описание и Обсуждение)
И Вышел сбалансированный вариант: https://huggingface.co/HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Balanced
Чтобы отключить «размышления», вам нужно отредактировать шаблон jinja или использовать параметр {«enable_thinking»: false}. Внимание: в Qwen3.6 нет программных переключателей /think и /no_think, которые были в Qwen3, поэтому используйте параметр.
Для Qwen3.6-35B-A3B было: https://t.me/Ai2Local/618
#Qwen36 #Qwen3627B #Uncensored #БезЦензуры #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Shield 82M способна отфильтровывать все типы персональных данных (информацию, позволяющую установить личность) в текстах на любом языке. Ее общая точность составляет ~96%.
(Обсуждение)
OpenAI выпустила нечто подобное:
https://openai.com/index/introducing-openai-privacy-filter/
Было еще про: GLiNER-PII https://t.me/Ai2Local/449
#Shield #Shield82M #PHI #PII #ПерсональныеДанные #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Добавьте анимированные субтитры в стиле TikTok к любому видео. ИИ транскрибирует речь, вы выбираете стиль, а ваш браузер встраивает субтитры в MP4. Видео не покидает ваше устройство. Хотите получить обычный текст? Воспользуйтесь функцией расшифровки.
Абсолютно бесплатный сервис для расшифровки и рендеринга субтитров, который на 100 % работает в браузере. Он использует whisper-ai для расшифровки аудио и рендерит видео с помощью веб-кодеков.
Загрузите видео или аудиофайл и получите точную расшифровку или переведите его на английский язык. Экспортируйте в виде обычного текста или субтитров.
(Обсуждение)
#Aivideo #captions #subtitle #Субтитры #Транскрибация #WhispherX #Whispher #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM