🎙 Русская версия Pocket TTS: клонирование голоса на процессоре
Лёгкий синтезатор речи, который работает без видеокарты. Клонирует голос по записи 10–20 секунд чистой речи.
Модель компактная — 6-слойный ученик, дистиллированный из 24-слойной версии. Быстрее и легче на инференсе.
На вход: текст + референс-аудио голоса. На выходе: WAV-файл речи.
Лицензия CC-BY-NC-4.0 — бесплатно для некоммерческого использования.
Текст нужно готовить: ударения обозначаются знаком «+» перед ударной гласной, числа раскрываются вручную. Длинные фразы лучше резать по предложениям. Качество зависит от промпта: шумная запись голоса даст шумную речь.
#PocketTTS #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
- Вот как выглядит рейтинг Frontier. (1 фото)
Вместе с всеобщим любимцем, qwen3.8-27B!
(Обсуждение)
- Вот как оценивают маленькие модели. (2 фото)
Ling 3.0 Tiny, похоже, по-прежнему лидирует, несмотря на то, что у него всего 1,3 миллиарда активных пользователей.
(Обсуждение)
#FrontierRanks #ModelsScore #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Собственный чат с искусственным интеллектом, агентами и автоматизацией.
Один образ Docker. Ваши собственные ключи модели. Ваши данные остаются на вашем сервере.
Создайте собственную ИИ-платформу для решения любых задач за считаные минуты.
Платформа состоит из трех частей:
Чат для обычного общения, Агенты для ботов, которые работают автономно (как Grok Bot), и Автоматизация для задач, выполняемых по расписанию.
(Обсуждение)
#Eidon #EidonAI #Docker #AiAgent #AgentAi #MCP #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Otaku — это LLM-интерфейс для ролевых игр (похожий на SillyTavern, Janitor AI и т. д.).
Он бесплатный, работает на вашем компьютере и позволяет играть как в веб-интерфейсе, так и в терминале. LLM могут быть локальными (через llama.cpp, KoboldCpp, Ollama и другие) или подключаться через API (OpenRouter, NanoGPT). Для Otaku не нужна инфраструктура — ни Docker, ни сервер баз данных. Он устанавливается одной командой и требует минимальной настройки.
Платформа: #macOS / #Linux / #Windows
Демоверсии доступны на веб-сайте:
Демо веб-интерфейса: https://otaku.sh/demo-web/
Демо терминала: https://otaku.sh/demo-terminal/
(Обсуждение)
#Otaku #roleplay #RP #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎙 Microsoft Research выпустила VibeVoice-ASR-Streaming
Потоковое распознавание речи, которое сразу определяет спикеров — без отдельного этапа диаризации. Модель обрабатывает звук кусками с небольшим заглядыванием вперёд и выдаёт реплики с метками говорящих по ходу разговора.
Можно передать список имён и терминов, чтобы модель их не коверкала. Поддерживает десять языков, включая русский.
По доле ошибок распознавания (WER для слов, CER для китайских иероглифов) версия 7B в среднем обходит Gemini 3.5 Transcribe Live, ElevenLabs Scribe v2 Realtime и потоковые модели OpenAI на пяти наборах записей встреч. Хотя на двух датасетах Gemini впереди. По атрибуции спикеров — лучший или равный лучшему результат в 12 из 13 настроек.
Веса версий с бэкбонами 1,5B и 7B под лицензией MIT, код открыт, есть демо.
(Обсуждение)
#Microsoft #VibeVoiceASRStreaming #VibeVoice #ASR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
На видео: Запуск полностью локального агента 9B AI на телефоне — LLM, инструменты, выполнение кода и генерация файлов.
TensorSharp - Собственный механизм логического вывода .NET для моделей GGUF. TensorSharp предоставляет консольное приложение, веб-интерфейс чат-бота и HTTP API, совместимые с Ollama/OpenAI, для программного доступа. Он поддерживает Windows/MacOS/iOS/Linux с использованием всех возможностей графического процессора.
Собственный движок вывода .NET LLM для моделей GGUF — авторегрессионные LLM и распространение текста в стиле DiffusionGemma, плюс редактирование изображений Qwen-Image-Edit и видео MiniMax-H3 с собственным стереозвуком 32 кГц (и Wan 2.1 / 2.2 только для видео). Включает консольное приложение, интерфейс чата в браузере и HTTP API, совместимые с Ollama/OpenAI. Движок на чистом .NET, который выигрывает по сравнению с C++ llama.cpp на идентичных файлах GGUF и с тем же графическим процессором. Дополнительный TensorSharp.AgentHost уровень добавляет навыки агента и ограниченный внутрипроцессный цикл преобразования модели в инструмент для работы с файлами и оболочкой в изолированной среде.
(Обсуждение)
#TensorSharp #MacOS #Windows #Linux #GGUF #AiAgent #AgentAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Имея 124B общих параметров, 5.1B активированных параметров и контекстное окно объемом 256K, модель сочетает в себе финансовую экспертизу с эффективным выводом для долгосрочных рабочих процессов агентов.
Анонс: https://x.com/AntLingAGI/status/2093022087069958492
OpenRouter
(Обсуждение)
#Ling30flashFin #Ling30 #Финансы #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Бесплатный MCP-сервер с открытым исходным кодом для ведической астрологии, который выступает в роли детерминированного астрономического калькулятора для больших языковых моделей — натальных карт, даш, панчангов и многого другого, рассчитанных с помощью Swiss Ephemeris.
Положение светил, дома, даши и панчанги, рассчитанные по швейцарским эфемеридам.
Ведическая астрология в значительной степени опирается на реальные астрономические расчеты — положение планет, разделение домов, временные рамки даши (планетарного периода), панчанг, — чтобы получить хоть какой-то результат. Большие языковые модели отлично справляются с объяснением и обобщением этих данных на понятном языке, но просить их на самом деле вычислить их на основе обучающих данных — плохая идея. Они сделают это уверенно, но ошибутся.
Большинство существующих инструментов/API для этого либо имеют закрытый исходный код, либо оплачиваются за каждый вызов, поэтому я создал свой собственный — честно говоря, в основном из любопытства. В процессе я многое узнал о ведической астрологии и архитектуре серверов MCP, и мне было очень интересно этим заниматься.
Что он делает: натальные карты, карты диспозиций (D1–D60), вимшоттари-даша, панчанг, шадбала, аштакаварга, транзиты, затмения, совместимость. Все расчеты производятся с помощью швейцарских эфемерид, в автономном режиме после установки — никаких затрат на API, никаких сетевых запросов во время выполнения запроса.
PyPI: https://pypi.org/project/librejyotish/
(Обсуждение)
#LibreJyotish #MCP #Астрология #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Нужен был быстрый счетчик калорий для себя, который с помощью больших языковых моделей оценивал бы калорийность блюд по фотографиям и описаниям.
Мне нужно было выбрать модель, поэтому я провел быстрый сравнительный анализ.
Условия были следующими:
- Фотографии Nutrition5k для фото + калорийность: https://github.com/google-research-datasets/Nutrition5k
- Инструмент с доступом к информации о калорийности из USDA FoodData Central + MEXT
- Я оценивал модели по тому, в скольких случаях погрешность не превышала 20%
- Все модели тестировались на одних и тех же 25 случайно выбранных блюдах.
Модели, которые были слишком большими для моего компьютера, были запущены через OpenCode Go/OpenRouter. Я также подключил Spark 1.3, так как предполагается, что его веса будут открытыми.
Самое интересное — это то, как Muse Glimmer 30b обходит Qwen 3.8 27b. Думаю, это показывает, что «лучшая» модель для потребительского оборудования (~32 ГБ видеопамяти) на самом деле зависит от задачи.
Ранее было:
#AiFood #AiTracker #calories #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Частный ИИ-помощник для Mac. 💯Автономный режим.
Fluid — это приватный офлайн-ассистент на базе большой языковой модели Llama 3 от Meta, созданный специально для компьютеров Mac с чипом Apple Silicon и операционной системой macOS 14 и новее. Его ключевое преимущество — полная обработка данных непосредственно на вашем устройстве без отправки информации на внешние серверы, что обеспечивает высокий уровень конфиденциальности.
Основные возможности:
- Полностью офлайн. Все запросы и ответы генерируются локально, что делает Fluid отличным выбором для работы с чувствительными данными, например, корпоративными документами или личной информацией.
- Голосовое управление. Можно диктовать запросы, и аудиоданные остаются на устройстве.
- Быстрый доступ. Для вызова помощника используется сочетание клавиш ⌃ (Ctrl) + Space.
- История чатов. Позволяет легко возвращаться к предыдущим диалогам.
- Автоматические обновления. Приложение само обновляется до последней версии с шифрованием.
- Безопасность. Программа работает в изолированной среде (песочнице), прошла проверку и укрепление со стороны Apple, не требует прав администратора.
Технические требования:
Для работы Fluid требуется значительное место на диске:
- Около 4,9 ГБ для Mac с 8 ГБ ОЗУ.
- Около 8,6 ГБ для Mac с 16 ГБ ОЗУ и более.
Для компьютеров Mac с Apple Silicon и macOS 14 или более поздней версии.
Создано с помощью Meta Llama 3
#Fluid #MacOS #Meta #Llama3 #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Хватит тратить часы на чтение PDF
Мгновенно общайтесь с любым PDF-файлом на своем Mac.
PDF Pals — это приложение для macOS, которое позволяет взаимодействовать с PDF-документами через чат с использованием искусственного интеллекта. Оно действительно хорошо подходит для резюмирования и анализа содержимого, при этом все операции выполняются локально на вашем устройстве, без выгрузки файлов в облако, что обеспечивает конфиденциальность.
Как это работает:
Вы открываете в приложении один или несколько PDF-файлов, задаёте вопросы на естественном языке, и ИИ отвечает, опираясь на содержание документов. Ответы сопровождаются цитатами с указанием конкретных страниц или фрагментов текста. Это особенно ценно для юридических и научных задач, где важна проверяемость.
Ключевые особенности:
- Локальная обработка. Файлы остаются на вашем Mac, не передаются внешним серверам.
- Мощный OCR-движок. Способен распознавать текст даже в отсканированных PDF-документах и сложных формах.
- Поддержка нескольких API. Можно использовать собственный ключ от OpenAI, Azure OpenAI или OpenRouter либо арендовать его прямо в приложении.
- Настраиваемый ИИ. Можно менять параметры модели (температуру, лимит контекста), язык ответов, использовать Markdown.
- Работа с несколькими файлами. Можно выделить несколько PDF в Finder, открыть их вместе и вести диалог по всей выборке.
- Защита данных. Приложение автоматически маскирует (редектит) в документах такую конфиденциальную информацию, как номера карт или денежные суммы.
#PDFPals #PDF #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM