Новая компактная, специально разработанная для кодинга в агентном режиме и локальной разработки!
Построена на базе Qwen3-Next-80B-A3B-Base с гибридным вниманием и MoE, где активно используется всего 3B параметров при общем размере 80B
В Qwen на этот раз уделили внимание обучению на исполнении задач с реальными средами, обратной связи от выполнения кода, специализированных экспертах для кодинга и дистилляции экспертов в одну модель
70%+ на SWE-Bench Verified (один из лучших показателей среди открытых моделей)
HuggingFace, Github, Блог, ModelScope
👉 Reddit: Технический отчёт Qwen3-Coder: обобщение вызовов инструментов, взлом вознаграждений, общие знания
👉 Пост про нее на Хабр.
#Qwen3Next80B #Qwen3Next #Qwen3CoderNext #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Локальное преобразование речи в текст для Windows/macOS с глобальной горячей клавишей.
✨ Особенности:
Глобальная горячая клавиша: начните записывать речь из любого приложения
Автоматическая вставка: запись непосредственно курсором.
Автоматическая отправка: При необходимости автоматически отправьте свою транскрипцию с помощью ENTER
Возможность работы в автономном режиме: после загрузки моделей интернет не требуется.
Локальная обработка: голосовые данные никогда не покидают ваш компьютер
Эффективные модели: Выберите небольшую и эффективную модель для центрального процессора
Поддержка CUDA: Или используйте графический процессор nVidia в моделях большего размера
Обнаружение голосовой активности: автоматическое отключение после длительного молчания и предотвращение галлюцинаций
Кроссплатформенность: работает в Windows и macOS
Настраиваемый: настройка горячих клавиш, моделей и многого другого
Теперь доступно в Windows и macOS!
(Обсуждение поста автора)
#WhisperKey #Whisper #Windows #macOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - PinW/whisper-key-local: Global hotkeys to record speech and transcribe directly to your cursor
Global hotkeys to record speech and transcribe directly to your cursor - PinW/whisper-key-local
Генератор аудиокниг с использованием аннотаций скриптов LLM и клонированием голоса Qwen3 TTS — лаунчер Pinokio.
LLM преобразует ваш текст в аннотированный сценарий, а TTS оживляет его с помощью пользовательских или клонированных голосов. поддерживает эмоциональные подсказки.
(Обсуждение поста Автора)
Есть: VoxCPM2 https://voxcpm.com
TTS без токенизации для генерации многоязычной речи, креативного голосового дизайна и реалистичного клонирования
Есть: GPT-SoVITS-WebUI
Мощный веб-интерфейс для преобразования речи в текст и обратно.
#AlexandriaAudiobook #Alexandria #Audiobook #TTS #Qwen3TTS #Pinokio #EdgeTTS #LocalAi #AiLocal #VoxCPM
Please open Telegram to view this post
VIEW IN TELEGRAM
Self-hosted ИИ-бухгалтерия для анализа чеков и инвойсов!
Позвольте ИИ наконец позаботиться о ваших налогах, отсканировать чеки и проанализировать ваши расходы!
Самостоятельное бухгалтерское приложение для фрилансеров, инди-разработчиков и малого бизнеса.
💥 TaxHacker — open source-приложение для автоматизации учёта расходов и доходов, ориентированное на приватное использование в режиме self-hosted. Система превращает фотографии чеков, PDF-инвойсы и банковские выписки в структурированную финансовую базу данных с помощью больших языковых моделей.
🧠 Как это работает:
Пользователь загружает документы, после чего ИИ извлекает ключевые данные, включая суммы, даты, контрагентов и назначения платежей. Процесс построен на LLM и может быть адаптирован под конкретные форматы документов за счёт настраиваемых промптов. Поддерживается обработка документов на любых языках, включая рукописные чеки.
📊 Система поддерживает мультивалютные операции с автоматической конвертацией по историческому курсу на дату транзакции, а также учёт криптоактивов. Возможна детализация одного чека на несколько транзакций, гибкая категоризация, привязка к проектам и хранение дополнительных пользовательских полей. Данные можно фильтровать и экспортировать для дальнейшей работы или налоговой отчётности. Приложение совместимо с моделями OpenAI, Google Gemini и Mistral.
🎯 TaxHacker закрывает нишу приватной ИИ-бухгалтерии для фрилансеров, предпринимателей и небольших команд, которым важно не передавать финансовые данные сторонним сервисам. Инструмент снижает ручную нагрузку, уменьшает количество ошибок при вводе данных и делает подготовку финансовой отчётности быстрее и прозрачнее.
https://github.com/vas3k/TaxHacker
#TaxHacker #AiTax #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💥 Ultimate Vocal Remover — бесплатный инструмент на базе нейросетей для разделения вокала и инструментальной части трека, а также очистки аудио от шумов и артефактов.
🧠 Ultimate Vocal Remover использует обученные модели разделения источников, которые анализируют аудиодорожку и раскладывают её на отдельные компоненты. Пользователь загружает файл, выбирает модель и получает раздельные дорожки без ручной настройки и сложных параметров.
📊 Инструмент работает локально и поддерживает Windows, macOS и Linux. Интерфейс максимально простой, установка не требует регистрации или подписки. Проект распространяется бесплатно с открытым исходным кодом, а качество разделения сопоставимо с платными сервисами.
🎯 Ultimate Vocal Remover делает профессиональные аудио-задачи доступными без затрат. Он подходит для музыкантов, подкастеров, монтажёров и контент-мейкеров, которым нужно быстро отделить вокал, сделать минусовку или очистить звук без облаков и ограничений.
🔗 https://github.com/Anjok07/ultimatevocalremovergui
#UltimateVocalRemover #VocalRemover #Windows #macOS #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Французская #Mistral AI выпустила второе поколение своих моделей распознавания речи. Главные акценты - задержка менее 200 мс, локальная работа без облака и открытая лицензия Apache 2.0.
Демо: https://huggingface.co/spaces/mistralai/Voxtral-Mini-Realtime
Что важно:
✧ потоковое распознавание в реальном времени
✧ открытые веса и on-device-запуск
✧ WER около 4% на бенчмарке FLEURS
✧ поддержка диаризации и 13 языков (включая русский)
✧ низкая стоимость через API
Mistral AI делает акцент и на стоимости сервиса. Использование Voxtral Mini Transcribe 2 через API оценивается в 0,003 доллара за минуту обработки (примерно 0,27 рубля), а потоковое распознавание в реальном времени - в 0,006 доллара за минуту (около 0,55 рубля). Это заметно ниже цен многих конкурентов при сопоставимых характеристиках.
Voxtral Realtime уже доступна для скачивания на платформе Hugging Face, а обе модели интегрированы в API Mistral.
Вместе с релизом компания запустила обновлённый аудио-плейграунд в Mistral Studio. Пользователи могут бесплатно загрузить до десяти аудиофайлов размером до 1 ГБ каждый, выбрать формат временных меток, включить диаризацию и добавить контекстные подсказки для улучшения качества распознавания. Поддерживаются популярные форматы - MP3, WAV, M4A, FLAC и OGG.🔗 Подробнее...
#VoxtralRealtime #Voxtral #VoxtralTranscribe2 #Transcribe #Транскрибация #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
💥 Полностью опенсорсный и локальный NotebookLM — в HyperBookLM достаточно загрузить URL-ссылку, PDF или текст,
а дальше можно:
• Задавать вопросы по содержанию;
• Получать удобные конспекты;
• Создавать наглядные майнд-мапы;
• Превращать в презентации;
• Генерировать аудио-выжимки.
Всё это — локально и 100% с открытым кодом.
Он похож на Google NotebookLM, но с ключевым отличием: активные веб-агенты, которые умеют работать с живым интернетом.
🔗 https://github.com/hyperbrowserai/hyperbooklm
#HyperBookLM #NotebookLM #LocalAi #AiLocal
а дальше можно:
• Задавать вопросы по содержанию;
• Получать удобные конспекты;
• Создавать наглядные майнд-мапы;
• Превращать в презентации;
• Генерировать аудио-выжимки.
Всё это — локально и 100% с открытым кодом.
Он похож на Google NotebookLM, но с ключевым отличием: активные веб-агенты, которые умеют работать с живым интернетом.
🧩 HyperbookLM — рабочее пространство для исследований и обучения, куда можно добавлять:
— URL-страницы
— PDF-документы
— текстовые файлы
ИИ позволяет задавать вопросы сразу по всем источникам, строить сводки и визуализации.
⚙️ Ключевые возможности:
— интеллектуальный поиск по материалам
— веб-агенты, анализирующие сайты
— автоматическое создание mind map
— экспорт в презентации
— аудио-саммари для прослушивания
🚀 Чем лучше аналогов:
— полностью open-source
— не привязан к Google
— работает с живым вебом
— не ограничен одним ИИ-вендором
🔗 https://github.com/hyperbrowserai/hyperbooklm
#HyperBookLM #NotebookLM #LocalAi #AiLocal
This media is not supported in your browser
VIEW IN TELEGRAM
🔊 Вышла мощнейшая нейронка для улучшения качества звука в несколько раз — NovaSR превращает аудио с частотой 16 кГц в супер-чёткое 48 кГц.
Работает как магия — обрабатывает 3600 секунд звука за одну (!) секунду. Сама модель — крошечная, весит всего 52 КБ, что меньше 5-секундного аудио-файла.
🔗 GitHub лежит тут, а демка доступна здесь.
#NovaSR #AiAudio #LocalAi #AiLocal
Работает как магия — обрабатывает 3600 секунд звука за одну (!) секунду. Сама модель — крошечная, весит всего 52 КБ, что меньше 5-секундного аудио-файла.
#NovaSR #AiAudio #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
PennyWise автоматически считывает SMS-сообщения о транзакциях и преобразует их в структурированные финансовые данные с помощью ИИ на устройстве. Никакого ручного ввода, никакой облачной обработки, полная конфиденциальность.
Превратите банковские SMS в удобную хронологию денежных операций с возможностью поиска с помощью искусственного интеллекта на устройстве. 100 % конфиденциальность, без облачной обработки.
Как это работает:
- Предоставьте разрешение на использование SMS (только для чтения). - Изменения в почтовом ящике не происходят, сообщения не отправляются.
- PennyWise анализирует SMS-сообщения о транзакциях, извлекает информацию о сумме, продавце, категории и дате.
- Просматривайте аналитику, подписки и полную хронологию транзакций с помощью встроенного в устройство ИИ-помощника.
Почему PennyWise:
🤖 Умный парсинг SMS — автоматическое извлечение данных о транзакциях из более чем 40 банков в 5 странах
🌍 Поддержка нескольких валют — встроенная поддержка ₹, $, د.إ, ₨, ብር с надлежащей локализацией
📊 Clear Insights — аналитика и графики, позволяющие мгновенно увидеть, на что уходят деньги
🔄 Отслеживание подписок — обнаружение и мониторинг регулярных платежей
💬 Искусственный интеллект на устройстве — задавайте вопросы, например: «Сколько я потратил на еду в прошлом месяце?»
🏷 Автоматическая категоризация — очистка названий продавцов и логичных категорий
📤 Экспорт данных — экспорт в формате CSV или PDF для налоговой отчетности
или https://f-droid.org/packages/com.pennywiseai.tracker
или v2.15.45 https://github.com/sarim2000/pennywiseai-tracker/releases/download/v2.15.45/PennyWise-v2.15.45-universal.apk
#PennyWise #PennyWiseAI #pennywiseaitracker #AiMoney #Android #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👎1
В приложении для iPhone KernelAi появилась модель для перевода на 50+ языков TranslateGemma от Google
На 4B параметров. В нем достаточно много моделей и есть модели сообщества!
Простое удобное приложение:
https://apps.apple.com/ru/app/kernelai/id6757350731
Про него подробнее: https://t.me/Ai2Local/143
#KernelAI #App #iPhone #LocalAi #AiLocal
На 4B параметров. В нем достаточно много моделей и есть модели сообщества!
Простое удобное приложение:
https://apps.apple.com/ru/app/kernelai/id6757350731
Про него подробнее: https://t.me/Ai2Local/143
#KernelAI #App #iPhone #LocalAi #AiLocal
Она демонстрирует впечатляющую точность 54,8% на BrowseComp-Plus, превосходя по этому показателю GPT-4.1, Claude-Opus-4, Gemini-2.5-Pro, DeepSeek-R1 и Tongyi-DeepResearch. Мы полностью открыли исходный код для обучения и оценки, включая данные, модель, методологию обучения и систему оценки, чтобы каждый мог продвигать глубокие исследования.
Демо: https://huggingface.co/spaces/OpenResearcher/OpenResearcher
(Обсуждение)
#OpenResearcher #DeepResearch #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
MDST Engine: запускайте модели GGUF в браузере с помощью WebGPU/WASM для 100% локального логического вывода.
Теперь для запуска моделей вам не понадобится дополнительное программное обеспечение — только современный браузер (Chrome, Safari и Edge).
Сейчас MDST работает на Qwen 3, Ministral 3, LFM 2.5 и Gemma 3 в любом квантовании GGUF.
Подробную информацию о исследовании GGUF и планах на будущее, а также о текущей общедоступной таблице лидеров WebGPU и раннем доступе можно найти по ссылке:
https://mdst.app/blog/mdst_engine_run_gguf_models_in_your_browser
(Обсуждение поста Автора) специальный код приглашения, чтобы пропустить очередь: localllama_Epyz6cF
#MDST #Engine #MDSTEngine #GGUF #WebGPU #WASM #AiLocal #LocalAi
Теперь для запуска моделей вам не понадобится дополнительное программное обеспечение — только современный браузер (Chrome, Safari и Edge).
Сейчас MDST работает на Qwen 3, Ministral 3, LFM 2.5 и Gemma 3 в любом квантовании GGUF.
Подробную информацию о исследовании GGUF и планах на будущее, а также о текущей общедоступной таблице лидеров WebGPU и раннем доступе можно найти по ссылке:
https://mdst.app/blog/mdst_engine_run_gguf_models_in_your_browser
(Обсуждение поста Автора) специальный код приглашения, чтобы пропустить очередь: localllama_Epyz6cF
#MDST #Engine #MDSTEngine #GGUF #WebGPU #WASM #AiLocal #LocalAi
Десктопное приложение для работы с голосом — от клонирования до озвучки длинных текстов.
🎙 Что внутри:
· Клонирование голоса по 3 секундам записи
· Генерация речи
· Создание аудиокниг и озвучка объёмных материалов
· 23 языка, включая русский
· Версии для macOS, Windows и веб
Главное — локальный запуск. Можно скачать бесплатные модели (Qwen3-TTS, Chatterbox, Kokoro) и работать без облака. Данные остаются на вашем компьютере, минимальные требования — 8 Гб ОЗУ.
Подходит для подкастов, обучающих материалов и любого контента, где нужен синтез речи.
23 Языка! (Английский, немецкий, испанский, французский, итальянский, японский, корейский, португальский, Русский, китайский, арабский, датский, хинди, голландский, норвежский, польский, шведский, турецкий, филиппинский, малайский, суахили, иврит, финский.
🔗 https://boltzmannentropy.github.io/mimikastudio.github.io
Проект: https://github.com/BoltzmannEntropy/MimikaStudio
(Статья) (Обсуждение поста Автора)
#TTS #MimikaStudio #AiLocal #LocalAi #MacOS
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Значительно улучшены такие аспекты, как понимание длинных контекстов и изображений с высоким разрешением, визуальное мышление с активным анализом изображений и понимание документов с большим объемом информации.
👉 Улучшенная обработка длинных последовательностей и изображений с высоким разрешением
Ovis2.6 расширяет контекстное окно до 64 000 токенов и поддерживает разрешение изображений до 2880×2880, что значительно повышает его способность обрабатывать визуальные данные с высоким разрешением и большим объемом информации. Эти улучшения особенно эффективны при ответах на вопросы по длинным текстам, когда модель должна собрать и синтезировать подсказки, разбросанные по нескольким страницам, чтобы дать правильный ответ.
👉 Думайте с помощью образа
Мы представляем возможность "Думай с помощью образа", которая превращает видение из пассивного источника информации в активное когнитивное рабочее пространство. Во время рассуждений модель может активно использовать визуальные инструменты (например, обрезку и поворот) для повторного изучения и анализа областей изображения в рамках своей цепочки размышлений, что позволяет проводить многооборотные саморефлексивные рассуждения на основе визуальных данных для повышения точности решения сложных задач.
👉 Расширенные возможности оптического распознавания символов, работы с документами и диаграммами
Продолжая уделять особое внимание задачам, связанным с обработкой визуальной информации, мы усовершенствовали возможности модели в области оптического распознавания символов (OCR), понимания документов и анализа графиков и диаграмм. Ovis2.6 не только точно извлекает структурированную информацию из визуальных данных, но и анализирует извлеченные данные.
(Обсуждение)
#Ovis2630BA3B #Ovis26 #Ovis #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM