Модель генерирует треки до 4,5 минут, работает с текстом и аудио, ошибается в передаче слов песен в 8,55% случаев — это лучше многих коммерческих решений.
Что умеет: создаёт музыку по текстовому описанию или аудиофрагменту, выдаёт отдельно вокал и инструменталы или вместе, запускается на GPU с 10 ГБ VRAM.
Есть быстрая версия — генерация за минуту.
Обновился плагин для ComfyUI.
Интересно сравнить с AceStep 1.5.
🔗 https://levo-demo.github.io/levo_v2_demo/
#LeVo2 #Suno #AiMusic #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🦥 Unsloth Studio - крутая альтернатива LM Studio!
Unsloth представила Unsloth Studio — open-source веб-интерфейс для запуска, обучения и экспорта моделей локально. Публичный запуск состоялся сейчас, хотя сам проект разрабатывался около года.
Это даёт простой единый инструмент вместо набора утилит: можно запускать GGUF и safetensors, собирать датасеты из файлов, дообучать модели и сравнивать их между собой. Есть поддержка text, vision, audio, TTS и embedding, а также экспорт в нужные форматы.
Обзор основных функций Unsloth Studio.
- Запускайте модели локально на Mac, Windows и Linux
- Обучайте более 500 моделей в 2 раза быстрее с уменьшением объема видеопамяти на 70%.
- Поддерживает GGUF, визуальные, звуковые и встраиваемые модели
- Сравнивайте и сражайтесь с моделями бок о бок
- Вызов инструмента для самовосстановления и веб-поиск
- Автоматическое создание наборов данных из PDF, CSV и DOCX
- Выполнение кода позволяет LLMs тестировать код для получения более точных выходных данных
- Экспортировать модели в GGUF, Safetensors и другие!
- Настройка параметров автоматического вывода (temp, top-p и т.д.) + редактирование шаблонов чатов
Обучение работает на NVIDIA GPU, на CPU и Mac доступен в основном режим чата, поддержка MLX, AMD и Intel заявлена позже.
GitHub: https://github.com/unslothai/unsloth
Блог + все, что нужно знать: https://unsloth.ai/docs/new/studio
(Обсуждение-1, Обсуждение-2)
#Unsloth #UnslothStudio #LLM #OpenSource #LocalAI #AI #AiLocal #MachineLearning #GGUF
Unsloth представила Unsloth Studio — open-source веб-интерфейс для запуска, обучения и экспорта моделей локально. Публичный запуск состоялся сейчас, хотя сам проект разрабатывался около года.
Это даёт простой единый инструмент вместо набора утилит: можно запускать GGUF и safetensors, собирать датасеты из файлов, дообучать модели и сравнивать их между собой. Есть поддержка text, vision, audio, TTS и embedding, а также экспорт в нужные форматы.
Обзор основных функций Unsloth Studio.
- Запускайте модели локально на Mac, Windows и Linux
- Обучайте более 500 моделей в 2 раза быстрее с уменьшением объема видеопамяти на 70%.
- Поддерживает GGUF, визуальные, звуковые и встраиваемые модели
- Сравнивайте и сражайтесь с моделями бок о бок
- Вызов инструмента для самовосстановления и веб-поиск
- Автоматическое создание наборов данных из PDF, CSV и DOCX
- Выполнение кода позволяет LLMs тестировать код для получения более точных выходных данных
- Экспортировать модели в GGUF, Safetensors и другие!
- Настройка параметров автоматического вывода (temp, top-p и т.д.) + редактирование шаблонов чатов
Обучение работает на NVIDIA GPU, на CPU и Mac доступен в основном режим чата, поддержка MLX, AMD и Intel заявлена позже.
GitHub: https://github.com/unslothai/unsloth
Блог + все, что нужно знать: https://unsloth.ai/docs/new/studio
(Обсуждение-1, Обсуждение-2)
#Unsloth #UnslothStudio #LLM #OpenSource #LocalAI #AI #AiLocal #MachineLearning #GGUF
Если вы не следили за сообществом Beaver, то могли пропустить эти четыре тихих релиза.
Это значительные улучшения по сравнению с предыдущими версиями, и они звучат так же, как другие модели поколения 4.0 (например, Cydonia 24B 4.3, Rocinante X 12B v1, если вам нравятся эти модели).
(Обсуждение)
#Beaver #Drummer #Skyfall31B #Valkyrie49B #Anubis70B #AnubisMini8B #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Local Ai
This media is not supported in your browser
VIEW IN TELEGRAM
Уже было о LoopMaker — нативном приложении для Mac, которое генерирует музыку локально на устройстве с помощью фреймворка Apple MLX. Вот что изменилось с тех пор.
Что улучшилось:
Самое большое изменение — переход на ACE-Step 1.5, новейшую музыкальную модель с открытым исходным кодом от ACE Studio. Эта модель по результатам тестирования на SongEval показала результаты между Suno v4.5 и v5, что является огромным скачком по сравнению с тем, на каком уровне находилась генерация локальной музыки еще месяц назад.
Конкретные улучшения качества:
- Разделение инструментов стало намного чище. Треки больше не звучат размыто или сжато
- Значительно улучшилась четкость и естественность вокала. Все еще не на уровне Suno v5, но теперь действительно приятно слушать
- Бас стал более плотным. 808-е и низкие частоты звучат как надо
- Высокочастотные детали (хай-хэты, тарелки, обертоны струнных) звучат более реалистично
- Структура песни на более длинных сессиях стала более целостной. Меньше случайных отклонений
Чем отличается архитектура новой модели:
В ACE-Step 1.5 используется гибридный подход, который отделяет планирование от рендеринга:
1) Языковая модель (на основе Qwen, 0,6–4 млрд параметров) отвечает за планирование песни с помощью метода Chain-of-Thought. Она принимает текстовое описание и создает полный план: темп, тональность, аранжировку, текст, стилистические характеристики.
2) Diffusion Transformer отвечает за синтез звука на основе этого шаблона
Такое разделение означает, что DiT не пытается одновременно понять ваш запрос и сгенерировать звук. Каждый компонент фокусируется на том, что у него получается лучше всего. Аналогичным образом разделение кодировщика текста и декодировщика изображений повысило качество SD-изображений.
Модель также использует внутреннее обучение с подкреплением для выравнивания, а не внешние модели вознаграждения. Без предвзятости в пользу RLHF. Это помогает обеспечить единообразие подсказок на более чем 50 языках.
Технические детали, которые важны для этого сабреддита:
- Модель работает через Apple MLX + графический процессор через Metal
- Требуется менее 8 ГБ памяти. Работает на базе M1/M2 с 16 ГБ памяти
- В модели реализована поддержка тонкой настройки LoRA (пока не в приложении, но в планах)
- Лицензия MIT, обучение на лицензионных и бесплатных данных
Над чем еще нужно поработать:
- Скорость генерации на MLX ниже, чем на CUDA. Минуты, а не секунды. Компромисс ради нативного интерфейса Mac
- Согласованность вокала может варьироваться в зависимости от поколения. Чувствительность к начальным данным по-прежнему высока (проблема «гача»)
- В приложении пока нет обучения с учителем. Если вы хотите провести тонкую настройку, вам нужно будет запустить необработанную модель через Python
- Некоторые жанры (особенно китайский рэп) проигрывают по сравнению с другими
(Обсуждение)
#LoopMaker #ACEStep15 #ACEStep #Suno #AiMusic #AiSong #AiAudio #MacOS #AiLocal #LocalAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Это высокопроизводительная мультимодальная модель с открытым исходным кодом, разработанная совместно с NVIDIA специально для эпохи компьютерных агентов. (По производительности не уступает Holo2/Qwen, но в два раза превосходит их по пропускной способности)
Holotron-12B, обученная на основе открытой модели NVIDIA Nemotron-Nano-2 VL на собственной смеси данных H Company, является результатом тесного сотрудничества исследовательских лабораторий в разработке нового типа модели, оптимизированной в первую очередь для масштабирования и производительности в производственных условиях.
Почему создали Holotron-12B?:
Большинство современных мультимодальных моделей оптимизированы в первую очередь для статического зрения или выполнения инструкций. Однако у Holotron-12B, как и у модели Holo2, другая цель: служить в качестве модели принятия решений для компьютерных агентов, которые должны эффективно воспринимать, анализировать и действовать в интерактивных средах.
При разработке Holotron-12B стремились создать модель, которая могла бы эффективно масштабироваться в производственной среде, обрабатывая длинные контексты с несколькими изображениями, и при этом показывать хорошие результаты в тестах.
🤗Hugging Face: https://huggingface.co/Hcompany/Holotron-12B
📖Подробное техническое описание: https://hcompany.ai/holotron-12b
Пост: https://x.com/hcompany_ai/status/2033851052714320083
(Обсуждение)
#Holotron12B #NVIDIA #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎬 Переводчик в реальном времени — локальный ИИ-переводчик
Локальный инструмент для перевода в режиме реального времени с использованием ИИ и плавающим интерфейсом на базе Whisper и Qwen.
🔗 https://github.com/GlitchyBlep/Realtime-AI-Translator
(Обсуждение)
#RealtimeInterpreter #Interpreter #Whisper #AiПеревод #Перевод #LocalAi #AiLocal
Локальный инструмент для перевода в режиме реального времени с использованием ИИ и плавающим интерфейсом на базе Whisper и Qwen.
Realtime Interpreter — это полностью локальный инструмент для синхронного перевода с использованием искусственного интеллекта. Он может прослушивать системный звук или микрофонный ввод в режиме реального времени, использовать Whisper для распознавания речи, а затем задействовать локальную большую языковую модель (например, Qwen) для потокового перевода и, наконец, отображать двуязычные субтитры в независимом плавающем окне, которое всегда находится поверх других окон.
Ключевые особенности:
🏠 Полностью локальное приложение: не требует подключения к интернету, что обеспечивает конфиденциальность и исключает утечку данных.
⚡️ Перевод в режиме реального времени с низкой задержкой: от распознавания речи до перевода обычно проходит 2–4 секунды.
🪟 Независимое плавающее окно Always-On-Top: Субтитры с переводом отображаются поверх всех остальных окон, не мешая вашей работе (иногда оно может вести себя нестабильно, но просто перезапустите его, если оно исчезнет 🫠).
🌍 Поддержка 29 языков: от китайского до венгерского, включая большинство основных языков мира.
🎭 Оптимизация для конкретных сценариев: вводите подсказки для конкретных областей (например, «Нейронаука Массачусетского технологического института», «Корейские дорамы», «Непринужденный чат») для оптимизации качества перевода.
🔄 Горячая перезагрузка во время работы: переключайте языки, сценарии и источники аудиовхода на лету, без перезапуска.
(Обсуждение)
#RealtimeInterpreter #Interpreter #Whisper #AiПеревод #Перевод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Голосовой ввод в автономном режиме обеспечивает профессиональный уровень преобразования речи в текст, работая полностью на вашем устройстве. Пишете ли вы электронные письма, делаете заметки или общаетесь в чате, ваши голосовые данные никогда не покидают ваш телефон.
Характеристики:
- Автономная транскрипция: использует модели глубокого обучения (Parakeet TDT) для полной расшифровки речи на устройстве.
- Поддерживаемые языки: болгарский, хорватский, чешский, датский, нидерландский, английский, эстонский, финский, французский, немецкий, греческий, венгерский, итальянский, латышский, литовский, мальтийский, польский, португальский, румынский, словацкий, словенский, испанский, шведский, русский, украинский
- Клавиатура с голосовым вводом Используйте свой голос для ввода текста.
- Субтитры в реальном времени: субтитры для любого аудио/видео, воспроизводимого на вашем устройстве.
- Конфиденциальность превыше всего: аудиоданные не покидают ваше устройство.
📱 https://play.google.com/store/apps/details?id=dev.notune.transcribe
Проект: https://github.com/notune/android_transcribe_app
✅ Еще есть: parakeet_transcribe https://github.com/RastislavKish/parakeet_transcribe
Многоязычная транскрипция аудио в текст с помощью Parakeet TDT (Восторг тут)
Аналоги по тегу: #Диктовка
#OfflineVoiceInput #transcribe #App #Android #Parakeet #транскрибация #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Это (почти) бесплатное офлайн-приложение для перевода в режиме реального времени с открытым исходным кодом для Android.
Подключитесь к тому, у кого есть это приложение, наденьте Bluetooth-наушники, положите телефон в карман, и вы сможете разговаривать так, будто собеседник говорит на вашем языке.
👉 Режим разговора
Режим «Разговор» — главная функция RTranslator. В этом режиме вы можете подключиться к другому телефону, на котором установлено это приложение. Если пользователь примет ваш запрос на подключение:
- Когда вы говорите, ваш телефон (или Bluetooth-гарнитура, если она подключена) записывает звук.
- Записанный звук преобразуется в текст и отправляется на телефон собеседника.
- Телефон собеседника переводит полученный текст на его язык.
- Телефон собеседника преобразует переведенный текст в аудио и воспроизводит его через динамик (или через Bluetooth-гарнитуру собеседника, если она подключена к его телефону).
Все это работает в обоих направлениях.
У каждого пользователя может быть несколько подключенных телефонов, что позволяет переводить разговоры между более чем двумя людьми в любой комбинации.
👉 Режим рации
Если режим разговора удобен для длительных бесед, то этот режим предназначен для коротких разговоров, например для того, чтобы узнать что-то на улице или поговорить с продавцом в магазине.
Этот режим переводит только разговоры между двумя людьми, он не работает с Bluetooth-гарнитурами, и вам придется говорить по очереди. Это не настоящий синхронный перевод, но он может работать с только одним телефоном.
В этом режиме микрофон смартфона будет одновременно прослушивать два языка (их можно выбрать на том же экране, что и режим рации).
Приложение определит, на каком языке говорит собеседник, переведет аудио на другой язык, преобразует текст в аудио и воспроизведет его через динамик телефона. После завершения преобразования текста в речь прослушивание возобновится автоматически.
👉 Режим перевода текста
Этот режим — обычный текстовый переводчик, но он всегда пригодится.
Поддерживаются следующие языки:
Арабский, болгарский, каталанский, китайский, хорватский, чешский, датский, нидерландский, английский, финский, французский, галисийский, немецкий, греческий, итальянский, японский, корейский, македонский, польский, португальский, румынский, русский, словацкий, испанский, шведский, тамильский, тайский, турецкий, украинский, урду, вьетнамский.
Скоро выйдет RTranslator 3.0!
Скачать .APK 2.1.5
#RTranslator #Android #AiTranslate #App #AiПеревод #Перевод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Рейтинг систем интеллектуальной обработки документов https://idp-leaderboard.org
Во всех победах или матчах Qwen:
OlmOCR (извлечение текста из беспорядочных сканирований, плотных PDF-файлов, макетов с несколькими столбцами):
Qwen3.5-9B: 78.1
Qwen3.5-4B: 77.2
Gemini 3.1 Pro: 74.6
Клод Сонет 4.6: 74.4
Qwen3.5-2B: 73.7
GPT-5.4: 73.4
9B и 4B опережают все модели frontier по извлечению необработанного текста. Модель 2B соответствует GPT-5.4.
VQA (ответы на вопросы о содержании документов, диаграммах, таблицах):
Gemini 3.1 Pro: 85,0
Qwen3.5-9B: 79,5
GPT-5.4: 78,2
Qwen3.5-4B: 72,4
Claude Sonnet 4.6: 65,2
GPT-5.2: 63,5
Gemini 3 Flash: 63,5
Это больше всего удивило. По результатам VQA 9B уступает только Gemini 3.1 Pro. Она опережает GPT-5.4. Она на 14 баллов опережает Claude Sonnet и на 16 баллов опережает Gemini Flash. Такой результат VQA для открытой модели 9B сложно объяснить.
KIE (извлечение номеров счетов, дат, сумм):
Gemini 3 Flash: 91,1
Claude Opus 4.6: 89,8
Claude Sonnet 4.6: 89,5
GPT-5.2: 87,5
Gemini 3.1 Pro: 86,8
Qwen3.5-9B: 86,5
Qwen3.5-4B: 86,0
GPT-5.4: 85,7
Qwen-9B соответствует уровню Gemini 3.1 Pro.
Qwen-4B соответствует уровню GPT-5.4.
Оба опережают GPT-5-Mini (85,7), Claude Haiku (85,6) и Ministral-8B (85,7).
Там, где передовые модели явно лучше.
Извлечение данных из таблиц (GrITS):
Gemini 3.1 Pro: 96,4
Claude Sonnet: 96,3
GPT-5.4: 94,8
Gemini 3 Pro: 95,8
GPT-5.2: 86,0
Gemini 3 Flash: 85,6
Qwen3.5-4B: 76,7
Qwen3.5-9B: 76,6
Модели Frontier имеют от 85 до 96 баллов по шкале Qwen. Независимо от размера, Qwen у моделей 4B и 9B составляет от 76 до 77 баллов. По сути, эти модели идентичны. Похоже, это ограничение связано с архитектурой, а не с масштабом.
Распознавание рукописного текста:
Gemini 3.1 Pro: 82,8
Gemini 3 Flash: 81,7
GPT-4.1: 75,6
Claude Opus: 74,0
Claude Sonnet: 73,7
GPT-5.4: 69,1
Ministral-8B: 67,8
Qwen3.5-9B: 65,5
Qwen3.5-4B: 64,7
Gemini лучше распознает рукописный текст. Qwen отстает, но не сильно, от GPT-5.4 (69,1 против 65,5).
Масштабирование в рамках семейства Qwen:
В целом: 0,8B 58,0, 2B 63,2, 4B 73,1, 9B 77,0
Резюме:
Извлечение с помощью оптического распознавания символов: Qwen 4B/9B опережает все передовые модели
Рассуждения с помощью VQA: Qwen-9B занимает второе место, уступая только Gemini 3.1 Pro. Опережает GPT-5.4.
Извлечение полей KIE: Qwen 4B/9B не уступает передовым моделям
Извлечение таблиц: передовые модели опережают на 10–20 баллов
(Обсуждение)
#Qwen359B #OCR #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Механизм логического вывода Bodega
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine
Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
О самой быстрой среде выполнения для Apple Silicon.
https://github.com/SRSWTI/bodega-inference-engine
Круто ускорили ИИ на Мак! Подробно ТУТ.
#Bodega #MacOS
Легкий и мощный инструмент для перевода аудио и речи в режиме реального времени на основе Windows LiveCaptions.
Встроенная в Windows функция LiveCaptions проста в использовании, не требует много ресурсов и обеспечивает чрезвычайно высокую точность распознавания. Если дополнить ее потрясающими возможностями перевода больших языковых моделей, вы получите... возможно, лучший на сегодняшний день переводчик в режиме реального времени!
#Перевод #LiveCaptions #Translator #Windows #App #AiTranslate #AiПеревод #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - SakiRinn/LiveCaptions-Translator: Lightweight and powerful real-time audio/speech translation tool based on Windows LiveCaptions.
Lightweight and powerful real-time audio/speech translation tool based on Windows LiveCaptions. - SakiRinn/LiveCaptions-Translator
Fish Audio выпустили S2 — модель для синтеза речи, которая воспроизводит естественные эмоции. Всё открыто: можно запустить локально или протестировать бесплатно онлайн.
Работает просто: пишешь текст и вставляешь теги вроде [смеётся], [шёпот], [грустно], [удивлённо] — голос отыгрывает их как живой человек. Поддерживается больше 15 000 тегов. Модель обучена на 10+ миллионах часов аудио и понимает около 80 языков.
Для клонирования голоса хватит образца длиной до 30 секунд.
По тестам S2 обошла закрытые модели Google и OpenAI: в Audio Turing Test набрала 0.515 против 0.417 у Seed-TTS, а в EmergentTTS-Eval выиграла у GPT-4o-mini-TTS в 81.88% случаев.
Модель полностью открыта — доступны веса, код для дообучения и стриминговый движок на SGLang.
🔗 https://fish.audio/ru/s2/
https://github.com/fishaudio/fish-speech
https://huggingface.co/fishaudio/s2-pro
#FishAudioS2 #TTS #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
NVILA-HD-Video обрабатывает видео в 4K с тысячей кадров. Технология AutoGaze вырезает из ролика повторяющиеся фрагменты — это ускоряет работу в 19 раз для ViT и в 10 раз для LLM.
Часовое 4K-видео модель обработала за 3,2 секунды. Ближайший конкурент Nemotron Nano 12B v2 VL потратил на это 61 секунду.
Результаты: лидирует на бенчмарке HLVid и показывает хорошую производительность на VideoMME.
🔗 https://autogaze.github.io/
https://github.com/NVlabs/VILA/tree/main/vila_hd/nvila_hd_video
https://huggingface.co/nvidia/NVILA-8B-HD-Video
https://huggingface.co/spaces/bfshi/AutoGaze
#NVILA8BHDVideo #NVIDIA #AiVideo #AutoGaze #VideoMME #HLVid #AiModel #ModelAi #LocalAi #AiLocal
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM