Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
VoxCPM2 - крупное обновление открытой системы синтеза речи VoxCPM.
Модель обучена на более 2 млн. часов мультиязычных аудиоданных и поддерживает 30 языков, включая русский, китайский, английский, японский, корейский, арабский и хинди (плюс 9 диалектов китайского).
За проектом стоит OpenBMB, структура при Университете Цинхуа, объединяющая академическую лабораторию THUNLP и коммерческую компанию ModelBest.
THUNLP - одна из сильнейших академических групп по LLM в Азии, которой руководит легенда китайского NLP, профессор Maosong Sun.
OpenBMB известна сериями CPM, MiniCPM, AgentCPM и фреймворками BMTrain и OpenPrompt.
В отличие современных TTS-систем, VoxCPM2 работает напрямую с непрерывными представлениями в латентном пространстве AudioVAE V2.
Пайплайн состоит из 4 стадий: LocEnc, TSLM, RALM и LocDiT. На выходе - аудио с частотой 48 кГц студийного качества: асимметричная архитектура AudioVAE V2 принимает референс на 16 кГц и повышает разрешение без внешнего апсемплера.
Из версии 1.5 перешел режим Ultimate Cloning: если передать вместе с референсом его точный транскрипт, модель воспроизводит ритм, интонации и манеру речи.
На Seed-TTS-eval модель показывает WER 1.84% на английском и CER 0.97% на китайском при сходстве голоса (SIM) 75.3% и 79.5% соответственно.
На мультиязычном Minimax-MLS-test система лидирует по SIM в подавляющем большинстве из 24 языков, опережая Minimax, ElevenLabs, FishAudio S2 и Qwen3-TTS.
В задаче генерации голоса по описанию модель набирает лучшие баллы среди open-source решений на InstructTTSEval в английском языке.
Скорость инференса по соотношению времени, затраченного моделью на генерацию аудио к длительности самого аудио - около 0.3 на NVIDIA RTX 4090. На движке Nano-vLLM этот показатель снижается до 0.13 (подходит для стриминга в реальном времени).
Есть скрипты и гайд для SFT (добавления нового языка или домена) или LoRA для глубокой имитации конкретного спикера. LoRA потребует 5–10 минут аудио и 20 ГБ VRAM.
@ai_machinelearning_big_data
#AI #ML #TTS #VoxCPM2 #OpenBNB
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Китайская лаборатория релизнула GLM-5.1 - флагманскую MoE-модель с 754B параметров нового поколения, ориентированную на агентную инженерию.
Фокус релиза - на кодинг и долгие агентные сессии.
GLM-5.1 построена так, чтобы оставаться продуктивной на длинной дистанции: декомпозировать задачу, запускать эксперименты, читать результаты, находить блокеры и пересматривать стратегию.
Z ai утверждает, что модель устойчиво оптимизирует решение на протяжении сотен итераций и тысяч вызовов инструментов, то есть результат тем заметнее, чем дольше она запускают.
API доступен на платформе Z ai, веб-версия на chat.z.ai обещана в ближайшие дни. Веса опубликованы на Hugging Face под лицензией MIT.
Для локального развертывания уже готовы сборки под SGLang 0.5.10+, vLLM 0.19.0+, xLLM, KTransformers и свежую ветку Transformers.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Креативный совет
🔥У нас новый чемпион?
На арене Artificial Analysis появилась новая таинственная модель Happy Horse, которая уделывает Seedance 2 в генерации видео и из текста и из изображений...
Прикрепляю первые видео и ждем подробностей, пока видны явные проблемы с физикой, но шикарное качество
@creadvice
На арене Artificial Analysis появилась новая таинственная модель Happy Horse, которая уделывает Seedance 2 в генерации видео и из текста и из изображений...
Прикрепляю первые видео и ждем подробностей, пока видны явные проблемы с физикой, но шикарное качество
@creadvice
Показатели, конечно, - перебор, но то, что модельки для домашнего использования умнеют, это точно
https://t.me/data_analysis_ml/4954
https://t.me/data_analysis_ml/4954
Telegram
Анализ данных (Data analysis)
🚀 Представь: уровень рассуждений как у Claude 4.6 Opus, но полностью локально на твоей GPU с всего 16GB VRAM
Эта версия Qwen3.5 на 27B параметров, дистиллированная на reasoning-трейсах Claude 4.6 Opus, даёт уровень кодинга почти как у топовых моделей — но…
Эта версия Qwen3.5 на 27B параметров, дистиллированная на reasoning-трейсах Claude 4.6 Opus, даёт уровень кодинга почти как у топовых моделей — но…
Очень любопытный видосик для тех, кто запускает LLM на базовых mac mini. Думаю, что сам подход пригодится для моделей любого размера - было бы железо помощнее.
https://www.youtube.com/watch?v=XLlQDfhyBjc
https://www.youtube.com/watch?v=XLlQDfhyBjc
YouTube
After This, 16GB Feels Different
TurboQuant... the next big jump in local AI isn’t a faster chip, but a different kind of compression.
🛡️Go to https://surfshark.com/alexziskind or use code ALEXZISKIND at checkout to get 4 extra months of Surfshark VPN!
🛒 Gear Links 🛒
💻☕ Thunderbolt 5 external…
🛡️Go to https://surfshark.com/alexziskind or use code ALEXZISKIND at checkout to get 4 extra months of Surfshark VPN!
🛒 Gear Links 🛒
💻☕ Thunderbolt 5 external…
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
Сегодня Anthropic запустила в открытую бету Claude Managed Agents - хостируемый сервис для запуска долгоживущих агентов на инфраструктуре Claude Platform.
Если коротко: вы описываете задачи, инструменты и ограничения, а всё остальное берет на себя платформа.
Самое интересное спрятано в инженерном блоге, где команда описала архитектуру. Они пришли к ней через боль. Первая версия упаковывала всё в один контейнер: и сессию, и harness (цикл вызовов модели), и sandbox. Контейнер превращался в "питомца" - если он падал, сессия терялась. Дебажить можно было только через шелл внутри контейнера, а там лежали пользовательские данные. Когда клиенты хотели подключить свой VPC, им приходилось пирить сети.
Решение: декомпозиция на три интерфейса. Session - append-only лог всех событий, живущий отдельно от всего. Harness - stateless оркестратор, который при падении просто перезапускается, подтягивает лог через getSession(id) и продолжает с последнего события. Sandbox - среда исполнения, к которой harness обращается как к обычному инструменту через execute(name, input) → string. Каждый компонент стал "скотом", а не "питомцем" в классической инфраструктурной метафоре.
Отдельно стоит сказать про безопасность. В монолитной архитектуре prompt injection мог добраться до токенов, лежащих в том же контейнере. Теперь sandbox физически изолирован от credentials. Git-токены прошиваются в remote при инициализации, OAuth хранится в vault за прокси. Агент никогда не видит реальных ключей.
По перформансу результаты заметные: p50 TTFT (время до первого токена) упал на 60%, p95 - на 90 с лишним процентов. Контейнер теперь поднимается по требованию через tool call, а если задача не требует sandbox, инференс стартует сразу.
Архитектура поддерживает "many brains, many hands": один агент может управлять несколькими sandbox-ами, а несколько агентов могут передавать окружения друг другу. Сессия при этом выступает как объект контекста за пределами context window модели - harness может запрашивать срезы через getEvents(), трансформировать их и управлять cache hit rate.
Notion уже в закрытой альфе: команды делегируют задачи Claude прямо из рабочего пространства, десятки задач выполняются параллельно.
Философия проекта прямо проговаривается в блоге: это мета-harness. Anthropic намеренно не фиксирует конкретную реализацию оркестрации, потому что она устаревает с каждым поколением моделей. Они уже столкнулись с этим, когда "context anxiety" из Sonnet 4.5 исчез в Opus 4.5, а workaround превратился в мертвый код. Поэтому ставка на стабильные интерфейсы, за которыми реализация меняется свободно - ровно та же идея, что у POSIX: read() работает одинаково для диска из 70-х и современного SSD.
https://www.anthropic.com/engineering/managed-agents
Если коротко: вы описываете задачи, инструменты и ограничения, а всё остальное берет на себя платформа.
Самое интересное спрятано в инженерном блоге, где команда описала архитектуру. Они пришли к ней через боль. Первая версия упаковывала всё в один контейнер: и сессию, и harness (цикл вызовов модели), и sandbox. Контейнер превращался в "питомца" - если он падал, сессия терялась. Дебажить можно было только через шелл внутри контейнера, а там лежали пользовательские данные. Когда клиенты хотели подключить свой VPC, им приходилось пирить сети.
Решение: декомпозиция на три интерфейса. Session - append-only лог всех событий, живущий отдельно от всего. Harness - stateless оркестратор, который при падении просто перезапускается, подтягивает лог через getSession(id) и продолжает с последнего события. Sandbox - среда исполнения, к которой harness обращается как к обычному инструменту через execute(name, input) → string. Каждый компонент стал "скотом", а не "питомцем" в классической инфраструктурной метафоре.
Отдельно стоит сказать про безопасность. В монолитной архитектуре prompt injection мог добраться до токенов, лежащих в том же контейнере. Теперь sandbox физически изолирован от credentials. Git-токены прошиваются в remote при инициализации, OAuth хранится в vault за прокси. Агент никогда не видит реальных ключей.
По перформансу результаты заметные: p50 TTFT (время до первого токена) упал на 60%, p95 - на 90 с лишним процентов. Контейнер теперь поднимается по требованию через tool call, а если задача не требует sandbox, инференс стартует сразу.
Архитектура поддерживает "many brains, many hands": один агент может управлять несколькими sandbox-ами, а несколько агентов могут передавать окружения друг другу. Сессия при этом выступает как объект контекста за пределами context window модели - harness может запрашивать срезы через getEvents(), трансформировать их и управлять cache hit rate.
Notion уже в закрытой альфе: команды делегируют задачи Claude прямо из рабочего пространства, десятки задач выполняются параллельно.
Философия проекта прямо проговаривается в блоге: это мета-harness. Anthropic намеренно не фиксирует конкретную реализацию оркестрации, потому что она устаревает с каждым поколением моделей. Они уже столкнулись с этим, когда "context anxiety" из Sonnet 4.5 исчез в Opus 4.5, а workaround превратился в мертвый код. Поэтому ставка на стабильные интерфейсы, за которыми реализация меняется свободно - ровно та же идея, что у POSIX: read() работает одинаково для диска из 70-х и современного SSD.
https://www.anthropic.com/engineering/managed-agents
🔥2❤1
Unsloth выпустил ПО для локальной тренировки Gemma 4. Должно работать на минимальном мак мини
https://x.com/unslothai/status/2041513619339575762?s=46
https://x.com/unslothai/status/2041513619339575762?s=46
X (formerly Twitter)
Unsloth AI (@UnslothAI) on X
You can now fine-tune Gemma 4 with our free notebooks! 🔥
You just need 8GB VRAM to train Gemma 4 locally!
Unsloth trains Gemma4 1.5x faster with 50% less VRAM.
GitHub: https://t.co/aZWYAtakBP
Guide: https://t.co/NBwKoFH2lp
Gemma-4-E4B Colab: https://t.co/JjpCQgWEpL
You just need 8GB VRAM to train Gemma 4 locally!
Unsloth trains Gemma4 1.5x faster with 50% less VRAM.
GitHub: https://t.co/aZWYAtakBP
Guide: https://t.co/NBwKoFH2lp
Gemma-4-E4B Colab: https://t.co/JjpCQgWEpL
Полезное видео для владельцев iPhone - оплату эккаунта в России теперь сделать проблематично, но нет худа без добра - можно будет подключить приложения, недоступные у нас
YouTube
Как теперь оплачивать iCloud в России? | Пополнение Apple ID
В этом видео я поделюсь всеми способами, как пополнить баланс Apple ID в России, как оплачивать iCloud в России, как не текущий момент выгоднее и проще всего покупать приложения и подписки в App Store, как сменить регион на айфоне и какой выбрать, а также…
Вот надо бы попробовать. С появлением агентов с новыми программами стало разбираться проще, но это обещает другой уровень взаимодействия
https://t.me/denissexy/11360
https://t.me/denissexy/11360
Telegram
Denis Sexy IT 🤖
Очередное интересное применение мультимодальных LLM – небольшая штука которая живет в системе, и помогает учиться любому софту
Наконец-то я изучу Blender (нет)
Исходный код тут
Наконец-то я изучу Blender (нет)
Исходный код тут
Forwarded from Data Secrets
Традиционно начинаем день с обновлений Anthropic: на этот раз они выкатили Advisor Strategy
Это способ получить почти топовое качество без оплаты топовой модели. Вот как работает:
– Есть две модели: Executor (исполнитель, дешевая и быстрая модель, Sonnet) и Advisor (советник, дорогая и сильная модель, Opus).
– Исполнитель делает всю основную работу. Но когда сталкивается со сложным моментом, вызывает advisor, который подсказывает, что делать дальше.
– Все происходит внутри одного запроса и вмешательства юзера не требует.
На самом деле задач, которые требуют вмешательства сильной модели, не так много. Так что на практике такой подход выходит ощутимо дешевле Opus (примерно на 10-12%) с качеством сильно выше Sonnet. Например, относительно базового Sonnet на SWE bench метрика растет почти на 3 процентных пункта.
Полезная вещь
Это способ получить почти топовое качество без оплаты топовой модели. Вот как работает:
– Есть две модели: Executor (исполнитель, дешевая и быстрая модель, Sonnet) и Advisor (советник, дорогая и сильная модель, Opus).
– Исполнитель делает всю основную работу. Но когда сталкивается со сложным моментом, вызывает advisor, который подсказывает, что делать дальше.
– Все происходит внутри одного запроса и вмешательства юзера не требует.
На самом деле задач, которые требуют вмешательства сильной модели, не так много. Так что на практике такой подход выходит ощутимо дешевле Opus (примерно на 10-12%) с качеством сильно выше Sonnet. Например, относительно базового Sonnet на SWE bench метрика растет почти на 3 процентных пункта.
Полезная вещь
Сделать себе сайт несложно. Теперь будет легче сделать сайт красиво… Просто скармливаем нейронке образцы дизайна и свои пожелания
https://github.com/VoltAgent/awesome-design-md
https://github.com/VoltAgent/awesome-design-md
GitHub
GitHub - VoltAgent/awesome-design-md: A collection of DESIGN.md files analysis by popular brand design systems. Drop one into your…
A collection of DESIGN.md files analysis by popular brand design systems. Drop one into your project and let coding agents generate a matching UI. - VoltAgent/awesome-design-md
🔥1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
В Claude Code появилась команда
/ultraplan - она передает планирование из локального CLI в облачную сессию Claude Code on the web.Логика в том, что чтение кода и составление плана почти не зависят от локального окружения и спокойно уезжают в облако, тогда как реализация часто завязана на интерактивность и инструменты конкретной машины.
По расходу токенов и лимитам /ultraplan сопоставим с обычным plan mode (об этом отдельно уточнил инженер Anthropic Thariq в сети X).
Запустить можно 3 способами:
/ultraplan с промптом;Пока Claude разбирает репозиторий в облаке, терминал остается свободным, а статус-индикатор показывает одно из 3-х состояний: черновик пишется, требуется уточнение или план готов.
Готовый драфт открывается в браузере в отдельном review-интерфейсе. Каждая итерация порождает новую версию плана, и таких циклов может быть сколько угодно.
После согласования разработчик решает, где исполнять:
Функция доступна в режиме research preview всем, у кого подключен Claude Code на вебе, и требует CLI версии 2.1.91 или новее, но не работает поверх Amazon Bedrock, Google Vertex AI и Microsoft Foundry.
Активный Remote Control при запуске
/ultraplan отключается - оба инструмента делят один и тот же интерфейс и одновременно жить там не могут.@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM