Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
Большинство качественных - слишком медленные.
И почти ни одна не решает вопрос аутентичности аудио на уровне архитектуры.
Resemble AI закрыли все три проблемы сразу.
Chatterbox Turbo 0 это:
🟢 <150 мс до первого звука
🟢 Качество уровня SOTA - превосходит более крупные проприетарные модели
🟢 Естественные, программируемые эмоции и интонации
🟢 Zero-shot клонирование голоса всего по 5 секундам аудио
🟢 PerTh watermarking - проверяемое и аутентифицированное аудио
🟢 Полностью open source, никакой «чёрной магии»
Редкий пример, когда скорость, качество и безопасность не идут на компромисс, а работают вместе.
HuggingFace: https://huggingface.co/spaces/ResembleAI/chatterbox-turbo-demo
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Моделька на 309B параметров, из которых одновременно активны лишь 15B - за счёт умной MoE-маршрутизации модель достигает высокой эффективности. Сравнима с DeepSeek-V3.2 на общих бенчмарках.
MiMo-V2-Flash заточена под агентов и работу с инструментами.
🔥 Ключевые особенности
🏗️ Hybrid Attention
5:1 чередование 128-window SWA и Global Attention
Контекст — 256K токенов
🏆 Код и разработка
• SWE-Bench Verified - 73.4%
• SWE-Bench Multilingual - 71.7%
Новый SOTA среди open-source моделей
🚀 Скорость
• До 150 output tokens/sec
• Day-0 поддержка от @lmsysorg
MiMo-V2-Flash - пример того, как MoE-архитектуры выходят на новый уровень: быстрее, дешевле и готовые к агентным сценариям.
🤗 Model: http://hf.co/XiaomiMiMo/MiMo-V2-Flash
📝 Blog: http://mimo.xiaomi.com/blog/mimo-v2-flash
📄 Technical Report: http://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf
🎨 AI Studio: http://aistudio.xiaomimimo.com
#AI #LLM #MoE #OpenSource #AgenticAI #MachineLearning #DeepLearning #GenAI #SWEBench #Xiaomi #AIModels
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Новый день – новые модели: Nvidia выпустили прекрасную Nemotron 3 Nano
В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.
Контекст – 1 миллион токенов.
По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.
И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.
Nvidia умеют удивлять.
Веса (+датасеты!) | Статья | Блогпост
P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3
В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.
Контекст – 1 миллион токенов.
По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.
И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.
Nvidia умеют удивлять.
Веса (+датасеты!) | Статья | Блогпост
P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3
Forwarded from Мишин Лернинг
Media is too big
VIEW IN TELEGRAM
🔉 Meta SAM Audio: Segment Anything Model Audio
SAM Audio — это “Segment Anything”, но для звука: foundation-модель, которая выделяет любой целевой звук (separation) из микса по промпту (текстом) или по отдельным объектам из видео!
Что может модель:
— Аудио сепарация: целевой объект (человек, машина, инструмент) + все остальное (бэкграунд, шум, пространство, реверберация и эхо)
— Visual prompting: можно привязать звук к объекту на кадре (маской/объектом в видео) и отделять “звук этого объекта” от остальных.
— Span prompting: задаёшь временные якоря, где звук есть/нет и модель сама определяет “что именно считать целевым”.
💻 github + модель SAM Audio
👄 Есть демо: можно потыкать по этой ссылке
SAM Audio — это “Segment Anything”, но для звука: foundation-модель, которая выделяет любой целевой звук (separation) из микса по промпту (текстом) или по отдельным объектам из видео!
Что может модель:
— Аудио сепарация: целевой объект (человек, машина, инструмент) + все остальное (бэкграунд, шум, пространство, реверберация и эхо)
— Visual prompting: можно привязать звук к объекту на кадре (маской/объектом в видео) и отделять “звук этого объекта” от остальных.
— Span prompting: задаёшь временные якоря, где звук есть/нет и модель сама определяет “что именно считать целевым”.
💻 github + модель SAM Audio
👄 Есть демо: можно потыкать по этой ссылке
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Google запустила в публичное превью платформу Code Wiki. Инструмент сканирует репозиторий и генерирует живую базу знаний, которая перестраивается автоматически после каждого изменения в коде.
Под капотом -
Code Wiki умеет строить диаграммы архитектуры, объяснять логику работы модулей и мгновенно перенаправлять из вики к конкретным определениям функций.
Сейчас веб-версия работает с публичными репозиториями, но в планах - CLI-расширение для развертывания системы в закрытых корпоративных контурах.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Какое-то бесконечное количество новостей и новых моделей. Вот, например, еще для любителей 3D разразились моделями Microsoft и Apple. Тоже что-то пилят..
huggingface.co
microsoft/TRELLIS.2-4B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Machinelearning
🔍 Mistral представила OCR 3 - новую версию своей AI-системы распознавания документов.
Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию
Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.
- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.
- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.
https://mistral.ai/news/mistral-ocr-3
@ai_machinelearning_big_data
#ocr #mistal #llm
Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию
Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.
- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.
- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.
https://mistral.ai/news/mistral-ocr-3
@ai_machinelearning_big_data
#ocr #mistal #llm
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
OpenAI представила GPT-5.2-Codex, которую называет самым продвинутым инструментом для реальной программной инженерии на сегодняшний день. Модель получила нативную поддержку сжатия контекста, улучшенную интеграцию с терминалом Windows и способность проводить глубокий рефакторинг крупных репозиториев без потери логической нити.
Ключевой апдейт коснулся сферы безопасности - Codex резко прибавил способностей в анализе защищенности кода. Модель уже доступна платным пользователям ChatGPT, а API будет открыт в ближайшие недели.
openai.com
Компания Илона Маска открыла публичный доступ к Grok Voice Agent API — нативному интерфейсу speech-to-speech для создания голосовых ассистентов. Решение построено на полностью собственной архитектуре, что позволило достичь задержки ответа менее 1 секунды.
API поддерживает вызов внешних инструментов, веб-поиск, прямую интеграцию с телефонией через SIP и понимает более 100 языков. В бенчмарке Big Bench Audio модель заняла 1 место с точностью 92,3%, опередив Gemini 2.5 Flash и GPT Realtime.
Главной фишкой стала ценовая политика: единый тариф составляет $0.05 за минуту. Это значительно дешевле, чем у OpenAI и ElevenLabs.
x.ai
В VS Code Insiders появилась поддержка Agent Skills - открытого протокола, разработанного Anthropic. Технология позволяет упаковывать инструкции, скрипты и вспомогательные ресурсы в модули, которыми можно пользоваться в разных ИИ-инструментах.
Главное отличие Agent Skills от привычных кастомных инструкций в функциональности: это не текстовые гайдлайны по стилю кода, а полноценные наборы инструментов для автоматизации задач, которые подгружаются в контекст модели динамически и только при необходимости.
Стандарт дает кросс-платформенность: созданный один раз скилл будет работать одинаково как в интерфейсе редактора, так и в CLI-агентах.
code.visualstudio.com
T5Gemma 2 получила серьезные архитектурные изменения по сравнению с первой версией. Чтобы снизить потребление памяти, инженеры внедрили
tied word embeddings для энкодера и декодера, а также объединили механизмы self-attention и cross-attention в единый слой. Модели доступны в компактных конфигурациях на 270M, 1B и 4B параметров.Новинка поддерживает контекстное окно до 128 тыс. токенов и умеет обрабатывать не только текст на 140 языках, но и изображения. В бенчмарках T5Gemma 2 обошла базовую Gemma 3 в задачах на длинный контекст, кодинг и мультимодальное понимание. Модели доступны на Hugging Face и Kaggle для исследовательских целей.
blog.google
Perception Encoder Audiovisual (PE-AV) - техническое ядро, лежащее в основе SAM Audio. Это мультимодальная модель, которая объединяет аудио, видео и текст в единое пространство эмбеддингов.
PE-AV умеет извлекать векторы признаков из аудио или видеокадров и формировать совместные аудиовизуальные представления. Это повышает точность в задачах кросс-модального поиска, детекции звуков и глубокого понимания сцен, где важен синхронный контекст изображения и звука.
В открытом доступе - 6 чекпоинтов модели разного размера (от Small до Large) с вариациями по количеству обрабатываемых кадров. Код опубликован на GitHub, а веса - на Hugging Face.
huggingface.co
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Не лишним будет проверять свой код с использованием таких инструментов...
https://t.me/data_analysis_ml/4531
https://t.me/data_analysis_ml/4531
Telegram
Анализ данных (Data analysis)
⚡️ Shannon - полностью автономный AI-хакер для поиска реальных уязвимостей в веб-приложениях
Shannon - это автономная система для offensive security, которая сама ищет, воспроизводит и документирует реальные эксплойты в веб-приложениях без подсказок и ручного…
Shannon - это автономная система для offensive security, которая сама ищет, воспроизводит и документирует реальные эксплойты в веб-приложениях без подсказок и ручного…
Forwarded from эйай ньюз
Kandinsky 5.0 Video на text-to-video арене
На арене появились результаты моделей Kandinsky 5.0 Video Lite и Pro.
Pro-версия — ТОП-1 открытая модель в мире.
На общем фоне Pro-версия уступает SOTA-моделям от Google, OpenAI, Alibaba и KlingAI. Но можно говорить о паритете с Luma Ray 3 и Minimax Hailuo 2.3 (отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла). Lite-версия (2B параметров) оказалась лучше первой версии Sora.
Стоит отметить, что сам факт выхода российской генеративной модели на международную арену и её конкуренция с другими игроками — событие довольно редкое, я бы сказал, неожиданное.
По архитектуре это довольно немаленький (19B) DiT с кросс атеншеном на текст. При этом VAE на базе HunyuanVideo. Генерит в 24fps видео длиной 5 или 10 секунд В HD (1280x768)
Арена
Веса
GitHub
Техрепорт
@ai_newz
На арене появились результаты моделей Kandinsky 5.0 Video Lite и Pro.
Pro-версия — ТОП-1 открытая модель в мире.
На общем фоне Pro-версия уступает SOTA-моделям от Google, OpenAI, Alibaba и KlingAI. Но можно говорить о паритете с Luma Ray 3 и Minimax Hailuo 2.3 (отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла). Lite-версия (2B параметров) оказалась лучше первой версии Sora.
Стоит отметить, что сам факт выхода российской генеративной модели на международную арену и её конкуренция с другими игроками — событие довольно редкое, я бы сказал, неожиданное.
По архитектуре это довольно немаленький (19B) DiT с кросс атеншеном на текст. При этом VAE на базе HunyuanVideo. Генерит в 24fps видео длиной 5 или 10 секунд В HD (1280x768)
Арена
Веса
GitHub
Техрепорт
@ai_newz
Вот это реально правильная штука, скачал себе, установил, но как работает не успел проверить. Тема в том, что теперь Клод поможет с тем, чтобы настроить какие-то вещи в интерфейсах программ. Раньше надо было кидать ему скрины того, что не работает, а теперь он сможет посмотреть сам. Ну круто же!
Telegram
How2AI
🫡 Расширение хром для Claude и Claude Code!
Отличная новость, как мне кажется. Юзеры про подписки тепепрь могут раздавать контекст браузера нейронке – расширение позволяет Claude видеть, что происходит в браузере, кликать кнопки и заполнять формы от имени…
Отличная новость, как мне кажется. Юзеры про подписки тепепрь могут раздавать контекст браузера нейронке – расширение позволяет Claude видеть, что происходит в браузере, кликать кнопки и заполнять формы от имени…
Любопытная история, для тех, у кого есть автоматизация. Текущая проблема в том, что вызов tools у больших моделей жрет много токенов. Вместо этого берем микро-модель, зафайнтьюненную на конкретные tools. Звучит интересно, хотя танцев с бубном для такой реализации надо будет выше крыши..
https://t.me/mishin_learning/1869
https://t.me/mishin_learning/1869
Telegram
Мишин Лернинг
📲 Google выкатили FunctionGemma — function calling для edge
Google не перестает радовать. Пока все меряются “reasoning” сантиметрами, в Google сделали вещь, которая действительно важна: FunctionGemma — это Gemma 3 270M, но специально заточенная под генерацию…
Google не перестает радовать. Пока все меряются “reasoning” сантиметрами, в Google сделали вещь, которая действительно важна: FunctionGemma — это Gemma 3 270M, но специально заточенная под генерацию…
Давно не было новостей от Qwen, а тут такая любопытная моделька - разбивает картинку на отдельные слои. Прикольно, и может быть полезно, когда работаешь с генераторами изображений
GitHub
GitHub - QwenLM/Qwen-Image-Layered: Qwen-Image-Layered: Layered Decomposition for Inherent Editablity
Qwen-Image-Layered: Layered Decomposition for Inherent Editablity - QwenLM/Qwen-Image-Layered