very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Большинство быстрых text-to-speech моделей звучат роботизировано.

Большинство качественных - слишком медленные.
И почти ни одна не решает вопрос аутентичности аудио на уровне архитектуры.

Resemble AI закрыли все три проблемы сразу.

Chatterbox Turbo 0 это:

🟢 <150 мс до первого звука
🟢 Качество уровня SOTA - превосходит более крупные проприетарные модели
🟢 Естественные, программируемые эмоции и интонации
🟢 Zero-shot клонирование голоса всего по 5 секундам аудио
🟢 PerTh watermarking - проверяемое и аутентифицированное аудио
🟢 Полностью open source, никакой «чёрной магии»

Редкий пример, когда скорость, качество и безопасность не идут на компромисс, а работают вместе.

HuggingFace: https://huggingface.co/spaces/ResembleAI/chatterbox-turbo-demo
Please open Telegram to view this post
VIEW IN TELEGRAM
🧠 Xiaomi представила MiMo-V2-Flash - новую open-source MoE-модель с фокусом на максимальную скорость без потери качества.

Моделька на 309B параметров, из которых одновременно активны лишь 15B - за счёт умной MoE-маршрутизации модель достигает высокой эффективности. Сравнима с DeepSeek-V3.2 на общих бенчмарках.

MiMo-V2-Flash заточена под агентов и работу с инструментами.

🔥 Ключевые особенности

🏗️ Hybrid Attention
5:1 чередование 128-window SWA и Global Attention
Контекст — 256K токенов

🏆 Код и разработка
• SWE-Bench Verified - 73.4%
• SWE-Bench Multilingual - 71.7%
Новый SOTA среди open-source моделей

🚀 Скорость
• До 150 output tokens/sec
• Day-0 поддержка от @lmsysorg

MiMo-V2-Flash - пример того, как MoE-архитектуры выходят на новый уровень: быстрее, дешевле и готовые к агентным сценариям.

🤗 Model: http://hf.co/XiaomiMiMo/MiMo-V2-Flash
📝 Blog: http://mimo.xiaomi.com/blog/mimo-v2-flash
📄 Technical Report: http://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf
🎨 AI Studio
: http://aistudio.xiaomimimo.com

#AI #LLM #MoE #OpenSource #AgenticAI #MachineLearning #DeepLearning #GenAI #SWEBench #Xiaomi #AIModels
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Новый день – новые модели: Nvidia выпустили прекрасную Nemotron 3 Nano

В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.

Контекст – 1 миллион токенов.

По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.

И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.

Nvidia умеют удивлять.

Веса (+датасеты!) | Статья | Блогпост

P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3
Media is too big
VIEW IN TELEGRAM
🔉 Meta SAM Audio: Segment Anything Model Audio

SAM Audio — это “Segment Anything”, но для звука: foundation-модель, которая выделяет любой целевой звук (separation) из микса по промпту (текстом) или по отдельным объектам из видео!

Что может модель:

— Аудио сепарация: целевой объект (человек, машина, инструмент) + все остальное (бэкграунд, шум, пространство, реверберация и эхо)

— Visual prompting: можно привязать звук к объекту на кадре (маской/объектом в видео) и отделять “звук этого объекта” от остальных.

— Span prompting: задаёшь временные якоря, где звук есть/нет и модель сама определяет “что именно считать целевым”.

💻 github + модель SAM Audio
👄
Есть демо: можно потыкать по этой ссылке
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Google Code Wiki.

Google запустила в публичное превью платформу Code Wiki. Инструмент сканирует репозиторий и генерирует живую базу знаний, которая перестраивается автоматически после каждого изменения в коде.

Под капотом - естественно Gemini. Разработчики могут общаться с контекстно-зависимым чат-ботом, который понимает структуру конкретного проекта «от и до».

Code Wiki умеет строить диаграммы архитектуры, объяснять логику работы модулей и мгновенно перенаправлять из вики к конкретным определениям функций.

Сейчас веб-версия работает с публичными репозиториями, но в планах - CLI-расширение для развертывания системы в закрытых корпоративных контурах.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Какое-то бесконечное количество новостей и новых моделей. Вот, например, еще для любителей 3D разразились моделями Microsoft и Apple. Тоже что-то пилят..
Forwarded from Machinelearning
🔍 Mistral представила OCR 3 - новую версию своей AI-системы распознавания документов.

Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию

Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.

- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.

- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.


https://mistral.ai/news/mistral-ocr-3

@ai_machinelearning_big_data

#ocr #mistal #llm
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ GPT-5.2-Codex.

OpenAI представила GPT-5.2-Codex, которую называет самым продвинутым инструментом для реальной программной инженерии на сегодняшний день. Модель получила нативную поддержку сжатия контекста, улучшенную интеграцию с терминалом Windows и способность проводить глубокий рефакторинг крупных репозиториев без потери логической нити.

Ключевой апдейт коснулся сферы безопасности - Codex резко прибавил способностей в анализе защищенности кода. Модель уже доступна платным пользователям ChatGPT, а API будет открыт в ближайшие недели.
openai.com

✔️ xAI представила Grok Voice Agent API.

Компания Илона Маска открыла публичный доступ к Grok Voice Agent API — нативному интерфейсу speech-to-speech для создания голосовых ассистентов. Решение построено на полностью собственной архитектуре, что позволило достичь задержки ответа менее 1 секунды.

API поддерживает вызов внешних инструментов, веб-поиск, прямую интеграцию с телефонией через SIP и понимает более 100 языков. В бенчмарке Big Bench Audio модель заняла 1 место с точностью 92,3%, опередив Gemini 2.5 Flash и GPT Realtime.

Главной фишкой стала ценовая политика: единый тариф составляет $0.05 за минуту. Это значительно дешевле, чем у OpenAI и ElevenLabs.
x.ai

✔️ VS Code получил поддержку стандарта Agent Skills.

В VS Code Insiders появилась поддержка Agent Skills - открытого протокола, разработанного Anthropic. Технология позволяет упаковывать инструкции, скрипты и вспомогательные ресурсы в модули, которыми можно пользоваться в разных ИИ-инструментах.

Главное отличие Agent Skills от привычных кастомных инструкций в функциональности: это не текстовые гайдлайны по стилю кода, а полноценные наборы инструментов для автоматизации задач, которые подгружаются в контекст модели динамически и только при необходимости.

Стандарт дает кросс-платформенность: созданный один раз скилл будет работать одинаково как в интерфейсе редактора, так и в CLI-агентах.
code.visualstudio.com

✔️ Google выпустила T5Gemma 2.

T5Gemma 2 получила серьезные архитектурные изменения по сравнению с первой версией. Чтобы снизить потребление памяти, инженеры внедрили tied word embeddings для энкодера и декодера, а также объединили механизмы self-attention и cross-attention в единый слой. Модели доступны в компактных конфигурациях на 270M, 1B и 4B параметров.

Новинка поддерживает контекстное окно до 128 тыс. токенов и умеет обрабатывать не только текст на 140 языках, но и изображения. В бенчмарках T5Gemma 2 обошла базовую Gemma 3 в задачах на длинный контекст, кодинг и мультимодальное понимание. Модели доступны на Hugging Face и Kaggle для исследовательских целей.
blog.google

✔️ ИИ-подразделение Марка Цукерберга открыло аудио-визуальный энкодер PE-AV.

Perception Encoder Audiovisual (PE-AV) - техническое ядро, лежащее в основе SAM Audio. Это мультимодальная модель, которая объединяет аудио, видео и текст в единое пространство эмбеддингов.

PE-AV умеет извлекать векторы признаков из аудио или видеокадров и формировать совместные аудиовизуальные представления. Это повышает точность в задачах кросс-модального поиска, детекции звуков и глубокого понимания сцен, где важен синхронный контекст изображения и звука.

В открытом доступе - 6 чекпоинтов модели разного размера (от Small до Large) с вариациями по количеству обрабатываемых кадров. Код опубликован на GitHub, а веса - на Hugging Face.
huggingface.co


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Kandinsky 5.0 Video на text-to-video арене

На арене появились результаты моделей Kandinsky 5.0 Video Lite и Pro.

Pro-версия — ТОП-1 открытая модель в мире.

На общем фоне Pro-версия уступает SOTA-моделям от Google, OpenAI, Alibaba и KlingAI. Но можно говорить о паритете с Luma Ray 3 и Minimax Hailuo 2.3 (отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла). Lite-версия (2B параметров) оказалась лучше первой версии Sora.

Стоит отметить, что сам факт выхода российской генеративной модели на международную арену и её конкуренция с другими игроками — событие довольно редкое, я бы сказал, неожиданное.

По архитектуре это довольно немаленький (19B) DiT с кросс атеншеном на текст. При этом VAE на базе HunyuanVideo. Генерит в 24fps видео длиной 5 или 10 секунд В HD (1280x768)

Арена
Веса
GitHub
Техрепорт

@ai_newz
Вот это реально правильная штука, скачал себе, установил, но как работает не успел проверить. Тема в том, что теперь Клод поможет с тем, чтобы настроить какие-то вещи в интерфейсах программ. Раньше надо было кидать ему скрины того, что не работает, а теперь он сможет посмотреть сам. Ну круто же!
Любопытная история, для тех, у кого есть автоматизация. Текущая проблема в том, что вызов tools у больших моделей жрет много токенов. Вместо этого берем микро-модель, зафайнтьюненную на конкретные tools. Звучит интересно, хотя танцев с бубном для такой реализации надо будет выше крыши..

https://t.me/mishin_learning/1869
Давно не было новостей от Qwen, а тут такая любопытная моделька - разбивает картинку на отдельные слои. Прикольно, и может быть полезно, когда работаешь с генераторами изображений