very vibe coding
122 subscribers
463 photos
126 videos
13 files
996 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
🎙️🚀 Qwen3-ASR и Qwen3-ForcedAligner- open source ASR модели

Мощный, стриминговый speech AI продакшн-уровня для 52 языков и диалектов.

ASR-1.7B - флагманская open-source модель распознавания речи. По качеству конкурирует с очень сильными решениями и обходит многие популярные open-модели прошлого поколения.

ASR-0.6B - компактная и очень быстрая версия.Cтавка на эффективность и низкую задержку, подходит для real-time сценариев.

ForcedAligner-0.6B - модель для точного сопоставления текста и аудио. Дает аккуратные таймкоды на уровне слов и фраз для 11 языков.

Целый открытый стек для разработчиков. Все это можно встраивать в свои системы без закрытых зависимостей.

Лицензия Apache 2.0 - можно использовать в коммерческих продуктах.

GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
Blog: https://qwen.ai/blog?id=qwen3asr
Paper: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
Очень любопытная библиотека для маков по работе с голосовыми моделями - тоже в моем списке того, что надо ставить и использовать. Все-таки говорящая нейронка - это, как минимум, прикольно
Встретил сегодня прикольный подход. Запуск агентов в ночную смену - это то, что делают уже многие, и то, к чему я только подхожу.

Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.

Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Tencent YouTu Research открыли Youtu-VL-4B-Instruct*- компактную VLM, которая серьёзно прокачивает визуальное понимание через подход VLUAS 👁️⚡

Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.

🌟 Что здесь особенно выделяется

✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.

✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).

✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.

✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.

🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.

Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.

🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF

📄 Статья
https://modelscope.cn/papers/2601.19798
😳 Новая лучшая модель для анимации?

Выходит Vidu Q3, модель, которая гордо занимает второе место на арене txt2vid

До 16 секунд видео+аудио генерации в 1080, шикарная консистентность и рендеринг текста

Помимо q3 компания так же обновила агента, добавила Q2 Reference-to-Video Pro и создала библиотеку референсов Reference Hub 2.0

@creadvice | Наш курс по ИИ Видео
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Вот с этим не поспоришь, исходя из того, как я использую агентов, я и пишу так, чтобы программы были удобны не людям, а агентам других людей. Скоро можно будет продавать только так
🔥1
🔥 Новый релиз от Stepfun - Step-3.5-Flash.

По сообщениям, модель обходит DeepSeek v3.2 на ряде бенчмарков, при этом она заметно компактнее по параметрам:

Step-3.5-Flash: 196B всего / 11B активных
DeepSeek v3.2: 671B всего / 37B активных

Почему это важно:
если при меньшем размере и меньшем числе активных параметров на токен модель держит или превосходит качество - это значит дешевле инференс, проще масштабирование и больше шансов увидеть такие модели в реальных продуктах.

Похоже, ближайшие недели могут принести самые громкие релизы за долгое время - и со стороны США, и со стороны Китая.

https://github.com/vllm-project/vllm/pull/33523
Forwarded from Data Secrets
Media is too big
VIEW IN TELEGRAM
OpenAI выпустили приложение Codex

Довольно симпатичная обертка вокруг CLI агента с дополнительными фичами. Главное: агенты теперь могут работать в нескольких отдельных потоках. Есть поддержка worktrees для параллельного тестирования без конфликтов.

Есть готовые расширения для инструментов: Figma, Linear, Vercel, GPT Image, Jupyter Notebooks и тд (ищите тут). Можно также дописывать собственные скиллы.

Еще из интересного – возможность планировать автоматизации, то есть ставить фоновые задачки по расписанию (например, CI-проверки).

Для Free и Go дали временную возможность попробовать, остальным удвоили лимиты.

Скачать для MacOS можно тут: openai.com/codex/
Ну что, ждем сегодня Sonnet 5? Было бы круто

Честно говоря, еще очень жду DeepSeek 4 - очень любопытно, что придумали в этот раз эти творческие китайские ребята
Обновленный Qwen для кодинга с очень серьезными возможностями, который можно запустить на маке с 64гб памяти.. (не забывайте, что кроме места на модель еще нужно место на контекст, на и операционка ест 6гб)