Forwarded from Machinelearning
Пока индустрия одержима гигантоманией и соревнуется, у кого больше параметров, Stepfun решили пойти против течения.
Встречайте, Step3-VL-10B - компактная VL-модель, которая по заявлениям разработчиков не просто конкурирует, а буквально уделывает модели в 10–20 раз тяжелее, включая таких титанов, как Gemini 2.5 Pro и GLM-4.6V.
Звучит как маркетинговый хайп, но под капотом есть интересные инженерные решения, хоть и с хитринкой.
Конструкция из кастомного визуального PE-lang энкодера на 1.8B параметров и Qwen3-8B (что уже половина успеха, учитывая мощь Qwen) в качестве декодера.
В отличие от многих, кто замораживает визуальную часть, Stepfun разморозили все и тренировали модель в один прогон на 1,2 трлн. токенов. Это позволило визуальной и языковой частям модели не просто сосуществовать, а реально срастись и притереться друг к другу.
После этого модель прогнали через адский RL-цикл (RLVR+RLHF) на 1400+ итераций, чтобы модель научилась жестко ризонить.
В бенчмарках цифры действительно страшные (в хорошем смысле) для такого размера:
Для сравнения: GLM-4.6V на 106B выдает на MMMU только 75.20.
Инженерная хитринка кроется в методологии тестирования. Видите в результатах тестов пометку PaCoRe?
PaCoRe (Parallel Coordinated Reasoning):
Чтобы получить топовые цифры, модель использует test-time compute. Она запускает 16 параллельных роллаутов, собирает доказательства из разных веток и синтезирует ответ.
На инференсе это будет стоить вам в 16 раз "дороже" по ресурсам, чем обычный прогон. В стандартном режиме (SeRe) модель все еще хороша, но уже не выглядит как "убийца всех топов".
Кстати, Stepfun честно признались, что в отчетах накосячили с бенчмарками конкурента Qwen3VL-8B из-за неверного
max_tokens. Извинились, обещают пересчитать. Это добавляет доверия, но напоминает, что бенчмарки - дело тонкое.В общем, модель - отличный кандидат для локального использования: есть OpenAI-compatible API и vLLM поддерживается (PR вмержили).
⚠️ Если модель зацикливается при генерации - обновите конфиг, там был баг с
eos_token_id, который уже пофиксили.@ai_machinelearning_big_data
#AI #ML #VLM #STEP3 #StepFunAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
🎙️🚀 Qwen3-ASR и Qwen3-ForcedAligner- open source ASR модели
Мощный, стриминговый speech AI продакшн-уровня для 52 языков и диалектов.
ASR-1.7B - флагманская open-source модель распознавания речи. По качеству конкурирует с очень сильными решениями и обходит многие популярные open-модели прошлого поколения.
ASR-0.6B - компактная и очень быстрая версия.Cтавка на эффективность и низкую задержку, подходит для real-time сценариев.
ForcedAligner-0.6B - модель для точного сопоставления текста и аудио. Дает аккуратные таймкоды на уровне слов и фраз для 11 языков.
Целый открытый стек для разработчиков. Все это можно встраивать в свои системы без закрытых зависимостей.
Лицензия Apache 2.0 - можно использовать в коммерческих продуктах.
GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
Blog: https://qwen.ai/blog?id=qwen3asr
Paper: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
Мощный, стриминговый speech AI продакшн-уровня для 52 языков и диалектов.
ASR-1.7B - флагманская open-source модель распознавания речи. По качеству конкурирует с очень сильными решениями и обходит многие популярные open-модели прошлого поколения.
ASR-0.6B - компактная и очень быстрая версия.Cтавка на эффективность и низкую задержку, подходит для real-time сценариев.
ForcedAligner-0.6B - модель для точного сопоставления текста и аудио. Дает аккуратные таймкоды на уровне слов и фраз для 11 языков.
Целый открытый стек для разработчиков. Все это можно встраивать в свои системы без закрытых зависимостей.
Лицензия Apache 2.0 - можно использовать в коммерческих продуктах.
GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
Blog: https://qwen.ai/blog?id=qwen3asr
Paper: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
Большое обновление в топовом репозитории по распознаванию документов. Можно ставить на локальных машинах - обязательно попробую
X (formerly Twitter)
PaddlePaddle (@PaddlePaddle) on X
🚀PaddleOCR-VL-1.5 is here!— A New SOTA for Document Parsing!
🔍 94.5% accuracy on OmniDocBench v1.5 with just 0.9B parameters, outperforming leading general-purpose LLMs and document-specific models under standardized benchmarks.
📐 Irregular-shaped localization…
🔍 94.5% accuracy on OmniDocBench v1.5 with just 0.9B parameters, outperforming leading general-purpose LLMs and document-specific models under standardized benchmarks.
📐 Irregular-shaped localization…
Очень любопытная библиотека для маков по работе с голосовыми моделями - тоже в моем списке того, что надо ставить и использовать. Все-таки говорящая нейронка - это, как минимум, прикольно
X (formerly Twitter)
Prince Canuma (@Prince_Canuma) on X
🔊mlx-audio v0.3.1 is out
New models 🤖
> Qwen3-ASR & ForceAligner by @Alibaba_Qwen
What's new ✨
> Qwen3-TTS streaming + optimized memory usage
> Fixed Qwen3-TTS 0.6B CustomVoice models producing silence
> Server improvements in API for STT and TTS
> Poetry…
New models 🤖
> Qwen3-ASR & ForceAligner by @Alibaba_Qwen
What's new ✨
> Qwen3-TTS streaming + optimized memory usage
> Fixed Qwen3-TTS 0.6B CustomVoice models producing silence
> Server improvements in API for STT and TTS
> Poetry…
Встретил сегодня прикольный подход. Запуск агентов в ночную смену - это то, что делают уже многие, и то, к чему я только подхожу.
Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.
Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.
Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Forwarded from Machine learning Interview
Tencent YouTu Research открыли Youtu-VL-4B-Instruct*- компактную VLM, которая серьёзно прокачивает визуальное понимание через подход VLUAS 👁️⚡
Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.
🌟 Что здесь особенно выделяется
✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.
✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).
✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.
✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.
🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.
Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.
🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF
📄 Статья
https://modelscope.cn/papers/2601.19798
Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.
🌟 Что здесь особенно выделяется
✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.
✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).
✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.
✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.
🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.
Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.
🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF
📄 Статья
https://modelscope.cn/papers/2601.19798
Вот так и начинается искусственный интеллект. С соцсетей для нейронок..
https://t.me/llm_under_hood/742
https://t.me/llm_under_hood/742
Telegram
LLM под капотом
Про MoltBook я обязан написать, ибо это забористая и интересная штука
Итак, есть MoltBot/ClawdBot (писал тут) - это агент, который ставится очень просто и подключается ко всему подряд. Особенно хорошо он встает на Маках, т.к. автор - разработчик под Mac…
Итак, есть MoltBot/ClawdBot (писал тут) - это агент, который ставится очень просто и подключается ко всему подряд. Особенно хорошо он встает на Маках, т.к. автор - разработчик под Mac…
😱1👀1
Forwarded from Креативный совет
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Выходит Vidu Q3, модель, которая гордо занимает второе место на арене txt2vid
До 16 секунд видео+аудио генерации в 1080, шикарная консистентность и рендеринг текста
Помимо q3 компания так же обновила агента, добавила Q2 Reference-to-Video Pro и создала библиотеку референсов Reference Hub 2.0
@creadvice | Наш курс по ИИ Видео
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Вот с этим не поспоришь, исходя из того, как я использую агентов, я и пишу так, чтобы программы были удобны не людям, а агентам других людей. Скоро можно будет продавать только так
Telegram
Dealer.AI
The Companies That Already Get It (Компании, которые уже поняли)
Дядя прозорлив, вот оказывается уже есть об этом статья. Новость из hacker news. 💅📦
ТЛДР.
Автор вводит термин B2CC — Business-to-(AI)-Customer-Customer — и утверждает, что в 2026 г. рынок…
Дядя прозорлив, вот оказывается уже есть об этом статья. Новость из hacker news. 💅📦
ТЛДР.
Автор вводит термин B2CC — Business-to-(AI)-Customer-Customer — и утверждает, что в 2026 г. рынок…
🔥1
Forwarded from Анализ данных (Data analysis)
🔥 Новый релиз от Stepfun - Step-3.5-Flash.
По сообщениям, модель обходит DeepSeek v3.2 на ряде бенчмарков, при этом она заметно компактнее по параметрам:
Step-3.5-Flash: 196B всего / 11B активных
DeepSeek v3.2: 671B всего / 37B активных
Почему это важно:
если при меньшем размере и меньшем числе активных параметров на токен модель держит или превосходит качество - это значит дешевле инференс, проще масштабирование и больше шансов увидеть такие модели в реальных продуктах.
Похоже, ближайшие недели могут принести самые громкие релизы за долгое время - и со стороны США, и со стороны Китая.
https://github.com/vllm-project/vllm/pull/33523
По сообщениям, модель обходит DeepSeek v3.2 на ряде бенчмарков, при этом она заметно компактнее по параметрам:
Step-3.5-Flash: 196B всего / 11B активных
DeepSeek v3.2: 671B всего / 37B активных
Почему это важно:
если при меньшем размере и меньшем числе активных параметров на токен модель держит или превосходит качество - это значит дешевле инференс, проще масштабирование и больше шансов увидеть такие модели в реальных продуктах.
Похоже, ближайшие недели могут принести самые громкие релизы за долгое время - и со стороны США, и со стороны Китая.
https://github.com/vllm-project/vllm/pull/33523
Forwarded from Data Secrets
Media is too big
VIEW IN TELEGRAM
OpenAI выпустили приложение Codex
Довольно симпатичная обертка вокруг CLI агента с дополнительными фичами. Главное: агенты теперь могут работать в нескольких отдельных потоках. Есть поддержка worktrees для параллельного тестирования без конфликтов.
Есть готовые расширения для инструментов: Figma, Linear, Vercel, GPT Image, Jupyter Notebooks и тд (ищите тут). Можно также дописывать собственные скиллы.
Еще из интересного – возможность планировать автоматизации, то есть ставить фоновые задачки по расписанию (например, CI-проверки).
Для Free и Go дали временную возможность попробовать, остальным удвоили лимиты.
Скачать для MacOS можно тут: openai.com/codex/
Довольно симпатичная обертка вокруг CLI агента с дополнительными фичами. Главное: агенты теперь могут работать в нескольких отдельных потоках. Есть поддержка worktrees для параллельного тестирования без конфликтов.
Есть готовые расширения для инструментов: Figma, Linear, Vercel, GPT Image, Jupyter Notebooks и тд (ищите тут). Можно также дописывать собственные скиллы.
Еще из интересного – возможность планировать автоматизации, то есть ставить фоновые задачки по расписанию (например, CI-проверки).
Для Free и Go дали временную возможность попробовать, остальным удвоили лимиты.
Скачать для MacOS можно тут: openai.com/codex/