Большое обновление в топовом репозитории по распознаванию документов. Можно ставить на локальных машинах - обязательно попробую
X (formerly Twitter)
PaddlePaddle (@PaddlePaddle) on X
🚀PaddleOCR-VL-1.5 is here!— A New SOTA for Document Parsing!
🔍 94.5% accuracy on OmniDocBench v1.5 with just 0.9B parameters, outperforming leading general-purpose LLMs and document-specific models under standardized benchmarks.
📐 Irregular-shaped localization…
🔍 94.5% accuracy on OmniDocBench v1.5 with just 0.9B parameters, outperforming leading general-purpose LLMs and document-specific models under standardized benchmarks.
📐 Irregular-shaped localization…
Очень любопытная библиотека для маков по работе с голосовыми моделями - тоже в моем списке того, что надо ставить и использовать. Все-таки говорящая нейронка - это, как минимум, прикольно
X (formerly Twitter)
Prince Canuma (@Prince_Canuma) on X
🔊mlx-audio v0.3.1 is out
New models 🤖
> Qwen3-ASR & ForceAligner by @Alibaba_Qwen
What's new ✨
> Qwen3-TTS streaming + optimized memory usage
> Fixed Qwen3-TTS 0.6B CustomVoice models producing silence
> Server improvements in API for STT and TTS
> Poetry…
New models 🤖
> Qwen3-ASR & ForceAligner by @Alibaba_Qwen
What's new ✨
> Qwen3-TTS streaming + optimized memory usage
> Fixed Qwen3-TTS 0.6B CustomVoice models producing silence
> Server improvements in API for STT and TTS
> Poetry…
Встретил сегодня прикольный подход. Запуск агентов в ночную смену - это то, что делают уже многие, и то, к чему я только подхожу.
Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.
Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Но тут один товарищ рассказывает, как его агенты собирают информацию за день, смотрят на изменения, актуализируют документацию, промпты. Накапливают знания.
Это очень логично, постоянно сталкиваюсь с тем, что мои репозитории не самые свежие, а системные промпты устарели. Особенно, когда используешь несколько разных компьютеров
Forwarded from Machine learning Interview
Tencent YouTu Research открыли Youtu-VL-4B-Instruct*- компактную VLM, которая серьёзно прокачивает визуальное понимание через подход VLUAS 👁️⚡
Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.
🌟 Что здесь особенно выделяется
✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.
✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).
✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.
✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.
🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.
Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.
🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF
📄 Статья
https://modelscope.cn/papers/2601.19798
Это не просто “ещё одна vision-модель”, а попытка объединить кучу задач в одной архитектуре без зоопарка отдельных голов.
🌟 Что здесь особенно выделяется
✅ All-in-One Vision
SOTA-уровень в детекции объектов, сегментации, оценке глубины и поз — без task-specific голов под каждую задачу.
✅ OCR и мультимодальное рассуждение
Сильная в сложном разборе документов и задачах, где нужно одновременно видеть и “думать” (например, математика по изображениям).
✅ Готовность к GUI-агентам
Оптимизирована под понимание окружающей среды и навигацию по интерфейсам — важная часть будущих AI-агентов.
✅ Эффективность
Всего 4B параметров — хорошо подходит для edge-деплоя и быстрого инференса.
🔧 По результатам
Модель обгоняет многие более крупные системы на OmniDocBench и vision-centric задачах, оставаясь при этом компактной.
Это интересный шаг к универсальным vision-моделям, которые могут стать базой для агентов, работающих с экранами, документами и реальным миром.
🔗 Модель
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct
https://modelscope.cn/models/Tencent-YouTu-Research/Youtu-VL-4B-Instruct-GGUF
📄 Статья
https://modelscope.cn/papers/2601.19798
Вот так и начинается искусственный интеллект. С соцсетей для нейронок..
https://t.me/llm_under_hood/742
https://t.me/llm_under_hood/742
Telegram
LLM под капотом
Про MoltBook я обязан написать, ибо это забористая и интересная штука
Итак, есть MoltBot/ClawdBot (писал тут) - это агент, который ставится очень просто и подключается ко всему подряд. Особенно хорошо он встает на Маках, т.к. автор - разработчик под Mac…
Итак, есть MoltBot/ClawdBot (писал тут) - это агент, который ставится очень просто и подключается ко всему подряд. Особенно хорошо он встает на Маках, т.к. автор - разработчик под Mac…
😱1👀1
Forwarded from Креативный совет
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Выходит Vidu Q3, модель, которая гордо занимает второе место на арене txt2vid
До 16 секунд видео+аудио генерации в 1080, шикарная консистентность и рендеринг текста
Помимо q3 компания так же обновила агента, добавила Q2 Reference-to-Video Pro и создала библиотеку референсов Reference Hub 2.0
@creadvice | Наш курс по ИИ Видео
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Вот с этим не поспоришь, исходя из того, как я использую агентов, я и пишу так, чтобы программы были удобны не людям, а агентам других людей. Скоро можно будет продавать только так
Telegram
Dealer.AI
The Companies That Already Get It (Компании, которые уже поняли)
Дядя прозорлив, вот оказывается уже есть об этом статья. Новость из hacker news. 💅📦
ТЛДР.
Автор вводит термин B2CC — Business-to-(AI)-Customer-Customer — и утверждает, что в 2026 г. рынок…
Дядя прозорлив, вот оказывается уже есть об этом статья. Новость из hacker news. 💅📦
ТЛДР.
Автор вводит термин B2CC — Business-to-(AI)-Customer-Customer — и утверждает, что в 2026 г. рынок…
🔥1
Forwarded from Анализ данных (Data analysis)
🔥 Новый релиз от Stepfun - Step-3.5-Flash.
По сообщениям, модель обходит DeepSeek v3.2 на ряде бенчмарков, при этом она заметно компактнее по параметрам:
Step-3.5-Flash: 196B всего / 11B активных
DeepSeek v3.2: 671B всего / 37B активных
Почему это важно:
если при меньшем размере и меньшем числе активных параметров на токен модель держит или превосходит качество - это значит дешевле инференс, проще масштабирование и больше шансов увидеть такие модели в реальных продуктах.
Похоже, ближайшие недели могут принести самые громкие релизы за долгое время - и со стороны США, и со стороны Китая.
https://github.com/vllm-project/vllm/pull/33523
По сообщениям, модель обходит DeepSeek v3.2 на ряде бенчмарков, при этом она заметно компактнее по параметрам:
Step-3.5-Flash: 196B всего / 11B активных
DeepSeek v3.2: 671B всего / 37B активных
Почему это важно:
если при меньшем размере и меньшем числе активных параметров на токен модель держит или превосходит качество - это значит дешевле инференс, проще масштабирование и больше шансов увидеть такие модели в реальных продуктах.
Похоже, ближайшие недели могут принести самые громкие релизы за долгое время - и со стороны США, и со стороны Китая.
https://github.com/vllm-project/vllm/pull/33523
Forwarded from Data Secrets
Media is too big
VIEW IN TELEGRAM
OpenAI выпустили приложение Codex
Довольно симпатичная обертка вокруг CLI агента с дополнительными фичами. Главное: агенты теперь могут работать в нескольких отдельных потоках. Есть поддержка worktrees для параллельного тестирования без конфликтов.
Есть готовые расширения для инструментов: Figma, Linear, Vercel, GPT Image, Jupyter Notebooks и тд (ищите тут). Можно также дописывать собственные скиллы.
Еще из интересного – возможность планировать автоматизации, то есть ставить фоновые задачки по расписанию (например, CI-проверки).
Для Free и Go дали временную возможность попробовать, остальным удвоили лимиты.
Скачать для MacOS можно тут: openai.com/codex/
Довольно симпатичная обертка вокруг CLI агента с дополнительными фичами. Главное: агенты теперь могут работать в нескольких отдельных потоках. Есть поддержка worktrees для параллельного тестирования без конфликтов.
Есть готовые расширения для инструментов: Figma, Linear, Vercel, GPT Image, Jupyter Notebooks и тд (ищите тут). Можно также дописывать собственные скиллы.
Еще из интересного – возможность планировать автоматизации, то есть ставить фоновые задачки по расписанию (например, CI-проверки).
Для Free и Go дали временную возможность попробовать, остальным удвоили лимиты.
Скачать для MacOS можно тут: openai.com/codex/
OpenAI дала доступ к своему агенту, которого используют для разработки внутри. Любопытно
OpenAI
Внутренний агент данных OpenAI
Как OpenAI создала внутреннего ИИ-агента, использующего GPT-5, Codex и память для анализа огромных наборов данных и предоставления надежных выводов за считанные минуты.
Ну что, ждем сегодня Sonnet 5? Было бы круто
Честно говоря, еще очень жду DeepSeek 4 - очень любопытно, что придумали в этот раз эти творческие китайские ребята
Честно говоря, еще очень жду DeepSeek 4 - очень любопытно, что придумали в этот раз эти творческие китайские ребята
Не могу оставаться равнодушным к теме распознавания документов - это база, которая необходима. Новая моделька подоспела
https://t.me/data_analysis_ml/4671
https://t.me/data_analysis_ml/4671
Telegram
Анализ данных (Data analysis)
⚡️ GLM-OCR 0.9B - мощный OCR для сложных документов
Модель показывает SOTA-результаты в задачах понимания документов, оставаясь компактной и быстрой.
Она справляется там, где обычный OCR ломается:
- распознавание формул
- извлечение таблиц
- структурированное…
Модель показывает SOTA-результаты в задачах понимания документов, оставаясь компактной и быстрой.
Она справляется там, где обычный OCR ломается:
- распознавание формул
- извлечение таблиц
- структурированное…
Обновленный Qwen для кодинга с очень серьезными возможностями, который можно запустить на маке с 64гб памяти.. (не забывайте, что кроме места на модель еще нужно место на контекст, на и операционка ест 6гб)
X (formerly Twitter)
Unsloth AI (@UnslothAI) on X
@Alibaba_Qwen Thank you so much for releasing an open-source LLM for fast and smart coding! 🥰
We made GGUFs so you can run Qwen3-Coder-Next locally on 46GB RAM or less: https://t.co/J6Eb8c1nKO
We made GGUFs so you can run Qwen3-Coder-Next locally on 46GB RAM or less: https://t.co/J6Eb8c1nKO
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Kling 3.0, Omni 3.0 и Image 3.0
В теории это значит, что теперь Kling безоговорочная SOTA — он и так составлял достойную конкуренцию Veo 3.1, обладая более широким функционалом и разрешением 1080p (не только через API). O1 была не самой лучшей в плане качества, но уже мультимодальной, а теперь на вход генерации можно подавать голос и даже видео в качестве элементов. Вдобавок они выкатили еще и Kling Image 3.0. Судя по успеху motion control, новое поколение моделей должно быть крайне удачным.
Черипики у Klinga ну просто какие-то божественные, в слепом тесте я бы никогда не отличил от реальных футажей. Но это черипики, а у них они всегда были хорошие.
Генерации теперь до 15 секунд (было 10) с выбором длительности шота с шагом в 1 секунду. Появился Multi-shot как в Sora 2, прикрутили нативный звук в OMNI модель и обновили Elements 3.0. Вроде как улучшили и текст, хотя не помню, чтобы с этим были проблемы.
А вот редактирования видео я пока не увидел, его можно подавать как элемент, причём генератор будет референсить движение в кадре, в том числе мимику актера. Кстати, про русский язык в анонсе не написано, интересно, будет ли поддержка.
И всё-таки я всё ещё не фанат элементов, какие бы крутые они ни были — сгенерировать начальный кадр сейчас гораздо проще и даёт больше контроля, а видос по-прежнему генерить дорого, и я сомневаюсь, что результат будет лучше чем у бананы. В этом плане обновление Kling Image 3.0 звучит гораздо интереснее. Там, как всегда, всё стало лучше, а из новых фич добавилась генерация сторибордов, где по одному промпту генерится серия последовательных во времени кадров. NanoBanana тоже таким хвалилась, но что-то, видимо, у них не задалось, не видел, чтобы эта фича нашла применение, так ещё и гугл во всю режут лимиты и косты на компьют.
Новая версия доступна на плане Ultra, на других должно быть скоро.
Ну что, догнали Kling флагмана от гугл, как думаете? Буржуа с подпиской ультра, прошу, скидывайте тесты в комментарии!
Анонс видео
Анонс картинок
Kling 2.6
@ai_newz
В теории это значит, что теперь Kling безоговорочная SOTA — он и так составлял достойную конкуренцию Veo 3.1, обладая более широким функционалом и разрешением 1080p (не только через API). O1 была не самой лучшей в плане качества, но уже мультимодальной, а теперь на вход генерации можно подавать голос и даже видео в качестве элементов. Вдобавок они выкатили еще и Kling Image 3.0. Судя по успеху motion control, новое поколение моделей должно быть крайне удачным.
Черипики у Klinga ну просто какие-то божественные, в слепом тесте я бы никогда не отличил от реальных футажей. Но это черипики, а у них они всегда были хорошие.
Генерации теперь до 15 секунд (было 10) с выбором длительности шота с шагом в 1 секунду. Появился Multi-shot как в Sora 2, прикрутили нативный звук в OMNI модель и обновили Elements 3.0. Вроде как улучшили и текст, хотя не помню, чтобы с этим были проблемы.
А вот редактирования видео я пока не увидел, его можно подавать как элемент, причём генератор будет референсить движение в кадре, в том числе мимику актера. Кстати, про русский язык в анонсе не написано, интересно, будет ли поддержка.
И всё-таки я всё ещё не фанат элементов, какие бы крутые они ни были — сгенерировать начальный кадр сейчас гораздо проще и даёт больше контроля, а видос по-прежнему генерить дорого, и я сомневаюсь, что результат будет лучше чем у бананы. В этом плане обновление Kling Image 3.0 звучит гораздо интереснее. Там, как всегда, всё стало лучше, а из новых фич добавилась генерация сторибордов, где по одному промпту генерится серия последовательных во времени кадров. NanoBanana тоже таким хвалилась, но что-то, видимо, у них не задалось, не видел, чтобы эта фича нашла применение, так ещё и гугл во всю режут лимиты и косты на компьют.
Новая версия доступна на плане Ultra, на других должно быть скоро.
Ну что, догнали Kling флагмана от гугл, как думаете? Буржуа с подпиской ультра, прошу, скидывайте тесты в комментарии!
Анонс видео
Анонс картинок
Kling 2.6
@ai_newz