Unlimited-OCR: как распознавать многостраничные документы за один проход
👋 Unlimited-OCR — открытая мультимодальная OCR-модель от компании Baidu. MoE-архитектура на 3 млрд параметров из которых при генерации активируются только 500 млн.
📌 Главная особенность — возможность обрабатывать несколько страниц одновременно за один проход.
Что важно:
▪️ Ключевая научная новелла модели — Reference Sliding Window Attention (R-SWA). Этот механизм позволяет зафиксировать объём KV-cache и не увеличивать его при генерации токенов, при этом постоянно сохраняя доступ ко всем исходным токенам: изображениям и запросу-промпту.
▪️ Страницы PDF преобразуются в изображения и загружаются в общий контекст. Это позволяет непрерывно распознавать книги, архивы, отчёты и комплекты документов без отдельного запуска для каждой страницы.
▪️ DeepEncoder сжимает страницу размером 1024 × 1024 до 256 визуальных токенов. Контекстное окно модели составляет 32K токенов, поэтому фактическое количество одновременно обрабатываемых страниц зависит от их разрешения и объёма опорного префикса.
📲 Подробнее в слайдах.
📎 При выборе GPU учитывайте не только размер весов, но и KV-cache, а также объём префикса, который увеличивается с количеством и разрешением страниц.
➡️ Бесплатно протестировать Unlimited-OCR можно через публичный API-эндпоинт. Чтобы получить доступ, необходимо создать аккаунт, пройти верификацию и выпустить токен.
☁️ Если для рабочих задач нужен изолированный сервер, модель можно развернуть на Tesla A2 от 33,74 ₽/ч.
📎 Об особенностях направления запросов по API в модель можно узнать по ссылке.
📌 Главная особенность — возможность обрабатывать несколько страниц одновременно за один проход.
Что важно:
▪️ Ключевая научная новелла модели — Reference Sliding Window Attention (R-SWA). Этот механизм позволяет зафиксировать объём KV-cache и не увеличивать его при генерации токенов, при этом постоянно сохраняя доступ ко всем исходным токенам: изображениям и запросу-промпту.
▪️ Страницы PDF преобразуются в изображения и загружаются в общий контекст. Это позволяет непрерывно распознавать книги, архивы, отчёты и комплекты документов без отдельного запуска для каждой страницы.
▪️ DeepEncoder сжимает страницу размером 1024 × 1024 до 256 визуальных токенов. Контекстное окно модели составляет 32K токенов, поэтому фактическое количество одновременно обрабатываемых страниц зависит от их разрешения и объёма опорного префикса.
📲 Подробнее в слайдах.
📎 При выборе GPU учитывайте не только размер весов, но и KV-cache, а также объём префикса, который увеличивается с количеством и разрешением страниц.
➡️ Бесплатно протестировать Unlimited-OCR можно через публичный API-эндпоинт. Чтобы получить доступ, необходимо создать аккаунт, пройти верификацию и выпустить токен.
☁️ Если для рабочих задач нужен изолированный сервер, модель можно развернуть на Tesla A2 от 33,74 ₽/ч.
📎 Об особенностях направления запросов по API в модель можно узнать по ссылке.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2⚡2 2👍1🔥1
DeepSeek-V4-Flash-0731: что обновили в новой версии
👋 DeepSeek-V4-Flash-0731 — обновлённая текстовая MoE-модель на 305 млрд параметров. При обработке каждого токена активируются 13 млрд параметров, а контекстное окно достигает 1 048 576 токенов.
📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста.
Что важно:
▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания.
▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия.
▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно.
➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен.
☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100.
📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста.
Что важно:
▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания.
▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия.
▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно.
➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен.
☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👏2❤1⚡1🔥1
Qwen3.8-27B: плотная модель для агентных задач
👋 Qwen3.8-27B — открытая мультимодальная модель с 27 млрд параметров, нативным контекстом 262 144 токена и возможностью расширения до 1 млн. Она работает с текстом, изображениями и видео, а лицензия Apache 2.0 позволяет использовать её в приватной инфраструктуре и собственных продуктах.
Что важно:
▪️ Гибридная архитектура
Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей.
▪️ Масштабное постобучение
Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах.
▪️ Multi-Token Prediction
MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации.
📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах.
➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен.
☁️ Если потребуется частный сервер, модель доступна на конфигурации 4 × RTX 4090 от 321,77 ₽/ч.
#ИИ_Модели #LLM
Что важно:
▪️ Гибридная архитектура
Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей.
▪️ Масштабное постобучение
Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах.
▪️ Multi-Token Prediction
MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации.
📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах.
➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен.
#ИИ_Модели #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1 1
📢 Объявляем конкурс с призовым фондом 60 000 бонусов
Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом.
🌳 Покажите, какой вы видите осень, с помощью возможностей immers.cloud и нейросетей.
📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах.
🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud.
Ждем ваши проекты 🍂
👉 Перейти в каталог моделей
👉 Выбрать сервер
Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом.
📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах.
🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud.
Ждем ваши проекты 🍂
👉 Перейти в каталог моделей
👉 Выбрать сервер
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉5 3❤1👍1🔥1
Что можно запустить на одной RTX 3090 или RTX 4090?
👋 Для многих продуктовых задач не нужны огромные модели и серверы с несколькими GPU. Суммаризация, классификация, анализ тональности, обработка изображений и распознавание документов могут работать на одной видеокарте — если правильно подобрать модель.
📌 В карточках разобрали решения для RTX 3090 и RTX 4090: компактные языковые модели, мультимодальные возможности, специализированный OCR и модель для агентских сценариев.
Полезные материалы по OCR-моделям из подборки:
▪️ Примеры запросов к baidu/Unlimited-OCR
▪️ Инструкция по запуску PaddleOCR-VL вместе с PP-DocLayoutV3
▪️ Лидерборд PaddleOCR
▪️ Демо PaddleOCR для проверки собственного документа
📲 Какие модели подходят для каждой карты и чего от них ожидать — в слайдах.
➡️ В Immers Foundation Models можно изучить доступные open-source модели и развернуть подходящее решение на GPU под конкретную продуктовую задачу.
➡️ Запустить сервер на RTX 3090
➡️ Запустить сервер на RTX 4090
📌 В карточках разобрали решения для RTX 3090 и RTX 4090: компактные языковые модели, мультимодальные возможности, специализированный OCR и модель для агентских сценариев.
Полезные материалы по OCR-моделям из подборки:
▪️ Примеры запросов к baidu/Unlimited-OCR
▪️ Инструкция по запуску PaddleOCR-VL вместе с PP-DocLayoutV3
▪️ Лидерборд PaddleOCR
▪️ Демо PaddleOCR для проверки собственного документа
📲 Какие модели подходят для каждой карты и чего от них ожидать — в слайдах.
➡️ В Immers Foundation Models можно изучить доступные open-source модели и развернуть подходящее решение на GPU под конкретную продуктовую задачу.
➡️ Запустить сервер на RTX 3090
➡️ Запустить сервер на RTX 4090
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥2❤1👏1🎉1