DeepSeek-V4-Flash-0731: что обновили в новой версии
👋 DeepSeek-V4-Flash-0731 — обновлённая текстовая MoE-модель на 305 млрд параметров. При обработке каждого токена активируются 13 млрд параметров, а контекстное окно достигает 1 048 576 токенов.
📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста.
Что важно:
▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания.
▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия.
▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно.
➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен.
☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100.
📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста.
Что важно:
▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания.
▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия.
▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно.
➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен.
☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👏2❤1⚡1🔥1
Qwen3.8-27B: плотная модель для агентных задач
👋 Qwen3.8-27B — открытая мультимодальная модель с 27 млрд параметров, нативным контекстом 262 144 токена и возможностью расширения до 1 млн. Она работает с текстом, изображениями и видео, а лицензия Apache 2.0 позволяет использовать её в приватной инфраструктуре и собственных продуктах.
Что важно:
▪️ Гибридная архитектура
Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей.
▪️ Масштабное постобучение
Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах.
▪️ Multi-Token Prediction
MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации.
📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах.
➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен.
☁️ Если потребуется частный сервер, модель доступна на конфигурации 4 × RTX 4090 от 321,77 ₽/ч.
#ИИ_Модели #LLM
Что важно:
▪️ Гибридная архитектура
Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей.
▪️ Масштабное постобучение
Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах.
▪️ Multi-Token Prediction
MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации.
📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах.
➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен.
#ИИ_Модели #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1 1
📢 Объявляем конкурс с призовым фондом 60 000 бонусов
Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом.
🌳 Покажите, какой вы видите осень, с помощью возможностей immers.cloud и нейросетей.
📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах.
🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud.
Ждем ваши проекты 🍂
👉 Перейти в каталог моделей
👉 Выбрать сервер
Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом.
📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах.
🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud.
Ждем ваши проекты 🍂
👉 Перейти в каталог моделей
👉 Выбрать сервер
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉5 3❤1👍1🔥1
Что можно запустить на одной RTX 3090 или RTX 4090?
👋 Для многих продуктовых задач не нужны огромные модели и серверы с несколькими GPU. Суммаризация, классификация, анализ тональности, обработка изображений и распознавание документов могут работать на одной видеокарте — если правильно подобрать модель.
📌 В карточках разобрали решения для RTX 3090 и RTX 4090: компактные языковые модели, мультимодальные возможности, специализированный OCR и модель для агентских сценариев.
Полезные материалы по OCR-моделям из подборки:
▪️ Примеры запросов к baidu/Unlimited-OCR
▪️ Инструкция по запуску PaddleOCR-VL вместе с PP-DocLayoutV3
▪️ Лидерборд PaddleOCR
▪️ Демо PaddleOCR для проверки собственного документа
📲 Какие модели подходят для каждой карты и чего от них ожидать — в слайдах.
➡️ В Immers Foundation Models можно изучить доступные open-source модели и развернуть подходящее решение на GPU под конкретную продуктовую задачу.
➡️ Запустить сервер на RTX 3090
➡️ Запустить сервер на RTX 4090
📌 В карточках разобрали решения для RTX 3090 и RTX 4090: компактные языковые модели, мультимодальные возможности, специализированный OCR и модель для агентских сценариев.
Полезные материалы по OCR-моделям из подборки:
▪️ Примеры запросов к baidu/Unlimited-OCR
▪️ Инструкция по запуску PaddleOCR-VL вместе с PP-DocLayoutV3
▪️ Лидерборд PaddleOCR
▪️ Демо PaddleOCR для проверки собственного документа
📲 Какие модели подходят для каждой карты и чего от них ожидать — в слайдах.
➡️ В Immers Foundation Models можно изучить доступные open-source модели и развернуть подходящее решение на GPU под конкретную продуктовую задачу.
➡️ Запустить сервер на RTX 3090
➡️ Запустить сервер на RTX 4090
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥2❤1👏1🎉1