GLM-5.3 — текстовая MoE-модель семейства GLM-5 от Z.ai с 753 млрд параметров (около 40 млрд активных на токен), контекстом 1 048 576 токенов и упором на программирование, рассуждение и долгосрочную работу с инструментами.
Что важно:
🟠 Масштабное постобучение. Главное изменение — не архитектура (сохранены MoE, DSA, IndexShare и MTP из GLM-5.2), а расширенное постобучение. Разработчики увеличили вычислительный бюджет, разнообразили тренировочные сценарии и расширили набор сред для длительных задач.
🟠 IndexShare для эффективной работы с длинным контекстом. Технология переиспользования индексов внимания между соседними слоями трансформера: только один слой в группе из четырёх вычисляет индексы, остальные используют их повторно. Это снижает вычислительную сложность при работе с контекстом в 1 млн токенов.
🟠 MoE-архитектура. 256 маршрутизируемых экспертов + 1 общий, top-k = 8 экспертов на токен. Модель поддерживает Multi-Token Prediction, работу с инструментами и управление усилиями рассуждения.
Подробнее — в слайдах.
▶️ GLM-5.3 доступна в нашем каталоге
Внимание! Для этой модели доступны только частные эндпоинты. Тарификация производится за время фактической аренды сервера, а не за количество обработанных токенов.
Что важно:
Подробнее — в слайдах.
Внимание! Для этой модели доступны только частные эндпоинты. Тарификация производится за время фактической аренды сервера, а не за количество обработанных токенов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡2🔥2👍1👏1😱1
Поздравляем разработчиков с профессиональным праздником ❤️
Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой.
Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков.
Листайте карусель, чтобы узнать:
С Днём программиста!
И куда же без подарка! По этому промокоду вы получите +20% к пополнению баланса в нашем облаке !
Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой.
Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков.
Листайте карусель, чтобы узнать:
— сколько разработчиков продолжают учиться
— с какими трудностями они сталкиваются ежедневно
— как отвлечения влияют на работу
С Днём программиста!
И куда же без подарка!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6⚡3🎉3🔥2🏆1
Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL
Что важно:
🟠 RTX 4090 достигает предела масштабирования пропускной способности на уровне ~15 RPS. Объема VRAM хватает для одновременного размещения не более двух контекстов максимальной длины (131k токенов) и при одновременной обработке более 200 запросов начинается вытеснение (preemption) данных из KV-кэша (фактически удаление).
Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency.
🟠 KV_OFFLOAD снижает негативный эффект вытеснения путем сохранения уже рассчитанных значений для вытесняемых запросов на хосте, но вносит дополнительные задержки из-за передачи данных между GPU и CPU.
🟠 H100 NVL не допускает вытеснения и обеспечивает линейное масштабирование пропускной способности (запросов / сек) с увеличением RPS благодаря четырехкратному преимуществу в объеме доступной памяти под KV-кэш и при этом обладает гораздо более мощными вычислительными возможностями.
▶️ Арендовать сервер с Н100 NVL
📬 Подписывайтесь на нас в МАХ
Что важно:
Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM