Поздравляем разработчиков с профессиональным праздником ❤️
Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой.
Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков.
Листайте карусель, чтобы узнать:
С Днём программиста!
И куда же без подарка! По этому промокоду вы получите +20% к пополнению баланса в нашем облаке !
Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой.
Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков.
Листайте карусель, чтобы узнать:
— сколько разработчиков продолжают учиться
— с какими трудностями они сталкиваются ежедневно
— как отвлечения влияют на работу
С Днём программиста!
И куда же без подарка!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6⚡3🎉3🔥2🏆1
Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL
Что важно:
🟠 RTX 4090 достигает предела масштабирования пропускной способности на уровне ~15 RPS. Объема VRAM хватает для одновременного размещения не более двух контекстов максимальной длины (131k токенов) и при одновременной обработке более 200 запросов начинается вытеснение (preemption) данных из KV-кэша (фактически удаление).
Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency.
🟠 KV_OFFLOAD снижает негативный эффект вытеснения путем сохранения уже рассчитанных значений для вытесняемых запросов на хосте, но вносит дополнительные задержки из-за передачи данных между GPU и CPU.
🟠 H100 NVL не допускает вытеснения и обеспечивает линейное масштабирование пропускной способности (запросов / сек) с увеличением RPS благодаря четырехкратному преимуществу в объеме доступной памяти под KV-кэш и при этом обладает гораздо более мощными вычислительными возможностями.
▶️ Арендовать сервер с Н100 NVL
📬 Подписывайтесь на нас в МАХ
Что важно:
Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM