immers.cloud | Облако с GPU
944 subscribers
1.27K photos
9 videos
318 links
immers.cloud — облачный GPU-сервис с широким выбором видеокарт для ML, генеративных моделей, 3D и рендеринга.

Самый большой ассортимент GPU Tesla и RTX 💻

👉 Наш сайт https://immers.cloud/
🎧 @immerscloudsupport

Чат по ИИ - https://t.me/immersAI
Download Telegram
Число π рассчитали до 314 трлн знаков после запятой

🧮 Новый мировой рекорд поставили не на GPU-кластере, а на одном сервере с CPU и 40 NVMe SSD.

📌 На первый взгляд кажется, что для таких вычислений нужны видеокарты. Но в этой задаче узким местом стали не математические операции, а память, накопители и стабильная работа с огромными объёмами данных.

⚙️ Это хороший пример того, почему инфраструктуру нельзя выбирать по принципу «чем больше GPU, тем лучше». Для одних задач важнее CPU и быстрые NVMe, для других — GPU и массово-параллельные вычисления.

📲 В слайдах разбираем, почему рекорд по π стал именно инфраструктурной задачей — и как понять, какая конфигурация нужна под конкретную нагрузку.

☁️ В immers.cloud можно подбирать инфраструктуру под сценарий: CPU-серверы — для вычислительных и сервисных задач, GPU-инстансы — для ИИ, инференса, обучения моделей и рендеринга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👏5😱321👍1🔥1
👍 Проголосуйте за тему, которая комфортнее именно вам ⤵️
Please open Telegram to view this post
VIEW IN TELEGRAM
Gemma 4 12B: мультимодальность на одной RTX 3090

👋 Gemma 4 12B — модель среднего класса в новой линейке Gemma 4: мощнее компактной E4B, но доступнее старшей 26B A4B MoE.

Что важно:
▪️ Полностью бесэнкодерная архитектура
Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения.

▪️ Мультимодальность в одной модели
Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса.

▪️ Доступность для self-hosting
Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев.

📲 Подробнее — в слайдах.

➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель, протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3🎉221👍1
NVIDIA Nemotron 3 Ultra: что внутри флагманской MoE-модели

👋 NVIDIA Nemotron 3 Ultra — крупнейшая модель в линейке Nemotron 3, ориентированная на агентные системы, рассуждения, кодинг, диалог и работу с длинным контекстом.

📌 Главный интерес — в том, как NVIDIA пытается совместить ёмкость крупной модели с более эффективным инференсом.

Что важно:

▪️ Гибридная архитектура Nemotron-H + LatentMoE
В модели используются 108 слоёв трёх типов: Mamba-2, Latent MoE и Attention. Значительная часть классических attention-слоёв заменена на Mamba-2, а экспертные вычисления вынесены в LatentMoE. Это снижает стоимость внимания и размер KV-cache, что особенно важно для длинноконтекстных задач и агентных цепочек.

▪️ LatentMoE вместо классической MoE-маршрутизации
Nemotron 3 Ultra содержит 550B параметров, из которых 55B активируются на токен. При этом токены перед маршрутизацией и вычислениями в экспертах проецируются в латентное пространство меньшей размерности. Такой подход делает маршрутизацию экономичнее по сравнению с классическими MoE-моделями.

▪️ Multi-Token Prediction для ускорения генерации
В архитектуру встроена Multi-Token Prediction — механизм, при котором модель может предсказывать несколько будущих токенов одновременно. Это помогает повышать пропускную способность инференса, особенно при генерации длинных ответов.


📲 Подробнее — в слайдах.

➡️ Запустить Nemotron 3 Ultra в квантизации 4 бита можно на 4 x H200 от 1 717,59 ₽/ч.

➡️ Перейти в каталог с более чем 200 другими моделями.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
4🔥221👍1