Gemma 4 12B: мультимодальность на одной RTX 3090
👋 Gemma 4 12B — модель среднего класса в новой линейке Gemma 4: мощнее компактной E4B, но доступнее старшей 26B A4B MoE.
Что важно:
▪️ Полностью бесэнкодерная архитектура
Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения.
▪️ Мультимодальность в одной модели
Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса.
▪️ Доступность для self-hosting
Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев.
📲 Подробнее — в слайдах.
➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель, протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения.
Что важно:
▪️ Полностью бесэнкодерная архитектура
Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения.
▪️ Мультимодальность в одной модели
Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса.
▪️ Доступность для self-hosting
Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев.
📲 Подробнее — в слайдах.
➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель, протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3🎉2 2❤1👍1
NVIDIA Nemotron 3 Ultra: что внутри флагманской MoE-модели
👋 NVIDIA Nemotron 3 Ultra — крупнейшая модель в линейке Nemotron 3, ориентированная на агентные системы, рассуждения, кодинг, диалог и работу с длинным контекстом.
📌 Главный интерес — в том, как NVIDIA пытается совместить ёмкость крупной модели с более эффективным инференсом.
Что важно:
▪️ Гибридная архитектура Nemotron-H + LatentMoE
В модели используются 108 слоёв трёх типов: Mamba-2, Latent MoE и Attention. Значительная часть классических attention-слоёв заменена на Mamba-2, а экспертные вычисления вынесены в LatentMoE. Это снижает стоимость внимания и размер KV-cache, что особенно важно для длинноконтекстных задач и агентных цепочек.
▪️ LatentMoE вместо классической MoE-маршрутизации
Nemotron 3 Ultra содержит 550B параметров, из которых 55B активируются на токен. При этом токены перед маршрутизацией и вычислениями в экспертах проецируются в латентное пространство меньшей размерности. Такой подход делает маршрутизацию экономичнее по сравнению с классическими MoE-моделями.
▪️ Multi-Token Prediction для ускорения генерации
В архитектуру встроена Multi-Token Prediction — механизм, при котором модель может предсказывать несколько будущих токенов одновременно. Это помогает повышать пропускную способность инференса, особенно при генерации длинных ответов.
📲 Подробнее — в слайдах.
➡️ Запустить Nemotron 3 Ultra в квантизации 4 бита можно на 4 x H200 от 1 717,59 ₽/ч.
➡️ Перейти в каталог с более чем 200 другими моделями.
📌 Главный интерес — в том, как NVIDIA пытается совместить ёмкость крупной модели с более эффективным инференсом.
Что важно:
▪️ Гибридная архитектура Nemotron-H + LatentMoE
В модели используются 108 слоёв трёх типов: Mamba-2, Latent MoE и Attention. Значительная часть классических attention-слоёв заменена на Mamba-2, а экспертные вычисления вынесены в LatentMoE. Это снижает стоимость внимания и размер KV-cache, что особенно важно для длинноконтекстных задач и агентных цепочек.
▪️ LatentMoE вместо классической MoE-маршрутизации
Nemotron 3 Ultra содержит 550B параметров, из которых 55B активируются на токен. При этом токены перед маршрутизацией и вычислениями в экспертах проецируются в латентное пространство меньшей размерности. Такой подход делает маршрутизацию экономичнее по сравнению с классическими MoE-моделями.
▪️ Multi-Token Prediction для ускорения генерации
В архитектуру встроена Multi-Token Prediction — механизм, при котором модель может предсказывать несколько будущих токенов одновременно. Это помогает повышать пропускную способность инференса, особенно при генерации длинных ответов.
📲 Подробнее — в слайдах.
➡️ Запустить Nemotron 3 Ultra в квантизации 4 бита можно на 4 x H200 от 1 717,59 ₽/ч.
➡️ Перейти в каталог с более чем 200 другими моделями.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥2 2⚡1👍1
Immers Foundation Models: каталог open-source моделей для запуска на GPU-инфраструктуре immers.cloud
📁 В каталоге уже собрано 210 моделей, для которых подобрано более 600 весов. Для части моделей доступны готовые публичные эндпоинты: сейчас можно протестировать 6 моделей через чат или API без подготовки собственного окружения.
🚀 Каталог упрощает путь от выбора модели до запуска: изучить характеристики, оценить требования к ресурсам, подобрать GPU-конфигурацию.
Если хотите разобрать процесс на практике, посмотрите видеогайд «Как запустить AI-модель на собственном сервере?»:
📱 ВК
📱 YouTube
📺 Rutube
➡️ Полное руководство по запуску модели доступно в FAQ immers.cloud.
➡️ Перейти в Immers Foundation Models
📁 В каталоге уже собрано 210 моделей, для которых подобрано более 600 весов. Для части моделей доступны готовые публичные эндпоинты: сейчас можно протестировать 6 моделей через чат или API без подготовки собственного окружения.
Если хотите разобрать процесс на практике, посмотрите видеогайд «Как запустить AI-модель на собственном сервере?»:
➡️ Полное руководство по запуску модели доступно в FAQ immers.cloud.
➡️ Перейти в Immers Foundation Models
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3👏3😱2❤1🤔1
GLM-5.2: выходит на территорию топовых моделей
👋 GLM-5.2 — open-source MoE-модель от Z.ai для задач, где важны длинный контекст, рассуждение, кодинг и многошаговая работа с инструментами.
Что важно:
▪️ Стабильность на длинных сценариях
GLM-5.2 рассчитана на задачи, где модель должна обрабатывать большой объём входных данных и сохранять связность рассуждения на протяжении нескольких этапов. Это важно для анализа репозиториев, технической документации, исследовательских материалов и агентных пайплайнов.
▪️ Эффективнее работа с большим контекстом
За счёт IndexShare модель снижает избыточные вычисления в индексаторе внимания и делает обработку сверхдлинных последовательностей более практичной. Это особенно важно в задачах, где контекст нельзя сильно сокращать без потери качества результата.
▪️ Фокус на кодинг и работу с инструментами
GLM-5.2 ориентирована на сценарии, где модель не ограничивается генерацией ответа: она анализирует контекст, выполняет промежуточные шаги, работает с инструментами и продолжает задачу с учётом уже полученных данных.
📲 Подробнее — в слайдах.
➡️ GLM-5.2 в 4-битной квантизации можно запустить в immers.cloud на конфигурации 4 × H200 от 1 719,14 ₽/ч.
Что важно:
▪️ Стабильность на длинных сценариях
GLM-5.2 рассчитана на задачи, где модель должна обрабатывать большой объём входных данных и сохранять связность рассуждения на протяжении нескольких этапов. Это важно для анализа репозиториев, технической документации, исследовательских материалов и агентных пайплайнов.
▪️ Эффективнее работа с большим контекстом
За счёт IndexShare модель снижает избыточные вычисления в индексаторе внимания и делает обработку сверхдлинных последовательностей более практичной. Это особенно важно в задачах, где контекст нельзя сильно сокращать без потери качества результата.
▪️ Фокус на кодинг и работу с инструментами
GLM-5.2 ориентирована на сценарии, где модель не ограничивается генерацией ответа: она анализирует контекст, выполняет промежуточные шаги, работает с инструментами и продолжает задачу с учётом уже полученных данных.
📲 Подробнее — в слайдах.
➡️ GLM-5.2 в 4-битной квантизации можно запустить в immers.cloud на конфигурации 4 × H200 от 1 719,14 ₽/ч.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡3❤2🔥2👏2👍1