Как быстро проверять AI-гипотезы без отдельного GPU-сервера под каждый PoC?
👋 IBS занимается исследованиями и разработкой в области искусственного интеллекта. Команда запускает fine-tuning, тестирует пайплайны, создает прототипы сервисов и разворачивает прикладные AI PoC.
🎯 Компании был нужен единый управляемый GPU-контур для AI R&D, production API и проверки новых сценариев.
🌳 До перехода на единый AI-контур в immers.cloud команда сталкивалась с нехваткой свободной GPU-песочницы, долгой подготовкой инфраструктуры под новые PoC и необходимостью выделять отдельный сервер под каждую задачу.
🔁 Решением стал единый AI-контур в immers.cloud.
Для проекта развернули инфраструктуру под смешанную AI-нагрузку:
— GPUStack для управления моделями и инстансами;
— vLLM для высокопроизводительного запуска LLM;
— 1 control plane и 4 GPU worker-узла;
— конфигурации 2 × A100 80GB, 2 × 4 × RTX 3090 24GB, 1 × RTX 4090 24GB;
— локальное хранение данных внутри приватного контура;
— корпоративный доступ через VPN;
— изолированный публичный прокси;
— централизованный сбор метрик, алертинг и логирование.
Что это дало команде:
— единый R&D AI API-контур для экспериментов;
— подключение новых PoC за часы, а не дни;
— не нужно выделять отдельный GPU-сервер под каждый кейс;
— проще подключать новые команды;
— контур стал наблюдаемым и предсказуемым.
📲 В карусели — как IBS перешла от точечных GPU-решений к единой модели работы с AI-инфраструктурой.
➡️ Полный разбор кейса.
☁️ Если вашей команде нужен управляемый GPU-контур, в immers.cloud можно спроектировать инфраструктуру под конкретные задачи и требования к доступу.
🎯 Компании был нужен единый управляемый GPU-контур для AI R&D, production API и проверки новых сценариев.
🔁 Решением стал единый AI-контур в immers.cloud.
Для проекта развернули инфраструктуру под смешанную AI-нагрузку:
— GPUStack для управления моделями и инстансами;
— vLLM для высокопроизводительного запуска LLM;
— 1 control plane и 4 GPU worker-узла;
— конфигурации 2 × A100 80GB, 2 × 4 × RTX 3090 24GB, 1 × RTX 4090 24GB;
— локальное хранение данных внутри приватного контура;
— корпоративный доступ через VPN;
— изолированный публичный прокси;
— централизованный сбор метрик, алертинг и логирование.
Что это дало команде:
— единый R&D AI API-контур для экспериментов;
— подключение новых PoC за часы, а не дни;
— не нужно выделять отдельный GPU-сервер под каждый кейс;
— проще подключать новые команды;
— контур стал наблюдаемым и предсказуемым.
📲 В карусели — как IBS перешла от точечных GPU-решений к единой модели работы с AI-инфраструктурой.
➡️ Полный разбор кейса.
☁️ Если вашей команде нужен управляемый GPU-контур, в immers.cloud можно спроектировать инфраструктуру под конкретные задачи и требования к доступу.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3🔥3⚡1 1
Qwen3.6-35B-A3B: зачем нужна MoE-версия
👋 Qwen3.6-35B-A3B — модель семейства Qwen3.6, которая близка к Qwen3.6-27B по назначению, но отличается архитектурным подходом.
Что важно:
▪️ MoE-архитектура
Модель использует 256 экспертов, из которых для каждого токена выбираются 8. Это позволяет сочетать качество крупной модели с более низкой вычислительной нагрузкой при инференсе.
▪️ Отличие от Qwen3.6-27B
По бенчмаркам Qwen3.6-35B-A3B уступает Qwen3.6-27B, но за счёт MoE и меньшей нагрузки на KV-cache может быть быстрее и экономичнее в ряде сценариев инференса, особенно при длинных многошаговых задачах.
📲 Подробнее — в слайдах.
➡️ Развернуть Qwen3.6-35B-A3B можно в immers.cloud и проверить модель на реальных задачах с оплатой за GPU-ресурсы, а не за отдельные токены.
Что важно:
▪️ MoE-архитектура
Модель использует 256 экспертов, из которых для каждого токена выбираются 8. Это позволяет сочетать качество крупной модели с более низкой вычислительной нагрузкой при инференсе.
▪️ Отличие от Qwen3.6-27B
По бенчмаркам Qwen3.6-35B-A3B уступает Qwen3.6-27B, но за счёт MoE и меньшей нагрузки на KV-cache может быть быстрее и экономичнее в ряде сценариев инференса, особенно при длинных многошаговых задачах.
📲 Подробнее — в слайдах.
➡️ Развернуть Qwen3.6-35B-A3B можно в immers.cloud и проверить модель на реальных задачах с оплатой за GPU-ресурсы, а не за отдельные токены.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥4👍2⚡1 1
Число π рассчитали до 314 трлн знаков после запятой
🧮 Новый мировой рекорд поставили не на GPU-кластере, а на одном сервере с CPU и 40 NVMe SSD.
📌 На первый взгляд кажется, что для таких вычислений нужны видеокарты. Но в этой задаче узким местом стали не математические операции, а память, накопители и стабильная работа с огромными объёмами данных.
⚙️ Это хороший пример того, почему инфраструктуру нельзя выбирать по принципу «чем больше GPU, тем лучше». Для одних задач важнее CPU и быстрые NVMe, для других — GPU и массово-параллельные вычисления.
📲 В слайдах разбираем, почему рекорд по π стал именно инфраструктурной задачей — и как понять, какая конфигурация нужна под конкретную нагрузку.
☁️ В immers.cloud можно подбирать инфраструктуру под сценарий: CPU-серверы — для вычислительных и сервисных задач, GPU-инстансы — для ИИ, инференса, обучения моделей и рендеринга.
🧮 Новый мировой рекорд поставили не на GPU-кластере, а на одном сервере с CPU и 40 NVMe SSD.
📌 На первый взгляд кажется, что для таких вычислений нужны видеокарты. Но в этой задаче узким местом стали не математические операции, а память, накопители и стабильная работа с огромными объёмами данных.
⚙️ Это хороший пример того, почему инфраструктуру нельзя выбирать по принципу «чем больше GPU, тем лучше». Для одних задач важнее CPU и быстрые NVMe, для других — GPU и массово-параллельные вычисления.
📲 В слайдах разбираем, почему рекорд по π стал именно инфраструктурной задачей — и как понять, какая конфигурация нужна под конкретную нагрузку.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👏5😱3 2❤1👍1🔥1
Please open Telegram to view this post
VIEW IN TELEGRAM
Какая тема сайта удобнее?
Anonymous Poll
41%
Тёмная
24%
Светлая
31%
Автоматически: как на моём устройстве
3%
В зависимости от освещения
Gemma 4 12B: мультимодальность на одной RTX 3090
👋 Gemma 4 12B — модель среднего класса в новой линейке Gemma 4: мощнее компактной E4B, но доступнее старшей 26B A4B MoE.
Что важно:
▪️ Полностью бесэнкодерная архитектура
Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения.
▪️ Мультимодальность в одной модели
Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса.
▪️ Доступность для self-hosting
Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев.
📲 Подробнее — в слайдах.
➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель, протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения.
Что важно:
▪️ Полностью бесэнкодерная архитектура
Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения.
▪️ Мультимодальность в одной модели
Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса.
▪️ Доступность для self-hosting
Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев.
📲 Подробнее — в слайдах.
➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель, протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3🎉2 2❤1👍1