ServerFlow | Новости и Железо 💾
4.23K subscribers
4.87K photos
387 videos
12 files
2.36K links
Серверы, нейронки, инсайды и немного технической магии. Мы препарируем железо, тестим AI-движки и рассказываем всё как есть.

Хотите поболтать?
https://t.me/serverflow_chat

Оформить заказ?
@ServerFlow

Сотрудничество?
@marketing_sf

https://serverflow.ru
Download Telegram
NVIDIA анонсировала новый ИИ-модуль Jetson Orin Nano 2 для робототехники и Edge AI. Платформа сохранила архитектуру Ampere, 8-ядерный Arm CPU и 8 ГБ LPDDR5X, но получила до 78 TOPS INT8 при TDP всего 40 Вт. Пропускная способность памяти составляет 120 ГБ/с, а заявленная производительность инференса выросла вдвое относительно предыдущей версии Jetson Orin Nano.

При работе в режиме с теплопакетом 15 Вт NVIDIA заявляет ту же производительность, которую предыдущий Orin Nano обеспечивал при более высоком энергопотреблении, но с экономией до 40%. Решение рассчитано на локальный запуск современных моделей на периферии, включая Qwen 3.5, Gemma 4, Nemotron и Cosmos. Старт продаж в 2027 году.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9🍾4
По данным инсайдеров, компания OpenAI завершила новое предварительное обучение ИИ-модели под кодовым названием Bel — преемника модели Doug, с более чем 10 триллионами параметров, которая является базовой моделью для дообучения с подкреплением грядущей флагманской нейронки GPT-6 Astra.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🌭11👍4🍾3
За кулисами конференции Hot Chips 2026. Высокие технологии, низкий кабель-менеджмент.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1💅16💩9🤯3👍1
Цены на GPU могут вырасти еще больше. Компания PC Partner, производящая видеокарты для таких брендов, как Zotac, Inno3D, Manli и Sapphire, ожидает, что во второй половине 2026 года ситуация с поставками графических процессоров значительно ухудшится. Сообщается, что в третьем квартале поставки RTX Blackwell от Nvidia уже ниже, чем во втором, и к концу года ожидается дальнейшее сокращение.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
💩13🤯5
На Hot Chips 2026 компания Waymo раскрыла детали о Sensor Fusion Processor — их ASIC-чипе для обработки данных с камер, LiDAR и радаров. Чип производится по техпроцессу TSMC N5, устанавливается в корпус FCBGA и работает с TDP менее 75 Вт. Внутри чипа находятся 64 МБ SRAM, 8 МБ регистровой памяти, LPDDR5X с пропускной способностью 273 ГБ/с, PCIe 5.0 x8 и контроллер 25GbE.

Основная вычислительная часть Waymo carTPU выдает 160 TOPS INT8 и 80 TFLOPS FP16. Архитектура разделена на три направления обработки данных: камеры, радары и объединение данных с разных датчиков. Каждая вычислительная секция содержит 2 RISC-V ядра с векторными расширениями и 2 МБ SRAM. Выполнение заранее компилируется в единый большой вычислительный модуль, поэтому процессор работает без кэшей и ветвлений, а компилятор заранее распределяет вычисления и обмен данными между блоками.

Waymo также встроила в чип значительную часть обработки самих датчиков. Камерный тракт включает прием данных, HDR-обработку, шумоподавление, собственную демозаикизацию и подготовку отдельных участков изображения. Для радаров и лидаров используются отдельные вычислительные блоки, в том числе для обработки точечных облаков и быстрого преобразования Фурье. После этого обработанные данные поступают в систему объединения информации от всех датчиков. По словам Waymo, этот процессор уже используется в автомобилях шестого поколения компании.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🌭2👍1
Компания XCENA представила MX1 — устройство на базе протокола CXL 3.2 Type 3, которое одновременно расширяет память сервера и выполняет вычисления рядом с данными. Через 4 канала DDR5 можно добавить до 2 ТБ памяти, подключение идет по PCIe 6.0. Кроме обычной оперативной памяти, MX1 умеет использовать SSD как дополнительное хранилище: часто используемые блоки по 64 КБ автоматически помещаются в DRAM, поэтому система может обращаться к ним через общий адресный интерфейс CXL.

В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.

В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Qwen3.8-Flash-Next с открытыми весами официально вышла. Нейронка с нативной мультимодальностью получила архитектуру следующего поколения ИИ-моделей Qwen4 и ряд оптимизационных апдейтов, которые значительно увеличили скорость инференса и качество ответов.

В основе — 125 млрд общих параметров, 6 млрд MoE-параметров, 51 млрд параметров n-gram embedding и еще 4 млрд параметров под механизм MTP. Также имеется 512 экспертов MoE.


⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.

⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.

⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.

В SWE-bench Pro, GPQA Diamond, LiveCodeBench и других тестах Qwen3.8-Flash-Next обходит проприетарную Claude-Opus-4.6 Max, а также открытые модели Qwen3.8 27B, Qwen3.7 Plus и DeepSeek-V4-Flash.


Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.

Веса уже лежат на Hugging Face.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15💅4🌭2🍾2
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11