NVIDIA анонсировала новый ИИ-модуль Jetson Orin Nano 2 для робототехники и Edge AI. Платформа сохранила архитектуру Ampere, 8-ядерный Arm CPU и 8 ГБ LPDDR5X, но получила до 78 TOPS INT8 при TDP всего 40 Вт. Пропускная способность памяти составляет 120 ГБ/с, а заявленная производительность инференса выросла вдвое относительно предыдущей версии Jetson Orin Nano.
При работе в режиме с теплопакетом 15 Вт NVIDIA заявляет ту же производительность, которую предыдущий Orin Nano обеспечивал при более высоком энергопотреблении, но с экономией до 40%. Решение рассчитано на локальный запуск современных моделей на периферии, включая Qwen 3.5, Gemma 4, Nemotron и Cosmos. Старт продаж в 2027 году.
😅 Канал Serverflow в MAX: Подписаться
При работе в режиме с теплопакетом 15 Вт NVIDIA заявляет ту же производительность, которую предыдущий Orin Nano обеспечивал при более высоком энергопотреблении, но с экономией до 40%. Решение рассчитано на локальный запуск современных моделей на периферии, включая Qwen 3.5, Gemma 4, Nemotron и Cosmos. Старт продаж в 2027 году.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9🍾4
По данным инсайдеров, компания OpenAI завершила новое предварительное обучение ИИ-модели под кодовым названием Bel — преемника модели Doug, с более чем 10 триллионами параметров, которая является базовой моделью для дообучения с подкреплением грядущей флагманской нейронки GPT-6 Astra.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🌭11👍4🍾3
ServerFlow | Новости и Железо 💾
OpenAI сравнила свой первый кастомный ИИ-чип Jalapeño с системами NVIDIA GB200 и GB300. В собственных тестах InferenceX на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T чип показал в 1,5-1,9 раза больше ИИ-производительности на ватт при максимальной пропускной…
Anthropic открыла набор инженеров по кремниевым технологиям. Кажется, Дарио всерьез задели успехи OpenAI с чипом Jalapeño.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9🤯3🍾3
За кулисами конференции Hot Chips 2026. Высокие технологии, низкий кабель-менеджмент.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1💅16💩9🤯3👍1
Цены на GPU могут вырасти еще больше. Компания PC Partner, производящая видеокарты для таких брендов, как Zotac, Inno3D, Manli и Sapphire, ожидает, что во второй половине 2026 года ситуация с поставками графических процессоров значительно ухудшится. Сообщается, что в третьем квартале поставки RTX Blackwell от Nvidia уже ниже, чем во втором, и к концу года ожидается дальнейшее сокращение.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
💩13🤯5
На Hot Chips 2026 компания Waymo раскрыла детали о Sensor Fusion Processor — их ASIC-чипе для обработки данных с камер, LiDAR и радаров. Чип производится по техпроцессу TSMC N5, устанавливается в корпус FCBGA и работает с TDP менее 75 Вт. Внутри чипа находятся 64 МБ SRAM, 8 МБ регистровой памяти, LPDDR5X с пропускной способностью 273 ГБ/с, PCIe 5.0 x8 и контроллер 25GbE.
Основная вычислительная часть Waymo carTPU выдает 160 TOPS INT8 и 80 TFLOPS FP16. Архитектура разделена на три направления обработки данных: камеры, радары и объединение данных с разных датчиков. Каждая вычислительная секция содержит 2 RISC-V ядра с векторными расширениями и 2 МБ SRAM. Выполнение заранее компилируется в единый большой вычислительный модуль, поэтому процессор работает без кэшей и ветвлений, а компилятор заранее распределяет вычисления и обмен данными между блоками.
Waymo также встроила в чип значительную часть обработки самих датчиков. Камерный тракт включает прием данных, HDR-обработку, шумоподавление, собственную демозаикизацию и подготовку отдельных участков изображения. Для радаров и лидаров используются отдельные вычислительные блоки, в том числе для обработки точечных облаков и быстрого преобразования Фурье. После этого обработанные данные поступают в систему объединения информации от всех датчиков. По словам Waymo, этот процессор уже используется в автомобилях шестого поколения компании.
😅 Канал Serverflow в MAX: Подписаться
Основная вычислительная часть Waymo carTPU выдает 160 TOPS INT8 и 80 TFLOPS FP16. Архитектура разделена на три направления обработки данных: камеры, радары и объединение данных с разных датчиков. Каждая вычислительная секция содержит 2 RISC-V ядра с векторными расширениями и 2 МБ SRAM. Выполнение заранее компилируется в единый большой вычислительный модуль, поэтому процессор работает без кэшей и ветвлений, а компилятор заранее распределяет вычисления и обмен данными между блоками.
Waymo также встроила в чип значительную часть обработки самих датчиков. Камерный тракт включает прием данных, HDR-обработку, шумоподавление, собственную демозаикизацию и подготовку отдельных участков изображения. Для радаров и лидаров используются отдельные вычислительные блоки, в том числе для обработки точечных облаков и быстрого преобразования Фурье. После этого обработанные данные поступают в систему объединения информации от всех датчиков. По словам Waymo, этот процессор уже используется в автомобилях шестого поколения компании.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🌭2👍1
Компания XCENA представила MX1 — устройство на базе протокола CXL 3.2 Type 3, которое одновременно расширяет память сервера и выполняет вычисления рядом с данными. Через 4 канала DDR5 можно добавить до 2 ТБ памяти, подключение идет по PCIe 6.0. Кроме обычной оперативной памяти, MX1 умеет использовать SSD как дополнительное хранилище: часто используемые блоки по 64 КБ автоматически помещаются в DRAM, поэтому система может обращаться к ним через общий адресный интерфейс CXL.
В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.
В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.
😅 Канал Serverflow в MAX: Подписаться
В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.
В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Qwen3.8-Flash-Next с открытыми весами официально вышла. Нейронка с нативной мультимодальностью получила архитектуру следующего поколения ИИ-моделей Qwen4 и ряд оптимизационных апдейтов, которые значительно увеличили скорость инференса и качество ответов.
⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.
⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.
⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.
Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.
Веса уже лежат на Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
В основе — 125 млрд общих параметров, 6 млрд MoE-параметров, 51 млрд параметров n-gram embedding и еще 4 млрд параметров под механизм MTP. Также имеется 512 экспертов MoE.
⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.
⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.
⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.
В SWE-bench Pro, GPQA Diamond, LiveCodeBench и других тестах Qwen3.8-Flash-Next обходит проприетарную Claude-Opus-4.6 Max, а также открытые модели Qwen3.8 27B, Qwen3.7 Plus и DeepSeek-V4-Flash.
Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.
Веса уже лежат на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15💅4🌭2🍾2
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11