На Hot Chips 2026 компания Waymo раскрыла детали о Sensor Fusion Processor — их ASIC-чипе для обработки данных с камер, LiDAR и радаров. Чип производится по техпроцессу TSMC N5, устанавливается в корпус FCBGA и работает с TDP менее 75 Вт. Внутри чипа находятся 64 МБ SRAM, 8 МБ регистровой памяти, LPDDR5X с пропускной способностью 273 ГБ/с, PCIe 5.0 x8 и контроллер 25GbE.
Основная вычислительная часть Waymo carTPU выдает 160 TOPS INT8 и 80 TFLOPS FP16. Архитектура разделена на три направления обработки данных: камеры, радары и объединение данных с разных датчиков. Каждая вычислительная секция содержит 2 RISC-V ядра с векторными расширениями и 2 МБ SRAM. Выполнение заранее компилируется в единый большой вычислительный модуль, поэтому процессор работает без кэшей и ветвлений, а компилятор заранее распределяет вычисления и обмен данными между блоками.
Waymo также встроила в чип значительную часть обработки самих датчиков. Камерный тракт включает прием данных, HDR-обработку, шумоподавление, собственную демозаикизацию и подготовку отдельных участков изображения. Для радаров и лидаров используются отдельные вычислительные блоки, в том числе для обработки точечных облаков и быстрого преобразования Фурье. После этого обработанные данные поступают в систему объединения информации от всех датчиков. По словам Waymo, этот процессор уже используется в автомобилях шестого поколения компании.
😅 Канал Serverflow в MAX: Подписаться
Основная вычислительная часть Waymo carTPU выдает 160 TOPS INT8 и 80 TFLOPS FP16. Архитектура разделена на три направления обработки данных: камеры, радары и объединение данных с разных датчиков. Каждая вычислительная секция содержит 2 RISC-V ядра с векторными расширениями и 2 МБ SRAM. Выполнение заранее компилируется в единый большой вычислительный модуль, поэтому процессор работает без кэшей и ветвлений, а компилятор заранее распределяет вычисления и обмен данными между блоками.
Waymo также встроила в чип значительную часть обработки самих датчиков. Камерный тракт включает прием данных, HDR-обработку, шумоподавление, собственную демозаикизацию и подготовку отдельных участков изображения. Для радаров и лидаров используются отдельные вычислительные блоки, в том числе для обработки точечных облаков и быстрого преобразования Фурье. После этого обработанные данные поступают в систему объединения информации от всех датчиков. По словам Waymo, этот процессор уже используется в автомобилях шестого поколения компании.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🌭2👍1
Компания XCENA представила MX1 — устройство на базе протокола CXL 3.2 Type 3, которое одновременно расширяет память сервера и выполняет вычисления рядом с данными. Через 4 канала DDR5 можно добавить до 2 ТБ памяти, подключение идет по PCIe 6.0. Кроме обычной оперативной памяти, MX1 умеет использовать SSD как дополнительное хранилище: часто используемые блоки по 64 КБ автоматически помещаются в DRAM, поэтому система может обращаться к ним через общий адресный интерфейс CXL.
В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.
В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.
😅 Канал Serverflow в MAX: Подписаться
В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.
В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Qwen3.8-Flash-Next с открытыми весами официально вышла. Нейронка с нативной мультимодальностью получила архитектуру следующего поколения ИИ-моделей Qwen4 и ряд оптимизационных апдейтов, которые значительно увеличили скорость инференса и качество ответов.
⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.
⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.
⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.
Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.
Веса уже лежат на Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
В основе — 125 млрд общих параметров, 6 млрд MoE-параметров, 51 млрд параметров n-gram embedding и еще 4 млрд параметров под механизм MTP. Также имеется 512 экспертов MoE.
⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.
⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.
⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.
В SWE-bench Pro, GPQA Diamond, LiveCodeBench и других тестах Qwen3.8-Flash-Next обходит проприетарную Claude-Opus-4.6 Max, а также открытые модели Qwen3.8 27B, Qwen3.7 Plus и DeepSeek-V4-Flash.
Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.
Веса уже лежат на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15💅4🌭2🍾2
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11
ServerFlow | Новости и Железо 💾
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня. 😅 Канал Serverflow в MAX: Подписаться
Долго ждать не пришлось — Z.ai официально выпустила GLM-5.3-Flash с открытыми весами, которая стала первой нативно мультимодальной моделью в серии GLM-5.
При общем размере 320 млрд параметров на каждом токене активируется только 18 млрд, контекстное окно достигает 1 млн токенов, а сама модель, по заявлению разработчиков, превосходит GLM-5.2 на бенчмарках и реальных задачах при стоимости инференса примерно в 10 раз ниже.
В основе GLM-5.3-Flash используется гибрид механизма sparse attention и linear attention: линейное внимание снижает стоимость обработки длинного контекста, а sparse attention сохраняет точность при работе с нужными фрагментами истории. Также появилась технология Manifold-Constrained Hyper-Connections (mHC). Она позволяет эффективнее масштабировать производительность и, по задумке Z.ai, получать больше полезных весов без пропорционального роста вычислительных затрат.
Отдельный упор сделан на мультимодальность. Для стадии pre-training использовался новый корпус данных объемом около 30 трлн токенов, включающий мультимодальные данные. Благодаря этому GLM-5.3-Flash изначально проектировалась как нативно мультимодальная модель, а не как текстовая модель с добавленным vision-модулем.
Во всех основных тестах нейронка приближается к производительности Claude Opus 4.8 и GPT-5.6 Terra, а также обходит открытые аналоги, такие как DeepSeek-V4-Vision-Exp.
Веса уже лежат на Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
При общем размере 320 млрд параметров на каждом токене активируется только 18 млрд, контекстное окно достигает 1 млн токенов, а сама модель, по заявлению разработчиков, превосходит GLM-5.2 на бенчмарках и реальных задачах при стоимости инференса примерно в 10 раз ниже.
В основе GLM-5.3-Flash используется гибрид механизма sparse attention и linear attention: линейное внимание снижает стоимость обработки длинного контекста, а sparse attention сохраняет точность при работе с нужными фрагментами истории. Также появилась технология Manifold-Constrained Hyper-Connections (mHC). Она позволяет эффективнее масштабировать производительность и, по задумке Z.ai, получать больше полезных весов без пропорционального роста вычислительных затрат.
Отдельный упор сделан на мультимодальность. Для стадии pre-training использовался новый корпус данных объемом около 30 трлн токенов, включающий мультимодальные данные. Благодаря этому GLM-5.3-Flash изначально проектировалась как нативно мультимодальная модель, а не как текстовая модель с добавленным vision-модулем.
Во всех основных тестах нейронка приближается к производительности Claude Opus 4.8 и GPT-5.6 Terra, а также обходит открытые аналоги, такие как DeepSeek-V4-Vision-Exp.
Веса уже лежат на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12🍾2💅1
По данным Bloomberg, Huawei ведет переговоры с Египтом для поставки более 2000 ИИ-чипов Ascend 950 и Ascend 910B для создания вычислительной инфраструктуры для египетских военных, служб наблюдения и других государственных структур. Строительство ЦОД планируют завершить за 12 месяцев. Интересно, что сейчас США работают над встречным предложением, чтобы организовать поставки GPU Nvidia и AMD.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍9🍾5
ServerFlow | Новости и Железо 💾
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня. 😅 Канал Serverflow в MAX: Подписаться
Кстати, ИИ-инженеры команды Google ранее намекали, что Ox Alpha является разработкой отдела DeepMind. Такого позора не испытывала даже Anthropic…
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍10💅5🤯1
Reuters сообщает, что Moonshot AI ведет переговоры с Microsoft, Amazon и Google о переносе Kimi K3 в облачную инфраструктуру Azure, AWS и Google Cloud. Moonshot претендует на 30% доходов, связанных с K3, и это может стать первой крупной сделкой по распределению доходов от облачных систем между Китаем и США.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤯16👍1
Nvidia RTX 5090 настолько тяжелая, что может буквально продавить материнскую плату 👀
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯30💩4👍3
Сообщается, что CXMT и YMTC не намерены поставлять Apple большие объемы микросхем памяти, но все же хотели бы получить право на поставки DRAM американскому IT-гиганту.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🤯5🍾2
В конце 90-х AMD выпускала такие часы в качестве промо-мерча для продвижения своего знаменитого процессора K6-2 с технологией 3DNow.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍22
Мир не будет прежним: по данным Reuters, Nvidia ведет переговоры о покупке Hugging Face за $12.9 млрд.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯39💩10
ServerFlow | Новости и Железо 💾
Мир не будет прежним: по данным Reuters, Nvidia ведет переговоры о покупке Hugging Face за $12.9 млрд. 😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍49🤯5💩3😡3🌭1
Линус Торвальдс заявил, что поиск ошибки в драйвере Intel GFX для Linux был “адской сессией отладки”. Когда он задействовал ИИ для фикса, нейронка назвала задачу “невыполнимой” и предлагала просто сделать отчет. После 24 отладочных патчей ошибка все же нашлась: функция round_up() должна была быть round_down(). Вот тебе и ИИ в кодинге…
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍44💅10🤯3😡2