ServerFlow | Новости и Железо 💾
4.23K subscribers
4.87K photos
386 videos
12 files
2.36K links
Серверы, нейронки, инсайды и немного технической магии. Мы препарируем железо, тестим AI-движки и рассказываем всё как есть.

Хотите поболтать?
https://t.me/serverflow_chat

Оформить заказ?
@ServerFlow

Сотрудничество?
@marketing_sf

https://serverflow.ru
Download Telegram
На Hot Chips 2026 компания Waymo раскрыла детали о Sensor Fusion Processor — их ASIC-чипе для обработки данных с камер, LiDAR и радаров. Чип производится по техпроцессу TSMC N5, устанавливается в корпус FCBGA и работает с TDP менее 75 Вт. Внутри чипа находятся 64 МБ SRAM, 8 МБ регистровой памяти, LPDDR5X с пропускной способностью 273 ГБ/с, PCIe 5.0 x8 и контроллер 25GbE.

Основная вычислительная часть Waymo carTPU выдает 160 TOPS INT8 и 80 TFLOPS FP16. Архитектура разделена на три направления обработки данных: камеры, радары и объединение данных с разных датчиков. Каждая вычислительная секция содержит 2 RISC-V ядра с векторными расширениями и 2 МБ SRAM. Выполнение заранее компилируется в единый большой вычислительный модуль, поэтому процессор работает без кэшей и ветвлений, а компилятор заранее распределяет вычисления и обмен данными между блоками.

Waymo также встроила в чип значительную часть обработки самих датчиков. Камерный тракт включает прием данных, HDR-обработку, шумоподавление, собственную демозаикизацию и подготовку отдельных участков изображения. Для радаров и лидаров используются отдельные вычислительные блоки, в том числе для обработки точечных облаков и быстрого преобразования Фурье. После этого обработанные данные поступают в систему объединения информации от всех датчиков. По словам Waymo, этот процессор уже используется в автомобилях шестого поколения компании.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🌭2👍1
Компания XCENA представила MX1 — устройство на базе протокола CXL 3.2 Type 3, которое одновременно расширяет память сервера и выполняет вычисления рядом с данными. Через 4 канала DDR5 можно добавить до 2 ТБ памяти, подключение идет по PCIe 6.0. Кроме обычной оперативной памяти, MX1 умеет использовать SSD как дополнительное хранилище: часто используемые блоки по 64 КБ автоматически помещаются в DRAM, поэтому система может обращаться к ним через общий адресный интерфейс CXL.

В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.

В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Qwen3.8-Flash-Next с открытыми весами официально вышла. Нейронка с нативной мультимодальностью получила архитектуру следующего поколения ИИ-моделей Qwen4 и ряд оптимизационных апдейтов, которые значительно увеличили скорость инференса и качество ответов.

В основе — 125 млрд общих параметров, 6 млрд MoE-параметров, 51 млрд параметров n-gram embedding и еще 4 млрд параметров под механизм MTP. Также имеется 512 экспертов MoE.


⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.

⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.

⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.

В SWE-bench Pro, GPQA Diamond, LiveCodeBench и других тестах Qwen3.8-Flash-Next обходит проприетарную Claude-Opus-4.6 Max, а также открытые модели Qwen3.8 27B, Qwen3.7 Plus и DeepSeek-V4-Flash.


Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.

Веса уже лежат на Hugging Face.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15💅4🌭2🍾2
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11
ServerFlow | Новости и Железо 💾
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня. 😅 Канал Serverflow в MAX: Подписаться
Долго ждать не пришлось — Z.ai официально выпустила GLM-5.3-Flash с открытыми весами, которая стала первой нативно мультимодальной моделью в серии GLM-5. 

При общем размере 320 млрд параметров на каждом токене активируется только 18 млрд, контекстное окно достигает 1 млн токенов, а сама модель, по заявлению разработчиков, превосходит GLM-5.2 на бенчмарках и реальных задачах при стоимости инференса примерно в 10 раз ниже. 

В основе GLM-5.3-Flash используется гибрид механизма sparse attention и linear attention: линейное внимание снижает стоимость обработки длинного контекста, а sparse attention сохраняет точность при работе с нужными фрагментами истории. Также появилась технология Manifold-Constrained Hyper-Connections (mHC). Она позволяет эффективнее масштабировать производительность и, по задумке Z.ai, получать больше полезных весов без пропорционального роста вычислительных затрат.

Отдельный упор сделан на мультимодальность. Для стадии pre-training использовался новый корпус данных объемом около 30 трлн токенов, включающий мультимодальные данные. Благодаря этому GLM-5.3-Flash изначально проектировалась как нативно мультимодальная модель, а не как текстовая модель с добавленным vision-модулем.

Во всех основных тестах нейронка приближается к производительности Claude Opus 4.8 и GPT-5.6 Terra, а также обходит открытые аналоги, такие как DeepSeek-V4-Vision-Exp.

Веса уже лежат на Hugging Face.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12🍾2💅1
По данным Bloomberg, Huawei ведет переговоры с Египтом для поставки более 2000 ИИ-чипов Ascend 950 и Ascend 910B для создания вычислительной инфраструктуры для египетских военных, служб наблюдения и других государственных структур. Строительство ЦОД планируют завершить за 12 месяцев. Интересно, что сейчас США работают над встречным предложением, чтобы организовать поставки GPU Nvidia и AMD.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍9🍾5
Reuters сообщает, что Moonshot AI ведет переговоры с Microsoft, Amazon и Google о переносе Kimi K3 в облачную инфраструктуру Azure, AWS и Google Cloud. Moonshot претендует на 30% доходов, связанных с K3, и это может стать первой крупной сделкой по распределению доходов от облачных систем между Китаем и США.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤯16👍1
Nvidia RTX 5090 настолько тяжелая, что может буквально продавить материнскую плату 👀

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯30💩4👍3
Сообщается, что CXMT и YMTC не намерены поставлять Apple большие объемы микросхем памяти, но все же хотели бы получить право на поставки DRAM американскому IT-гиганту.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🤯5🍾2
В конце 90-х AMD выпускала такие часы в качестве промо-мерча для продвижения своего знаменитого процессора K6-2 с технологией 3DNow.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍22
Мир не будет прежним: по данным Reuters, Nvidia ведет переговоры о покупке Hugging Face за $12.9 млрд.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯39💩10
Линус Торвальдс заявил, что поиск ошибки в драйвере Intel GFX для Linux был “адской сессией отладки”. Когда он задействовал ИИ для фикса, нейронка назвала задачу “невыполнимой” и предлагала просто сделать отчет. После 24 отладочных патчей ошибка все же нашлась: функция round_up() должна была быть round_down(). Вот тебе и ИИ в кодинге…

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍44💅10🤯3😡2