Компания XCENA представила MX1 — устройство на базе протокола CXL 3.2 Type 3, которое одновременно расширяет память сервера и выполняет вычисления рядом с данными. Через 4 канала DDR5 можно добавить до 2 ТБ памяти, подключение идет по PCIe 6.0. Кроме обычной оперативной памяти, MX1 умеет использовать SSD как дополнительное хранилище: часто используемые блоки по 64 КБ автоматически помещаются в DRAM, поэтому система может обращаться к ним через общий адресный интерфейс CXL.
В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.
В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.
😅 Канал Serverflow в MAX: Подписаться
В MX1 установлено более 1000 специализированных RISC-V ядер для обработки данных непосредственно рядом с памятью. Они берут на себя операции, которые обычно выполняются центральным процессором и требуют постоянного перетаскивания больших массивов данных: поиск по векторам, обработку KV-кэша, фильтрацию, сортировку трафика и другие подобные задачи. Встроенные векторные блоки обеспечивают до 3 TFLOPS в FP32/FP16 на операциях скалярного произведения.
В собственных тестах XCENA один MX1 обработал типовые задачи в 4,7 раза быстрее, чем центральный процессор при работе через CXL, и оказался в 18,7 раза эффективнее по энергопотреблению. При обращении к локальной DDR5 преимущество составило 2 раза по скорости и 6,2 раза по энергоэффективности. Массовое производство MX1 XCENA планирует начать к концу 2026 года.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Qwen3.8-Flash-Next с открытыми весами официально вышла. Нейронка с нативной мультимодальностью получила архитектуру следующего поколения ИИ-моделей Qwen4 и ряд оптимизационных апдейтов, которые значительно увеличили скорость инференса и качество ответов.
⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.
⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.
⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.
Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.
Веса уже лежат на Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
В основе — 125 млрд общих параметров, 6 млрд MoE-параметров, 51 млрд параметров n-gram embedding и еще 4 млрд параметров под механизм MTP. Также имеется 512 экспертов MoE.
⚙️ Первый апдейт — новая система внимания Gated DeltaNet + Qwen Sparse Attention (QSA). QSA не пытается обрабатывать каждый отдельный токен длинного контекста: вместо этого модель выбирает микроблоки, сокращая объем работы с историей. В Qwen рассчитывают, что это особенно поможет в сценариях с длинным контекстом. Контекст модели составляет 262 144 токена нативно, а архитектура рассчитана на расширение до 1 млн токенов.
⚙️ Второй апдейт — система Gated Residual. Вместо простой обработки информации модель использует управляемые read/write-механизмы: они позволяют динамически регулировать поток информации между слоями, оптимизируя вычисления.
⚙️ Третий апдейт — модель масштабируется через механизм N-gram Embedding. Вместо того чтобы увеличивать вычислительно дорогие компоненты MoE, дополнительные параметры размещаются в энбеддинги. В Qwen3.8-Flash-Next для этого выделено 51 млрд параметров, что позволяет увеличивать объем модели с меньшими требованиями к вычислениям и лучше подходит для систем с ограниченной памятью.
В SWE-bench Pro, GPQA Diamond, LiveCodeBench и других тестах Qwen3.8-Flash-Next обходит проприетарную Claude-Opus-4.6 Max, а также открытые модели Qwen3.8 27B, Qwen3.7 Plus и DeepSeek-V4-Flash.
Qwen3.8-Flash-Next пока является экспериментальным preview, а не финальной версией нового поколения LLM — ею станет переход на Qwen 4.
Веса уже лежат на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15💅4🌭2🍾2
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11
ServerFlow | Новости и Железо 💾
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня. 😅 Канал Serverflow в MAX: Подписаться
Долго ждать не пришлось — Z.ai официально выпустила GLM-5.3-Flash с открытыми весами, которая стала первой нативно мультимодальной моделью в серии GLM-5.
При общем размере 320 млрд параметров на каждом токене активируется только 18 млрд, контекстное окно достигает 1 млн токенов, а сама модель, по заявлению разработчиков, превосходит GLM-5.2 на бенчмарках и реальных задачах при стоимости инференса примерно в 10 раз ниже.
В основе GLM-5.3-Flash используется гибрид механизма sparse attention и linear attention: линейное внимание снижает стоимость обработки длинного контекста, а sparse attention сохраняет точность при работе с нужными фрагментами истории. Также появилась технология Manifold-Constrained Hyper-Connections (mHC). Она позволяет эффективнее масштабировать производительность и, по задумке Z.ai, получать больше полезных весов без пропорционального роста вычислительных затрат.
Отдельный упор сделан на мультимодальность. Для стадии pre-training использовался новый корпус данных объемом около 30 трлн токенов, включающий мультимодальные данные. Благодаря этому GLM-5.3-Flash изначально проектировалась как нативно мультимодальная модель, а не как текстовая модель с добавленным vision-модулем.
Во всех основных тестах нейронка приближается к производительности Claude Opus 4.8 и GPT-5.6 Terra, а также обходит открытые аналоги, такие как DeepSeek-V4-Vision-Exp.
Веса уже лежат на Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
При общем размере 320 млрд параметров на каждом токене активируется только 18 млрд, контекстное окно достигает 1 млн токенов, а сама модель, по заявлению разработчиков, превосходит GLM-5.2 на бенчмарках и реальных задачах при стоимости инференса примерно в 10 раз ниже.
В основе GLM-5.3-Flash используется гибрид механизма sparse attention и linear attention: линейное внимание снижает стоимость обработки длинного контекста, а sparse attention сохраняет точность при работе с нужными фрагментами истории. Также появилась технология Manifold-Constrained Hyper-Connections (mHC). Она позволяет эффективнее масштабировать производительность и, по задумке Z.ai, получать больше полезных весов без пропорционального роста вычислительных затрат.
Отдельный упор сделан на мультимодальность. Для стадии pre-training использовался новый корпус данных объемом около 30 трлн токенов, включающий мультимодальные данные. Благодаря этому GLM-5.3-Flash изначально проектировалась как нативно мультимодальная модель, а не как текстовая модель с добавленным vision-модулем.
Во всех основных тестах нейронка приближается к производительности Claude Opus 4.8 и GPT-5.6 Terra, а также обходит открытые аналоги, такие как DeepSeek-V4-Vision-Exp.
Веса уже лежат на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12🍾2💅1
По данным Bloomberg, Huawei ведет переговоры с Египтом для поставки более 2000 ИИ-чипов Ascend 950 и Ascend 910B для создания вычислительной инфраструктуры для египетских военных, служб наблюдения и других государственных структур. Строительство ЦОД планируют завершить за 12 месяцев. Интересно, что сейчас США работают над встречным предложением, чтобы организовать поставки GPU Nvidia и AMD.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍9🍾5
ServerFlow | Новости и Железо 💾
Команда Z.ai подтвердила, что гост-модель Ox Alpha — это тестирование новой флагманской нейронки GLM-5.3 Flash, релиз которой намечен уже на сегодня. 😅 Канал Serverflow в MAX: Подписаться
Кстати, ИИ-инженеры команды Google ранее намекали, что Ox Alpha является разработкой отдела DeepMind. Такого позора не испытывала даже Anthropic…
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍10💅5🤯1
Reuters сообщает, что Moonshot AI ведет переговоры с Microsoft, Amazon и Google о переносе Kimi K3 в облачную инфраструктуру Azure, AWS и Google Cloud. Moonshot претендует на 30% доходов, связанных с K3, и это может стать первой крупной сделкой по распределению доходов от облачных систем между Китаем и США.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤯16👍1
Nvidia RTX 5090 настолько тяжелая, что может буквально продавить материнскую плату 👀
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯30💩4👍3
Сообщается, что CXMT и YMTC не намерены поставлять Apple большие объемы микросхем памяти, но все же хотели бы получить право на поставки DRAM американскому IT-гиганту.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🤯5🍾2
В конце 90-х AMD выпускала такие часы в качестве промо-мерча для продвижения своего знаменитого процессора K6-2 с технологией 3DNow.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍22
Мир не будет прежним: по данным Reuters, Nvidia ведет переговоры о покупке Hugging Face за $12.9 млрд.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯39💩10
ServerFlow | Новости и Железо 💾
Мир не будет прежним: по данным Reuters, Nvidia ведет переговоры о покупке Hugging Face за $12.9 млрд. 😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍49🤯5💩3😡3🌭1
Линус Торвальдс заявил, что поиск ошибки в драйвере Intel GFX для Linux был “адской сессией отладки”. Когда он задействовал ИИ для фикса, нейронка назвала задачу “невыполнимой” и предлагала просто сделать отчет. После 24 отладочных патчей ошибка все же нашлась: функция round_up() должна была быть round_down(). Вот тебе и ИИ в кодинге…
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍44💅10🤯3😡2
Друзья, у нас возникла идея, как разнообразить контент в нашем ТГ-канале и заодно, возможно, завести новую рубрику — как только на рынок будет выходить новая знаковая ИИ-модель, мы в кратчайшие сроки будем делать список ИИ-ускорителей и связок из нескольких GPU, которые подойдут для запуска свежей LLM.
Итак, начнем! Перед вами — 6 передовых графических решений, которые подойдут для локального инференса топовой модели Qwen3.8-Flash-Next-GGUF в квантизации Q4_K_XL 👀
Если вам придется по вкусу такой формат, мы продолжим выпускать такие топы на релизе новых нейронок. Делитесь своим мнением и рекомендациями в комментариях!
😅 Канал Serverflow в MAX: Подписаться
Итак, начнем! Перед вами — 6 передовых графических решений, которые подойдут для локального инференса топовой модели Qwen3.8-Flash-Next-GGUF в квантизации Q4_K_XL 👀
Если вам придется по вкусу такой формат, мы продолжим выпускать такие топы на релизе новых нейронок. Делитесь своим мнением и рекомендациями в комментариях!
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍83🍾5💅5💩1
NVIDIA выпустит последний драйвер GeForce Game Ready, поддерживающий Windows 10, в октябре 2026 года. С ноября 2026 года NVIDIA будет требовать установки Windows 11.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
💩34👍5😡5
Помимо GLM-5.3-Flash, компания Z.ai также готовится выпустить стандартную версию GLM-5.3 с открытыми весами. Релиз уже завтра 👀
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18
ServerFlow | Новости и Железо 💾
Apple внезапно показала сразу два новых процессора для линейки Mac: M6 для ноутбуков и ИИ-ПК на базе 2-нм техпроцесса и, что самое главное, долгожданный M5 Ultra для рабочих станций Mac Studio с архитектурой на базе 4 чиплетов. Apple M6 получил 12-ядерный…
Предзаказы на Apple Mac Studio уже стартовали — цена за версию с чипом M5 Ultra, 256 ГБ унифицированной памяти и накопитель на 16 ТБ достигает астрономических $18 299. Тем временем, Nvidia DGX Spark стоит более чем в 3 раза дешевле. Будет ли M5 Ultra настолько хорош, что переплюнет даже детище Хуанга? (тестов, само собой, пока нет). И только представьте, сколько будет стоить версия с 512 ГБ оперативки…
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯21👍2💩2🌭2
AMD в своем портале с технической информацией официально засветила следующую линейку Ryzen на архитектуре Zen 6. Для настольных AM5 указаны два семейства Olympic Ridge и Medusa1.
Olympic Ridge рассчитано на массовые и высокопроизводительные настольные ПК. В линейке ожидаются процессоры до 24 ядер, при этом один CCD сможет содержать до 12 ядер Zen 6. Также заявлена поддержка большого объёма кеша и 3D V-Cache, а теплопакет отдельных моделей должен находиться в диапазоне 65-170 Вт. Семейство будет работать как на существующих, так и на новых материнских платах AM5.
Medusa1 займёт другую нишу. Это гибридные процессоры с ядрами Zen 6 и обновлённой встроенной графикой, которые должны прийти на смену Ryzen 8000G. AMD также готовит мобильные Medusa, где количество ядер может достигать 22. При этом сама компания пока не раскрыла точные характеристики Zen 6, частоты и сроки выхода серийных чипов.
😅 Канал Serverflow в MAX: Подписаться
Olympic Ridge рассчитано на массовые и высокопроизводительные настольные ПК. В линейке ожидаются процессоры до 24 ядер, при этом один CCD сможет содержать до 12 ядер Zen 6. Также заявлена поддержка большого объёма кеша и 3D V-Cache, а теплопакет отдельных моделей должен находиться в диапазоне 65-170 Вт. Семейство будет работать как на существующих, так и на новых материнских платах AM5.
Medusa1 займёт другую нишу. Это гибридные процессоры с ядрами Zen 6 и обновлённой встроенной графикой, которые должны прийти на смену Ryzen 8000G. AMD также готовит мобильные Medusa, где количество ядер может достигать 22. При этом сама компания пока не раскрыла точные характеристики Zen 6, частоты и сроки выхода серийных чипов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🍾5