ServerFlow | Новости и Железо 💾
4.25K subscribers
4.95K photos
392 videos
12 files
2.42K links
Серверы, нейронки, инсайды и немного технической магии. Мы препарируем железо, тестим AI-движки и рассказываем всё как есть.

Хотите поболтать?
https://t.me/serverflow_chat

Оформить заказ?
@ServerFlow

Сотрудничество?
@marketing_sf

https://serverflow.ru
Download Telegram
Intel свернула планы по Battlemage с 3D-кэшем и 40 ядрами Xe2

Инсайдеры раскрыли отмененные планы Intel по выпуску линейки GPU BMG-G10, у которых было до 40 ядер Xe2, 512 МБ 3D-V кэша и интерфейсом PCIe 5.0, которые должны были войти в линейку Battlemage.

Эти решения разрабатывались для мощных ИИ-ускорителей с 192-битными и 256-битными шинами памяти и также рассматривались как основа для интеграции в процессоры Halo SoC.

Видеокарты на базе BMG-G10 должны были называться Battlemage X3/X4 (до 28 ядер у X3 и до 40 ядер у X4). На плате могло размещаться до 6 чипов GDDR6, а питание подавалось по 2×8 pin).


Процессоры Halo SoC с этим GPU также отменили — теперь ставка делается на Nova Lake с графикой Xe3P.

Причина сворачивания — финансовое давление и реструктуризация GPU-подразделения под новым руководством. Battlemage BMG-G21 с 20 ядрами Xe2 остался единственным представителем отмененной серии.
🤯1
Сегодня вечером на Ютубе Выйдет одна из самых красивых сборок, что мы снимали.📈

Gigabyte MZ73-LM0 + 2x EPYC + H100 96GB


В этом ролике мы покажем, как DeepSeek R1 70B работает на этом железе и какого размера контекста нам удалось достигнуть.
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍42💩1
🤖 LongCat-Flash-Omni: мультимодальная модель с 560 млрд параметров

Компания Meituan LongCat очень неожиданно перешла из сферы доставки еды в область разработки искусственного интеллекта, и что самое удивительное, их нейросети разрывают все шаблоны.

Недавно они представили свой новый проект LongCat-Flash-Omni — мультимодальную модель нового поколения на архитектуре MoE с 560 млрд параметров (27 млрд активных), и при этом она находится в открытом доступе на GitHub.

Нейронка объединяет текст, изображение, аудио и речь в едином контексте и работает в режиме реального времени с минимальной задержкой. Контекстное окно достигает 128 000 токенов.


LongCat-Flash-Omni использует энкодеры и декодеры для каждой модальности и обучающий конвейер с поэтапным включением модальностей. Такой подход сохраняет производительность в кросс-модальных навыках.

LongCat-Flash-Omni близка к Gemini 2.5 Pro и превосходит Qwen 3 Omni в заданиях на память и мультимодальность.
1👍3💩1🌭1
⚒️ Nano-vLLM: минималистичная версия vLLM в 1200 строк кода

А вы знали, что существует облегченная версия движка инференса vLLM? Она называется Nano-vLLM, ее разработал один из инженеров DeepSeek и движок умещается всего в 1200 строк кода на Python.

Nano-vLLM обеспечивает сопоставимую скорость вывода ИИ и сохраняет ключевые принципы оригинальной архитектуры — открытость, совместимость и высочайшую производительность.


Платформа поддерживает кэширование префиксов, тензорный параллелизм, компиляцию Torch и использование CUDA-графов. Такой набор делает ее пригодной для быстрой отладки, экспериментов и обучения принципам высокопроизводительного вывода LLM без тяжелых зависимостей.

Идеальный вариант, чтобы вкатиться в ИИ, если хочется работать с vLLM, но ориг не тянет.
👍2
Вышел Вышел Вышел

Смотрим на рабочую станцию с H100. Вообще вроде красиво получилось. Да и приятно когда токены так быстро вылетают, хотя H100 и побыстрее может)))

DeepSeek 70B Q4_K_M + 128k контекст. Посмотреть как он работает можно по таймкодам. Мы об этом позаботились!


https://youtu.be/RC44oa_m_vY?si=8prXC_X8WDfEuIw3
Please open Telegram to view this post
VIEW IN TELEGRAM
5252🌭1💅1
⚒️ Wine 10.18: подготовка к релизу 11.0 идет во всю

Популярная прога Wine для запуска приложений Windows на Linux получила новое обновление до версии 10.18.

Главные новшества — расширения режима WoW64, который позволяет запускать 32-битные Windows-программы в 64-битных системах Linux. Теперь WoW64 поддерживает отображение памяти OpenGL через Vulkan и обеспечивает сквозную работу SCSI-устройств.

Также были добавлены API барьеров синхронизации и улучшена обработка исключений WinRT. Всего исправлено около 30 ошибок, включая игровые и прикладные сбои.

Все изменения сделаны в целях подготовки к запуску нового, крупного апдейта до версии Wine 11.0.


Обновление можно скачать на официальном сайте проекта WineHQ.
👍1
🤯 PewDiePie теперь техноблогер

PewDiePie, который в прошлом был самым популярным летсплейщиком и ютубером в целом, похоже, успешно справился с кризисом среднего возраста, став…техноблогером, которого смотрят миллионы человек.

Он уже выпустил ролики про вкатывание в Linux, сборку сервака, локальный инференс нейронок по 120 млрд параметров, написание СОБСТВЕННОГО чат-бота ChatOS, настройку RAG и прочие интересности, приправляя это прикольчиками и фирменным монтажом.

При этом, за Феликсом следят свыше 110 млн человек, и миллионы зрителей реально смотрят, как он компилирует CUDA или собирает платформу на RTX 4000 Ada и RTX 4090.


А ведь все начиналось с редстоуна в майнкрафте…

Поздравляем легенду, но мы то с вами знаем, на каком канале реально шарят за серверное железо 😉
👍3
🖥 ORICO выпустила мини-ПК OmniPro в стиле Mac Pro с Ryzen 7 8845HS

Китайская компания ORICO представила компактный ПК OmniPro, который подозрительно похож на уменьшенный Mac Pro.

Корпус с габаритами 139 × 61 × 185 мм выполнен из алюминия, а внутри стоит 8-ядерный Ryzen 7 8845HS (16 потоков, до 5,1 ГГц) с графикой Radeon 780M на архитектуре RDNA 3.

Заявленная вычислительная мощность — до 38 TOPS, что позволяет использовать устройство для легких ИИ-задач и мультимедийных приложений.


Базовая версия без памяти и накопителя оценивается в ~$550, а вариант с 32 ГБ ОЗУ и 1 ТБ SSD стоит ~$605.

Модель уже доступна для заказа в Китае и, судя по форм-фактору, будет конкурировать с мини-ПК от китайских Beelink и Minisforum в нише компактных рабочих станций.
👍3
🤔 Nova Lake может вернуть AVX10 и APX в потребительские процессоры Intel

В свежих сборках NASM 3.1 нашли упоминания инструкций AVX10 и APX для архитектуры Intel Nova Lake. Это указывает, что наборы расширений для 512-битных вычислений и продвинутого векторного умножения могут появиться не только в серверных Xeon, но и в потребительских чипах. Ранее компилятор GCC отмечал их отсутствие в ранних версиях Nova Lake.

Согласно утечкам, Nova Lake получит до 52 ядер16 P-ядер, 32 E-ядер и 4 низкопрофильных, которые будут поддерживать инструкции AVX10, AMX и APX.

AVX10 — это тот же набор инструкций AVX512, но для работы на E-ядрах с 256-битным регистром. В свою очередь, AMX и APX ускоряют матричные операции и расширяют доступ к регистрам.


Таким образом, весь стек ядер Nova Lake получит ускорение для ИИ, кодирования и создания контента.

Если инфа верна, это станет первым случаем, когда Intel предложит полноценный AVX-512 в настольных CPU.

Пока подтверждений со стороны Intel нет.
👍2
⚒️ MaxKB: RAG-движок для самых важных шишек

Разработчики из сообщества LangChain (популярный RAG-конструктор) вывели на open-source рынок свой новый проект под названием MaxKB.

Эта платформа корпоративного уровня представляет из себя набор инструментов для создания ИИ-агентов корпоративного уровня, объединяющий принципы RAG, workflow и MCP в одном ядре.

В основе решения лежит RAG-конвейер с автоматическим парсингом и векторизацией документов, чтобы снизить галлюцинации моделей. Агентский движок строит управляемые цепочки действий, а интеграция с любыми LLM (DeepSeek, Qwen, OpenAI, Gemini и др.) делает платформу доступной для любых компаний.


Сценарии использования MaxKB — от клиентской поддержки до исследовательских помощников и обучения.

В комплекте также есть мультимодальная поддержка текста, изображений, аудио и видео, что превращает MaxKB в универсальную среду для ИИ-сервисов внутри компании.

Ссылочка на GitHub.
1👍1🌭1
🚀 Qwen3-Max Thinking — мощная, бесплатная и с рассуждением!

Alibaba запустила Qwen3-Max с функцией Thinking в веб-версии и мобильном приложении, что еще раз укрепляет позицию этой LLM как самой мощной нейронки от восходящего китайского ИИ-гиганта.

Модель имеет все те же 1 трлн параметров, базируется на архитектуре MoE и имеет контекстное окно в 262 000 токенов. Примечательно, что пользователи могут задать бюджет расхода токенов для рассуждения прямо в интерфейсе.

Открытых весов к сожалению, нет, а также Alibaba не поделилась подробными бенчмарками, так как релиз все еще предварительный.


Тем не менее, очевидно, что Qwen3-Max Thinking — далеко не слабый инструмент, и он будет крайне полезен для тяжелых задач кодинга и агентских операций.
👍1
⚙️ ByteDance продвигает новый формат MXINT8

Исследователи ByteDance выложили статью, где сравнили форматы вычислений MXINT8 и MXFP8. По их данным, целочисленный MXINT8 показывает лучшую точность и энергоэффективность при мелкозернистом квантовании, чем формат с плавающей запятой FP8.

Это открытие может стать началом сдвига в дизайне будущих ИИ-ускорителей, ознаменовав переход от FP к INT, особенно для массовых нагрузок инференса.


Целочисленные схемы проще и дешевле, а выигрыши в производительности при том же энергопотреблении становятся заметными уже на 8-битном уровне.
👍1