⚒️ Nano-vLLM: минималистичная версия vLLM в 1200 строк кода
А вы знали, что существует облегченная версия движка инференса vLLM? Она называется Nano-vLLM, ее разработал один из инженеров DeepSeek и движок умещается всего в 1200 строк кода на Python.
Платформа поддерживает кэширование префиксов, тензорный параллелизм, компиляцию Torch и использование CUDA-графов. Такой набор делает ее пригодной для быстрой отладки, экспериментов и обучения принципам высокопроизводительного вывода LLM без тяжелых зависимостей.
Идеальный вариант, чтобы вкатиться в ИИ, если хочется работать с vLLM, но ориг не тянет.
А вы знали, что существует облегченная версия движка инференса vLLM? Она называется Nano-vLLM, ее разработал один из инженеров DeepSeek и движок умещается всего в 1200 строк кода на Python.
Nano-vLLM обеспечивает сопоставимую скорость вывода ИИ и сохраняет ключевые принципы оригинальной архитектуры — открытость, совместимость и высочайшую производительность.
Платформа поддерживает кэширование префиксов, тензорный параллелизм, компиляцию Torch и использование CUDA-графов. Такой набор делает ее пригодной для быстрой отладки, экспериментов и обучения принципам высокопроизводительного вывода LLM без тяжелых зависимостей.
Идеальный вариант, чтобы вкатиться в ИИ, если хочется работать с vLLM, но ориг не тянет.
👍2
Смотрим на рабочую станцию с H100. Вообще вроде красиво получилось. Да и приятно когда токены так быстро вылетают, хотя H100 и побыстрее может)))
DeepSeek 70B Q4_K_M + 128k контекст. Посмотреть как он работает можно по таймкодам. Мы об этом позаботились!
https://youtu.be/RC44oa_m_vY?si=8prXC_X8WDfEuIw3
Please open Telegram to view this post
VIEW IN TELEGRAM
YouTube
Сборка сервера для ИИ: DeepSeek локально на H100 и EPYC
Собираем сервер для ИИ на двух процессорах AMD EPYC и видеокарте NVIDIA H100. Это мощная рабочая станция, созданная для задач обучения и инференса нейросетей. Демонстрируем процесс сборки, организацию охлаждения, кабель-менеджмент и установку компонентов…
52 5 2🌭1💅1
⚒️ Wine 10.18: подготовка к релизу 11.0 идет во всю
Популярная прога Wine для запуска приложений Windows на Linux получила новое обновление до версии 10.18.
Главные новшества — расширения режима WoW64, который позволяет запускать 32-битные Windows-программы в 64-битных системах Linux. Теперь WoW64 поддерживает отображение памяти OpenGL через Vulkan и обеспечивает сквозную работу SCSI-устройств.
Также были добавлены API барьеров синхронизации и улучшена обработка исключений WinRT. Всего исправлено около 30 ошибок, включая игровые и прикладные сбои.
Обновление можно скачать на официальном сайте проекта WineHQ.
Популярная прога Wine для запуска приложений Windows на Linux получила новое обновление до версии 10.18.
Главные новшества — расширения режима WoW64, который позволяет запускать 32-битные Windows-программы в 64-битных системах Linux. Теперь WoW64 поддерживает отображение памяти OpenGL через Vulkan и обеспечивает сквозную работу SCSI-устройств.
Также были добавлены API барьеров синхронизации и улучшена обработка исключений WinRT. Всего исправлено около 30 ошибок, включая игровые и прикладные сбои.
Все изменения сделаны в целях подготовки к запуску нового, крупного апдейта до версии Wine 11.0.
Обновление можно скачать на официальном сайте проекта WineHQ.
👍1
🤯 PewDiePie теперь техноблогер
PewDiePie, который в прошлом был самым популярным летсплейщиком и ютубером в целом, похоже, успешно справился с кризисом среднего возраста, став…техноблогером, которого смотрят миллионы человек.
Он уже выпустил ролики про вкатывание в Linux, сборку сервака, локальный инференс нейронок по 120 млрд параметров, написание СОБСТВЕННОГО чат-бота ChatOS, настройку RAG и прочие интересности, приправляя это прикольчиками и фирменным монтажом.
А ведь все начиналось с редстоуна в майнкрафте…
Поздравляем легенду, но мы то с вами знаем, на каком канале реально шарят за серверное железо 😉
PewDiePie, который в прошлом был самым популярным летсплейщиком и ютубером в целом, похоже, успешно справился с кризисом среднего возраста, став…техноблогером, которого смотрят миллионы человек.
Он уже выпустил ролики про вкатывание в Linux, сборку сервака, локальный инференс нейронок по 120 млрд параметров, написание СОБСТВЕННОГО чат-бота ChatOS, настройку RAG и прочие интересности, приправляя это прикольчиками и фирменным монтажом.
При этом, за Феликсом следят свыше 110 млн человек, и миллионы зрителей реально смотрят, как он компилирует CUDA или собирает платформу на RTX 4000 Ada и RTX 4090.
А ведь все начиналось с редстоуна в майнкрафте…
Поздравляем легенду, но мы то с вами знаем, на каком канале реально шарят за серверное железо 😉
👍3
🖥 ORICO выпустила мини-ПК OmniPro в стиле Mac Pro с Ryzen 7 8845HS
Китайская компания ORICO представила компактный ПК OmniPro, который подозрительно похож на уменьшенный Mac Pro.
Корпус с габаритами 139 × 61 × 185 мм выполнен из алюминия, а внутри стоит 8-ядерный Ryzen 7 8845HS (16 потоков, до 5,1 ГГц) с графикой Radeon 780M на архитектуре RDNA 3.
Базовая версия без памяти и накопителя оценивается в ~$550, а вариант с 32 ГБ ОЗУ и 1 ТБ SSD стоит ~$605.
Модель уже доступна для заказа в Китае и, судя по форм-фактору, будет конкурировать с мини-ПК от китайских Beelink и Minisforum в нише компактных рабочих станций.
Китайская компания ORICO представила компактный ПК OmniPro, который подозрительно похож на уменьшенный Mac Pro.
Корпус с габаритами 139 × 61 × 185 мм выполнен из алюминия, а внутри стоит 8-ядерный Ryzen 7 8845HS (16 потоков, до 5,1 ГГц) с графикой Radeon 780M на архитектуре RDNA 3.
Заявленная вычислительная мощность — до 38 TOPS, что позволяет использовать устройство для легких ИИ-задач и мультимедийных приложений.
Базовая версия без памяти и накопителя оценивается в ~$550, а вариант с 32 ГБ ОЗУ и 1 ТБ SSD стоит ~$605.
Модель уже доступна для заказа в Китае и, судя по форм-фактору, будет конкурировать с мини-ПК от китайских Beelink и Minisforum в нише компактных рабочих станций.
👍3
🤔 Nova Lake может вернуть AVX10 и APX в потребительские процессоры Intel
В свежих сборках NASM 3.1 нашли упоминания инструкций AVX10 и APX для архитектуры Intel Nova Lake. Это указывает, что наборы расширений для 512-битных вычислений и продвинутого векторного умножения могут появиться не только в серверных Xeon, но и в потребительских чипах. Ранее компилятор GCC отмечал их отсутствие в ранних версиях Nova Lake.
Согласно утечкам, Nova Lake получит до 52 ядер — 16 P-ядер, 32 E-ядер и 4 низкопрофильных, которые будут поддерживать инструкции AVX10, AMX и APX.
Таким образом, весь стек ядер Nova Lake получит ускорение для ИИ, кодирования и создания контента.
Если инфа верна, это станет первым случаем, когда Intel предложит полноценный AVX-512 в настольных CPU.
Пока подтверждений со стороны Intel нет.
В свежих сборках NASM 3.1 нашли упоминания инструкций AVX10 и APX для архитектуры Intel Nova Lake. Это указывает, что наборы расширений для 512-битных вычислений и продвинутого векторного умножения могут появиться не только в серверных Xeon, но и в потребительских чипах. Ранее компилятор GCC отмечал их отсутствие в ранних версиях Nova Lake.
Согласно утечкам, Nova Lake получит до 52 ядер — 16 P-ядер, 32 E-ядер и 4 низкопрофильных, которые будут поддерживать инструкции AVX10, AMX и APX.
AVX10 — это тот же набор инструкций AVX512, но для работы на E-ядрах с 256-битным регистром. В свою очередь, AMX и APX ускоряют матричные операции и расширяют доступ к регистрам.
Таким образом, весь стек ядер Nova Lake получит ускорение для ИИ, кодирования и создания контента.
Если инфа верна, это станет первым случаем, когда Intel предложит полноценный AVX-512 в настольных CPU.
Пока подтверждений со стороны Intel нет.
👍2
⚒️ MaxKB: RAG-движок для самых важных шишек
Разработчики из сообщества LangChain (популярный RAG-конструктор) вывели на open-source рынок свой новый проект под названием MaxKB.
Эта платформа корпоративного уровня представляет из себя набор инструментов для создания ИИ-агентов корпоративного уровня, объединяющий принципы RAG, workflow и MCP в одном ядре.
Сценарии использования MaxKB — от клиентской поддержки до исследовательских помощников и обучения.
В комплекте также есть мультимодальная поддержка текста, изображений, аудио и видео, что превращает MaxKB в универсальную среду для ИИ-сервисов внутри компании.
Ссылочка на GitHub.
Разработчики из сообщества LangChain (популярный RAG-конструктор) вывели на open-source рынок свой новый проект под названием MaxKB.
Эта платформа корпоративного уровня представляет из себя набор инструментов для создания ИИ-агентов корпоративного уровня, объединяющий принципы RAG, workflow и MCP в одном ядре.
В основе решения лежит RAG-конвейер с автоматическим парсингом и векторизацией документов, чтобы снизить галлюцинации моделей. Агентский движок строит управляемые цепочки действий, а интеграция с любыми LLM (DeepSeek, Qwen, OpenAI, Gemini и др.) делает платформу доступной для любых компаний.
Сценарии использования MaxKB — от клиентской поддержки до исследовательских помощников и обучения.
В комплекте также есть мультимодальная поддержка текста, изображений, аудио и видео, что превращает MaxKB в универсальную среду для ИИ-сервисов внутри компании.
Ссылочка на GitHub.
1👍1🌭1
🚀 Qwen3-Max Thinking — мощная, бесплатная и с рассуждением!
Alibaba запустила Qwen3-Max с функцией Thinking в веб-версии и мобильном приложении, что еще раз укрепляет позицию этой LLM как самой мощной нейронки от восходящего китайского ИИ-гиганта.
Модель имеет все те же 1 трлн параметров, базируется на архитектуре MoE и имеет контекстное окно в 262 000 токенов. Примечательно, что пользователи могут задать бюджет расхода токенов для рассуждения прямо в интерфейсе.
Тем не менее, очевидно, что Qwen3-Max Thinking — далеко не слабый инструмент, и он будет крайне полезен для тяжелых задач кодинга и агентских операций.
Alibaba запустила Qwen3-Max с функцией Thinking в веб-версии и мобильном приложении, что еще раз укрепляет позицию этой LLM как самой мощной нейронки от восходящего китайского ИИ-гиганта.
Модель имеет все те же 1 трлн параметров, базируется на архитектуре MoE и имеет контекстное окно в 262 000 токенов. Примечательно, что пользователи могут задать бюджет расхода токенов для рассуждения прямо в интерфейсе.
Открытых весов к сожалению, нет, а также Alibaba не поделилась подробными бенчмарками, так как релиз все еще предварительный.
Тем не менее, очевидно, что Qwen3-Max Thinking — далеко не слабый инструмент, и он будет крайне полезен для тяжелых задач кодинга и агентских операций.
👍1
⚙️ ByteDance продвигает новый формат MXINT8
Исследователи ByteDance выложили статью, где сравнили форматы вычислений MXINT8 и MXFP8. По их данным, целочисленный MXINT8 показывает лучшую точность и энергоэффективность при мелкозернистом квантовании, чем формат с плавающей запятой FP8.
Целочисленные схемы проще и дешевле, а выигрыши в производительности при том же энергопотреблении становятся заметными уже на 8-битном уровне.
Исследователи ByteDance выложили статью, где сравнили форматы вычислений MXINT8 и MXFP8. По их данным, целочисленный MXINT8 показывает лучшую точность и энергоэффективность при мелкозернистом квантовании, чем формат с плавающей запятой FP8.
Это открытие может стать началом сдвига в дизайне будущих ИИ-ускорителей, ознаменовав переход от FP к INT, особенно для массовых нагрузок инференса.
Целочисленные схемы проще и дешевле, а выигрыши в производительности при том же энергопотреблении становятся заметными уже на 8-битном уровне.
👍1
🕵️♂️ У NVIDIA есть своя ОС для DGX. И мы её достали.
Знали, что NVIDIA для DGX-систем использует отдельную операционку — DGX-OS?
Не Debian не Rocky, а собственный образ, который ставят на DGX серваки с GB200/GB300.
Мы нашли старую версию и запустили её в live-режиме. Установить не удалось, но этого хватило, чтобы убедиться:
• отдельный дистрибутив, не просто “Ubuntu с драйверами”
• встроенные Mellanox + NVSwitch драйверы
• полностью подготовленная среда под многогранную GPU-архитектуру DGX
• для работы с ним нужна подписка Nvidia AI Enterprise
Это закрытая экосистема. NVIDIA вкладывается, чтобы DGX работал как единый организм, а не как сервер “на коленке”.
Позже разберёмся, что там под капотом, и можно ли вытащить часть этих фишек в обычную инфраструктуру(можно) , а пока статья в разработке.
Знали, что NVIDIA для DGX-систем использует отдельную операционку — DGX-OS?
Не Debian не Rocky, а собственный образ, который ставят на DGX серваки с GB200/GB300.
Мы нашли старую версию и запустили её в live-режиме. Установить не удалось, но этого хватило, чтобы убедиться:
• отдельный дистрибутив, не просто “Ubuntu с драйверами”
• встроенные Mellanox + NVSwitch драйверы
• полностью подготовленная среда под многогранную GPU-архитектуру DGX
• для работы с ним нужна подписка Nvidia AI Enterprise
Это закрытая экосистема. NVIDIA вкладывается, чтобы DGX работал как единый организм, а не как сервер “на коленке”.
Позже разберёмся, что там под капотом, и можно ли вытащить часть этих фишек в обычную инфраструктуру
1👍2💅1 1
🧪 ИИ-ученые? Наконец-то! Выпустили ИИ-проект Denario для написания научных статей
Исследователи из команды Astropilot AI представили мультиагетскую систему Denario, которая способна выполнять полный цикл научных исследований: от формирования гипотезы до выполнения экспериментов и написания статьи.
Denario объединяет десятки ИИ-агентов, среди которых есть “генератор идей”, “критик” и управляющий уровень, который координирует их взаимодействие.
Если проект будет успешен, Denario станет первой полноценной платформой для автономных исследований, где человек выступает не автором, а заказчиком эксперимента.
Идеальный кандидат на следующую Нобелевскую премию найден.
Исследователи из команды Astropilot AI представили мультиагетскую систему Denario, которая способна выполнять полный цикл научных исследований: от формирования гипотезы до выполнения экспериментов и написания статьи.
Denario объединяет десятки ИИ-агентов, среди которых есть “генератор идей”, “критик” и управляющий уровень, который координирует их взаимодействие.
Denario умеет анализировать литературу, разрабатывать экспериментальные методы, писать и запускать код, строить графики и даже оценивать собственные результаты. По данным разработчиков, ИИ уже создал и опубликовал научные статьи в 13 областях — от квантовой физики до нейробиологии. Эксперты подтвердили новизну идей, предложенных системой.
Если проект будет успешен, Denario станет первой полноценной платформой для автономных исследований, где человек выступает не автором, а заказчиком эксперимента.
Идеальный кандидат на следующую Нобелевскую премию найден.
👍2
⌛️ Как быстро все меняется…
Три года назад, в ноябре 2022 года, OpenAI представила своего революционного чат-бота ChatGPT, который разделил мир на до и после.
Только представьте — в те времена у Intel было больше дата-центров, чем у Nvidia, синие все еще не сдали свои позиции AMD, а главными направлением IT-индустрии были облачные технологии, метавселенные и Web 3.0.
И все это всего за 3 года. Революция только начинается…
Три года назад, в ноябре 2022 года, OpenAI представила своего революционного чат-бота ChatGPT, который разделил мир на до и после.
Только представьте — в те времена у Intel было больше дата-центров, чем у Nvidia, синие все еще не сдали свои позиции AMD, а главными направлением IT-индустрии были облачные технологии, метавселенные и Web 3.0.
Никто даже подумать не мог, что релиз ChatGPT и вызванный им ИИ-бум перекроит индустрию раз и навсегда, превратив Nvidia из поставщика GPU для геймеров в ключевого игрока ИИ-инфраструктуры и самую дорогую компанию с капитализацией $5 трлн.
И все это всего за 3 года. Революция только начинается…
👍2
😱 А вот так выглядит самая мощная рабочая станция в мире.
Да, это тот самый "DGX системник", который так расхваливал Хуанг — в нем стоит суперчип GB300 на базе двух GPU Blackwell Ultra B300 и CPU Grace.
На самом деле, язык с трудом поворачивается назвать этого монстра рабочей станцией, ведь характеристики выдают в нем полноценный сервер: 288 ГБ памяти HBM3E с пропускной способностью 8 ТБ/с, 1 440 PFLOPS в FP4 и мощность в 1400 Вт.
В продажу эти DGX-станции еще не вышли, но уже известно, что поставкой займутся ASUS, Dell, Lenovo, HP и другие OEM-партнеры Nvidia.
Да, это тот самый "DGX системник", который так расхваливал Хуанг — в нем стоит суперчип GB300 на базе двух GPU Blackwell Ultra B300 и CPU Grace.
На самом деле, язык с трудом поворачивается назвать этого монстра рабочей станцией, ведь характеристики выдают в нем полноценный сервер: 288 ГБ памяти HBM3E с пропускной способностью 8 ТБ/с, 1 440 PFLOPS в FP4 и мощность в 1400 Вт.
Другими словами, полноразмерные нейкронки без квантизации на такой машине можно щелкать как орешки.
В продажу эти DGX-станции еще не вышли, но уже известно, что поставкой займутся ASUS, Dell, Lenovo, HP и другие OEM-партнеры Nvidia.
1👍3