⚒️ MaxKB: RAG-движок для самых важных шишек
Разработчики из сообщества LangChain (популярный RAG-конструктор) вывели на open-source рынок свой новый проект под названием MaxKB.
Эта платформа корпоративного уровня представляет из себя набор инструментов для создания ИИ-агентов корпоративного уровня, объединяющий принципы RAG, workflow и MCP в одном ядре.
Сценарии использования MaxKB — от клиентской поддержки до исследовательских помощников и обучения.
В комплекте также есть мультимодальная поддержка текста, изображений, аудио и видео, что превращает MaxKB в универсальную среду для ИИ-сервисов внутри компании.
Ссылочка на GitHub.
Разработчики из сообщества LangChain (популярный RAG-конструктор) вывели на open-source рынок свой новый проект под названием MaxKB.
Эта платформа корпоративного уровня представляет из себя набор инструментов для создания ИИ-агентов корпоративного уровня, объединяющий принципы RAG, workflow и MCP в одном ядре.
В основе решения лежит RAG-конвейер с автоматическим парсингом и векторизацией документов, чтобы снизить галлюцинации моделей. Агентский движок строит управляемые цепочки действий, а интеграция с любыми LLM (DeepSeek, Qwen, OpenAI, Gemini и др.) делает платформу доступной для любых компаний.
Сценарии использования MaxKB — от клиентской поддержки до исследовательских помощников и обучения.
В комплекте также есть мультимодальная поддержка текста, изображений, аудио и видео, что превращает MaxKB в универсальную среду для ИИ-сервисов внутри компании.
Ссылочка на GitHub.
1👍1🌭1
🚀 Qwen3-Max Thinking — мощная, бесплатная и с рассуждением!
Alibaba запустила Qwen3-Max с функцией Thinking в веб-версии и мобильном приложении, что еще раз укрепляет позицию этой LLM как самой мощной нейронки от восходящего китайского ИИ-гиганта.
Модель имеет все те же 1 трлн параметров, базируется на архитектуре MoE и имеет контекстное окно в 262 000 токенов. Примечательно, что пользователи могут задать бюджет расхода токенов для рассуждения прямо в интерфейсе.
Тем не менее, очевидно, что Qwen3-Max Thinking — далеко не слабый инструмент, и он будет крайне полезен для тяжелых задач кодинга и агентских операций.
Alibaba запустила Qwen3-Max с функцией Thinking в веб-версии и мобильном приложении, что еще раз укрепляет позицию этой LLM как самой мощной нейронки от восходящего китайского ИИ-гиганта.
Модель имеет все те же 1 трлн параметров, базируется на архитектуре MoE и имеет контекстное окно в 262 000 токенов. Примечательно, что пользователи могут задать бюджет расхода токенов для рассуждения прямо в интерфейсе.
Открытых весов к сожалению, нет, а также Alibaba не поделилась подробными бенчмарками, так как релиз все еще предварительный.
Тем не менее, очевидно, что Qwen3-Max Thinking — далеко не слабый инструмент, и он будет крайне полезен для тяжелых задач кодинга и агентских операций.
👍1
⚙️ ByteDance продвигает новый формат MXINT8
Исследователи ByteDance выложили статью, где сравнили форматы вычислений MXINT8 и MXFP8. По их данным, целочисленный MXINT8 показывает лучшую точность и энергоэффективность при мелкозернистом квантовании, чем формат с плавающей запятой FP8.
Целочисленные схемы проще и дешевле, а выигрыши в производительности при том же энергопотреблении становятся заметными уже на 8-битном уровне.
Исследователи ByteDance выложили статью, где сравнили форматы вычислений MXINT8 и MXFP8. По их данным, целочисленный MXINT8 показывает лучшую точность и энергоэффективность при мелкозернистом квантовании, чем формат с плавающей запятой FP8.
Это открытие может стать началом сдвига в дизайне будущих ИИ-ускорителей, ознаменовав переход от FP к INT, особенно для массовых нагрузок инференса.
Целочисленные схемы проще и дешевле, а выигрыши в производительности при том же энергопотреблении становятся заметными уже на 8-битном уровне.
👍1
🕵️♂️ У NVIDIA есть своя ОС для DGX. И мы её достали.
Знали, что NVIDIA для DGX-систем использует отдельную операционку — DGX-OS?
Не Debian не Rocky, а собственный образ, который ставят на DGX серваки с GB200/GB300.
Мы нашли старую версию и запустили её в live-режиме. Установить не удалось, но этого хватило, чтобы убедиться:
• отдельный дистрибутив, не просто “Ubuntu с драйверами”
• встроенные Mellanox + NVSwitch драйверы
• полностью подготовленная среда под многогранную GPU-архитектуру DGX
• для работы с ним нужна подписка Nvidia AI Enterprise
Это закрытая экосистема. NVIDIA вкладывается, чтобы DGX работал как единый организм, а не как сервер “на коленке”.
Позже разберёмся, что там под капотом, и можно ли вытащить часть этих фишек в обычную инфраструктуру(можно) , а пока статья в разработке.
Знали, что NVIDIA для DGX-систем использует отдельную операционку — DGX-OS?
Не Debian не Rocky, а собственный образ, который ставят на DGX серваки с GB200/GB300.
Мы нашли старую версию и запустили её в live-режиме. Установить не удалось, но этого хватило, чтобы убедиться:
• отдельный дистрибутив, не просто “Ubuntu с драйверами”
• встроенные Mellanox + NVSwitch драйверы
• полностью подготовленная среда под многогранную GPU-архитектуру DGX
• для работы с ним нужна подписка Nvidia AI Enterprise
Это закрытая экосистема. NVIDIA вкладывается, чтобы DGX работал как единый организм, а не как сервер “на коленке”.
Позже разберёмся, что там под капотом, и можно ли вытащить часть этих фишек в обычную инфраструктуру
1👍2💅1 1
🧪 ИИ-ученые? Наконец-то! Выпустили ИИ-проект Denario для написания научных статей
Исследователи из команды Astropilot AI представили мультиагетскую систему Denario, которая способна выполнять полный цикл научных исследований: от формирования гипотезы до выполнения экспериментов и написания статьи.
Denario объединяет десятки ИИ-агентов, среди которых есть “генератор идей”, “критик” и управляющий уровень, который координирует их взаимодействие.
Если проект будет успешен, Denario станет первой полноценной платформой для автономных исследований, где человек выступает не автором, а заказчиком эксперимента.
Идеальный кандидат на следующую Нобелевскую премию найден.
Исследователи из команды Astropilot AI представили мультиагетскую систему Denario, которая способна выполнять полный цикл научных исследований: от формирования гипотезы до выполнения экспериментов и написания статьи.
Denario объединяет десятки ИИ-агентов, среди которых есть “генератор идей”, “критик” и управляющий уровень, который координирует их взаимодействие.
Denario умеет анализировать литературу, разрабатывать экспериментальные методы, писать и запускать код, строить графики и даже оценивать собственные результаты. По данным разработчиков, ИИ уже создал и опубликовал научные статьи в 13 областях — от квантовой физики до нейробиологии. Эксперты подтвердили новизну идей, предложенных системой.
Если проект будет успешен, Denario станет первой полноценной платформой для автономных исследований, где человек выступает не автором, а заказчиком эксперимента.
Идеальный кандидат на следующую Нобелевскую премию найден.
👍2
⌛️ Как быстро все меняется…
Три года назад, в ноябре 2022 года, OpenAI представила своего революционного чат-бота ChatGPT, который разделил мир на до и после.
Только представьте — в те времена у Intel было больше дата-центров, чем у Nvidia, синие все еще не сдали свои позиции AMD, а главными направлением IT-индустрии были облачные технологии, метавселенные и Web 3.0.
И все это всего за 3 года. Революция только начинается…
Три года назад, в ноябре 2022 года, OpenAI представила своего революционного чат-бота ChatGPT, который разделил мир на до и после.
Только представьте — в те времена у Intel было больше дата-центров, чем у Nvidia, синие все еще не сдали свои позиции AMD, а главными направлением IT-индустрии были облачные технологии, метавселенные и Web 3.0.
Никто даже подумать не мог, что релиз ChatGPT и вызванный им ИИ-бум перекроит индустрию раз и навсегда, превратив Nvidia из поставщика GPU для геймеров в ключевого игрока ИИ-инфраструктуры и самую дорогую компанию с капитализацией $5 трлн.
И все это всего за 3 года. Революция только начинается…
👍2
😱 А вот так выглядит самая мощная рабочая станция в мире.
Да, это тот самый "DGX системник", который так расхваливал Хуанг — в нем стоит суперчип GB300 на базе двух GPU Blackwell Ultra B300 и CPU Grace.
На самом деле, язык с трудом поворачивается назвать этого монстра рабочей станцией, ведь характеристики выдают в нем полноценный сервер: 288 ГБ памяти HBM3E с пропускной способностью 8 ТБ/с, 1 440 PFLOPS в FP4 и мощность в 1400 Вт.
В продажу эти DGX-станции еще не вышли, но уже известно, что поставкой займутся ASUS, Dell, Lenovo, HP и другие OEM-партнеры Nvidia.
Да, это тот самый "DGX системник", который так расхваливал Хуанг — в нем стоит суперчип GB300 на базе двух GPU Blackwell Ultra B300 и CPU Grace.
На самом деле, язык с трудом поворачивается назвать этого монстра рабочей станцией, ведь характеристики выдают в нем полноценный сервер: 288 ГБ памяти HBM3E с пропускной способностью 8 ТБ/с, 1 440 PFLOPS в FP4 и мощность в 1400 Вт.
Другими словами, полноразмерные нейкронки без квантизации на такой машине можно щелкать как орешки.
В продажу эти DGX-станции еще не вышли, но уже известно, что поставкой займутся ASUS, Dell, Lenovo, HP и другие OEM-партнеры Nvidia.
1👍3
🤯 Tencent и Tsinghua предлагают концепцию непрерывного мышления в ИИ
Исследователи компании Tencent и университета Цинхуа представили концепцию Continuous Autoregressive Language Models (CALM) — архитектуру, которая отказывается от дискретного предсказания токенов. Вместо этого модель генерирует непрерывные векторы, охватывающие сразу несколько элементов текста.
Если идея концепт будет работать на масштабных моделях, это может стать новым подходом к развитию архитектуры трансформеров, позволив перейти от дискретного языка к “потоковому” мышлению.
Исследователи компании Tencent и университета Цинхуа представили концепцию Continuous Autoregressive Language Models (CALM) — архитектуру, которая отказывается от дискретного предсказания токенов. Вместо этого модель генерирует непрерывные векторы, охватывающие сразу несколько элементов текста.
По данным авторов, такой подход снижает количество шагов прогнозирования примерно в 4 раза и сокращает затраты на обучение на ~44 %. В CALM нет словаря токенов и функции softmax: модель обучается как система, предсказывающая не символы, а смыслы. Для оценки качества введена новая метрика — BrierLM, пришедшая на смену традиционной perplexity.
Если идея концепт будет работать на масштабных моделях, это может стать новым подходом к развитию архитектуры трансформеров, позволив перейти от дискретного языка к “потоковому” мышлению.
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🦙 Llama.cpp теперь с WebUI: локальный ChatGPT прямо в браузере
Создатель движка инференса llama.cpp Георгий Герганов объявил об интеграции веб-интерфейса, который превращает консольный инструмент в полноценное веб-приложение для работы с локальными LLM. Теперь запустить модель можно через llama-server, подключившись к WebUI по адресу в браузере — даже с телефона.
Движок тянет обработку текстов, PDF и формул, а при работе с мультимодальными моделями можно работать с картинками и видео. Еще история чатов, ветвления диалогов, кеш префиксов и поддержка моделей с длинным контекстом, включая State Space Models — короче, максимальное удобство.
Llama.cpp догнал Ollama и LM Studio по удобству. Похоже, движки инференса перестают быть утилитами “для своих” и становятся user-friendly инструментами для всех.
Создатель движка инференса llama.cpp Георгий Герганов объявил об интеграции веб-интерфейса, который превращает консольный инструмент в полноценное веб-приложение для работы с локальными LLM. Теперь запустить модель можно через llama-server, подключившись к WebUI по адресу в браузере — даже с телефона.
Движок тянет обработку текстов, PDF и формул, а при работе с мультимодальными моделями можно работать с картинками и видео. Еще история чатов, ветвления диалогов, кеш префиксов и поддержка моделей с длинным контекстом, включая State Space Models — короче, максимальное удобство.
Система все еще не имеет RAG-модуля, зато есть интеграция с MCP, поэтому можно запускать локальные тесты нейронок с любого устройства.
Llama.cpp догнал Ollama и LM Studio по удобству. Похоже, движки инференса перестают быть утилитами “для своих” и становятся user-friendly инструментами для всех.
👍2💅1
🚀 Azure HBv5: AMD EPYC 9V64H с HBM3 — феноменальная эффективности в HPC
Microsoft открыла доступ к виртуальным машинам HBv5, построенным на специальных процессорах AMD EPYC 9V64H с памятью HBM3. Эти Zen 4-чипы без SMT предлагают до 368 ядер на сервер и 6,9 ТБ/с пропускной способности памяти, используя до 450 ГБ HBM3 (до 9 ГБ на ядро).
HBv5 создает новый класс VM с локальной HBM-памятью, а AMD впервые вывела HBM в серверный сегмент Azure. Конфиг на базе Zen 5, скорее всего, не за горами, и он может стать новым витком эффективности в HPC-задачах.
Microsoft открыла доступ к виртуальным машинам HBv5, построенным на специальных процессорах AMD EPYC 9V64H с памятью HBM3. Эти Zen 4-чипы без SMT предлагают до 368 ядер на сервер и 6,9 ТБ/с пропускной способности памяти, используя до 450 ГБ HBM3 (до 9 ГБ на ядро).
Несмотря на архитектуру Zen 4, а не более современную Zen 5, скорость работы чипов с большими наборами данных впечатляет — EPYC 9V64H демонстрирует 35-60% прирост скорости в сравнении с HBv4 на базе Genoa-X с 3D V-Cache. Тесты проводились на Ubuntu 24.04 LTS с ядром Linux 6.14.
HBv5 создает новый класс VM с локальной HBM-памятью, а AMD впервые вывела HBM в серверный сегмент Azure. Конфиг на базе Zen 5, скорее всего, не за горами, и он может стать новым витком эффективности в HPC-задачах.
👍4 1
🤣 Защита лувра: Windows Server 2003 и пароль “Louvre”
Музей лувра недавно ограбили, и это подняло весь мир на уши. Обстоятельства события все еще выясняются, а воры до сих пор не пойманы, но в ходе расследования стали известны интересные подробности о системе защиты музея.
Система видеонаблюдения работала, вы не поверите, на устаревшей Windows Server 2003 (тот же Windows XP, но под сервера), которая не получала патчи уже больше 15 лет. Дыр в ней больше, чем в швейцарском сыре — уязвимость SMBv1, критические RCE всех видов, слабая обработка шифров, бэкдоры IE и сотни других проблем.
Все стало еще смешнее, когда вскрылось, что паролем от системы было слово “Louvre”. Если у системы нет кулдауна ввода пароля(а его 100% нет) взлом лувра брутфорсом занял бы примерно 5 секунд.
А вот если бы они купили сервер видеонаблюдения в ServerFlow, все могло бы закончиться куда лучше…
Музей лувра недавно ограбили, и это подняло весь мир на уши. Обстоятельства события все еще выясняются, а воры до сих пор не пойманы, но в ходе расследования стали известны интересные подробности о системе защиты музея.
Система видеонаблюдения работала, вы не поверите, на устаревшей Windows Server 2003 (тот же Windows XP, но под сервера), которая не получала патчи уже больше 15 лет. Дыр в ней больше, чем в швейцарском сыре — уязвимость SMBv1, критические RCE всех видов, слабая обработка шифров, бэкдоры IE и сотни других проблем.
Все стало еще смешнее, когда вскрылось, что паролем от системы было слово “Louvre”. Если у системы нет кулдауна ввода пароля
Короче, самый известный музей в мире с технической точки зрения охранялся хуже, чем продуктовый магазин.
А вот если бы они купили сервер видеонаблюдения в ServerFlow, все могло бы закончиться куда лучше…
5👍5 2 2
💣 Apple готовит M5 Ultra для Mac Studio — релиз ожидается в 2026 году
По данным Bloomberg, что Apple планирует выпустить чип M5 Ultra для Mac Studio примерно в середине 2026 года. Это будет продолжение традиции выпуска Ultra-версий, которые появляются спустя несколько месяцев после моделей Pro и Max.
M5 Ultra объединит два кристалла M5 Max через шину UltraFusion, как и прошлые Ultra-чипы. Чип должен лечь в основу обновленного Mac Studio и, возможно, появится в новой версии Mac Pro.
Ждем будущую звезду локального инференса!
По данным Bloomberg, что Apple планирует выпустить чип M5 Ultra для Mac Studio примерно в середине 2026 года. Это будет продолжение традиции выпуска Ultra-версий, которые появляются спустя несколько месяцев после моделей Pro и Max.
M5 Ultra объединит два кристалла M5 Max через шину UltraFusion, как и прошлые Ultra-чипы. Чип должен лечь в основу обновленного Mac Studio и, возможно, появится в новой версии Mac Pro.
По слухам, внешне топовые рабочие станции Apple на базе M5 Ultra не будут отличаться от предыдущих поколений — скорее всего, компания вложит время и средства не в пресловутый дизайн, а в наращивание вычислительной мощности и энергоэффективности.
Ждем будущую звезду локального инференса!
2👍2💅1
Если вам когда-нибудь было интересно, зачем компании покупают системы DGX, HGX, MGX высочайшего корпоративного уровня, стоимость которых может переваливать за $5 млн.
А вот для чего: на скрине — компактный дата-сетик Nvidia для обучения физического искусственного интеллекта автономных автомобилей. Объем данных в нем достигает всего лишь 98,7 ТБ(слабо, Хуанг, мог бы и до 100 ТБ поднажать) .
А если серьезно, то цифры просто колоссальные, и чтобы обучить нейронку на таком дата-сете, серверы DGX, HGX, MGX должны из раза в раз с минимальной задержкой и максимальной скоростью перегонять эти данные туда-сюда днями, неделями или месяцами.
Теперь понятно, за что Хуанг получил свои лавры и раскрутил капитализацию Nvidia до $5 трлн.
А вот для чего: на скрине — компактный дата-сетик Nvidia для обучения физического искусственного интеллекта автономных автомобилей. Объем данных в нем достигает всего лишь 98,7 ТБ
А если серьезно, то цифры просто колоссальные, и чтобы обучить нейронку на таком дата-сете, серверы DGX, HGX, MGX должны из раза в раз с минимальной задержкой и максимальной скоростью перегонять эти данные туда-сюда днями, неделями или месяцами.
Вот для этого и покупают решения Nvidia, ведь ни одна другая машина не смогла бы справиться с такой колоссальной ИИ-нагрузкой.
Теперь понятно, за что Хуанг получил свои лавры и раскрутил капитализацию Nvidia до $5 трлн.
1👍4
🤑 AMD прибавила 36%: рекордная выручка $9,2 млрд за III квартал 2025
AMD отчиталась о доходах за 3-й квартал 2025 года: выручка выросла на 36% — до $9,2 млрд, операционная рентабельность поднялась до 14% (+3 п.п.), а прибыль на акцию составила $1,20, что на $0,03 выше ожиданий аналитиков.
Компания прогнозирует рост еще на 25% в 4-м квартале 2025 года — до $9,6 млрд. Основной драйвер роста — серверные центральные процессоры EPYC и ИИ- ускорители Instinct, которые активно скупают ИИ-ориентированные дата-центры и суперкомпьютерные комплексы по всему миру.
Такими темпами, AMD постепенно закрепится в верхнем ценовом диапазоне ИИ и HPC рынка, сокращая отставание от NVIDIA в области ИИ-ускорителей.
AMD отчиталась о доходах за 3-й квартал 2025 года: выручка выросла на 36% — до $9,2 млрд, операционная рентабельность поднялась до 14% (+3 п.п.), а прибыль на акцию составила $1,20, что на $0,03 выше ожиданий аналитиков.
Компания прогнозирует рост еще на 25% в 4-м квартале 2025 года — до $9,6 млрд. Основной драйвер роста — серверные центральные процессоры EPYC и ИИ- ускорители Instinct, которые активно скупают ИИ-ориентированные дата-центры и суперкомпьютерные комплексы по всему миру.
Такими темпами, AMD постепенно закрепится в верхнем ценовом диапазоне ИИ и HPC рынка, сокращая отставание от NVIDIA в области ИИ-ускорителей.
👍2
🤔 Ryzen AI MAX+ 388: 8 ядер, Radeon 8060S и TDP до 125 Вт
AMD готовит новый гибридный чип Ryzen AI MAX+ 388. Он засветился в базе PassMark и скоро его могут официально зарелизить.
Процессор оснащен 8 ядрами с 16 потоками, 32 МБ L3-кэша и графикой Radeon 8060S (40 блоков RDNA 3.5), которая ранее встречалась только в старшем 16-ядерном Ryzen AI MAX+ 395.
Чип имеет настраиваемый TDP от 45 до 125 Вт, что позволит ставить процессор как в игровые ноутбуки, так и в настольные рабочие станции, а также поддерживается до 128 ГБ LPDDR5x 8000 МТ/с.
Если у чипа сохранится NPU-блок уровня AI MAX-серии, Ryzen AI MAX+ 388 может стать неплохим решением для бюджетного ИИ-инференса.
AMD готовит новый гибридный чип Ryzen AI MAX+ 388. Он засветился в базе PassMark и скоро его могут официально зарелизить.
Процессор оснащен 8 ядрами с 16 потоками, 32 МБ L3-кэша и графикой Radeon 8060S (40 блоков RDNA 3.5), которая ранее встречалась только в старшем 16-ядерном Ryzen AI MAX+ 395.
Чип имеет настраиваемый TDP от 45 до 125 Вт, что позволит ставить процессор как в игровые ноутбуки, так и в настольные рабочие станции, а также поддерживается до 128 ГБ LPDDR5x 8000 МТ/с.
В PassMark Ryzen AI MAX+ 388 набирает ~4160 баллов в однопоточке и ~54 000 в многопоточке, в последнем отставая от старшего решения AI MAX+ 395 почти в два раза, но имея значительно меньшее энергопотребление.
Если у чипа сохранится NPU-блок уровня AI MAX-серии, Ryzen AI MAX+ 388 может стать неплохим решением для бюджетного ИИ-инференса.
2👍5