Дождались: Alibaba выпустила Qwen3.8-27B, плотную модель на 27 млрд параметров без MoE. Она умеет работать с текстом, изображениями и видео, а контекстное окно нейронки может достигать 1 миллиона токенов. Модель базируется на нейросети Qwen3.5 и включает те же оптимизационные механизмы: DeltaNet, Gated Attention и Multi-Token Prediction. Глубина рассуждения переключается через reasoning_effort в режимах xhigh, medium и low.
На Terminal Bench 2.1 Qwen3.8-27B получила 73,0 балла против 63,4 у Qwen3.6-27B и 64,0 у Qwen3.7-Plus, на SWE-bench Pro результат составил 61,7 против 53,5 и 51,2. В DeepSWE 1.1 новая модель набрала 42,2 против 13,3 и 14,2, в CoWorkBench 70,7 против 61,0 и 65,1, а в JobBench 33,4 против 21,8 и 27,6. На OSWorld-Verified, где модель должна выполнять действия в интерфейсе компьютера, Qwen3.8-27B получила 84,3 балла против 63,9 у Qwen3.6-27B и 73,3 у Qwen3.7-Plus. В мультимодальном SWE-MM результат составил 38,6 против 25,7 и 30,0.
Уже на релиза появилась поддержка всех популярных форматов вычислений и квантизаций: GGUF, NVFP4, MLX, FP16, FP8, FP4 — для запуска нужно от 16 до 54 ГБ VRAM. Вы буквально получите мощь закрытой Claude Opus 4.6 всего на одной потребительской видеокарте.
Модель уже доступна для скачивания Hugging Face.
😅 Канал Serverflow в MAX: Подписаться
На Terminal Bench 2.1 Qwen3.8-27B получила 73,0 балла против 63,4 у Qwen3.6-27B и 64,0 у Qwen3.7-Plus, на SWE-bench Pro результат составил 61,7 против 53,5 и 51,2. В DeepSWE 1.1 новая модель набрала 42,2 против 13,3 и 14,2, в CoWorkBench 70,7 против 61,0 и 65,1, а в JobBench 33,4 против 21,8 и 27,6. На OSWorld-Verified, где модель должна выполнять действия в интерфейсе компьютера, Qwen3.8-27B получила 84,3 балла против 63,9 у Qwen3.6-27B и 73,3 у Qwen3.7-Plus. В мультимодальном SWE-MM результат составил 38,6 против 25,7 и 30,0.
Уже на релиза появилась поддержка всех популярных форматов вычислений и квантизаций: GGUF, NVFP4, MLX, FP16, FP8, FP4 — для запуска нужно от 16 до 54 ГБ VRAM. Вы буквально получите мощь закрытой Claude Opus 4.6 всего на одной потребительской видеокарте.
Модель уже доступна для скачивания Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15🍾6🤯2💩2
AMD не стала медлить и уже объявила о Day 0 поддержке топовой компактной нейронки Qwen3.8-27B. LLM можно запускать локально на рабочих станциях на базе чиров Ryzen AI Max+ или на видеокартах Radeon AI PRO R9700 с 32 ГБ VRAM. При запуске через Llama.cpp на Windows через Vulkan-бэкенд Ryzen AI Max+ 395 показывает до 24,5 токена/с, а одна Radeon AI PRO R9700 достигает 51,8 токена/с.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍17
ServerFlow | Новости и Железо 💾
Дождались: Alibaba выпустила Qwen3.8-27B, плотную модель на 27 млрд параметров без MoE. Она умеет работать с текстом, изображениями и видео, а контекстное окно нейронки может достигать 1 миллиона токенов. Модель базируется на нейросети Qwen3.5 и включает те…
Unsloth: вы можете запускать Qwen3.8-27B в GGUF-формате всего на 17 ГБ ОЗУ 👀
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1🌭17💅3💩1
Qwen3.8-27B в сравнении с DeepSeek V4 Flash, Claude Sonnet 5 и 4.6. Вполне неплохо для 27 миллиардов параметров.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍24🌭2
Anthropic опубликовала отчет, в котором признала, что ее сотрудники пользуются особой внутренней ИИ-моделью под кодовым названием Model 2 для исследований и разработок, производительность которой в разы выше, чем у Claude Mythos 5. При этом компания заявила, что модель неоднократно пыталась выйти из изолированной среды, нарушала правила обучения и создавала небезопасных ИИ-агентов. Anthropic также отметила, что никогда не будет публиковать Model 2 в публичный доступ.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
💩34👍5
Немецкие IT-исследователи обнаружили уязвимость LoongLeak в процессорах Loongson с архитектурой LoongArch. Проблема связана с одной из инструкций, которая оставляет часть регистра в неопределенном состоянии. Исследователи выяснили, что в некоторых случаях эти 32 бита могут содержать данные из L1-кэша, причем кеш не изолируется между отдельными программами.
Используя эту особенность, атакующий может предварительно изменить внутреннее состояние процессора и затем получать нужные фрагменты данных из кеша. В лабораторных тестах таким способом удалось извлечь ключи AES, части хешей паролей root, а также обойти ASLR и некоторые проверки целостности стека. Атаку можно запускать даже из виртуальной машины, используя ее для доступа к данным процесса на хост-системе.
Полностью устранить проблему обычным обновлением ПО нельзя, поскольку причина находится на уровне архитектуры процессора. Один из вариантов защиты заключается в отключении второго потока на ядре, но это снижает возможности многопоточности. Loongson уже выпустила программное исправление для 3A6000: очистка кеша снижает производительность максимум примерно на 1,4%. На практике масштаб угрозы ограничен тем, что процессоры Loongson почти не распространены за пределами Китая.
😅 Канал Serverflow в MAX: Подписаться
Используя эту особенность, атакующий может предварительно изменить внутреннее состояние процессора и затем получать нужные фрагменты данных из кеша. В лабораторных тестах таким способом удалось извлечь ключи AES, части хешей паролей root, а также обойти ASLR и некоторые проверки целостности стека. Атаку можно запускать даже из виртуальной машины, используя ее для доступа к данным процесса на хост-системе.
Полностью устранить проблему обычным обновлением ПО нельзя, поскольку причина находится на уровне архитектуры процессора. Один из вариантов защиты заключается в отключении второго потока на ядре, но это снижает возможности многопоточности. Loongson уже выпустила программное исправление для 3A6000: очистка кеша снижает производительность максимум примерно на 1,4%. На практике масштаб угрозы ограничен тем, что процессоры Loongson почти не распространены за пределами Китая.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10👍6🍾2
ServerFlow | Новости и Железо 💾
Photo
Please open Telegram to view this post
VIEW IN TELEGRAM
💅8🌭5💩3🤯2👍1
Вот так новости: жена Дарио Амодея, главы компании Anthropic, предлагала Джеффри Эпштейну вложиться в свою студию 18+ фильмов класса люкс. Эпштейн отказался.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯28
Qwen 3.8 35B A3B обнаружили в логах ModelScope. Похоже, нас ждет еще один грандиозный Open-Source релиз от Alibaba 👀
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍25🌭3💩2
ИИ-ускорители Nvidia P100 и P40 делят одну и ту же архитектуру и даже один и тот же корпус, но почему, казалось бы, два близкородственных GPU имеют настолько разные характеристики? И какой из них все-таки лучше всего подходит для ИИ-моделей? Давайте разберемся.
Только вдумайтесь, насколько велик разрыв в, казалось бы, самом передовом в 2016 году режиме вычислений — P40 отстает от P100 в 115 раз! Почему так? На самом деле, тут все достаточно просто — Nvidia позиционировала P100 как решение для обучения ИИ, HPC и корпоративного сектора, тогда как P40 изначально был продуктом для инференса и потребительских задач. Поэтому более легкий GPU не получил аппаратную поддержку FP64 и FP16, зато обзавелся идеальной для потребительского запуска LLM в 2016 году INT8.
На тот момент для Nvidia это было наиболее логично, но сейчас, когда GPU обзавелись адекватной поддержкой FP16, FP8 и даже FP4, в 2026 году покупка P40 для ИИ-инференса выглядит не совсем оправданной — и в обучении, и инференса P100 будет показывать себя гораздо лучше.
😅 Канал Serverflow в MAX: Подписаться
Nvidia P100 — это, по праву, легендарный ускоритель на архитектуре Pascal, который задавал тон всей индустрии ИИ и HPC вычислений до появления решений эпохи Volta. Внутри него — графический чип GP100: 3584 ядра CUDA, частота до 1,4 ГГц и 16 ГБ быстрой HBM2 со скоростью 732 ГБ/с на 4096-битной шине давали до 5.3 TFLOPS в FP64, до 10.6 TFLOPS в FP32 и, самое главное, до 21.2 TFLOPS в FP16 — прорывной для того момента уровень эффективности в вычислениях с плавающей запятой.
Nvidia P40 — прямое продолжение концепции P100, но с определенными нюансами. Архитектура Pascal осталась без изменений, но вот чип уже поменялся на GP102, причем характеристики подросли: 3840 CUDA-ядер вместо 3584, частоты до 1,5 ГГц в бусте вместо 1,4 ГГц, и даже памяти стало 24 ГБ вместо 16 ГБ, правда не HBM2, уже GDDR5X на 384-битной шине с пропускной способностью до 347 ГБ/с. А вот с производительностью что-то пошло не так — 367 GFLOPS в FP64, 11,7 TFLOPS в FP32 и, что самое интересное, всего 183 GFLOPS в FP16. В отместку, Nvidia обеспечила P40 поддержкой сверхлегкого режима INT8 с производительностью 47 TOPS.
Только вдумайтесь, насколько велик разрыв в, казалось бы, самом передовом в 2016 году режиме вычислений — P40 отстает от P100 в 115 раз! Почему так? На самом деле, тут все достаточно просто — Nvidia позиционировала P100 как решение для обучения ИИ, HPC и корпоративного сектора, тогда как P40 изначально был продуктом для инференса и потребительских задач. Поэтому более легкий GPU не получил аппаратную поддержку FP64 и FP16, зато обзавелся идеальной для потребительского запуска LLM в 2016 году INT8.
На тот момент для Nvidia это было наиболее логично, но сейчас, когда GPU обзавелись адекватной поддержкой FP16, FP8 и даже FP4, в 2026 году покупка P40 для ИИ-инференса выглядит не совсем оправданной — и в обучении, и инференса P100 будет показывать себя гораздо лучше.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🤯3🍾2💩1
Cerebras предлагает Alibaba стать полноценным партнером облака и готова выделить инстансы для инференса Qwen3.8-27b.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍19🌭4💩2🍾2💅1
ИИ-энтузиасты из orcarouter уже успели выпустить расцензуренную версию Qwen3.8-27b — все самые вредоносные, неэтичные и оскорбительные запросы, которые исходный Qwen3.8-27B отклонил бы, эта модель будет выполнять как ни в чем не бывало.
😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍28💩1
Пока мы все наслаждались релизом открытой Qwen3.8-27b, Z.ai под шумок релизнула GLM-5.3. Архитектурно это та же GLM-5.2, но за счет дополнительного дообучения с подкреплением в рабочем окружении новая нейронка стала показывать более лучшие результаты: На Terminal-Bench 3.0 она получила 28,3% против 21,1% у Opus 4.8, 33,7% у Fable 5 и 34,6% у GPT-5.6 Sol. На DeepSWE результат составил 66,9% против 67,5%, 69,7% и 72,7% соответственно.
Модель уже доступна в GLM Coding Plan, ZCode, Claude Code и OpenCode, при вызове LLM предыдущие версии будут автоматически переключаться на GLM-5.3. Открытые веса Z.ai обещает опубликовать примерно 28 августа после дополнительной проверки безопасности.
😅 Канал Serverflow в MAX: Подписаться
Модель уже доступна в GLM Coding Plan, ZCode, Claude Code и OpenCode, при вызове LLM предыдущие версии будут автоматически переключаться на GLM-5.3. Открытые веса Z.ai обещает опубликовать примерно 28 августа после дополнительной проверки безопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9💅2🌭1