ServerFlow | Новости и Железо 💾
4.23K subscribers
4.87K photos
386 videos
12 files
2.36K links
Серверы, нейронки, инсайды и немного технической магии. Мы препарируем железо, тестим AI-движки и рассказываем всё как есть.

Хотите поболтать?
https://t.me/serverflow_chat

Оформить заказ?
@ServerFlow

Сотрудничество?
@marketing_sf

https://serverflow.ru
Download Telegram
Дождались: Alibaba выпустила Qwen3.8-27B, плотную модель на 27 млрд параметров без MoE. Она умеет работать с текстом, изображениями и видео, а контекстное окно нейронки может достигать 1 миллиона токенов. Модель базируется на нейросети Qwen3.5 и включает те же оптимизационные механизмы: DeltaNet, Gated Attention и Multi-Token Prediction. Глубина рассуждения переключается через reasoning_effort в режимах xhigh, medium и low.

На Terminal Bench 2.1 Qwen3.8-27B получила 73,0 балла против 63,4 у Qwen3.6-27B и 64,0 у Qwen3.7-Plus, на SWE-bench Pro результат составил 61,7 против 53,5 и 51,2. В DeepSWE 1.1 новая модель набрала 42,2 против 13,3 и 14,2, в CoWorkBench 70,7 против 61,0 и 65,1, а в JobBench 33,4 против 21,8 и 27,6. На OSWorld-Verified, где модель должна выполнять действия в интерфейсе компьютера, Qwen3.8-27B получила 84,3 балла против 63,9 у Qwen3.6-27B и 73,3 у Qwen3.7-Plus. В мультимодальном SWE-MM результат составил 38,6 против 25,7 и 30,0.

Уже на релиза появилась поддержка всех популярных форматов вычислений и квантизаций: GGUF, NVFP4, MLX, FP16, FP8, FP4 — для запуска нужно от 16 до 54 ГБ VRAM. Вы буквально получите мощь закрытой Claude Opus 4.6 всего на одной потребительской видеокарте.

Модель уже доступна для скачивания Hugging Face.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15🍾6🤯2💩2
AMD не стала медлить и уже объявила о Day 0 поддержке топовой компактной нейронки Qwen3.8-27B. LLM можно запускать локально на рабочих станциях на базе чиров Ryzen AI Max+ или на видеокартах Radeon AI PRO R9700 с 32 ГБ VRAM. При запуске через Llama.cpp на Windows через Vulkan-бэкенд Ryzen AI Max+ 395 показывает до 24,5 токена/с, а одна Radeon AI PRO R9700 достигает 51,8 токена/с.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍17
Qwen3.8-27B в сравнении с DeepSeek V4 Flash, Claude Sonnet 5 и 4.6. Вполне неплохо для 27 миллиардов параметров.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍24🌭2
Anthropic опубликовала отчет, в котором признала, что ее сотрудники пользуются особой внутренней ИИ-моделью под кодовым названием Model 2 для исследований и разработок, производительность которой в разы выше, чем у Claude Mythos 5. При этом компания заявила, что модель неоднократно пыталась выйти из изолированной среды, нарушала правила обучения и создавала небезопасных ИИ-агентов. Anthropic также отметила, что никогда не будет публиковать Model 2 в публичный доступ.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
💩34👍5
Немецкие IT-исследователи обнаружили уязвимость LoongLeak в процессорах Loongson с архитектурой LoongArch. Проблема связана с одной из инструкций, которая оставляет часть регистра в неопределенном состоянии. Исследователи выяснили, что в некоторых случаях эти 32 бита могут содержать данные из L1-кэша, причем кеш не изолируется между отдельными программами.

Используя эту особенность, атакующий может предварительно изменить внутреннее состояние процессора и затем получать нужные фрагменты данных из кеша. В лабораторных тестах таким способом удалось извлечь ключи AES, части хешей паролей root, а также обойти ASLR и некоторые проверки целостности стека. Атаку можно запускать даже из виртуальной машины, используя ее для доступа к данным процесса на хост-системе.

Полностью устранить проблему обычным обновлением ПО нельзя, поскольку причина находится на уровне архитектуры процессора. Один из вариантов защиты заключается в отключении второго потока на ядре, но это снижает возможности многопоточности. Loongson уже выпустила программное исправление для 3A6000: очистка кеша снижает производительность максимум примерно на 1,4%. На практике масштаб угрозы ограничен тем, что процессоры Loongson почти не распространены за пределами Китая.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10👍6🍾2
ServerFlow | Новости и Железо 💾
Photo
Те самые коллекционные карточки Хуанга 👀

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
💅8🌭5💩3🤯2👍1
Вот так новости: жена Дарио Амодея, главы компании Anthropic, предлагала Джеффри Эпштейну вложиться в свою студию 18+ фильмов класса люкс. Эпштейн отказался.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯28
Qwen 3.8 35B A3B обнаружили в логах ModelScope. Похоже, нас ждет еще один грандиозный Open-Source релиз от Alibaba 👀

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍25🌭3💩2
ИИ-ускорители Nvidia P100 и P40 делят одну и ту же архитектуру и даже один и тот же корпус, но почему, казалось бы, два близкородственных GPU имеют настолько разные характеристики? И какой из них все-таки лучше всего подходит для ИИ-моделей? Давайте разберемся.

Nvidia P100 — это, по праву, легендарный ускоритель на архитектуре Pascal, который задавал тон всей индустрии ИИ и HPC вычислений до появления решений эпохи Volta. Внутри него — графический чип GP100: 3584 ядра CUDA, частота до 1,4 ГГц и 16 ГБ быстрой HBM2 со скоростью 732 ГБ/с на 4096-битной шине давали до 5.3 TFLOPS в FP64, до 10.6 TFLOPS в FP32 и, самое главное, до 21.2 TFLOPS в FP16 — прорывной для того момента уровень эффективности в вычислениях с плавающей запятой.


Nvidia P40 — прямое продолжение концепции P100, но с определенными нюансами. Архитектура Pascal осталась без изменений, но вот чип уже поменялся на GP102, причем характеристики подросли: 3840 CUDA-ядер вместо 3584, частоты до 1,5 ГГц в бусте вместо 1,4 ГГц, и даже памяти стало 24 ГБ вместо 16 ГБ, правда не HBM2, уже GDDR5X на 384-битной шине с пропускной способностью до 347 ГБ/с. А вот с производительностью что-то пошло не так — 367 GFLOPS в FP64, 11,7 TFLOPS в FP32 и, что самое интересное, всего 183 GFLOPS в FP16. В отместку, Nvidia обеспечила P40 поддержкой сверхлегкого режима INT8 с производительностью 47 TOPS.


Только вдумайтесь, насколько велик разрыв в, казалось бы, самом передовом в 2016 году режиме вычислений — P40 отстает от P100 в 115 раз! Почему так? На самом деле, тут все достаточно просто — Nvidia позиционировала P100 как решение для обучения ИИ, HPC и корпоративного сектора, тогда как P40 изначально был продуктом для инференса и потребительских задач. Поэтому более легкий GPU не получил аппаратную поддержку FP64 и FP16, зато обзавелся идеальной для потребительского запуска LLM в 2016 году INT8.

На тот момент для Nvidia это было наиболее логично, но сейчас, когда GPU обзавелись адекватной поддержкой FP16, FP8 и даже FP4, в 2026 году покупка P40 для ИИ-инференса выглядит не совсем оправданной — и в обучении, и инференса P100 будет показывать себя гораздо лучше.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🤯3🍾2💩1
Cerebras предлагает Alibaba стать полноценным партнером облака и готова выделить инстансы для инференса Qwen3.8-27b.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍19🌭4💩2🍾2💅1
ИИ-энтузиасты из orcarouter уже успели выпустить расцензуренную версию Qwen3.8-27b — все самые вредоносные, неэтичные и оскорбительные запросы, которые исходный Qwen3.8-27B отклонил бы, эта модель будет выполнять как ни в чем не бывало.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍28💩1
Пока мы все наслаждались релизом открытой Qwen3.8-27b, Z.ai под шумок релизнула GLM-5.3. Архитектурно это та же GLM-5.2, но за счет дополнительного дообучения с подкреплением в рабочем окружении новая нейронка стала показывать более лучшие результаты: На Terminal-Bench 3.0 она получила 28,3% против 21,1% у Opus 4.8, 33,7% у Fable 5 и 34,6% у GPT-5.6 Sol. На DeepSWE результат составил 66,9% против 67,5%, 69,7% и 72,7% соответственно. 

Модель уже доступна в GLM Coding Plan, ZCode, Claude Code и OpenCode, при вызове LLM предыдущие версии будут автоматически переключаться на GLM-5.3. Открытые веса Z.ai обещает опубликовать примерно 28 августа после дополнительной проверки безопасности.

😅 Канал Serverflow в MAX: Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9💅2🌭1