Media is too big
VIEW IN TELEGRAM
Таким должен был быть трейлер к Red Alert 2!
Ладно, забирайте эту вашу оперативку. 6 минут 1080р.
Отдельно доставляет советская озвучка в исполнении китайских моделей.
x
автор:
https://www.douyin.com, lyxw1327
Ладно, забирайте эту вашу оперативку. 6 минут 1080р.
Отдельно доставляет советская озвучка в исполнении китайских моделей.
x
автор:
https://www.douyin.com, lyxw1327
❤42🔥12😁6🤡2
Наконец дошли руки поковырять Qwen 3.8-27b
Как говорится, мое увожение.
На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth
выдает 36.77 t/s с контекстом 100535
Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b
Понятно, что сильно умнее qwen 3.5 не стал, это скорее тюн для тулколлинга.
С Qwen3.8-9B-Q8_0 и конфигом
выдает 85-110 t/s с контекстом 262144 (I'm stupid faster)
В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается и любит заloopиться.
Можно гонять и через claude code/codex, но codex тыкается в новый более сырой апи как слепой котенок и одним своим системным промтом сжирает 20к+ токенов :D
Можно генерить план имплементации с Qwen3.8-27B-UD-Q3_K_XL а потом имплементировать Qwen3.8-9B-Q8_0
llama.cpp тут
Как говорится, мое увожение.
На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth
--ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all выдает 36.77 t/s с контекстом 100535
Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b
Понятно, что сильно умнее qwen 3.5 не стал, это скорее тюн для тулколлинга.
С Qwen3.8-9B-Q8_0 и конфигом
--ctx-size 262144 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --jinja --reasoning-effort low --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all выдает 85-110 t/s с контекстом 262144 (I'm stupid faster)
В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается и любит заloopиться.
Можно гонять и через claude code/codex, но codex тыкается в новый более сырой апи как слепой котенок и одним своим системным промтом сжирает 20к+ токенов :D
Можно генерить план имплементации с Qwen3.8-27B-UD-Q3_K_XL а потом имплементировать Qwen3.8-9B-Q8_0
llama.cpp тут
1❤14🔥1
Derp Learning
Наконец дошли руки поковырять Qwen 3.8-27b Как говорится, мое увожение. На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth --ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context…
DFlash2 Qwen3.8-27b: 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста
Еще интересный подход - взять драфтер токенов не из самого чекпоинта, а DFlash2 отсюда -
Qwen3.8-27B-DFlash2-GGUF
Для этого придется собрать llama.cpp:
Зато потом получаем вместо 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста
+40% скорости за 5% контекста
Еще интересный подход - взять драфтер токенов не из самого чекпоинта, а DFlash2 отсюда -
Qwen3.8-27B-DFlash2-GGUF
Для этого придется собрать llama.cpp:
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/27342/head:pr-27342
git switch pr-27342
# NVIDIA CUDA
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build -j
# Apple Silicon
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON
cmake --build build -j
Зато потом получаем вместо 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста
llama-server.exe -m "Qwen3.8-27B-UD-Q3_K_XL.gguf" -md "Qwen3.8-27B-DFlash2-Q4_K_M.gguf" --alias qwen38 --port 8080 --ctx-size 95536 -ngl 99 -ngld 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-dflash --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all --parallel 1huggingface.co
incoai/Qwen3.8-27B-DFlash2-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
2👍14❤1