Derp Learning
13.8K subscribers
3.53K photos
1.02K videos
11 files
1.47K links
Используем ИИ строго не по назначению.
Заметки про ИИ, IT, компьютерные игры, и всякие инженерные интересности.
Download Telegram
Кто такой этот ваш майор Аутаж и почему он мешает мне вайбкодить
😁74🤣7🤬3👍2
😁64🤣275🤡2🫡2👍1🔥1
Forwarded from Dev Meme / devmeme
3😁46🤡1
🤣53😁12😱2
😁50🤗74👍1
Media is too big
VIEW IN TELEGRAM
Таким должен был быть трейлер к Red Alert 2!
Ладно, забирайте эту вашу оперативку. 6 минут 1080р.
Отдельно доставляет советская озвучка в исполнении китайских моделей.

x
автор:
https://www.douyin.com, lyxw1327
42🔥12😁6🤡2
Наконец дошли руки поковырять Qwen 3.8-27b

Как говорится, мое увожение.

На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth

--ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all

выдает 36.77 t/s с контекстом 100535

Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b
Понятно, что сильно умнее qwen 3.5 не стал, это скорее тюн для тулколлинга.
С Qwen3.8-9B-Q8_0 и конфигом

--ctx-size 262144 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --jinja --reasoning-effort low --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all

выдает 85-110 t/s с контекстом 262144 (I'm stupid faster)

В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается и любит заloopиться.
Можно гонять и через claude code/codex, но codex тыкается в новый более сырой апи как слепой котенок и одним своим системным промтом сжирает 20к+ токенов :D

Можно генерить план имплементации с Qwen3.8-27B-UD-Q3_K_XL а потом имплементировать Qwen3.8-9B-Q8_0

llama.cpp тут
114🔥1
😁56🤣21💯8🫡2🔥1
люблю когда есть свобода выбора
1😁30🤩71
137🤩17😱6😢1
3💯13🤬1🤩1
Derp Learning
Наконец дошли руки поковырять Qwen 3.8-27b Как говорится, мое увожение. На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth --ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context…
DFlash2 Qwen3.8-27b: 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста


Еще интересный подход - взять драфтер токенов не из самого чекпоинта, а DFlash2 отсюда -
Qwen3.8-27B-DFlash2-GGUF

Для этого придется собрать llama.cpp:

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/27342/head:pr-27342
git switch pr-27342

# NVIDIA CUDA
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build -j

# Apple Silicon
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON
cmake --build build -j


Зато потом получаем вместо 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста

llama-server.exe -m "Qwen3.8-27B-UD-Q3_K_XL.gguf" -md "Qwen3.8-27B-DFlash2-Q4_K_M.gguf" --alias qwen38 --port 8080 --ctx-size 95536 -ngl 99 -ngld 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-dflash --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all --parallel 1
2👍141