Derp Learning
13.8K subscribers
3.54K photos
1.02K videos
11 files
1.47K links
Используем ИИ строго не по назначению.
Заметки про ИИ, IT, компьютерные игры, и всякие инженерные интересности.
Download Telegram
Наконец дошли руки поковырять Qwen 3.8-27b

Как говорится, мое увожение.

На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth

--ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all

выдает 36.77 t/s с контекстом 100535

Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b
Понятно, что сильно умнее qwen 3.5 не стал, это скорее тюн для тулколлинга.
С Qwen3.8-9B-Q8_0 и конфигом

--ctx-size 262144 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --jinja --reasoning-effort low --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all

выдает 85-110 t/s с контекстом 262144 (I'm stupid faster)

В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается и любит заloopиться.
Можно гонять и через claude code/codex, но codex тыкается в новый более сырой апи как слепой котенок и одним своим системным промтом сжирает 20к+ токенов :D

Можно генерить план имплементации с Qwen3.8-27B-UD-Q3_K_XL а потом имплементировать Qwen3.8-9B-Q8_0

llama.cpp тут
115🔥1
😁56🤣21💯8🫡2🔥1
люблю когда есть свобода выбора
1😁30🤩71
141🤩18😱6😢1
3💯20🤩2🤬1
Derp Learning
Наконец дошли руки поковырять Qwen 3.8-27b Как говорится, мое увожение. На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth --ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context…
DFlash2 Qwen3.8-27b: 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста


Еще интересный подход - взять драфтер токенов не из самого чекпоинта, а DFlash2 отсюда -
Qwen3.8-27B-DFlash2-GGUF

Для этого придется собрать llama.cpp:

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/27342/head:pr-27342
git switch pr-27342

# NVIDIA CUDA
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build -j

# Apple Silicon
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON
cmake --build build -j


Зато потом получаем вместо 36.77 t/s / 100k ctx -> 52.15 t/s / 95k ctx
+40% скорости за 5% контекста

llama-server.exe -m "Qwen3.8-27B-UD-Q3_K_XL.gguf" -md "Qwen3.8-27B-DFlash2-Q4_K_M.gguf" --alias qwen38 --port 8080 --ctx-size 95536 -ngl 99 -ngld 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-dflash --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all --parallel 1
2👍171
😁56👨‍💻1
Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.

Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505

Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.
3😁61😢3
Huggingface у нас дома (в Поднебесной) - modelscope тизерит новый qwen3.8-next-flash.
На хф анонс тоже есть, но детали с китайского они перевести поленились 🫠

Судя по всему это будет мультимодальный МоЕ на архитектуре qwen4.

Возможно, 125b A6b + 51b ngram embedding - возможно будет нативная поддержа видео.

Хотя ее заявляют как тизер новой архитектуры, так что может будет и что-то мелкое на 9-13-27б.

X
Hf
git
🔥11
😁163🔥3😱2
Forwarded from La Qeque
😁434😱3🔥2👍1🤬1
😁21👍3
GLM-5.3-flash (320b): выходит
Qwen-3.8-flash-next (125+51b A6b):
😁13👍2