5060 8G使用Llama.cpp Desktop加载Qwen3.6-35B-A3B最佳参数

概述:

运行参数

ctx_size:4096
GPU layers:23
n_predict:512

展示:

Chat Template Kwargs

{"enable_thinking": false, "thinking_budget": 0}

开发者:

运行参数

Threads:14
Threads batch:14
Batch size:512
Ubatch size:256
n_cpu_moe:14

自定义附加参数

--cache-type-k q4_0 --cache-type-v q4_0 --flash-attn 1 --threads 14 --threads-batch 14

最终启动参数:
D:\llama\dist\bin\llama-server.exe --model D:\models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf --host 0.0.0.0 --port 8080 --ctx-size 4096 --n-predict 512 --n-gpu-layers 23 --chat-template-kwargs "{\"enable_thinking\": false, \"thinking_budget\": 0}" --temp 0.8 --top-k 20 --top-p 0.95 --min-p 0 --presence-penalty 1.5 --threads 14 --threads-batch 14 --batch-size 521 --ubatch-size 256 --split-mode layer --n-cpu-moe 14 --log-verbosity 3 --verbose --webui --cont-batching --cache-type-k q4_0 --cache-type-v q4_0 --flash-attn 1 --threads 14 --threads-batch 14

上一篇 转载:PotPlayer+DeepSeek自动识别翻译字幕 老司机骚操作拯救无字片库-鼠标迁徙