RTX 5060 Ti 16GB 跑 Qwen3.8-27B

Home / Article MrLee 4天前 6

模型選擇與量化對比 (16GB 卡)

量化大小最小 VRAM單流 TG (tok/s)PP (tok/s)代碼質量推薦度
IQ4_XS14.8 GB15.8 GB38–43~1,350⭐⭐⭐⭐16GB 卡全層首選
Q4_K_M16.5 GB17.5 GB18–27 (offload)~1,240⭐⭐⭐⭐⭐質量優先,需 offload 2-4 層
Q5_K_M19.8 GB21 GB34–36~1,080⭐⭐⭐⭐⭐需 24GB 卡
NVFP4 (Blackwell 專用)~13 GB14 GB55–65~1,800⭐⭐⭐⭐⭐未來首選,待 llama.cpp PR #21095 合併
Q3_K_L14.2 GB15.2 GB44+~1,420⭐⭐不推薦生產

llama.cpp 編譯:Blackwell (SM 120) 專用參數

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git checkout b5585  # 或最新 release,含 Qwen3.8/Gemma 3 修復
cmake -B build \
  -D GGML_CUDA=ON \
  -D CMAKE_CUDA_ARCHITECTURES=120 \      # 必須:Blackwell = SM 120
  -D LLAMA_BUILD_SERVER=ON \
  -D GGML_CUDA_FA_ALL_QUANTS=ON \        # Flash Attention 全量化支援
  -D GGML_CUDA_GRAPH=ON \
  -D CMAKE_BUILD_TYPE=Release
cmake --build build --config Release --parallel $(nproc)
# 驗證:應輸出 built for sm_120
./build/bin/llama-cli --version

避坑:絕對不要用 -D CMAKE_CUDA_ARCHITECTURES=86 89 90 (混編導致 15-20% 性能損失);必須開 GGML_CUDA_FA_ALL_QUANTS=ON 否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。

./build/bin/llama-server \
  -m ./models/Qwen3.8-27B-IQ4_XS.gguf \
  -c 32768 \                    # 32K 上下文極限
  -ngl 99 \                     # 全層上 GPU (62 層,IQ4_XS 14.8GB 可全上)
  -fa on \                      # Flash Attention 必開
  --host 0.0.0.0 --port 8080 \
  --jinja \
  --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \
  -b 2048 -ub 512 \
  --no-mmap --mlock \
  --parallel 1 \
  --ctx-checkpoints 64 --swa-checkpoints 64


本文链接:https://it72.com/12842.htm

推荐阅读
最新回复 (0)
返回