git clone https://github.com/ggml-org/llama.cpp cd llama.cpp git checkout b5585 # 或最新 release,含 Qwen3.8/Gemma 3 修復 cmake -B build \ -D GGML_CUDA=ON \ -D CMAKE_CUDA_ARCHITECTURES=120 \ # 必須:Blackwell = SM 120 -D LLAMA_BUILD_SERVER=ON \ -D GGML_CUDA_FA_ALL_QUANTS=ON \ # Flash Attention 全量化支援 -D GGML_CUDA_GRAPH=ON \ -D CMAKE_BUILD_TYPE=Release cmake --build build --config Release --parallel $(nproc) # 驗證:應輸出 built for sm_120 ./build/bin/llama-cli --version
避坑:絕對不要用 -D CMAKE_CUDA_ARCHITECTURES=86 89 90 (混編導致 15-20% 性能損失);必須開 GGML_CUDA_FA_ALL_QUANTS=ON 否則 FP8/Q4_K_M 無 FA、decode 速度腰斬。
./build/bin/llama-server \ -m ./models/Qwen3.8-27B-IQ4_XS.gguf \ -c 32768 \ # 32K 上下文極限 -ngl 99 \ # 全層上 GPU (62 層,IQ4_XS 14.8GB 可全上) -fa on \ # Flash Attention 必開 --host 0.0.0.0 --port 8080 \ --jinja \ --temp 0.6 --top-p 0.95 --top-k 40 --min-p 0.05 \ -b 2048 -ub 512 \ --no-mmap --mlock \ --parallel 1 \ --ctx-checkpoints 64 --swa-checkpoints 64
本文链接:https://it72.com/12842.htm