如何找到适合自己的 llama.cpp 配置
众所周知,llama.cpp 是一个使用 C++ 来实现的一个大模型推理工具,不依赖 python, pytorch,而且性能也很好,支持自定义的参数调整。Ollama 底层也是封装了这个库,提供给普通用户。
Ollama 的设置对于 AI生成代码这样的专业场景下,不一定可以发挥硬件的最大性能,所以有的场景,还是会有人直接使用 llama.cpp 来加载模型。
对于 Windows 平台,最直接的方式就是使用 winget 来安装:
winget install llama.cpp
今天的这边文章,要和大家分享的是普通的开发人员,如何简单快速地在本地使用 llama.cpp 搭建起本地模型。当然,不可否认,Ollama 依然是很优秀的工具,它们是相互补充而不是替代其中的某一个。
第一步从 HF 上下载 GGUF 模型文件,一般而言大家可以下载 Q4_K_M 格式的文件。
第二步,运行最基础的命令:llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 0 -fa off –spec-type none -c 1024,记得模型名称换成你本地实际的模型,先保证你机器可以跑起来,如果你模型不适用你电脑,那么初始化就会报错。
第三步,当可以运行后,你就可以访问 localhost:8080 访问 llama.cpp 提供的简单网页版聊天工具,随便说点什么,在里面你会看到生成的 token 速度,Qwen3.8 在我机器上只有 2t/s,够慢的了。
第四步,结束并运行新的命令:llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 10 -fa off –spec-type none -c 1024,可以看到变化是 ngl 从 0 变到了 10,你就可以观察内存和显存的占用情况,如果允许没有问题,就以步长 10,逐步添加,同时也增加 -c 上下文长度。
第五步,打开 mtp,执行下面的命令 llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 20 -fa on –spec-type draft-mtp -c 1024, 可以看开启 mtp 后,是否可以初始化成功,一般而言启用了 mtp ,生成 token 的速度会增加,如果你发现没有效果,应该及时关闭,否则得不偿失。
对于我的机器,最后停留在 llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 10 -fa on –spec-type draft-mtp -c 32768 这个参数上面。
大家可以自己试一试,没有最好的,只有合适的。