众所周知,llama.cpp 是一个使用 C++ 来实现的一个大模型推理工具,不依赖 python, pytorch,而且性能也很好,支持自定义的参数调整。Ollama 底层也是封装了这个库,提供给普通用户。
Ollama 的设置对于 AI生成代码这样的专业场景下,不一定可以发挥硬件的最大性能,所以有的场景,还是会有人直接使用 llama.cpp 来加载模型。
对于 Windows 平台,最直接的方式就是使用 winget 来安装:
winget install llama.cpp
今天的这边文章,要和大家分享的是普通的开发人员,如何简单快速地在本地使用 llama.cpp 搭建起本地模型。当然,不可否认,Ollama 依然是很优秀的工具,它们是相互补充而不是替代其中的某一个。
第一步从 HF 上下载 GGUF 模型文件,一般而言大家可以下载 Q4_K_M 格式的文件。
第二步,运行最基础的命令:llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 0 -fa off –spec-type none -c 1024,记得模型名称换成你本地实际的模型,先保证你机器可以跑起来,如果你模型不适用你电脑,那么初始化就会报错。
第三步,当可以运行后,你就可以访问 localhost:8080 访问 llama.cpp 提供的简单网页版聊天工具,随便说点什么,在里面你会看到生成的 token 速度,Qwen3.8 在我机器上只有 2t/s,够慢的了。
第四步,结束并运行新的命令:llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 10 -fa off –spec-type none -c 1024,可以看到变化是 ngl 从 0 变到了 10,你就可以观察内存和显存的占用情况,如果允许没有问题,就以步长 10,逐步添加,同时也增加 -c 上下文长度。
第五步,打开 mtp,执行下面的命令 llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 20 -fa on –spec-type draft-mtp -c 1024, 可以看开启 mtp 后,是否可以初始化成功,一般而言启用了 mtp ,生成 token 的速度会增加,如果你发现没有效果,应该及时关闭,否则得不偿失。
对于我的机器,最后停留在 llama-server.exe -m .\Qwen3.8-27B-UD-Q4_K_M.gguf -ngl 10 -fa on –spec-type draft-mtp -c 32768 这个参数上面。
大家可以自己试一试,没有最好的,只有合适的。
OpenCode 是什么?
一句话来说:一个开源的 AI Coding Agent,可以运行在 Terminal、Desktop、IDE 中,并支持几乎所有主流的大模型。相比很多只能调用固定模型的工具,OpenCode 最大的特点就是Provider 无关。
基本可以理解成:只要模型提供 OpenAI Compatible API,大概率都能接。
官网地址是 https://opencode.ai,官方也提供桌面版应用,非常适合我这样无法接受命令行的小白。
为什么很多人开始用 OpenCode?如果只看能力,其实现在 AI Coding Agent 都差不多:
- 修改代码
- 自动搜索项目
- 调用终端
- Git 操作
- 修 Bug
- 写测试
这些大家都会。OpenCode 真正吸引人的地方主要有几个:
1. 开源。这是很多人首先关注的一点。整个 Agent 都是开源的,很多时候你甚至可以直接看看它到底是怎么组织 Prompt、怎么管理 Context、怎么调 Tool 的。对于喜欢研究 Agent Workflow 的人,这一点很有价值。
2. 不绑定任何模型。这一点比想象中重要。如果工具绑定 Provider,你只能等官方适配,OpenCode 基本没有这个问题,换模型基本就是改配置。
3. 真正以 Terminal 为中心。很多 IDE 插件,本质还是聊天窗口。OpenCode 更像一个真正工作的 Agent。
例如:修复所有 eslint 错误。它可能会:
- 搜索项目
- 分析错误
- 修改多个文件
- 执行 npm run lint
- 再继续修改
- 最终提交修改
整个过程基本不用你手动介入。这种体验和 Cursor 的 Agent Mode 很接近。
4. LSP 支持。很多 Agent 修改代码其实都是:全文件读取 → LLM 自己猜。OpenCode 会利用 Language Server 获取:
- Definition
- Reference
- Symbol
- 类型信息
因此:跨文件修改准确率会高不少,尤其大型项目比较明显。
配置建议
项目级 Prompt
很多人一直在聊天。其实更推荐写:AGENTS.md 或者项目 Prompt。
告诉 Agent:项目规范、命名规则、Commit 风格、是否允许执行命令、是否自动运行测试,效果会明显好很多。
自定义命令
OpenCode 支持自定义 Command。
例如:/review,实际上就是:
Review 当前改动,只关注:
- Bug
- 性能
- 安全
以后一句:/review,不用重复输入 Prompt。长期下来效率提升非常明显。
AI 编程工具最大的变化,不是模型越来越强,而是 Agent 越来越成熟。OpenCode 代表的是另一种思路:不是把 AI 塞进 IDE,而是把 AI 放到开发流程本身。它知道你的项目、能调用工具、能执行命令、能管理上下文,也能完成完整的开发任务。
如果你平时就是终端重度用户,或者已经习惯 Claude Code、Aider、Codex CLI 这一类工具,那么 OpenCode 值得体验一下。它未必会成为你的唯一工具,但很可能会成为工具箱里长期保留的那一个。