DeepSeek Harness 怎么接入本地大模型?LM-Kit、llama.cpp 与 DSH plugin 模型配置
DeepSeek Harness 接入本地大模型,前提是本地服务已启动、endpoint 与模型名填对;配置入口在 Web UI 的设置 → 模型,走 OpenAI 兼容协议即可。
概览
本地模型接入就三步:起服务、填配置、切换验证。 本地模型服务(LM-Kit / llama.cpp / Ollama)基本都提供 OpenAI 兼容接口,DSH 用通用配置就能接,不用改源码。本地模型适合隐私敏感、离线或控成本场景:对话数据不出本机,也不需要 API 密钥与网络往返;代价是要自己准备模型文件与硬件资源。接入后连不上,先按《DeepSeek Harness 模型连不上排查》走一遍。DSH 还在开发者预览阶段,配置项可能变化,以官方文档为准(来源)。
DeepSeek Harness 接入前:本地模型服务怎么起
先让本地模型服务跑起来,拿到地址与模型名,再谈接入。 三类常见服务:
- Ollama:
ollama serve启动服务,默认http://127.0.0.1:11434/v1;ollama list查看已拉取的模型名。 - llama.cpp(llama-server):
llama-server -m <模型文件>启动,默认http://127.0.0.1:8080/v1。 - LM-Kit:本地 OpenAI 兼容服务,地址以你的启动配置为准。
还没下载模型的先用 ollama pull <模型名> 拉一个(llama.cpp 则需先准备好 GGUF 模型文件);模型名以 ollama list 的输出为准。注意两点:这些服务大多是前台进程,关掉启动它的终端,服务就停了,DSH 再请求就会失败;服务端的默认端口与模型名都可以改,改了之后 DSH 里的配置必须同步,两边不一致必然连不上。
起完先用 curl 验证服务在跑(以 Ollama 为例):
curl http://127.0.0.1:11434/v1/models
能返回模型列表,再进下一步;返回不了就先修服务本身,别急着改 DSH。这一步的意义是把「服务」和「DSH 配置」两个变量分开:curl 能通,说明问题只可能出在 DSH 侧配置;curl 不通,问题在服务或端口,去 Web UI 里瞎改也没用。
curl 不通时先分三类原因:端口被占用(换端口或先杀掉占用进程)、模型文件缺失或加载失败(看服务启动日志里有没有 OOM/显存不足)、地址写错(127.0.0.1 别写成别的地址)。其中显存不足在本地模型里最常见——模型超过显存时服务要么崩溃要么慢到不可用,先换小一号的模型,再回 DSH 侧调。服务稳定之后,DSH 侧基本就剩 endpoint 与模型名两个字段的事。
在 DeepSeek Harness Web UI 里配置本地模型
配置入口是设置 → 模型,按 OpenAI 兼容配置填 endpoint 与模型名。 打开 Web UI 的设置 → 模型(来源),添加模型时:
- 填 Base URL:本地服务的 OpenAI 兼容地址,例如
http://127.0.0.1:11434/v1。 - 填模型名:必须是服务端已加载/已拉取的模型名,写错会直接 404。
- 保存即生效:模型路由立即生效、不用重启(来源)。
可以给不同服务各起一个配置项(如「本地 Ollama」「云端 DeepSeek」),用模型名区分,切换时直接选;模型名填错返回 404 的处理方式见《模型连不上排查》。
本地服务一般不需要 API 密钥,endpoint 填 http://127.0.0.1:端口/v1 即可;个别本地服务自带鉴权开关,若服务端开了校验,把密钥填进 DSH 对应配置项,别留空。模型名必须与服务端一致:Ollama 用 ollama list 显示的名字,llama.cpp 用加载时指定的名字或默认模型名。
想确认配置真的写进去了,执行 dsh --dump-config 看组合后的配置树里模型相关行(来源)。
DeepSeek Harness 本地与云端模型怎么切换
本地、云端可以并存,切换即时生效。 在设置 → 模型里把多个 endpoint 都加上:本地填 127.0.0.1 各端口地址,云端填官方地址与 API 密钥,用时直接选对应模型。注意三点:
- endpoint 与模型名必须匹配,换模型要一起改。
- 云端模型要填 API 密钥,本地模型通常不需要。
- profile 只影响各自环境:
web和headless可以分别用不同模型,互不干扰。
切换后直接发一句消息即可验证是否走通:能正常回复说明配置成功;报 401/404/超时,回到《模型连不上排查》对照处理。本地与云端可以在同一个工作流里混用:跑敏感数据用本地模型,追求生成效果用云端模型,切换即时生效。
模型管理类 DSH plugin(模型路由、用量统计等)可以在 DSH Plugin Hub 的 model 分类下找到——安装后能直观看到当前走的是哪个模型、调用是否成功,本地与云端切换时一目了然。
什么场景用本地、什么场景用云端,取决于你的约束:要求数据不出本机、离线可用、或要控 API 成本,用本地模型;追求生成质量与长上下文,用云端模型。两者并存的意义是按任务切换:日常草稿走本地,正式产出走云端,切换即时生效、无需重启。
注意事项
- 本地模型服务要自己先起,DSH 不会替你启动它。
- 模型名写服务端真实存在的名字,写错连不上。
- headless 模式使用同一套模型配置,
dsh --dump-config可确认。 - 改了服务端端口或换了模型,DSH 里的 endpoint 与模型名要同步改。
常见问题
三步:先启动本地模型服务(Ollama / llama.cpp / LM-Kit),再到 Web UI 的设置 → 模型按 OpenAI 兼容配置填 endpoint 与模型名,保存即生效、不用重启。
Ollama 默认 http://127.0.0.1:11434/v1,llama.cpp 的 llama-server 默认 http://127.0.0.1:8080/v1,LM-Kit 以启动配置为准;它们都提供 OpenAI 兼容接口。
能。在设置 → 模型里把多个 endpoint 都加上:本地填 127.0.0.1 地址、云端填 API 密钥与官方地址,用时直接切换模型,即时生效。
先 curl 本地 /v1 地址确认服务在跑,再核对模型名是否为服务端已加载的模型;还不行就按《DSH 常见问题排查》里的模型部分继续查。
来源
- DeepSeek Harness 官方文档 - Quickstart· deepseek-harness
- dsh CLI README· deepseek-ai