DeepSeek Harness 怎么接入本地大模型?LM-Kit、llama.cpp 与 DSH plugin 模型配置

配置与使用发布于 2026-08-21作者: DSH Plugin 插件中心
DeepSeek HarnessDSH plugin本地大模型Ollamallama.cpp
DeepSeek Harness 接入本地大模型,先确认本地服务(LM-Kit、llama.cpp、Ollama)已启动并拿到 OpenAI 兼容地址,再到 Web UI 的设置 → 模型里填 endpoint 与模型名;本文同时讲清 profile 配置与本地、云端模型切换。

DeepSeek Harness 接入本地大模型,前提是本地服务已启动、endpoint 与模型名填对;配置入口在 Web UI 的设置 → 模型,走 OpenAI 兼容协议即可。

概览

本地模型接入就三步:起服务、填配置、切换验证。 本地模型服务(LM-Kit / llama.cpp / Ollama)基本都提供 OpenAI 兼容接口,DSH 用通用配置就能接,不用改源码。本地模型适合隐私敏感、离线或控成本场景:对话数据不出本机,也不需要 API 密钥与网络往返;代价是要自己准备模型文件与硬件资源。接入后连不上,先按《DeepSeek Harness 模型连不上排查》走一遍。DSH 还在开发者预览阶段,配置项可能变化,以官方文档为准(来源)。

DeepSeek Harness 接入前:本地模型服务怎么起

先让本地模型服务跑起来,拿到地址与模型名,再谈接入。 三类常见服务:

  1. Ollamaollama serve 启动服务,默认 http://127.0.0.1:11434/v1ollama list 查看已拉取的模型名。
  2. llama.cpp(llama-server)llama-server -m <模型文件> 启动,默认 http://127.0.0.1:8080/v1
  3. LM-Kit:本地 OpenAI 兼容服务,地址以你的启动配置为准。

还没下载模型的先用 ollama pull <模型名> 拉一个(llama.cpp 则需先准备好 GGUF 模型文件);模型名以 ollama list 的输出为准。注意两点:这些服务大多是前台进程,关掉启动它的终端,服务就停了,DSH 再请求就会失败;服务端的默认端口与模型名都可以改,改了之后 DSH 里的配置必须同步,两边不一致必然连不上。

起完先用 curl 验证服务在跑(以 Ollama 为例):

bash
curl http://127.0.0.1:11434/v1/models

能返回模型列表,再进下一步;返回不了就先修服务本身,别急着改 DSH。这一步的意义是把「服务」和「DSH 配置」两个变量分开:curl 能通,说明问题只可能出在 DSH 侧配置;curl 不通,问题在服务或端口,去 Web UI 里瞎改也没用。

curl 不通时先分三类原因:端口被占用(换端口或先杀掉占用进程)、模型文件缺失或加载失败(看服务启动日志里有没有 OOM/显存不足)、地址写错(127.0.0.1 别写成别的地址)。其中显存不足在本地模型里最常见——模型超过显存时服务要么崩溃要么慢到不可用,先换小一号的模型,再回 DSH 侧调。服务稳定之后,DSH 侧基本就剩 endpoint 与模型名两个字段的事。

在 DeepSeek Harness Web UI 里配置本地模型

配置入口是设置 → 模型,按 OpenAI 兼容配置填 endpoint 与模型名。 打开 Web UI 的设置 → 模型来源),添加模型时:

  1. 填 Base URL:本地服务的 OpenAI 兼容地址,例如 http://127.0.0.1:11434/v1
  2. 填模型名:必须是服务端已加载/已拉取的模型名,写错会直接 404。
  3. 保存即生效:模型路由立即生效、不用重启(来源)。

可以给不同服务各起一个配置项(如「本地 Ollama」「云端 DeepSeek」),用模型名区分,切换时直接选;模型名填错返回 404 的处理方式见《模型连不上排查》。

本地服务一般不需要 API 密钥,endpoint 填 http://127.0.0.1:端口/v1 即可;个别本地服务自带鉴权开关,若服务端开了校验,把密钥填进 DSH 对应配置项,别留空。模型名必须与服务端一致:Ollama 用 ollama list 显示的名字,llama.cpp 用加载时指定的名字或默认模型名。

想确认配置真的写进去了,执行 dsh --dump-config 看组合后的配置树里模型相关行(来源)。

DeepSeek Harness 本地与云端模型怎么切换

本地、云端可以并存,切换即时生效。 在设置 → 模型里把多个 endpoint 都加上:本地填 127.0.0.1 各端口地址,云端填官方地址与 API 密钥,用时直接选对应模型。注意三点:

  1. endpoint 与模型名必须匹配,换模型要一起改。
  2. 云端模型要填 API 密钥,本地模型通常不需要。
  3. profile 只影响各自环境webheadless 可以分别用不同模型,互不干扰。

切换后直接发一句消息即可验证是否走通:能正常回复说明配置成功;报 401/404/超时,回到《模型连不上排查》对照处理。本地与云端可以在同一个工作流里混用:跑敏感数据用本地模型,追求生成效果用云端模型,切换即时生效。

模型管理类 DSH plugin(模型路由、用量统计等)可以在 DSH Plugin Hub 的 model 分类下找到——安装后能直观看到当前走的是哪个模型、调用是否成功,本地与云端切换时一目了然。

什么场景用本地、什么场景用云端,取决于你的约束:要求数据不出本机、离线可用、或要控 API 成本,用本地模型;追求生成质量与长上下文,用云端模型。两者并存的意义是按任务切换:日常草稿走本地,正式产出走云端,切换即时生效、无需重启。

注意事项

  1. 本地模型服务要自己先起,DSH 不会替你启动它。
  2. 模型名写服务端真实存在的名字,写错连不上。
  3. headless 模式使用同一套模型配置,dsh --dump-config 可确认。
  4. 改了服务端端口或换了模型,DSH 里的 endpoint 与模型名要同步改。

来源:官方 Quickstartdsh CLI README

常见问题

DeepSeek Harness 怎么接本地大模型?

三步:先启动本地模型服务(Ollama / llama.cpp / LM-Kit),再到 Web UI 的设置 → 模型按 OpenAI 兼容配置填 endpoint 与模型名,保存即生效、不用重启。

本地模型服务默认地址是什么?

Ollama 默认 http://127.0.0.1:11434/v1,llama.cpp 的 llama-server 默认 http://127.0.0.1:8080/v1,LM-Kit 以启动配置为准;它们都提供 OpenAI 兼容接口。

本地和云端模型能一起配吗?

能。在设置 → 模型里把多个 endpoint 都加上:本地填 127.0.0.1 地址、云端填 API 密钥与官方地址,用时直接切换模型,即时生效。

填了本地模型还是连不上?

先 curl 本地 /v1 地址确认服务在跑,再核对模型名是否为服务端已加载的模型;还不行就按《DSH 常见问题排查》里的模型部分继续查。

来源