dsh-llama-model-manager:为 DeepSeek Harness 托管本地 llama.cpp 模型
doctorxpriestess/dsh-llama-model-manager
这是一个 DSH 插件,用 OpenAI 兼容网关统一管理本地 llama.cpp GGUF 模型,按需自动加载、切换与卸载,让 DSH 始终只连一个固定地址。
dsh-llama-model-manager 是面向 DeepSeek Harness 的本地模型托管插件,把 Windows 上的 llama.cpp GGUF 模型包装成一个地址固定的 OpenAI 兼容网关。它要解决的是换模型就得停服务、改配置、重启的老问题:启动、停止、切换、重启全部由插件接管,DSH 始终只面对同一个 URL。串行化访问闸门保证切换时在途请求先排空,真实 Ctrl+C 让显存被 llama.cpp 自行释放,runtime.json 与端口预检则兜住孤儿进程和端口冲突。设置页里状态、日志、模型列表与操作按钮一屏可见。
如何安装
dsh plugin --profile web add github:doctorxpriestess/dsh-llama-model-manager- 分类
- 模型与推理
- 平台
- DSH Plugin
- 作者
- doctorxpriestess
- 分发方式
- 插件
dsh-llama-model-manager 核心特性
dsh-llama-model-manager 仓库简介
它是做什么的?
它是 DeepSeek Harness(DSH)的本地 llama.cpp 模型管理插件,把 Windows 上的 GGUF 模型变成 DSH 可直接调用的稳定服务。它解决的是「换模型就要停服务、改配置、重启」的麻烦:插件自己托管模型生命周期,DSH 始终只面对一个固定的 OpenAI 兼容网关地址,背后换哪个模型都无需改动。由 DoctorxPriestess 维护,采用 MIT 协议,纯 JavaScript 实现,无 npm 依赖、无构建步骤。
核心功能
- 模型生命周期托管:启动、停止、切换、重启本地 GGUF 模型,DSH 侧只保留一个固定 URL。
- 串行化访问闸门:推理请求持共享票据,切换模型需独占票据并等待在途请求排空,避免中途换模型导致输出损坏。
- 真实停止与显存回收:向 llama-server 发送真正的 Ctrl+C 语义,让 llama.cpp 自行释放模型,避免残留约 12 GB 显存。
- 孤儿进程兜底:通过 runtime.json 记录运行状态,DSH 异常退出后只清理能确认归属自己的残留进程。
- 启动前端口检查:端口被占用时直接报错并指出占用进程,同时以隐藏控制台方式启动,避免窗口闪烁。
- 设置页可视化管理:实时状态、日志、模型列表,以及启动/停止/切换/重启操作一屏完成。
怎么使用这个插件?
在 DSH 的 Web 界面打开「设置 → 本地模型管理」,先填写 llama-server.exe 的完整路径,再至少添加一个模型(模型 id、显示名、.gguf 文件完整路径)。随后在 DSH 的 settings.yaml 中把某个 provider 指向该网关,即可在 DSH 里正常对话并随时切换本地模型。该插件仅支持 Windows 10/11,需要 Node.js 20.10 及以上(推荐 22+),并自备 llama.cpp 的 llama-server 可执行文件与 .gguf 模型文件。
本页是基于该插件官方 README 独立重写的导读——权威文档和最新变更请以源头为准:doctorxpriestess/dsh-llama-model-manager。插件是安装时就在你机器上运行的第三方代码;收录不代表背书——安装前请自行审阅源码。
