dsh-local-models:在 DeepSeek Harness 里跑本地 GGUF 模型
vmarcelo49/dsh-local-models
为 DeepSeek Harness 的 Web GUI 添加本地模型标签页,挑选 .gguf 文件、调节上下文与投机解码、实时估算显存,并通过 llama-server 加载后一键注册为 dsh 模型提供商。
dsh-local-models 是给 DeepSeek Harness 加上本地模型能力的 DSH plugin,在 Web GUI 设置里多出一个 Local Models 标签页。它解决的是本地大模型跑起来容易、接进 Agent 框架却要手工改配置的麻烦:挑选 .gguf 文件、调上下文与投机解码、看实时显存估算,再用 llama-server 加载,最后一键把运行中的服务注册成 DSH 的模型提供方。插件基于上游原版 llama.cpp,无需打补丁或构建步骤,采用 MIT 协议。
如何安装
dsh plugin --profile web add github:vmarcelo49/dsh-local-models- 分类
- 模型与推理
- 平台
- DSH Plugin
- 作者
- vmarcelo49
- 分发方式
- 插件
dsh-local-models 核心特性
dsh-local-models 仓库简介
它是做什么的?
dsh-local-models 是 DeepSeek Harness(DSH)的本地模型接入插件,在 DSH Web GUI 里新增一个 Local Models 标签页,让你挑选 .gguf 文件、调好上下文与投机解码参数、看着显存估算,再通过 llama-server 把模型跑起来。它解决的是「本地大模型跑起来容易、接进 Agent 框架麻烦」的问题:加载完成后一键把运行中的服务注册成 DSH 的模型提供方,不必手工改配置。插件由 Vmarcelo49 维护,采用 MIT 协议,基于上游原版 llama.cpp,不需要打补丁或额外构建步骤。
核心功能
- 模型选择器:内置文件浏览器只显示目录与 .gguf 文件,并对 GGUF 头部做轻量解析,读出架构、量化方式、层数、上下文长度与是否为 MoE。
- 启动参数调节:上下文滑块按 8K 步进并以模型训练上下文为上限,可设 MTP 草稿深度、思考等级、可选的视觉 mmproj 投影器(GPU 或 CPU 卸载)以及 MoE 专家放置策略。
- 实时显存估算:把权重、KV 缓存、循环状态与计算图开销加总后与 16 GB 显存对比,给出是否放得下、安全余量与最大可容纳上下文。
- 配置档案与路由模式:保存命名好的启动配置一键重载;路由模式用一个 OpenAI 兼容端点同时服务多个档案,模型按需加载,默认同一时刻只驻留一个。
- 一键注册进 DSH:把就绪的服务写成 DSH 的模型提供方路由,自动带上视觉模态与思考等级。
- 终端浮层:在标签页内实时查看 llama-server 日志输出。
怎么使用这个插件?
在 DSH 的 web profile 中启用后,打开设置里的 Local Models 标签页,点「Choose GGUF…」挑选模型文件,再用 Home / Models 快捷入口与向上导航浏览目录。接着调整上下文、MTP 草稿深度、思考等级,按需配置 mmproj 与 MoE 选项,点「Load model」加载并观察状态卡片,必要时用「Open terminal」查看输出。加载完成后点「Register in dsh」,对应路由会出现在模型选择器里;也可以先保存多个配置档案,再用「Start router (from profiles)」起一个多模型端点。端口、服务二进制路径、文件浏览快捷目录、路由并发模型数等都可以通过环境变量调整,显存估算常量则写在客户端脚本顶部,换显卡时按需修改。
报错怎么排查?
显存估算对 Gemma 系列模型存在已知精度偏差,若估算结果与实际占用不符,请以实际运行日志为准。插件依赖一个可用的 llama-server 二进制,若加载失败,先确认该二进制存在且与你的 Vulkan / CUDA / CPU 环境匹配。显存估算常量默认按 16 GB 显卡设定,显卡不同时需要按官方说明调整对应常量。修改服务端路由或注入列表后需要重启 DSH 进程,只改客户端部分则刷新页面即可。
本页是基于该插件官方 README 独立重写的导读——权威文档和最新变更请以源头为准:vmarcelo49/dsh-local-models。插件是安装时就在你机器上运行的第三方代码;收录不代表背书——安装前请自行审阅源码。
