dsh-vision:为 DeepSeek Harness 提供接近原生的图像理解能力
oil-oil/dsh-vision
为 DeepSeek Harness 提供原生图像理解,纯文本模型也能看图。
dsh-vision 让 DeepSeek Harness 的文本模型也能看懂图片,通过视觉桥接注入观察结果,支持多图联合分析。
dsh plugin --profile web add github:oil-oil/dsh-vision- 分类
- 工具与能力
- 平台
- DSH-Plugin
- 作者
- oil-oil
- 分发方式
- 插件
dsh-vision 核心特性
dsh-vision 仓库信息

dsh-vision 仓库简介
dsh-vision 是 DeepSeek Harness(DSH)的视觉能力插件(DSH plugin),由 oil-oil 维护,采用 MIT 协议,旨在为 Harness 带来接近原生的图像理解能力。它解决的核心问题是:当主模型不支持图像输入时,如何让 DeepSeek 模型依然能基于图片内容给出最终答案。该插件通过一个独立的视觉模型观察原始图片,并将观察结果作为附件上下文注入,从而让文本模型也能“看懂”图片。它不替换 Harness 中选定的主模型,而是以桥接方式工作,支持多图联合分析,且不改变用户任务的原始转发。
dsh-vision 这个 DSH plugin 支持哪些核心特性?
- 原生透传:当主模型支持图像时,原始图片直接发送,无需预处理或 OCR。
- 视觉桥接:当主模型为
deepseek-official或其他纯文本模型时,调用配置的视觉模型观察图片,输出作为附件上下文注入。 - 多图联合分析:多个图片附件一起分析,支持对比和组合证据。
- 回退机制:云端视觉不可用时,回退到 macOS Vision 或 Tesseract 本地 OCR。
- 兼容 see-skill:可读取
~/.config/see/config.env中的配置。
dsh-vision 怎么安装?
使用 DeepSeek Harness 内置的插件管理器安装,命令如下:
dsh plugin --profile web add github:oil-oil/dsh-vision
安装后重启 Harness,即可在输入框中粘贴或拖拽图片。插件会替换官方 deepseek-official 适配器,但保留其模型目录、设置和凭据,并在 Settings → Plugins → Plugin configuration 中新增 Vision Recognition 卡片。
dsh-vision 如何配置视觉识别?
在 Settings → Plugins → Plugin configuration → Vision Recognition 中,选择 ZenMux、阿里云百炼、TokenDance 或 OpenRouter,并输入 API 密钥。同一卡片可修改模型 ID、API 端点和图片数量限制。API 密钥通过 Harness 官方凭据服务存储,浏览器中只写不读,确保安全。路由遵循用户选择:文本模型优先使用 Vision Recognition 中选定的提供商,其他 Harness 视觉路由和本地 OCR 仅作为回退。选择 Automatic 可跳过插件管理的云凭据,自动尝试 Harness 中已配置的图像模型。
dsh-vision 支持哪些高级文件配置?
大多数场景使用 UI 即可,等效的非机密字段位于 $DSH_HOME/settings.yaml 的 llm-deepseek 部分:
llm-deepseek:
visionBackend: zenmux
visionBackendModel: qwen/qwen3.7-plus
visionBackendBaseURL: https://zenmux.ai/api/v1
maxImages: 8
注意:不要在此文件中放置 API 密钥,应通过 Vision Recognition 卡片或环境变量提供。配置更改无需重启即可生效。
dsh-vision 兼容哪些 DeepSeek Harness 版本和平台?
该插件针对 DeepSeek Harness 0.1.0-rc.6 版本开发,目前 Harness 仍处于开发者预览阶段。插件由 TypeScript 编写,依赖多个官方 DSH 包,支持 macOS 平台(利用 macOS Vision 作为回退)。仓库创建于 2026-08-14,最近更新于同日,目前无未解决问题。