dsh-vision-toolkit 是什么?给 DeepSeek Harness 纯文本模型加视觉

使用指南发布于 2026-08-30作者: DeepSeek Plugin 插件市场
dsh-vision-toolkit视觉工具DeepSeek HarnessDSHOCR
dsh-vision-toolkit 是 DeepSeek Harness 首个全面视觉工具插件,为纯文本模型赋予图像问答、长截图 OCR、UI 还原、像素对比与定位裁剪等能力,粘贴图片即可直接提问,Web 与 Headless 都能用。

dsh-vision-toolkit 是 DeepSeek Harness(DSH)生态首个全面视觉工具插件:它给纯文本模型装上一双「眼睛」,用 10 个视觉工具加一套 vision-skills 技能,完成图像问答、长截图 OCR、UI 还原、像素对比、定位裁剪等视觉任务。 本文介绍 dsh-vision-toolkit 是什么、核心功能、完整的安装更新卸载命令、典型用法与常见排错,帮你给 DSH 的文本模型补上视觉能力。

dsh-vision-toolkit 是什么?

dsh-vision-toolkit 解决「纯文本模型看不懂图像」的问题:它是 DSH 生态中首个全面视觉工具插件,让模型能粘贴图片直接提问、识别截图内容、还原前端 UI,并执行像素对比、定位裁剪等 GUI 视觉任务。 以下定位与事实均来自官方 README(来源):

dsh-vision-toolkit(GitHub 仓库 Anionex/dsh-vision-toolkit)由 Anionex 维护,MIT 协议开源,上游是 agent-vision-toolkit。它是 agent-vision-toolkit 的 DSH 原生集成,把「读取、定位、裁剪、矢量化、重建、验证」的视觉工作流带进 Web 与 Headless Profiles。在 DSH Web 中粘贴图片会自动把纯文本模型切换到带 (Vision Toolkit) 标记的视觉变体,原生缩略图、会话历史与工作区路径保持不变,还能预览工件;Headless 模式通过 read_image、OCR 等工具调用视觉能力。它是 DSH Plugin 生态中开箱即用的视觉工具插件,界面支持中英文。

dsh-vision-toolkit 的核心功能有哪些?

核心能力围绕「10 个视觉工具、focus hint 机制、vision-skills 技能、透明路由、隔离 Python 运行时」五件事展开,一次配置后粘贴图片即可使用。 以下能力均来自官方 README(来源):

  • 图像问答与多图比较:vision_glance 回答「图里是什么、哪里报错」等问题,支持一次比较多张图片。
  • 长截图 OCR:vision_long_screenshot_ocr 识别超长截图,输出 Markdown、分块结果、元素清单与审计信息。
  • UI 还原:从截图还原前端 UI,生成 UI 代码或结构描述,辅助界面开发与测试。
  • 像素对比:vision_pixel_diff 输出差异百分比、排序差异区域、热力图与 JSON。
  • 定位与裁剪:vision_ground 返回原始像素坐标 x1,y1,x2,y2(可选 boxed 预览),vision_crop 裁剪 PNG/JPEG,vision_trace 矢量化成 SVG。
  • 透明路由:粘贴图片自动切换到 (Vision Toolkit) 视觉变体,无需手动切模型,会话历史与工作区路径保持不变。

怎么安装与启用 dsh-vision-toolkit?

安装用一条 npm 命令装进 DeepSeek Harness Web profile,重启后到设置里配置视觉提供方并测试模型,然后粘贴图片或调用 /vision-skills 即可使用。 安装、更新与卸载命令均来自官方 README(来源):

1. 安装:推荐从 npm 安装稳定版到 Web profile:

bash
dsh plugin --profile web add @anionex/dsh-vision-toolkit

Headless 与 Desktop 分别使用对应 profile:

bash
dsh plugin --profile headless add @anionex/dsh-vision-toolkit

2. 启用:重启 Web Profile 后打开 Settings → Vision Toolkit,配置视觉提供方(如 Gemini 3.7 Flash),点 Test vision model 验证;首次启动会准备隔离 Python 运行时——优先用系统 Python 3.11+,否则下载约 35 MB 独立 Python 并从镜像安装 Pillow、NumPy、vtracer。

3. 更新:重新运行同一条 add 命令并指定最新版(update 到最新版):

bash
# update to latest
dsh plugin --profile web add @anionex/dsh-vision-toolkit@latest

4. 卸载:从 Web profile 移除:

bash
dsh plugin --profile web remove @anionex/dsh-vision-toolkit

dsh-vision-toolkit 典型用法

装上并配好视觉提供方后,粘贴图片或调用视觉技能就能让模型看图干活:日常问答、长截图 OCR、UI 还原、像素对比、定位裁剪都通过工具自动完成。 以下用法示例均来自官方 README(来源):

1. 粘贴图片直接提问:粘贴截图并提问「这张截图里哪里报错?」,模型自动切换到视觉变体并调用 vision_glance 定位证据;支持一次比较多张图片。

2. 调用视觉技能:使用 /vision-skills 让模型从五套 playbook(长截图 OCR / UI 还原 / 图形还原 / 结构还原 / GUI 操作)里选择合适的流程:

bash
/vision-skills

3. 长截图 OCR:对整屏长截图做文字识别,让模型用 vision_long_screenshot_ocr 输出 Markdown、分块结果与元素清单:

bash
请对这张长截图做 OCR,输出 Markdown,并列出所有按钮和表单元素

4. UI 还原:把设计稿或界面截图还原成前端 UI,让模型按 UI 还原 playbook 生成代码或结构描述:

bash
根据这张截图还原成前端 UI,输出对应的 HTML 结构

5. 像素对比:回归测试中对比两张截图,用 vision_pixel_diff 得到差异百分比、差异区域排序与热力图:

bash
对比这两张截图,输出差异百分比和差异区域

6. 定位与裁剪:让 vision_ground 返回原始像素坐标(x1,y1,x2,y2),再用 vision_crop 裁剪局部:

bash
定位截图里的报错弹窗,并裁剪出来

dsh-vision-toolkit 常见问题与排错

最常见的 dsh-vision-toolkit 问题集中在四个地方:视觉 API 返回结构不兼容、粘贴图片仍提示不支持、429 限流、首次运行环境准备失败。 以下排错要点均来自官方 README(来源):

1. 报「Vision API returned an incompatible response structure」:症状 = 配置后调用视觉工具报结构不兼容;原因 = baseUrl 缺少 /v1 路径前缀,例如 LM Studio/Ollama 需写成 http://127.0.0.1:1234/v1;解决 = 在配置里补全 /v1 前缀后重试。

2. 粘贴图片仍提示不支持:症状 = 粘贴图片后模型仍说无法处理图片;原因 = 未重启或路由未生效;解决 = 重启 Web Profile、确认路由带 (Vision Toolkit) 后缀,或把图片放进工作区后调用 /vision-skills。

3. 视觉 API 返回 429:症状 = 请求被限流;原因 = 端点配额不足;解决 = 等待 Retry-After 时间后重试,或换用自己的端点。

4. 首次运行时设置失败:症状 = 首次启动环境准备报错;原因 = 网络或磁盘异常,无法获取独立 Python;解决 = 检查网络与磁盘,安装系统 Python 3.11+,或在配置里指定 runtime.python。

适用场景与注意

dsh-vision-toolkit 适合所有需要让 DeepSeek Harness 处理图像的场景:看图问答、识别截图、还原 UI、对比像素、定位元素,一次配置后 Web 与 Headless 都能用。 以下场景与限制均来自官方 README(来源):

  • 适用场景:测试与开发时粘贴报错截图直接定位问题;对长截图批量 OCR 提取信息;从设计稿还原前端 UI;回归测试中对比两张截图的像素差异;用 GUI 操作 playbook 指导模型操作界面。
  • 注意事项:透明路由默认开启,可在高级设置「Transparent variant routing」关闭以恢复显式变体条目;每次调用只发送必要意图与图像、上下文不跨调用累积,成本小;可本地部署 Gemma 4、Qwen 3.5/3.6 等小多模态模型进一步降本;自签证书或 MITM 场景可设 VISION_SSL_VERIFY=0;HTML 截图工具需要系统安装 Chrome/Chromium/Edge,缺省时其余工具不受影响。

项目链接

dsh-vision-toolkit 是 Anionex 维护的 MIT 开源项目。

插件详情:dsh-vision-toolkit 插件详情。

本页是基于该插件官方 README 独立重写的导读——权威文档和最新变更请以源头为准:Anionex/dsh-vision-toolkit。插件是安装时就在你机器上运行的第三方代码;收录不代表背书——安装前请自行审阅源码。

常见问题

dsh-vision-toolkit 是什么,能为 DeepSeek Harness 解决什么问题?

dsh-vision-toolkit 是 DeepSeek Harness 生态首个全面视觉工具插件,为纯文本模型赋予图像问答、长截图 OCR、UI 还原等视觉能力,粘贴图片即可直接提问。

dsh-vision-toolkit 如何让纯文本模型自动切换视觉变体?

在 DSH Web 粘贴图片后,dsh-vision-toolkit 的透明路由会自动把纯文本模型切换到带(Vision Toolkit)标记的视觉变体,无需手动改模型,历史记录与工作区路径保持不变。

dsh-vision-toolkit 内置了哪些视觉工具?

dsh-vision-toolkit 内置 10 个视觉工具:vision_glance 负责图像问答,长截图 OCR、像素对比、定位与裁剪、UI 还原等覆盖看图、读长图、比界面、找元素等任务,配合 vision-skills 技能挑选合适工具并验证结果。

dsh-vision-toolkit 的 vision-skills 是什么?

vision-skills 是 dsh-vision-toolkit 捆绑的技能,内置长截图 OCR、UI 还原、图形还原、结构还原、GUI 操作五套 playbook,指导选工具并验证结果。

dsh-vision-toolkit 首次使用需要准备什么?

dsh-vision-toolkit 安装后重启 Web Profile 使插件生效,然后在设置里配置视觉提供方并测试即可,之后粘贴图片即可直接提问。首次启动会自动准备隔离的 Python 运行时,无需手动安装依赖,后续调用即开即用。

dsh-vision-toolkit 的使用成本高吗?

dsh-vision-toolkit 每次调用只发送必要意图与图像,上下文不跨调用累积,成本很小;也可以本地部署 Gemma 4、Qwen 3.5 等小多模态模型进一步降本。

相关术语

dsh-vision-toolkit
dsh-vision-toolkit 是 DeepSeek Harness(DSH)的视觉工具箱插件,内置 10 个视觉工具与 vision-skills 技能,为纯文本模型赋予图像问答、长截图 OCR、UI 还原、像素对比等能力。— dsh-vision-toolkit README
透明路由
透明路由是 dsh-vision-toolkit 默认开启的机制:粘贴图片时自动把纯文本模型切换到带(Vision Toolkit)标记的视觉变体,可在高级设置中关闭。— dsh-vision-toolkit README
vision-skills
vision-skills 是 dsh-vision-toolkit 捆绑的视觉技能,内置长截图 OCR、UI 还原、图形还原、结构还原与 GUI 操作五套 playbook。— dsh-vision-toolkit README
focus hint
focus hint 是 dsh-vision-toolkit 的聚焦提示机制:把用户消息或模型理由作为提示传给视觉模型,产出任务感知的描述,token 更少、准确率更高。— dsh-vision-toolkit README
(Vision Toolkit) 变体
(Vision Toolkit) 变体是纯文本模型在 DSH 中的视觉形态,透明路由开启时由粘贴图片自动切换,关闭后可在模型选择器中手动选择。— dsh-vision-toolkit README

来源

查看全部文章