跳到主内容

dsh-vision-toolkit 使用指南

给 DeepSeek Harness 纯文本 Agent 装上眼睛:粘贴图片即提问、视觉定位、OCR、UI 还原与像素对比。

本文为派生内容(基于 wiki / faq / compatibility_json 自动组装),非 AI 即时创作。

本文由本站基于该插件已收录的字段自动派生(wiki / faq / compatibility_json / readme),非 AI 即时创作。每节末尾标源字段。

快速上手

dsh-vision-toolkit

— 源: plugin_wiki.wiki_content

安装与验证

dsh plugin --profile web add @anionex/dsh-vision-toolkit

复制以上命令在 DSH Web Profile 内运行。安装完成后在「插件列表」启用即可。

— 源: plugins.install

关键要点

    • ChatGPT / Claude(授权码 + PKCE):本机浏览器打开授权页 → 用户授权 → 跳回 127.0.0.1 回调。必须在本机跑 dsh,远程/无桌面环境收不到回调;
    • Grok / Kimi(设备授权流):页面展示验证链接 + 设备码 → 用户在浏览器打开并输入代码;
  • 设置页有渠道、模型选择器没有:未登录或令牌失效——重新登录。未登录渠道故意不注册 provider;
  • ChatGPT / Claude 点登录无反应或一直 pending:rundll32 打开浏览器失败,或本机 1455 / 54545 端口被占;不要用 cmd /c start(URL 里的 & 会被截断);
  • history unavailable + uncachedInputTokens / Too small: expected number to be >=0:旧会话日志里有负 usage。写入侧已钳零,读路径有投影守卫;仍炸则换新会话,不要改 DSH 内核;

— 源: plugin_wiki.readme_zh (fallback readme_raw)

常见问题

安装后还需要自己申请视觉模型 API Key 吗?

不需要。插件默认接入内置免费的共享视觉服务(Gemini 3.7 Flash),开箱即可粘贴图片提问。需要在「设置 → 视觉工具」运行一次"测试视觉模型"确认连通即可。

它和 DSH 自带的 describe_image 工具有什么区别?

自带工具只能给出一段笼统描述。这个插件提供 10 个细分工具,分别负责问答、定位、检测、裁剪、矢量描摹、像素对比、长图 OCR、主体抠图、主色分析和 HTML 截图,并且会围绕用户当前问题提取证据,而不只是描述图片。

为什么我粘贴图片后还是提示模型不支持图片?

通常需要重启 Web Profile 并刷新页面,让模型选择器出现带"(Vision Toolkit)"后缀的变体;或者先把图片放进会话工作区,再调用 /vision-tools 让工具显式读图。

是否支持 Headless Profile(纯命令行)?

服务端插件和 10 个视觉工具在 Headless Profile 下同样可用;但设置界面、粘贴接管和产物预览等 Web 端能力依赖 dsh.client.platform=web,只在 Web Profile 生效。

升级后需要手动重启吗?

在"设置 → 视觉工具"里点"自动更新并重启",插件会校验、备份 manifest、然后自重启当前 Web 进程。Windows、动态端口或由进程管理器托管的实例只能手动检查版本。

— 源: plugin_wiki.faq_json

兼容性

  • DSH: ^0.1.0-rc.6
  • Node: ^22.19.0 || >=24.0.0

— 源: plugin_wiki.compatibility_json

踩坑提醒

安装前请审阅上游仓库;本指南基于已收录字段自动派生,可能滞后于最新版本。如发现与官方文档冲突,请以上游为准。

— 来源:通用规则