dsh-vision-toolkit 使用指南
给 DeepSeek Harness 纯文本 Agent 装上眼睛:粘贴图片即提问、视觉定位、OCR、UI 还原与像素对比。
本文为派生内容(基于 wiki / faq / compatibility_json 自动组装),非 AI 即时创作。
本文由本站基于该插件已收录的字段自动派生(wiki / faq / compatibility_json / readme),非 AI 即时创作。每节末尾标源字段。
快速上手
dsh-vision-toolkit
— 源: plugin_wiki.wiki_content
安装与验证
dsh plugin --profile web add @anionex/dsh-vision-toolkit
复制以上命令在 DSH Web Profile 内运行。安装完成后在「插件列表」启用即可。
— 源: plugins.install
关键要点
-
- ChatGPT / Claude(授权码 + PKCE):本机浏览器打开授权页 → 用户授权 → 跳回
127.0.0.1回调。必须在本机跑 dsh,远程/无桌面环境收不到回调;
- ChatGPT / Claude(授权码 + PKCE):本机浏览器打开授权页 → 用户授权 → 跳回
-
- Grok / Kimi(设备授权流):页面展示验证链接 + 设备码 → 用户在浏览器打开并输入代码;
- 设置页有渠道、模型选择器没有:未登录或令牌失效——重新登录。未登录渠道故意不注册 provider;
- ChatGPT / Claude 点登录无反应或一直 pending:
rundll32打开浏览器失败,或本机 1455 / 54545 端口被占;不要用cmd /c start(URL 里的&会被截断); history unavailable+uncachedInputTokens/Too small: expected number to be >=0:旧会话日志里有负 usage。写入侧已钳零,读路径有投影守卫;仍炸则换新会话,不要改 DSH 内核;
— 源: plugin_wiki.readme_zh (fallback readme_raw)
常见问题
安装后还需要自己申请视觉模型 API Key 吗?
不需要。插件默认接入内置免费的共享视觉服务(Gemini 3.7 Flash),开箱即可粘贴图片提问。需要在「设置 → 视觉工具」运行一次"测试视觉模型"确认连通即可。
它和 DSH 自带的 describe_image 工具有什么区别?
自带工具只能给出一段笼统描述。这个插件提供 10 个细分工具,分别负责问答、定位、检测、裁剪、矢量描摹、像素对比、长图 OCR、主体抠图、主色分析和 HTML 截图,并且会围绕用户当前问题提取证据,而不只是描述图片。
为什么我粘贴图片后还是提示模型不支持图片?
通常需要重启 Web Profile 并刷新页面,让模型选择器出现带"(Vision Toolkit)"后缀的变体;或者先把图片放进会话工作区,再调用 /vision-tools 让工具显式读图。
是否支持 Headless Profile(纯命令行)?
服务端插件和 10 个视觉工具在 Headless Profile 下同样可用;但设置界面、粘贴接管和产物预览等 Web 端能力依赖 dsh.client.platform=web,只在 Web Profile 生效。
升级后需要手动重启吗?
在"设置 → 视觉工具"里点"自动更新并重启",插件会校验、备份 manifest、然后自重启当前 Web 进程。Windows、动态端口或由进程管理器托管的实例只能手动检查版本。
— 源: plugin_wiki.faq_json
兼容性
- DSH: ^0.1.0-rc.6
- Node: ^22.19.0 || >=24.0.0
— 源: plugin_wiki.compatibility_json
踩坑提醒
安装前请审阅上游仓库;本指南基于已收录字段自动派生,可能滞后于最新版本。如发现与官方文档冲突,请以上游为准。
— 来源:通用规则