dsh-vision 使用指南
给 DeepSeek Harness 的纯文本模型装上眼睛,让它们能直接看懂用户粘贴的图片并基于图像内容回答问题。
本文为派生内容(基于 wiki / faq / compatibility_json 自动组装),非 AI 即时创作。
本文由本站基于该插件已收录的字段自动派生(wiki / faq / compatibility_json / readme),非 AI 即时创作。每节末尾标源字段。
快速上手
dsh-vision
— 源: plugin_wiki.wiki_content
安装与验证
dsh plugin --profile web add github:oil-oil/dsh-vision
复制以上命令在 DSH Web Profile 内运行。安装完成后在「插件列表」启用即可。
— 源: plugins.install
关键要点
- macOS:系统 Vision OCR,无需额外安装。
- Linux / Windows:Tesseract;需要自行安装对应语言包。
- 原图只发送给用户配置的视觉服务。
- 视觉结果会被标记为非可信观察数据,图片里的提示词不会获得系统权限。
- 视觉上下文只参与当前模型请求,不改写历史消息。
— 源: plugin_wiki.readme_zh (fallback readme_raw)
常见问题
安装后还需要自己申请视觉模型的 API Key 吗?
默认不需要。保持"自动选择"即可,插件会先尝试 Harness 中已配置且声明支持图片的模型,再读取 see 私有配置和本地 OCR;只有手动指定某个云端平台(ZenMux / 百炼 / TokenDance / OpenRouter)时,才需要填写对应平台的 API Key。
当前主模型已经支持图片,插件还会插手吗?
不会。VisionBridgeAdapter 会先检查当前模型的输入模态,如果原生支持图片就直接转发到原始 DeepSeek 适配器,桥接逻辑完全不参与;只有在原模型不支持图片时才会调用外部视觉模型。
多张图片会分开识别还是联合分析?
联合分析。一次请求里所有图片会打包送进同一个外部视觉调用,因此适合做前后对比、组合证据这种需要同时看到多张图的场景。
macOS 上不联网能识别图片吗?
可以。在 macOS 上本地降级走系统内置 Vision OCR,不需要额外安装;如果系统 OCR 不可用,会再尝试 Tesseract。其他系统需要自行安装 Tesseract 和语言包。注意本地降级以文字识别为主,不等同于完整多模态语义理解。
单次请求最多能发几张图片?
默认 8 张,可在 1–32 之间调整(界面"视觉识别"卡片上的"单次图片上限")。超过上限会直接报错,不会静默截断。
API Key 会被保存到哪里?安全吗?
通过 Harness 官方凭据服务保存,写入后只能知道"是否存在",不会被读回聊天、设置页面或会话日志;也可以通过 see 私有配置文件 ~/.config/see/config.env 或同名环境变量提供。本仓库不会写入任何 Key。
配置改了之后需要重启吗?
不需要。$DSH_HOME/settings.yaml 的 llm-deepseek 段落或界面里改完后会自动生效。
如何卸载或停用?
用 dsh plugin --profile web remove 卸载;想临时关掉可以把 cordis.patch.yml 里的 dsh-vision 条标 disabled: true 后重启 Web Profile。
— 源: plugin_wiki.faq_json
兼容性
- DSH: =0.1.0-rc.6
- Node: >=22.19
— 源: plugin_wiki.compatibility_json
踩坑提醒
安装前请审阅上游仓库;本指南基于已收录字段自动派生,可能滞后于最新版本。如发现与官方文档冲突,请以上游为准。
— 来源:通用规则