跳到主内容

dsh-vision 使用指南

给 DeepSeek Harness 的纯文本模型装上眼睛,让它们能直接看懂用户粘贴的图片并基于图像内容回答问题。

本文为派生内容(基于 wiki / faq / compatibility_json 自动组装),非 AI 即时创作。

本文由本站基于该插件已收录的字段自动派生(wiki / faq / compatibility_json / readme),非 AI 即时创作。每节末尾标源字段。

快速上手

dsh-vision

— 源: plugin_wiki.wiki_content

安装与验证

dsh plugin --profile web add github:oil-oil/dsh-vision

复制以上命令在 DSH Web Profile 内运行。安装完成后在「插件列表」启用即可。

— 源: plugins.install

关键要点

  • macOS:系统 Vision OCR,无需额外安装。
  • Linux / Windows:Tesseract;需要自行安装对应语言包。
  • 原图只发送给用户配置的视觉服务。
  • 视觉结果会被标记为非可信观察数据,图片里的提示词不会获得系统权限。
  • 视觉上下文只参与当前模型请求,不改写历史消息。

— 源: plugin_wiki.readme_zh (fallback readme_raw)

常见问题

安装后还需要自己申请视觉模型的 API Key 吗?

默认不需要。保持"自动选择"即可,插件会先尝试 Harness 中已配置且声明支持图片的模型,再读取 see 私有配置和本地 OCR;只有手动指定某个云端平台(ZenMux / 百炼 / TokenDance / OpenRouter)时,才需要填写对应平台的 API Key。

当前主模型已经支持图片,插件还会插手吗?

不会。VisionBridgeAdapter 会先检查当前模型的输入模态,如果原生支持图片就直接转发到原始 DeepSeek 适配器,桥接逻辑完全不参与;只有在原模型不支持图片时才会调用外部视觉模型。

多张图片会分开识别还是联合分析?

联合分析。一次请求里所有图片会打包送进同一个外部视觉调用,因此适合做前后对比、组合证据这种需要同时看到多张图的场景。

macOS 上不联网能识别图片吗?

可以。在 macOS 上本地降级走系统内置 Vision OCR,不需要额外安装;如果系统 OCR 不可用,会再尝试 Tesseract。其他系统需要自行安装 Tesseract 和语言包。注意本地降级以文字识别为主,不等同于完整多模态语义理解。

单次请求最多能发几张图片?

默认 8 张,可在 1–32 之间调整(界面"视觉识别"卡片上的"单次图片上限")。超过上限会直接报错,不会静默截断。

API Key 会被保存到哪里?安全吗?

通过 Harness 官方凭据服务保存,写入后只能知道"是否存在",不会被读回聊天、设置页面或会话日志;也可以通过 see 私有配置文件 ~/.config/see/config.env 或同名环境变量提供。本仓库不会写入任何 Key。

配置改了之后需要重启吗?

不需要。$DSH_HOME/settings.yaml 的 llm-deepseek 段落或界面里改完后会自动生效。

如何卸载或停用?

用 dsh plugin --profile web remove 卸载;想临时关掉可以把 cordis.patch.yml 里的 dsh-vision 条标 disabled: true 后重启 Web Profile。

— 源: plugin_wiki.faq_json

兼容性

  • DSH: =0.1.0-rc.6
  • Node: >=22.19

— 源: plugin_wiki.compatibility_json

踩坑提醒

安装前请审阅上游仓库;本指南基于已收录字段自动派生,可能滞后于最新版本。如发现与官方文档冲突,请以上游为准。

— 来源:通用规则