跳到主内容

dsh-media-skills 使用指南

为 DeepSeek Harness 提供图片识别、视觉检查与图片生成能力,并自动注册可配置的视觉模型。

本文为派生内容(基于 wiki / faq / compatibility_json 自动组装),非 AI 即时创作。

本文由本站基于该插件已收录的字段自动派生(wiki / faq / compatibility_json / readme),非 AI 即时创作。每节末尾标源字段。

快速上手

dsh-media-skills

— 源: plugin_wiki.wiki_content

安装与验证

dsh plugin --profile web add github:akqwpeter-prog/dsh-media-skills

复制以上命令在 DSH Web Profile 内运行。安装完成后在「插件列表」启用即可。

— 源: plugins.install

关键要点

  • 👁️ vision-review — analyze images and screenshots, catch UI visual bugs, detect watermarks, turn images into text.
  • 🎨 media-tools — generate illustrations, avatars, backgrounds and banners with a free, watermark-free model.
    • (optional third) Google Gemini — aistudio.google.com → Get API key; joins the vision failover chain automatically

— 源: plugin_wiki.readme_zh (fallback readme_raw)

常见问题

安装后需要配置什么?

读图至少要准备 GLM_API_KEY;使用图片生成还要配置 SENSENOVA_API_KEY 或 SILICONFLOW_API_KEY。其他视觉服务作为可选的故障转移路线。

纯文本模型可以直接贴图吗?

需要在 DeepSeek Harness 0.1.0-rc.7 或 rc.8 对应源码中应用仓库提供的宿主与客户端补丁。插件本身提供模型路线和两个技能,缺少这层宿主能力时,纯文本会话仍会拒绝图片。

图片会保存在哪里?

读图脚本不会把输入图片另存到仓库;纯文本会话的贴图会保留在 DSH 会话附件库。生成图片只会写入调用者指定的目标路径。

图片会离开本机吗?

会。读图请求会发送到当前配置的第三方视觉服务;生成请求同样发送到 SenseNova 或 SiliconFlow。敏感图片应先考虑服务商的数据条款和隐私要求。

支持哪些系统?

插件代码未限制操作系统,也没有原生模块,可在能运行 DSH、Python 3 和 Pillow 的环境使用。实际可用性还取决于 DSH 宿主机及相应服务是否可访问。

遇到 1210 或上下文超限怎么办?

GLM-4V-Flash 单次输出上限是 1024,输入与输出合计上限是 16384。插件已按该上限配置;长会话应开启新会话重试,必要时检查种子配置是否被改写。

读图服务异常时如何排查?

可运行 vision-review 脚本的 --doctor 选项查看 Python、Pillow、密钥和各个服务的连通性。也可在密钥文件加入其他视觉服务,或用 VISION_FALLBACKS 追加兼容服务。

如何卸载?

可运行 dsh plugin --profile web remove dsh-media-skills。插件不会主动删除已经写入 DSH 设置的模型条目,如不再使用该模型,还需手动删除对应配置并重启 DSH。

— 源: plugin_wiki.faq_json

兼容性

  • DSH: 0.1.0-rc.7~0.1.0-rc.8(贴图自动转述已验证)
  • Node: 未声明

— 源: plugin_wiki.compatibility_json

踩坑提醒

安装前请审阅上游仓库;本指南基于已收录字段自动派生,可能滞后于最新版本。如发现与官方文档冲突,请以上游为准。

— 来源:通用规则