基于 DeepSeek-OCR 的光学压缩记忆插件,把记忆渲染成图像存储,按年龄降分辨率并自动恢复高清检索。
ⓘ 此插件是大仓库 DDDFXYqiming/Agent_Extensions 的子包,星数与活跃度统计的是整个仓库。
- 语言
- JavaScript
- License
- MIT
- 分支
- main
安装
$ dsh plugin --profile web add github:DDDFXYqiming/Agent_Extensions#path:dsh-plugins/dsh-ocr1-memory在终端中运行以上命令,通过 dsh CLI 安装此插件。可在右上角切换 Profile。 第一次用 dsh?看这篇新手教程
对话式安装
帮我安装 DeepSeek Harness 插件 DDDFXYqiming/Agent_Extensions/dsh-plugins/dsh-ocr1-memory:先查看仓库 https://github.com/DDDFXYqiming/Agent_Extensions.git 确认安全性,然后执行安装命令并验证插件加载成功。
把这段指令粘贴给 DSH Web GUI 里的助手,由它代你完成安装与验证。
一句话定位
把 DSH Agent 的记忆存成"图像"而非纯文本:每条记忆渲染为带编号的 PNG,旧记忆按年龄自动降分辨率,检索命中时用 DeepSeek-OCR 读回原文片段。
核心能力
- 文本入库自动分段并渲染成图像(SoM 编号),存到本地记忆库
- 按年龄自动降分辨率:vivid(1280px, 24h 内) → normal(1024px, 7 天内) → fuzzy(640px, 更久)
- 检索命中低清记忆时自动触发 active recall 临时恢复高清
- 用 OCR 读回图像作为召回证据,返回原始原文片段而非生成式摘要
- 存储 1280 维视觉向量(DeepSeek-OCR embeddings),用余弦相似度作为检索主信号
- 提供 9 个 Agent 可直接调用的工具:状态/存储/更新/检索/列表/压缩比指标/基线校准/删除/渲染与 embedding 自测
技术实现
- 语言: JavaScript(Node ESM,零运行时依赖)
- 关键依赖: @deepseek-ai/dsh-tools(注册 Agent 工具)、@deepseek-ai/schemastery(配置 schema)、Python + Pillow(图像渲染);可选 DeepSeek-OCR 后端(vLLM 或 llama.cpp GGUF)做读回与 embedding
- 架构模式: 通过
inject=['tools']把 9 个 ocr1_mem_* 工具挂到宿主 tools 服务;配置经 cordis.patch.yml 注入;apply(ctx, config)启动时按配置构建渲染器 + OCR 客户端 + embedding 客户端,并可按需自动拉起 llama-server - 入口文件: lib/index.js(apply 入口注册所有工具),lib/core.js(记忆引擎、检索算法、渲染管线),lib/ocr-server.js(llama-server 生命周期)
适用场景
适合需要给 DSH Agent 配备"持久 + 长期 + 可视觉化"记忆的场景,例如让 Agent 记住文档要点、项目知识、用户偏好,并在多轮对话中按需召回原文片段。如果只是需要轻量文本记忆,官方 dsh-memory 更省事;如果希望记忆按时间自然"褪色"且能 OCR 读回图像证据,这个插件提供了官方记忆不具备的能力。
前置依赖与兼容性
| 依赖 | 最低版本 | 说明 |
|---|---|---|
| Node.js | >=22.19.0 | engines.node 声明 |
| @deepseek-ai/cordis | >=4.0.0-rc <5 | peerDependencies |
| @deepseek-ai/dsh-tools | >=0.0.1-rc <2 | peerDependencies |
| @deepseek-ai/schemastery | >=3.18.0 <4 | peerDependencies |
| Python + Pillow | 任意可用版本 | scripts/render_memory.py 依赖,本地需要 Pillow |
| 平台 | 跨平台 | OCR 自动拉起脚本默认走 Windows 路径,可改 serverPath/modelDir 覆盖 |
| 原生模块 | 无 | 纯 Node + Python 子进程,不引入 node-gyp 依赖 |
安装方式
dsh plugin --profile web add github:DDDFXYqiming/Agent_Extensions#path:dsh-plugins/dsh-ocr1-memory
配置项
| 配置 | 类型 | 说明 | 默认值 |
|---|---|---|---|
| storeDir | string | 记忆库根目录,存图像与 memories.json | <home>/.dsh/ocr1-memory |
| ocrBaseUrl | string | DeepSeek-OCR 的 OpenAI 兼容端点(如 vLLM http://127.0.0.1:8000/v1),留空则跳过 OCR 读回 | 空 |
| ocrApiKey | string | OCR 端点的 API key,本地服务一般留空 | 空 |
| ocrModel | string | OCR 模型名 | deepseek-ai/DeepSeek-OCR |
| pythonPath | string | 渲染脚本使用的 Python 解释器 | python |
| renderScript | string | 渲染脚本绝对路径 | <插件目录>/scripts/render_memory.py |
| requireOcr | boolean | true 时 OCR 不可用直接报错而不是降级 | false |
| useMockRenderer | boolean | true 时跳过 Python,用纯文本占位(仅自测) | false |
| autoStartOcrServer | boolean | true 时插件加载后自动确保 llama-server 在线 | false |
| ocrServerPath | string | llama-server 可执行文件路径 | Windows 默认或 OCR_SERVER_PATH 环境变量 |
| ocrModelDir | string | DeepSeek-OCR GGUF 所在目录 | Windows 默认或 OCR_MODEL_DIR 环境变量 |
| ocrServerPort | number | OCR 服务端口 | 18080 |
| ocrEmbeddingBaseUrl | string | 视觉 embedding 端点,留空回退到 ocrBaseUrl(combined 模式) | 空 |
| ocrEmbeddingApiKey | string | embedding 端点 API key | 空 |
| ocrEmbeddingModel | string | embedding 模型名,留空用 ocrModel | 空 |
| ocrEmbeddingTimeoutMs | number | embedding 请求超时 | 120000 |
| ocrEmbeddingAutoStart | boolean | 独立 embedding 服务时是否自动拉起 | false |
| ocrEmbeddingPort | number | 独立 embedding 服务端口(combined 模式不用) | 18084 |
| ocrEmbeddingUbatchSize | number | llama-server 的 -ub 参数,必须 ≥ 单图视觉 token 数 | 2048 |
| ocrEmbeddingOnDemand | boolean | combined 模式下不启用(仅独立服务时生效) | true |
| ocrEmbeddingIdleTimeoutMs | number | embedding 服务空闲多少毫秒后自动关闭 | 300000 |
| sharedStore | boolean | true 时每次操作前重读 memories.json,支持多 Agent 共享 | false |
| embeddingRetrieval | boolean | true 时用 1280 维视觉 embedding 相似度作为检索主信号 | true |
| ocrMaxEntriesPerRetrieve | number | 文本检索不足时最多对多少条记忆做 OCR 读回,防止大库卡死 | 5 |
| ocrRepeatPenalty | number | OCR 读回的重复惩罚系数 | 1.2 |
| ocrNoRepeatNgramSize | number | OCR 读回的 n-gram 重复抑制窗口 | 30 |
| ocrTextOnlyPromptTokens | number | OCR 文本基线(用于估算视觉 token 数) | 5 |
常见问题
Q: 这个插件和官方 dsh-memory 有什么不同?
A: dsh-memory 把记忆存成纯文本;dsh-ocr1-memory 则把每条记忆渲染成带 SoM 编号的图像,按时间降到 640px 的 fuzzy 层,命中低清记忆时自动 active recall 恢复高清。它用 OCR 读回替代纯文本检索,返回原文片段而非生成式摘要,规避大模型幻觉。
Q: 不接 DeepSeek-OCR 服务能直接用吗?
A: 可以装上就能用 ocr1_mem_status / ocr1_mem_store / ocr1_mem_list 等基础功能。但 ocr1_mem_retrieve 的图像读回和视觉 embedding 需要一个 OpenAI 兼容的 OCR 端点(vLLM 起 deepseek-ai/DeepSeek-OCR,或 llama.cpp 起 GGUF 版),否则检索只能走纯文本打分。
Q: 渲染需要什么本地环境?
A: 需要 Python 3 加 Pillow 库。插件通过 scripts/render_memory.py 调 Python 把记忆分段渲染成 PNG(带 SoM 编号框),脚本内置 CJK 字体候选路径(微软雅黑/苹方/文泉驿),覆盖 Windows、macOS、Linux。
Q: 记忆存放在哪里?怎么删除单条记忆?
A: 默认放在 <home>/.dsh/ocr1-memory/,可在配置 storeDir 改成自定义目录。用 ocr1_mem_forget 工具按 id 删除单条;卸载插件不会自动清理该目录,需要手动删除。
Q: 为什么旧记忆会变模糊?这和 bug 有关吗?
A: 不是 bug,是设计行为:每条记忆按 createdAt 落在 vivid(24h 内 1280px) / normal(7 天内 1024px) / fuzzy(更久 640px) 三层。检索命中低清层时会自动 active recall 临时恢复高清,并在窗口内豁免再衰减,模拟"人记忆被想起后变清晰"的特性。
Q: 多个 Agent 能共享同一份记忆库吗?
A: 可以,把 sharedStore 设为 true 即可。该模式在每次操作前重读 memories.json,并使用唯一临时文件 + rename 串行化写入,避免并发覆盖;测试报告中 M1–M6 包含多 Agent 共享场景。
Q: 视觉 token 数是怎么测出来的?
A: 插件通过 embedding 端点的 marker-only 请求(只传 media 不传文本)测出 visualTokensDirect,并以文本基线做近似估算。这是 llama.cpp 公开接口的测量值,并非 DeepEncoder 内部张量输出;README 明确指出这是论文思想的工程近似。
Q: 装了插件后 DSH Agent 能直接调用这些工具吗?
A: 可以。插件通过 inject=['tools'] 向宿主注册 9 个 ocr1_mem_* 工具,Agent 在对话里直接调用即可,无需额外启用开关;工具输出 schema 严格,headless profile 下也不会报 invalid output。
上手难度
进阶 — 需要本地装 Python+Pillow,并且要让 OCR 端点(vLLM 或 llama.cpp GGUF)真正在线才能用上检索和视觉 embedding;纯配置项多达 27 个,对只想"装上就用"的用户门槛偏高。
已知问题与限制
- OCR 后端是工程近似而非论文复刻:README 第 138-170 行明确说明,DeepEncoder 内部张量输出和 Locate-and-Transcribe 的"模型输出 SoM 编号"在当前 llama.cpp 公开接口下无法实现,需要 LoRA 微调才能进一步对齐
- 默认路径绑定 Windows:lib/ocr-server.js:8 与 lib/index.js:80-93 默认 llama-server 路径写死
D:\AI_Projects\models\llama.cpp\llama-server.exe,macOS/Linux 用户必须通过ocrServerPath/OCR_SERVER_PATH环境变量覆盖 - ocrEmbeddingUbatchSize 必须 ≥ 单图视觉 token 数:默认 2048 已经能覆盖,但缩到默认 512 会被 llama-server 拒大图(README 第 128-131 行)
- embedding 服务空闲后会自动关闭:默认 5 分钟空闲后 stop(lib/index.js:153-160),多 Agent 高频并发场景可能反复拉起
- 检索文本打分是字符级 token 重叠:中文按单字切,英文按空格切,标点和 emoji 会被剥掉;超长查询不会自动改写
- Locate-and-Transcribe 用文本打分 + OCR 证据而非模型输出编号:返回 verbatim 片段避免生成幻觉,但与 OCR-Memory 论文原版 Locate 路径不同(README 第 145-147 行)
- 多模态 embedding 依赖 llama.cpp 扩展:在 AMD 无 NVIDIA/vLLM 的环境下无法切换到官方 DeepEncoder 输出(README 第 166 行)
- Python 渲染 30 秒超时:lib/core.js:267 对单条渲染设了 30s 上限,超长文本会被 hard wrap 分段避免单图超时
简体中文 | English
Agent_Extensions
📦 DSH 插件已拆分为独立仓库
本仓库
dsh-plugins/下的 DSH 插件已迁移为独立 GitHub 仓库,推荐直接安装独立仓库:
插件 独立仓库 dsh-vision-skill https://github.com/DDDFXYqiming/dsh-vision-skill dsh-layered-memory https://github.com/DDDFXYqiming/dsh-layered-memory dsh-annotation-patched https://github.com/DDDFXYqiming/dsh-annotation-patched dsh-side-panel-patched https://github.com/DDDFXYqiming/dsh-side-panel-patched dsh-ocr1-memory https://github.com/DDDFXYqiming/dsh-ocr1-memory 安装示例:
dsh plugin --profile web add github:DDDFXYqiming/dsh-ocr1-memory本仓库不再维护 dsh 插件,仅保留历史快照与说明;后续更新请以独立仓库为准。
DeepSeek Harness(DSH)插件与 AI Agent 技能集合 —— 面向 DeepSeek Harness 的原生插件(走官方扩展接缝,零框架补丁)+ 跨框架通用 Skill + Hermes 插件,开箱即用。
本仓库收集、翻译并自包含封装 AI Agent 相关的技能资源,并面向 DeepSeek Harness(DSH) 提供标准插件形式的扩展。所有内容均为自包含(技能/插件内自带脚本、模板与文档,不依赖仓库外文件),克隆即可用。
✨ 内容总览
1️⃣ DSH 原生插件(dsh-plugins)—— 零框架补丁
面向 DeepSeek Harness 官方扩展接缝(ctx.skills / ctx.tools / ctx.credentials / ctx.slots / ctx.layout),可随 DSH 版本升级:
| 插件 | 能力 | 依赖 |
|---|---|---|
dsh-vision-skill v0.4.4 | 识图插件:8 个工具(含渐进式暴露激活工具)+ Credential 化 + 路径围栏 | Node.js + DSH(dsh-tools / dsh-credentials)、Python 3 + Pillow、视觉模型 API Key |
dsh-layered-memory v0.4 | 跨会话长期记忆:命名空间隔离 + L1 索引注入(存在性编码、KV 缓存友好)+ L2 环境事实 + L3 任务经验 + 自动蒸馏候选 + 溯源/归档/回滚 + 自动维护 | Node.js + DSH(dsh-tools) |
dsh-annotation-patched | 选中批注/引用插件(fork 增强):选中助手回复文字 → 批注(可空)或一键「引用」→ 回车随消息发送,回复按 Annotation N 逐条对照;增强:Codex 式「引用」按钮(显式确认制)+ 幽灵引用修复 | Node.js + DSH(纯浏览器端 bundle,零 Node 逻辑) |
dsh-side-panel-patched | 右侧工作区面板(fork 增强):文件树/多文件 tab/预览/编辑(CodeMirror)+ Git 审查 + 终端;增强:绕开官方 520px 宽度上限、头部像素级对齐、Codex 风格梭形拖拽把手、文件 tab 栈 + 会话跟踪、Windows 终端防崩溃 | Node.js + DSH(文件/Git/终端 API + 浏览器 bundle) |
dsh-ocr1-memory v0.1.0 | 光学压缩记忆:文本渲染为 SoM 图像存储 + 年龄衰减 + active recall + OCR 驱动召回 | Node.js + DSH(dsh-tools / cordis / schemastery)、Python 3 + Pillow、可选 DeepSeek-OCR 后端 |
2️⃣ 通用技能(General_skills)—— 跨框架可用
任何智能体框架(Claude Code / Codex / opencode / DSH / Hermes 等)均可把目录作为 Skill 挂载:
| 技能 | 能力 | 依赖 |
|---|---|---|
vision-skill | 识图:本地图片 → 视觉模型描述(Qwen 动态分辨率方法,OpenAI 兼容接口) | Python 3 + 视觉模型 API Key |
video-notes-generator | 视频 URL → 结构化 Markdown 笔记(时间戳 / 抽取帧 / 多模态图像观察 / AI 总结),支持 Bilibili / YouTube / 抖音 / 快手 / 本地文件 | Python 3 + 依赖(见 scripts/install_deps.sh) |
ppt-master | 源文档(PDF / DOCX / URL / Markdown)→ 多角色协作生成 SVG 页面 → 导出 PPTX | Python 3(标准库为主,可选依赖见 requirements.txt) |
markitdown-skill | 微软 MarkItDown:PDF / DOCX / PPTX / XLSX / HTML / EPUB 等 → 统一 Markdown | Python 3 + pip install -r requirements.txt |
generic-agent-code-run | GenericAgent 风格 code_run:Windows 桌面应用 / 真实浏览器自动化(Win32 / UIA / OCR / 截图 / CDP)+ 观察-行动-验证循环 | Python 3 + 对应库 |
所有技能均内置
SKILL.md(agent 运行时加载的指令),部分附scripts/、templates/、references/。
3️⃣ Hermes 插件(hermes_plugins)
| 插件 | 能力 | 依赖 |
|---|---|---|
language-router v5.0 | 自适应语言路由:Planner-first → Worker → 可选 Verifier → Digest 流程(NousResearch / Diana 出品),hooks 挂载 pre_llm_call / pre_api_request / post_api_request | Hermes 框架 |
📁 目录结构
Agent_Extensions/
├── dsh-plugins/ # DeepSeek Harness(DSH)原生插件
│ ├── dsh-vision-skill/ # 识图插件 v0.4.4(8 工具 + 渐进式暴露 + Credential 化)
│ ├── dsh-layered-memory/ # 分层长期记忆(v0.4:命名空间/自动蒸馏/自动维护)
│ ├── dsh-annotation-patched/ # 选中批注/引用插件(fork 增强,Codex 式选中即引用)
│ ├── dsh-side-panel-patched/ # 右侧工作区面板(fork 增强,多文件 tab + 会话跟踪)
│ └── dsh-ocr1-memory/ # 光学压缩记忆(SoM 图像 + active recall)
├── General_skills/ # 通用智能体技能(跨框架,挂载即用)
│ ├── vision-skill/ # 识图
│ ├── video-notes-generator/ # 视频转结构化笔记
│ ├── ppt-master/ # 文档 → SVG → PPTX
│ ├── markitdown-skill/ # 任意文档 → Markdown
│ └── generic-agent-code-run/ # Windows 桌面/浏览器自动化
├── hermes_plugins/ # Hermes 框架插件
│ └── language-router/ # 语言路由(planner-first)
└── README.md
🚀 快速开始
方式一:安装 DSH 插件(以 dsh-vision-skill 为例)
DSH 插件已拆分为独立仓库,推荐直接安装独立仓库:
# 1. 从独立仓库安装(自带 cordis.patch.yml,自动贡献 id: vision-skill)
dsh plugin --profile web add github:DDDFXYqiming/dsh-vision-skill
# 2. 配置 Credential($DSH_HOME/.credentials.yaml)
VISION_API_KEY: sk-xxxx
本仓库
dsh-plugins/下保留的是历史快照;各插件最新文档见对应独立仓库。
⚠️ bundle 安装后不要在 profile 的
cordis.patch.yml里再insert同名条目,否则会触发duplicate loader entry id启动崩溃;需要自定义配置时用裸条目按 id 覆盖(见插件 README)。
方式二:挂载通用技能(任何框架)
以 vision-skill 为例:
# 1. 复制技能目录到你的 agent 的 skills 目录
# (Claude Code: ~/.claude/skills/ ;Codex: ~/.codex/skills/ ;其他框架见其文档)
cp -r General_skills/vision-skill <你的 skills 目录>/
# 2. 配置视觉模型(OpenAI 兼容接口)
cd General_skills/vision-skill
cp templates/.env.example .env # 填入 VISION_API_URL / VISION_MODEL / VISION_API_KEY
# 3. 自检
python scripts/vision.py --check
其他技能用法详见各目录内 SKILL.md。
方式三:安装 Hermes 插件
将 hermes_plugins/language-router 目录放入 Hermes 插件目录即可(plugin.yaml 声明了全部 hooks 与版本信息)。
🧩 DSH 插件能力一览
dsh-vision-skill v0.4.4(8 工具 + 1 运行时 skill)
| 工具 | 能力 |
|---|---|
vision_analyze | 识图(5 模式 + mega 超高清 16M 像素预算) |
vision_ocr / vision_long_screenshot_ocr | 独立 OCR / 超长截图分块 OCR(带重叠切块 → 逐块识别 → 合并) |
vision_ground / vision_detect | 目标定位 / 元素枚举(像素坐标框 + 归一化坐标) |
vision_dominant_colors | 主色分析(本地像素算法,无需 API) |
vision_clipboard | 剪贴板图片兜底(应对"当前模型不支持图片"粘贴拦截) |
vision_activate | 渐进式暴露兜底:skill 加载后工具未自动出现时调用一次 |
工程化特性:渐进式工具暴露(全局只挂 1 个轻量激活工具,省上下文)、密钥 Credential 化(credential: VISION_API_KEY 引用,每操作解析)、路径围栏(realpath 校验防穿越)、超时与并发门控、严格 JSON Schema 结构化输出。
dsh-layered-memory v0.4(分层长期记忆)
| 组件 | 说明 |
|---|---|
memory:index 注入 | 通过 ctx.systemPrompt.context 每轮实时注入 L1 索引(存在性编码,读文件即生效,KV 缓存友好) |
memory(运行时 skill) | 触发语义:何时读 / 何时写 / 何时同步索引 |
memory_activate | 渐进式暴露兜底:skill 加载后工具未自动出现时调用一次 |
memory_list / memory_read | 列出 / 读取记忆(index / fact / sop,含溯源 meta) |
memory_write | 写入记忆(fact/sop,evidence 必填 = 行动验证公理) |
memory_index | 重建 L1 索引自动段(保留 [RULES] 手动段) |
memory_pending / memory_accept | 自动蒸馏候选区:查看 / 确认入正式记忆 |
memory_update / memory_archive / memory_rollback | 更新(supersede 保留历史)/ 归档 / 回滚 |
memory_expand | 通过 sessionQuery 展开 sourceSession/sourceSeqs 原始事件 |
memory_stats / memory_maintain | 统计 / 自动维护(去重、压缩索引、合并候选) |
核心特性:命名空间隔离(<memoryDir>/<namespace>/...,默认 workspace 目录 + git 分支)、自动蒸馏(turn/end 成功工具调用 → pending/,确认后才入正式记忆)、自动维护(maintainEveryTurns 默认 20)、渐进式工具暴露(progressive: false 可回退全局注册)。
核心公理:行动验证(No Execution, No Memory)、神圣不可删改(已验证事实可压缩迁移、严禁丢弃)、禁易变状态(时间戳/PID/临时路径不存)、最小充分指针(L1 只写存在性)。注入走 user-role 快照,不破坏 DSH 的 KV 缓存命中率(设计细节见插件 README)。
dsh-annotation-patched(选中批注/引用,fork 增强)
| 能力 | 说明 |
|---|---|
| 选中批注 | 选中助手回复文字 → 批注(可留空)→ 回车随消息发送;自己的气泡不显示批注块(零闪烁隐藏) |
| 逐条对照 | 模型按 Annotation 1: … 逐条回应,回复中为可悬停芯片(回看原文+批注) |
| Codex 式「引用」按钮(增强①) | 选中文字 → 工具栏「引用」按钮 → 回车即带(空批注纯引用),显式确认制,复制/阅读选中不会误触发 |
| 幽灵引用修复(增强②) | 拼稿即清待发送集(原版依赖装饰扫描轮询清理存在竞态残留) |
来源:omdsh-dev/dsh-annotation v1.3.13(MIT),全部改动带 PATCH(2026-08-14) 标记,详见目录内 README.md。
dsh-side-panel-patched(右侧工作区面板,fork 增强)
| 能力 | 说明 |
|---|---|
| 文件树 + 多文件 tab | 文件树点文件 → 独立 tab(同时打开多个文件,切换/单关/查重激活),树单例跟随激活 tab、滚动位置跨 tab 保持 |
| 会话跟踪 | 切换工作区 → 树重载当前工作区;文件 tab 按会话分组(各自保留、切换显示、互不串扰) |
| Git 审查 / 终端 | 工作区变更审查(stage/unstage);终端 Windows 友好降级(Unix PTY 限制不崩溃) |
| 布局增强 | 绕开官方 520px 宽度上限(420~60% 视口自由拖宽)、头部与官方 header 像素级对齐、Codex 风格梭形拖拽把手、放大按钮全宽切换 |
来源:ccq1/dsh-side-panel v0.2.0(BSD-3-Clause),全部改动带 PATCH(2026-08-14) 标记,详见目录内 README.md。
⚙️ 环境要求
| 使用场景 | 要求 |
|---|---|
| DSH 插件 | Node.js + DSH(@deepseek-ai/dsh-tools、@deepseek-ai/dsh-credentials) |
| dsh-vision-skill / vision-skill | 额外需要 Python 3 + Pillow,以及任意 OpenAI 兼容多模态模型 API Key(Qwen-VL / MiniMax-M3 / Gemini / GPT-4o,默认 MiniMax-M3) |
| 通用技能(vision / video / ppt / markitdown / automation) | Python 3.x + 各技能列出的 pip 依赖 |
| Hermes 插件 | Hermes 框架 |
❓ FAQ
Q:通用技能和 DSH 插件怎么选?
A:通用技能跨框架,任何 agent 都能挂载;DSH 插件是 DSH 原生扩展,走官方接缝(工具注册 / Credential / 上下文注入 / 布局插槽),能力更强但只适用于 DSH。两者能力互通——dsh-vision-skill 就是把 General_skills/vision-skill 包装成 DSH 原生插件。
Q:我的模型不支持图片,能识图吗?
A:能。直接贴图会被框架拒绝(MODEL_DOES_NOT_SUPPORT_IMAGES),改用两种方式:① 发图片的本地路径文本;② 截图后说"看图",vision_clipboard 自动保存到工作区再识别。这是纯文本模型的能力门禁,不是插件问题。
Q:视觉 API 用哪家?
A:任意 OpenAI 兼容的多模态模型接口,通过 VISION_API_URL / VISION_MODEL / VISION_API_KEY 注入,不写死任何厂商。
Q:子目录之间有关联吗? A:没有。每个子目录是独立的自包含单元,可单独使用、单独发布、单独删除。
🤝 贡献
- 每个子目录是独立的自包含单元,欢迎以 PR 提交新技能/插件,或提 Issue 反馈问题。
- 贡献要求:自包含(自带脚本/模板/文档)、许可证清晰(建议 MIT)、不写死密钥与本机绝对路径。
- 新增技能的入口文档统一为
SKILL.md,DSH 插件另附cordis.patch.yml与package.json。
📄 许可
本仓库全部内容以 MIT License 分发。社区来源内容保留原作者署名(见各子目录 SKILL.md / plugin.yaml 头部)。
收录徽章
[](https://deepseek-plugin.org/plugins/DDDFXYqiming/Agent_Extensions/dsh-plugins/dsh-ocr1-memory)把这段 markdown 粘贴到你的 GitHub README,链接回本插件详情页。徽章只声明已被本站收录,不代表安全认证。