risk-rule-design 使用指南
面向 DSH 的金融风控规则挖掘插件:自动完成数据质检、单规则挖掘、并行 OR 规则组合最优搜索并输出自包含 HTML 报告。
本文为派生内容(基于 wiki / faq / compatibility_json 自动组装),非 AI 即时创作。
本文由本站基于该插件已收录的字段自动派生(wiki / faq / compatibility_json / readme),非 AI 即时创作。每节末尾标源字段。
快速上手
risk-rule-design
— 源: plugin_wiki.wiki_content
安装与验证
dsh plugin --profile web add dsh-plugin-risk-rule-design
复制以上命令在 DSH Web Profile 内运行。安装完成后在「插件列表」启用即可。
— 源: plugins.install
关键要点
-
- 最优组合总览卡片(精准率、召回率、F1、命中率、Lift、拒绝样本数);
-
- 最优组合内所有规则 + 累积命中率 / Lift / 召回率 / 边际增益明细;
-
- 全部组合评估表(按 F1 降序):排名、组合规则、精准率、召回率、F1、命中率、Lift,
-
- 命中率 × Lift 点位图:全部组合散点,最优高亮(可见累加规则后沿「命中率↑、Lift↓」移动);
-
- 精准率-召回率曲线:全部组合曲线,标注 F1 最高点(即最优组合对应的点),而非拐点;
— 源: plugin_wiki.readme_zh (fallback readme_raw)
常见问题
目标变量 y 需要什么格式?
必须是二分类标签。支持 0/1、true/false、good/bad、正常/违约、违约/未逾期、是/否、yes/no 等取值,引擎会自动映射为 bad=1/good=0。单一取值(如全部为 0 或全部为 1)会直接报错。
数据集必须是什么格式?
仅支持 CSV(带表头行)。引擎自带 CSV 解析器,支持引号、转义引号、引号内逗号/换行、CRLF、BOM 等情况;不支持 xlsx/excel,需要先转成 CSV。
数据量很大时会不会跑得很慢?
组合搜索阶段若行数超过 50000 会自动按等步长抽样加速,但最终全部指标(F1、召回率、命中率、Lift 等)会在全体数据上精确重算,并在报告中注明是否抽样。数据量 > 20 万时跳过重复行检查。
输出的 HTML 报告需要联网吗?
不需要。报告是自包含 HTML,CSS 和图表都内联在文件里(含 SVG 散点图与 PR 曲线),用任何浏览器直接打开即可,无需外网资源。
五种评估目标(objective)有什么区别?
f1(默认)= 精准率与召回率最平衡(F1 最大);top_lift = 组合 Lift 前 5% 内命中率最小者;composite = lift×(1−命中率) 最大;max_lift = 命中率预算内最大化 lift;min_hit = lift 达标下最小化命中率。f1/top_lift 不受 minBadCoverage 约束。
如何卸载?
运行 dsh plugin --profile web remove dsh-plugin-risk-rule-design,然后重启 dsh web 即可。
没有 ID/流水号类字段时会被误删吗?
引擎按列名正则(如 _id、serialno、编号、手机号 等)+ 卡片基数(≈ 样本数视为近似唯一)+ 常量检测 三条规则自动剔除 ID/serialno 列。误判概率较低,如确需保留可用 rrd_profiling 的 exclude 参数追加剔除,或用 features 显式指定。
— 源: plugin_wiki.faq_json
兼容性
- DSH: 未声明
- Node: >=18
— 源: plugin_wiki.compatibility_json
踩坑提醒
安装前请审阅上游仓库;本指南基于已收录字段自动派生,可能滞后于最新版本。如发现与官方文档冲突,请以上游为准。
— 来源:通用规则