ontology-golden-case-testing · git:20260831.f33ce1b · 2026-08-31 · sha256 0a10089aa3beeede
ontology-golden-case-testing git:20260831.f33ce1bA
Immutable. This exact content is served forever at /api/v1/blob/0a10089aa3beeede.
--- name: ontology-golden-case-testing description: | 用于需要验收本体能否回答真实业务问题、本体规则或版本变化后要做回归,用户出现“帮我设计本体测试用例”“怎么做黄金问题集”或 golden cases, ontology regression, test matrix 等信号时调用。不适用于只有形式化语法错误,需要先走模型质量门。 metadata: tags: "testing, golden-cases, test-matrix, regression, validation, enterprise-ai, ontology-driven" related-skills: "ontology-model-multilayer-quality-gate:depends-on, data-to-ontology-mapping-and-instantiation:depends-on, ontology-ai-scenario-fit-and-spike:composes-with" --- # 本体“黄金用例—测试矩阵—结果回溯”验收 ## 方法骨架 - 用业务专家定义的黄金用例建立本体验收基准,再让AI扩展边界和异常测试。 - 每个用例包含真实问题、输入事实、期望规则路径、期望答案或Action和判定标准。 - 测试矩阵覆盖正常、边界、缺失、冲突、越权、等价变异和压力场景。 - 失败结果要回溯到输入事实、模型规则、查询、Action或用例本身。 - 修复后执行全量回归,防止局部调整破坏既有业务逻辑。 - 测试集作为版本化资产,随业务规则和本体版本持续演进。 ## 触发场景 ### 用户会在什么情境下需要这个 Skill 1. 需要验收本体能否回答真实业务问题 2. 本体规则或版本变化后要做回归 3. 准备设计边界、异常和越权测试 ### 语言信号 - “帮我设计本体测试用例” - “怎么做黄金问题集” - “这次本体变更会不会影响原结论” - 英文信号:golden cases, ontology regression, test matrix ### 与相邻 Skill 的区分 - 与 `ontology-model-multilayer-quality-gate`:质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。 - 与 `ontology-ai-scenario-fit-and-spike`:穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。 ## 执行步骤 Skill 激活后按以下顺序执行: 1. **确定验收范围** - 动作:列出核心意图、关键决策点、Action和不可接受错误。 - 完成标准:每项与业务目标和风险等级对应。 2. **制作黄金用例** - 动作:为正常、边界、异常、缺失、冲突和越权场景定义输入、期望路径、期望结果。 - 完成标准:用例经业务专家确认并有稳定样本。 3. **扩展测试矩阵** - 动作:基于黄金用例生成等价变异、组合、压力和回归用例。 - 完成标准:矩阵覆盖对象、规则、权限、查询和行动维度。 4. **执行并回溯** - 动作:记录实际输出、模型与映射版本、实例来源、规则路径和差异,把失败归因到数据需求、知识来源、语义、概念模型、逻辑模型、映射、查询、Action或用例。 - 完成标准:每个失败项有唯一责任和修复建议。 5. **修复与回归** - 动作:修复后重跑失败项和全部核心黄金用例,更新版本记录。 - 完成标准:阻断用例100%通过,一般用例达到约定阈值且无新增回归。 ### 固定输出 最终结果至少包含:验收范围、业务专家确认的黄金用例、正常/边界/异常/缺失/冲突/权限矩阵、输入实例、预期路径与结果、实际结果、模型与映射版本、失败归因、回归报告和发布建议。 ## 使用边界 ### 不要在以下情况使用 - 只有形式化语法错误,需要先走模型质量门 - 没有稳定业务预期或专家无法确认答案 - 用少量样本直接宣称全量生产效果 ### 常见失败模式 - **把语法通过当成业务语义正确**:形式合法性与业务正确性处于不同验证层,语法工具无法判断领域含义、规则完整性及行动后果。 - **用错误本体生成训练数据并放大偏差**:同一语义缺陷被重复采样,训练优化把局部错误提升为模型的稳定决策倾向。 - **行动前无校验且失败后无反馈策略**:计划层假设与真实系统状态没有校验,执行结果也未反馈给决策层重新规划。 ### 使用折扣与复核要求 - 黄金用例容易固化已知经验,应持续补充线上新异常和反事实边界。 - 大模型生成形式结构无法直接证明业务语义正确,生产使用需保留专家确认、工具校验、真实用例和审计记录。 ## 相关 Skills - `depends-on` → `ontology-model-multilayer-quality-gate`;质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。 - `depends-on` → `data-to-ontology-mapping-and-instantiation`;真实实例和映射版本属于用例输入。 - `composes-with` → `ontology-ai-scenario-fit-and-spike`;穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。 ## 审计信息 - **历史验证**:v0.1.0 路由测试 6/6;v0.3.0 增加实例、映射和全链路归因后需重新执行跨平台行为抽样 - **首次公开版本**:2026-08-21 - **来源说明**:方法框架受《本体驱动的 AI 数据管理》启发;仓库不包含原书正文。