ontology-golden-case-testing · git:20260906.e53cd23 · 2026-09-06 · sha256 1ae5d9d438fda56d
ontology-golden-case-testing git:20260906.e53cd23A
Immutable. This exact content is served forever at /api/v1/blob/1ae5d9d438fda56d.
--- name: ontology-golden-case-testing description: | 用于需要验收本体能否回答真实业务问题、本体规则或版本变化后要做回归,用户出现“帮我设计本体测试用例”“怎么做黄金问题集”或 golden cases, ontology regression, test matrix 等信号时调用。不适用于只有形式化语法错误,需要先走模型质量门。 metadata: tags: "testing, golden-cases, test-matrix, regression, validation, enterprise-ai, ontology-driven" related-skills: "ontology-model-multilayer-quality-gate:depends-on, data-to-ontology-mapping-and-instantiation:depends-on, ontology-ai-scenario-fit-and-spike:composes-with" --- # 本体“黄金用例—测试矩阵—结果回溯”验收 ## 方法骨架 - 用业务专家定义的黄金用例建立本体验收基准,再让AI扩展边界和异常测试。 - 每个用例包含真实问题、输入事实、期望规则路径、期望答案或Action和判定标准。 - 测试矩阵覆盖正常、边界、缺失、冲突、越权、等价变异和压力场景。 - 失败结果要回溯到输入事实、模型规则、查询、Action或用例本身。 - 修复后执行全量回归,防止局部调整破坏既有业务逻辑。 - 测试集作为版本化资产,随业务规则和本体版本持续演进。 ## 触发场景 ### 用户会在什么情境下需要这个 Skill 1. 需要验收本体能否回答真实业务问题 2. 本体规则或版本变化后要做回归 3. 准备设计边界、异常和越权测试 ### 语言信号 - “帮我设计本体测试用例” - “怎么做黄金问题集” - “这次本体变更会不会影响原结论” - 英文信号:golden cases, ontology regression, test matrix ### 与相邻 Skill 的区分 - 与 `ontology-model-multilayer-quality-gate`:质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。 - 与 `ontology-ai-scenario-fit-and-spike`:穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。 ## 执行步骤 按当前任务选择必要步骤;已有可靠成果直接复用: 1. **确定验收范围** - 动作:列出核心意图、关键决策点、Action和不可接受错误。 - 完成标准:每项与业务目标和风险等级对应。 2. **制作黄金用例** - 动作:为正常、边界、异常、缺失、冲突和越权场景定义输入、期望路径、期望结果。 - 完成标准:候选用例有明确的预期依据与样本状态;正式黄金基线需专家确认和稳定样本。 3. **扩展测试矩阵** - 动作:基于黄金用例生成等价变异、组合、压力和回归用例。 - 完成标准:矩阵覆盖对象、规则、权限、查询和行动维度。 4. **执行并回溯** - 动作:记录实际输出、模型与映射版本、实例来源、规则路径和差异,把失败归因到数据需求、知识来源、语义、概念模型、逻辑模型、映射、查询、Action或用例。 - 完成标准:每个失败项有唯一责任和修复建议。 5. **修复与回归** - 动作:修复后重跑失败项及受影响的核心黄金用例;跨模块语义或公共规则变更时运行完整核心回归;更新版本记录。 - 完成标准:阻断用例100%通过,一般用例达到约定阈值且无新增回归。 ## 固定输出 - 验收范围与版本锁定表:场景、任务、本体、数据映射、规则、查询和 Action 版本 - 黄金用例登记表:用例编号、业务问题、输入实例、前置条件、预期证据、推理路径、结果、专家确认人和优先级 - 正常、边界、异常、缺失、冲突和权限用例矩阵 - 测试执行结果表:预期与实际结果、通过状态、证据、运行时间和执行环境 - 失败归因与修复清单:数据、语义、逻辑、映射、权限、Action 或用例问题及责任人 - 回归测试报告:重跑范围、新增缺陷、阻断通过率、一般用例通过率和剩余风险 - 业务验收结论与发布建议 ## 使用边界 ### 不要在以下情况使用 - 只有形式化语法错误,需要先走模型质量门 - 将缺少稳定业务预期或专家确认的用例直接声明为正式黄金基线;可先设计候选用例并标记待确认预期 - 用少量样本直接宣称全量生产效果 ### 常见失败模式 - **把语法通过当成业务语义正确**:形式合法性与业务正确性处于不同验证层,语法工具无法判断领域含义、规则完整性及行动后果。 - **用错误本体生成训练数据并放大偏差**:同一语义缺陷被重复采样,训练优化把局部错误提升为模型的稳定决策倾向。 - **行动前无校验且失败后无反馈策略**:计划层假设与真实系统状态没有校验,执行结果也未反馈给决策层重新规划。 ### 使用折扣与复核要求 - 黄金用例容易固化已知经验,应持续补充线上新异常和反事实边界。 - 大模型生成形式结构无法直接证明业务语义正确,生产使用需保留专家确认、工具校验、真实用例和审计记录。 ## 相关 Skills - `depends-on` → `ontology-model-multilayer-quality-gate`;质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。 - `depends-on` → `data-to-ontology-mapping-and-instantiation`;真实实例和映射版本属于用例输入。 - `composes-with` → `ontology-ai-scenario-fit-and-spike`;穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。 ## 审计信息 - **历史验证**:v0.1.0 路由测试 6/6;v0.4.0 已通过输出契约结构校验,跨平台行为继续按版本抽样 - **首次公开版本**:2026-08-21 - **来源说明**:方法框架受《本体驱动的 AI 数据管理》启发;仓库不包含原书正文。