ontology-golden-case-testing · git:20260906.e53cd23 · 2026-09-06 · sha256 1ae5d9d438fda56d

ontology-golden-case-testing git:20260906.e53cd23A

Immutable. This exact content is served forever at /api/v1/blob/1ae5d9d438fda56d.

---
name: ontology-golden-case-testing
description: |
  用于需要验收本体能否回答真实业务问题、本体规则或版本变化后要做回归,用户出现“帮我设计本体测试用例”“怎么做黄金问题集”或 golden cases, ontology regression, test matrix 等信号时调用。不适用于只有形式化语法错误,需要先走模型质量门。
metadata:
  tags: "testing, golden-cases, test-matrix, regression, validation, enterprise-ai, ontology-driven"
  related-skills: "ontology-model-multilayer-quality-gate:depends-on, data-to-ontology-mapping-and-instantiation:depends-on, ontology-ai-scenario-fit-and-spike:composes-with"
---

# 本体“黄金用例—测试矩阵—结果回溯”验收

## 方法骨架

- 用业务专家定义的黄金用例建立本体验收基准,再让AI扩展边界和异常测试。
- 每个用例包含真实问题、输入事实、期望规则路径、期望答案或Action和判定标准。
- 测试矩阵覆盖正常、边界、缺失、冲突、越权、等价变异和压力场景。
- 失败结果要回溯到输入事实、模型规则、查询、Action或用例本身。
- 修复后执行全量回归,防止局部调整破坏既有业务逻辑。
- 测试集作为版本化资产,随业务规则和本体版本持续演进。

## 触发场景

### 用户会在什么情境下需要这个 Skill

1. 需要验收本体能否回答真实业务问题
2. 本体规则或版本变化后要做回归
3. 准备设计边界、异常和越权测试

### 语言信号

- “帮我设计本体测试用例”
- “怎么做黄金问题集”
- “这次本体变更会不会影响原结论”
- 英文信号:golden cases, ontology regression, test matrix

### 与相邻 Skill 的区分

- 与 `ontology-model-multilayer-quality-gate`:质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。
- 与 `ontology-ai-scenario-fit-and-spike`:穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。

## 执行步骤

按当前任务选择必要步骤;已有可靠成果直接复用:

1. **确定验收范围**
   - 动作:列出核心意图、关键决策点、Action和不可接受错误。
   - 完成标准:每项与业务目标和风险等级对应。

2. **制作黄金用例**
   - 动作:为正常、边界、异常、缺失、冲突和越权场景定义输入、期望路径、期望结果。
   - 完成标准:候选用例有明确的预期依据与样本状态;正式黄金基线需专家确认和稳定样本。

3. **扩展测试矩阵**
   - 动作:基于黄金用例生成等价变异、组合、压力和回归用例。
   - 完成标准:矩阵覆盖对象、规则、权限、查询和行动维度。

4. **执行并回溯**
   - 动作:记录实际输出、模型与映射版本、实例来源、规则路径和差异,把失败归因到数据需求、知识来源、语义、概念模型、逻辑模型、映射、查询、Action或用例。
   - 完成标准:每个失败项有唯一责任和修复建议。

5. **修复与回归**
   - 动作:修复后重跑失败项及受影响的核心黄金用例;跨模块语义或公共规则变更时运行完整核心回归;更新版本记录。
   - 完成标准:阻断用例100%通过,一般用例达到约定阈值且无新增回归。

## 固定输出

- 验收范围与版本锁定表:场景、任务、本体、数据映射、规则、查询和 Action 版本
- 黄金用例登记表:用例编号、业务问题、输入实例、前置条件、预期证据、推理路径、结果、专家确认人和优先级
- 正常、边界、异常、缺失、冲突和权限用例矩阵
- 测试执行结果表:预期与实际结果、通过状态、证据、运行时间和执行环境
- 失败归因与修复清单:数据、语义、逻辑、映射、权限、Action 或用例问题及责任人
- 回归测试报告:重跑范围、新增缺陷、阻断通过率、一般用例通过率和剩余风险
- 业务验收结论与发布建议

## 使用边界

### 不要在以下情况使用

- 只有形式化语法错误,需要先走模型质量门
- 将缺少稳定业务预期或专家确认的用例直接声明为正式黄金基线;可先设计候选用例并标记待确认预期
- 用少量样本直接宣称全量生产效果

### 常见失败模式

- **把语法通过当成业务语义正确**:形式合法性与业务正确性处于不同验证层,语法工具无法判断领域含义、规则完整性及行动后果。
- **用错误本体生成训练数据并放大偏差**:同一语义缺陷被重复采样,训练优化把局部错误提升为模型的稳定决策倾向。
- **行动前无校验且失败后无反馈策略**:计划层假设与真实系统状态没有校验,执行结果也未反馈给决策层重新规划。

### 使用折扣与复核要求

- 黄金用例容易固化已知经验,应持续补充线上新异常和反事实边界。
- 大模型生成形式结构无法直接证明业务语义正确,生产使用需保留专家确认、工具校验、真实用例和审计记录。

## 相关 Skills

- `depends-on` → `ontology-model-multilayer-quality-gate`;质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。
- `depends-on` → `data-to-ontology-mapping-and-instantiation`;真实实例和映射版本属于用例输入。
- `composes-with` → `ontology-ai-scenario-fit-and-spike`;穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。

## 审计信息

- **历史验证**:v0.1.0 路由测试 6/6;v0.4.0 已通过输出契约结构校验,跨平台行为继续按版本抽样
- **首次公开版本**:2026-08-21
- **来源说明**:方法框架受《本体驱动的 AI 数据管理》启发;仓库不包含原书正文。