git:20260829.7b0e120 to git:20260831.f33ce1b

5 added, 5 removed. Audit A to A.

---
name: ontology-golden-case-testing
description: |
用于需要验收本体能否回答真实业务问题、本体规则或版本变化后要做回归,用户出现“帮我设计本体测试用例”“怎么做黄金问题集”或 golden cases, ontology regression, test matrix 等信号时调用。不适用于只有形式化语法错误,需要先走模型质量门。
metadata:
tags: "testing, golden-cases, test-matrix, regression, validation, enterprise-ai, ontology-driven"
- related-skills: "ontology-model-multilayer-quality-gate:depends-on, ontology-ai-scenario-fit-and-spike:composes-with"
+ related-skills: "ontology-model-multilayer-quality-gate:depends-on, data-to-ontology-mapping-and-instantiation:depends-on, ontology-ai-scenario-fit-and-spike:composes-with"
---
# 本体“黄金用例—测试矩阵—结果回溯”验收
## 方法骨架
- 用业务专家定义的黄金用例建立本体验收基准,再让AI扩展边界和异常测试。
- 每个用例包含真实问题、输入事实、期望规则路径、期望答案或Action和判定标准。
- 测试矩阵覆盖正常、边界、缺失、冲突、越权、等价变异和压力场景。
- 失败结果要回溯到输入事实、模型规则、查询、Action或用例本身。
- 修复后执行全量回归,防止局部调整破坏既有业务逻辑。
- 测试集作为版本化资产,随业务规则和本体版本持续演进。
## 触发场景
### 用户会在什么情境下需要这个 Skill
1. 需要验收本体能否回答真实业务问题
2. 本体规则或版本变化后要做回归
3. 准备设计边界、异常和越权测试
### 语言信号
- “帮我设计本体测试用例”
- “怎么做黄金问题集”
- “这次本体变更会不会影响原结论”
- 英文信号:golden cases, ontology regression, test matrix
### 与相邻 Skill 的区分
- 与 `ontology-model-multilayer-quality-gate`:质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。
- 与 `ontology-ai-scenario-fit-and-spike`:穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。
## 执行步骤
Skill 激活后按以下顺序执行:
1. **确定验收范围**
- 动作:列出核心意图、关键决策点、Action和不可接受错误。
- 完成标准:每项与业务目标和风险等级对应。
2. **制作黄金用例**
- 动作:为正常、边界、异常、缺失、冲突和越权场景定义输入、期望路径、期望结果。
- 完成标准:用例经业务专家确认并有稳定样本。
3. **扩展测试矩阵**
- 动作:基于黄金用例生成等价变异、组合、压力和回归用例。
- 完成标准:矩阵覆盖对象、规则、权限、查询和行动维度。
4. **执行并回溯**
- - 动作:记录实际输出、路径、版本和差异,把失败归因到数据、语义、查询、Action或用例。
+ - 动作:记录实际输出、模型与映射版本、实例来源、规则路径和差异,把失败归因到数据需求、知识来源、语义、概念模型、逻辑模型、映射、查询、Action或用例。
- 完成标准:每个失败项有唯一责任和修复建议。
5. **修复与回归**
- 动作:修复后重跑失败项和全部核心黄金用例,更新版本记录。
- 完成标准:阻断用例100%通过,一般用例达到约定阈值且无新增回归。
### 固定输出
- 最终结果至少包含:输入与假设、逐步判断、证据与来源、未决项、风险边界、建议动作、完成标准。涉及项目适配时,将方法假设与项目事实分栏表达。
+ 最终结果至少包含:验收范围、业务专家确认的黄金用例、正常/边界/异常/缺失/冲突/权限矩阵、输入实例、预期路径与结果、实际结果、模型与映射版本、失败归因、回归报告和发布建议。
## 使用边界
### 不要在以下情况使用
- 只有形式化语法错误,需要先走模型质量门
- 没有稳定业务预期或专家无法确认答案
- 用少量样本直接宣称全量生产效果
### 常见失败模式
- **把语法通过当成业务语义正确**:形式合法性与业务正确性处于不同验证层,语法工具无法判断领域含义、规则完整性及行动后果。
- **用错误本体生成训练数据并放大偏差**:同一语义缺陷被重复采样,训练优化把局部错误提升为模型的稳定决策倾向。
- **行动前无校验且失败后无反馈策略**:计划层假设与真实系统状态没有校验,执行结果也未反馈给决策层重新规划。
### 使用折扣与复核要求
- 黄金用例容易固化已知经验,应持续补充线上新异常和反事实边界。
- 大模型生成形式结构无法直接证明业务语义正确,生产使用需保留专家确认、工具校验、真实用例和审计记录。
## 相关 Skills
- `depends-on` → `ontology-model-multilayer-quality-gate`;质量门审查模型本身;本 skill 用真实问题验证业务结果和推理路径。
+ - `depends-on` → `data-to-ontology-mapping-and-instantiation`;真实实例和映射版本属于用例输入。
- `composes-with` → `ontology-ai-scenario-fit-and-spike`;穿刺验证决定技术路线是否可行;黄金用例形成可持续回归资产。
## 审计信息
- - **验证通过**:V1 ✓ / V2 ✓ / V3 ✓
- - **测试通过率**:100%(6/6,独立 sub-agent 盲测;详见 test-results.md)
+ - **历史验证**:v0.1.0 路由测试 6/6;v0.3.0 增加实例、映射和全链路归因后需重新执行跨平台行为抽样
- **首次公开版本**:2026-08-21
- **来源说明**:方法框架受《本体驱动的 AI 数据管理》启发;仓库不包含原书正文。