---
name: ai-app-testing
description: AI 应用测试深挖：非确定性输出、幻觉与 RAG 评估、Agent 链路审计、安全对抗、回归门禁、AI 生成用例。
keywords: [ai 测试, 大模型应用测试, 非确定性, 幻觉检测, rag 评估, agent 测试, 决策链路, 安全对抗, 红队, 回归门禁, 评测流水线, ai 生成用例, 意图驱动测试, mcp 测试]
layer: detail
domains: [test-qa, ai-agent]
---

## 面试官在意什么

这本是测试开发在 2026 年的新分水岭：被测对象是大模型应用与 Agent，输出不确定、错误不报错、行为随上下文变。面试官要候选人说清怎么给非确定性输出定"对"、怎么测幻觉与检索质量、怎么审计 Agent 的决策链路、怎么做安全对抗、怎么把这些做成回归门禁进流水线；同时会问候选人自己怎么用 AI 生成用例、做意图驱动测试，以及 MCP 工具的测法。评测方法论的深挖在 llm-eval 包里，这里是测试岗视角的落地。

## 项目 / 实习怎么深挖

简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实；只有框架名与结论、说不出自己那一段的，记为危险信号。通用的追问方法见 project-deep-dive。

- 简历出现大模型应用测试 → 追怎么定义"对"、评测集从哪来、多大、通过率怎么算、非确定性怎么处理
- 简历出现幻觉 / RAG 评估 → 追怎么判幻觉、检索召回率怎么测、失败案例归因到哪一层
- 简历出现 Agent 测试 → 追测了哪些工具调用路径、决策链路怎么审计、死循环与越权怎么发现
- 简历出现安全测试 / 红队 → 追攻击集从哪来、注入路径覆盖、拦截率与误拦
- 简历出现评测流水线 / 回归门禁 → 追门禁指标与阈值、拦过什么、误拦多少、跑一次多久多贵
- 简历出现 AI 生成用例 / 意图驱动测试 → 追生成的用例怎么验、覆盖了什么人工没覆盖的、误报率
- 简历出现 MCP / Skill 工程化 → 追工具 schema 怎么测、权限怎么验、和普通接口测试的差别

## 常见失守与危险信号

- 非确定性输出的测法：还在用精确匹配；不知道多次采样与阈值；把偶发失败当 flaky 忽略
- 幻觉与 RAG 评估：判幻觉靠人看；分不清检索失败与生成失败；没有检索评测集
- Agent 链路审计：只测最终结果；不看工具调用序列；死循环与越权靶不到
- 安全对抗测试：只测正常输入；把"系统提示里写了不要"当防护；没有间接注入用例
- 回归门禁与评测流水线：改完不回归；门禁只有人工看；跑一次的成本不知道
- 用 AI 做测试：生成的用例不验直接用；不知道生成用例的误报率；意图驱动只是口号
- MCP 与工具的测法：把工具当普通接口测；不测权限与错误回传；不测描述对模型选择的影响
- 数据集与标注治理：评测集没版本；标注一致性没量过；测试数据里有生产隐私

## 常考主题清单

只列名字、阶梯与答实的标志，作"问到哪一层算实"的参考；问哪些、问几道由这份 JD 与这份简历定，不是配额。

### AI 时代的测试
- 阶梯：大模型能帮测试做什么（用例生成、脚本生成、日志分析、缺陷聚类） → 生成用例的质量怎么评估、怎么防止幻觉用例进入用例库 → 测试 AI 产品本身：非确定性输出怎么断言、评测集怎么建、Agent 调用失败怎么兜底 → 人与 AI 在测试中的分工，哪些环节不能交给模型
- 答实的标志：有生成用例的审核与去重机制；知道用 LLM-as-judge 加人工校准；有分层兜底（调用、推理、模型、消费）的验证清单。

### 非确定性输出的测法
- 阶梯：为什么精确匹配不行 → 语义相似、规则断言、LLM 判分、多次采样取通过率各适合什么 → 通过率阈值怎么定、偶发失败怎么区分真问题与噪声 → 测试成本（每次调用要钱）与覆盖的平衡；温度与种子能不能固定
- 答实的标志：有多种断言方式的取舍；有通过率与噪声底线；知道成本约束下怎么取样

### 幻觉与 RAG 质量的测法
- 阶梯：幻觉怎么定义与判定（忠实度、事实性）→ 检索层单独测：query-正确文档对、召回率；生成层单独测：忠实于上下文 → 一个错误答案怎么归因到解析、检索、生成哪一层 → 评测集怎么随知识库更新维护
- 答实的标志：有分层的测法与指标；有归因流程；评测集有维护机制

### Agent 决策链路审计
- 阶梯：为什么 Agent 要测过程不只测结果 → 工具调用序列、参数、退回、预算触顶怎么记录与断言 → 死循环、越权调用、幻觉参数、忽略确认怎么构造用例 → 轨迹级指标进门禁；模拟对手与沙箱环境怎么搭
- 答实的标志：能断言工具调用序列；有越权与死循环的用例；有轨迹指标

### 安全对抗与合规测试
- 阶梯：prompt 注入与传统注入的差别 → 直接注入、间接注入（文档、工具返回）、越权、敏感信息泄露各怎么构造用例 → 攻击集从哪来、怎么更新；拦截率与误拦率怎么平衡 → 合规（隐私、内容安全）的测试点与证据留存
- 答实的标志：攻击集覆盖间接注入；有两个率的数字；合规测试有证据留存

### 回归门禁与评测流水线
- 阶梯：评测怎么进 CI：什么时候跑、跑多少、多久、多贵 → 门禁指标与阈值怎么定；分层门禁（快速冒烟 vs 全量）→ 离线通过线上出问题怎么归因；线上采样人审怎么接回评测集 → 门禁误拦与漏放的成本，谁能越过
- 答实的标志：有门禁与阈值；有拦下坏改动的案例；离线与线上有回流机制

### 用 AI 做测试
- 阶梯：AI 生成用例、意图驱动测试、自愈定位器各解决什么 → 生成的用例怎么验（有效性、覆盖增量、误报率）→ 什么测试该交给 AI、什么必须人写；AI 测试智能体的边界与审核 → 引入 AI 后测试流程与人的分工怎么变
- 答实的标志：有生成用例的验证与误报率；知道 AI 测试的边界；能说出流程变化

### MCP 与工具的测法
- 阶梯：MCP 工具与普通接口测试的差别：模型会不会选对、参数会不会填错 → 工具 schema 与描述的测法（模型选择准确率）、权限与确认的测法、错误回传的测法 → 工具集变化对现有 agent 的回归 → 第三方 MCP server 的信任与隔离测试
- 答实的标志：测过工具选择准确率；权限与错误回传有用例；有工具变更的回归

### 评测数据集与标注治理
- 阶梯：评测集从哪来（回流、构造、生成）、怎么去隐私 → 标注一致性怎么量、判分规则怎么写 → 评测集版本与被测版本怎么对应；污染怎么防 → 数据集的维护成本与责任人
- 答实的标志：评测集有版本与责任人；标注一致性有数字；去隐私有流程
