ai-app-testing · git:20260920.a4843f5 · 2026-09-20 · sha256 e358f40ff9f38cf3
ai-app-testing git:20260920.a4843f5A
Immutable. This exact content is served forever at /api/v1/blob/e358f40ff9f38cf3.
--- name: ai-app-testing description: AI 应用测试深挖:非确定性输出、幻觉与 RAG 评估、Agent 链路审计、安全对抗、回归门禁、AI 生成用例。 keywords: [ai 测试, 大模型应用测试, 非确定性, 幻觉检测, rag 评估, agent 测试, 决策链路, 安全对抗, 红队, 回归门禁, 评测流水线, ai 生成用例, 意图驱动测试, mcp 测试] layer: detail domains: [test-qa, ai-agent] --- ## 面试官在意什么 这本是测试开发在 2026 年的新分水岭:被测对象是大模型应用与 Agent,输出不确定、错误不报错、行为随上下文变。面试官要候选人说清怎么给非确定性输出定"对"、怎么测幻觉与检索质量、怎么审计 Agent 的决策链路、怎么做安全对抗、怎么把这些做成回归门禁进流水线;同时会问候选人自己怎么用 AI 生成用例、做意图驱动测试,以及 MCP 工具的测法。评测方法论的深挖在 llm-eval 包里,这里是测试岗视角的落地。 ## 项目 / 实习怎么深挖 简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实;只有框架名与结论、说不出自己那一段的,记为危险信号。通用的追问方法见 project-deep-dive。 - 简历出现大模型应用测试 → 追怎么定义"对"、评测集从哪来、多大、通过率怎么算、非确定性怎么处理 - 简历出现幻觉 / RAG 评估 → 追怎么判幻觉、检索召回率怎么测、失败案例归因到哪一层 - 简历出现 Agent 测试 → 追测了哪些工具调用路径、决策链路怎么审计、死循环与越权怎么发现 - 简历出现安全测试 / 红队 → 追攻击集从哪来、注入路径覆盖、拦截率与误拦 - 简历出现评测流水线 / 回归门禁 → 追门禁指标与阈值、拦过什么、误拦多少、跑一次多久多贵 - 简历出现 AI 生成用例 / 意图驱动测试 → 追生成的用例怎么验、覆盖了什么人工没覆盖的、误报率 - 简历出现 MCP / Skill 工程化 → 追工具 schema 怎么测、权限怎么验、和普通接口测试的差别 ## 常见失守与危险信号 - 非确定性输出的测法:还在用精确匹配;不知道多次采样与阈值;把偶发失败当 flaky 忽略 - 幻觉与 RAG 评估:判幻觉靠人看;分不清检索失败与生成失败;没有检索评测集 - Agent 链路审计:只测最终结果;不看工具调用序列;死循环与越权靶不到 - 安全对抗测试:只测正常输入;把"系统提示里写了不要"当防护;没有间接注入用例 - 回归门禁与评测流水线:改完不回归;门禁只有人工看;跑一次的成本不知道 - 用 AI 做测试:生成的用例不验直接用;不知道生成用例的误报率;意图驱动只是口号 - MCP 与工具的测法:把工具当普通接口测;不测权限与错误回传;不测描述对模型选择的影响 - 数据集与标注治理:评测集没版本;标注一致性没量过;测试数据里有生产隐私 ## 常考主题清单 只列名字、阶梯与答实的标志,作"问到哪一层算实"的参考;问哪些、问几道由这份 JD 与这份简历定,不是配额。 ### AI 时代的测试 - 阶梯:大模型能帮测试做什么(用例生成、脚本生成、日志分析、缺陷聚类) → 生成用例的质量怎么评估、怎么防止幻觉用例进入用例库 → 测试 AI 产品本身:非确定性输出怎么断言、评测集怎么建、Agent 调用失败怎么兜底 → 人与 AI 在测试中的分工,哪些环节不能交给模型 - 答实的标志:有生成用例的审核与去重机制;知道用 LLM-as-judge 加人工校准;有分层兜底(调用、推理、模型、消费)的验证清单。 ### 非确定性输出的测法 - 阶梯:为什么精确匹配不行 → 语义相似、规则断言、LLM 判分、多次采样取通过率各适合什么 → 通过率阈值怎么定、偶发失败怎么区分真问题与噪声 → 测试成本(每次调用要钱)与覆盖的平衡;温度与种子能不能固定 - 答实的标志:有多种断言方式的取舍;有通过率与噪声底线;知道成本约束下怎么取样 ### 幻觉与 RAG 质量的测法 - 阶梯:幻觉怎么定义与判定(忠实度、事实性)→ 检索层单独测:query-正确文档对、召回率;生成层单独测:忠实于上下文 → 一个错误答案怎么归因到解析、检索、生成哪一层 → 评测集怎么随知识库更新维护 - 答实的标志:有分层的测法与指标;有归因流程;评测集有维护机制 ### Agent 决策链路审计 - 阶梯:为什么 Agent 要测过程不只测结果 → 工具调用序列、参数、退回、预算触顶怎么记录与断言 → 死循环、越权调用、幻觉参数、忽略确认怎么构造用例 → 轨迹级指标进门禁;模拟对手与沙箱环境怎么搭 - 答实的标志:能断言工具调用序列;有越权与死循环的用例;有轨迹指标 ### 安全对抗与合规测试 - 阶梯:prompt 注入与传统注入的差别 → 直接注入、间接注入(文档、工具返回)、越权、敏感信息泄露各怎么构造用例 → 攻击集从哪来、怎么更新;拦截率与误拦率怎么平衡 → 合规(隐私、内容安全)的测试点与证据留存 - 答实的标志:攻击集覆盖间接注入;有两个率的数字;合规测试有证据留存 ### 回归门禁与评测流水线 - 阶梯:评测怎么进 CI:什么时候跑、跑多少、多久、多贵 → 门禁指标与阈值怎么定;分层门禁(快速冒烟 vs 全量)→ 离线通过线上出问题怎么归因;线上采样人审怎么接回评测集 → 门禁误拦与漏放的成本,谁能越过 - 答实的标志:有门禁与阈值;有拦下坏改动的案例;离线与线上有回流机制 ### 用 AI 做测试 - 阶梯:AI 生成用例、意图驱动测试、自愈定位器各解决什么 → 生成的用例怎么验(有效性、覆盖增量、误报率)→ 什么测试该交给 AI、什么必须人写;AI 测试智能体的边界与审核 → 引入 AI 后测试流程与人的分工怎么变 - 答实的标志:有生成用例的验证与误报率;知道 AI 测试的边界;能说出流程变化 ### MCP 与工具的测法 - 阶梯:MCP 工具与普通接口测试的差别:模型会不会选对、参数会不会填错 → 工具 schema 与描述的测法(模型选择准确率)、权限与确认的测法、错误回传的测法 → 工具集变化对现有 agent 的回归 → 第三方 MCP server 的信任与隔离测试 - 答实的标志:测过工具选择准确率;权限与错误回传有用例;有工具变更的回归 ### 评测数据集与标注治理 - 阶梯:评测集从哪来(回流、构造、生成)、怎么去隐私 → 标注一致性怎么量、判分规则怎么写 → 评测集版本与被测版本怎么对应;污染怎么防 → 数据集的维护成本与责任人 - 答实的标志:评测集有版本与责任人;标注一致性有数字;去隐私有流程