---
name: llm-eval
description: 大模型与 Agent 评测深挖：评测集与真值、LLM-as-judge 校准、轨迹指标、回归门禁、去污染、红队。
keywords: [评测, eval, evaluation, llm-as-judge, 评测集, benchmark, 回归, regression, 轨迹评测, trace, 红队, 去污染, contamination, golden set, ci 门禁]
layer: detail
domains: [ai-agent, ai-algorithm, test-qa]
---

## 面试官在意什么

评测是 2026 年 Agent 与大模型岗面试的硬门：没有评测闭环的项目一律按 demo 处理。面试官问的不是"用了什么框架"，而是评测集从哪来、真值怎么定、judge 怎么校准、噪声底线多少、失败怎么回灌到下一版、门禁怎么进 CI。Agent 任务还要多一层：同样的结果可能走了 3 步或 30 步，只看成功率不够，要看轨迹。

## 项目 / 实习怎么深挖

简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实；只有框架名与结论、说不出自己那一段的，记为危险信号。通用的追问方法见 project-deep-dive。

- 简历出现评测集 / benchmark → 追来源、大小、真值怎么定、有没有与训练或提示示例重叠、怎么维护
- 简历出现 LLM-as-judge → 追 judge 用哪个模型、和人工标注的一致性多少、位置与长度偏差怎么控
- 简历出现"成功率 / 准确率提升 X%" → 追跑了几次、噪声底线多少、样本数、有没有对照
- 简历出现回归 / 门禁 → 追门禁指标与阈值、拦过什么坏改动、误拦多少
- 简历出现 agent 评测 → 追轨迹级指标有哪些、评测环境怎么搭、模拟对手怎么做
- 简历出现红队 / 安全评测 → 追攻击集从哪来、覆盖哪些注入路径、拦截率与误拦率

## 常见失守与危险信号

- 评测集构建与真值：从来没有评测集；真值就是"我觉得对"；评测集与提示示例重叠
- LLM-as-judge 校准：judge 用的就是被评估的模型且没校验过一致性；不知道位置偏差与长度偏好
- 轨迹级指标：只有一个成功率数字；不知道步数、无效工具调用率、预算触顶率
- 噪声与统计：没跑过两次基线看噪声；一场翻转就当结论
- 回归门禁：改完不回归；门禁只有人工看
- 去污染：分数涨了不查是不是污染；不知道 n-gram 重叠与时间切分
- 失败回灌：失败修完没有对应的回归用例；同一类失败反复出现
- 红队与安全评测：只测正常输入；把"系统提示里写了不要"当防护

## 常考主题清单

只列名字、阶梯与答实的标志，作"问到哪一层算实"的参考；问哪些、问几道由这份 JD 与这份简历定，不是配额。

### 评测：轨迹、评测集与 judge
- 阶梯：怎么证明这次改动变好了；为什么只看成功率不够（同样的结果可能走了 3 步或 30 步）→ 离线评测集怎么建（线上回流 + 构造真值的蜕变用例 + 模拟对手）、多大够用、怎么避免与训练 / 提示示例重叠 → 轨迹级指标：步数、无效工具调用率、预算触顶率、每步缓存命中、每段成本；LLM-as-judge 的偏差（位置、长度、自我偏好）与校准 → 噪声底线怎么定（同配置跑两次的差）；离线与线上指标背离时信谁；失败模式怎么沉淀（进失败清单、补扰动、修完先跑扰动、再进技能或规则）
- 答实的标志：评测集覆盖典型、边界、对抗三类；judge 与人工标注做一致性检验；有噪声底线；轨迹指标能说出三个以上；失败清单 → 扰动 → 修 → 冒烟的闭环；知道用不同家族的模型生成对抗样本以降低共享盲点

### 评测集构建与真值
- 阶梯：评测集从哪来：线上回流、人工构造、模型生成再人审、蜕变关系构造真值 → 典型、边界、对抗三类各占多少；多大够用 → 与训练数据、提示示例、few-shot 重叠怎么查 → 评测集随产品迭代怎么维护，谁负责，过期怎么办
- 答实的标志：三类覆盖有比例；重叠有检查；评测集有版本与维护人

### LLM-as-judge 的偏差与校准
- 阶梯：为什么用模型当裁判、什么任务不能用 → 位置偏差、长度偏好、自我偏好、格式偏好各怎么表现 → 和人工标注做一致性检验（多少样本、什么指标），不一致怎么办 → 让 judge 只答是非题、用不同家族的模型、成对比较各解决什么
- 答实的标志：judge 校准有数字；知道用不同家族模型降共享盲点；judge 输出结构化且可复核

### 轨迹级指标
- 阶梯：为什么成功率不够 → 步数、无效工具调用率、预算触顶率、每步缓存命中、每段成本、退回次数各衡量什么 → 一条轨迹怎么判"走对了但绕远"；过程指标与结果指标背离怎么解释 → 轨迹指标进面板与门禁的方式
- 答实的标志：能说出三个以上轨迹指标与各自的用途；有过程与结果背离的案例

### 噪声底线与统计
- 阶梯：同配置跑两次的差是什么、为什么要先量它 → 样本量、置信区间、配对比较（同种子同画像）各解决什么 → 一场翻转对指标的影响有多大；什么变化才算结论 → 评测费用与统计功效的取舍
- 答实的标志：有噪声底线数字；比较用配对；知道 n 太小时该说什么不该说什么

### 离线、线上与回归门禁
- 阶梯：离线评测、影子流量、灰度、线上采样人审各回答什么问题 → 门禁指标与阈值怎么定；进 CI 怎么跑得起 → 离线涨线上不涨怎么归因 → 门禁误拦与漏放的成本，谁能越过门禁
- 答实的标志：有门禁拦下坏改动的案例；离线与线上指标有对应关系；门禁有 owner

### 去污染与泄漏
- 阶梯：评测集污染怎么发生（爬到训练数据、示例进提示、回流数据进训练）→ n-gram 重叠、困惑度、时间切分、改写检测各能查什么 → 分数涨了先查什么 → 私有评测集与公开基准的取舍
- 答实的标志：训练前查污染；有私有评测集；能说出一次污染导致误判的案例

### 失败回灌与扰动集
- 阶梯：失败怎么进清单、怎么分类、怎么变成回归用例 → 针对每类失败构造扰动（换说法、注入、超长、答非所问）→ 修完先跑扰动再跑全量的顺序 → 失败清单怎么反过来改提示词、规则或技能
- 答实的标志：有失败清单与扰动的对应关系；修 → 扰动 → 冒烟的闭环；同类失败复发率在下降

### 红队与安全评测
- 阶梯：攻击集从哪来：公开注入集、自造、模型生成 → 直接注入、间接注入（文档、工具返回）、越权工具调用、敏感信息泄露各怎么测 → 拦截率与误拦率怎么平衡 → 安全评测进门禁的方式与更新频率
- 答实的标志：攻击集覆盖间接注入；有拦截率与误拦率两个数；安全评测有回归
