llm-eval · git:20260920.a4843f5 · 2026-09-20 · sha256 78d4ec56496c71a9
llm-eval git:20260920.a4843f5A
Immutable. This exact content is served forever at /api/v1/blob/78d4ec56496c71a9.
--- name: llm-eval description: 大模型与 Agent 评测深挖:评测集与真值、LLM-as-judge 校准、轨迹指标、回归门禁、去污染、红队。 keywords: [评测, eval, evaluation, llm-as-judge, 评测集, benchmark, 回归, regression, 轨迹评测, trace, 红队, 去污染, contamination, golden set, ci 门禁] layer: detail domains: [ai-agent, ai-algorithm, test-qa] --- ## 面试官在意什么 评测是 2026 年 Agent 与大模型岗面试的硬门:没有评测闭环的项目一律按 demo 处理。面试官问的不是"用了什么框架",而是评测集从哪来、真值怎么定、judge 怎么校准、噪声底线多少、失败怎么回灌到下一版、门禁怎么进 CI。Agent 任务还要多一层:同样的结果可能走了 3 步或 30 步,只看成功率不够,要看轨迹。 ## 项目 / 实习怎么深挖 简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实;只有框架名与结论、说不出自己那一段的,记为危险信号。通用的追问方法见 project-deep-dive。 - 简历出现评测集 / benchmark → 追来源、大小、真值怎么定、有没有与训练或提示示例重叠、怎么维护 - 简历出现 LLM-as-judge → 追 judge 用哪个模型、和人工标注的一致性多少、位置与长度偏差怎么控 - 简历出现"成功率 / 准确率提升 X%" → 追跑了几次、噪声底线多少、样本数、有没有对照 - 简历出现回归 / 门禁 → 追门禁指标与阈值、拦过什么坏改动、误拦多少 - 简历出现 agent 评测 → 追轨迹级指标有哪些、评测环境怎么搭、模拟对手怎么做 - 简历出现红队 / 安全评测 → 追攻击集从哪来、覆盖哪些注入路径、拦截率与误拦率 ## 常见失守与危险信号 - 评测集构建与真值:从来没有评测集;真值就是"我觉得对";评测集与提示示例重叠 - LLM-as-judge 校准:judge 用的就是被评估的模型且没校验过一致性;不知道位置偏差与长度偏好 - 轨迹级指标:只有一个成功率数字;不知道步数、无效工具调用率、预算触顶率 - 噪声与统计:没跑过两次基线看噪声;一场翻转就当结论 - 回归门禁:改完不回归;门禁只有人工看 - 去污染:分数涨了不查是不是污染;不知道 n-gram 重叠与时间切分 - 失败回灌:失败修完没有对应的回归用例;同一类失败反复出现 - 红队与安全评测:只测正常输入;把"系统提示里写了不要"当防护 ## 常考主题清单 只列名字、阶梯与答实的标志,作"问到哪一层算实"的参考;问哪些、问几道由这份 JD 与这份简历定,不是配额。 ### 评测:轨迹、评测集与 judge - 阶梯:怎么证明这次改动变好了;为什么只看成功率不够(同样的结果可能走了 3 步或 30 步)→ 离线评测集怎么建(线上回流 + 构造真值的蜕变用例 + 模拟对手)、多大够用、怎么避免与训练 / 提示示例重叠 → 轨迹级指标:步数、无效工具调用率、预算触顶率、每步缓存命中、每段成本;LLM-as-judge 的偏差(位置、长度、自我偏好)与校准 → 噪声底线怎么定(同配置跑两次的差);离线与线上指标背离时信谁;失败模式怎么沉淀(进失败清单、补扰动、修完先跑扰动、再进技能或规则) - 答实的标志:评测集覆盖典型、边界、对抗三类;judge 与人工标注做一致性检验;有噪声底线;轨迹指标能说出三个以上;失败清单 → 扰动 → 修 → 冒烟的闭环;知道用不同家族的模型生成对抗样本以降低共享盲点 ### 评测集构建与真值 - 阶梯:评测集从哪来:线上回流、人工构造、模型生成再人审、蜕变关系构造真值 → 典型、边界、对抗三类各占多少;多大够用 → 与训练数据、提示示例、few-shot 重叠怎么查 → 评测集随产品迭代怎么维护,谁负责,过期怎么办 - 答实的标志:三类覆盖有比例;重叠有检查;评测集有版本与维护人 ### LLM-as-judge 的偏差与校准 - 阶梯:为什么用模型当裁判、什么任务不能用 → 位置偏差、长度偏好、自我偏好、格式偏好各怎么表现 → 和人工标注做一致性检验(多少样本、什么指标),不一致怎么办 → 让 judge 只答是非题、用不同家族的模型、成对比较各解决什么 - 答实的标志:judge 校准有数字;知道用不同家族模型降共享盲点;judge 输出结构化且可复核 ### 轨迹级指标 - 阶梯:为什么成功率不够 → 步数、无效工具调用率、预算触顶率、每步缓存命中、每段成本、退回次数各衡量什么 → 一条轨迹怎么判"走对了但绕远";过程指标与结果指标背离怎么解释 → 轨迹指标进面板与门禁的方式 - 答实的标志:能说出三个以上轨迹指标与各自的用途;有过程与结果背离的案例 ### 噪声底线与统计 - 阶梯:同配置跑两次的差是什么、为什么要先量它 → 样本量、置信区间、配对比较(同种子同画像)各解决什么 → 一场翻转对指标的影响有多大;什么变化才算结论 → 评测费用与统计功效的取舍 - 答实的标志:有噪声底线数字;比较用配对;知道 n 太小时该说什么不该说什么 ### 离线、线上与回归门禁 - 阶梯:离线评测、影子流量、灰度、线上采样人审各回答什么问题 → 门禁指标与阈值怎么定;进 CI 怎么跑得起 → 离线涨线上不涨怎么归因 → 门禁误拦与漏放的成本,谁能越过门禁 - 答实的标志:有门禁拦下坏改动的案例;离线与线上指标有对应关系;门禁有 owner ### 去污染与泄漏 - 阶梯:评测集污染怎么发生(爬到训练数据、示例进提示、回流数据进训练)→ n-gram 重叠、困惑度、时间切分、改写检测各能查什么 → 分数涨了先查什么 → 私有评测集与公开基准的取舍 - 答实的标志:训练前查污染;有私有评测集;能说出一次污染导致误判的案例 ### 失败回灌与扰动集 - 阶梯:失败怎么进清单、怎么分类、怎么变成回归用例 → 针对每类失败构造扰动(换说法、注入、超长、答非所问)→ 修完先跑扰动再跑全量的顺序 → 失败清单怎么反过来改提示词、规则或技能 - 答实的标志:有失败清单与扰动的对应关系;修 → 扰动 → 冒烟的闭环;同类失败复发率在下降 ### 红队与安全评测 - 阶梯:攻击集从哪来:公开注入集、自造、模型生成 → 直接注入、间接注入(文档、工具返回)、越权工具调用、敏感信息泄露各怎么测 → 拦截率与误拦率怎么平衡 → 安全评测进门禁的方式与更新频率 - 答实的标志:攻击集覆盖间接注入;有拦截率与误拦率两个数;安全评测有回归