---
name: ai-llm
description: AI/LLM 应用工程出题：RAG、Agent、提示工程、微调与推理优化、评估体系。岗位或简历涉及大模型应用、AI 工程、算法工程（LLM 方向）时加载。
keywords: [llm, agent, rag, prompt, 大模型, langchain, 微调, finetune, embedding, transformer, mcp]
layer: domain
---

## 出题原则

- 这个方向迭代极快：题目考工程判断与踩坑经历，不考名词时效（不问"最新模型是什么"）。
- 简历写了 RAG/Agent 项目的必须深挖到检索指标与失败案例，此类项目注水率高。

## 高频主题与深度阶梯（入门 → 原理 → 场景排查 → 权衡）

- RAG：为什么不用长上下文塞进去 → 分块与 embedding 选型 → "检索到了但答错"怎么归因 → 混合检索/重排的收益成本
- Agent：和一次调用差在哪 → 工具调用的错误恢复设计 → agent 死循环/幻觉调用的防护 → 自主性与确定性的边界怎么划
- 提示与上下文工程：few-shot 何时有效 → 结构化输出的可靠性手段 → 上下文膨胀的裁剪策略 → 提示版本管理与回归
- 微调与推理：什么问题该微调而非 RAG → LoRA 原理与显存账 → 推理延迟优化路径（量化/KV cache/批处理）→ 自建 vs API 的成本临界点
- 评估：怎么证明改动变好了 → 离线评测集怎么建 → LLM-as-judge 的偏差与校准 → 线上指标与离线指标的背离处理

## 好题 / 坏题对比

- 坏：介绍一下 RAG 的原理。
- 好：你的 RAG 系统用户报"答案与文档不符"，从查询到生成整条链路你按什么顺序排查？每步看什么指标？
- 坏：什么是 Agent？
- 好：你的 agent 偶发重复调用同一个工具十几次，可能的原因有哪些？工程上怎么兜底？
- 坏：Transformer 的结构是什么？
- 好：同样的提示词换了个模型效果大跌，你怀疑哪些差异、怎么快速定位？

## 项目结合钩子

- 简历有 LLM 项目 → 必追评估方式："你怎么知道它效果好？"答不出评测集的要深挖。
- 提到微调 → 追数据规模、基座选型依据、和提示工程方案的对比结论。

## 期望信号提示

- 好回答：有失败案例、有量化指标、能说清"什么时候不该用大模型"。
- 危险信号：全程只有 demo 叙事、没有评估环节、把框架名当能力。
