---
name: recsys-search-ads
description: 搜推广深挖：召回与向量检索、精排多目标、重排多样性、样本与偏差、冷启动探索、搜索相关性、广告校准、生成式推荐。
keywords: [推荐系统, recsys, 搜索算法, 广告算法, 召回, 双塔, 精排, 多目标, mmoe, 重排, 样本构造, 负采样, 曝光偏差, 冷启动, 相关性, ctr, cvr, 校准, 生成式推荐]
layer: detail
domains: [algorithm]
---

## 面试官在意什么

搜索推荐广告是国内算法岗需求最大的方向，面试有一套自己的语言：召回粗排精排重排的候选量级、双塔的样本构造、多目标怎么融合、曝光偏差怎么纠、冷启动怎么做、离线 AUC 涨了线上没涨怎么办。2026 年多了一层：生成式推荐（用大模型或序列生成替代部分排序）与 LLM 做特征和标注在哪些场景真的有用。面试官追的是链路每一层的数字与一次线上没涨的归因。

## 项目 / 实习怎么深挖

简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实；只有框架名与结论、说不出自己那一段的，记为危险信号。通用的追问方法见 project-deep-dive。

- 简历出现推荐 / 广告模型 → 追召回样本构造、负采样、各层候选量级与延迟预算、离线与线上指标的对应、AB 置信度
- 简历出现双塔 / 向量召回 → 追样本对怎么构、batch 内负采样、流行度修正、索引更新频率
- 简历出现多目标 → 追目标之间怎么权衡、融合公式怎么定、线上怎么调
- 简历出现搜索相关性 / 排序 → 追标注怎么来、离线 NDCG 与线上点击的关系、query 理解与召回的分工
- 简历出现 CTR / CVR 预估 → 追校准怎么做、延迟反馈怎么处理、出价与预估偏差怎么互相影响
- 简历出现冷启动 / 探索 → 追新用户新物品各怎么处理、探索流量多少、效果怎么量
- 简历出现生成式推荐 / LLM 用于搜推 → 追替代了哪一层、延迟与成本、和传统模型对比的实测

## 常见失守与危险信号

- 推荐系统链路：说不出各层的候选量级与延迟预算；负样本只答"随机采"；不知道曝光未点击样本的偏差
- 搜索与广告排序：相关性只答"用 BERT"；不知道 query 理解与召回的分工；广告只谈 CTR 不谈出价与校准
- 样本构造与不平衡：直接把负样本采到 1:1 且不做校准；不知道延迟反馈
- 召回与向量检索：只会说"用双塔"；不知道索引类型与更新代价；没有流行度修正
- 精排与多目标：目标融合拍脑袋；不知道 MMoE / PLE 解决什么；序列建模只会报名字
- 重排与多样性：不知道重排存在；多样性靠规则硬打散
- 冷启动与探索：只答"用规则"；探索流量没有量化
- 生成式推荐与 LLM：无条件用 LLM；或完全拒绝而说不出理由；没有延迟与成本账

## 常考主题清单

只列名字、阶梯与答实的标志，作"问到哪一层算实"的参考；问哪些、问几道由这份 JD 与这份简历定，不是配额。

### 样本构造与不平衡
- 阶梯：正负样本怎么定义 → 采样、加权、focal loss 各解决什么 → 负采样后概率校准偏了怎么修 → 标签噪声与延迟反馈（转化在点击后几天才发生）怎么处理
- 答实的标志：评估用 PR-AUC 或 KS；采样后概率修正公式；延迟标签用观察窗口或专门建模

### 推荐系统链路
- 阶梯：召回、粗排、精排、重排各解决什么问题、各层候选量级与延迟预算 → 双塔模型的结构与样本构造、batch 内负采样与流行度修正、特征交叉模型（DeepFM、DIN、MMoE）的动机、序列建模 → 新模型离线好线上差、召回与排序目标不一致、样本选择偏差、曝光偏差怎么处理 → 多目标融合、冷启动、探索与利用的取舍
- 答实的标志：能说出各层的目标与约束；知道 batch 内负采样与流行度修正；能解释召回与精排的目标偏差；多目标融合公式与线上调参有依据

### 搜索与广告排序
- 阶梯：搜索链路（query 理解、召回、相关性、排序）与推荐的差别 → 相关性标注怎么来、离线 NDCG 与线上点击的关系；广告的 eCPM 排序、CTR / CVR 预估与校准的作用 → 长尾 query、新广告冷启动、出价与预估偏差互相影响怎么处理 → 相关性、商业化与用户体验的三方取舍
- 答实的标志：能说出相关性与点击的分工；知道校准为什么在广告里是硬要求；有长尾与冷启动的具体方案

### 召回与向量检索
- 阶梯：多路召回各解决什么（协同、内容、向量、规则）→ 双塔的结构、样本构造、batch 内负采样与流行度修正、温度 → 向量索引（HNSW / IVF）的更新频率与延迟、召回与排序目标不一致怎么处理 → 召回路数与融合、召回质量怎么量（离线召回率、线上贡献）
- 答实的标志：能说出各路召回的目标与量级；知道 batch 内负采样的偏差与修正；有召回评估方案

### 精排与多目标建模
- 阶梯：精排的目标（点击、转化、时长、互动）为什么要一起建 → 特征交叉模型（DeepFM、DIN、序列建模）与多任务结构（MMoE、PLE）各解决什么 → 目标之间跷跷板、融合公式怎么定、线上怎么调 → 模型复杂度与延迟预算；实时特征的收益与成本
- 答实的标志：知道多任务结构的动机与失效；融合公式有依据与线上调参方法；有延迟预算数字

### 重排与多样性
- 阶梯：重排解决什么精排解决不了的（多样性、业务规则、整页效果）→ 打散、MMR、列表级建模各怎么做 → 多样性与效率指标怎么权衡、怎么量 → 重排的延迟与复杂度边界
- 答实的标志：知道重排的位置与目标；有多样性指标；能说出规则与模型重排的取舍

### 冷启动与探索
- 阶梯：新用户、新物品各缺什么信息 → 内容特征、跨域迁移、探索流量、bandit 各解决什么 → 探索流量多少、怎么量探索的长期收益 → 冷启动与整体效率的取舍
- 答实的标志：有新物品冷启动的具体方案；探索有量化；知道探索的代价

### 生成式推荐与 LLM 在搜推
- 阶梯：生成式推荐替代的是哪一层（召回、排序、还是整体）→ 序列生成、语义 ID、LLM 做特征或标注各在什么场景有用 → 延迟与成本怎么办；离线效果与线上效果的差距 → 什么时候不该用大模型；LLM 标注的抽检与偏差
- 答实的标志：有替代层的明确判断；有延迟与成本账；LLM 标注做过一致性抽检
