recsys-search-ads · git:20260920.a4843f5 · 2026-09-20 · sha256 b51a5b5fc8ab9af4
recsys-search-ads git:20260920.a4843f5A
Immutable. This exact content is served forever at /api/v1/blob/b51a5b5fc8ab9af4.
--- name: recsys-search-ads description: 搜推广深挖:召回与向量检索、精排多目标、重排多样性、样本与偏差、冷启动探索、搜索相关性、广告校准、生成式推荐。 keywords: [推荐系统, recsys, 搜索算法, 广告算法, 召回, 双塔, 精排, 多目标, mmoe, 重排, 样本构造, 负采样, 曝光偏差, 冷启动, 相关性, ctr, cvr, 校准, 生成式推荐] layer: detail domains: [algorithm] --- ## 面试官在意什么 搜索推荐广告是国内算法岗需求最大的方向,面试有一套自己的语言:召回粗排精排重排的候选量级、双塔的样本构造、多目标怎么融合、曝光偏差怎么纠、冷启动怎么做、离线 AUC 涨了线上没涨怎么办。2026 年多了一层:生成式推荐(用大模型或序列生成替代部分排序)与 LLM 做特征和标注在哪些场景真的有用。面试官追的是链路每一层的数字与一次线上没涨的归因。 ## 项目 / 实习怎么深挖 简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实;只有框架名与结论、说不出自己那一段的,记为危险信号。通用的追问方法见 project-deep-dive。 - 简历出现推荐 / 广告模型 → 追召回样本构造、负采样、各层候选量级与延迟预算、离线与线上指标的对应、AB 置信度 - 简历出现双塔 / 向量召回 → 追样本对怎么构、batch 内负采样、流行度修正、索引更新频率 - 简历出现多目标 → 追目标之间怎么权衡、融合公式怎么定、线上怎么调 - 简历出现搜索相关性 / 排序 → 追标注怎么来、离线 NDCG 与线上点击的关系、query 理解与召回的分工 - 简历出现 CTR / CVR 预估 → 追校准怎么做、延迟反馈怎么处理、出价与预估偏差怎么互相影响 - 简历出现冷启动 / 探索 → 追新用户新物品各怎么处理、探索流量多少、效果怎么量 - 简历出现生成式推荐 / LLM 用于搜推 → 追替代了哪一层、延迟与成本、和传统模型对比的实测 ## 常见失守与危险信号 - 推荐系统链路:说不出各层的候选量级与延迟预算;负样本只答"随机采";不知道曝光未点击样本的偏差 - 搜索与广告排序:相关性只答"用 BERT";不知道 query 理解与召回的分工;广告只谈 CTR 不谈出价与校准 - 样本构造与不平衡:直接把负样本采到 1:1 且不做校准;不知道延迟反馈 - 召回与向量检索:只会说"用双塔";不知道索引类型与更新代价;没有流行度修正 - 精排与多目标:目标融合拍脑袋;不知道 MMoE / PLE 解决什么;序列建模只会报名字 - 重排与多样性:不知道重排存在;多样性靠规则硬打散 - 冷启动与探索:只答"用规则";探索流量没有量化 - 生成式推荐与 LLM:无条件用 LLM;或完全拒绝而说不出理由;没有延迟与成本账 ## 常考主题清单 只列名字、阶梯与答实的标志,作"问到哪一层算实"的参考;问哪些、问几道由这份 JD 与这份简历定,不是配额。 ### 样本构造与不平衡 - 阶梯:正负样本怎么定义 → 采样、加权、focal loss 各解决什么 → 负采样后概率校准偏了怎么修 → 标签噪声与延迟反馈(转化在点击后几天才发生)怎么处理 - 答实的标志:评估用 PR-AUC 或 KS;采样后概率修正公式;延迟标签用观察窗口或专门建模 ### 推荐系统链路 - 阶梯:召回、粗排、精排、重排各解决什么问题、各层候选量级与延迟预算 → 双塔模型的结构与样本构造、batch 内负采样与流行度修正、特征交叉模型(DeepFM、DIN、MMoE)的动机、序列建模 → 新模型离线好线上差、召回与排序目标不一致、样本选择偏差、曝光偏差怎么处理 → 多目标融合、冷启动、探索与利用的取舍 - 答实的标志:能说出各层的目标与约束;知道 batch 内负采样与流行度修正;能解释召回与精排的目标偏差;多目标融合公式与线上调参有依据 ### 搜索与广告排序 - 阶梯:搜索链路(query 理解、召回、相关性、排序)与推荐的差别 → 相关性标注怎么来、离线 NDCG 与线上点击的关系;广告的 eCPM 排序、CTR / CVR 预估与校准的作用 → 长尾 query、新广告冷启动、出价与预估偏差互相影响怎么处理 → 相关性、商业化与用户体验的三方取舍 - 答实的标志:能说出相关性与点击的分工;知道校准为什么在广告里是硬要求;有长尾与冷启动的具体方案 ### 召回与向量检索 - 阶梯:多路召回各解决什么(协同、内容、向量、规则)→ 双塔的结构、样本构造、batch 内负采样与流行度修正、温度 → 向量索引(HNSW / IVF)的更新频率与延迟、召回与排序目标不一致怎么处理 → 召回路数与融合、召回质量怎么量(离线召回率、线上贡献) - 答实的标志:能说出各路召回的目标与量级;知道 batch 内负采样的偏差与修正;有召回评估方案 ### 精排与多目标建模 - 阶梯:精排的目标(点击、转化、时长、互动)为什么要一起建 → 特征交叉模型(DeepFM、DIN、序列建模)与多任务结构(MMoE、PLE)各解决什么 → 目标之间跷跷板、融合公式怎么定、线上怎么调 → 模型复杂度与延迟预算;实时特征的收益与成本 - 答实的标志:知道多任务结构的动机与失效;融合公式有依据与线上调参方法;有延迟预算数字 ### 重排与多样性 - 阶梯:重排解决什么精排解决不了的(多样性、业务规则、整页效果)→ 打散、MMR、列表级建模各怎么做 → 多样性与效率指标怎么权衡、怎么量 → 重排的延迟与复杂度边界 - 答实的标志:知道重排的位置与目标;有多样性指标;能说出规则与模型重排的取舍 ### 冷启动与探索 - 阶梯:新用户、新物品各缺什么信息 → 内容特征、跨域迁移、探索流量、bandit 各解决什么 → 探索流量多少、怎么量探索的长期收益 → 冷启动与整体效率的取舍 - 答实的标志:有新物品冷启动的具体方案;探索有量化;知道探索的代价 ### 生成式推荐与 LLM 在搜推 - 阶梯:生成式推荐替代的是哪一层(召回、排序、还是整体)→ 序列生成、语义 ID、LLM 做特征或标注各在什么场景有用 → 延迟与成本怎么办;离线效果与线上效果的差距 → 什么时候不该用大模型;LLM 标注的抽检与偏差 - 答实的标志:有替代层的明确判断;有延迟与成本账;LLM 标注做过一致性抽检