---
name: data-science
description: 数据科学与分析出题：统计与实验设计、A/B 测试、指标体系与异常归因、SQL 与建模、因果推断入门、业务洞察表达。岗位或简历涉及数据分析、数据科学、商业分析、增长分析时加载。
keywords: [数据分析, 数据科学, data analyst, data scientist, 商业分析, 增长分析, ab测试, 实验设计, 指标体系, 因果推断, sql, 统计, 假设检验, 用户画像, 归因分析]
layer: domain
---

## 岗位职责与考察重点

数据分析师 / 数据科学家的工作是用数据回答业务问题并推动决策：定指标、设计实验、诊断异常、做专题分析、给出可执行的建议。真实面试里最常见的三类题：指标异常归因（"DAU 掉了 10% 你怎么查"）、实验设计与解读（"这个 A/B 结果能不能上"）、开放业务题（"怎么提升某功能的转化"）。面试官最在意的是分析思路是否结构化且落地、统计判断是否严谨（显著性、样本量、混杂因素）、以及能否把结论讲成业务能听懂的行动建议。很多候选人会背 A/B 流程、会写窗口函数，但一遇到"数据显著但业务上不合理"或"没法做实验"就卡住，这正是要区分的地方。

校招侧重统计基础（假设检验、置信区间、常见分布）、SQL 熟练度、基本的分析框架和案例表达；社招侧重实验平台的坑（样本比例不匹配、多重比较、网络效应）、因果推断的实际应用（无法实验时怎么办）、指标体系搭建与推动落地的经验、以及对所在行业业务模型的理解。互联网大厂偏"业务 sense + 实验"，外企与金融偏"统计严谨 + 建模"。

## 主题

### 指标异常归因
- 阶梯：指标掉了先确认是不是数据问题 → 拆维度（时间、渠道、版本、地域、新老用户）定位的方法 → 多维度同时变化、辛普森悖论、维度爆炸怎么处理 → 归因到原因之后，怎么判断该不该干预、干预效果怎么衡量
- 好题：某电商 App 昨天下单转化率从 3.2% 掉到 2.6%，一小时后要给业务答复，你按什么顺序查？如果拆到"iOS 新版本用户"掉得最多但 Android 也略降，你怎么解释？
- 危险信号：上来就猜原因；不先排除数据链路与口径问题；拆维度没有优先级
- 期望信号：先确认数据正确性与节假日、活动等外部因素；按贡献度排序拆维度；能区分"结构变化"与"单维度恶化"；给出验证假设的方法

### A/B 测试设计
- 阶梯：为什么要随机分组而不是前后对比 → 样本量怎么算、最小可检测效应（MDE）与功效 → 样本比例不匹配（SRM）、分流不均、新奇效应怎么发现和处理 → 网络效应、供给侧干扰下随机化单元怎么选，实验成本与决策速度的平衡
- 好题：推荐策略实验组 CTR 显著提升 2%，但人均时长下降、SRM 检验 p 值 0.001，你会建议上线吗？先做什么？
- 危险信号：只看 p 值不看效应量与置信区间；不知道 SRM；认为跑够 7 天就够而说不出样本量计算
- 期望信号：提前定主指标与护栏指标；SRM 异常先查分流；理解 peeking 问题；能说出何时用用户级、何时用地域/时间片随机化

### 假设检验与统计基础
- 阶梯：p 值到底是什么、不是什么 → t 检验、卡方、Mann-Whitney 各适用什么数据 → 比率类指标方差怎么算、delta method、bootstrap 什么时候用 → 多重比较修正与业务上"看很多指标"的冲突怎么协调
- 好题：人均 GMV 这类长尾分布指标，直接用 t 检验有什么问题？你会怎么处理极端值和方差估计？
- 危险信号：把 p<0.05 解释为"95% 概率有效果"；不知道方差与样本量的关系；对长尾指标直接 t 检验且无处理
- 期望信号：区分统计显著与业务显著；知道 CUPED 等方差缩减手段；对离群值有截尾或分位数策略

### 指标体系搭建
- 阶梯：北极星指标怎么选 → OSM / 指标分层（结果指标、过程指标、护栏指标）的拆解逻辑 → 指标太多没人看、部门间口径打架怎么治理 → 虚荣指标与可操作指标的区分，指标被"刷"了怎么办
- 好题：为一个刚上线的社区型产品设计指标体系，北极星是什么、为什么不是 DAU？哪些护栏指标能防止团队为了北极星伤害长期价值？
- 危险信号：北极星选 DAU 却说不出理由；指标堆砌没有层级；不考虑指标可被操纵
- 期望信号：北极星反映用户获得的核心价值；每个指标有负责人与口径；有反向指标做护栏

### SQL 与数据处理
- 阶梯：多表关联与聚合的常见错误（重复放大、NULL 处理）→ 窗口函数解决留存、连续登录、排名类问题 → 大表查询慢或结果对不上怎么排查 → 什么该在 SQL 里做、什么该拉到 Python 里做
- 好题：用 SQL 计算每个用户注册后第 1/7/30 日留存率，并处理"注册当天就流失"和"多设备登录"的口径问题；写完说说哪一步最容易出错。
- 危险信号：join 后行数膨胀没意识到；留存分母口径说不清；只会 group by 不会窗口
- 期望信号：先明确口径再写；用窗口函数处理连续性；对结果做合理性校验（总数对账）

### 因果推断入门
- 阶梯：相关不等于因果的实际案例 → 混杂变量、选择偏差是怎么产生的 → 没法做实验（如定价、全量上线的功能）时用 DID、PSM、合成控制各能解决什么 → 因果方法的前提假设怎么验证、结论怎么向业务表达不确定性
- 好题：某功能已经全量上线无法做 A/B，业务想知道它对留存的贡献，你会怎么设计分析？结果的可信度受哪些假设制约？
- 危险信号：把"使用该功能的用户留存更高"直接当作因果；不知道任何准实验方法
- 期望信号：识别自选择偏差；提出 DID 或匹配并说明平行趋势等假设；用敏感性分析表达不确定性

### 用户行为分析与分群
- 阶梯：漏斗、留存曲线、路径分析各回答什么问题 → 分群（RFM、行为聚类）的目的与方法 → 分群结果业务用不起来、群体随时间漂移怎么处理 → 分群颗粒度与运营执行能力的匹配
- 好题：流失预警模型识别出 5 万高风险用户，运营只有资源触达 5 千人，你怎么决定触达谁并证明触达有效？
- 危险信号：分群只是描述统计没有行动；没考虑触达本身的效果验证
- 期望信号：结合 uplift 思路区分"触达才会留"的人群；预留对照组；关注边际收益

### 预测与建模在分析中的应用
- 阶梯：什么问题用回归、分类、时序 → 特征来自业务理解还是自动生成，过拟合怎么看 → 模型上线后效果不如离线评估怎么排查 → 可解释性 vs 精度，分析场景下模型的价值边界
- 好题：预测下季度各城市销量，历史数据只有两年且有疫情异常期，你怎么建模并向业务说明置信区间？
- 危险信号：只会说"用 XGBoost"；不知道时序要按时间切分验证；忽略异常期处理
- 期望信号：基线模型先行；按时间切分；对异常期用哑变量或剔除并说明影响；预测给区间不给点

### 业务洞察与表达
- 阶梯：分析报告的结构（结论先行、证据、建议）→ 怎么把统计结论翻译成业务语言 → 结论与业务方预期相反怎么沟通 → 分析没有明确结论时怎么给建议
- 好题：你的分析显示某个高层力推的功能对核心指标没有显著效果，你会怎么写这份报告、怎么在会上讲？
- 危险信号：报告只有图没有结论；被质疑就妥协改口径
- 期望信号：结论、置信度、建议三段分明；准备好被挑战的点；给出后续验证方案

### 数据产品与埋点需求
- 阶梯：分析师为什么要参与埋点设计 → 事件模型（用户、事件、属性）设计原则 → 埋点上线后发现字段缺失或语义不一致怎么补救 → 埋点粒度与存储成本、隐私合规的平衡
- 好题：新功能上线前，你要给研发提埋点需求，怎么设计才能同时支持漏斗分析和后续实验？哪些常见错误会让数据无法使用？
- 危险信号：认为埋点是研发的事；上线后才发现关键属性没埋
- 期望信号：从分析问题反推需要的事件与属性；有埋点验收流程

### 活动效果评估与 ROI
- 阶梯：一次运营活动怎么算效果 → 增量（incremental）与总量的区别，对照组从哪来 → 活动期间指标涨了但活动后回落、用户被"透支"怎么判断 → 补贴与长期留存的取舍，ROI 口径怎么定才不被单次活动数据误导
- 好题：一次发券活动期间 GMV 涨了 40%，运营认为效果很好要常态化，你怎么评估真实增量？如果当时没有留对照组，还能怎么估计？
- 危险信号：直接用活动前后对比当效果；不知道什么是增量；不考虑活动后的回落与蚕食
- 期望信号：坚持预留对照组或用地域/时间对照；看活动后 2–4 周的留存与复购；把补贴成本分摊到增量上算 ROI

## 好题 / 坏题对比

- 坏：A/B 测试的流程是什么？
- 好：实验组 CTR 显著提升 2%，但人均时长下降，SRM 检验 p=0.001，你会建议上线吗？先做什么？如果分流没问题，两个指标冲突时你的决策框架是什么？

- 坏：DAU 掉了怎么分析？
- 好：下单转化率一天内从 3.2% 掉到 2.6%，一小时内要答复，你查什么、按什么顺序？拆到 iOS 新版本掉得最多但 Android 也略降，你怎么解释这个结构？

- 坏：解释一下 p 值。
- 好：人均 GMV 这类长尾指标，你的同事直接用 t 检验得到 p=0.03 建议上线，你会怎么复核？方差估计和极端值怎么处理？

## 项目结合钩子

- 简历出现"搭建指标体系" → 追北极星怎么定的、多少指标、谁在用、口径冲突怎么解决的具体案例
- 简历出现 A/B 测试 → 追样本量怎么算、主指标与护栏指标、遇到过的 SRM 或新奇效应、最终决策
- 简历出现"提升转化率 X%" → 追是实验验证还是前后对比、置信区间、有没有排除季节与活动影响
- 简历出现"用户画像 / 分群" → 追分群怎么用起来的、运营动作是什么、效果怎么验证
- 简历出现预测模型 → 追验证方式（是否按时间切分）、上线后的实际误差、业务怎么使用预测结果
- 简历出现因果推断 → 追用的什么方法、假设怎么验证、结论有没有被后续实验证实
- 简历出现 SQL / 取数 → 给一道留存或漏斗题现场写，重点看口径确认与结果校验习惯

## 出题原则

- 每道题都要有业务场景与具体数字，让候选人现场做判断，而不是复述框架；框架说得再顺也要追"这个场景里哪一步会出错"。
- 统计严谨性是硬门槛：p 值、样本量、混杂因素答错要减分，不能被表达流畅掩盖。
- 分析题不设标准答案，评估思路的结构化、假设的可验证性、以及结论到行动的转化能力。
- 结合候选人所在行业出题（电商、内容、金融、SaaS 各有典型指标），不要用候选人完全不熟悉的业务模型。
