platform-engineering · git:20260920.a4843f5 · 2026-09-20 · sha256 47013af1d5402eab

platform-engineering git:20260920.a4843f5A

Immutable. This exact content is served forever at /api/v1/blob/47013af1d5402eab.

---
name: platform-engineering
description: 平台工程深挖:IaC、K8s 运维、容量与成本、灾备多活、内部开发者平台、GPU 集群、多云。
keywords: [平台工程, platform engineering, iac, terraform, gitops, 内部开发者平台, idp, 容量规划, 成本治理, finops, 灾备, 多活, gpu 集群, ai 负载, 多云, kubernetes 运维]
layer: detail
domains: [infra-sre]
---

## 面试官在意什么

这本是 SRE 往平台方向的深挖:把基础设施做成产品给几十个团队用。面试官看的是规模与代价:IaC 漂移怎么治、容量怎么规划、成本怎么归因到团队、灾备演练过没有、平台的抽象泄漏了什么。2026 年多了 GPU 集群与 AI 负载:调度、利用率、配额与成本成了平台团队的新 KPI。

## 项目 / 实习怎么深挖

简历上出现下面这类经历时从哪里切、追什么。追到候选人能说出机制、数字的来源与一次真实的故障或取舍才算实;只有框架名与结论、说不出自己那一段的,记为危险信号。通用的追问方法见 project-deep-dive。

- 简历出现 Terraform / IaC / GitOps → 追漂移怎么发现、状态怎么管、一次 apply 出事故的经历、审批流程
- 简历出现容量 / 成本 → 追成本归因到哪一级、省了多少、怎么防止反弹、利用率数字
- 简历出现灾备 / 多活 → 追 RPO / RTO、演练频率、上次演练发现了什么
- 简历出现内部平台 / 开发者门户 → 追用户是谁、采用率、抽象泄漏了什么、平台团队怎么接需求
- 简历出现 GPU 集群 → 追调度策略、利用率、配额与抢占、故障率
- 简历出现多云 / 混合云 → 追为什么多云、抽象在哪一层、成本与复杂度

## 常见失守与危险信号

- 基础设施即代码与配置管理:手工改线上再补代码;不知道状态漂移;没有审批与计划预览
- 容量规划与成本治理:容量拍脑袋;成本只看总账不归因;省成本靠砍资源不看利用率
- 高可用与灾备架构:只说"两地三中心";从没演练;RPO / RTO 没有数字
- 自动化与平台化思维:把脚本堆成平台;没有用户视角;抽象泄漏一堆
- 编排平台运维:升级靠祈祷;不知道控制面与数据面的故障差别
- 内部开发者平台:平台没人用;接口设计不考虑自服务;文档缺失
- GPU 集群与 AI 负载:GPU 利用率不监控;调度还用 CPU 的思路;配额与抢占没有策略
- 多云与供应商锁定:为多云而多云;抽象层成本比收益高

## 常考主题清单

只列名字、阶梯与答实的标志,作"问到哪一层算实"的参考;问哪些、问几道由这份 JD 与这份简历定,不是配额。

### 编排平台运维(Kubernetes 视角)
- 阶梯:Pod、Deployment、Service 分别解决什么 → 调度、探针、资源 request/limit、HPA 的机制 → Pod Pending/CrashLoopBackOff/Evicted 各怎么查、节点 NotReady 怎么处理 → 集群规模、多集群、升级策略与平台自治程度的取舍(细节交给 infra-k8s 包)
- 答实的标志:先回滚再排查的止血意识;describe 看事件、按节点/版本对比;探针与优雅退出的配合;对集群升级的风险有认识

### 基础设施即代码与配置管理
- 阶梯:为什么要 IaC → Terraform 状态文件、plan/apply、模块化,Ansible 幂等性 → 状态漂移、并发 apply 冲突、误删资源怎么防与恢复 → IaC 覆盖范围(全部还是核心)、平台团队与业务团队的权限边界
- 答实的标志:远程 state 加锁;lifecycle 保护关键资源;plan 进 PR 审核;漂移检测定期跑

### 容量规划与成本治理
- 阶梯:怎么知道该扩容了 → 压测方法、水位线、峰值预估、弹性伸缩 → 资源利用率只有 15% 但业务喊不够、云账单月涨 30% 没人说得清,怎么查 → 预留与按需、超卖、混部的风险收益,成本责任怎么分摊到业务
- 答实的标志:按服务维度的用量/申请比;VPA 或推荐值治理;错峰与弹性;成本可视化到团队并有考核

### 高可用与灾备架构
- 阶梯:单点在哪 → 多可用区、多活与主备、数据复制的一致性 → 一个可用区挂了业务却全挂、切换演练从没成功过,怎么整改 → 多活的成本与复杂度,RPO/RTO 目标怎么与业务对齐
- 答实的标志:依赖梳理与单点清单;定期演练(混沌工程);数据层切换的一致性代价;按业务重要性分级的灾备目标

### 自动化与平台化思维
- 阶梯:哪些重复工作该自动化 → 脚本、工具、平台的演进路径 → 自动化脚本本身成为故障源、平台没人用,怎么办 → 平台工程的边界:自助服务与安全约束,做多少抽象合适
- 答实的标志:按频率与风险排序自动化;自助带护栏与审计;用工单减少量和 lead time 衡量;能说出一次"自动化闯祸"的教训

### 内部开发者平台
- 阶梯:平台工程与传统运维的差别:把基础设施做成自服务产品 → 平台要抽象什么、暴露什么(模板、门户、API);黄金路径 → 采用率低怎么办;抽象泄漏(用户还是得懂底层)怎么处理 → 平台团队与业务团队的边界;平台的 SLO 与反馈机制
- 答实的标志:有采用率或用户数;能说出一处抽象泄漏与处理;平台有自己的 SLO

### GPU 集群与 AI 负载
- 阶梯:GPU 负载与普通服务的差别(独占、长任务、通信密集)→ 调度:拓扑感知、gang 调度、配额与抢占、碎片 → GPU 利用率怎么测(SM、显存、带宽)、为什么常常很低、怎么提 → 训练与推理服务各自的 SLO;故障率与自动替换;成本归因到团队
- 答实的标志:知道 gang 调度与拓扑感知解决什么;有利用率数字与提升手段;能说出 GPU 故障的处理流程

### 多云与供应商锁定
- 阶梯:为什么会多云(合规、成本、容灾、并购)→ 抽象在哪一层(K8s、IaC 模块、自建平台)、各自的代价 → 跨云的网络、身份、数据同步问题 → 锁定的真实成本与迁移成本;什么时候接受锁定
- 答实的标志:有多云的明确理由;知道抽象层的成本;能说出一次跨云问题的处理