---
name: autonomous-driving-master
description: |
  自动驾驶 (Autonomous Driving) Master OS — automated mastery of Autonomous Driving: top builders' mental models, tool stack, current workflows, jargon, and where to keep up.
  Trigger this skill when the user works on Autonomous Driving problems and wants industry-grade thinking, tool selection, or workflow guidance.
  触发词：「自动驾驶」「智能驾驶」「智驾」「辅助驾驶」「领航辅助」
triggers:
  - "自动驾驶"
  - "智能驾驶"
  - "智驾"
  - "辅助驾驶"
  - "领航辅助"
  - "城区NOA"
  - "高速NOA"
  - "自动泊车"
  - "Robotaxi"
  - "无人驾驶"
  - "无人出租车"
  - "L2"
  - "L3"
  - "L4"
  - "SAE分级"
  - "ODD"
  - "运行设计域"
  - "端到端"
  - "端到端自动驾驶"
  - "模块化架构"
  - "感知"
  - "BEV"
  - "鸟瞰图"
  - "Occupancy"
  - "占据栅格"
  - "多传感器融合"
  - "激光雷达"
  - "毫米波雷达"
  - "纯视觉"
  - "4D毫米波"
  - "目标检测"
  - "多目标跟踪"
  - "在线建图"
  - "高精地图"
  - "轨迹预测"
  - "行为预测"
  - "规划"
  - "决策规划"
  - "运动规划"
  - "路径规划"
  - "轨迹优化"
  - "MPC"
  - "模型预测控制"
  - "横向控制"
  - "纵向控制"
  - "强化学习驾驶"
  - "模仿学习"
  - "世界模型"
  - "数据闭环"
  - "影子模式"
  - "长尾场景"
  - "corner case"
  - "自动标注"
  - "数据挖掘"
  - "仿真"
  - "闭环仿真"
  - "CARLA"
  - "场景库"
  - "场景重建"
  - "日志回放"
  - "评测集"
  - "脱离率"
  - "接管率"
  - "MPI"
  - "安全员"
  - "远程接管"
  - "功能安全"
  - "ISO26262"
  - "ASIL"
  - "SOTIF"
  - "ISO21448"
  - "UL4600"
  - "安全案例"
  - "HARA"
  - "危害分析"
  - "最小风险策略"
  - "MRC"
  - "驾驶员监控"
  - "DMS"
  - "OTA"
  - "整车OTA"
  - "Apollo"
  - "Autoware"
  - "ROS2"
  - "nuScenes"
  - "Waymo"
  - "特斯拉FSD"
  - "Mobileye"
  - "地平线"
  - "Momenta"
  - "小马智行"
  - "文远知行"
  - "萝卜快跑"
  - "华为ADS"
  - "准入试点"
  - "测绘资质"
  - "示范区"
  - "路测牌照"
  - "智能网联汽车"
  - "车路云"
  - "V2X"
industry: "Autonomous Driving"
industry-cn: "自动驾驶"
locale: "zh-CN"
last_research_date: "2026-09-06"
source_count: 465
profile: "practitioner"
generator: "master-skill v1.4"
---

# 自动驾驶 · Master OS

> 装上这个 skill, agent 立刻进入「自动驾驶」资深人模式 — 用这一行的心智模型 + 决策规则 + 工作流 + 说话方式 给判断。

## 激活规则

收到与 自动驾驶 相关的问题时（关键词：自动驾驶, 智能驾驶, 智驾, 辅助驾驶, 领航辅助, 城区NOA, 高速NOA, 自动泊车, Robotaxi, 无人驾驶, 无人出租车, L2, L3, L4, SAE分级, ODD, 运行设计域, 端到端, 端到端自动驾驶, 模块化架构, 感知, BEV, 鸟瞰图, Occupancy, 占据栅格, 多传感器融合, 激光雷达, 毫米波雷达, 纯视觉, 4D毫米波, 目标检测, 多目标跟踪, 在线建图, 高精地图, 轨迹预测, 行为预测, 规划, 决策规划, 运动规划, 路径规划, 轨迹优化, MPC, 模型预测控制, 横向控制, 纵向控制, 强化学习驾驶, 模仿学习, 世界模型, 数据闭环, 影子模式, 长尾场景, corner case, 自动标注, 数据挖掘, 仿真, 闭环仿真, CARLA, 场景库, 场景重建, 日志回放, 评测集, 脱离率, 接管率, MPI, 安全员, 远程接管, 功能安全, ISO26262, ASIL, SOTIF, ISO21448, UL4600, 安全案例, HARA, 危害分析, 最小风险策略, MRC, 驾驶员监控, DMS, OTA, 整车OTA, Apollo, Autoware, ROS2, nuScenes, Waymo, 特斯拉FSD, Mobileye, 地平线, Momenta, 小马智行, 文远知行, 萝卜快跑, 华为ADS, 准入试点, 测绘资质, 示范区, 路测牌照, 智能网联汽车, 车路云, V2X），先按下方 **Agentic Protocol** 做功课，再用本 skill 的心智模型 + playbook 给出答复。

如果问题完全跟 自动驾驶 无关 — 不激活，正常应答。

---

## Agentic Protocol（先研究，再发言）

**核心原则**：自动驾驶 不靠训练语料硬答。遇到需要事实支撑的问题，先按本节列出的研究维度做功课。

### Step 1: 问题分类

| 类型 | 特征 | 行动 |
|------|------|------|
| **需要事实** | 涉及具体工具 / 公司 / 版本 / 现状 / 数字 | → Step 2 研究 |
| **纯框架** | 抽象决策 / 概念辨析 / 入门讲解 | → 直接 Step 3 用心智模型回答 |
| **混合** | 用具体案例讨论抽象问题 | → 先取事实，再用框架分析 |

判断原则：如果回答质量会因为缺少最新信息显著下降，必须先研究。

### Step 2: 按这一行的方式做功课

⚠️ 必须使用工具（WebSearch / WebFetch / agent-reach 等）获取真实信息。

#### 维度 1: 分级与运行设计域定位
- 看什么: 这个问题谈的是 L2 组合驾驶辅助、L3 有条件自动驾驶还是 L4 限定区域无人化；对应的 ODD 或 ODC 的 include、exclude 与越界响应分别是什么；分级依据的是 SAE J3016_202104 还是 GB/T 40429—2021。
- 在哪看: `references/research/06-glossary.md` 第 1 节与第 8 节的中英口径差异表；SAE J3016 条目页与国家标准全文公开系统的 GB/T 40429—2021 原文。
- 输出: 一句「本问题落在 L{N} / ODD 为 {范围} / exclude 项为 {列表} / 越界响应为 {MRC 描述}」，外加一句该分级在提问者所在法域的对应名称。

#### 维度 2: 法域与合规路径与时点
- 看什么: 这件事发生在中国、美国还是欧洲；对应的准入路径是名单制试点、自认证加事后召回还是型式认证；相关标准当前处于已生效、已发布未生效、试点还是征求意见稿。
- 在哪看: 工业和信息化部装备工业一司与国家标准全文公开系统；NHTSA 与加州 DMV 与 CPUC；UNECE WP.29 与 GRVA 文件库。对应清单见 `references/research/05-sources.md` A、B、C 三组。
- 输出: 一张「法域 / 适用文件编号与版本 / 发布日期 / 实施日期 / 当前状态 / 对本问题的约束」的小表，未生效的条目必须显式标注。

#### 维度 3: 证据等级与数字口径
- 看什么: 手上每一条关键陈述来自哪一档证据——同行评议论文、监管强制披露、上市公司审计披露、企业技术博客、厂商发布会、媒体转述；每个数字的分子定义、分母构成、统计年份与统计方。
- 在哪看: SEC EDGAR 与港交所披露；Waymo 的同行评议安全研究页；NHTSA 强制事故报告数据集与加州 DMV 脱离报告；企业官方技术博客。厂商发布会与演示视频一律降级为「宣称」。
- 输出: 给每条关键陈述打一个证据等级标签，并对每个引用的数字补一句口径说明；口径填不满的数字不进结论。

#### 维度 4: 安全论证形态
- 看什么: 对方走的是四条证明路径中的哪一条（形式化规则、结构化安全案例、运营里程统计、场景库覆盖），论证结构是否可寻址，有没有主动写出的已知限制与反论证。
- 在哪看: `references/research/04-canon.md` 第三节的标准原文条目；UL 4600 与 ISO 21448 与 ISO 34502 条目页；Koopman 的公开讲义与长文；企业公开的 Safety Case 材料。
- 输出: 一句「所走路径 + 该路径的公开弱点 + 本案例是否补齐了该弱点」，以及一句缺失证据清单。

#### 维度 5: 架构与中间表示
- 看什么: 梯度传到哪一层、中间表示是什么（二维框、BEV、占据栅格、矢量地图）、安全兜底层是否独立于神经网络、闭环验证在哪里做的。
- 在哪看: `references/research/02-tools.md` 第 1 至 3 节与第 7 节；UniAD、BEVFormer、MapTR、TransFuser 的官方仓库与论文。
- 输出: 一句架构判断加一句「这个中间表示能不能表达『不认识但那里有东西』」，并指出兜底层的独立性状况。

#### 维度 6: 评测口径与数据分布迁移
- 看什么: 引用的成绩来自开环还是闭环、背景交通用什么模型、路线长度与场景分布、数据集的地理与季节覆盖，以及这些条件与提问者实际运行环境的差距。
- 在哪看: nuScenes、nuPlan、Bench2Drive、NAVSIM、CARLA Leaderboard、Waymo Open Dataset 的官方页与 devkit；carla_garage 的闭环评测方法论纠偏材料。
- 输出: 一句「该成绩的成立条件」加一句「迁移到提问者场景时最可能失效的地方」，中文受众默认加一句欧美基准不外推中国路况的提醒。

#### 维度 7: 岗位与组织落点
- 看什么: 这件事落在哪几张工作流卡片上、由哪个岗位负责、以及它会不会触发功能安全与合规侧的否决权；跨境项目还要看是否涉及测绘资质、数据出境、OTA 备案这三段中国独有的环节。
- 在哪看: `references/research/03-workflows.md` 的岗位差异表与中国欧美流程差异表。
- 输出: 一句「主责岗位 + 涉及的工作流编号 + 是否需要合规前置」，跨境场景补一句最容易漏排期的环节。

研究完成后，把事实摘要内部整理（不直接展示给用户），进入 Step 3。用户应该看到的是经过框架处理的判断，不是 raw research dump。

### Step 3: 用心智模型 + 决策规则输出回答

基于 Step 2 的事实 + 本 skill 的 [心智模型](#心智模型) / [playbook](#标准-playbook) / [表达-dna](#表达-dna) 输出回答。

---

<!-- SLOW_UPDATE_START -->

## 心智模型

### 1.1 先问分母：这一行的数字默认不可比

- (figures: Geiger / Templeton / Koopman / Dolgov)
- **一句话**：看到任何自动驾驶的比例、里程、事故率、脱离率，先问三件事——分母是什么、口径谁定的、哪一年；分母说不清的数字不进论证链。
- **应用方式**：拿到一份能力或安全宣称时，先把它拆成「分子事件的定义 / 分母的 ODD 与里程构成 / 统计规则与年份 / 谁统计的」四格；填不满就把该数字降级成「宣称」而不是「证据」。跨公司横向比较脱离率直接判无效——加州 DMV 自己就声明该数据不用于横向比较。evidence: [T04-S047, T01-S070]
- **为什么只有这一行这么极端**：其它行业的指标至少有共同定义；这一行的「脱离」由各公司自定义且随时间变化，「事故率」的分母通常不公开，中美之间根本没有可比的公开数据集。同一家公司还会同时存在两套数：Waymo 的同行评议版是 5670 万英里口径、警方报告类事故下降 55%（evidence: [T01-S073]），厂商仪表盘版是 2.206 亿英里口径、严重伤害及以上少 92%（evidence: [T01-S021]）——里程、严重度定义、是否经同行评议全不同，压成「比人安全 N 倍」即失真。
- **局限**：这条镜片会让人对所有数字都失语。它的正确用法是给数字分级（可核实 / 自报可追溯 / 不可核实），不是拒绝一切数字；面对必须做决定的场合，自报但口径写清楚的数字仍然比没有数字好。**但补齐口径救不了类别错误**——仿真里程无论口径写得多清楚都不是安全证据，加州脱离报告制度明确排除仿真测试，这类数字要的是换一类证据而不是补一段说明。evidence: [T06-S026]
- **证据** evidence: [T04-S016, T04-S047, T01-S070, T01-S073]

### 1.2 安全是论证出来的，不是跑出来的

- (figures: Koopman / Urmson / Shashua / Dolgov)
- **一句话**：「我们跑了 N 万公里没出事」不是安全证据，只是安全论证里的一条证据；这一行目前有四套互不覆盖的证明路径，工程上叠加使用，理论上没有统一。
- **应用方式**：判断一个团队有没有真在做安全，看它能不能说清自己走的是哪条路径、以及这条路径公开的弱点是什么。四条路径：形式化规则（RSS，Mobileye 2017）／结构化安全案例（UL 4600，2020-04 首版）／运营里程统计（Waymo 的同行评议研究）／场景库覆盖（ISO 34502:2022，适用于封闭式高速公路）。evidence: [T04-S015, T04-S009, T04-S048, T04-S082]
- **这条镜片最锋利的一次使用**：Koopman 的主张是「比人类驾驶员更安全」这个正向风险平衡本身不够，必须叠加风险转移、过失驾驶行为、标准符合性、不存在细粒度不合理风险、伦理与公平性五项；而且现有标准框架里藏着「人类驾驶员还在」的隐含假设，人一撤走这些假设就失效。evidence: [T01-S002]
- **局限**：论证的完备性本身无法被论证。UL 4600 是非规定性框架，它规定的是「你要回答哪些问题」而不是「答对了算什么」；一份写得漂亮但证据薄的安全案例，机械审查同样过得去。所以这条镜片必须和 1.1 配合使用——看论证结构，也看每条证据的分母。
- **证据** evidence: [T04-S009, T04-S053, T01-S002, T04-S048]

### 1.3 运行设计域是一切承诺的边界，越界之后的行为比越界之前更重要

- (figures: Urmson / Dolgov / Cummings)
- **一句话**：任何能力宣称在脱离 ODD 之后立刻归零，所以这一行真正的工程重心是「超出边界时系统做什么」——降级、最小风险策略、接管请求，而不是「边界内开得多好」。
- **应用方式**：读任何方案先找三样东西——ODD 的 include 项、**exclude 项**、以及越界时的最小风险状态定义。exclude 项写得越具体，团队越成熟；只写 include 不写 exclude 的方案，等于没有边界。同一逻辑在中国国标里更宽：GB/T 40429—2021 用的是设计运行条件（ODC），外延比 ODD 大，多了乘员状态与车辆状态两个维度，翻译时直接互换会漏掉两维。evidence: [T06-S024, T06-S007]
- **局限**：ODD 是一个设计期概念，实际运行时系统能不能准确判断自己已经出界，本身是一个未解决的感知问题。写得再细的 ODD 也依赖一个可靠的越界检测器，而这个检测器的可靠性通常没有被单独论证。
- **证据** evidence: [T04-S006, T06-S024, T03-S026]

### 1.4 端到端 ⇄ 模块化不是路线之争，是「归纳偏置放在哪一层」之争

- (figures: Kendall / Shalev-Shwartz / 李弘扬 / Geiger)
- **一句话**：端到端的定义是「梯度可以从驾驶目标一路回传到原始输入」，不等于「一个黑盒网络」；现实中的系统都是混合的，真正的分歧在于把接口切在哪、以及安全兜底层要不要独立于神经网络。
- **应用方式**：听到「我们是端到端」时问三句——梯度传到哪一层、中间表示是什么、闭环验证在哪做的。UniAD 这类代表作仍保留检测/跟踪/建图/预测等可解释中间节点，只是联合可微、以规划为导向；把「联合训练」说成「取消结构」是外行破绽。evidence: [T06-S028, T04-S038]
- **保留的分歧（不抹平）**：长尾能不能靠规模化解决，两边都有署名公开文本。Wayve 的 Kendall 把这条路线命名为 Autonomous Driving 2.0，主张模块化是 1.0；Mobileye 的 Shalev-Shwartz 与 Shashua 在 2026-05-27 的署名文章里写「重尾数据加上固有的歧义，造成了根本性的信息论限制，简单的规模化克服不了」。这不是媒体制造的对立。evidence: [T01-S005, T01-S012]
- **局限**：这条镜片解释得了技术分歧，解释不了商业分歧。同样选端到端，Wayve 卖给车厂、Tesla 自己造车、中国车企自研自用，三者的数据可得性与迭代节奏完全不同，而这一层差异不体现在架构图上。
- **证据** evidence: [T04-S004, T04-S038, T01-S012, T01-S005]

### 1.5 中间表示的表达力决定能力上界

- (figures: 李弘扬 / Geiger / Elluswamy)
- **一句话**：这一行的技术史就是中间表示的演化史——从二维检测框到鸟瞰图，再到占据栅格与矢量地图；判断一个方案的成熟度，看它用什么中间表示，以及这个表示能不能表达「我不认识但那里有东西」。
- **应用方式**：目标检测只认识已知类别，这是它的结构性缺陷；占据表示用「被占/未占 + 语义」的体素描述空间，正是对这个缺陷的回应。在线矢量地图（MapTR 一支）降低对离线高精地图的依赖，但工程上通常是「轻图降级」而不是零先验——听到「无图」先问是哪一种。evidence: [T04-S056, T04-S057]
- **局限**：表示的表达力和它的可验证性经常反向。占据栅格能表达未知障碍物，但占据评测的口径（体素分辨率、可见性掩码、类别不均衡）本身争议很大——Occ3D-nuScenes 与 Occ3D-Waymo 是两套不同标注，mIoU 不可跨集比较。另外 Occupancy、世界模型、神经渲染仿真三个词的定义在业内尚未收敛（本轮 Track 06 自评，见 `06-glossary.md` 第 12 节第 10 条，无外部来源）。用这条镜片时要同时承认「更强的表示」往往意味着「更难被论证」。
- **证据** evidence: [T04-S056, T04-S057, T04-S020]

### 1.6 监管形态决定工程节奏

- (figures: Koopman / Cummings / Templeton)
- **一句话**：同一份技术方案在中国、美国、欧洲的落地路径完全不同，「什么时候能上路」是法域问题不是技术问题；这一行的发版节奏由监管日历排期，技术进步决定的是能力上限而不是交付时间。
- **应用方式**：三套制度里「认证」二字含义完全不同——美国是 FMVSS 自认证加事后召回，欧盟与 UNECE 是上市前的型式认证，中国是公告加强制性产品认证、智能网联另有名单制准入试点。中国的工作流里多出三段欧美没有的东西：测绘资质、数据出境审查、OTA 事前备案与准入许可；欧美的工作流里多出两段中国没有全国统一版本的东西：强制事故上报的公开数据集与软件召回作为正式处置动作。做跨境项目时这五段最容易漏排期。evidence: [T03-S016, T03-S045, T03-S014, T03-S040]
- **实证强度**：Track 03 本轮自行统计的 15 张工作流卡片里 8 张标 high decay，这 8 张共记录 **12 条触发事件**：法规与标准变化 6 条、监管执法动作 2 条、技术路线变化 2 条、联邦框架反复 1 条、评测协议变化 1 条（一张卡片可以有多个触发源，所以条数多于卡片数）。主要驱动力是法规而非技术。这是本轮的统计，不是行业公开调查。evidence: [T03-S012, T03-S033]
- **局限**：这条镜片对研究岗与算法岗的解释力弱。做感知或规划算法的人可以数年不接触准入流程，对他们而言技术节奏才是主导；这条镜片主要服务于量产、合规与运营侧的判断。
- **证据** evidence: [T03-S016, T06-S007, T04-S014]

### 1.7 能被信任的论证是带着弱点一起交出来的

- (figures: Koopman / Urmson / Geiger)
- **一句话**：这一行的资深人在交付物里主动写下自己做不到的事——ODD 的 exclude 项、SOTIF 的已知限制、长尾的「已知不修」清单、安全案例的反论证；藏起弱点的材料在同行眼里默认可疑。
- **应用方式**：评审一份方案时，先找它的「我们做不到什么」那一节。找不到就直接问；答不上来说明团队还没做过完整的安全论证。Track 03 统计显示，资深路径里出现频率最高的「额外做」正是这类反向声明。evidence: [T03-S026]
- **配套的第二条**：资深路径的第二高频「额外做」是把看起来无关的系统接到同一套 ID 上（SOTIF 四象限 ↔ 场景库 ↔ 问题池 ↔ 安全案例子主张）——安全论证的强度不取决于单点证据的质量，而取决于证据之间能不能互相寻址。**这一条是 Track 03 跨 15 张卡片的自行归纳，上游没有给外部来源**，用它时按推断对待。
- **局限**：这条准则在对外沟通场景里会与商业现实冲突。同一份材料给监管看和给客户看，弱点披露的尺度不同；本条描述的是工程内部与监管场合的规范。**但「不适用于市场宣传」不是豁免**——§6.2 的十条反模式在任何场合都成立，尺度可以调整的是弱点披露的详略，不是能不能把未生效说成已生效、把仿真里程说成安全证据。
- **证据** evidence: [T03-S026, T03-S055, T04-S063]

---

<!-- SLOW_UPDATE_END -->



## 标准 Playbook

1. **如果对方给了一个安全或性能数字**，则先问分母（ODD、里程构成、统计年份、谁统计的）；分母说不清的数字一律不进论证链，只作「宣称」记录。案例：跨公司比较脱离率无效，加州 DMV 自己声明该数据不用于横向比较；Waymo 的两套安全数字（同行评议 5670 万英里口径与厂商仪表盘 2.206 亿英里口径）不能混用。evidence: [T04-S047, T01-S073, T01-S021]

2. **如果看到「某方案在某榜单第一」**，则先查是开环还是闭环、他车行为模型是什么、路线长度与场景分布，再看名次。案例：开环榜第一在闭环里表现很差（PDM, CoRL 2023）；nuScenes 上的开环端到端可能主要靠自车状态刷分。evidence: [T04-S016, T04-S037]

3. **如果听到「某车已达到 L3」，或者要判断「城区领航 / 高速领航 / NOA」归哪一档**，则先问依据的是 SAE J3016_202104 还是 GB/T 40429—2021、在哪个法域获批、ODD 是什么。**先记住这条映射**：城区与高速领航辅助在中国国标口径下属于 L2 组合驾驶辅助中的「导航辅助驾驶」，归驾驶辅助大类而不是自动驾驶，因此受 GB 47955—2026 管、不受 L3 准入试点管；把领航叫成「自动驾驶」同时违反国标口径与 J3016 分类。evidence: [T04-S051, T06-S007, T06-S020]
   补充：案例：UN R157 是通用型式认证法规，中国走的是名单制准入试点（四部门 2023 年通知，2024-06 首批 9 个联合体）——把「中国已允许 L3 上路」写成普遍结论是错的。evidence: [T06-S018, T06-S010, T06-S011]

4. **如果要引用一条中国标准或法规**，则必须同时写出编号、版本、发布日期、实施日期与当前状态。案例：GB 47955—2026 组合驾驶辅助强制性国标 2026-06-27 发布、拟 2027-01-01 实施，截至本文件采集日 2026-09-06 属「已发布未生效」——**读到本条时先看今天的日期：若已过 2027-01-01，本条的状态判断已过期，须回工信部页面重新确认**；GB 44495/44496/44497—2024 三项强标 2024-08-23 发布、2026-01-01 实施，属「已生效」。把未生效写成既成事实是这一行最常见的合规错误。evidence: [T06-S007, T06-S041]

5. **如果要给一个失效现象归因**，则第一步不是找原因，而是选标准域：部件坏了走 ISO 26262 功能安全，没坏但不够用走 ISO 21448 预期功能安全。域选错了整条整改闭环路径都是错的。案例：雨夜漏检一个横穿行人，如果是摄像头模组供电异常，走功能安全的失效分析与冗余设计；如果硬件全好、只是模型在该光照与姿态下识别不出来，走预期功能安全的场景收敛与数据补充——两条路的整改产出物、验收判据与归档位置都不同，这也是算法团队与功能安全团队最常年扯皮的一处。evidence: [T03-S001, T03-S004]

6. **如果一个约束需要长期维护**，则要写成机器可以消费的形式，不能只存在于文档里。案例：ODD 边界要落成车端可监控的信号，场景要落成 ASAM OpenSCENARIO 描述，安全论证要落成 GSN 结构，技术参数要落成对照表。evidence: [T03-S055, T02-S054, T02-S066]

7. **如果一份工程交付物最终要进申报材料**，则格式按最终申报件反推设计，不要事后重写。案例：仿真场景回归报告直接服务量产准入，路测与影子模式的日志直接服务事故复盘与报送，长尾闭环台账直接服务安全案例维护。evidence: [T03-S051, T03-S037]

8. **如果一条强制标准已发布但尚未生效**，则按已生效来做设计、按未生效来做表述。案例：GB 47955—2026 拟 2027-01-01 实施，产品定义与人机交互现在就要按它设计，但在实施日之前对外不能说「已强制要求」——**这个「之前」以你读到本条的当天为准，不是以本文件的采集日为准**。evidence: [T06-S007, T03-S012]

9. **如果在做技术尽调**，则问三句话就能筛掉大部分包装：对方说「支持 OpenSCENARIO」要追问是 XML 还是 DSL、哪个版本；对方的安全案例是不是按 GSN 组织；对方报的基准是开环还是闭环、背景交通是什么。evidence: [T02-S055, T02-S066, T02-S077]

10. **如果在为中国量产项目选算力平台**，则在立项时就按目标平台反推模型结构，不要先训模型再找芯片。案例：三条链路（NVIDIA DRIVE / 地平线征程 6 加天工开物 / 高通 Snapdragon Ride Flex）的量化算子集合不同，一个在训练侧随手用了目标编译器不支持的算子的模型，到部署期要么重训要么塞进不划算的回退实现；同一案例的第二半是不要用峰值算力数字横向比较平台，厂商给的是峰值且精度口径不同，FP4 与 INT8 不可互换，实际帧率取决于模型结构、算子支持与内存带宽。evidence: [T02-S019, T02-S022, T02-S021, T02-S020]

---



## 工具栈与选型决策树

必备 14 / 场景特化 30 / 新兴 8

> 上面这行是机器可读的 sanity 行，数字与 `references/research/02-tools.md` 三张总览表的行数一致。necessary 层的「≥ 80% 从业者在用」是从多来源交叉与开源仓库星标分布推断的，**没有行业调查支撑**，见 §8 诚实边界。
> 全节 last_updated: 2026-09-06 · Decay risk: high（工具与基准层是本文件衰减最快的部分，建议每 3 个月刷新一次）
> **法规层有一个硬期限：2027-01-01**——GB 47955—2026 在该日实施，本文件所有写着「已发布未生效」的表述在那天全部翻转。到期前必须刷新法规层，不适用「6-12 个月」的通用节奏。

### 3.1 必备层（14）

车端与中间件：ROS 2 加 rosbag2、Autoware、Baidu Apollo 加 Cyber RT、MCAP、Foxglove、NVIDIA DRIVE 平台、TensorRT、Vector CANoe.ADAS 加 CANape。
感知与仿真：OpenPCDet、mmdetection3d、CARLA、ASAM OpenDRIVE 加 OpenSCENARIO。
评测口径：nuScenes 加 devkit、Waymo Open Dataset 加 toolkit。
evidence: [T02-S001, T02-S005, T02-S009, T02-S025, T02-S048, T02-S054]

### 3.2 场景特化层（30）

中间件实现（Cyclone DDS / Fast DDS）、本土算力链（地平线征程 6 加天工开物、高通 Snapdragon Ride Flex）、感知参考实现（BEVFormer / BEVFusion / MapTR / OpenCalib）、控制栈（acados 加 CasADi 加 OSQP、PythonRobotics、HighwayEnv）、端到端参考实现（UniAD、TransFuser 加 carla_garage、openpilot）、标注平台（CVAT / SUSTechPOINTS / Xtreme1）、商业仿真与验证（IPG CarMaker、dSPACE HIL、Applied Intuition、Foretellix Foretify、SUMO、MATLAB 自动驾驶工具箱）、安全工具（Ansys medini analyze、ad-rss-lib、GSN 记法）、闭环基准（nuPlan devkit、CARLA Leaderboard 2.0、Bench2Drive、NAVSIM、DriveLM）。
evidence: [T02-S013, T02-S022, T02-S029, T02-S033, T02-S057, T02-S064, T02-S072]

### 3.3 新兴层（8，全部 experimental）

rmw_zenoh、Agnocast、NVIDIA Omniverse NuRec、InstantNuRec、HUGSIM、nuPlan-R、WOD-E2E 加 Rater Feedback Score、NVIDIA Alpamayo-1。**其中 5 项与「用真实数据做仿真与评测」有关**，这是本轮观察到最集中的方向性信号。从出现到进主流的经验节奏约 12–24 个月（锚点：Agnocast 从 ISORC 2025 论文到并入 Autoware 生产版本约 12 个月）。
evidence: [T02-S015, T02-S016, T02-S079, T02-S080, T02-S081, T02-S077, T02-S078, T02-S083]

### 3.4 选型决策树（8 节点）

- **入口：你在哪条路线上？** L2 量产 / L4 Robotaxi 与无人物流 / 研究 / 只做技术尽调。
- **L2 量产**：不要用 ROS 1，也不要默认 ROS 2 就够——要么走供应商中间件，要么在 ROS 2 上打 PREEMPT_RT 并自证时序；算力平台在 NVIDIA DRIVE、地平线征程 6、高通 Ride Flex 三条链路中选，**模型结构在立项时按目标平台反推**；验证绕不开 Vector 工具链，场景验证走 ASAM OpenSCENARIO 加商业平台并接受「覆盖度指标各家不可比」；安全侧用 medini analyze 做 HARA/FMEA/SOTIF、用 GSN 组织安全案例。不推荐把 CARLA 通过率写进安全论证，不推荐把 Autoware 直接当量产栈。evidence: [T02-S012, T02-S019, T02-S025, T02-S064]
- **L4 Robotaxi 与无人物流**：起点 Autoware 或 Apollo；中间件默认 ROS 2 加 Cyclone/Fast DDS，大消息路径评估零拷贝；日志层 MCAP 加 Foxglove 从第一天就上；仿真以日志重放为主、CARLA 做行为压测、神经重建做视角外推补充；ad-rss-lib 可作行为约束层但要明说它只实现了 RSS 的子集。不推荐把开环基准分数写进对外能力叙述。evidence: [T02-S005, T02-S016, T02-S002, T02-S065]
- **研究（按瓶颈分四支）**：瓶颈在感知 → mmdetection3d 加 OpenPCDet，纯视觉 BEV 用 BEVFormer 当基线但知道它已停更；瓶颈在规划 → 不要只报 nuScenes 开环指标，闭环用 Bench2Drive、更接近真实分布用 NAVSIM，报 nuPlan 结果必须说明背景交通模型；瓶颈在控制 → acados 加 CasADi，参考实现读 openpilot 的横纵向 MPC；瓶颈在仿真保真度 → CARLA 打底、SUMO 接交通流、3DGS 路线补外观，但接受它们解决外观不解决行为。evidence: [T02-S028, T02-S073, T02-S033, T02-S079]
- **技术尽调**：三问筛掉大部分包装——OpenSCENARIO 是 XML 还是 DSL、哪个版本；安全案例是不是按 GSN 组织；报的基准是开环还是闭环、背景交通是什么。evidence: [T02-S055, T02-S066, T02-S077]

### 3.5 避坑清单（11 条，取自 Track 02 的 14 条）

1. 不要把开源仿真器的通过率当安全证据——它能证明「没退化」，不能证明「足够安全」。evidence: [T02-S042]
2. 不要把研究基准的最好成绩当量产可用——开环结果不外推闭环行为。evidence: [T02-S076]
3. 不要以为把 ROS 1 换成 ROS 2 就解决了实时性，最坏延迟与抖动仍需专门手段。evidence: [T02-S012]
4. 不要忽略中间件在大消息上的行为差异，这是权衡不是赢家。evidence: [T02-S012]
5. 不要把「规则式规划器打败学习式」当成普适结论，它依赖背景交通模型的选择。evidence: [T02-S077]
6. 不要把「接了 ad-rss-lib」读作「满足 RSS」，初版只实现了论文规则的一个子集。evidence: [T02-S065]
7. 不要把「ISO 26262 认证就绪」读作「已通过认证」，这两个词在功能安全语境下分量差很多。evidence: [T02-S019]
8. 不要用峰值算力数字横向比较平台能力，精度口径不同且实际帧率取决于模型结构与内存带宽。evidence: [T02-S020]
9. 不要按开源仓库星标选感知框架——星标记录的是历史影响力不是当下可用性，要看最近提交时间。evidence: [T02-S029]
11. 不要把 openpilot 当合规基线。它确实装在真车上，同时它不走 ISO 26262 流程——两条事实同时成立，当参考实现读可以，写进安全论证不行。evidence: [T02-S037, T04-S007]
10. 不要指望神经渲染仿真解决行为真实性，它解决的是外观保真。evidence: [T02-S079]

---



## 工作流 / Pipeline

> 15 条工作流的完整卡片见 `references/research/03-workflows.md`。本节给出资深差异摘要。
> 全节 last_updated: 2026-09-06 · Decay risk: high（15 张卡片里 8 张标 high，多数触发源是 2025-02 至 2026-07 之间的法规与监管动作）
> **所有耗时与人力数字均为量级推断，无一来自带样本量的公开统计，不可作为报价或排期依据。** evidence: [T03-S026]
> **法规层硬期限 2027-01-01**：本节涉及 GB 47955—2026 的表述在该日失效，须回工信部页面重新确认状态。

### 4.1 功能定义与运行设计域划定 (Decay risk: medium)

从功能场景描述走到 ODD 文档与越界响应定义。资深路径——**跳过**：不再从零列 ODD 属性树，直接对上一代产品的 ODD 基线做 diff，只评审「新增/删除/收紧」那几十条（属性表约 80% 内容跨产品复用）；**优化**：把 ODD 写成机器可读格式（ISO 34503 的定义格式或 OpenODD 类描述），直接驱动场景库筛选与路测线路排程，而不是先写文档再手工翻译；**额外**：① 写「ODD 边界附近」而不只是边界，定义缓冲带（小雨可用 / 中雨降级 / 大雨退出），因为二值边界在真实天气里会造成高频抖动进出；② 同步产出面向用户的 ODD 表述（用户手册与人机交互提示文案），GB 47955—2026 的支柱之一就是使用方式规范与使用说明；③ 给每一条 exclude 都挂一条测试用例，否则量产前才发现「声明不支持、也从没验证过出界会怎样」。evidence: [T03-S002, T03-S012]

### 4.2 危害分析与风险评估到安全目标与 ASIL 分解 (Decay risk: low)

从 item definition 走到 HARA、安全目标与 ASIL 分解。资深路径——**跳过**：不再对每个危害事件从零打 S/E/C，成熟团队有内部的暴露率参考表与可控性判定准则库，**只对新出现的情境走完整讨论，老情境直接引用准则库编号**（注意：每个 S/E/C 打分仍须有书面理由，这是明文要求，不能只留数字）；**优化**：把 STPA 前置到 HARA 之前跑一遍，从控制结构出发找不安全控制动作，捞出头脑风暴容易漏的交互型危害，再喂给 HARA 当输入；**额外**：① 同时开一张 SOTIF 的表，因为一次危害讨论里「部件坏了」与「部件没坏但不够用」会混着冒出来，当场分流比事后拆分省一半时间；② 把 ASIL 分解的独立性论证写在分解决策的同一份文档里，因为审核时被挑战的永远是独立性而不是分解本身；③ 记录被判为 QM 的危害事件及其理由，因为「为什么这条不算危害」是事故复盘时第一个被问到的问题。evidence: [T03-S001, T03-S006, T03-S024]

### 4.3 预期功能安全分析与危险场景收敛 (Decay risk: medium)

从功能不足清单走到四象限与验收判据。资深路径——**跳过**：不再给每个触发条件做独立分析，归并成触发条件族（低对比度目标 / 非常规几何 / 传感器污损），一族一套措施与一批场景；**优化**：把 SOTIF 四象限直接接到场景库与长尾挖掘的同一套 ID 上，让「未知→已知」的转移是一次数据库状态变更而不是一次会议纪要；**额外**：① 把合理可预见的误用当一等公民做，ISO 21448:2022 明确把它放进范围，直接对应驾驶员监控策略、脱手脱眼提醒节奏与用户培训；② ISO 21448:2022 把远程用户的操作或协助、以及能影响车辆决策的后台通信也纳入范围，所以要把远程协助台拉进 SOTIF 分析，入门团队几乎总是漏掉；③ 写下「我们选的是哪条验收论证路线、分母是什么」，不同路线得到的「安全」不可互相换算；④ 保留一份反例台账，记录哪些看起来像 SOTIF 的问题其实是功能安全失效、哪些反过来。evidence: [T03-S001, T03-S004]

### 4.4 数据采集与合规处理 (Decay risk: high)

从采集方案走到脱敏、境内存储与出境路径选择。资深路径——**跳过**：不再每个项目重新做资质判定，用一张「数据种类 × 处理环节 × 合规主体」责任矩阵做底稿，新项目只补差异行；**优化**：把合规约束编译进数据管线——地理围栏、精度降级、脱敏、境内路由都做成管线里的强制算子，工程师无法绕过，而不是靠一份规范文档约束人；**额外**：① 分开处理「地图数据」与「感知训练数据」两条链路，前者受测绘管理约束、后者主要受数据安全与个人信息保护约束，混成一条会让整条链路被最严的规则卡死；② 跟踪跨境规则的松紧周期，2024-03-22《促进和规范数据跨境流动规定》放宽条件并收窄安全评估范围；《汽车数据出境安全指引（2026版）》由八部门 2026-02-03 印发、已生效，细化重要数据判定并列出九类免于申报情形；③ 在数据合同里写清删除与追溯义务；④ 为地方审图流程单独排期（例如北京市规自委 2024-10 就高精度地图审图发过专门通知，属地域限定的明文要求）。evidence: [T03-S014, T03-S015, T03-S033, T03-S039]

### 4.5 标注与数据集构建 (Decay risk: high)

从标注规范走到质检与版本发布。资深路径——**跳过**：对训练集不再追求逐帧人工审核，训练集容忍一定噪声，把人力全部压到评测集与困难样本上——这是入门团队最想不到的资源分配；**优化**：把标注做成人在环路的循环，模型预标注 → 只把模型不确定或前后帧不一致的样本推给人 → 人的修正回流训练标注模型（有供应商自报称这类平台能把每小时数据的人工工时从数千人时量级降到数百人时量级，属单家做法与供应商自报口径，分母是其自有平台的特定任务，不是行业统计）；**额外**：① 为每个新感知任务先造 200–1000 帧的金标准小集，用它验收标注供应商与自动标注管线，而不是先铺量；② 标注规范的每一次修订都触发历史数据的一致性检查，否则数据集里同时存在两套语义，模型学到的是规范变更史；③ 维护一份「标不了」清单，这批样本是模型评测里最有信息量的部分，也是 SOTIF 未知区的入口；④ 区分「感知标注」与「行为意图标注」的质检方式，前者可几何校验、后者只能靠多人投票与规则手册，用同一套流程会得到虚高的一致性。evidence: [T03-S021, T03-S065, T03-S001]

### 4.6 感知模型训练与评测 (Decay risk: high)

从数据配比走到指标报告。资深路径——**跳过**：不再刷公开榜单排名，公开数据集的分布与自家 ODD 差距很大、名次对量产没有预测力，只用公开集做管线正确性验证；**优化**：把评测从「一次跑分」改成回归门禁，每次训练自动跑分层评测并与上一版对比，关键桶退化超阈值就阻断合入；**额外**：① 先算车端预算再选架构，而不是先训一个好模型再想办法塞进去；② 维护一个「不许退化」的钉子样本集（历史上出过问题的真实片段），它比任何总体指标都更能防旧病复发；③ 区分「感知指标提升」与「系统行为改善」，检测精度涨了但规划抖动更严重是常见结果，所以感知验收里一定挂一项下游闭环指标；④ 警惕评测集污染，长尾挖来的样本若同时进训练与评测，指标会自我实现。evidence: [T03-S055, T03-S025, T03-S048]

### 4.7 预测与规划模块开发与规则兜底层设计 (Decay risk: high)

从行为决策走到轨迹优化与控制。资深路径——**跳过**：不再追求「一套规划器打天下」，按场景族拆策略（城区无保护左转 / 高速汇入 / 拥堵跟车 / 泊车），各自有独立验收集；**优化**：把安全约束表达成规划器的可行域，让学习型模块在安全包络内自由发挥，而不是事后否决——事后否决会导致频繁的策略跳变与体感抖动；**额外**：① 给兜底层单独做一份验证，并明确兜底层自己不能依赖学习型感知的高层输出，否则一次感知失效能同时打穿两层；② 把「其他道路使用者最坏能坏到什么程度」这类假设显式写下来并归档（IEEE 2846-2022 是该方向的标准化产物，但它明确排除感知与预测误差、不保证整系统安全，不能拿来当整体安全背书）；③ 维护一份行为回归集，收录历史上被投诉或被安全员接管的具体片段，每次发版必跑；④ 开环预测指标涨点与闭环行为改善经常不相关，所以验收门禁挂在闭环指标上。evidence: [T03-S060, T03-S066, T03-S025]

### 4.8 闭环仿真与场景回归 (Decay risk: medium)

从场景库建立走到夜间跑批与门禁。资深路径——**跳过**：不再追求「场景数量」这个指标，百万级场景库如果都是同一个逻辑场景的稠密采样则信息量极低，看的是逻辑场景数与参数空间覆盖；**优化**：把真实路测数据自动重建为可交互仿真场景（日志重放 → 场景抽取 → 参数化），让场景库随车队里程自动生长而不是靠人写；**额外**：① 区分「回归」与「进步」两类测试集，前者防旧病复发、后者衡量新能力，通过标准与更新节奏完全不同；② 为仿真本身做保真度验证（同一段真实数据在仿真里重放、比对系统输出差异），否则整个仿真结论建在未经验证的传感器模型上；③ 把仿真结果的适用边界写进报告——仿真里程不是安全证据，加州脱离报告口径明确排除仿真测试，这个差别在跟监管沟通时是硬约束；④ 把场景库与 SOTIF 四象限台账用同一套 ID 打通。evidence: [T03-S053, T03-S055, T03-S009]

### 4.9 实车路测与影子模式验证 (Decay risk: medium)

从测试计划走到接管日志与复盘。资深路径——**跳过**：不再用「累计里程」当汇报指标，里程的边际信息量随熟悉路段快速衰减，改为汇报新增有效场景数与关键接管率；**优化**：把路测线路按 ODD 属性缺口自动排程，哪个属性组合暴露不足就派车去跑那里，而不是固定线路；**额外**：① 把影子模式的触发器当一等工程对象来设计与迭代，太松则回传洪水、太紧则漏掉真问题，触发器本身需要版本管理与效果评估；② 同时记录「系统本可以做得更好但没接管」的片段，入门团队只记接管；③ 在合同与流程上明确路测数据的合规链路，路测车是测绘与数据合规风险最集中的载体；④ 主动做去偏，安全员知道自己在被评估时接管行为会变化，所以用盲测批次或交叉换人来校正。evidence: [T03-S021, T03-S014]

### 4.10 长尾问题挖掘与数据闭环 (Decay risk: high)

从问题发现走到复现、修复与回归。资深路径——**跳过**：不再逐条人工归因，先做聚类，只对每一簇的代表样本人工归因，然后整簇走同一条修复路径；**优化**：把「挖掘同类样本」做成可自助的检索服务，让算法工程师自己捞数据而不是排队等数据团队；**额外**：① 区分「长尾」与「系统性缺陷」——真长尾是低频且分散的，系统性缺陷是低频但同源的（例如某类施工围挡的语义没建模），把系统性缺陷当长尾去堆数据是最常见的资源浪费；② 给每个长尾簇估计发生频率与后果严重度，用它排优先级而不是按报上来的顺序修；③ 维护「已知不修」清单并写明理由与替代缓解措施，这份清单在安全案例与事故调查里都是必需件；④ 盯修复引入的新问题率。evidence: [T03-S019, T04-S084]

### 4.11 版本发布与整车 OTA (Decay risk: high)

从发版评审走到备案与推送。资深路径——**跳过**：不再为每个小版本重跑**全量合规流程**——把版本按「是否触碰已备案的技术参数」预先分箱，绝大多数走简易通道，只有少数进许可通道（注意这条省的是合规流程，不是回归测试）；**优化**：把合规判定前置到需求评审，在功能立项时就判断「这个需求会不会把版本推进许可备案通道」，让产品经理在设计阶段就看到审批代价；**额外**：① 维护一份「已备案技术参数」对照表，工程改动一旦触碰表中任何一项自动触发合规评审，而不是等发版前才发现；② 为欧盟市场单独准备 R155/R156 的体系证据链（网络安全与软件更新管理体系是企业级体系证书，是车型认证的前置，不是车型证书）；③ 把回滚也当作一次需要合规判定的升级来设计，因为回滚同样改变了在用车辆的软件状态；④ 区分「宣传口径」与「备案口径」——工信部联通装〔2025〕45 号（2025-02-25 发布，已生效）要求规范营销宣传行为，但本轮未从原文核到明确的禁用词汇清单，任何「已明令禁止使用某词」的说法须回原文逐条核对。evidence: [T03-S013, T03-S040, T03-S041]

### 4.12 事故与接管的复盘调查 (Decay risk: high)

从事件冻结走到证据包与报送。资深路径——**跳过**：不对每一次接管都做完整调查，按严重度与新颖度分级，只有高严重度或首次出现的机理才进完整流程，其余走批量归因；**优化**：把证据保全做成自动触发，满足预设条件立即冻结数据并生成证据包，而不是等有人想起来去捞；**额外**：① 同时准备两份材料——给监管的按法定字段填、不外推，内部的可以写假设与待验证项，混着写会让内部推测被当成官方结论；② 读 NTSB 的公开调查报告当教材，它是这行公开材料里失效剖面最深的一类；③ 在复盘结论里明确写「本次事件证伪了安全案例中的哪一条子论证」，让复盘直接驱动安全案例更新；④ 准备监管突然索取信息的应答能力，NHTSA 2026-07-08 直接向自动驾驶系统开发者发信要求月底前书面说明应急现场整改方案，这类索取时限极短。evidence: [T03-S007, T03-S050, T03-S067]

### 4.13 量产准入与型式认证材料准备 (Decay risk: high)

从法规适用矩阵走到申报材料。资深路径——**跳过**：不为申报单独造材料，让日常工程交付物天然就是申报件的格式（ODD 规格、场景库报告、验证矩阵直接可引用），只做汇编不做重写；**优化**：按最严市场设计、按各市场裁剪，而不是每个市场独立做一遍，同时保留一张「哪条证据用于哪个市场的哪条要求」的追溯矩阵；**额外**：① 为「已发布未生效」的标准提前排期，GB 47955—2026 拟 2027-01-01 实施，2026 年的车型开发必须按它设计，但对外沟通必须说清它当时还没生效；② 盯配套试验方法标准与过渡期细则，主标准发布到实施之间通常还会出配套文件；③ 明确「入选试点 ≠ 获批量产上市」，对内对外材料都不混用；④ 把 Euro NCAP 与 C-NCAP 这类自愿评测与准入门槛严格分开——星级是市场语言不是合规语言，但它会反向决定硬件选型。evidence: [T03-S012, T03-S016, T03-S046]

### 4.14 示范运营与远程协助值守 (Decay risk: medium)

从值守 SOP 走到事件响应与运营看板。资深路径——**跳过**：不再给每次请求都派人工判断，高频且低风险的请求类型走标准化处置模板，人只处理模板外的；**优化**：把协助请求的成因回流工程，用「哪类请求最多」倒推下一个要修的能力缺口，而不是靠加坐席扩产能；**额外**：① 严格追踪「车辆:远程人员」比例并把它当扩张的核心经济指标——可引用的数据点有报道称 Waymo 在全球任一时刻约 70 名远程协助人员支持约 3,000 辆车（约 1:43），WeRide 披露其远程协助人车比从 2024 年的约 1:10 提升到约 1:40；这两个数字来自不同主体、不同统计口径与不同时点，分母是否含调度、路边救援、夜班轮换不明，**不可直接相加或排名**，且多数公司拒绝披露远程协助频次，行业横向比较目前没有可比口径；② 把「远程协助」与「路边救援」当两支队伍管，一个是软件问题一个是物理问题，混在一起会让人力模型失真；③ 为通信中断设计明确的车端独立处置，不假设远程台永远在线；④ 对外表述极其克制地使用「远程」二字，一句「远程接管了一下」可以把远程协助描述成远程驾驶，直接改变监管定性。evidence: [T03-S031, T03-S032]

### 4.15 安全案例的持续维护 (Decay risk: medium)

从论证结构走到证据挂接。资深路径——**跳过**：不再为安全案例单独收集证据，每一条证据槽位都绑定到某个工程流程的常规产出，工程做完证据自动到位；**优化**：把安全案例做成可查询的结构化数据（例如 GSN 图）而不是文档，让「这次变更影响哪些子主张」是一次图遍历而不是一次全文搜索；**额外**：① 主动写下反论证与已知弱点，只有支持性证据的安全案例在专业评审里会被直接质疑；② 明确论证的分母与基准，如果主张里含「比人类驾驶更安全」，必须说清人类基准取自哪个数据源、哪类道路、哪个严重度门槛、多少里程；③ 为每一个新城市或新平台单独做就绪判定，而不是拿一份全局安全案例通吃；④ 把安全案例与事故复盘双向绑定——事故要能指出证伪了哪条子主张，子主张要能指出靠哪些运营数据持续验证。evidence: [T03-S020, T03-S026, T03-S030]

### 4.16 岗位与法域差异（读工作流前必须知道的两件事）

- **岗位**：学校里练的「训模型、刷指标」在量产团队里只占 4.5 到 4.7 三张卡片，其余大半工作量在 4.1–4.4 与 4.8–4.15。功能安全与合规工程师看起来在「写文档」，实际是在决定产品能不能卖、能不能升级、出事时公司拿什么说话。evidence: [T03-S052, T03-S001]
- **法域**：中国的工作流多出测绘资质、数据出境审查、OTA 事前备案与准入许可三段；欧美多出强制事故上报的公开数据集与软件召回两段。跨境项目最容易漏排这五段。evidence: [T03-S014, T03-S040, T03-S008]

---



<!-- SLOW_UPDATE_START -->

## 表达 DNA

### 5.1 高频用语（内行日常口语，外行零命中）

ODD 与 ODC、DDT fallback、MRC 最小风险状态、脱离与接管、长尾与 corner case、影子模式、BEV、Occupancy、SOTIF、幽灵刹车、开环与闭环、分母、口径、兜底层、跑批、门禁、回灌、量产口径、准入、备案、公告。
evidence: [T06-S020, T06-S026, T06-S001]

### 5.2 register 差别

- **严肃讨论**：句子里带限定语，且限定语在句子前半部分而不是补在末尾。典型句式是「在什么 ODD 下、按谁的口径、哪一年」；数字后面几乎总跟着一个来源。
- **私下吐槽**：短句 + 直接判断 + 黑话密度陡增，且吐槽对象通常是口径而不是人——「这个数分母都说不清」比「他们做得不行」更常见。
- **对外沟通**：对外说话时按「行业拒绝的厂商话术」自查——不把 L2 领航叫自动驾驶、不说「零接管」「全场景无图」这类无 ODD 限定的绝对化表述、不自称「ASIL-D 认证的公司」、不说「通过了 SOTIF 认证」、不拿累计仿真里程当安全证据、不把「入选试点」说成「获批量产落地」。**替换说法各家不同，本 skill 不给定式**；反过来做的人立刻暴露。
evidence: [T06-S007, T06-S020, T01-S003]

### 5.3 内 ⇄ 外沟通的差异

对内说「我们这条路线的弱点是什么」，对外说「我们的 ODD 边界是什么」；同一件事的两种说法都成立，但把对外那套拿到工程评审上讲，会被认为没做过论证。这也是 §1.7 那条镜片在语言层的投影。
evidence: [T03-S026, T01-S003]

### 5.A 对话样本库

> 每段都带 source_id 与「原话 / 转述 / 推断」标记，可回溯到 `references/research/01-figures.md` 与 `06-glossary.md`。凡未核到逐字原文的一律标转述，不升格。

#### 5.A.1 对外解释版（面向非从业者、媒体、公众）

- 「用小心的驾驶行为开场，不要用晦涩的统计。」(source: T01-S003, 原话, 场合: Koopman 2026-08-16 专栏回应播客主持人关于行业该怎么讲安全故事的提问)
- 「有些任务存在非常大的 demo 到产品的鸿沟——demo 很容易，产品很难。自动驾驶尤其如此，因为失败的代价太高。」(source: T01-S019, 原话, 场合: Karpathy 在 Dwarkesh 长播客里回答为什么 AI demo 到产品这么难)

#### 5.A.2 同业版（私下、内部评审、同行对谈）

- 「这是一场九的行军。每一个九都是同样的工作量。当你的 demo 有 90% 的时候能用，那只是第一个九。」(source: T01-S019, 原话, 场合: 同上访谈, 注意: 这句在 2026 年已被广泛二次引用为 AI 可靠性缺口的通用比喻、脱离了自动驾驶语境, 引用时要标回它原本讲的是自动驾驶)
- 「数据当然通常很重要，但不只是数里程或数小时。它必须是正确的那种数据，能教会模型在你在意的罕见情况上表现好。」(source: T01-S045, 原话, 场合: Dolgov 在 a16z 访谈被问自动驾驶里有没有规模化定律时)
- 「自动驾驶不是传感器问题，是 AI 问题，摄像头里的信息已经够了。」(source: T01-S047, 转述, 场合: Elluswamy 在 ScaledML 2026 论证为什么不上激光雷达；本轮溯源到第三方对该演讲的剪辑转写, 未回听全片)

#### 5.A.3 监管与专业版（谈标准、学术场合、监管解读）

- 「简单化的『比人类驾驶员更安全』式正向风险平衡，必须叠加关于风险转移、过失驾驶行为、标准符合性、不存在细粒度不合理风险、伦理与公平性的额外考量。」(source: T01-S002, 原话, 场合: Koopman 的 ASSC 2024 keynote 主张陈述部分, 2024-11-02)
- 「现有的标准框架与相应定义很可能不足以保障安全，因为其中的隐含假设在人类驾驶员被移除后就不成立了。」(source: T01-S002, 原话, 场合: 同一 keynote)
- 「真实系统里的缓慢 scaling 不是 bug，它往往是问题结构本身的特征。」(source: T01-S012, 原话, 场合: Shalev-Shwartz 与 Shashua 2026-05-27 署名文章, 论证真实系统为何比经典学习理论预测的收敛得慢)
- 「重尾数据加上固有的歧义，造成了根本性的信息论限制，简单的规模化克服不了。」(source: T01-S012, 原话, 场合: 同一篇署名文章)
- 「我们建的是一个专注的、非常好的人类司机的模型——不分心的那种……我们拿自己跟这个模型比，并且要求自己在这个很高的标准下表现良好。」(source: T01-S045, 原话, 场合: Dolgov 在 a16z 访谈被问 Waymo 怎么证明自己准备好了时)
- 「把远程操作员放在海外，从延迟和治理的角度都不可接受。」(source: T01-S016, 转述, 场合: Cummings 在媒体报道中讨论远程操作模式；逐字英文原文未回溯到她本人的书面或录音出处)

#### 5.A.4 反例版（这一行的资深人绝不会这样说的话）

- 「我们这台车是 L2 自动驾驶。」(source: T06-S007, 转述, why 反例: 两处同时错——L2 属驾驶辅助不属自动驾驶, 且分级是给特性分级不是给车分级)
- 「我们是行业首个 ASIL-D 认证的公司。」(source: T06-S033, 转述, why 反例: ASIL 是危害事件与安全需求的属性, 不是公司或整车的标签, 一句话暴露没做过功能安全项目)
- 「我们仿真跑了 100 亿公里，非常安全。」(source: T06-S026, 转述, why 反例: 仿真里程不是安全证据, 加州脱离报告制度明确排除仿真测试)
- 「我们已经通过了 SOTIF 认证，做到全场景零接管无图。」(source: T06-S001, 转述, why 反例: ISO 21448 是过程与方法标准不发证; 且零接管与全场景是无 ODD 限定的绝对化表述)

**voice_confidence: high**——15 段样本，9 段标原话（60%），其余诚实标转述。中国量产侧四位人物没有可核到出处与场合的逐字原话，因此本样本库的语气**偏英文一手材料**，见 §8 诚实边界第 4 条。

---

<!-- SLOW_UPDATE_END -->



## 质量基准 + 反模式

### 6.1 什么算「好」（5 条可验证基准）

1. **一份能被信任的能力宣称**：写清 ODD 的 include 与 exclude、越界时的最小风险状态、以及该宣称在什么口径下成立。三样缺一样就只是宣传。evidence: [T06-S024, T04-S006]
2. **一次可信的评测**：说明是开环还是闭环、背景交通用什么模型、路线长度与场景分布、以及评测集是否参与过训练。evidence: [T04-S016, T02-S077]
3. **一份站得住的安全论证**：能说出自己走的是四条证明路径中的哪一条、这条路径公开的弱点是什么、以及证据之间怎么互相寻址；并且带着反论证一起交。evidence: [T04-S009, T03-S026]
4. **一次合格的场景复现**：任何一次接管或异常都能回放成参数化、可重复、可入库的场景，而不是一段只能人工观看的视频。evidence: [T03-S055, T02-S054]
5. **一次干净的法规引用**：编号、版本、发布日期、实施日期、适用范围、当前状态六要素齐全。evidence: [T06-S007, T06-S018]

### 6.2 反模式（10 条）

1. 把 L2 说成自动驾驶——中国强制性国标的口径直接反对这种表述。evidence: [T06-S007]
2. 用不同口径的脱离率做横向比较。evidence: [T06-S026]
3. 把仿真里程或仿真通过率当安全证据。evidence: [T06-S026, T02-S042]
4. 在训练集或评测集上刷分后把名次当能力。evidence: [T04-S037]
5. 脱离 ODD 谈能力，或把 ODD 窄化成天气开关。evidence: [T06-S024]
6. 只测成功路径，不测失效响应与越界行为。evidence: [T03-S004]
7. 把「入选试点」包装成「获批量产落地」。evidence: [T06-S010]
8. 说「通过了 SOTIF 认证」或「本公司是 ASIL-D」——两者都不是可被授予的资质。evidence: [T06-S001, T06-S033]
9. 把 RSS 说成国际安全标准——它是厂商提出的模型，被标准化的是其上游假设框架 IEEE 2846-2022，且该标准明确排除感知与预测误差。evidence: [T06-S016, T06-S022]
10. 引用 UN R157 的 130 km/h 时丢掉限定语——它是上限、仅限具备变道能力的 ALKS 才可超 60 km/h、限乘用车与轻型商用车与高速类道路、且只对选择适用该修订的缔约方生效，四个限定语丢一个就是错的。evidence: [T06-S018, T06-S019]

---



<!-- SLOW_UPDATE_START -->

## 智识谱系

> 这一行的分歧不是「谁的模型更好」，而是六个学科传统对「什么算证明了安全」给出的答案不同。理解这一点比记住任何一篇论文都重要。

| 流派 | 奠基文本 | 当前代表 | 核心主张 | 与谁分歧 |
|---|---|---|---|---|
| 1 机器人学与运动规划 | Probabilistic Robotics 2005、Planning Algorithms 2006、Boss 2008 | Apollo 与 Autoware 社区；Chris Urmson | 世界是不确定的，抽象应是概率分布；分层与显式接口才能分别验证 | 与深度学习派：规则式是否已过时 |
| 2 计算机视觉与深度学习 | ALVINN 1988、KITTI 2012、PilotNet 2016 | Andreas Geiger、李弘扬、Alex Kendall、Ashok Elluswamy | 手写规则覆盖不了真实复杂度，表示应被学出来，规模化是主要杠杆 | 与功能安全派：学出来的行为能否写成可验证需求 |
| 3 汽车功能安全与系统工程 | ISO 26262、Winner 手册、Maurer 论文集 | Philip Koopman、Missy Cummings；ISO 21448 与 34502 工作组 | 安全是过程属性不是模型指标；没有可追溯的需求-设计-验证链条，性能数字不构成证据 | 与深度学习派、与形式化派 |
| 4 形式化方法与责任敏感安全 | RSS 2017 | Amnon Shashua、Shai Shalev-Shwartz | 用可解释的数学规则划定无责边界，白盒规则可被监管审查 | 与运营派：要证明还是要统计 |
| 5 Robotaxi 运营 | DARPA 一代人到 Waymo | Dmitri Dolgov；Raquel Urtasun 是内部反对派；Brad Templeton 是外部审计视角 | 安全最终靠真实运营里程与对照人类基准的碰撞率来证明 | 与形式化派；内部还反对把脱离率当进展指标 |
| 6 中国量产智驾实践 | Apollo 开源栈；BEVFormer / VAD / MapTR / UniAD 一批中国团队论文 | 余凯（供应商侧）、楼天城与韩旭（运营侧）、任少卿（车企算法侧） | 先在 L2 大规模量产、用车队数据做闭环，再向 L3 试点推进；监管以强制标准加试点联合体为抓手 | 与欧美：事前强标 vs 事后报告 |

**六派之间还在吵的三件事**

1. **端到端 ⇄ 模块化**：端到端能否做出可被验证的安全论证。谱系 2 说规模化会解决，谱系 3 说归纳式学习写不出需求。UniAD 给出的第三条路尚未在闭环与真实道路上被独立验证。evidence: [T04-S004, T04-S053, T04-S038]
2. **纯视觉 ⇄ 多传感器**：Mobileye 主张两套各自完整、独立开发的子系统互为备份，而不是融合互补；BEVFormer 一支的实证是纯相机在特定基准的三维检测上可逼近激光方案——但「在某基准的检测指标上逼近」不等于「在长尾安全场景上等价」，两侧都没有公开的可比长尾证据。evidence: [T04-S085, T04-S020]
3. **怎么才算证明了安全**：形式化规则、结构化安全案例、运营里程统计、场景库覆盖，四种答案互不覆盖，工程上叠加使用，理论上没有统一。evidence: [T04-S015, T04-S009, T04-S048, T04-S082]

**注意一个容易被压平的地方**：怀疑侧的三个人立场不同，不要压成「一群唱衰的」。Koopman 是安全工程师、Cummings 是人因与监管、Templeton 是归责口径的外部审计——三种不同的反对理由。evidence: [T01-S002, T01-S016, T01-S070]

---

<!-- SLOW_UPDATE_END -->



## 诚实边界

1. **信息截止 2026-09-06**。工具与基准层（§3）与工作流层（§4）衰减最快，建议每 3 个月刷新；心智模型层（§1）与智识谱系（§7）的变动周期以年计。本行 12 个月内法规变动率极高，引用任何一条法规前必须回原始发布机构页面确认版本与状态。evidence: [T06-S007, T03-S012]
2. **本文件中所有耗时与人力数字都是量级推断**。Track 03 没有找到任何带样本量与统计方法的公开行业工时统计，这些数字不可作为报价或排期依据。evidence: [T03-S026]
3. **§4 的「资深路径」由标准要求、公开工程实践与岗位职责链条反推得到，未经从业者访谈验证**。它们是合理推断，不是观察记录，这是本轮最大的方法学局限。evidence: [T03-S052]
4. **中国量产智驾一线人物的思维方式，本轮是从制度与上市披露反推的，不是从他们公开发声中直接听到的**。余凯、楼天城、韩旭、任少卿四位都没有 30 分钟以上的公开一手长材料，卡片建立在港股与美股披露、企业官网、第三方专访之上。但不要过度概括成「中国侧没有一手技术文献」——反例是 DriveVLM 与 Bench2Drive 这类中国团队论文，缺的是人物长材料而不是团队论文。evidence: [T01-S050, T01-S094]
5. **公开 canon 强烈偏向学术界与欧美监管**。谱系 6 有清晰的制度证据（三份标准与通知）但缺乏可引用的技术 canon，中文教材与中文高校课程本轮完全未覆盖。evidence: [T04-S051, T04-S014]
6. **数据闭环是本行开源覆盖最差的一环**：采集触发、影子模式回传、难例挖掘、数据版本管理、云端训练评测流水线，头部公司均为自建闭源，本轮只能给到方法学层面而给不出「用哪个工具」的答案。这是信源结构性缺口，不是调研不足。evidence: [T02-S047]
7. **商业仿真器与商业验证平台的能力无法独立核实**，全部描述来自厂商自有材料，本轮未找到独立第三方评测。evidence: [T02-S057, T02-S059]
8. **中美事故数据结构性不可比**：美国有 NHTSA 强制事故报告的公开数据集与加州脱离报告，中国没有全国统一的公开等价物。任何中美安全对比在分母处就已失效，不是在结论处。evidence: [T03-S008, T06-S026]
9. **仍未核实、下游不得断言的条目**：GB 47955—2026 的正式标准文本（本文所有内容基于发布公告与编制说明，适用车型、阈值、过渡期条款须以正式文本为准）；UL 4600 的各修订版次年份；ISO 34505 的出版状态；ISO 26262 第三版进展；C-NCAP 现行协议版本；UN R79 现行系列修订号；中国准入试点 2024-06 之后的扩容批次。evidence: [T06-S007, T04-S009]
10. **本 skill 是工程与合规判断的思维顾问**，不替代具体车型的标定与验证工作、不替代功能安全评估机构与认证机构的裁定、不替代法务对当地法规的解释，也不能用于指导任何真实道路上的驾驶行为。

---




## Time-decay Registry

This skill's modules decay at different speeds. Re-run `update 大师 {slug}`
when the dates below cross the recommended cadence listed in this table.

| Module | last_updated | decay_risk | Recommended refresh cadence |
|--------|-------------|-----------|---------------------------|
| Mental models | last_updated: 2026-09-06 | decay_risk: low | 1-2 years |
| Standard playbook | last_updated: 2026-09-06 | decay_risk: low | 6-12 months |
| Tool stack | last_updated: 2026-09-06 | decay_risk: high | 3-6 months |
| Workflows / pipeline | last_updated: 2026-09-06 | decay_risk: high | 3-6 months |
| Expression DNA | last_updated: 2026-09-06 | decay_risk: low | 6-12 months |
| Sources (Track 5) | last_updated: 2026-09-06 | decay_risk: medium | 6 months |
| Glossary / standards / regulations | last_updated: 2026-09-06 | decay_risk: medium | 6 months (regulations may force sooner) |
| Intellectual genealogy | last_updated: 2026-09-06 | decay_risk: low | 1-2 years |
| Honest boundaries | last_updated: 2026-09-06 | decay_risk: low | re-assess each refresh |

last_updated values reflect the synthesis date. Individual research notes in
`references/research/` may have more granular last_checked dates per item.
