ML平台全链路

3 阅读31分钟

ML 平台全链路

🏠 返回 README | 横切治理:06-Staff扩展 | 数据管道:08-数据管道

用法:按 45 min 时间盒 自练;覆盖 数据 → Feature Store → 训练 → Registry → Serving → 实验 → 治理 七段。每段含 Mermaid、容量口算、大厂口述题、STAR-M-P


0. 45min 时间盒与冲刺 Checklist

gantt
    title ML 平台 System Design 45 min
    dateFormat mm:ss
    axisFormat %M:%S
    section 阶段
    需求澄清与 NFR           :a1, 00:00, 5m
    容量估算与 SLO           :a2, after a1, 5m
    七段架构总图             :a3, after a2, 8m
    深入 FS + 训练 + Serving :a4, after a3, 12m
    MLOps/实验/治理          :a5, after a4, 10m
    风险降级与观测           :a6, after a5, 5m

Staff 开场句(背)

「这是 工业 ML 平台 题,我会先澄清 用例(推荐/风控/LLM)、SLA、合规;然后画 数据→FS→训练→Registry→Serving→实验→治理 七段与 Source of Truth;再深入 PIT 防泄露、训练–Serving skew、CT Gate、FinOps chargeback。」

0.1 考前 30 项 Checklist

  • P01 能 30s 讲清七段各自最大风险点
  • P02 能画离线/在线特征同构或物化路径
  • P03 PIT join / ASOF 防泄露口述 2 例
  • P04 Training–Serving skew 三种一致性策略
  • P05 DDP vs FSDP/ZeRO-3 各一句
  • P06 Registry promote Gate:相对基线 + 护栏
  • P07 Canary/Shadow 与特征 schema 兼容
  • P08 SRM + CUPED 前提各一句
  • P09 有效 $/GPU-hour vs 名义账单
  • P10 Chargeback 三维度:team/model/data
  • P11 Lineage 四元组可复述
  • P12 GDPR 删除 → 再训练/unlearn 链路
  • P13 §7 STAR-M-P 能 90s 口述
  • P14 §8 大厂题任选 3 题 ≤90s

1. 需求澄清与范围切割

段标识 data · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q1.1 · 若 需求澄清与范围切割 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q1.2 · 若 需求澄清与范围切割 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q1.3 · 若 需求澄清与范围切割 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

2. 容量估算与 SLO 账本

段标识 capacity · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q2.1 · 若 容量估算与 SLO 账本 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、capacity 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q2.2 · 若 容量估算与 SLO 账本 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、capacity 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q2.3 · 若 容量估算与 SLO 账本 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、capacity 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

3. 数据层 · 湖仓与训练数据集

段标识 data · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q3.1 · 若 数据层 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q3.2 · 若 数据层 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q3.3 · 若 数据层 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

4. Feature Store · 离线/在线一致性

段标识 fs · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q4.1 · 若 Feature Store 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、fs 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q4.2 · 若 Feature Store 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、fs 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q4.3 · 若 Feature Store 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、fs 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

5. 训练平台 · 分布式与 GPU 调度

段标识 train · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q5.1 · 若 训练平台 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、train 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q5.2 · 若 训练平台 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、train 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q5.3 · 若 训练平台 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、train 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

6. Model Registry · 制品与审批

段标识 registry · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q6.1 · 若 Model Registry 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、registry 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q6.2 · 若 Model Registry 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、registry 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q6.3 · 若 Model Registry 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、registry 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

7. Serving · 在线推理与发布

段标识 serve · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q7.1 · 若 Serving 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、serve 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q7.2 · 若 Serving 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、serve 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q7.3 · 若 Serving 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、serve 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

8. 实验平台 · AB 与归因

段标识 exp · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q8.1 · 若 实验平台 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、exp 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q8.2 · 若 实验平台 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、exp 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q8.3 · 若 实验平台 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、exp 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

9. 治理横切 · FinOps/安全/Responsible AI

段标识 govern · Staff 需给出 组件边界 + SoT + 失败模式

需求澄清表(5 min 模板)

问题推荐假设(写下来)
业务用例?推荐排序 + 风控 + 1 个 LLM 辅助场景
日活/请求?1 亿 DAU;峰值推理 8 万 QPS
特征规模?5000 维稀疏 + 200 实时;P99 特征 < 30ms
模型刷新?排序日更;风控周更;LLM prompt 周更、权重季更
合规?PII 最小化;模型卡;公平性 Gate
flowchart LR
  D[数据湖] --> FS[Feature Store]
  FS --> TR[训练]
  TR --> REG[Registry]
  REG --> SV[Serving]
  SV --> EXP[实验]
  EXP --> GOV[治理]

容量口算片段

# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)

关键设计决策

决策点选项 A选项 BStaff 推荐
特征一致性双写 Flink+离线在线物化物化 + PIT
训练调度SlurmK8s Volcano云原生 Kueue
发布Blue-greenCanary+Shadow风控 Canary
实验单元请求级用户级用户级 + 网络效应说明

失败模式与降级

  • 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
  • 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
  • Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
  • 实验污染:SRM 检测 → 自动停实验

口述题(本段)

Q9.1 · 若 治理横切 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、govern 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q9.2 · 若 治理横切 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、govern 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

Q9.3 · 若 治理横切 延迟翻倍,你先看哪三个指标?

:trace 分段 latency、队列深度、govern 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。

10. STAR-M-P · 训练–Serving Skew 导致 CTR 跌 12%

Situation:推荐主模型日更;上线 6 小时后 CTR -12%,收入 -8%。 Task:24h 内定位并回滚,不扩大资损。 Action

  1. Shadow 对比发现 实时点击特征 在线用 1h 窗口、离线训练用 24h 窗口;
  2. Lineage 查到 feature_view click_24h 未同步到在线 Redis 物化;
  3. 回滚 Registry v{n-1};修复 FS 物化 job;补 PIT 回归集。 Result:2h 回滚;CTR 恢复;新增 skew 日抽检 Gate。 Metrics:MTTR 2h;影响请求 ~4%;修复后 7 天无复发。 Prevention:CI 中 离线/在线特征哈希对账;promote 前 Shadow 24h。

11. STAR-M-P · GPU 账单暴涨未增实验产出

Situation:FinOps 报 ML 账单 +45% QoQ,实验上线数 flat。 Task:降本 25% 不伤训练 SLA。 Action:有效 $/GPU-hour dashboard;top3 为 Notebook 占卡、低 MFU 大 job、推理无 autoscale。 Result:Spot+checkpoint、idle notebook 4h 回收、推理 HPA;账单 -28%。 Metrics:MFU 18%→31%;排队 P95 不变。 Prevention:Chargeback 月报 + 配额硬顶。

12. 大厂口述题库(精选 20)

O01 · 为何需要 Feature Store?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:复用、一致性、PIT、治理。

O02 · 十亿用户在线特征怎么存?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:分片 Redis/KeyDB + 域分组 + 热点。

O03 · 70B 训练怎么排并行?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:3D 并行口算 + checkpoint。

O04 · CT 和 CI 差异?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:数据/模型漂移触发 + 相对 Gate。

O05 · p=0.06 怎么决策?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:先验、功效、业务损失函数。

O06 · Responsible AI 三阶段?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:Pre/In/Post + Model Card。

O07 · Build vs Buy FS?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:团队规模×差异化×TCO。

O08 · LLM 与经典 ML 平台边界?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:Serving 链到 llm-agent/07。

O09 · GDPR 删除如何落到模型?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:Catalog→purge→unlearn 验证。

O10 · 多租户 GPU 公平?

满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:配额+gang+dominant share。

13. 七段 Source of Truth 总表

实体Owner消费者不一致修复
原始事件数据湖 BronzeFS/训练重放分区
特征定义FS Registry训练/Serving版本 pin
训练数据 SnapshotDataOpsRegistrymanifest 哈希
模型 ArtifactRegistryServing不可变 tag
实验分流实验平台全链路SRM 停实验
成本归因FinOps治理chargeback 标签

14. 端到端参考架构(满分白板)

flowchart TB
  subgraph Data
    LAKE[(Lakehouse)]
    GE[Great Expectations]
    SNAP[Dataset Snapshot]
  end
  subgraph FS
    OFF[Offline Store]
    ON[Online Store]
    REG_F[Feature Registry]
  end
  subgraph Train
    SCH[Scheduler Volcano/Kueue]
    JOB[Distributed Training]
    CKPT[Checkpoint S3]
  end
  subgraph MLOps
    REG_M[Model Registry]
    CI[ML CI Gates]
    LINE[Lineage]
  end
  subgraph Serve
    TRITON[Triton/KServe]
    CACHE[Feature+Emb Cache]
  end
  subgraph Exp
    AB[AB Platform]
    CUPED[CUPED/Sequential]
  end
  subgraph Gov
    AUD[Audit]
    FIN[FinOps Chargeback]
    RAI[Responsible AI]
  end
  LAKE --> GE --> SNAP
  SNAP --> OFF
  OFF --> JOB
  ON --> TRITON
  JOB --> CKPT --> REG_M
  REG_M --> TRITON
  TRITON --> AB
  LINE --> AUD
  FIN --> Gov

15.1 深度附录 · PIT join 与泄露场景清单

15.1.1 机制

PIT join 与泄露场景清单 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 PIT join 与泄露场景清单 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.2 深度附录 · FSDP ZeRO-3 通信代价

15.2.1 机制

FSDP ZeRO-3 通信代价 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 FSDP ZeRO-3 通信代价 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.3 深度附录 · 动态批 max_queue_delay

15.3.1 机制

动态批 max_queue_delay 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 动态批 max_queue_delay 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.4 深度附录 · Registry 审批流 YAML

15.4.1 机制

Registry 审批流 YAML 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Registry 审批流 YAML 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.5 深度附录 · PSI 漂移阈值

15.5.1 机制

PSI 漂移阈值 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 PSI 漂移阈值 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.6 深度附录 · CUPED 方差缩减条件

15.6.1 机制

CUPED 方差缩减条件 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 CUPED 方差缩减条件 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.7 深度附录 · Spot checkpoint 周期公式

15.7.1 机制

Spot checkpoint 周期公式 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Spot checkpoint 周期公式 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.8 深度附录 · Model Card 必填字段

15.8.1 机制

Model Card 必填字段 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Model Card 必填字段 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.9 深度附录 · Shadow traffic 资源代价

15.9.1 机制

Shadow traffic 资源代价 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Shadow traffic 资源代价 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.10 深度附录 · Champion-Challenger 离线

15.10.1 机制

Champion-Challenger 离线 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Champion-Challenger 离线 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.11 深度附录 · Feature 域分组策略

15.11.1 机制

Feature 域分组策略 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Feature 域分组策略 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.12 深度附录 · GPU 碎片与 gang

15.12.1 机制

GPU 碎片与 gang 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 GPU 碎片与 gang 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.13 深度附录 · mTLS 推理侧

15.13.1 机制

mTLS 推理侧 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 mTLS 推理侧 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.14 深度附录 · Delta/Iceberg 时间旅行

15.14.1 机制

Delta/Iceberg 时间旅行 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Delta/Iceberg 时间旅行 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.15 深度附录 · LabelOps IAA κ

15.15.1 机制

LabelOps IAA κ 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 LabelOps IAA κ 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.16 深度附录 · Unlearning 验证集

15.16.1 机制

Unlearning 验证集 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Unlearning 验证集 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.17 深度附录 · Network effect 单元随机

15.17.1 机制

Network effect 单元随机 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Network effect 单元随机 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.18 深度附录 · Sequential testing 边界

15.18.1 机制

Sequential testing 边界 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Sequential testing 边界 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.19 深度附录 · Uplift vs Shapley

15.19.1 机制

Uplift vs Shapley 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Uplift vs Shapley 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

15.20 深度附录 · Build vs Buy TCO 口算

15.20.1 机制

Build vs Buy TCO 口算 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。

sequenceDiagram
  participant DS as Data Scientist
  participant PL as ML Platform
  participant PR as Prod
  DS->>PL: 提交训练 job + data_snapshot_id
  PL->>PL: CI Gate: GE + skew sample
  PL->>PR: Canary promote
  PR-->>PL: SLI 异常 → 自动 rollback

15.{idx}.2 大厂追问链

  • 追问 1:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 2:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 3:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 4:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
  • 追问 5:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
    • :指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。

15.{idx}.3 口算练习

假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)

15.{idx}.4 Checklist

  • 能白板画 Build vs Buy TCO 口算 在七段中的触点
  • 能举 1 个失败模式 + 降级
  • 能量化 1 个 SLO 或成本指标

16. 满分答题框架(ML 平台通用)

  1. 澄清:用例、SLA、合规、训练/推理占比
  2. 度量:没有 dashboard 先建 SLI/SLO 与有效 $/GPU-hour
  3. 七段架构图:数据→FS→train→registry→serve→exp→govern
  4. 深入 2 点:通常 FS+PIT、Serving+发布 或 治理+FinOps
  5. 权衡:延迟 vs 一致性、成本 vs 科学严谨
  6. 回滚:Registry 版本、特征兼容、实验停开

17. 与专题文档交叉索引

深入阅读
数据08-数据管道
FS01-特征平台
训练02-模型训练
Serving03-模型Serving
MLOps04-MLOps
实验05-实验平台
治理06-Staff扩展
LLMllm-agent/07

18. 一句话速记

ML 平台 = 七段流水线 + PIT 防泄露 + skew 对账 + Registry Gate + FinOps 有效成本 + 实验可信度 + 治理可审计。

官方文档与源码(一级依据)

See registry · 正文机制应来自下方 官方文档(L1)官方源码仓库(L2); 禁止用教程站/博客充当机制依据。本章 QPS/延迟/STAR 为面试示意。 写作规范:docs/official-sources-registry.md §0

L1 · 官方文档