ML 平台全链路
🏠 返回 README | 横切治理:06-Staff扩展 | 数据管道:08-数据管道
用法:按 45 min 时间盒 自练;覆盖 数据 → Feature Store → 训练 → Registry → Serving → 实验 → 治理 七段。每段含 Mermaid、容量口算、大厂口述题、STAR-M-P。
0. 45min 时间盒与冲刺 Checklist
gantt
title ML 平台 System Design 45 min
dateFormat mm:ss
axisFormat %M:%S
section 阶段
需求澄清与 NFR :a1, 00:00, 5m
容量估算与 SLO :a2, after a1, 5m
七段架构总图 :a3, after a2, 8m
深入 FS + 训练 + Serving :a4, after a3, 12m
MLOps/实验/治理 :a5, after a4, 10m
风险降级与观测 :a6, after a5, 5m
Staff 开场句(背):
「这是 工业 ML 平台 题,我会先澄清 用例(推荐/风控/LLM)、SLA、合规;然后画 数据→FS→训练→Registry→Serving→实验→治理 七段与 Source of Truth;再深入 PIT 防泄露、训练–Serving skew、CT Gate、FinOps chargeback。」
0.1 考前 30 项 Checklist
- P01 能 30s 讲清七段各自最大风险点
- P02 能画离线/在线特征同构或物化路径
- P03 PIT join / ASOF 防泄露口述 2 例
- P04 Training–Serving skew 三种一致性策略
- P05 DDP vs FSDP/ZeRO-3 各一句
- P06 Registry promote Gate:相对基线 + 护栏
- P07 Canary/Shadow 与特征 schema 兼容
- P08 SRM + CUPED 前提各一句
- P09 有效 $/GPU-hour vs 名义账单
- P10 Chargeback 三维度:team/model/data
- P11 Lineage 四元组可复述
- P12 GDPR 删除 → 再训练/unlearn 链路
- P13 §7 STAR-M-P 能 90s 口述
- P14 §8 大厂题任选 3 题 ≤90s
1. 需求澄清与范围切割
段标识
data· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q1.1 · 若 需求澄清与范围切割 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q1.2 · 若 需求澄清与范围切割 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q1.3 · 若 需求澄清与范围切割 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
2. 容量估算与 SLO 账本
段标识
capacity· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q2.1 · 若 容量估算与 SLO 账本 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、capacity 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q2.2 · 若 容量估算与 SLO 账本 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、capacity 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q2.3 · 若 容量估算与 SLO 账本 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、capacity 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
3. 数据层 · 湖仓与训练数据集
段标识
data· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q3.1 · 若 数据层 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q3.2 · 若 数据层 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q3.3 · 若 数据层 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、data 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
4. Feature Store · 离线/在线一致性
段标识
fs· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q4.1 · 若 Feature Store 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、fs 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q4.2 · 若 Feature Store 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、fs 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q4.3 · 若 Feature Store 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、fs 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
5. 训练平台 · 分布式与 GPU 调度
段标识
train· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q5.1 · 若 训练平台 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、train 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q5.2 · 若 训练平台 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、train 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q5.3 · 若 训练平台 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、train 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
6. Model Registry · 制品与审批
段标识
registry· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q6.1 · 若 Model Registry 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、registry 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q6.2 · 若 Model Registry 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、registry 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q6.3 · 若 Model Registry 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、registry 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
7. Serving · 在线推理与发布
段标识
serve· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q7.1 · 若 Serving 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、serve 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q7.2 · 若 Serving 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、serve 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q7.3 · 若 Serving 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、serve 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
8. 实验平台 · AB 与归因
段标识
exp· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q8.1 · 若 实验平台 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、exp 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q8.2 · 若 实验平台 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、exp 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q8.3 · 若 实验平台 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、exp 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
9. 治理横切 · FinOps/安全/Responsible AI
段标识
govern· Staff 需给出 组件边界 + SoT + 失败模式。
需求澄清表(5 min 模板)
| 问题 | 推荐假设(写下来) |
|---|---|
| 业务用例? | 推荐排序 + 风控 + 1 个 LLM 辅助场景 |
| 日活/请求? | 1 亿 DAU;峰值推理 8 万 QPS |
| 特征规模? | 5000 维稀疏 + 200 实时;P99 特征 < 30ms |
| 模型刷新? | 排序日更;风控周更;LLM prompt 周更、权重季更 |
| 合规? | PII 最小化;模型卡;公平性 Gate |
flowchart LR
D[数据湖] --> FS[Feature Store]
FS --> TR[训练]
TR --> REG[Registry]
REG --> SV[Serving]
SV --> EXP[实验]
EXP --> GOV[治理]
容量口算片段
# 推理 GPU 粗算(替换假设)
峰值 QPS = 80,000
单请求 GPU ms = 5ms (batch=32 摊销)
所需 GPU 秒/s = 80k * 0.005 = 400 GPU-s/s
→ 约 400 张 A10 等效(未计副本与 headroom 1.5x)
关键设计决策
| 决策点 | 选项 A | 选项 B | Staff 推荐 |
|---|---|---|---|
| 特征一致性 | 双写 Flink+离线 | 在线物化 | 物化 + PIT |
| 训练调度 | Slurm | K8s Volcano | 云原生 Kueue |
| 发布 | Blue-green | Canary+Shadow | 风控 Canary |
| 实验单元 | 请求级 | 用户级 | 用户级 + 网络效应说明 |
失败模式与降级
- 特征延迟:回退默认特征向量 + 告警;禁止 silent 零向量(skew)
- 训练失败:checkpoint 恢复;Spot 中断 < checkpoint 周期
- Serving 回滚:Registry 上一版本 + 特征视图兼容矩阵
- 实验污染:SRM 检测 → 自动停实验
口述题(本段)
Q9.1 · 若 治理横切 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、govern 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q9.2 · 若 治理横切 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、govern 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
Q9.3 · 若 治理横切 延迟翻倍,你先看哪三个指标?
答:trace 分段 latency、队列深度、govern 版本是否与 prod 对齐;再查 skew 抽样与 GPU 利用率。
10. STAR-M-P · 训练–Serving Skew 导致 CTR 跌 12%
Situation:推荐主模型日更;上线 6 小时后 CTR -12%,收入 -8%。 Task:24h 内定位并回滚,不扩大资损。 Action:
- Shadow 对比发现 实时点击特征 在线用 1h 窗口、离线训练用 24h 窗口;
- Lineage 查到 feature_view
click_24h未同步到在线 Redis 物化; - 回滚 Registry v{n-1};修复 FS 物化 job;补 PIT 回归集。 Result:2h 回滚;CTR 恢复;新增 skew 日抽检 Gate。 Metrics:MTTR 2h;影响请求 ~4%;修复后 7 天无复发。 Prevention:CI 中 离线/在线特征哈希对账;promote 前 Shadow 24h。
11. STAR-M-P · GPU 账单暴涨未增实验产出
Situation:FinOps 报 ML 账单 +45% QoQ,实验上线数 flat。 Task:降本 25% 不伤训练 SLA。 Action:有效 $/GPU-hour dashboard;top3 为 Notebook 占卡、低 MFU 大 job、推理无 autoscale。 Result:Spot+checkpoint、idle notebook 4h 回收、推理 HPA;账单 -28%。 Metrics:MFU 18%→31%;排队 P95 不变。 Prevention:Chargeback 月报 + 配额硬顶。
12. 大厂口述题库(精选 20)
O01 · 为何需要 Feature Store?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:复用、一致性、PIT、治理。
O02 · 十亿用户在线特征怎么存?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:分片 Redis/KeyDB + 域分组 + 热点。
O03 · 70B 训练怎么排并行?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:3D 并行口算 + checkpoint。
O04 · CT 和 CI 差异?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:数据/模型漂移触发 + 相对 Gate。
O05 · p=0.06 怎么决策?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:先验、功效、业务损失函数。
O06 · Responsible AI 三阶段?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:Pre/In/Post + Model Card。
O07 · Build vs Buy FS?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:团队规模×差异化×TCO。
O08 · LLM 与经典 ML 平台边界?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:Serving 链到 llm-agent/07。
O09 · GDPR 删除如何落到模型?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:Catalog→purge→unlearn 验证。
O10 · 多租户 GPU 公平?
满分结构:澄清 → 架构图 → 权衡 → 数字 → 回滚。要点:配额+gang+dominant share。
13. 七段 Source of Truth 总表
| 实体 | Owner | 消费者 | 不一致修复 |
|---|---|---|---|
| 原始事件 | 数据湖 Bronze | FS/训练 | 重放分区 |
| 特征定义 | FS Registry | 训练/Serving | 版本 pin |
| 训练数据 Snapshot | DataOps | Registry | manifest 哈希 |
| 模型 Artifact | Registry | Serving | 不可变 tag |
| 实验分流 | 实验平台 | 全链路 | SRM 停实验 |
| 成本归因 | FinOps | 治理 | chargeback 标签 |
14. 端到端参考架构(满分白板)
flowchart TB
subgraph Data
LAKE[(Lakehouse)]
GE[Great Expectations]
SNAP[Dataset Snapshot]
end
subgraph FS
OFF[Offline Store]
ON[Online Store]
REG_F[Feature Registry]
end
subgraph Train
SCH[Scheduler Volcano/Kueue]
JOB[Distributed Training]
CKPT[Checkpoint S3]
end
subgraph MLOps
REG_M[Model Registry]
CI[ML CI Gates]
LINE[Lineage]
end
subgraph Serve
TRITON[Triton/KServe]
CACHE[Feature+Emb Cache]
end
subgraph Exp
AB[AB Platform]
CUPED[CUPED/Sequential]
end
subgraph Gov
AUD[Audit]
FIN[FinOps Chargeback]
RAI[Responsible AI]
end
LAKE --> GE --> SNAP
SNAP --> OFF
OFF --> JOB
ON --> TRITON
JOB --> CKPT --> REG_M
REG_M --> TRITON
TRITON --> AB
LINE --> AUD
FIN --> Gov
15.1 深度附录 · PIT join 与泄露场景清单
15.1.1 机制
PIT join 与泄露场景清单 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 PIT join 与泄露场景清单,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 PIT join 与泄露场景清单 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.2 深度附录 · FSDP ZeRO-3 通信代价
15.2.1 机制
FSDP ZeRO-3 通信代价 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 FSDP ZeRO-3 通信代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 FSDP ZeRO-3 通信代价 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.3 深度附录 · 动态批 max_queue_delay
15.3.1 机制
动态批 max_queue_delay 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 动态批 max_queue_delay,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 动态批 max_queue_delay 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.4 深度附录 · Registry 审批流 YAML
15.4.1 机制
Registry 审批流 YAML 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Registry 审批流 YAML,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Registry 审批流 YAML 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.5 深度附录 · PSI 漂移阈值
15.5.1 机制
PSI 漂移阈值 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 PSI 漂移阈值,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 PSI 漂移阈值 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.6 深度附录 · CUPED 方差缩减条件
15.6.1 机制
CUPED 方差缩减条件 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 CUPED 方差缩减条件,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 CUPED 方差缩减条件 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.7 深度附录 · Spot checkpoint 周期公式
15.7.1 机制
Spot checkpoint 周期公式 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Spot checkpoint 周期公式,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Spot checkpoint 周期公式 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.8 深度附录 · Model Card 必填字段
15.8.1 机制
Model Card 必填字段 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Model Card 必填字段,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Model Card 必填字段 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.9 深度附录 · Shadow traffic 资源代价
15.9.1 机制
Shadow traffic 资源代价 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Shadow traffic 资源代价,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Shadow traffic 资源代价 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.10 深度附录 · Champion-Challenger 离线
15.10.1 机制
Champion-Challenger 离线 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Champion-Challenger 离线,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Champion-Challenger 离线 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.11 深度附录 · Feature 域分组策略
15.11.1 机制
Feature 域分组策略 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Feature 域分组策略,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Feature 域分组策略 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.12 深度附录 · GPU 碎片与 gang
15.12.1 机制
GPU 碎片与 gang 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 GPU 碎片与 gang,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 GPU 碎片与 gang 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.13 深度附录 · mTLS 推理侧
15.13.1 机制
mTLS 推理侧 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 mTLS 推理侧,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 mTLS 推理侧 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.14 深度附录 · Delta/Iceberg 时间旅行
15.14.1 机制
Delta/Iceberg 时间旅行 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Delta/Iceberg 时间旅行,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Delta/Iceberg 时间旅行 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.15 深度附录 · LabelOps IAA κ
15.15.1 机制
LabelOps IAA κ 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 LabelOps IAA κ,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 LabelOps IAA κ 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.16 深度附录 · Unlearning 验证集
15.16.1 机制
Unlearning 验证集 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Unlearning 验证集,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Unlearning 验证集 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.17 深度附录 · Network effect 单元随机
15.17.1 机制
Network effect 单元随机 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Network effect 单元随机,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Network effect 单元随机 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.18 深度附录 · Sequential testing 边界
15.18.1 机制
Sequential testing 边界 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Sequential testing 边界,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Sequential testing 边界 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.19 深度附录 · Uplift vs Shapley
15.19.1 机制
Uplift vs Shapley 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Uplift vs Shapley,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Uplift vs Shapley 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
15.20 深度附录 · Build vs Buy TCO 口算
15.20.1 机制
Build vs Buy TCO 口算 在 ML 平台中的位置:连接 §3–§9 七段,面试追问时从 度量→根因→工程手段→流程 四层回答。
sequenceDiagram
participant DS as Data Scientist
participant PL as ML Platform
participant PR as Prod
DS->>PL: 提交训练 job + data_snapshot_id
PL->>PL: CI Gate: GE + skew sample
PL->>PR: Canary promote
PR-->>PL: SLI 异常 → 自动 rollback
15.{idx}.2 大厂追问链
- 追问 1:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 2:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 3:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 4:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
- 追问 5:若忽略 Build vs Buy TCO 口算,线上会出现什么可观测信号?
- 答:指标漂移、公平性切片恶化、或 FinOps 异常;用 Lineage 定位到 feature_view / model_version。
15.{idx}.3 口算练习
假设:日训练 200 job,平均 8 GPU×4h,Spot 节省 60%,中断率 5%
有效 GPU-hour = 200 * 8 * 4 * (1 - 0.05) = 6080
名义 = 6400;节省账单 ≈ 6400 * price * 0.6 * 0.95(粗算)
15.{idx}.4 Checklist
- 能白板画 Build vs Buy TCO 口算 在七段中的触点
- 能举 1 个失败模式 + 降级
- 能量化 1 个 SLO 或成本指标
16. 满分答题框架(ML 平台通用)
- 澄清:用例、SLA、合规、训练/推理占比
- 度量:没有 dashboard 先建 SLI/SLO 与有效 $/GPU-hour
- 七段架构图:数据→FS→train→registry→serve→exp→govern
- 深入 2 点:通常 FS+PIT、Serving+发布 或 治理+FinOps
- 权衡:延迟 vs 一致性、成本 vs 科学严谨
- 回滚:Registry 版本、特征兼容、实验停开
17. 与专题文档交叉索引
| 段 | 深入阅读 |
|---|---|
| 数据 | 08-数据管道 |
| FS | 01-特征平台 |
| 训练 | 02-模型训练 |
| Serving | 03-模型Serving |
| MLOps | 04-MLOps |
| 实验 | 05-实验平台 |
| 治理 | 06-Staff扩展 |
| LLM | llm-agent/07 |
18. 一句话速记
ML 平台 = 七段流水线 + PIT 防泄露 + skew 对账 + Registry Gate + FinOps 有效成本 + 实验可信度 + 治理可审计。
官方文档与源码(一级依据)
See registry · 正文机制应来自下方 官方文档(L1) 与 官方源码仓库(L2); 禁止用教程站/博客充当机制依据。本章 QPS/延迟/STAR 为面试示意。 写作规范:docs/official-sources-registry.md §0
L1 · 官方文档