Home AI Infra 面试题(八):训练与推理系统设计
Post
Cancel

AI Infra 面试题(八):训练与推理系统设计

本文是AI Infra 面试题系列的 Level 8,覆盖 Q85-Q90。重点是70B/MoE 训练、在线推理、百万上下文、checkpoint 与自动并行搜索。

上一篇:项目答辩与高压追问 · 系列总索引 · 下一篇:工程实现与实验深挖


9. Level 8:系统设计题

系统设计题没有唯一配置。面试开始的前五分钟应主动索要模型架构、GPU/网络、精度、序列长度、global batch、SLO、容错和成本约束。未经估算直接报 TP=8, PP=16 通常是失分项。

Q85. 设计一个 256xH100 的 70B dense 模型预训练系统

必须覆盖

  • 容量表:参数、梯度、Adam state、master weight、activation、临时 buffer;说明 BF16/FP8 和 optimizer 分片假设。
  • 枚举 DP/FSDP、TP、PP、CP 候选,给 world size 与 global batch 约束;TP/CP 放 NVLink 域,跨节点通信说明 NIC 路径。
  • 6*N*tokens 作为 dense Transformer 粗略训练 FLOPs 起点,再说明 attention、embedding、recompute 会修正;给 MFU 与目标 tokens/s 的估算方法。
  • pipeline microbatch/bubble、activation recompute、数据 packing、distributed optimizer 和 checkpoint 策略。
  • 观测 MFU、step 分解、collective、straggler、loss/overflow、数据等待、checkpoint pause;故障注入和 restore 验证。

高压追问

  • 模型单卡能否放下不是唯一问题,为什么仍可能使用 TP?
  • global batch 被优化团队固定后,如何选择 PP microbatch 数?
  • 某个机架链路降级 30%,job 是否继续、重排还是重启?

Q86. 设计一个大规模 MoE 预训练系统

必须覆盖

  • 区分总参数与每 token active 参数,估算 expert 权重容量、router/attention dense 部分和每 token FLOPs。
  • 明确 TP/EP/DP/PP group 关系、expert placement 和 All-to-All 路径;说明为什么 EP 对网络和拓扑更敏感。
  • router top-k、capacity factor、token drop、auxiliary loss、expert replication/dynamic placement。
  • grouped GEMM、token permute、dispatch/combine overlap,以及每 expert token 分布的 p99/max-to-mean。
  • checkpoint 如何保存/reshard experts;节点故障后如何保持 expert 集合完整。

高压追问:平均每 expert token 很均匀,但 step 仍有长尾,你还会看什么?

Q87. 用 64 张 GPU 部署 70B chat 模型,要求 TTFT p99<1s、TPOT p99<50ms

必须覆盖

  • 先索要输入/输出长度分布、arrival trace、上下文上限、精度/质量、可用 GPU 型号和 availability target。
  • 计算参数与单请求 KV,选择最小可行 TP;剩余 GPU 做 replicas,设计 topology-aware placement 和 cache-aware routing。
  • scheduler 的 max batched tokens、chunked prefill、decode reservation、admission/preemption;用 open-loop sweep 找 SLO knee。
  • prefix cache、量化、compile/CUDA Graph 的收益边界;模型加载、warmup 和 cache 冷启动。
  • 多租户隔离、健康检查、滚动升级、失败请求重试与容量冗余;主指标是 SLO goodput/GPU,不只是 output tok/s。

高压追问:流量突然 3x 时,为什么立刻扩容也可能来不及?什么请求应先拒绝?

Q88. 设计支持 1M context 的推理服务

必须覆盖

  • 先算 KV cache;即便 GQA/量化,单请求容量也可能决定整个部署,不能先谈 scheduler。
  • prefill 的 attention 计算、TTFT 与显存;考虑 CP、ring attention、chunked prefill、KV offload/分层存储和算法级稀疏方案的语义差异。
  • 超长请求 admission、异步进度、取消、租户配额和对短请求的隔离,避免 head-of-line blocking。
  • prefix reuse、prompt ingestion、KV transfer 和 PD disaggregation 的网络预算。
  • benchmark 使用长度分桶和真实 needle/retrieval 质量,性能优化不能破坏长上下文正确性。

Q89. 设计可跨并行配置恢复的 distributed checkpoint 服务

必须覆盖

  • 全局 tensor identity、shape、dtype、placement/shard metadata,与 rank-local chunk 文件解耦。
  • rank 并行上传、checksum、manifest、两阶段/原子完成标记、垃圾回收和版本兼容。
  • restore planner 根据新 mesh 读取并重分片,控制读放大和内存峰值;optimizer/RNG/data cursor 一并恢复。
  • storage 限流、训练网络隔离、异步 snapshot 一致性、加密与访问控制。
  • 测试 partial write、rank/node loss、坏 chunk、不同 world size、旧版本迁移和真实 loss 连续性。

Q90. 设计一套自动寻找最佳并行配置的系统

必须覆盖

  • 输入模型图、shape/dtype、GPU 拓扑/显存/峰值、collective calibration、global batch 与约束。
  • cost model 估算每算子 FLOPs/bytes、activation/状态峰值、DP/TP/PP/CP/EP 通信、pipeline bubble 和 overlap。
  • 搜索合法 mesh/config,先做静态剪枝,再运行少量 calibration/profile 校正模型;输出 Pareto frontier 而非单点。
  • 目标函数可为 time-to-train、tokens/s、SLO goodput、成本或能耗,并对 OOM/故障域设置硬约束。
  • 线上反馈修正带宽、kernel 和 straggler 分布;配置变化后必须做 correctness/收敛 gate。


上一篇:项目答辩与高压追问 · 系列总索引 · 下一篇:工程实现与实验深挖

This post is licensed under CC BY 4.0 by the author.

AI Infra 面试题(七):8 卡 V100 项目答辩

AI Infra 面试题(九):工程实现与实验深挖