Home Megatron 专家面试题系列:架构、并行与大规模训练
Post
Cancel

Megatron 专家面试题系列:架构、并行与大规模训练

系列说明

这套专项题库包含 M001-M140 共 140 道 Megatron 面试题。每道题都提供前置知识、逐步分析、10 分主问题评分、完整追问回答和 5 分追问评分,目标是从会使用配置推进到能解释张量、通信、状态、源码和生产决策。

flowchart LR
    A[MCore 架构] --> B[模型数据流]
    B --> C[TP 与 SP]
    C --> D[PP 调度]
    D --> E[分布式优化器]
    E --> F[CP 与长序列]
    F --> G[MoE 与 EP]
    G --> H[性能与精度]
    H --> I[可靠性]
    I --> J[专家系统设计]

十级题库

分卷题号文章核心范围
Level 0M001-M012全局架构Megatron-LM/MCore/TE 边界、package、parallel state、配置与训练 iteration
Level 1M013-M024模型抽象与数据流Transformer layer、QKV、GQA、RoPE、SwiGLU、vocab parallel 与精度状态
Level 2M025-M040TP 与 SPColumn/Row Parallel、mapping autograd、通信量、切分约束与 V100 实测
Level 3M041-M054PP 调度与负载均衡GPipe/1F1B、bubble、microbatch、P2P、VPP 和 stage imbalance
Level 4M055-M068DDP、分布式优化器与 FSDPMain grad、contiguous buffer、通信 overlap、状态分片、norm 与 overflow
Level 5M069-M080CP、重计算与长序列SP/CP 边界、attention 通信、recompute、offload、packing 与 batch 联动
Level 6M081-M096MoE 与 EPRouter、容量、token dispatch、All-to-All、GroupedGEMM 与负载均衡
Level 7M097-M110性能、精度与 overlapMFU、FLOPs、Transformer Engine、fusion、CUDA Graph、FP8 与拓扑映射
Level 8M111-M124Checkpoint 与可靠性Sharded state、reshard、原子提交、可复现性、hang/NaN、数据与回归 CI
Level 9M125-M140专家系统设计与源码70B/405B/MoE/128K 方案、OOM/性能/数值事故、源码追踪与专家表达

配套内容

1. 使用方法与专家标准

1.1 你需要建立的能力树

层级必须掌握面试官验证方式
架构Megatron-LM、Megatron-Core、Transformer Engine 的边界;Core 包结构让你从启动脚本画到一个 Transformer layer
张量每种并行下的参数/activation/gradient shape临场手推 Column/Row Parallel、SP、CP、EP
通信group、collective、bytes、调用频率、关键路径追问 forward/backward 分别通信什么、能否 overlap
调度microbatch、1F1B、interleaving、VPP、stage layout给 PP/M 要求算 bubble 并定位不均衡
状态contiguous grad buffer、distributed optimizer、checkpoint reshard追问 optimizer state 所有权与恢复配置变化
性能MFU、GEMM shape、fusion、precision、topology、straggler给 profile 让你提出可证伪优化实验
MoErouter、dispatch、GroupedGEMM、EP、负载均衡、通信 overlap从 token 路由一路追到 All-to-All 和尾部专家
工程初始化、RNG、数据、日志、升级、故障、correctness问“为什么没有报错但结果错了”

1.2 每题统一回答模板

每道题按以下顺序组织。正文中的三条“高分回答要点”不是孤立关键词,而是从定义、机制到工程判断的递进参考回答。

  1. 前置知识:回答前必须会的公式、对象和框架接口。
  2. 高分回答要点:先给定义,再推数据流,最后给工程 trade-off 和证据边界。
  3. 分析过程:说明现场应如何从约束推导答案,而不是直接背结论。
  4. 主问题得分点:总分 10 分,明确基础、机制、工程和边界各占多少分。
  5. 追问:面试官用于判断答案是否背诵的问题。
  6. 追问分析与参考回答:同样从对象、公式/数据流和工程验证逐步回答。
  7. 追问得分点:总分 5 分;只有结论、没有推导最多得 2 分。

现场作答仍应遵循六步:先画 rank group、tensor shape、module/stage 和状态所有权;再走 forward/backward/optimizer/checkpoint 数据流;写 collective、bytes、频率和显存;找 critical path 和 overlap;给指标、对照与 correctness oracle;最后说明版本和证据边界。

1.3 评分

主问题统一按 10 分评价:

  • 0-2 分:只知道参数名或核心方向错误。
  • 3-4 分:能给定义,但推不出 tensor、通信或状态。
  • 5-6 分:数据流和主公式正确,工程细节不足。
  • 7-8 分:能讨论关键路径、指标、实验和常见反例。
  • 9-10 分:能落到源码/runtime、版本边界和生产决策,并能证伪自己的判断。

追问统一按 5 分评价:对象/前提 1 分,推导或数据流 2 分,工程验证 1 分,反例/边界 1 分。追问答错底层语义时,主问题即使背得完整也不应超过 6 分。

1.4 本机证据速查

实验核心数字可支持的回答
TP1 -> TP884,626 -> 14,667 tok/s;显存 2.85 -> 0.473 GiBPCIe 上 TP 首先解决容量;小 GEMM 与层内通信会吞掉算力收益
TP2 SP显存省 3.0%,吞吐降 15.9%SP 收益取决于可切 activation 占比和互连
TP4 SP显存省 9.3%,吞吐降 19.3%不能把 SP 当免费显存优化
seq4096 SP仅省 1.3%-3.8%长序列不保证 SP 相对收益单调增加
seq4096 full recompute显存省 77.6%-78.1%,吞吐降 27%-30%SP 与 recompute 优化不同张量集合
PP8/M1bubble 87.5%,仅 9,627 tok/s少 microbatch 时 PP 可比单卡更慢
PP8/M1642,522 tok/s,PP1 的 2.59x,效率 32.4%bubble 降低不等于线性扩展
PP8 stage参数 max/min=2.76x等层切分会被 embedding/output endpoint 打破
进程组 mappingSYS TP phase 是 PIX 的 3.05xrank mapping 必须服从拓扑和通信频率

This post is licensed under CC BY 4.0 by the author.

AI Infra 面试实战:上机题、岗位选题与六周训练计划

Megatron 面试题(零):全局架构与核心抽象