系列说明
这套专项题库包含 M001-M140 共 140 道 Megatron 面试题。每道题都提供前置知识、逐步分析、10 分主问题评分、完整追问回答和 5 分追问评分,目标是从会使用配置推进到能解释张量、通信、状态、源码和生产决策。
flowchart LR
A[MCore 架构] --> B[模型数据流]
B --> C[TP 与 SP]
C --> D[PP 调度]
D --> E[分布式优化器]
E --> F[CP 与长序列]
F --> G[MoE 与 EP]
G --> H[性能与精度]
H --> I[可靠性]
I --> J[专家系统设计]
十级题库
| 分卷 | 题号 | 文章 | 核心范围 |
|---|---|---|---|
| Level 0 | M001-M012 | 全局架构 | Megatron-LM/MCore/TE 边界、package、parallel state、配置与训练 iteration |
| Level 1 | M013-M024 | 模型抽象与数据流 | Transformer layer、QKV、GQA、RoPE、SwiGLU、vocab parallel 与精度状态 |
| Level 2 | M025-M040 | TP 与 SP | Column/Row Parallel、mapping autograd、通信量、切分约束与 V100 实测 |
| Level 3 | M041-M054 | PP 调度与负载均衡 | GPipe/1F1B、bubble、microbatch、P2P、VPP 和 stage imbalance |
| Level 4 | M055-M068 | DDP、分布式优化器与 FSDP | Main grad、contiguous buffer、通信 overlap、状态分片、norm 与 overflow |
| Level 5 | M069-M080 | CP、重计算与长序列 | SP/CP 边界、attention 通信、recompute、offload、packing 与 batch 联动 |
| Level 6 | M081-M096 | MoE 与 EP | Router、容量、token dispatch、All-to-All、GroupedGEMM 与负载均衡 |
| Level 7 | M097-M110 | 性能、精度与 overlap | MFU、FLOPs、Transformer Engine、fusion、CUDA Graph、FP8 与拓扑映射 |
| Level 8 | M111-M124 | Checkpoint 与可靠性 | Sharded state、reshard、原子提交、可复现性、hang/NaN、数据与回归 CI |
| Level 9 | M125-M140 | 专家系统设计与源码 | 70B/405B/MoE/128K 方案、OOM/性能/数值事故、源码追踪与专家表达 |
配套内容
1. 使用方法与专家标准
1.1 你需要建立的能力树
| 层级 | 必须掌握 | 面试官验证方式 |
|---|---|---|
| 架构 | Megatron-LM、Megatron-Core、Transformer Engine 的边界;Core 包结构 | 让你从启动脚本画到一个 Transformer layer |
| 张量 | 每种并行下的参数/activation/gradient shape | 临场手推 Column/Row Parallel、SP、CP、EP |
| 通信 | group、collective、bytes、调用频率、关键路径 | 追问 forward/backward 分别通信什么、能否 overlap |
| 调度 | microbatch、1F1B、interleaving、VPP、stage layout | 给 PP/M 要求算 bubble 并定位不均衡 |
| 状态 | contiguous grad buffer、distributed optimizer、checkpoint reshard | 追问 optimizer state 所有权与恢复配置变化 |
| 性能 | MFU、GEMM shape、fusion、precision、topology、straggler | 给 profile 让你提出可证伪优化实验 |
| MoE | router、dispatch、GroupedGEMM、EP、负载均衡、通信 overlap | 从 token 路由一路追到 All-to-All 和尾部专家 |
| 工程 | 初始化、RNG、数据、日志、升级、故障、correctness | 问“为什么没有报错但结果错了” |
1.2 每题统一回答模板
每道题按以下顺序组织。正文中的三条“高分回答要点”不是孤立关键词,而是从定义、机制到工程判断的递进参考回答。
- 前置知识:回答前必须会的公式、对象和框架接口。
- 高分回答要点:先给定义,再推数据流,最后给工程 trade-off 和证据边界。
- 分析过程:说明现场应如何从约束推导答案,而不是直接背结论。
- 主问题得分点:总分 10 分,明确基础、机制、工程和边界各占多少分。
- 追问:面试官用于判断答案是否背诵的问题。
- 追问分析与参考回答:同样从对象、公式/数据流和工程验证逐步回答。
- 追问得分点:总分 5 分;只有结论、没有推导最多得 2 分。
现场作答仍应遵循六步:先画 rank group、tensor shape、module/stage 和状态所有权;再走 forward/backward/optimizer/checkpoint 数据流;写 collective、bytes、频率和显存;找 critical path 和 overlap;给指标、对照与 correctness oracle;最后说明版本和证据边界。
1.3 评分
主问题统一按 10 分评价:
- 0-2 分:只知道参数名或核心方向错误。
- 3-4 分:能给定义,但推不出 tensor、通信或状态。
- 5-6 分:数据流和主公式正确,工程细节不足。
- 7-8 分:能讨论关键路径、指标、实验和常见反例。
- 9-10 分:能落到源码/runtime、版本边界和生产决策,并能证伪自己的判断。
追问统一按 5 分评价:对象/前提 1 分,推导或数据流 2 分,工程验证 1 分,反例/边界 1 分。追问答错底层语义时,主问题即使背得完整也不应超过 6 分。
1.4 本机证据速查
| 实验 | 核心数字 | 可支持的回答 |
|---|---|---|
| TP1 -> TP8 | 84,626 -> 14,667 tok/s;显存 2.85 -> 0.473 GiB | PCIe 上 TP 首先解决容量;小 GEMM 与层内通信会吞掉算力收益 |
| TP2 SP | 显存省 3.0%,吞吐降 15.9% | SP 收益取决于可切 activation 占比和互连 |
| TP4 SP | 显存省 9.3%,吞吐降 19.3% | 不能把 SP 当免费显存优化 |
| seq4096 SP | 仅省 1.3%-3.8% | 长序列不保证 SP 相对收益单调增加 |
| seq4096 full recompute | 显存省 77.6%-78.1%,吞吐降 27%-30% | SP 与 recompute 优化不同张量集合 |
| PP8/M1 | bubble 87.5%,仅 9,627 tok/s | 少 microbatch 时 PP 可比单卡更慢 |
| PP8/M16 | 42,522 tok/s,PP1 的 2.59x,效率 32.4% | bubble 降低不等于线性扩展 |
| PP8 stage | 参数 max/min=2.76x | 等层切分会被 embedding/output endpoint 打破 |
| 进程组 mapping | SYS TP phase 是 PIX 的 3.05x | rank mapping 必须服从拓扑和通信频率 |