本文逐节对应 CUDA Programming Guide v13.3 的 4.6 Green Contexts。Green Contexts API 在 CUDA 版本中仍在演进,部署时应以目标 Toolkit 的头文件与 release notes 为准。 4.6.1 动机与使用场景 同一 GPU 上的吞吐任务和延迟敏感任务会争用 SM、work queue 以及共享内存系统...
本文逐节对应 CUDA Programming Guide v13.3 的 4.5 Programmatic Dependent Launch and Synchronization。 4.5.1 Background 同一 stream 中,后一个 kernel 通常要等前一个 kernel 完成才能开始。程序化依赖发射(PDL)允许主 kernel 在主动声明“发射条件已满足...
本文逐节对应 CUDA Programming Guide v13.3 的 4.4 Cooperative Groups。 4.4.1 引言 Cooperative Groups(CG)把“共同参与某个操作的线程集合”表示为显式 group。设备函数可在接口中声明同步范围,避免把“必须由整个 block 调用”藏在实现内部。 4.4.2 Group Handle 与成员函数 ...
本文逐节对应 CUDA Programming Guide v13.3 的 4.3 Stream-Ordered Memory Allocator。 4.3.1 引言 传统 cudaMalloc/cudaFree 在主机上管理设备内存生命周期,释放还可能等待设备工作。流顺序分配器将分配和释放变成 stream 中的操作,让内存生命周期能由事件与 stream 依赖描述,并用 me...
本文逐节对应 CUDA Programming Guide v13.3 的 4.2 CUDA Graphs,以中文技术转述覆盖原章的结构、更新、条件节点、内存节点和设备端发射语义。 传统 stream 模型由 CPU 一次次提交 kernel 和复制。操作很短、每轮拓扑重复时,主机提交开销会与设备执行时间相当。CUDA Graph 把操作及依赖预先描述为图,实例化时集中完成验证与准...
本文面向训练、推理和 Kernel 工程。它不只罗列峰值参数,而是回答三件事:每代硬件要解决什么瓶颈,数据怎样穿过 HBM、Shared Memory、寄存器和 Tensor Core,以及这些变化何时能转化成端到端收益。规格以 2026-07-21 能查到的 NVIDIA、CUDA 和 OEM 官方资料为准。 先建立正确的比较方法 谈“某代 GPU 支持什么”时,必须区分三个层...
本文固定到实际运行验证过的 vLLM 与 SGLang fork,从源码对象和状态变化解释调度。目标不是背策略名称,而是理解一轮计划如何在 token、KV、请求槽位和 SLO 约束下成立。 vLLM 请求全流程 · SGLang 请求全流程 · 面试题系列 先用 30 秒理解调度 在线推理调度不是简单地“从队列取几个请求组成 batch”。它至少包含四个不同阶段: 排序...
本文是Megatron 专家面试题系列的训练附录,包含十二组实验、六条连续深挖链、四周计划、源码阅读路径和最终自检。 系列总索引 12. 十二组上机实验 实验 设置 必看指标 你应掌握的内容 E01 单卡源码跟踪 2层GPT,local spec,单...
本文是Megatron 专家面试题系列的 Level 9,覆盖 M125-M140。重点是70B/405B/MoE/128K 方案、OOM/性能/数值事故、源码追踪与专家表达。 上一篇:Checkpoint 与可靠性 · 系列总索引 11. Level 9:专家系统设计、源码与事故题(M125-M140) M125. 用64张H100训练LLaMA类70B,你如何选择并...
本文是Megatron 专家面试题系列的 Level 8,覆盖 M111-M124。重点是Sharded state、reshard、原子提交、可复现性、hang/NaN、数据与回归 CI。 上一篇:性能、精度与 overlap · 系列总索引 · 下一篇:专家系统设计与源码 10. Level 8:Checkpoint、数据、可靠性与可观测性(M111-M124) M...
本文是Megatron 专家面试题系列的 Level 7,覆盖 M097-M110。重点是MFU、FLOPs、Transformer Engine、fusion、CUDA Graph、FP8 与拓扑映射。 上一篇:MoE 与 EP · 系列总索引 · 下一篇:Checkpoint 与可靠性 9. Level 7:性能、融合、精度与通信重叠(M097-M110) M097...
本文是Megatron 专家面试题系列的 Level 6,覆盖 M081-M096。重点是Router、容量、token dispatch、All-to-All、GroupedGEMM 与负载均衡。 上一篇:CP、重计算与长序列 · 系列总索引 · 下一篇:性能、精度与 overlap 8. Level 6:MoE、Expert Parallel 与负载均衡(M081-M...
本文是Megatron 专家面试题系列的 Level 5,覆盖 M069-M080。重点是SP/CP 边界、attention 通信、recompute、offload、packing 与 batch 联动。 上一篇:DDP、分布式优化器与 FSDP · 系列总索引 · 下一篇:MoE 与 EP 7. Level 5:Context Parallel、重计算与长序列(M0...
本文是Megatron 专家面试题系列的 Level 4,覆盖 M055-M068。重点是Main grad、contiguous buffer、通信 overlap、状态分片、norm 与 overflow。 上一篇:PP 调度与负载均衡 · 系列总索引 · 下一篇:CP、重计算与长序列 6. Level 4:Megatron DDP、Distributed Optim...
本文是Megatron 专家面试题系列的 Level 3,覆盖 M041-M054。重点是GPipe/1F1B、bubble、microbatch、P2P、VPP 和 stage imbalance。 上一篇:TP 与 SP · 系列总索引 · 下一篇:DDP、分布式优化器与 FSDP 5. Level 3:Pipeline Parallel 调度与负载均衡(M041-M...
本文是Megatron 专家面试题系列的 Level 2,覆盖 M025-M040。重点是Column/Row Parallel、mapping autograd、通信量、切分约束与 V100 实测。 上一篇:模型抽象与数据流 · 系列总索引 · 下一篇:PP 调度与负载均衡 4. Level 2:Tensor Parallel 与 Sequence Parallel(M...
本文是Megatron 专家面试题系列的 Level 1,覆盖 M013-M024。重点是Transformer layer、QKV、GQA、RoPE、SwiGLU、vocab parallel 与精度状态。 上一篇:全局架构 · 系列总索引 · 下一篇:TP 与 SP 3. Level 1:模型抽象与训练数据流(M013-M024) M013. 一个 Transfor...
本文是Megatron 专家面试题系列的 Level 0,覆盖 M001-M012。重点是Megatron-LM/MCore/TE 边界、package、parallel state、配置与训练 iteration。 系列总索引 · 下一篇:模型抽象与数据流 2. Level 0:Megatron 全局架构(M001-M012) M001. Megatron-LM、Me...
本文是AI Infra 面试题系列的实践附录,包含 C01-C08 上机题、岗位选题、训练计划、评分表、证据表达和最终自检。 系列总索引 12. 编码与上机题 C01. 写一个 topology-aware process-group planner 要求:输入 GPU 间带宽矩阵、节点/NIC 信息和 TP/PP/DP,输出 rank placement 与各 gr...
本文是AI Infra 面试题系列的 Level 10,覆盖 Q116-Q145。重点是Process group、stream、FSDP 状态机、KV 抢占和 kernel 资源证据。 上一篇:工程实现与实验深挖 · 系列总索引 11. Level 10:框架运行时与底层契约 这一层不再满足于“知道某框架用了哪个 collective”。回答必须落到 communic...
A new version of content is available.