Home
Cptz's blog
Cancel

CUDA Features 4.6:Green Contexts

本文逐节对应 CUDA Programming Guide v13.3 的 4.6 Green Contexts。Green Contexts API 在 CUDA 版本中仍在演进,部署时应以目标 Toolkit 的头文件与 release notes 为准。 4.6.1 动机与使用场景 同一 GPU 上的吞吐任务和延迟敏感任务会争用 SM、work queue 以及共享内存系统...

CUDA Features 4.5:程序化依赖发射与同步

本文逐节对应 CUDA Programming Guide v13.3 的 4.5 Programmatic Dependent Launch and Synchronization。 4.5.1 Background 同一 stream 中,后一个 kernel 通常要等前一个 kernel 完成才能开始。程序化依赖发射(PDL)允许主 kernel 在主动声明“发射条件已满足...

CUDA Features 4.4:Cooperative Groups

本文逐节对应 CUDA Programming Guide v13.3 的 4.4 Cooperative Groups。 4.4.1 引言 Cooperative Groups(CG)把“共同参与某个操作的线程集合”表示为显式 group。设备函数可在接口中声明同步范围,避免把“必须由整个 block 调用”藏在实现内部。 4.4.2 Group Handle 与成员函数 ...

CUDA Features 4.3:流顺序内存分配器

本文逐节对应 CUDA Programming Guide v13.3 的 4.3 Stream-Ordered Memory Allocator。 4.3.1 引言 传统 cudaMalloc/cudaFree 在主机上管理设备内存生命周期,释放还可能等待设备工作。流顺序分配器将分配和释放变成 stream 中的操作,让内存生命周期能由事件与 stream 依赖描述,并用 me...

CUDA Features 4.2:CUDA Graphs

本文逐节对应 CUDA Programming Guide v13.3 的 4.2 CUDA Graphs,以中文技术转述覆盖原章的结构、更新、条件节点、内存节点和设备端发射语义。 传统 stream 模型由 CPU 一次次提交 kernel 和复制。操作很短、每轮拓扑重复时,主机提交开销会与设备执行时间相当。CUDA Graph 把操作及依赖预先描述为图,实例化时集中完成验证与准...

NVIDIA GPU 架构演进:从 Volta 到 Blackwell 的计算、存储与互联

本文面向训练、推理和 Kernel 工程。它不只罗列峰值参数,而是回答三件事:每代硬件要解决什么瓶颈,数据怎样穿过 HBM、Shared Memory、寄存器和 Tensor Core,以及这些变化何时能转化成端到端收益。规格以 2026-07-21 能查到的 NVIDIA、CUDA 和 OEM 官方资料为准。 先建立正确的比较方法 谈“某代 GPU 支持什么”时,必须区分三个层...

vLLM 与 SGLang 调度器源码详解:排序、准入、KV 与提交

本文固定到实际运行验证过的 vLLM 与 SGLang fork,从源码对象和状态变化解释调度。目标不是背策略名称,而是理解一轮计划如何在 token、KV、请求槽位和 SLO 约束下成立。 vLLM 请求全流程 · SGLang 请求全流程 · 面试题系列 先用 30 秒理解调度 在线推理调度不是简单地“从队列取几个请求组成 batch”。它至少包含四个不同阶段: 排序...

Megatron 专家训练:实验、深挖链与源码阅读路径

本文是Megatron 专家面试题系列的训练附录,包含十二组实验、六条连续深挖链、四周计划、源码阅读路径和最终自检。 系列总索引 12. 十二组上机实验 实验 设置 必看指标 你应掌握的内容 E01 单卡源码跟踪 2层GPT,local spec,单...

Megatron 面试题(九):专家系统设计、源码与事故题

本文是Megatron 专家面试题系列的 Level 9,覆盖 M125-M140。重点是70B/405B/MoE/128K 方案、OOM/性能/数值事故、源码追踪与专家表达。 上一篇:Checkpoint 与可靠性 · 系列总索引 11. Level 9:专家系统设计、源码与事故题(M125-M140) M125. 用64张H100训练LLaMA类70B,你如何选择并...

Megatron 面试题(八):Checkpoint、数据与可靠性

本文是Megatron 专家面试题系列的 Level 8,覆盖 M111-M124。重点是Sharded state、reshard、原子提交、可复现性、hang/NaN、数据与回归 CI。 上一篇:性能、精度与 overlap · 系列总索引 · 下一篇:专家系统设计与源码 10. Level 8:Checkpoint、数据、可靠性与可观测性(M111-M124) M...

Megatron 面试题(七):性能、融合、精度与通信重叠

本文是Megatron 专家面试题系列的 Level 7,覆盖 M097-M110。重点是MFU、FLOPs、Transformer Engine、fusion、CUDA Graph、FP8 与拓扑映射。 上一篇:MoE 与 EP · 系列总索引 · 下一篇:Checkpoint 与可靠性 9. Level 7:性能、融合、精度与通信重叠(M097-M110) M097...

Megatron 面试题(六):MoE 与 Expert Parallel

本文是Megatron 专家面试题系列的 Level 6,覆盖 M081-M096。重点是Router、容量、token dispatch、All-to-All、GroupedGEMM 与负载均衡。 上一篇:CP、重计算与长序列 · 系列总索引 · 下一篇:性能、精度与 overlap 8. Level 6:MoE、Expert Parallel 与负载均衡(M081-M...

Megatron 面试题(五):Context Parallel 与长序列

本文是Megatron 专家面试题系列的 Level 5,覆盖 M069-M080。重点是SP/CP 边界、attention 通信、recompute、offload、packing 与 batch 联动。 上一篇:DDP、分布式优化器与 FSDP · 系列总索引 · 下一篇:MoE 与 EP 7. Level 5:Context Parallel、重计算与长序列(M0...

Megatron 面试题(四):DDP 与 Distributed Optimizer

本文是Megatron 专家面试题系列的 Level 4,覆盖 M055-M068。重点是Main grad、contiguous buffer、通信 overlap、状态分片、norm 与 overflow。 上一篇:PP 调度与负载均衡 · 系列总索引 · 下一篇:CP、重计算与长序列 6. Level 4:Megatron DDP、Distributed Optim...

Megatron 面试题(三):Pipeline Parallel 调度

本文是Megatron 专家面试题系列的 Level 3,覆盖 M041-M054。重点是GPipe/1F1B、bubble、microbatch、P2P、VPP 和 stage imbalance。 上一篇:TP 与 SP · 系列总索引 · 下一篇:DDP、分布式优化器与 FSDP 5. Level 3:Pipeline Parallel 调度与负载均衡(M041-M...

Megatron 面试题(二):Tensor 与 Sequence Parallel

本文是Megatron 专家面试题系列的 Level 2,覆盖 M025-M040。重点是Column/Row Parallel、mapping autograd、通信量、切分约束与 V100 实测。 上一篇:模型抽象与数据流 · 系列总索引 · 下一篇:PP 调度与负载均衡 4. Level 2:Tensor Parallel 与 Sequence Parallel(M...

Megatron 面试题(一):模型抽象与训练数据流

本文是Megatron 专家面试题系列的 Level 1,覆盖 M013-M024。重点是Transformer layer、QKV、GQA、RoPE、SwiGLU、vocab parallel 与精度状态。 上一篇:全局架构 · 系列总索引 · 下一篇:TP 与 SP 3. Level 1:模型抽象与训练数据流(M013-M024) M013. 一个 Transfor...

Megatron 面试题(零):全局架构与核心抽象

本文是Megatron 专家面试题系列的 Level 0,覆盖 M001-M012。重点是Megatron-LM/MCore/TE 边界、package、parallel state、配置与训练 iteration。 系列总索引 · 下一篇:模型抽象与数据流 2. Level 0:Megatron 全局架构(M001-M012) M001. Megatron-LM、Me...

AI Infra 面试实战:上机题、岗位选题与六周训练计划

本文是AI Infra 面试题系列的实践附录,包含 C01-C08 上机题、岗位选题、训练计划、评分表、证据表达和最终自检。 系列总索引 12. 编码与上机题 C01. 写一个 topology-aware process-group planner 要求:输入 GPU 间带宽矩阵、节点/NIC 信息和 TP/PP/DP,输出 rank placement 与各 gr...

AI Infra 面试题(十):框架运行时与底层契约

本文是AI Infra 面试题系列的 Level 10,覆盖 Q116-Q145。重点是Process group、stream、FSDP 状态机、KV 抢占和 kernel 资源证据。 上一篇:工程实现与实验深挖 · 系列总索引 11. Level 10:框架运行时与底层契约 这一层不再满足于“知道某框架用了哪个 collective”。回答必须落到 communic...