2026
- 22 Jul CUDA Features 4.20:Driver Entry Point Access
- 22 Jul CUDA Features 4.19:CUDA 与图形及外部 API 互操作
- 22 Jul CUDA Features 4.18:CUDA Dynamic Parallelism(CDP2)
- 22 Jul CUDA Features 4.17:Extended GPU Memory(EGM)
- 22 Jul CUDA Features 4.16:Virtual Memory Management
- 22 Jul CUDA Features 4.15:Interprocess Communication
- 22 Jul CUDA Features 4.14:Memory Synchronization Domains
- 22 Jul CUDA Features 4.13:L2 Cache Control
- 22 Jul CUDA Features 4.12:Cluster Launch Control 工作窃取
- 22 Jul CUDA Features 4.11:Asynchronous Data Copies
- 22 Jul CUDA Features 4.10:Pipelines
- 22 Jul CUDA Features 4.9:Asynchronous Barriers
- 22 Jul CUDA Features 4.8:Error Log Management
- 22 Jul CUDA Features 4.7:Lazy Loading
- 22 Jul CUDA Features 4.6:Green Contexts
- 22 Jul CUDA Features 4.5:程序化依赖发射与同步
- 22 Jul CUDA Features 4.4:Cooperative Groups
- 22 Jul CUDA Features 4.3:流顺序内存分配器
- 22 Jul CUDA Features 4.2:CUDA Graphs
- 22 Jul CUDA Features 4.1:统一内存(Unified Memory)
- 21 Jul NVIDIA GPU 架构演进:从 Volta 到 Blackwell 的计算、存储与互联
- 21 Jul vLLM 与 SGLang 调度器源码详解:排序、准入、KV 与提交
- 20 Jul Megatron 专家训练:实验、深挖链与源码阅读路径
- 20 Jul Megatron 面试题(九):专家系统设计、源码与事故题
- 20 Jul Megatron 面试题(八):Checkpoint、数据与可靠性
- 20 Jul Megatron 面试题(七):性能、融合、精度与通信重叠
- 20 Jul Megatron 面试题(六):MoE 与 Expert Parallel
- 20 Jul Megatron 面试题(五):Context Parallel 与长序列
- 20 Jul Megatron 面试题(四):DDP 与 Distributed Optimizer
- 20 Jul Megatron 面试题(三):Pipeline Parallel 调度
- 20 Jul Megatron 面试题(二):Tensor 与 Sequence Parallel
- 20 Jul Megatron 面试题(一):模型抽象与训练数据流
- 20 Jul Megatron 面试题(零):全局架构与核心抽象
- 20 Jul Megatron 专家面试题系列:架构、并行与大规模训练
- 20 Jul AI Infra 面试实战:上机题、岗位选题与六周训练计划
- 20 Jul AI Infra 面试题(十):框架运行时与底层契约
- 20 Jul AI Infra 面试题(九):工程实现与实验深挖
- 20 Jul AI Infra 面试题(八):训练与推理系统设计
- 20 Jul AI Infra 面试题(七):8 卡 V100 项目答辩
- 20 Jul AI Infra 面试题(六):生产集群、可靠性与 RL Infra
- 20 Jul AI Infra 面试题(五):GPU Kernel、编译与性能工程
- 20 Jul AI Infra 面试题(四):LLM 推理引擎与在线服务
- 20 Jul AI Infra 面试题(三):大模型多维并行
- 20 Jul AI Infra 面试题(二):DDP、FSDP 与训练运行时
- 20 Jul AI Infra 面试题(一):GPU、通信与性能基础
- 20 Jul AI Infra 面试题系列:从 GPU 基础到生产系统
- 20 Jul SGLang 请求处理全流程:从 Tokenizer 到 Scheduler、Radix 与输出
- 20 Jul vLLM 请求处理全流程:从 HTTP 到 Scheduler、GPU 与流式输出
- 20 Jul vLLM / SGLang 面试源码深挖:优化机制与实验
- 20 Jul vLLM / SGLang 深度面试:24 道完整答案与评分指南
- 20 Jul vLLM / SGLang 面试题(六):Staff 级系统设计与现场推演
- 20 Jul vLLM / SGLang 面试题(五):高级优化、分布式与性能诊断
- 20 Jul vLLM / SGLang 面试题(四):KV Cache 与 GPU 执行
- 20 Jul vLLM / SGLang 面试题(三):调度、准入与资源预算
- 20 Jul vLLM / SGLang 面试题(二):请求生命周期与模块契约
- 20 Jul vLLM / SGLang 面试题(一):推理服务基础
- 20 Jul vLLM / SGLang 源码面试题系列:从基础到 Staff
- 17 Jul NCCL 进阶面试实验题:20 个细节追问、源码与实测证据
- 15 Jul NCCL 面试题详解:54 题从集合通信到大模型推理与生产排障
- 12 Jul NCCL 专家课程 36:一条 DDP AllReduce 的端到端证明
- 12 Jul NCCL 专家课程 35:生产基线、回归判定与版本治理
- 12 Jul NCCL 专家课程 34:Debug、NVTX、Nsight 与 Flight Recorder 证据链
- 12 Jul NCCL 专家课程 33:Collective Mismatch、Hang、Rank Crash 与根因链
- 12 Jul NCCL 专家课程 32:TP、PP、EP/MoE 与多维 Process Group
- 12 Jul NCCL 专家课程 31:ZeRO-0/1/2/3、FSDP 与状态分片
- 12 Jul NCCL 专家课程 30:DDP Reducer、Bucket 与计算通信重叠
- 12 Jul NCCL 专家课程 29:ProcessGroupNCCL、Stream、Event 与 Work
- 12 Jul NCCL 专家课程 28:CollNet、SHARP、NVLS 与插件门控
- 12 Jul NCCL 专家课程 27:Multi-NIC、Rail、Cross-NIC 与 PXN
- 12 Jul NCCL 专家课程 26:GPUDirect RDMA、DMA-BUF、MR 与注册缓存
- 11 Jul NCCL 专家课程 25:Socket、InfiniBand、RoCE 与 Verbs 数据面
- 11 Jul NCCL 专家课程 24:CPU Proxy、NET Progress、Socket Helper 与 GPU 协作
- 11 Jul NCCL 专家课程 23:Device Kernel、Primitives、Step/Credit 与 LL Flag
- 11 Jul NCCL 专家课程 22:Enqueue、Task、Plan、Work Batch 与 CUDA Graph
- 11 Jul NCCL 专家课程 21:P2P Direct、CUDA IPC、Read/Write 与 SHM Copy Engine
- 11 Jul NCCL 专家课程 20:Transport 选择、Connector 与连接生命周期
- 11 Jul NCCL 专家课程 19:Graph Search、Ring/Tree 与 Channel 构造
- 11 Jul NCCL 专家课程 18:拓扑 XML、节点模型与路径计算
- 11 Jul NCCL 专家课程 17:Bootstrap 与 Communicator 初始化状态机
- 10 Jul NCCL 专家课程 16:Tuning 代价模型、自动选择与 Tuner Plugin
- 10 Jul NCCL 专家课程 15:Channel、Chunk、Slice、Step、Buffer 与 CUDA Block
- 10 Jul NCCL 专家课程 14:Simple、LL、LL128 的线格式、同步与真实性能边界
- 10 Jul NCCL 专家课程 13:Tree、双树、层次化连接与真实交叉区间
- 10 Jul NCCL 专家课程 12:Ring AllReduce 逐步推导、真实 Ring 与 Channel 并行
- 10 Jul NCCL 专家课程 11:性能回归的分层归因与故障指纹
- 10 Jul NCCL 专家课程 10:延迟-带宽分段模型、残差与 Tuner 预测
- 10 Jul NCCL 专家课程 09:Benchmark 方法学、同步边界与噪声证据
- 10 Jul NCCL 专家课程 08:从 nccl-tests 源码推导 algbw 与 busbw
- 10 Jul NCCL 专家课程 07:AllReduce 等价分解、显存生命周期与 Kernel 证据
- 10 Jul NCCL 专家课程 06:Group、全局顺序与异步错误状态机
- 10 Jul NCCL 专家课程 05:Collective 契约、内存布局与逐元素证明
- 10 Jul NCCL 专家课程 03:CUDA Stream、Work.wait 与真正的完成语义
- 10 Jul NCCL 专家课程 01:从 ELF 动态链接证明实际运行版本
- 09 Jul NCCL 专家课程 04:Rank、Process Group 与 Communicator 生命周期
- 09 Jul NCCL 专家课程 02:从 NV2 拓扑到 P2P 带宽与并发争用
- 09 Jul NCCL 专家学习路线:36 章源码与实验课程
2023
- 12 May 分布式系统基础
- 10 May Build Your Own Image Bed