Trending Tags
AI Infra 96
- CUDA Features 4.20:Driver Entry Point Access Jul 22, 2026
- CUDA Features 4.19:CUDA 与图形及外部 API 互操作 Jul 22, 2026
- CUDA Features 4.18:CUDA Dynamic Parallelism(CDP2) Jul 22, 2026
- CUDA Features 4.17:Extended GPU Memory(EGM) Jul 22, 2026
- CUDA Features 4.16:Virtual Memory Management Jul 22, 2026
- CUDA Features 4.15:Interprocess Communication Jul 22, 2026
- CUDA Features 4.14:Memory Synchronization Domains Jul 22, 2026
- CUDA Features 4.13:L2 Cache Control Jul 22, 2026
- CUDA Features 4.12:Cluster Launch Control 工作窃取 Jul 22, 2026
- CUDA Features 4.11:Asynchronous Data Copies Jul 22, 2026
- CUDA Features 4.10:Pipelines Jul 22, 2026
- CUDA Features 4.9:Asynchronous Barriers Jul 22, 2026
- CUDA Features 4.8:Error Log Management Jul 22, 2026
- CUDA Features 4.7:Lazy Loading Jul 22, 2026
- CUDA Features 4.6:Green Contexts Jul 22, 2026
- CUDA Features 4.5:程序化依赖发射与同步 Jul 22, 2026
- CUDA Features 4.4:Cooperative Groups Jul 22, 2026
- CUDA Features 4.3:流顺序内存分配器 Jul 22, 2026
- CUDA Features 4.2:CUDA Graphs Jul 22, 2026
- CUDA Features 4.1:统一内存(Unified Memory) Jul 22, 2026
- NVIDIA GPU 架构演进:从 Volta 到 Blackwell 的计算、存储与互联 Jul 21, 2026
- vLLM 与 SGLang 调度器源码详解:排序、准入、KV 与提交 Jul 21, 2026
- Megatron 专家训练:实验、深挖链与源码阅读路径 Jul 20, 2026
- Megatron 面试题(九):专家系统设计、源码与事故题 Jul 20, 2026
- Megatron 面试题(八):Checkpoint、数据与可靠性 Jul 20, 2026
- Megatron 面试题(七):性能、融合、精度与通信重叠 Jul 20, 2026
- Megatron 面试题(六):MoE 与 Expert Parallel Jul 20, 2026
- Megatron 面试题(五):Context Parallel 与长序列 Jul 20, 2026
- Megatron 面试题(四):DDP 与 Distributed Optimizer Jul 20, 2026
- Megatron 面试题(三):Pipeline Parallel 调度 Jul 20, 2026
- Megatron 面试题(二):Tensor 与 Sequence Parallel Jul 20, 2026
- Megatron 面试题(一):模型抽象与训练数据流 Jul 20, 2026
- Megatron 面试题(零):全局架构与核心抽象 Jul 20, 2026
- Megatron 专家面试题系列:架构、并行与大规模训练 Jul 20, 2026
- AI Infra 面试实战:上机题、岗位选题与六周训练计划 Jul 20, 2026
- AI Infra 面试题(十):框架运行时与底层契约 Jul 20, 2026
- AI Infra 面试题(九):工程实现与实验深挖 Jul 20, 2026
- AI Infra 面试题(八):训练与推理系统设计 Jul 20, 2026
- AI Infra 面试题(七):8 卡 V100 项目答辩 Jul 20, 2026
- AI Infra 面试题(六):生产集群、可靠性与 RL Infra Jul 20, 2026
- AI Infra 面试题(五):GPU Kernel、编译与性能工程 Jul 20, 2026
- AI Infra 面试题(四):LLM 推理引擎与在线服务 Jul 20, 2026
- AI Infra 面试题(三):大模型多维并行 Jul 20, 2026
- AI Infra 面试题(二):DDP、FSDP 与训练运行时 Jul 20, 2026
- AI Infra 面试题(一):GPU、通信与性能基础 Jul 20, 2026
- AI Infra 面试题系列:从 GPU 基础到生产系统 Jul 20, 2026
- SGLang 请求处理全流程:从 Tokenizer 到 Scheduler、Radix 与输出 Jul 20, 2026
- vLLM 请求处理全流程:从 HTTP 到 Scheduler、GPU 与流式输出 Jul 20, 2026
- vLLM / SGLang 面试源码深挖:优化机制与实验 Jul 20, 2026
- vLLM / SGLang 深度面试:24 道完整答案与评分指南 Jul 20, 2026
- vLLM / SGLang 面试题(六):Staff 级系统设计与现场推演 Jul 20, 2026
- vLLM / SGLang 面试题(五):高级优化、分布式与性能诊断 Jul 20, 2026
- vLLM / SGLang 面试题(四):KV Cache 与 GPU 执行 Jul 20, 2026
- vLLM / SGLang 面试题(三):调度、准入与资源预算 Jul 20, 2026
- vLLM / SGLang 面试题(二):请求生命周期与模块契约 Jul 20, 2026
- vLLM / SGLang 面试题(一):推理服务基础 Jul 20, 2026
- vLLM / SGLang 源码面试题系列:从基础到 Staff Jul 20, 2026
- NCCL 进阶面试实验题:20 个细节追问、源码与实测证据 Jul 17, 2026
- NCCL 面试题详解:54 题从集合通信到大模型推理与生产排障 Jul 15, 2026
- NCCL 专家课程 36:一条 DDP AllReduce 的端到端证明 Jul 12, 2026
- NCCL 专家课程 35:生产基线、回归判定与版本治理 Jul 12, 2026
- NCCL 专家课程 34:Debug、NVTX、Nsight 与 Flight Recorder 证据链 Jul 12, 2026
- NCCL 专家课程 33:Collective Mismatch、Hang、Rank Crash 与根因链 Jul 12, 2026
- NCCL 专家课程 32:TP、PP、EP/MoE 与多维 Process Group Jul 12, 2026
- NCCL 专家课程 31:ZeRO-0/1/2/3、FSDP 与状态分片 Jul 12, 2026
- NCCL 专家课程 30:DDP Reducer、Bucket 与计算通信重叠 Jul 12, 2026
- NCCL 专家课程 29:ProcessGroupNCCL、Stream、Event 与 Work Jul 12, 2026
- NCCL 专家课程 28:CollNet、SHARP、NVLS 与插件门控 Jul 12, 2026
- NCCL 专家课程 27:Multi-NIC、Rail、Cross-NIC 与 PXN Jul 12, 2026
- NCCL 专家课程 26:GPUDirect RDMA、DMA-BUF、MR 与注册缓存 Jul 12, 2026
- NCCL 专家课程 25:Socket、InfiniBand、RoCE 与 Verbs 数据面 Jul 11, 2026
- NCCL 专家课程 24:CPU Proxy、NET Progress、Socket Helper 与 GPU 协作 Jul 11, 2026
- NCCL 专家课程 23:Device Kernel、Primitives、Step/Credit 与 LL Flag Jul 11, 2026
- NCCL 专家课程 22:Enqueue、Task、Plan、Work Batch 与 CUDA Graph Jul 11, 2026
- NCCL 专家课程 21:P2P Direct、CUDA IPC、Read/Write 与 SHM Copy Engine Jul 11, 2026
- NCCL 专家课程 20:Transport 选择、Connector 与连接生命周期 Jul 11, 2026
- NCCL 专家课程 19:Graph Search、Ring/Tree 与 Channel 构造 Jul 11, 2026
- NCCL 专家课程 18:拓扑 XML、节点模型与路径计算 Jul 11, 2026
- NCCL 专家课程 17:Bootstrap 与 Communicator 初始化状态机 Jul 11, 2026
- NCCL 专家课程 16:Tuning 代价模型、自动选择与 Tuner Plugin Jul 10, 2026
- NCCL 专家课程 15:Channel、Chunk、Slice、Step、Buffer 与 CUDA Block Jul 10, 2026
- NCCL 专家课程 14:Simple、LL、LL128 的线格式、同步与真实性能边界 Jul 10, 2026
- NCCL 专家课程 13:Tree、双树、层次化连接与真实交叉区间 Jul 10, 2026
- NCCL 专家课程 12:Ring AllReduce 逐步推导、真实 Ring 与 Channel 并行 Jul 10, 2026
- NCCL 专家课程 11:性能回归的分层归因与故障指纹 Jul 10, 2026
- NCCL 专家课程 10:延迟-带宽分段模型、残差与 Tuner 预测 Jul 10, 2026
- NCCL 专家课程 09:Benchmark 方法学、同步边界与噪声证据 Jul 10, 2026
- NCCL 专家课程 08:从 nccl-tests 源码推导 algbw 与 busbw Jul 10, 2026
- NCCL 专家课程 07:AllReduce 等价分解、显存生命周期与 Kernel 证据 Jul 10, 2026
- NCCL 专家课程 06:Group、全局顺序与异步错误状态机 Jul 10, 2026
- NCCL 专家课程 05:Collective 契约、内存布局与逐元素证明 Jul 10, 2026
- NCCL 专家课程 03:CUDA Stream、Work.wait 与真正的完成语义 Jul 10, 2026
- NCCL 专家课程 01:从 ELF 动态链接证明实际运行版本 Jul 10, 2026
- NCCL 专家课程 04:Rank、Process Group 与 Communicator 生命周期 Jul 9, 2026
- NCCL 专家课程 02:从 NV2 拓扑到 P2P 带宽与并发争用 Jul 9, 2026
- NCCL 专家学习路线:36 章源码与实验课程 Jul 9, 2026