Home
Cptz's blog
Cancel

AI Infra 面试题(九):工程实现与实验深挖

本文是AI Infra 面试题系列的 Level 9,覆盖 Q91-Q115。重点是DDP/NCCL/MoE/checkpoint/Triton/vLLM 实验的实现与归因细节。 上一篇:系统设计 · 系列总索引 · 下一篇:运行时与底层契约 10. Level 9:工程实现与现场深挖 这一层不再考“知道术语”,而是检查候选人是否真的写过 runner、读过 runti...

AI Infra 面试题(八):训练与推理系统设计

本文是AI Infra 面试题系列的 Level 8,覆盖 Q85-Q90。重点是70B/MoE 训练、在线推理、百万上下文、checkpoint 与自动并行搜索。 上一篇:项目答辩与高压追问 · 系列总索引 · 下一篇:工程实现与实验深挖 9. Level 8:系统设计题 系统设计题没有唯一配置。面试开始的前五分钟应主动索要模型架构、GPU/网络、精度、序列长度、gl...

AI Infra 面试题(七):8 卡 V100 项目答辩

本文是AI Infra 面试题系列的 Level 7,覆盖 Q75-Q84。重点是实验数字、证据边界、反直觉结果和项目价值的现场防守。 上一篇:集群、可靠性与 RL Infra · 系列总索引 · 下一篇:系统设计 8. Level 7:本项目答辩与高压追问 Q75. 请用两分钟介绍这个 8xV100 项目,不要按实验目录流水账。 参考回答骨架 我在一台 8x...

AI Infra 面试题(六):生产集群、可靠性与 RL Infra

本文是AI Infra 面试题系列的 Level 6,覆盖 Q65-Q74。重点是可观测性、hang/straggler/OOM、恢复、数据、放置、过载与 RL 系统。 上一篇:Kernel、编译与性能工程 · 系列总索引 · 下一篇:项目答辩与高压追问 7. Level 6:生产集群、可靠性与 RL Infra Q65. 如何为千卡训练任务设计可观测性? 高分回答要...

AI Infra 面试题(五):GPU Kernel、编译与性能工程

本文是AI Infra 面试题系列的 Level 5,覆盖 Q55-Q64。重点是Profiling、算术强度、FlashAttention、Triton、occupancy 与图编译。 上一篇:推理引擎与在线服务 · 系列总索引 · 下一篇:集群、可靠性与 RL Infra 6. Level 5:GPU Kernel、编译与性能工程 Q55. 接到“训练吞吐下降 20...

AI Infra 面试题(四):LLM 推理引擎与在线服务

本文是AI Infra 面试题系列的 Level 4,覆盖 Q41-Q54。重点是KV Cache、PagedAttention、调度、SLO、P/D 分离、投机解码与量化。 上一篇:TP、SP、CP、PP 与 EP · 系列总索引 · 下一篇:Kernel、编译与性能工程 5. Level 4:LLM 推理引擎与在线服务 Q41. prefill 和 decode 的...

AI Infra 面试题(三):大模型多维并行

本文是AI Infra 面试题系列的 Level 3,覆盖 Q27-Q40。重点是Tensor、Sequence、Context、Pipeline、Expert Parallel 及组合选型。 上一篇:DDP、FSDP 与训练运行时 · 系列总索引 · 下一篇:推理引擎与在线服务 4. Level 3:Tensor、Sequence、Context、Pipeline 与 ...

AI Infra 面试题(二):DDP、FSDP 与训练运行时

本文是AI Infra 面试题系列的 Level 2,覆盖 Q13-Q26。重点是梯度同步、bucket overlap、ZeRO/FSDP、checkpoint 与数值诊断。 上一篇:GPU 与性能基础 · 系列总索引 · 下一篇:TP、SP、CP、PP 与 EP 3. Level 2:DDP、FSDP 与训练运行时 Q13. DDP 从 forward 到参数更新经...

AI Infra 面试题(一):GPU、通信与性能基础

本文是AI Infra 面试题系列的 Level 1,覆盖 Q01-Q12。重点是GPU 瓶颈、显存、Roofline、拓扑、collective、精度与 benchmark。 系列总索引 · 下一篇:DDP、FSDP 与训练运行时 2. Level 1:GPU 与性能基础 Q01. 一个 GPU workload 为什么可能算力利用率很低? 高分回答要点 先...

SGLang 请求处理全流程:从 Tokenizer 到 Scheduler、Radix 与输出

本文按固定源码版本逐段跟踪一个 SGLang 请求。先用 30 秒建立全局路径,再按模块解释问题、Input、实现、Output、性能收益、代价与正确性不变量。 另一篇:vLLM 请求全流程 · 调度器源码详解 · 面试题系列 · 源码实验手册 30 秒全流程概览 HTTP / OpenAI Chat Completion -> TokenizerManager:...

vLLM 请求处理全流程:从 HTTP 到 Scheduler、GPU 与流式输出

本文按固定源码版本逐段跟踪一个 vLLM 请求。先用 30 秒建立全局路径,再按模块解释问题、Input、实现、Output、性能收益、代价与正确性不变量。 另一篇:SGLang 请求全流程 · 调度器源码详解 · 面试题系列 · 源码实验手册 30 秒全流程概览 HTTP / OpenAI Chat Completion -> OpenAIServingChat...

vLLM / SGLang 面试源码深挖:优化机制与实验

本文是面试题系列的源码实验卷。它不重复罗列术语,而是用固定版本源码和 A100 实验回答可以被继续追问的工程细节。 本文不是框架功能清单,而是一组可以被继续追问的工程问题。每节固定回答:模块为什么存在、Input 是什么、状态如何变化、Output 给谁、优化改变哪个性能维度、代价是什么,以及当前源码和实测结果是否 支持这个判断。 实验日期为 2026-07-17,环境是...

vLLM / SGLang 深度面试:24 道完整答案与评分指南

本文保留 24 道综合题的长篇回答,适合模拟单题多轮深挖。按难度训练请从60 题系列总索引开始;需要实验数据与源码边界时继续阅读源码实验手册。 需要先按难度自测或用于组织面试时,见 VLLM_SGLANG_INTERVIEW_QUESTION_BANK.md: 60 道题按基础、生命周期、调度、KV/执行、高级优化和系统设计六档组织, 每题都提供回答思路、详细答案、主...

vLLM / SGLang 面试题(六):Staff 级系统设计与现场推演

本文是vLLM / SGLang 源码面试题系列第 6 卷,覆盖第 51-60 题。重点是SLO、容量、故障恢复、正确性不变量、扩展点与演进路线。 上一篇:高级优化、分布式与性能诊断 · 系列总索引 Level 6:Staff 级系统设计与现场推演 目标:确认候选人能组合前述机制,在不确定 workload、故障和多租户约束下做完整工程决策。 51. 设计一个 dea...

vLLM / SGLang 面试题(五):高级优化、分布式与性能诊断

本文是vLLM / SGLang 源码面试题系列第 5 卷,覆盖第 41-50 题。重点是投机解码、CUDA Graph、TP/EP、P/D 分离、量化与 benchmark。 上一篇:KV Cache 与 GPU 执行细节 · 系列总索引 · 下一篇:Staff 级系统设计与现场推演 Level 5:高级优化、分布式与性能诊断 目标:确认候选人不仅懂机制,还能判断优化...

vLLM / SGLang 面试题(四):KV Cache 与 GPU 执行

本文是vLLM / SGLang 源码面试题系列第 4 卷,覆盖第 31-40 题。重点是Paged KV、Radix Cache、Beam Search、slot mapping、attention backend 与显存。 上一篇:调度、准入与资源预算 · 系列总索引 · 下一篇:高级优化、分布式与性能诊断 Level 4:KV Cache 与 GPU 执行细节 目...

vLLM / SGLang 面试题(三):调度、准入与资源预算

本文是vLLM / SGLang 源码面试题系列第 3 卷,覆盖第 21-30 题。重点是Continuous batching、token budget、chunked prefill、公平性与背压。 上一篇:请求生命周期与模块契约 · 系列总索引 · 下一篇:KV Cache 与 GPU 执行细节 Level 3:调度、准入与资源预算 目标:确认候选人能解释 Sch...

vLLM / SGLang 面试题(二):请求生命周期与模块契约

本文是vLLM / SGLang 源码面试题系列第 2 卷,覆盖第 11-20 题。重点是HTTP 到 GPU 再到流式返回、IPC、状态所有权、取消与异步边界。 上一篇:推理服务基础 · 系列总索引 · 下一篇:调度、准入与资源预算 Level 2:请求生命周期与模块契约 目标:确认候选人能跟着真实对象和进程边界,从 HTTP 请求走到流式返回与资源释放。 11. ...

vLLM / SGLang 面试题(一):推理服务基础

本文是vLLM / SGLang 源码面试题系列第 1 卷,覆盖第 1-10 题。重点是Prefill/Decode、在线指标、批处理、采样、并行与基础容量分析。 系列总索引 · 下一篇:请求生命周期与模块契约 Level 1:推理服务基础 目标:确认候选人理解在线自回归推理的成本、指标和基本资源,而不是只会调用 API。 1. Prefill 和 Decode 分别...

NCCL 进阶面试实验题:20 个细节追问、源码与实测证据

这篇文章解决什么问题 54 道 NCCL 面试题详解已经覆盖了从 collective 语义到生产排障的完整知识面。这篇文章不再增加同层级名词题,而是把面试官常用来区分“看过 NCCL”和“真正做过 AI Infra”的细节继续向下追: 第一层:结论是否正确 第二层:能否画出数据、stream 和连接状态 第三层:能否定位 NCCL/PyTorch 的决定性源码 第四层:能否设计可证伪实...