华中科技大学 · 2027 年首次开课

大模型推理系统
与实践

LLM Inference Systems and Practice

从一次请求出发,理解队列、调度、Prefill、Decode、KV Cache、执行路径与结果指标如何组成一个可验证的在线推理系统。

Choose a route

按你的时间选择材料

三套课件共享同一术语、算例和研究边界,但服务不同教学节奏。

One request, end to end

用一条请求串起整门课

课程不把推理缩成一次前向计算,而是追踪请求、状态、控制点和指标的完整闭环。

  1. 01输入聊天模板与 Tokenizer
  2. 02准入等待队列与资源检查
  3. 03调度Token、KV 与执行预算
  4. 04Prefill处理上下文并建立 KV
  5. 05Decode逐步生成并更新状态
  6. 06返回采样、流式输出与释放
  7. 07验证TTFT、TPOT、P99、Goodput

16-hour core course

八讲主课程

从系统边界进入,经过机制、架构与优化,最后落到论文验证和开源项目。

Read · Run · Verify

从课件走向系统实践

CODE

Nano-vLLM 教学代码

沿着请求入口、调度器、KV 管理和模型执行路径阅读一套最小可运行实现。

进入代码 ↗
LAB

实验与课程项目

从环境检查、最小复现到可审计实验记录,把系统主张落实为证据。

查看实验 ↗
READ

Tutorial 与研究案例

结合 vLLM、SGLang、DistServe、Mooncake、FlashInfer 等工作理解机制边界。

阅读 Tutorial ↗

Single source of truth

所有正式材料只在课程仓库维护

主页负责导航,PPTX、PDF、源码与实验材料保持在同一版本历史中。课程仓库当前为私有仓库,下载材料需要相应的 GitHub 权限。