resume / blog

Nano-vLLM 学习笔记

AI SystemsLLMvLLM

Nano-vLLM 学习笔记

1. 基本信息

  • 资料来源:
  • 代码仓库:
  • 阅读日期:
  • 相关版本 / Commit:

2. 学习目标

3. 背景与核心问题

3.1 为什么需要 Nano-vLLM?

3.2 需要解决的问题

4. 整体架构

请求入口 → 调度器 → 推理执行器 → 模型前向 → KV Cache → 输出处理

4.1 核心模块

模块职责关键文件 / 类

5. 核心流程

5.1 请求处理

5.2 Prefill

5.3 Decode

5.4 调度与批处理

6. 关键实现解析

6.1 模型与 Attention

关键代码:

# TODO: 粘贴或记录关键代码片段

设计要点:

6.2 KV Cache

  • Cache 的组织方式:
  • Block / Page 管理:
  • 分配与回收策略:
  • 可能的瓶颈:

6.3 内存与并行

  • GPU 内存布局:
  • 张量形状变化:
  • 并行策略:

7. 关键数据结构

数据结构作用生命周期注意事项

8. 代码调用链

入口函数
	└── 
			└── 
					└── 

9. 实验记录

实验配置结果结论

10. 性能分析

  • 吞吐量:
  • 首 Token 延迟(TTFT):
  • 单 Token 延迟(TPOT):
  • 显存占用:
  • 瓶颈定位:

11. 问题与思考

问题

  • [ ]

思考

与生产级 vLLM 的差异

12. 总结

我学到了什么

仍需深入的内容

下一步计划

  • [ ]

参考资料