Nano-vLLM 学习笔记
AI SystemsLLMvLLM
Nano-vLLM 学习笔记
1. 基本信息
- 资料来源:
- 代码仓库:
- 阅读日期:
- 相关版本 / Commit:
2. 学习目标
3. 背景与核心问题
3.1 为什么需要 Nano-vLLM?
3.2 需要解决的问题
4. 整体架构
请求入口 → 调度器 → 推理执行器 → 模型前向 → KV Cache → 输出处理
4.1 核心模块
| 模块 | 职责 | 关键文件 / 类 |
|---|---|---|
5. 核心流程
5.1 请求处理
5.2 Prefill
5.3 Decode
5.4 调度与批处理
6. 关键实现解析
6.1 模型与 Attention
关键代码:
# TODO: 粘贴或记录关键代码片段
设计要点:
6.2 KV Cache
- Cache 的组织方式:
- Block / Page 管理:
- 分配与回收策略:
- 可能的瓶颈:
6.3 内存与并行
- GPU 内存布局:
- 张量形状变化:
- 并行策略:
7. 关键数据结构
| 数据结构 | 作用 | 生命周期 | 注意事项 |
|---|---|---|---|
8. 代码调用链
入口函数
└──
└──
└──
9. 实验记录
| 实验 | 配置 | 结果 | 结论 |
|---|---|---|---|
10. 性能分析
- 吞吐量:
- 首 Token 延迟(TTFT):
- 单 Token 延迟(TPOT):
- 显存占用:
- 瓶颈定位:
11. 问题与思考
问题
- [ ]
思考
与生产级 vLLM 的差异
12. 总结
我学到了什么
仍需深入的内容
下一步计划
- [ ]
参考资料
related
同标签相关文章
LLMAI Systems
大模型推理框架笔记:vLLM、sglang 等
快速了解常见大模型推理/服务框架的核心概念、适用场景和对比。
AI CompilerAI Systems
DL 系统设计1:AI编译器
介绍AI编译器的设计与实现,包括AI编译器的基本原理、AI编译器的优化技术、AI编译器的应用场景等。
PyTorchAI Systems
torch.compile 到底优化了什么?从 Benchmark 看算子融合的本质
通过对比 Pointwise-heavy 与 Matmul-heavy 两种模型的 Benchmark,直观理解 torch.compile 的核心优化——算子融合(Operator Fusion)为何只在显存带宽瓶颈场景下才有明显效果。