从 TTFT 到工程闭环:10 周 LLM 推理优化路线
GitHub 项目 time-to-first-token 提供 10 周 50 课时路线,围绕同一个 OpenAI 兼容推理服务持续迭代,覆盖 Roofline 分析、vLLM 与 SGLang 源码、量化、投机...





GitHub 上的 time-to-first-token 项目提供了一个为期 10 周、共 50 个课时的学习方案。参与者需要持续迭代同一个 OpenAI 兼容的推理服务,而不是完成彼此独立的 Demo。

课程内容从 Roofline 模型分析开始,延伸到 vLLM 与 SGLang 源码解读、量化压缩、投机采样,以及 Kubernetes 上的存算分离部署。终点是在租用的 GPU 上完成支撑 1000 次并发请求的压力测试,并产出可复现的性能基准报告。

路线强调先测量再优化,通过监控首字延迟(TTFT)和 Token 间延迟来建立观察系统。这种安排把优化工作从经验性调参转向可量化的工程成本控制,更接近生产环境中定位瓶颈的方式。
社区评论指出,目前 90% 的教程止步于环境配置,真正的瓶颈常出现在 KV Cache 内存碎片以及 Prefill 与 Decode 阶段算力不对称等环节。该项目的连续迭代设计,正好将这些容易被跳过的部分重新纳入主线。
对工程团队而言,可以借鉴其目标设定:为延迟指标建立监控,用 1000 并发和可复现报告作为压测基线,并评估量化压缩与投机采样对吞吐、延迟和模型质量的影响。运维侧则需要关注 Kubernetes 存算分离带来的调度与缓存变化。
目前公开信息没有说明具体 GPU 型号、压测数据集与请求分布,项目许可证和依赖环境也尚未披露。因此,基准结果是否能在自己的硬件上直接对比,仍需要开发者在复现前确认。




