SGLang 发布 Kimi K3 Day0 适配与架构解读
SGLang 团队发布 Kimi K3 Day0 适配文章,围绕可原地修改的 KDA 循环状态重新设计前缀缓存,并以统一内存池让 KDA 状态与 MLA KV 缓存共享显存。接入 DSpark 投机解码后单请求生成...




SGLang 团队发布了适配 Kimi K3 的详细文章,包含大量可视化图表,可以作为 K3 架构解读。文章重点放在围绕 KDA 循环状态与 MLA 注意力特性,重新设计缓存、内存和并行策略。

在缓存与内存侧,KDA 循环状态支持原地修改,直接复用前缀缓存容易引入并发竞态。SGLang 采用写时复制、快照和状态转交来避免竞态并实现状态复用,同时通过统一内存池让固定大小的 KDA 状态与随 token 增长的 MLA KV 缓存动态共享显存。部署时可能需要关注状态一致性与显存分配策略。

投机解码方面,SGLang 接入 DSpark,根据预测置信度和实际硬件成本动态裁剪不值得验证的候选 token。ReplaySSM 不保存每一步的完整状态,而是保存轻量原始输入并在确认后重放,使草稿窗口相关内存下降约 32 倍。文章给出的单请求生成速度在投机解码前约 113 token/s,加入 DSpark 后约 423 token/s;不过这些数据对应的硬件、批大小、上下文长度和精度配置尚未披露,不宜直接作为通用基准。
预填充与解码采用不同并行方式:预填充使用分块流水线并行,解码使用按 token 位置切分 KV 缓存的 DCP。DCP8 将逻辑 KV 容量从约 150 万 token 提升至 1220 万 token,部分吞吐配置达到每 GPU 2,808 token/s。结合预填充/解码分离,这套方案更倾向于用不同阶段的切分策略扩展长上下文容量与吞吐,实际收益仍依赖目标负载和生产配置。
训练侧,Miles 支持在原生 MXFP4 权重上进行 LoRA 强化学习,只需同步 BF16 LoRA 适配器。在一次 64 张 GB300、持续 12 小时的数学训练实验中,AIME 2024 贪心评测成绩从 43.3% 提升到 76.7%,训练端与推理端分布差异保持稳定。这种设计可能减少通信开销,但具体任务上仍需要评估训练与推理的分布差异。材料未说明相关实现是否开源及许可证。

