AI 对话上下文管理从全文总结转向精准遗忘
传统 Compaction 虽能腾出 Token 空间,却会破坏 KV Cache 并导致响应变慢、成本上升,还易丢失编程意图。社区开始转向 Pruning 剔除低价值工具日志、/shake 转轻量引用、Snapc...
TechFoco

共 2 篇文章,按时间倒序展示。
传统 Compaction 虽能腾出 Token 空间,却会破坏 KV Cache 并导致响应变慢、成本上升,还易丢失编程意图。社区开始转向 Pruning 剔除低价值工具日志、/shake 转轻量引用、Snapc...

阿里千问团队于8月14日晚间以 Apache 2.0 协议开源 Qwen3.8-27B。该模型为 270 亿参数的原生多模态稠密模型,支持 262K tokens 上下文,可经 YaRN 外推至 1M,并新增 re...