livenerf 开源工具用固定评测追踪模型能力漂移
livenerf 是一个开源工具,通过固定提示、命令行界面(CLI)版本和评分器,重复测试同一组问题并记录准确率、输出 token 与原始日志,用于区分模型上线后的真实漂移与随机波动。Opus 5.5 系列的基线仍...
livenerf 是一个开源工具,目标是用固定评测追踪模型上线后的能力变化。它锁定提示、命令行界面(CLI)版本和评分器三个关键条件,针对同一组问题反复测试,从而把评测变量本身的噪声压到最低。每一次运行都会记录准确率、输出 token 数量和原始日志,为后续对比提供相对稳定的数据底座。
这个设计让评测结果不再只是一个分数。准确率反映任务完成度,token 用量和原始日志能够帮助定位模型输出在结构或表达方式上的变化。当两次运行的结果出现差异时,这些记录为判断差异来源提供了依据,而不是直接把波动归因于模型本身。
目前 Opus 5.5 系列的基线数据仍在收集中。由于样本尚未完成,现有的波动还不能支撑模型被降低能力的结论。在基线不完整的情况下,任何短期变化更适合被视为待观察信号,而非系统性的能力漂移。
另一个需要注意的边界是评测路径。livenerf 测量的是 Claude Code 订阅服务路径,这与直接访问原始 API 模型并不等同。订阅服务路径可能受到额外封装、调度策略或其他中间层的影响,因此在把结论外推到 API 模型之前需要保持谨慎。
对于持续跟踪模型表现的团队而言,livenerf 提供了一个相对完整的参照模板。固定关键测试条件、记录原始数据、区分服务路径,这些做法有助于减少环境噪声带来的误判,也便于在出现异常时回溯定位。不过,目前公开信息尚未说明其安装方式、许可证类型以及评分器的具体实现。