MiMo-V2.6 披露代码质量分组评分方法
MiMo-V2.6 报告提出多维代码补丁评分机制,涵盖必要性、精度、副作用与风格一致性,并将依赖泄漏答案的轨迹奖励归零。该方法属训练评估框架,非已部署的自动审查功能。
MiMo-V2.6 报告首次公开了代码质量分组评分方法,标志着代码智能体训练评估从二元测试通过/失败转向多维度质量刻画。这一变化直接回应了单纯依赖测试用例覆盖导致补丁工程合理性被忽视的问题。
新方法显式引入四个可评估维度:补丁是否必要、实现是否精确、是否引入意外副作用、是否符合目标代码库的风格规范。每个维度独立打分,支持更细粒度的策略优化。
特别地,报告明确将确认存在依赖泄漏(即模型利用测试答案而非真实推理生成补丁)的轨迹,其奖励值强制设为零。这是一种强约束型奖励塑形,旨在切断对数据泄露路径的策略偏好。
该机制属于训练与离线评估阶段的方法论升级,不等同于可集成到开发流程中的实时审查工具。工程落地需配套设计多目标奖励函数,并校准各维度权重。
当前未披露具体实现语言适配范围、评分量化标准及CI/CD集成能力。评测流程需同步拆解功能性验证与代码质量评估两个环节,避免指标混淆。



