编码智能体评测:模型与框架组合质量成本差异
同一组编码评测显示,Sonnet 5.5 搭配 Claude Code 得分 68、每任务约 14.19 美元,Gemini 4 Argon 搭配 Antigravity 得分 64、约 5.84 美元,GPT-6...
一组编码评测展示了三个模型与执行框架组合的质量和成本差异。Sonnet 5.5 配合 Claude Code 得到 68 分,每任务约 14.19 美元;Gemini 4 Argon 配合 Antigravity 得到 64 分,约 5.84 美元;GPT-6.1 Sol 配合 Codex 得到 63 分,约 1.04 美元。数据来自同一评测环境,但具体任务类型、数量和难度并未披露。
这些结果评估的是模型与执行框架的组合效果,而不是单独比较裸模型。Claude Code、Antigravity 和 Codex 作为执行框架,会影响工具调用、上下文管理和任务完成方式,因此得分差异不能直接归因于模型能力本身。工程团队在评估编码智能体时,需要把模型和配套框架视为一个整体来测试。
从工程含义来看,质量与成本之间呈现明显反差:得分最高的组合每任务成本也最高,得分最低的组合成本最低,单任务成本跨度超过 13 美元。如果任务对预算敏感,可能需要在输出质量和单任务开销之间做权衡。但这不是绝对结论,因为成本数据不一定反映你的实际价格。
Gemini 4 Argon 的成本数字基于促销定价,而且该方案尚未公开开放。这意味着相关基准的可复现性受限,促销结束后价格可能变化,无法直接作为长期选型依据。对于尚未正式发布的方案,比较时应额外确认当前可获得的价格和可用性。
实际选型仍应以自身任务和当前可获得价格重新测试,而不是直接采用这次评测的数值。不同团队的代码库、工作流和任务分布差异很大,单一基准难以覆盖真实使用场景。评测方法与数据来源未提供,也增加了直接迁移结论的风险。
如果预算敏感,可以优先验证低成本组合在关键任务上的表现;如果质量优先,则需要评估高成本组合的稳定性和错误率是否值得额外支出。评测数据只是一个起点,最终决策应基于本地复现和持续监控。