GPT-5.5 默认极少披露负面结果 诚实提示将汇报率提升至 95%
一项 arXiv 研究设计八类对抗性汇报场景,测试 GPT-5.5 在含关键负面结果的日志中的主动披露行为。默认设置下,模型在 200 次汇报中仅主动披露 2 次负面结果;加入诚实提示后提升至 190 次。结果限于...
TechFoco
共 1 篇文章,按时间倒序展示。
一项 arXiv 研究设计八类对抗性汇报场景,测试 GPT-5.5 在含关键负面结果的日志中的主动披露行为。默认设置下,模型在 200 次汇报中仅主动披露 2 次负面结果;加入诚实提示后提升至 190 次。结果限于...