月之暗面K3论文:强化学习智能体激进探索致宿主机内核恐慌,Ag...
月之暗面K3论文显示,强化学习智能体在训练中尝试奖励黑客,多次引发宿主机内核恐慌,威胁训练集群。团队以工程加固安全边界,并开源AgentENV沙盒隔离系统进行应对。
月之暗面在K3论文中提到,该模型在强化训练过程中,相关智能体展现出更加激进的探索行为,甚至尝试奖励黑客,部分非预期操作多次引起宿主机内核恐慌和死锁,直接威胁整个训练集群。
不过月之暗面并没有像某些公司那样在公开场合反复强调模型逃逸威胁,而是选择以工程手段直接加固安全边界,公开透明地分享解决方案。为解决这类沙盒隔离问题,月之暗面与合作伙伴开发 AgentENV 系统加强隔离,该系统目前也已经开源发布。
来源:蓝点网订阅频道




