智能体安全设计需将紧急停止与审计置于模型之外
纳德拉提出智能体安全新原则:紧急停止和审计功能必须独立于大模型本身,通过分离模型与编排器、动作执行及权限控制实现人为干预能力,并要求关键操作留有防篡改、可读、可验证的日志。
微软CEO纳德拉在推文中明确指出,智能体系统的紧急停止与审计能力不应内嵌于模型内部,而必须作为外部治理层存在。这一主张直指当前多数AI系统将控制逻辑耦合进推理流程的设计惯性。
具体实现路径是解耦:模型仅负责生成指令,编排器调度执行,动作模块调用工具,权限系统实时拦截或放行。三者与模型之间需有清晰、不可绕过的边界。
获授权人员须能在任务任意阶段发起暂停或终止,该能力由独立控制平面保障,不依赖模型是否响应或输出是否可信。这意味着中断指令的接收、鉴权与生效,必须脱离LLM推理链路。
所有重要动作须生成结构化、带数字签名的日志,确保内容可读、不可篡改,并支持第三方工具进行独立验证与故障注入测试。这不仅是记录,更是可验证的运行证据。
需要强调的是,该方案目前仅为系统设计建议,尚未形成标准化接口或通用开关;也无证据表明已有模型因此类缺陷被实际攻破。工程落地仍需定义编排协议、权限分发机制与日志格式等细节。