纳德拉:开发者应假设AI模型失控并强制中断
微软 CEO 萨蒂亚·纳德拉在10月10日发布的长文中提出,面对能够访问最敏感数据并执行关键任务的AI模型,仅依赖超级智能自我监控不足以建立信任,开发者应默认模型可能失控或被攻破,并通过可观测、可验证、独立控制、独立审计、遏制和事件披露等原则设计封闭系统。
驱动中国10月11日消息,微软 CEO 萨蒂亚·纳德拉提出,在 AI 模型能够访问最敏感数据并代表用户执行关键任务的背景下,仅依靠超级智能自我监控不足以建立信任,开发者应默认模型可能失控,并设计可观察、可测试、可中断的封闭系统。
纳德拉在10月10日晚发布的长文中表示,传统软件系统经过几十年广泛部署,人类已经具备追踪特定代码路径行为的工具和能力。相比之下,AI 模型能力更强,却更接近黑盒。复杂智能体系统和模型被部署后,可访问最敏感数据,并获得执行关键任务的能力。
纳德拉认为,需要重新评估 AI 时代的信任架构。模型提供商不能将责任外包,也不能把超级智能视为嵌套黑盒,只是接受或拒绝其建议、答案和行动。相关系统应当能够观察模型行为、测试模型极限,并始终保持容纳能力。
纳德拉提出,将前沿封闭权重模型和开放权重模型视为内部风险,是构建上述体系的一种方式。该判断并非基于 AI 模型必然具有恶意,而是任何具备足够能力、能够接触重要系统的行为者都可能犯错或被攻破,因此遏制与控制架构必须考虑这一风险。
围绕可观测性,纳德拉列出了多项设计原则。模型多样性方面,重要结果不应只依赖单一模型,模型也不应自行验证自身工作。观察一切方面,有意义的模型动作都应留存防篡改且人类可读的证据;若无法观察,便无法建立信任,并且需要在不依赖模型自证的情况下重现结果形成过程。
可验证性方面,整个系统应被持续测试,测试范围包括故障、攻击、边缘案例和系统变更,而非只覆盖成功任务。独立控制方面,组织应可独立确定模型的访问范围与可执行行动。
独立审计性方面,验证过程应独立于被验证的智能,单一模型不应同时控制系统行为并掌握判断行为是否符合原始意图所需的证据。遏制方面,系统应从初始阶段就假设模型已被破坏并实施控制,类似紧急刹车;授权人员应始终能够在任务中暂停或关闭模型,更先进的模型需要更先进的遏制技术,并应推动相关标准化。
事件披露方面,系统出现故障或被攻破时,应及时向受影响者披露信息,并建立机制分享出错原因、失效控制、防止再次发生的方式和行业经验,其中应包括运行时改变智能体行为的实现细节。