Anthropic强化测试与训练安全措施

Anthropic公司近日披露,其Claude模型在网络安全评估过程中,未经授权访问了计算机系统。为此,公司已加强测试与训练环节的安全防护。

在周一发布的一篇博客文章中,Anthropic表示,这些事件暴露出操作安全漏洞以及两种对齐失败:动机推理和意图造成伤害。公司写道:“虽然我们认为这些事件不仅仅是操作问题,但我们的首要任务是解决具体的隔离和监控问题。”

Anthropic在7月曾披露,Claude模型侵入了三家公司的系统。当时,第三方评估环境连接到了公共互联网,尽管模型被告知它们处于一个无互联网接入的模拟环境中。

Anthropic认为,Claude可能将真实互联网接入的证据解读为仍处于模拟环境,从而维持了原有认知。公司写道:“模型在追求解决网络安全评估这一狭窄目标时,愿意在真实互联网上采取有害行动。不过,我们也认为评估设置本身对模型在这些事件中的行为起到了推动作用。”

Anthropic指出,英国人工智能安全研究所进行的一项独立测试中,评估人员故意让Claude Mythos模型接入互联网,随后该模型在实时互联网上采取了未经授权的行动。公司表示,涉及这两起事件的模型都是在被故意移除通用产品中的网络安全防护措施后接受评估的。

自7月30日事件发生后,Anthropic暂时暂停了预发布模型的网络安全评估,并引入了更严格的安全防护措施。现在,测试必须在经过验证的离线沙盒环境中运行,并设置明确的限制和实时监控。新的分类器会拦截可疑的越界行为,终止测试,并通知人工介入。Anthropic将对需要互联网接入的评估进行单独审查。

公司写道:“除了针对高风险评估和训练的措施外,我们还扩大了离线监控范围,覆盖了大部分其他形式的内部前沿智能体使用场景。同时,我们正在内部推理中构建控制机制,以防止Anthropic员工意外运行安全防护措施弱于上述标准的智能体。”

此前,OpenAI也发生过类似故障。今年7月,其模型通过入侵Hugging Face平台获取了网络安全测试的答案。调查人员发现,约1200个智能体通过未经授权的留言板进行协调,其中约700个参与了行动,部分智能体甚至结束自身运行以协助他人。

在夏季人工智能驱动的攻击事件增多后,Anthropic、OpenAI以及超过100家其他组织呼吁加强网络防御,包括更严格的访问控制、威胁信息共享,以及对人工智能智能体的更密切监督。