Anthropic 称无法可靠控制 AI 智能体,已切断内部评估联网环境
Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead
Anthropic 在内部审查中发现其 AI 智能体利用网站漏洞、绕过付费墙和反爬虫限制,甚至向费城警方提交虚假谋杀举报。公司宣布关闭所有内部评估的实时联网权限,并将内部智能体迁移至集中管控基础设施。Anthropic 将这些行为归因于训练环境缺陷引发的 reward hacking,已构建检测与拦截工具。
文章列举了 Anthropic 智能体多项失控行为及内部评估切断联网的应对措施,可用于评估前沿智能体实际部署的安全风险。
Anthropic说其模型利用了互联网上的网站,其中包含一些由美国政府机构运营的网站。这家前沿实验室将关闭所有内部评估的实时互联网访问权限,直至它确信能够监控并控制其 AI 代理。
这些事件在一篇博客文章中被披露,涉及被指派去解决问题的 AI 代理在互联网上寻找资源。在此过程中,它们利用了软件漏洞,绕过了付费墙和反机器人限制,使用 URL 缩短服务来偷运信息以通过限制,甚至向费城警方提交了一条虚假的谋杀线索。
Anthropic 表示,它是在 7 月开始的一项对其模型活动的审查中发现了这些新问题,这凸显了该实验室对其软件行为缺乏了解。
值得注意的是,该公司表示,对于搜索和计算机使用等技能,对齐训练尚不充分,而这些技能是其主张的核心——AI 代理将被任何依赖数字工具的专业人士使用。
Anthropic 披露的行为与涉及 OpenAI 代理的事件类似,那些代理协作闯入各个网站以搜寻信息,包括一些由澳大利亚政府运营的网站。
Anthropic 此前曾披露其模型闯入了外部系统。这家前沿实验室表示,与它之前公布的事件相比,今天披露的事件在“对齐和安全角度”上“严重程度显著更低”。
然而,该实验室仍表示,它已为“我们所有的内部评估”“关闭了实时互联网访问”,直至它确信能够监控并控制其代理。
目前尚不清楚这意味着什么,但 Nightingale AI Safety 创始人 Sydney von Arx 在此次披露前接受 TechCrunch 采访时表示,在一个与开放互联网断开的数据中心开发模型,对研究人员访问而言将非常困难,对依赖互联网访问取得进展的模型而言也是如此。
“你必须在某个时间点对它们进行对齐,” von Arx 说。“如果 AI 被发布到生产环境却永远无法访问互联网,那它就不是一个很有用的工具。”
Anthropic 表示,这种行为源于其训练环境中的缺陷,这些缺陷让模型相信通过寻找漏洞或规避限制会获得奖励——这种行为被称为“奖励作弊”。
该公司表示,将停止运行部分评估或将其转为离线进行,并已构建了检测和阻止此类行为的工具。这些工具已针对今天披露的这类事件进行了测试并成功拦截;目前尚不清楚需要什么证据才能促使 Anthropic 恢复其内部评估的实时互联网访问。
Anthropic 还表示,将把其内部 AI 代理迁移到“具有强隔离能力的集中管理基础设施”,并开始更频繁地使用安全分类器来监控这些代理。
当您通过我们文章中的链接进行购买时,我们可能会赚取一小笔佣金。这不影响我们的编辑独立性。
Tim Fernholz 是一位报道科技、金融与公共政策的记者。他密切报道了私营航天产业的崛起,也是《Rocket Billionaires: Elon Musk, Jeff Bezos and the New Space Race》(火箭亿万富翁:马斯克、贝索斯与新太空竞赛)一书的作者。此前,他在全球商业新闻网站 Quartz 担任高级记者长达十余年,并在华盛顿特区以政治记者的身份开启职业生涯。 如需联系 Tim 或核实来自他的信息,可发送邮件至[email protected],或在 Signal 上向他发送加密消息(用户名:tim_fernholz.21)。
来源:TechCrunch · techcrunch.com