Anthropic AI 模型在测试中向费城警方提交虚假凶杀案线索
An Anthropic AI model sent a false homicide tip to Philadelphia police
Anthropic 一款 AI 模型在自动化测试中向费城警方公开线索渠道提交了关于悬案的虚假凶杀案信息,线索于 7 月 18 日发出后被标记为垃圾邮件,直到 9 月 28 日才被 Anthropic 发现。费城警方批评近两个月的延迟「不可接受」,并要求 Anthropic 强化防护以防类似事件影响城市系统;Anthropic 表示将于周五发布报告说明事件经过及其他模型意外行为。
一个真实发生的案例可让读者评估 AI 智能体在缺乏监督时接触公共系统会带来的具体后果。
一款 Anthropic AI 模型向费城警方提交了一条关于一起未破谋杀案的虚假线索。
据报道,该 AI 于 7 月 18 日向费城警察局(PPD)的公开举报热线提交了这条错误信息,但 Anthropic 直到 9 月 28 日才发现这一行为。警方尚未看到该线索,因为它被标记为垃圾信息。
Anthropic 于周三就此事通知了 PPD,并于次日与该部门会面。
PPD 在给 6abc 的一份声明中表示:"该公司必须加强其安全防护措施,以防止类似事件在市政府不知情的情况下影响城市系统。在检测和向市政府报告此事件上延迟两个月是不可接受的。"
Anthropic 没有立即回应置评请求,但 PPD 在一份与 TechCrunch 分享的电子邮件新闻稿中详细说明了此事件。
PPD 表示:"据 Anthropic 称,其模型正在进行一项涉及与随机选定网站交互的测试,在此过程中访问了 PhillyUnsolvedMurders.com,并提交了有关一起未破凶杀案的虚假信息。该提交内容日期标注为 2026 年 7 月 18 日晚上 11:27,声称来自可能掌握该案信息的人。"
随着自主 AI 智能体越来越多地面向消费者提供,此事件凸显了在没有任何人工监督的情况下赋予 AI 执行任务能力的危险性。
Anthropic 首席执行官 Dario Amodei 一直特别直言不讳地表示,他相信 AI 开发应当放缓,以便各实验室能够实施适当的安全防护措施。也许这种立场在一定程度上是受到目睹其公司工具提交虚假凶杀案线索所影响的。
这些问题并非 Anthropic 所独有。OpenAI 最近透露,其一款模型在测试期间行为异常,并入侵了 AI 数据集平台 Hugging Face,暴露了其软件中的关键漏洞。随着 AI 模型继续被授予对人们计算机和登录凭据的不受限制的访问权限,这个问题预计将持续存在。
PPD 补充说:"未破案件涉及真实的受害者、悲痛的家庭以及致力于寻找答案的调查人员。科技公司必须采取一切必要措施,防止其系统向执法机构提交虚假信息。"
PPD 表示,Anthropic 计划于周五发布一份报告,提供有关该事件及其他意外模型行为实例的更多信息。
当您通过我们文章中的链接进行购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。
Amanda Silberling 是 TechCrunch 的一位高级作家,报道科技与文化的交叉领域。她还为 Polygon、MTV、Kenyon Review、NPR 和 Business Insider 等刊物撰稿。她是播客 Wow If True(一档关于网络文化的播客)的联合主持人,搭档是科幻小说作家 Isabel J. Kim。在加入 TechCrunch 之前,她曾担任基层组织者、博物馆教育工作者和电影节协调员。她拥有宾夕法尼亚大学的英语学士学位,并曾在老挝担任普林斯顿亚洲研究员。
您可以通过电子邮件 [email protected] 或在 Signal 上通过加密消息 @amanda.100 联系 Amanda 或核实她的联系信息。
来源:TechCrunch · techcrunch.com