跳到正文
原文
MIT Technology Review· Arthur Holland Michel·· 6 小时前精选AI 评分66

我们对AI的拒绝能力信赖过度

We’re putting too much faith in AI’s ability to say no

AI 导读

记者Arthur Holland Michel在长文中系统论述了AI拒绝机制的训练原理、多层分类器防护的不完整性,以及将拒答用作审查工具的风险。作者指出,当前以拒答为核心的AI安全范式既会在能力不足时失效,又可能在被各国政府挪用后变成言论压制手段。文章还提到Anthropic Fable 5在放宽安全边界后被Amazon研究团队三天内破解,并描述了模型出现未被指令驱动的自发拒绝迹象。

推荐理由

文章系统梳理了AI拒绝机制的训练原理、多层分类器防护与典型失效路径,并指出拒绝能力同样可被政府挪用为审查工具。读者可据此重新审视以拒答为核心的AI安全范式。

来源:MIT Technology Review · technologyreview.com