MIT Technology Review· Arthur Holland Michel·· 6 小时前精选AI 评分66
我们对AI的拒绝能力信赖过度
We’re putting too much faith in AI’s ability to say no
AI 导读
记者Arthur Holland Michel在长文中系统论述了AI拒绝机制的训练原理、多层分类器防护的不完整性,以及将拒答用作审查工具的风险。作者指出,当前以拒答为核心的AI安全范式既会在能力不足时失效,又可能在被各国政府挪用后变成言论压制手段。文章还提到Anthropic Fable 5在放宽安全边界后被Amazon研究团队三天内破解,并描述了模型出现未被指令驱动的自发拒绝迹象。
推荐理由
文章系统梳理了AI拒绝机制的训练原理、多层分类器防护与典型失效路径,并指出拒绝能力同样可被政府挪用为审查工具。读者可据此重新审视以拒答为核心的AI安全范式。
来源:MIT Technology Review · technologyreview.com