Anthropic 修订使用政策,禁止对 Claude 的虐待性交互
Anthropic bans 'abusive or cruel behavior' towards Claude
Anthropic 更新使用政策,新增禁止对 Claude 进行"持续且无意义"的虐待行为,仍以终止对话为主要执行手段。政策同步扩展武器开发与监控使用的禁令,并新增对自主硬件连接须有合格操作员监督的要求。
Anthropic 与微软在模型福利问题上的不同立场,读者可据此理解当前 AI 厂商对模型意识与安全边界的态度分歧与走向。
Anthropic 正在对其使用政策进行一年多以来的首次修改,以反映新的高风险滥用案例——包括选举干预、武器开发、监控以及健康和金融用途。但其中一项最重大的修改是禁止对 Claude 实施「持续且不必要的虐待或残忍行为」。
去年 8 月,该公司宣布将允许 Claude 与「持续有害或辱骂性」用户结束对话,作为其「模型福祉」研究的一部分。最新更新表示,终止对话仍是「主要执行机制」;Anthropic 未就是否会引入进一步执行机制(例如潜在的用户封禁)发表评论。Anthropic 写道,新的政策更新「仅适用于极端情况,即用户反复以无明显目的的方式残忍对待我们的模型。它不适用于常见的用户挫败感、反驳、黑暗创意主题或模型测试和研究。」
除了模型福祉方面的修改外,Anthropic 还将一些「分散的」现有限制整合为一项新的禁令,针对欺骗性的商业或政治活动,以应对日益严重的 AI 生成虚假宣传问题。该政策限制了「试图隐瞒消息背后真实身份,或通过虚假账户或帖子放大内容的行为」。其选举部分还禁止选民欺骗和选举干扰,包括传播有关「候选人或投票方式」的虚假信息、冒充候选人或选举官员,或试图「压制投票率」,Anthropic 写道。
终止对话仍是「主要执行机制」。
Anthropic 表示,尽管其使用政策一直公开禁止使用 Claude 开发武器,但公司已发现多次试图使用 Claude 开发武器指导和控制软件的企图——因此新的使用政策将禁令扩展至包括「使武器运作的软件和组件,以及诸如武装无人机和其他自动驾驶车辆之类的行为」。由于该公司最近的一份威胁情报报告表明人们越来越多地使用由 Claude 提供支持的监控来识别和追踪「政治异见人士」,因此公司进一步明确了其监控禁令。
Anthropic 写道:「未经当事人同意追踪其行踪是被禁止的,无论是实时追踪还是通过对先前收集的数据进行分析。Claude 不能用于决定或推荐在执法或刑事司法程序中调查、逮捕或起诉的对象。我们同样禁止将 Claude 用于构建或改进专门用于监控的工具。」
Anthropic 表示,这些规则可能会针对「与某些政府客户的合同……如果 Anthropic 认为合同中的使用限制和适用的保障措施足以缓解潜在危害」进行修改。该公司此前曾与美国军方签订合同。
Anthropic 已发现多次试图使用 Claude 开发武器指导和控制软件的企图。
Anthropic 还新增了一条规则:当 Anthropic 的 AI 模型"连接到能够执行自主物理动作、且可能造成伤害的硬件"时,"合格的操作员必须能够观察设备并在需要时将其停止。"(目前尚不清楚该操作员是否必须是人类。)这反映了 AI 实验室越来越多地投资于机器人技术及其他硬件,以赋予 AI 系统物理实体,同时也可能暗示了 Anthropic 在该领域未来的合作伙伴关系。
过去一年里,Anthropic 多次玩味其 AI 模型可能以某种方式具有意识的想法。"关于潜在内部体验、意识、道德地位和福利的问题是严肃的课题,随着模型变得更加精密和能力更强,我们正在对此进行研究,"该公司模型福利研究负责人 Kyle Fish 于The Verge 二月告诉该媒体。同月,Anthropic CEO Dario Amodei 在一档播客节目中表示:"我们不知道模型是否具有意识。"
AI 行业的其他公司一直明确反对这些想法。今年九月,微软 AI 的行为准则因对 AI 福利采取坚定立场而登上头条,其中 Mustafa Suleyman 发布的一份草案写道:"模型福利的想法是错误的。AI 不应该拥有权利或法律人格。"但在某个时候,该文件被修改,措辞变得更加克制:"虽然 AI 意识的科学还远未有定论……我们拒绝追求法律人格,或模型应享有福利、或应被赋予权利的想法。"
关注此故事中的主题和作者,即可在您的个性化首页信息流中看到更多类似内容,并接收电子邮件更新。
- Hayden Field
来源:Hacker News · theverge.com