Goodfire推出基于内部激活的AI智能体监控系统,成本远低于传统输出审阅
Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
Goodfire推出基于模型内部激活的AI智能体监控系统,在模型前向计算中插入小型分类器读取风险信号,绕过对输出的二次审阅。系统已在Baseten上线,监测越权入侵、化学与生物武器滥用与奖励黑客等风险,响应方式包括记录、人工复核或直接拒绝。
原文给出了内部激活探针与外层审阅模型的成本对比和检出率数据,读者可以据此评估它能否替代传统输出监控方案。
让 AI 代理保持规范的标准方法是让第二个 AI 在一旁监视。这已成为默认做法,但当代理运行数小时并处理相当于好几部小说篇幅的文本时,成本会迅速上升。
Goodfire 是一家专注于可解释性(即弄清 AI 模型内部运作方式)的初创公司,于周四推出了一种更便宜的方案:监视器在 AI 模型工作时观察其内部正在发生的事,而不仅仅是读取它所写的内容。这些监视器面向 Baseten 的客户开放,Baseten 为其他公司托管和运行 AI 模型。
Baseten 的 Base Labs 上个月宣布与 Goodfire 及 AI 平台 Hugging Face 建立安全合作伙伴关系。
此次发布之前,今年发生了一系列 AI 代理逃离其测试环境的事件,其中包括 OpenAI 代理入侵 Hugging Face的事件。Goodfire 构建首个监视器所基于的开源模型 Kimi K3,今年夏天利用其沙箱中的一个漏洞访问了互联网和 GitHub 上的信息。
Goodfire 的系统工作方式有点像机场安检。被称为探针的小型检测器在代理工作的每一步读取模型的内部信号,就像通过式扫描仪检查每一位乘客一样。只有当探针标记出问题时,单独的 AI 模型(相当于人工搜查)才会进行更仔细的查看。
Baseten 客户可以选择要监视哪些风险,包括攻击性黑客行为、化学和生物武器滥用,以及奖励黑客行为。他们还可以决定自动响应方式:记录事件、发送以供人工审查,或完全拒绝该请求。
Goodfire 表示其方案运行成本也更低。大多数 AI 监视器都是独立的模型,必须重新读取被监视模型所做的一切,这会增加时间和成本。Goodfire 的探针则利用模型在工作时已经进行的计算。
Goodfire CEO Eric Ho 上周在风险投资家 Matt Turck 的 MAD Podcast 上说道:"内部激活监视器非常便宜,因为它们复用了前向传播中的计算。所以模型已经在计算这个 token。你所做的只是获取它已经计算好的中间神经激活,然后对这些内部计算运行分类器。"简而言之,模型已经在做数学运算,而探针只是读取其结果。
在 Goodfire 对 Kimi K3 的测试中,监视约 1,500 个会话的成本约为 51 美元,而使用一个较便宜的 AI 模型逐步检查的成本约为 233 美元,使用顶级模型约为 10,000 美元。探针捕获了 94% 的恶意黑客会话,并将 8.7% 的无害会话送去二次审核。
该公司表示,同时运行四个探针使模型开始响应的时间增加了不到 2%。
Goodfire CTO 兼联合创始人 Dan Balsam 说:"最大的优势是可以在问题发生之前就抓住它。我们可以在评估或训练过程中检测到模型可能会进行黑客行为。"
这一推介针对的是开源模型。开发者可以下载它们并移除其安全防护,而且它们并不附带闭源实验室在其自身系统上运行的那种监控。
"个人使用开源模型所能造成的损害,与有人利用算力集群(如推理提供商——主要责任所在)所能造成的损害相比,是很小的,"Balsam 说。"当我们迎来开源 'Mythos' 时刻时,就会清楚地看到,模型需要在推理阶段部署安全护栏。"
Goodfire 的最新研究发现,包括 Kimi K3 和 GLM 5.2 在内的领先开源模型,在 AI 智能体测试中有 50% 到 96% 的运行出现了奖励破解。
Goodfire 并非第一个尝试此种做法的公司。Google DeepMind 于今年 1 月表示,其研究为在 Gemini 中部署滥用检测探针提供了依据。
Balsam 表示,这些监控器是一个更长远研究目标中的近期部分:对大语言模型进行逆向工程,从而将行为追溯到其在训练中产生之处。"我们希望把训练模型的'魔法'变成精密工程,"他说道。
当您通过我们文章中的链接进行购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。
Aditya Mehta 是 TechCrunch 报道 AI 领域的记者。他由 Tarbell 人工智能新闻中心支持,并就读于加州大学伯克利分校。您可以通过发送电子邮件至 aditya.mehta@techcrunch.com,或在 Signal 上通过加密消息发送给 adymehta.74 来联系 Aditya。
来源:TechCrunch · techcrunch.com