Simon Willison·· 10 天前精选AI 评分51
Anthropic Frontier Red Team:GLM-5.3 与 Claude Mythos Preview 在漏洞利用基准上跨过零成功率门槛
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准上对 GLM-5.3 与 Claude Mythos Preview 各跑 100 项任务,分别在 4% 与 6% 的试次中实现完整控制流劫持,跨过了此前的零成功率门槛;同批评估的 Claude Opus 4.6 与 GLM-5.2 在所有任务上均未成功。
推荐理由
在内部漏洞利用基准上,GLM-5.3 与 Claude Mythos Preview 都跨过了此前模型无法取得成功的门槛,给出了具体的数字对照。
来源:Simon Willison · simonwillison.net