跳到正文
原文
Hacker News· sfkgtbor·· 2 天前精选AI 评分74

Anthropic 发布 Claude Haiku 5.5,定位为迄今最便宜、最快且能力最强的小模型

Claude Haiku 5.5

AI 导读

Anthropic 发布 Claude Haiku 5.5,称其为迄今最便宜、最快且能力最强的小模型,主打高吞吐、成本敏感任务。

推荐理由

原文给出了 Haiku 5.5 与 Haiku 4.5 的价格和性能对比,以及 Sonnet 5.5 cache reads 降价信息,便于判断小模型在成本敏感场景里的适配位置。

正文 · AI 翻译

推出 Claude Haiku 5.5:迄今为止我们发布过的最便宜、最快速且能力最强的小模型。

Claude Haiku 5.5 专为高吞吐量、对成本敏感的任务而设计。它能够可靠地处理快速且重复性的工作负载(如摘要、压缩、数据库查询和分类请求)。它可以与 Opus 5.5 和 Sonnet 5.5 良好搭配,作为编码工作中的子智能体使用。而且,由于它也是我们迄今为止最快的模型,因此在实时客户支持和浏览器使用等对速度敏感的任务中表现尤为出色。¹

Haiku 5.5 的价格远低于 Haiku 4.5。平均而言,其运行成本现在降低了约 75%。²

伴随此次发布,我们正在提升整个模型系列的性价比。我们将 Claude Sonnet 5.5 缓存读取的价格减半,这意味着 Sonnet 5.5 在大多数智能体工作上的运行成本降低了约 20%。我们还为 Claude Max 和 Team 订阅用户推出了一项新的每月 API 额度,旨在支持用户在 Claude 平台上构建新的智能体和应用程序。

性能表现

以下是 Claude Haiku 5.5 在一系列基准测试中的表现:

Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5供参考
知识工作GDPval-AA v2.1162073514371840
知识工作AA-Briefcase v1.1157861413361824
计算机使用OSWorld 2.172.4%离线子集15.7%离线子集48.9%离线子集83.9%离线子集
多学科推理Humanity's Last Exam45.9%无工具10.2%无工具—56.9%无工具
57.4%使用工具18.7%使用工具—64.5%使用工具
智能体编码Terminal-Bench 4.039.2%0.0%16.4%70.6%
智能体编码FrontierCode 1.1(主线)46.4%—42.4%52.1%Xhigh
视觉推理Chartography46.4%无工具6.4%无工具29.1%无工具61.6%无工具

有关我们如何运行评估的详细信息,请参阅 Haiku 5.5 系统卡。

Haiku 5.5 是我们首款支持可调节 effort 设置的 Haiku 系列模型。这意味着与其他模型一样,用户可以决定是优先优化成本还是智能水平。下方图表展示了 Haiku 5.5 在每个 effort 设置下在三个基准测试中的表现:

OSWorld 2.1(离线子集)准确率与成本对比

OSWorld 2.1 用于衡量智能体操作真实计算机以完成长程多步骤任务的能力。

在早期测试中,我们的客户反馈的结果与上文展示的性能和成本改进一致。以下是他们对这款新模型的评价:

引用

“我们对 Claude Haiku 5.5 印象非常深刻,尤其是它的速度。我们针对我们的 AI 智能体产品 AI Teammates 运行了评估套件,涵盖了缺陷分诊、项目搭建以及在大型项目组合中检索高风险或逾期工作等用例。与我们目前使用的模型相比,任务完成的延迟降低了 30% 以上,每次智能体轮次的推理速度最高提升 2.5 倍。体验明显更加流畅。”

公司Asana

作者Aaron Vinh,资深软件工程师

价格

下表展示了 Claude Haiku 5.5 的定价与我们其他模型的对比。对于提示词在 100,000 token 以内的任务,Haiku 5.5 性价比尤为突出,这类请求约占我们上一代 Haiku 模型请求量的 90%。

每 100 万 token 的价格Haiku 5.5
提示词 100k 以内 / 超过 100k
Haiku 4.5Sonnet 5.5
缓存读取$0.01 / $0.05$0.10$0.10
缓存写入$0.125 / $0.625$1.25$2.50
输入 token$0.10 / $0.50$1.00$2.00
输出 token$0.50 / $2.50$5.00$10.00

安全

对齐性。 相比 Haiku 4.5,Claude Haiku 5.5 在我们几乎所有的对齐评估中都表现出显著提升。具体而言,我们发现其出现失对齐行为的实例大幅减少,配合滥用的意愿也更低。该模型的 系统卡 详细描述了我们的评估流程与结果。

安全防护。 与其能力相匹配,Haiku 5.5 的网络安全防护措施比 Haiku 4.5 更严格,但比我们近期其他模型上所应用的措施略宽松。在网络安全方面,相比我们为 Sonnet 5.5 设置的防护,它们允许更广泛范围的防御性任务,同时仍会阻止渗透测试及其他更可能被攻击者使用的技术。

Haiku 5.5 的生物学防护措施与 Sonnet 5、Sonnet 5.5 和 Opus 5 保持一致。它们允许研究性的生物学问题,但会限制访问我们判断可能造成危害的请求。涉及更广泛生物学与网络活动的组织可申请加入我们的 生命科学验证计划 和 网络安全验证计划。

可用性

Claude Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude Platform 上,可通过 claude-haiku-5-5 开始使用。

详情请参阅我们的 迁移指南。

更多更新

在推出 Claude Haiku 5.5 新定价的同时,我们也在持续提升模型与产品的价值。

首先,我们正在下调 Claude Sonnet 5.5 的缓存读取价格,从今天起生效。缓存读取价格降低了 50%:从每百万 token 0.20 美元降至 0.10 美元。由于缓存读取在模型 token 消耗中占比较大,这使得 Sonnet 5.5 在大多数智能体任务上的成本降低了约 20%。

例如,此次降价对 Sonnet 5.5 在 Terminal-Bench 4.0 上性能与成本之比的意义如下:

Terminal-Bench 4.0准确率与成本对比

Terminal-Bench 4.0 用于衡量模型在命令行界面内完成复杂、多步骤专业任务的能力。

这张图揭示了 Haiku 5.5 与我们更大模型之间的一项重要差异。对于 Terminal-Bench 4.0 所衡量的复杂智能体编码任务,Sonnet 5.5 和 Opus 5.5 仍是更优选择。相比之下,Haiku 5.5 最适合范围更窄的任务——例如压缩、摘要或子智能体工作——这些任务在使用此前版本的 Claude 时可能因成本过高而难以开展。

其次,本周我们将为所有 Max 和 Team 订阅用户在 Claude 平台上推出一项新的月度 API 额度。Max 5x 用户每月将获得 100 美元额度,Max 20x 用户将获得 200 美元,Team 订阅用户将获得最多 500 美元的额度,由其用户共同使用。这些额度旨在让我们的用户能够试验构建调用我们 API 的工具、应用和代理,可用于我们任何模型。更多信息,请参阅我们的帮助中心文章。

对开发者而言,我们还将更新 Claude Python 和 TypeScript SDK,在测试版中新增对计算机使用和浏览器使用的支持。考虑到 Haiku 5.5 在速度、能力和价格方面的综合表现,它尤其适合这些任务。您可以在我们的 Claude 平台文档中了解更多详情。

来源:Hacker News · anthropic.com