跳到正文
原文
TechCrunch· Julie Bort·· 1 天前精选AI 评分63

AI 模型众包评测平台 Arena 获 2 亿美元 B 轮融资,估值 31 亿美元,10 个月内几近翻倍

Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months

AI 导读

AI 模型众包评测平台 Arena 获 2 亿美元 B 轮融资,估值升至 31 亿美元,较 1 月的 17 亿美元几近翻倍。

推荐理由

原文同时给出估值翻倍、年化营收变化和新增 alignment 排行榜的细节,可帮助读者判断众包评测在当前 AI 评估赛道的商业位置。

正文 · AI 翻译

Arena 起源于 2023 年加州大学伯克利分校的一项众包 AI 模型排名研究项目,该公司周四表示,已完成 31 亿美元估值的 2 亿美元 B 轮融资。

此前该公司表示,其年化运行率营收在 6 月份已达 1 亿美元。

本轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等参投。Arena 此前于 1 月宣布以 17 亿美元投后估值完成 1.5 亿美元 A 轮融资。彼时其年化营收为 3000 万美元。这意味着其估值在大约 10 个月里几乎翻了一番。

Arena 提供一个对消费者免费开放的众包平台。用户输入提示词或请求 vibe-coded 项目,然后对哪个模型表现更好进行评分。Arena 称其每月访问量达数千万次。

去年 9 月,该公司推出了其商业产品 AI Evaluations,这是一项基于社区反馈为模型实验室和企业提供详细性能分析服务的业务。时机把握得恰到好处。今年,AI 实验室意识到他们的模型正在刷基准测试,找到了不真正获得好成绩就能拿到高分的方法。与此同时,企业希望帮助确定哪种模型最适合其自身内部需求,而不是仅依赖标准化基准测试。

"AI 的发展速度超过了我们评估它的能力,而一旦模型意识到它们正在被测试,静态基准测试就会失效,"该公司在融资公告中说道。"世界需要一个中立的第三方,来衡量 AI 一旦交到真实用户手中时到底有多安全、有多对齐。Arena 今天正在承担这一角色,"公司补充道。

为此,Arena 还在其排行榜上新增了一个类别:对齐。该类别根据未授权操作(执行未被请求的操作)、错误归属(将陈述或事实错误地归于错误的来源)以及该公司所称的"欺骗性完成"(谎称完成了实际并未完成的任务)等问题对模型进行排名。

目前,OpenAI 的多款模型在其初步对齐排行榜上位居前列,Claude Opus 5.5 和 Claude Fable 分别位列第六和第九。

当您通过我们文章中的链接进行购买时,我们可能会获得一小笔佣金。这不会影响我们的编辑独立性。

Julie Bort 是 TechCrunch 的初创公司/风险投资频道编辑。

您可以通过发送电子邮件至 [email protected] 或在 X 上通过 @Julie188 来联系或核实 Julie。

查看简介

来源:TechCrunch · techcrunch.com