短短 10 个月几乎翻倍,AI 模型评测平台 Arena 估值升至 31 亿美元
2 小时前 / 阅读约3分钟
来源:IT之家
AI模型评测平台Arena完成2亿美元B轮融资,估值达31亿美元。平台对个人用户免费,提供AI模型排名服务,新增对齐能力评测,OpenAI多款模型名列前茅。

IT之家 10 月 9 日消息,当地时间 8 日,AI 模型评测平台 Arena 竞技场宣布完成 2 亿美元(IT之家注:现汇率约合 13.43 亿元人民币) B 轮融资,估值达到 31 亿美元(现汇率约合 208.17 亿元人民币)。Arena 最初是加州大学伯克利分校 2023 年的一项研究项目,通过公众投票对 AI 模型进行排名。

Arena 此前披露,今年 6 月的年化营收达到 1 亿美元(现汇率约合 6.72 亿元人民币)。

本轮融资由光速创投和 Khosla Ventures 共同领投,Salesforce Ventures、01 Advisors、戴尔科技资本、Endeavor Catalyst、a16z、Felicis 等机构参与投资。

今年 1 月,Arena 曾完成 1.5 亿美元(现汇率约合 10.07 亿元人民币) A 轮融资,投后估值 17 亿美元(现汇率约合 114.16 亿元人民币),当时的年化营收为 3,000 万美元(现汇率约合 2.01 亿元人民币)。短短约 10 个月,Arena 的估值接近翻倍。

Arena 的评测平台对个人用户免费开放。用户可以输入提示词,或让 AI 按照自己的要求编写程序、开发项目,再比较不同模型的完成效果并评分。Arena 称,平台每月吸引数千万名访客。

去年 9 月,Arena 推出面向 AI 模型研发机构和企业的商业服务 AI Evaluations,利用社区用户的反馈数据,提供详细的模型性能分析。

今年,AI 研发机构发现,旗下模型能够通过迎合基准测试的规则获得高分,却未必具备相应的实际能力。企业也不再满足于标准化测试成绩,希望了解哪款模型更适合自己的业务需求。

Arena 在融资公告中指出:“AI 的发展速度已经超过了我们的评估能力。模型一旦发现自己在接受测试,固定的基准测试就会失效。世界需要一个中立的第三方,检验 AI 在实际使用中是否安全、行为是否符合人类的预期。Arena 开始承担这一角色。”

为此,Arena 在排行榜中新增了对齐能力评测,重点考察模型是否会擅自执行用户没有要求的操作,是否会张冠李戴,将言论或事实归于错误的来源,以及是否会谎称完成了任务。Arena 将最后一种行为称为“欺骗性完成”。

在初步公布的对齐能力排行榜上,OpenAI 多款模型名列前茅,Claude Opus 5.5 排名第六,Claude Fable 排名第九。