正文
发布时间
12 分钟前源站更新
12 分钟前首次抓取
12 分钟前发布时间
2026/03/25 04:5812 分钟前源站更新
2026/03/25 04:5812 分钟前首次抓取
2026/03/25 04:5812 分钟前发布时间
12 分钟前源站更新
12 分钟前首次抓取
12 分钟前用于追踪这条内容的来源与记录标识。
Source
原始链接
发布时间
2026/03/25 04:5812 分钟前源站更新
2026/03/25 04:5812 分钟前首次抓取
2026/03/25 04:5812 分钟前发布时间
12 分钟前源站更新
12 分钟前首次抓取
12 分钟前用于追踪这条内容的来源与记录标识。
Source
原始链接
AI Model Evaluator Arena Valued at Over $3 Billion in Round
Arena Intelligence Inc.,这家开发了广受欢迎的人工智能模型排行榜的初创公司,已以 31 亿美元的估值获得了 2 亿美元融资,并计划扩展到 AI 安全评估领域,以满足日益增长的对技术性能和风险评估的需求。
这笔融资将于周四公布,由光速创投和 Khosla Ventures 领投,Salesforce Ventures 和 Dell Technologies Capital 参投。该初创公司在 1 月份的融资轮中估值曾为 17 亿美元。
Arena 于 2023 年以 Chatbot Arena 的形式起步,这是加州大学伯克利分校 Sky Computing 实验室的一个研究项目,允许任何人试用最先进的 AI 模型并对回复进行排名。在 OpenAI 发布 ChatGPT 引发 AI 热潮几个月后推出,Chatbot Arena 很快成为行业早期采用者的热门之地,并成为快速发展的 AI 基准测试领域的领先指标。
这个学术项目于 2025 年转变为一家公司,此后扩展出多个不同的排行榜,让人们可以在各种不同任务上衡量 AI 模型。据公司联合创始人兼首席执行官 Anastasios Angelopoulos 称,Arena 现在每月有数千万访客。阅读更多:在 DeepSeek 爆火之前,Chatbot Arena 宣布了其到来。
Arena 计划于周四推出一个新的排行榜,展示 AI 模型在多项对齐指标上的表现。对齐是常用来指软件遵循人们为其设定的目标的程度。Angelopoulos 表示,公司的对齐指数将通过考虑模型采取未经授权行动或告诉用户完成实际未完成任务的频率等信号,来追踪 AI 模型在编码等活动中与人类协作的有效性和安全性。
OpenAI 和 Anthropic PBC 等领先 AI 模型制造商目前正应对对其最先进人工智能产品日益增长的担忧,此前最近发生了一系列涉及恶意 AI 系统的黑客事件。安全漏洞以及行业内不断升级的生存风险警告,引发了对该技术加强保护和监管的呼声。
最初,Arena 的对齐指数包括二十多个不同的 AI 模型,其中 OpenAI 的 GPT-6.1 Sol 和 Anthropic 的 Claude Opus 5.5 分别位列第一和第二。
Arena 从用户通过其 Agent Arena(一个让人们使用模型完成更复杂的多步骤任务的平台)与 AI 模型的对话中提取对齐数据。Angelopoulos 表示,Arena 计划逐步扩大排行榜,以纳入更多与安全相关的信号。
凭借最新一轮融资,Angelopoulos 表示 Arena 还计划将其评估工作扩展到更广泛的业务,帮助企业利用自身数据来确定哪些 AI 模型适合运行。
“我们现在还处于早期阶段,”Angelopoulos 说,“我们已经取得了良好进展。”
发布时间
8 小时前
2026-10-08 16:00:11 UTC
源站更新
8 小时前
2026-10-08 16:00:11 UTC
首次抓取
8 小时前
2026-10-08 16:07:48 UTC
AI 模型评估平台 Arena 完成 2 亿美元融资,估值达 31 亿美元,计划扩展至 AI 安全评估领域,并发布对齐指数排行榜。
Arena Intelligence(前身为 Chatbot Arena)完成新一轮 2 亿美元融资,估值达 31 亿美元,由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures 和 Dell Technologies Capital 参投。该公司此前在 1 月融资时的估值为 17 亿美元。
Arena 始于 2023 年,作为加州大学伯克利分校 Sky Computing Lab 的研究项目,允许用户测试前沿 AI 模型并排名。2025 年商业化后,拓展出多个不同任务的排行榜,目前月访问量达数千万。
为应对 AI 安全担忧,Arena 将发布“对齐指数”排行榜,衡量模型在编码等活动中遵循用户目标的安全性和有效性,包括未经授权操作或虚假完成等信号。初期收录 20 多个模型,OpenAI GPT-6.1 Sol 和 Anthropic Claude Opus 5.5 分列前二。数据来自 Agent Arena 平台。
公司计划将评估服务扩展至更多企业,帮助其用自有数据选择合适模型。CEO 表示“我们还处于早期,但已取得良好进展”。
Arena Intelligence, creator of the popular AI model leaderboard, raised $200M at a $3.1B valuation, and will expand into AI safety with a new Alignment Index.
用于追踪这条内容的来源与记录标识。