Arena 刚完成 2 亿美元 B 轮融资,估值站上 31 亿美元。比这个数字更值得琢磨的,是它同期甩出的 Alignment Index——一套专门衡量 AI 智能体是否安全、是否真实、是否老老实实待在用户划定范围内的评测标准。
这两件事看着分散,其实是一回事。智能体正在从"能聊"转向"能替人办事",一旦真的去调接口、动文件、花钱,出错成本就不再是一句胡话了。Alignment Index 想回答的正是这个:模型答得漂亮不算数,还得看它无人监督时守不守规矩、会不会为了完成任务绕开限制、有没有把不确定的事说成确定的。测评对象从"输出质量"挪到"行为边界",这一步迈得不小。
商业层面同样有看点。据 Felicis 披露,Arena 年化收入已超过 1 亿美元,平台累计促成 3.5 亿次会话和 6200 万次投票。这些数字的含义不只是流量——真实用户的盲测对比和偏好投票,本身就是当下极稀缺的评测资产。谁掌握人类如何判断模型好坏的第一手数据,谁就有资格参与定义"好"的标准。融资、榜单、收入三线并进,Arena 显然不打算只当一个擂台。

