当前位置:首页 > 科技资讯 > 正文

LMArena引领AI评测新纪元:用户投票决定模型优劣

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第1张

AI模型能力评估从2025年热议至2026年,一家通过“为模型打分”的公司迅速崛起成为行业独角兽。

本月,随着1.5亿美元融资的到位,AI大模型评测机构LMArena的估值飙升至17亿美元。

这个起源于伯克利校园的项目,看似偶然,实则精准地击中了AI时代一个日益尖锐的痛点:当传统的考试框架因模型反复“刷题”而逐渐失效,我们该如何判断一个模型是否真正有用

LMArena的解决方案既简洁又颠覆:将裁决权交给用户,让每一次点击成为投票。日均上千场对战、数万次匿名比拼在此上演,成为所有大厂不敢缺席的“试金石”。

在争议与流量齐飞中,LMArena在2025年9月实现了关键一跃:将数千万次人类偏好数据封装成B端评估服务。产品仅上线4个月,其年化经常性收入便突破3000万美元,OpenAI、Google、xAI等头部AI企业均成为其核心付费客户。

尽管LMArena并非完美答案,其众包模式也伴随着“不够专业”、“易被操纵”的批评,但其在商业上的迅速成功与估值飙升如同一面镜子,揭示了旧有评估体系的失效,并将选择权部分交还给了用户。

当刷榜不再可信,用千万次匿名对决选出“好用”的AI

从2025年开始,AI行业出现了一种微妙而普遍的情绪变化。

模型仍在发布,榜单仍在刷新,但兴奋感正在快速衰减。一次次参数升级、一次次排行榜登顶,越来越像一场成本高昂却回报有限的表演。

产品落地节奏跟不上模型宣传节奏,甚至微软内部的研究人员也公开谈到自己正在经历“AI疲劳”。

更深层次的问题在于,榜单正在塑造一种不健康的激励机制。

当模型能力被压缩进有限的基准测试中,优化目标会迅速收敛。

面对开放式问题,不同模型的回答在结构、措辞、推理路径上高度相似,看似稳健实则趋同。创造力下降并非因为模型不够强,而是因为它们被训练成了“会考试的学生”。

基准测试数量有限、覆盖场景狭窄,模型极易产生过拟合。它们学会的并非理解与推理,而是如何针对题库进行“应试准备”。静态测试的存在本身就在引导模型向固定解法靠拢。

在这一背景下,行业开始重新讨论一个更现实的问题:如何评估模型的真实能力?

答案正在从排行榜迁移。比起分数高低,人们开始关心更具体的维度:模型是否容易集成进真实系统?在专业场景中是否稳定可靠?能否在长期使用中保持一致表现?以及它是否真的理解业务语境,而不是给出看似正确的通用答案。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第2张在这种集体焦虑中,一个“匿名选手”的走红提供了另一种可能性。

2025年8月,一个名为nano-banana的模型悄然出现在LMArena的图像编辑竞技场。没有发布会、没有技术白皮书,甚至模型名称都是匿名的。平台采用完全盲测机制,用户只能看到结果,通过对比投票来判断优劣。

短短两周内,这个模型累计获得超过500万次社区投票,其中直接胜出票达到250万张,以明显优势登顶榜首。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第3张流量随之涌入。LMArena的整体访问量在当月增长了10倍,月活用户突破300万。随后,谷歌正式认领了这位“匿名选手”,其真实身份是Gemini 2.5 Flash Image。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第4张回顾这一过程,这并非一次偶然事件。

最早的扩散来自Andrej Karpathy的转发,随后OpenAI、Anthropic等头部厂商的模型陆续接入。原本只是一个对比工具的平台逐渐演变为一场围绕真实用户体验展开的“模型对决”。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第5张连思维链CoT的提出者Jason Wei也参与了讨论。他指出,好的评估体系应当聚焦智能的核心能力,比如语言理解、数学推理和问题解决,并且需要足够大的样本规模与清晰的判断标准,而不是不断叠加复杂但脱离实际的指标。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第6张某种程度上,LMArena恰好踩中了这一共识。

它的核心设计并不复杂:用户每次提问,系统随机抽取两个匿名模型同时作答,结果并排展示为“回答1”和“回答2”。用户从有用性、准确性、贴合度、安全性等角度投票,也可以选择平局或都不满意。甚至连用户的提问本身也会被纳入评估数据。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第7张这种机制天然贴近真实使用场景。编程、写作、逻辑分析、法律解读、多轮对话、多模态生成……这些都不是被拆分成单项能力测试,而是在完整任务中直接对比。

从免费榜单到B端服务,模型评测市场加速商业化

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第8张在LMArena出现之前,AI评测并不是一个商业意味浓厚的赛道。

过去十多年里这项工作主要由学术机构或开源社区维护。它们更像一种行业公共产品不直接变现而是通过提供统一可复现的评估框架建立学术影响力与话语权。榜单存在但目的不是竞争而是共识。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第9张真正的变化发生在大模型产业化之后。

随着模型数量激增应用场景外溢评测不再只是研究工具而成为支撑整个市场运行的基础设施之一。模型要进入企业系统要被采购要被对比评测开始承担“决策前置”的角色其市场空间也随之被迅速放大。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第10张很少有人想到这条商业化路径的起点其实是一场极其朴素的学术实验。

LMArena引领AI评测新纪元:用户投票决定模型优劣 LMArena AI模型评测 用户投票 匿名对决 第11张LMArena最早由卡内基梅隆大学加州大学伯克利分校以及LMSYS相关成员共同发起。