我认为 Arena.ai 以及多数 “AI” 博主的测评,参考价值非常低。
如今几乎所有个人测评都是:用一句话让模型 “生成 xxx”。这种测评真的有意义吗?
分别对两个 AI 说 “生成一个 Minecraft 游戏”。一个只实现了最基础的放置 / 破坏方块;另一个则包含合成、挖矿、敌对生物,甚至光影。多数人会据此认定后者更强。但两者其实都 100% 完成了任务 —— 都写出了一个 Minecraft 游戏。几乎无法从这类对比中得到真正有用的信息。
最终的结果就会变成比拼谁的思维链更长。导致模型在实际任务中反复修改 - 检验细枝末节,既浪费 token,又耗费时间,最终产物却未必更好。反而误导模型厂商往这方面死命训练,恶性循环。
问题在于,这根本不是规范的测试。我认为,一个合格的模型评测,至少应尽量做到以下几点:
-
明确输出、量化得分
在 prompt 中清楚写明需求,例如:“生成一个带有创造模式、合成功能,且具有好看光影的 Minecraft 游戏。” 三项要求对应三个得分点,按完成情况打分,才能客观比较模型能力。 -
全面考察能力
不要再天天只测前端了!用前端堆出再花哨的游戏,也几乎没有实质意义,只会诱导厂商朝这个方向疯狂 “卷”—— 就像很多人买手机只看跑分,数字背后的实际价值几乎为零。更该测试的是真实工程能力:修 bug、使用更多实用语言、编写测试等。 -
代码健壮性
这是最重要、也最容易被忽视的一点:审查代码的健壮性,尤其是所采用的架构与框架。然而对多数民间评测者来说,他们既不关心,也没有能力去评估这一维度。 -
控制变量
Harness、skills 等对模型输出影响巨大,评测中必须保持一致。
唯有这样的评测才是有益的,不仅对大众选择有参考价值,对模型厂商也指明了方向。
当然也有做到以上几点的评测,如 Artificial Analysis 的模型榜单,是我认为相对客观、公正的。
Comments
Loading comments…