昊梵体育网

OpenRouter 的 Ori Eval 上线刚一周,又被官方推送了五项改动。

OpenRouter 的 Ori Eval 上线刚一周,又被官方推送了五项改动。最显眼的一条:模型对比从串行改成并行,普通测试速度直接快大约 5 倍——这意味着以前要等半天才能跑完一轮横向打分,现在喝杯咖啡的功夫就能拿到初步结果。对于正在筛选底座模型、动不动就要跑几十个候选的人来说,这个提速等于把单次决策的成本砍掉了一大半。

更实际的是省钱门槛。新增的 ori eval --pilot 命令可以在正式开跑之前,先给出一份误差在 5% 以内的费用预估,不再等到月底账单出来才发现某个对比任务烧了多少。这意味着个人开发者或小团队可以用很低的试错成本去验证"到底要不要跑完整评测"。

改动里还有两条直指"评测能不能信":当模型得分低于设定门槛时,工具会直接指出具体失败原因,并标明这份结果由哪家提供商响应,相当于给每一行分数都加上了出处标签;而如果评分模型和被评模型来自同一家族,系统会主动提示你换掉评分模型——之前这种"自己评自己"的情况很容易把得分拉高到失真,现在被显式拦下来了。崩溃的评测运行也不再被记成"答错",而是单独标为失败,避免了把系统问题误算成模型能力问题。

五项改动集中在可信度和使用门槛两条线上,说明这套工具还在快速补漏期,没到可以闭眼采信的程度。

你跑评测时,最头疼的是费用、速度还是评分公平性?