Artificial Analysis搞了一个对开源模型很有用的指数:端点准确性指数,用于衡量每家开源模型供应商的API保留了多少开放权重模型的准确性。除了基本的性能指标外,他们还列出了每家的价格(包括考虑缓存命中后的综合价格)。对选择哪家供应商是一个很好的参考了。
比如Scaleway这家供应的GLM5.2就很鸡贼啊。价格最高,水平却很靠后。。-------------官方介绍:“提供商通过牺牲准确性来优化速度和成本。他们量化权重、编写自定义内核并调整推理堆栈,有时甚至会引入bug。我们将人工分析智能指数的严谨性应用于端点测量,使开发者能够根据准确性而非仅凭价格和速度来选择提供商。
我们将每个无服务器端点与我们自行部署的官方权重参考基准进行对比,其中100%表示与参考基准完全匹配。当端点结果落在参考基准的95%置信区间内时,即视为达到参考基准等效。GLM-5.2、gpt-oss-120b和DeepSeek V4 Pro的覆盖率现已上线,Kimi K3的准确性覆盖率即将推出。”How I AI


