昊梵体育网

代码能力超越Deepseek和Claude! 最近AI圈出了件怪事。20号左右,

代码能力超越Deepseek和Claude!
最近AI圈出了件怪事。20号左右,一个叫Ox Alpha的匿名模型突然出现在OpenRouter上,没署名、没介绍,就这么静悄悄上线了。

然后它凭实力把整个圈炸了,代码能力直接干翻一堆明星产品,调用量冲到平台第一。但到现在,没人知道它到底是谁家的。

因为Ox就是公牛的意思,加上电影《牛来》正好在热映,国内网友直接给它起了外号叫“牛来”。

它到底有多强?

先说硬指标:能一次处理104万字的上下文,单次能吐出13万字的内容,图片、视频都能看懂,而且完全免费。

再来看它的实战表现。有个叫DeepSWE的测试,专门考模型在真实代码里修bug的能力——得自己读代码、找到问题、动手改、跑测试,改错了还得继续修。

一轮测下来,Ox Alpha通过了80%,比Claude那个65%高出一大截。在OpenCode平台上,它直接把DeepSeek从连续56天的第一名位置上拉了下来。

调用量更吓人。上线没几天,光是前五大应用就累计调了超过4万亿Token,OpenCode上四天就吸引了26万开发者来试。

Stripe的CEO亲自上手试了下,留了四个字:相当惊艳。

然后全网开始猜:这到底是谁家的?

因为全程匿名,平台只说来自某个“暂时不透露名字的第三方”。于是社区和媒体全在扒。

扒出来的线索几乎全指向国内一家公司——智谱。

首先是视频处理方式。有人专门做了几段测试视频,发现Ox Alpha处理视频时消耗的“视觉token”数量和智谱的GLM-5V-Turbo完全一样,其他模型比如Mimo、Qwen都不是这个结果。

其次是文字处理方式。测了20多组提示词,发现Ox Alpha和GLM-5.3在分词计数上始终保持固定的75个token差异。

更直接的是报错信息。
有人故意传错误参数,捕捉到类似[1210]的报错信息,格式和内容跟智谱的服务几乎一模一样。

还有个关键线索:智谱有匿名测试的前科。
今年2月他们就用过“Pony Alpha”的代号匿名测试过GLM-5系列,后来在技术报告里说这叫“盲测实验”,就是不想让人因为品牌光环高看或者低看它一眼,纯粹靠实力说话。

谷歌那边也来凑热闹。

DeepMind的研究员发帖暗示“这是我们的Gemini”,但评论区直接翻车,高赞是“GLM就是Google Language Model”网友都看不下去了。
所以现在是什么情况?

无人认领,谷歌认了但没人信。

如果最后证实这是国产模型的手笔,那只能说,国内AI的技术储备比大家想的要深。
牛来 人工智能 大模型