
如今业内已经形成一种心照不宣的行业操作,不少头部科技企业都会选择匿名上线自家还未正式发布的模型产品。字节跳动、阿里、Sea 这些企业,今年都有过匿名投放模型的过往记录。就连海外头部企业,也曾使用代号匿名测试新模型。

企业选择这种方式,目的十分现实,不用背负品牌压力,依靠真实用户流量完成压力测试,收集真实场景下的反馈数据,等到测试完成之后再正式官宣发布,完成商业落地。此前多款匿名模型,后续都被证实对应国内大厂的未公开产品,这样的先例,也让这次牛来模型的身份猜测,变得更加扑朔迷离。

事件的导火索,源自一份亮眼到让人难以置信的测试报告。有技术作者使用专业的代码评测工具,对这款匿名模型开展十道题目的编码能力测试,最终拿到百分之八十的通过率。这个成绩,大幅超过两款已经面世的顶尖闭源模型。后续还有其他开发者独立开展复测,得出的结果和初次测试基本吻合。消息一经传出,立刻在海外技术社区炸开锅,就连知名企业高管,都亲自上手体验,并且给出了很高的评价。
时间拨回到北京时间八月二十一日凌晨,这款被国内网友叫做牛来的匿名模型,悄无声息上架海外的模型聚合平台,没有标注任何研发企业,只标记为匿名第三方提供的隐身模型。


硬件配置十分豪华,拥有百万级别的上下文窗口,文字、图片、视频都可以作为输入内容,工具调用功能全部开放,最为震撼的是全程免费对外开放。上线短短一周时间,它的调用量近乎没有上限,有配套工具平台对外披露,该模型背后,每天可以承载百万亿级别的算力消耗,这个算力规模,是知名支付企业一个月 AI 调用总量的百倍。海量开发者蜂拥而至,争相体验这款凭空出现的 AI 产品。

强大的性能加上完全免费的使用权限,所有人第一时间就好奇,到底是哪家企业,愿意拿出这么庞大的算力,对外无偿开放。于是一场二十四小时不间断的技术指纹追踪就此拉开帷幕。一位有着大厂从业经历的行业从业者,在海外社交平台放出完整的比对分析,从五个完全独立的技术维度开展比对,一条条线索,全部指向国内智谱尚未发布的新版本模型。

技术人员做了一组对照实验,把同一套测试视频输入不同模型,记录模型处理视频消耗的数值,牛来模型和智谱对应版本,每一组数值完全一模一样,帧采样、时长缩放、分辨率缩放三处设计全部重合,分析文章称,出现这种巧合的概率几乎为零。
除此之外,分词工具对于各类特殊字符的处理结果完全匹配;传入错误参数时,会出现一组独有的报错编码;图片解析失败的时候,后端直接返回中文报错提示;面对敏感提问,输出的回复口径也和智谱模型高度一致。五条来自不同技术层面的线索串联在一起,给出七成到八成的置信度,推断牛来就是智谱还没有对外发布的多模态版本。过往智谱也曾经使用代号匿名投放模型,这一过往经历,也进一步加深了大家的怀疑。

可疑点并没有就此消失,矛盾点同样十分突出。首要问题就是算力缺口,每天百万亿级别的算力消耗,很多分析师认为,仅凭智谱现有的算力储备,很难独立支撑如此大规模的免费对外开放。于是社区诞生出新的猜想,模型本体是智谱的成果,但是算力资源,由其他科技巨头提供托管,像是小米或者腾讯都被纳入猜测名单。

圈内知名爆料人也公开发声,表示自己已经确认模型归属,但暂时不能对外透露,最后的答案会出乎所有人的预料。还有分析师表示,随着更多样本的比对,越来越多的人,开始推翻之前的判断,甚至有分析提出,它的分词特征,也有概率来自微软的系列模型。
除去追查模型身世,还有一个关乎每一位使用者的现实隐患摆在台面上。不同官方渠道给出的数据留存规则,出现了相互矛盾的说法。模型平台的页面标注,用户提交的对话内容会被提供方保存,但是不会拿来训练模型。可配套工具平台的公告却写着零数据留存。这两种说法有着本质区别,不用于训练不等于删除原始对话记录,用户的提问内容依旧会被服务商保管,保存多久、会不会外泄,全部没有对外公示,普通使用者,根本无法核实数据的真实去向。

所有人都把目光投向八月二十八日,到了这一天,智谱的新版本模型权重将会正式开源,等到模型文件公开,技术人员直接比对底层参数,牛来模型的真实身份,就会水落石出。如果这款匿名模型最终拿到高分,它将会成为开源权重模型里首个突破六十分的产品,直接摸到顶尖闭源模型的能力门槛。

一场全民参与的 AI 侦探故事,最终答案,只能等待开源文件揭晓, 您觉得它是哪一家的大模型?