昊梵体育网

*印度一吹牛就坏事了!吹嘘自研大模型比DeepSeek还牛,结果有AI玩家不服气

*印度一吹牛就坏事了!吹嘘自研大模型比DeepSeek还牛,结果有AI玩家不服气,扒开底裤一看,发现架构竟然是DeepSeek的山寨缩水版!被玩家一顿嘲讽。看来中国大模型不仅养活了全球开发者,还养活了不少套壳忽悠本国政府补贴的软件公司!

2026年7月底到8月初,印度在AI领域搞了一次集体"大跃进",本土企业169PI推出了一款32亿参数的轻量化模型,叫做Alpie,当地媒体直接给它冠上"印度版DeepSeek"的称号。

官方公布的跑分数据显示,这个模型在数学基准测试GSM8K上超过了DeepSeek V3,在代码评测和逻辑测试里也名列前茅,宣称整体水准对标GPT-4o。

这个宣传力度,放在任何一个国家都算是相当炸裂的发布会词汇了。

开发者社区没有直接鼓掌。有人把Alpie的底层权重拆开来看,发现这款模型并非从零独立训练,而是基于中国开源大模型DeepSeek-R1-Distill-Qwen-32B做了蒸馏和量化优化。

换句话说,说是"自研",其实是拿DeepSeek的开源版本改了个壳子,宣称"对标GPT-4o"这话没说错,在特定测试集上确实跑得不慢,但"自研"二字就很值得商榷了。

这种操作在技术圈有个专门说法,叫"套壳",操作逻辑其实并不复杂:你把别人开源出来的大模型权重下载下来,针对自己的场景做微调和量化压缩,最后发布的时候只强调性能数据,对底层来源轻描淡写。

跑分不见得造假,但"自主研发"的成分就得打个大大的问号。

更耐人寻味的,是另一家印度公司Sarvam AI的遭遇,2026年2月,班加罗尔初创公司Sarvam AI在新德里的AI峰会上发布了105B参数的大模型Sarvam-105B,官方宣传称该模型在多项数学推理基准上超过了参数量是它六倍以上的DeepSeek-R1。

发布会照片传遍网络,声势浩大,但批评声音在几个小时内就来了,有人直接拆解了模型的配置文件,定性为"缩水版DeepSeek架构克隆"。

有人把这个配置文件拿去让ChatGPT分析,得到的描述是"Mini DeepSeek-V2风格模型",这个截图在技术社区里广泛流传,嘲讽效果拉满。

我认为这里有一点值得认真区分,不然容易误判,Sarvam的情况和Alpie并不完全一样。Sarvam方面坚持,两款模型均从预训练阶段开始在印度本地完成,使用的是印度政府IndiaAI计划提供的算力,没有使用任何外国模型权重。

它采用了MoE(混合专家)架构,这个架构思路和DeepSeek高度相似,但MoE本身是一种通用技术路线,不是DeepSeek的专利。

用同一套架构思路做模型,类似于两家手机厂商都用了安卓系统,"参考"和"抄袭"之间有实质区别。

Sarvam的CEO公开表示,团队"仰慕DeepSeek,学习和跟进他们的研究",同时强调105B模型"以更小的团队和更小的模型尺寸实现了这些结果",工程师则明确声称,所有模型均从零开始训练。

那批评者说的架构克隆算不算成立?业内普遍指出,Sarvam超越DeepSeek的结论仅限于小范围专项测试集,在全域通用评测中并未拉开明显优势。

这是一个比较关键的限制条件,选择性地在自己擅长的垂直场景里做测试,然后拿这个结果宣传"超越",在AI行业几乎已经是通行做法了,不只印度公司这么干。

但普通大众看到"超越DeepSeek"这几个字,脑子里浮现的往往是全面碾压,这中间的信息落差很大。

真正有意思的背景是Sarvam拿到政府资源的方式:2025年4月,印度政府从67家申请机构中选中Sarvam,提供4096块英伟达H100算力,使用期六个月,政府补贴部分费用并换取公司股权。

合同核心要求只有一条:模型必须从零训练,完成后开源,这个设计本身说明印度政府并不傻,已经预料到有人可能拿着开源模型糊弄补贴,所以专门设了"从零训练"的门槛。

Sarvam算是勉强过了这道门槛,至少他们确实从头训练了。但Alpie的情况就没这么干净了。

在我看来,这件事折射出的是全球AI军备竞赛在中小国家落地时的一种扭曲形态。

每个政府都想要"主权AI",但真正从头构建基础模型的门槛极高,印度AI算力中心目前配备了1.8万多块GPU,其中约1.3万块是英伟达H100,硬件投入不算小。

但算力有了,不代表就能凭空产出基础能力的积累。更务实的做法,是站在开源生态的肩膀上往前走。

问题在于,这条路怎么走、走完之后怎么讲故事,直接决定了它是一个合理的技术追赶路径,还是一场拿着开源代码骗补贴的表演。