那个声称比DeepSeek更便宜的印度模型Sarvam AI其实很拉胯。
首先,Sarvam AI并没有什么原创性,它是采用的DeepSeek开源出来的模型架构。比如说,Sarvam 105B采用的多头隐注意力(Multi-head Latent Attention)架构,就是DeepSeek 提出的,并发表了论文。它们就是直接“借鉴”了。
其次,Sarvam AI的价格也没有比DeepSeek便宜。DeepSeek训练一个单款旗舰模型,也不过五六百万美元,Sarvam AI的训练成本,三个模型加起来2000万美元,平均每个都是六百多万美元,其实要比DeepSeek贵。
之所以说便宜,是因为印度公司在这里耍了个心眼。它拿训练单个大模型的成本,跟DeepSeek多年累计总成本进行对比。只能说印度是会宣传的。
最后,Sarvam AI训练出来的三个大模型,性能远远比不上DeepSeek的大模型,甚至可以说落后了一个时代。无论是模型参数上限,还是模型适用场景,亦或者数据训练底座,都远远不如。
举一个最典型的例子。Sarvam AI的大模型,数据训练底座只是南亚本土的一些语言,DeepSeek的大模型,数据训练底座则是超百万种的覆盖全球的语言。两者差距显而易见。
了解了这些之后,笔者只有一个感叹:
印度人吹牛逼的功夫还真是挺厉害,就这么个东西,也敢拿来碰瓷DeepSeek,一点都不脸红。

