Alpie公司推出的320亿参数模型,底层基于DeepSeek-R1-Distill-Qwen-32B二次蒸馏和微调。Sarvam AI的105B架构直接改了DeepSeek的多头隐注意力与MoE设计。印度方只在数学代码单项跑分声称领先,脱离南亚语境后推理和长文本能力直接断层。这些模型本质靠成熟开源底座绕开GPU和语料短板,印度企业正借此把成本压低一个数量级。 印度AI模型 借鉴DeepSeek

Alpie公司推出的320亿参数模型,底层基于DeepSeek-R1-Distill-Qwen-32B二次蒸馏和微调。Sarvam AI的105B架构直接改了DeepSeek的多头隐注意力与MoE设计。印度方只在数学代码单项跑分声称领先,脱离南亚语境后推理和长文本能力直接断层。这些模型本质靠成熟开源底座绕开GPU和语料短板,印度企业正借此把成本压低一个数量级。 印度AI模型 借鉴DeepSeek
