昊梵体育网

英伟达造万亿参数模型,为整座AI工厂促销1. 免费模型,是英伟达分散客户风险的工

英伟达造万亿参数模型,为整座AI工厂促销

1. 免费模型,是英伟达分散客户风险的工具

英伟达正在开发Nemotron 4,最大版本预计拥有至少1万亿个总参数,接近Nemotron 3 Ultra的两倍。目前模型架构和训练数据已有初步方案,最关键的训练尚未开始,最终规格与发布时间仍可能调整。“万亿参数”代表研发目标,暂时不能当作已经完成的产品。

这笔账英伟达这样算:模型免费开放,企业使用模型所需的GPU、网络、服务器和软件继续收费。

英伟达也不需要依靠Nemotron的API收入收回研发成本。只要开放模型足够强,更多企业、政府和创业公司就会开始训练、微调和部署AI,算力需求自然流向英伟达的整套平台。

这件事还有更现实的背景:英伟达的收入过度集中。

截至4月26日的季度,三个直接客户分别贡献收入的21%、17%和16%,合计54%。这些客户可能包含云厂商、服务器厂商和分销商,无法直接等同于三家最终用户,但集中风险已经非常明显。英伟达还披露,一家AI研究与部署企业通过购买云服务,间接贡献了“有意义的收入”。

更麻烦的是,大客户正在加速开发替代品。AWS称,已有接近100万颗Trainium 2用于训练和运行Claude;谷歌Ironwood TPU同时支持大规模训练和推理;AMD也在用MI350和ROCm软件生态争夺开放模型负载。

当模型架构和工作负载逐渐稳定,云厂商可以针对固定任务开发定制芯片,用更低成本替代部分GPU。英伟达更喜欢一个高度分散的AI市场:成千上万个模型、智能体和行业应用同时生长,架构持续变化,没有一款定制芯片能够覆盖所有需求。这个环境更有利于通用GPU和CUDA。

因此,Nemotron必须强到企业愿意真正部署。落后太多的开放模型只能产生下载量,很难让银行、制造企业和政府部门为生产集群批准预算。

现有Nemotron 3 Ultra拥有5500亿个总参数,每次处理一个Token只激活550亿参数,支持最长100万Token的上下文。英伟达公布的测试显示,其推理速度较高;第三方综合排名仍未进入全球第一梯队。

这也提醒我,模型最终能力还取决于训练数据、训练量、后训练、工具调用以及推理系统。Nemotron 4需要在企业真实任务中进入开放模型第一梯队,才可能改变算力采购。

2. 一款免费模型,可以带出整套收费平台

英伟达已经把Nemotron的商业转化路径铺到了机房:

企业免费下载Nemotron的模型权重、训练数据和训练方法;

用NeMo工具,把自己的行业数据继续喂给模型,改造成金融、制造、医疗或政府专用模型;

用NIM和TensorRT-LLM将模型封装并加速,让它能够稳定服务大量用户;

算力落到DGX Cloud、公共云GPU或者企业自建的HGX、DGX集群;

GPU之外,连接GPU的NVLink、高速网络、CPU、DPU和NVIDIA AI Enterprise软件订阅全部进入账单。

英伟达免费送出的是模型起点,收费环节覆盖了训练、微调、部署和长期运行。模型越多人使用,后面的收入入口越多。

Palantir已经把Nemotron带入美国政府的隔离网络。

客户可以在本地基础设施上训练模型,敏感数据无需离开内部网络,模型权重也由客户自己掌握。日本企业则用Nemotron数据和NeMo训练日语模型,以HGX B300建设私有算力,Jetson负责机场等场景的边缘部署。

这类政府、金融、医疗和关键基础设施,往往受到数据驻留、本地审计和模型所有权要求限制。

公共云里的闭源API很难覆盖全部需求,开放模型可以把AI负载带进企业机房、区域AI云、主权数据中心和边缘设备。

对模型公司来说,这个市场客户分散、交付复杂、收费困难;对英伟达来说,每增加一个部署地点,就多出一套硬件、网络和企业软件需求。

新发布的NeMo Switchyard进一步放大了这条逻辑。

它是一套免费的模型路由工具:简单任务交给速度快、价格低的小模型,复杂规划交给能力更强的大模型。企业还能混用Nemotron、其他开放模型和闭源模型,无需把所有任务押在一家模型公司上。

英伟达甚至不要求Nemotron赢下每一次模型调用。模型可以更换,计算平台和推理软件继续收费。

模型路由会降低单次任务成本,但更便宜的智能通常会带来更多使用量。聊天机器人回答一次便结束;

智能体还会规划、搜索、调用工具、检查结果和返工,一个任务可能触发多轮模型调用。

Gartner预计,到2030年,万亿参数模型的推理成本将比2025年降低90%以上;智能体每项任务消耗的Token又可能达到普通聊天机器人的5至30倍。

英伟达押注的是:Token价格下降10倍,使用量增长几十倍。智能越便宜,常驻运行的智能体越多,最终需要的GPU反而越多。

3. 做模型,也是在提前设计下一代芯片

Nemotron还有一项不直接体现在模型收入里的价值:它是英伟达自己的全栈压力测试。

如果芯片团队只等客户模型定型,再适配新的注意力机制、MoE架构、超长上下文和低精度计算,产品迭代会慢半拍。亲自训练前沿模型,英伟达可以更早发现显存、GPU互联、数据读取和推理调度的瓶颈,再把解决方案写入下一代GPU、NVLink和软件库。

Nemotron 3 Ultra已经带有明显的硬件协同设计痕迹:

混合Mamba与Attention架构,降低处理长文本的计算压力;

MoE架构每次只调用一部分参数,减少无效计算;

预训练大量使用Blackwell支持的NVFP4,也就是更节省显存和电力的4位计算格式;

多Token预测可以一次预测多个Token,提高生成速度。

Nemotron因此同时承担三个角色:开放模型产品、Blackwell能力展示,以及下一代硬件的测试负载。

模型开放后,外部开发者还会继续替英伟达优化。

新架构在CUDA、vLLM、SGLang和TensorRT-LLM上跑通,优化成果再回到整个英伟达平台。英伟达称,Blackwell运行DeepSeek V4的每Token成本在一个月内最多下降了80%;模型调度、低精度计算和并行技术叠加后,部分场景吞吐量可以提高至原来的20倍。

开放权重同样方便AMD、华为等竞争者适配Nemotron。

英伟达无法只靠模型锁定客户,它必须持续证明一件事:同一个模型放到英伟达平台上,能够更快上线、运行更稳定、每个Token成本更低。长期护城河由芯片、网络、软件和开发者共同形成,参数规模只占很小一部分。

所以,我判断Nemotron 4价值时,主要观察三个指标:

第三方测试和企业真实任务能否进入开放模型第一梯队;

政府、企业和区域AI云的部署量能否持续扩大;

英伟达数据中心收入能否从少数超大客户,进一步扩散到AI云、工业和企业客户。

英伟达已经开始单独披露这组数据:

最新季度数据中心收入752亿美元,其中超大规模云客户约379亿美元,AI云、工业与企业客户约374亿美元。后者如果持续增长,才能证明Nemotron正在把开放生态转化为更分散、更稳定的GPU需求。

Nemotron 4无需击败OpenAI才能成功。它只需要让更多客户拥有自己的模型、建设自己的集群,并长期运行自己的智能体。模型免费,算力需求留在英伟达手里。