CUDA霸权被撼动?Rust GPU编程新突破:H100上反超CUDA 11%
NVIDIA的CUDA生态,一向被视为高性能计算的“铁王座”。任何试图挑战它的技术,要么性能不达标,要么生态不兼容。
但现在,Rust编程语言正在撕开一道口子。
追平CUDA,部分场景反超11%
近日,一篇聚焦Rust GPU编程的最新研究论文引发业内震动。研究显示,通过LLVM的卸载基础设施,Rust编写的GPU内核性能已能媲美手写优化的CUDA和HIP C++方案,在NVIDIA H100 GPU上,Rust内核的运行速度比原生CUDA快11%到慢46%不等,具体取决于工作负载。
也就是说,在部分场景下,Rust不仅追平了CUDA,甚至还实现了反超。
凭什么?内存安全+高性能兼得
传统CUDA开发用C/C++,为了追求极致性能,开发者经常要用裸指针,稍不留神就会出现内存泄漏、数据竞争等难以调试的问题。
Rust的方案完全不同。它完全构建于LLVM后端与Rust编译器内部,无需依赖第三方组件。Rust的所有权系统在编译期就能保证GPU内存安全,借用检查器在编译阶段就能捕获通信错误,而CUDA中这类问题往往要等到运行时调试才发现。
简单说:CUDA的坑要运行时才能踩到,Rust的坑编译时就帮你填平了。
差距在哪?寄存器压力是瓶颈
性能差异的根源在于寄存器压力与循环展开的适配度。Rust的平均寄存器压力略高于CUDA(33个寄存器对28个),在FIR、LTIMES等对循环展开敏感的微基准测试中,Rust方案仍有明显性能差距。
研究团队表示,后续将通过代码生成优化和中间表示差异适配继续缩小差距。
NVIDIA也在拥抱Rust
值得注意的是,NVIDIA自己也在推动Rust上GPU。今年5月,NVIDIA实验室开源了CUDA-Oxide 0.1——一个实验性的Rust-to-CUDA编译器,让开发者用纯Rust语言编写CUDA内核,直接输出NVIDIA的PTX中间表示。
NVIDIA还推出了cuTile Rust,一个基于tile的GPU内核开发系统,在B200 GPU上GEMM性能达到2 PFlop/s(cuBLAS的96%),Qwen3-32B推理达82 tokens/s。
小结
Rust在GPU编程领域的这次突破,核心意义不在于“跑分反超”,而在于证明了内存安全与高性能可以兼得。在AI算力军备竞赛的今天,这个方向值得整个行业关注。


