十万卡集群跑推理,中科曙光的ParaCache是怎么撑住的
今年数博会最火的展台不用争议,中科曙光,人流量说明一切,我在展台前站了十分钟,愣是没找到机会跟工作人员说上话。
为啥这么火?7月国内首个全国产十万卡AI超集群曙光8000正式落成,这个本身就够震撼了。但真正让懂行人驻足的,是今天首发的新一代词元加速方案ParaCache。
十万卡集群做推理,KV Cache的管理难度指数级上升。跨节点、跨GPU、跨对话的重复计算,随便一个没管好,就是巨大的算力浪费。
中科曙光ParaCache在这个场景里做了四层管理,热数据放显存、温数据放内存、冷数据放SSD和分布式存储,统一池化、统一调度。四个层级打通了,数据该放哪放哪、该从哪取从哪取。
而且工作人员介绍ParaCache已成功支撑起长上下文对话、高并发在线推理、智能体工作流与高通量推理四类应用场景,扛住了十万卡规模的生产级考验。
曙光8000已经是超算互联网核心节点,接入了全国一体化算力网。ParaCache在这套体系里跑通了,更能说明这套方案是真正大规模上验证过的。
曙光8000 数博会 中科曙光 AI超集群 中科曙光paracache 中科曙光paracache
