从万卡到十万卡,存在诸多的挑战,不是简单的乘以10。最大的难点在于,能否跑出应有的性能和效率,任何一个环节的短板都会导致性能折损。这正是十万卡集群建设最核心的命题——系统级创新。
2026年7月10日,光合组织2026智能计算应用大会在郑州举办。会上,中科曙光宣布中国首个全国产十万卡AI超集群——曙光8000(登峰)正式落成,并同步接入国家超算互联网。这标志着国产AI基础设施建设正式从万卡级迈入十万卡级部署阶段。
从万卡到十万卡,绝不仅仅是数字后面加一个零。中科曙光高级副总裁李斌直言:从万卡到十万卡,存在诸多的挑战,不是简单的乘以10。最大的难点在于,能否跑出应有的性能和效率,任何一个环节的短板都会导致性能折损。这正是十万卡集群建设最核心的命题——系统级创新。
十万卡的三道坎:功耗、稳定性与网络
中科曙光高端计算总工程师卜景德在采访中系统梳理了从万卡到十万卡面临的核心挑战。他指出,从万卡到十万卡,必须迈过功耗、稳定性与网络这三道坎。
第一道坎是功耗。万卡集群的功耗在几个兆瓦到十兆瓦级别,多数数据中心可以轻易处理;但十万卡集群的功耗呈数量级跃升,瞬间负载从几百千瓦飙升到几兆瓦,对电力系统和散热系统提出了完全不同的要求。我们知道,郑州夏天温度比较高,这一具体场景,让散热问题变得尤为迫切。曙光8000采用相变浸没液冷技术,配合高压直流供电,PUE可低至1.04。
第二道坎是系统稳定性。卜景德表示,十万卡集群包含约30亿个部件,任何一个小的波动都会影响整个系统。为此,中科曙光针对核心部件全面强化冗余设计,在供电余量、故障恢复等方面进行了大量工程打磨。
第三道坎是网络。研究显示,在大规模分布式训练中,网络通信耗时占比已达30%到50%。而网络的扩展并非线性,最坏情况下复杂度会呈平方级增长。中科曙光高速网络互联产品部总工程师万伟表示,AI计算对数据吞吐的能力要比传统的高精计算翻很多。
曙光8000采用了全栈自研的400G无损网络scaleFabric——这是国内首款基于原生RDMA架构的高端网络产品,从底层的112G SerDes IP、交换芯片、网卡,到上层的交换机硬件和管理软件,全部实现自主研发。该产品端到端通信时延低至0.9微秒,单子网可支持超11万卡集群部署。
超智融合:打破“两条平行线”
长期以来,科学计算(超算)与人工智能计算(智算)被视为两条平行线。前者追求双精度(FP64)的极致准确,服务于气象、物理仿真;后者侧重低精度(FP16/INT8)的高吞吐,服务于大模型训练。传统的做法是建一个资源分区,上一套独立的管理平台,不同平台之间资源割裂,无法实现自动化协同。
曙光8000最大的颠覆性创新在于,它摒弃了传统“超算区+智算区”的拼凑式部署,采用了“原生超智融合”架构。
采访中卜景德告诉我们,这套系统具有全精度计算能力,从FP64到FP32到TF32,到BF16、FP16、FP8,在同一套硬件上就可以支撑不同的应用负载。曙光高端计算产品部副总工程师兼系统总体部经理、产品部设计经理赵欢进一步指出,曙光8000本身就是一个超智融合的整机系统。这一架构变革精准回应了当前最前沿的科研趋势——AI
for Science。
在软件层面,Gridview 7.0扮演着“算力大脑”的角色。赵欢介绍,该系统集成了Slurm和Kubernetes双调度融合架构,能够识别到不同任务的倾向性,根据任务特征自动选择对应的资源,实现算力的自动调度融合。目前,在十万卡核心节点上,已完成300余项超智融合应用优化,涵盖大模型、机器人、汽车、创新药、新材料、量子计算、天文气象等二十余个领域。
Agent时代的新命题:从“算力堆砌”到“全链路加速”
如果说大模型时代考验的是训练集群的规模和稳定性,那么Agent时代对算力基础设施提出了全新的要求。中科曙光AI行业首席工程师李冉指出,当前AI产业的竞争逻辑“已经从底层去比拼基模的能力和算力规模,转向智能系统的综合落地能力。AI从被动回答问题的工具,转向一个自主完成任务的智能体。
具体到算力基础设施层面,李冉总结了几个关键变化:多Agent多轮推理、多工具调用和跨Agent通信导致Token消耗量、上下文长度和网络流量大幅增加;多轮执行触发大量数据读写,对存储平台要求更高;多Agent、多模型、多工具的频繁通信使得系统的协同性成为效率瓶颈。而行业普遍存在的瓶颈是“聚焦在GPU算力的堆砌”,存在明显的木桶效应——算力其实是够的,但因IO、通信或显存制约,算力无法充分发挥,导致这个算力没有发挥出来。
曙光对此的回应是围绕超节点打造全链路推理加速方案。
李冉介绍,一方面围绕计算、存储、网络、管理软件做深度系统化设计,打造适配Agent场景的算力底座;另一方面从底层算子库、通信库优化到上层系统、模型和应用,实现全栈加速。具体而言,40卡超节点可提供5TB大容量池化显存、28P
FP8算力精度;网络侧支持基于轨道优化的网络Scale-out网络扩展,更好地发挥同轨内通信效率;软件层面整合了从芯片到整机到系统到应用的多级RAS能力,可以做到秒级的故障感知,分钟级的故障定位。
网络架构的未来:光电共封与全光互联
中科曙光高速网络互联产品部总工程师万伟对下一代网络架构提出了前瞻性判断。他认为,未来网络演进仍会沿着scale out和scale up两条路线并行发展。算、网、存之间的耦合会进一步加深。
另一个重要趋势是,随着AI推理需求增加,未来很可能会出现更多面向 AI 推理场景的专门化架构优化。
总结:从“堆料”到“系统力” 创新深水区
十万卡之后,中国智算产业的竞争逻辑正在发生深刻变化。正如中科曙光高级副总裁李斌所言,十万卡集群并非所有场景的标配,首先要考虑的是应用需求导向。但无论如何,曙光8000的落成已经为十万卡级AI基础设施提供了一个可参照的全国产化建设样本。
从国产芯片,到scaleFabric高速网络,到ParaStor分布式存储,到浸没式相变液冷,再到Gridview管理平台,曙光8000实现了“芯片、计算、存储、网络、散热、应用、服务”的全链路自主。其中,ParaStor分布式存储在2026年IO500榜单中获得生产型全节点和10节点性能全球第一,这也是中国厂商首次在生产类榜单斩获双料冠军。
大会期间,中科曙光还与北京科学智能研究院达成战略合作,启动第二套全国产十万卡超智融合算力系统研制与建设。面向AI4S、大模型等大规模算力需求,十万卡级全精度算力中心有望从示范性工程走向规模化复制。中国算力基础设施,正在告别单纯追求峰值性能的堆料时代,迈入以“超智融合”与“全栈自研”为核心特征的系统级创新深水区。
©本文为清一色官方代发,观点仅代表作者本人,与清一色无关。清一色对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文不作为投资理财建议,请读者仅作参考,并请自行承担全部责任。文中部分文字/图片/视频/音频等来源于网络,如侵犯到著作权人的权利,请与我们联系(微信/QQ:1074760229)。转载请注明出处:清一色财经

微信扫码打赏
支付宝扫码打赏
