未来十年,AI基础设施的竞争,不再是单一芯片的军备竞赛,而是系统级效率的全面比拼。
过去几年,GPU算力大幅增长,而网络带宽和内存容量增长却相对缓慢。算力的指数级攀升与网络、内存的线性增长之间,横亘着一道日益扩大的鸿沟——这便是AI基础设施领域著名的“通信/内存墙”。代理式AI(Agentic AI)时代的到来,让这道鸿沟变得更加复杂。
代理式AI时代:一场计算范式的根本性变革
前几年的大语言模型,无论是训练还是推理,都以Transformer为核心,进行大规模矩阵计算。GPU持续执行GEMM运算,而CPU更多承担数据准备、任务调度等辅助工作。因此,整个数据中心的设计目标始终围绕“如何让GPU跑得更快”展开。
代理式AI的出现改变了这一前提。AI
Agent并不会在生成一次回答后便结束计算,而是需要不断进行“思考—调用工具—执行代码—验证结果—再次推理”的循环。在强化学习的后训练过程中,Agent需要持续生成代码、进入沙盒运行、获取反馈并重新优化策略。在多智能体系统中,不同Agent之间又需要频繁交换上下文、调用外部工具、共享中间状态,共同完成复杂任务。
AI的计算模式已不再是单纯的大规模并行矩阵计算,而是演变为计算、访存、网络通信与控制流高度交织的混合负载。
正是这种工作负载的根本性变化,让传统AI集群体系结构集中暴露出了“三堵墙”。
一是控制流瓶颈——阿姆达尔定律重现。代理式AI需要频繁调用Python解释器、代码编译器、数据库、搜索引擎等外部工具。这些任务依赖大量条件判断、系统调用和控制流分支,只能由CPU串行执行。
根据阿姆达尔定律,当不可并行化部分不断增加时,即使GPU的计算能力继续提升,整个系统性能仍将受到CPU串行执行能力的限制,导致大量GPU计算资源反而会因为等待CPU而空转。NVIDIA技术博客明确指出,系统性能正日益受到代理式循环中CPU绑定串行任务的制约——这是阿姆达尔定律的典型体现。
二是通信墙与内存墙——长上下文的代价。随着模型上下文窗口扩展到数十万乃至数百万Token,Transformer的KV
Cache持续膨胀,占据越来越多的HBM容量。
在多节点推理过程中,这些上下文状态还需要频繁同步,引发大量网络微突发。如果是传统基于松耦合以太网的数据中心,很容易因此产生拥塞、哈希冲突和丢包,最终导致尾端延迟快速放大,GPU的计算效率也随之下降。
三是安全边界的失效。代理式AI的功能不仅是读取数据,还能动态生成并执行代码。而传统的EDR等安全软件与AI工作负载共享同一个操作系统内核,一旦发生Prompt Injection或权限逃逸,攻击便能直接绕过主机安全机制,形成直接入侵。
这三类问题并非单纯源于GPU算力不足,而是CPU、GPU、内存、网络和安全之间传统松散耦合的系统架构,已经无法支撑代理式AI的新型工作负载。真正需要升级的,是整个AI数据中心的体系结构。
Vera CPU:为代理式AI重铸计算的控制中枢
代理式AI的工作模式,彻底改写了CPU在数据中心中的角色定位。
在大模型时代,CPU的任务相对单纯——准备数据、调度任务、偶尔处理一些轻量级的控制逻辑,GPU才是舞台中央的主角。但代理式AI的运转逻辑截然不同:一个AI Agent从接收指令到产出最终结果,中间要经历“规划→调用工具→执行代码→验证结果→再次规划”的往复循环。每一次循环都伴随着Python解释器的调用、编译器的启动、数据库查询的发起、外部API的请求——这些工作,GPU做不了,只能交给CPU。
更严峻的挑战来自强化学习的后训练场景。成千上万个Agent沙盒同时运行,每个沙盒都在独立执行代码、收集反馈、调整策略。这种大规模并行的高频任务调度,对CPU的并发处理能力提出了前所未有的要求。
传统x86架构的CPU,在设计之初并未预料到这样极端的工作负载。它们擅长的是通用计算,但在面对代理式AI中密集的条件跳转、系统调用和上下文切换时,流水线频繁冲刷、分支预测失误、线程调度不均等问题逐一暴露。整个系统的运行速度,被CPU的串行执行能力牢牢卡住——GPU再强,也只能等待。
NVIDIA给出的答案,是彻底重新思考CPU的架构哲学。

Vera CPU搭载了88颗NVIDIA完全自研的Olympus核心,基于Armv9.2指令集构建。但“自研”二字的分量远不止于指令集的差异。代理式AI的代码编译、文本解析和工具调用,会产生大量不可预测的控制流分支。传统CPU的分支预测器一旦猜错,就必须清空流水线从头再来——预测越不准,性能折损越严重。
Olympus核心的应对策略是双管齐下。一方面,它配备了10宽指令获取与解码前端,让每个时钟周期能够吞吐更多指令;另一方面,它引入了神经分支预测器,能够在单个时钟周期内同时评估两条已采取的分支路径。这意味着即使面对复杂且难以预测的控制流,CPU也能最大程度避免流水线冲刷,维持较高的实际指令执行效率。
不过,单线程性能的提升只是故事的一半。当代理式AI的规模扩展到数百甚至数千个并发沙盒时,真正的考验变成了系统能否让所有线程稳定、公平地获得计算资源。
Vera引入的空间多线程技术,正是为此而生。它在物理层面上对执行资源进行静态隔离和配额分配,确保每个线程在高负载下都能获得确定性的计算能力。这种可预测的执行节奏,对于需要大规模并行跑强化学习训练的场景而言,不是锦上添花,而是刚性需求。

解决了控制和调度的问题,下一个瓶颈很快浮出水面——数据搬运的效率。
Agent在执行代码编译、数据库查询、ETL数据处理时,CPU的大部分时间并非用于计算,而是等待数据从内存中抵达。为了打破这一困局,Vera重构了整个内存子系统。它采用第二代LPDDR5X内存,并引入SOCAMM封装技术——这项创新在保留LPDDR低功耗优势的同时,赋予服务器内存可插拔、可升级的灵活性。
最终成果是:在内存子系统典型功耗低于30瓦的前提下,Vera实现了1.2TB/s的总内存带宽和1.5TB的总容量。平均每个核心可支配约14GB/s的内存带宽,远超传统x86平台的供给水平。在沙盒容器的代码编译、脚本执行等代理式AI典型负载中,Vera的单核性能较x86平台实现了1.5倍的提升。
值得一提的是,Vera带来的不仅是性能的跃升,更是每瓦特能效的优化。AI工厂的运营者必须在有限的电力预算内,尽可能产出更多的Token。Vera的低功耗内存设计和空间多线程的高效调度,共同构成了一个在性能与功耗之间达成精妙平衡的计算中枢。
控制流瓶颈、线程调度瓶颈、内存访问瓶颈——三道枷锁被一一卸下。Vera CPU让代理式AI的“大脑”终于不再因等待而空转。
纵向扩展:NVL72如何以260TB/s重塑机架级互连
单个节点的效率问题解决之后,真正的系统级挑战才刚刚开始。
AI工厂从来不是一台孤立的服务器在工作,而是成千上万颗芯片协同作战。当GPU与CPU的数量从几十扩展到几百、几千,芯片之间如何高效地“对话”,将直接决定整个集群的实际吞吐能力。倘若芯片间的数据通路不畅,再强大的单颗算力也会被通信延迟拖入泥潭。
Vera Rubin NVL72的设计哲学,可以用一句话概括:把整个机架变成一台超级计算机。
这并非比喻。NVL72的物理结构是一个由底板硬连接构成的封闭式闭环,而非通过以太网线缆松散连接的独立服务器群。单个机架内集成了72颗Rubin GPU和36颗Vera CPU,它们之间共享内存、保持一致性通信——这一切的核心支撑,是机架背部的第六代NVLink铜质主干。

这套互连系统的工程复杂度令人震撼。NVL72将Spine拆分为四个模块化的预集成线缆盒,内部排布超过5000根特制高频铜缆,总长度超过2英里。计算托盘则采用PCB中板设计,超级芯片插槽直接对接后部的NVLink接口,托盘内部实现了彻底的无缆化——所有的电气连接都通过板对板连接器完成。这样的设计让组装与维护时间从2小时骤降至5分钟,对于大规模部署的运维效率提升具有立竿见影的效果。
更重要的是性能层面的释放。整个机架纵向扩展的对分带宽达到260TB/s,每块Rubin GPU可独占3.6TB/s的通信通道。这意味着什么?对于混合专家模型(MoE)而言,推理过程中专家路由机制会触发巨量的参数交互流量。如果这部分流量被迫经由高延迟的以太网传输,模型性能将出现断崖式下跌。而NVLink将所有数据交互牢牢收敛在低延迟的物理层内部,数据从产生到消费,无需流出机架半步。
单机架72卡只是起点。为了承载未来更大规模的模型,NVIDIA正在用光学技术拓宽NVLink的物理边界。在Rubin Ultra世代,NVL576将由8个MGX NVL机架组成,每个机架72颗GPU——机架内部走铜缆,机架之间由CPO交换机搭建两层全互连网络,576颗GPU最终共享同一个NVLink域。再往后的Feynman世代,单机架的NVLink域将进一步翻倍至144颗GPU。
不过,互连带宽的提升只是解决了数据搬运的通路问题,大模型推理在计算特性上的内在分裂,还需要更精妙的架构设计来调和。
预填充阶段是典型的计算密集型任务,GPU的Tensor Core在此大显身手;而解码阶段采用自回归生成逻辑,每次只输出一个Token,计算量不大,却对内存带宽极度敏感——两者对硬件资源的需求截然不同。
NVIDIA的解法是“注意力前馈解耦”(AFD)。Rubin GPU承担预填充计算,同时保留解码阶段的注意力计算——这部分需要访问全部KV Cache,考验的是显存容量,配备288GB HBM4的Rubin足以胜任。而FFN与MoE专家计算不依赖大容量显存,只对带宽敏感,因此交由Groq 3 LPX机架中的LPU执行。
LPU的硬件特性为此而生:单颗LPU配备500MB片上SRAM,容量远不及Rubin,但其SRAM带宽高达150TB/s,接近Rubin
HBM4(22TB/s)的7倍。整机架汇聚为128GB片上SRAM、40PB/s的SRAM带宽,另配12TB DDR5承载大模型。两类芯片并非简单的前后接力,而是针对每个输出Token的每一层进行协同计算,请求的分类与路由由NVIDIA Dynamo负责调度。
最终成效如何?借助这一解耦方案,系统在维持高并发吞吐的前提下,每兆瓦推理吞吐量提升了35倍。这不是简单的硬件堆叠,而是对算力资源的精准匹配与高效利用。
横向扩展:Spectrum-6 SPX如何挣脱功耗枷锁
纵向扩展解决了机架内部和有限机架间的芯片互连,但当AI工厂的规模从单个POD扩展到包含十万张GPU的超大规模集群时,外部网络便成为新的瓶颈。而这一次,最大的敌人不是带宽,而是功耗。
传统交换机的网络通道速率提升至200Gb/s后,ASIC到前面板光模块之间的PCB铜线走线会产生严重的信号衰减。为了补偿信号完整性,工程师不得不引入功耗极高的重定时器和数字信号处理器(DSP)。这些芯片的功耗呈指数级攀升,大量能源预算被网络通信消耗,留给GPU计算的份额越来越捉襟见肘。
NVIDIA Spectrum-6 SPX以太网机架背后的CPO(光电一体化封装)硅光技术,正是对这一问题的手术刀式解决。

CPO的核心突破在于:光通信组件被直接集成到芯片封装内部。电信号从ASIC生成后,只需传输数毫米的极短路径,便可在封装内部直接调制为光信号送入光纤。这一架构彻底摒弃了长距离的PCB走线,进而移除了功耗高昂的外置DSP与重定时器芯片。
带来的改变是革命性的:光网络能效提升5倍;系统故障率下降10倍——也就是可靠性提升了10倍;更重要的是,横向扩容的功率天花板被大幅抬升。AI集群从数千卡向数万卡、数十万卡扩展时,不再被网络功耗的指数级增长所阻挡。
在物理层实现突破后,NVIDIA针对AI流量的特性设计了MGX ETL机架。其内部采用Spectrum-X多平面拓扑结构:1U的交换机托盘内,通过短距离铜质Spine连接节点,在机架组内提供完全无阻塞的多对多连接。结合动态负载均衡算法,该架构能有效打散并吸收AI训练中产生的同步微突发流量——这种微突发在传统以太网中往往导致拥塞和丢包,进而引发尾端延迟的剧烈放大。
光电硬件与自适应路由软件的深度融合,使标准以太网实现了媲美InfiniBand的无损、零抖动传输质量。换句话说,AI工厂的运营者无需在“高性能专用网络”和“通用开放网络”之间做痛苦的取舍——Spectrum-X兼得两者的优势。
存储与安全:BlueField-4的双重使命
当算力和网络的基础设施被重新定义之后,代理式AI还有一个被长期低估的瓶颈在等待解决:上下文记忆的存储与调度。
多智能体系统能够连续数小时执行对话与自主任务,期间产生海量的KV Cache数据。这些上下文记忆的存放位置,直接决定了推理的响应速度与并发能力。如果全部放在显存中,HBM会被迅速占满,压缩模型推理的并发空间;如果卸载到PCIe连接的NVMe SSD,冗长的I/O协议栈和总线延迟又会阻塞推理流程,让智能体任务频繁卡顿。
BlueField-4 STX存储机架与CMX上下文内存存储平台,在高速HBM与低成本冷存储之间,构建出一层大容量、高带宽、AI原生的共享上下文存储层。

在具体架构中,每颗Vera CPU与存储节点均直连800Gb/s的BlueField-4 DPU,由DPU承担全链路的数据调度与卸载工作。当模型需要调取历史KV缓存时,DPU通过RDMA远程直接内存访问协议,从STX存储机架中抓取数据,以线速无损灌入GPU显存。整套流程彻底绕过主机操作系统的TCP/IP协议栈——既不消耗Vera
CPU的算力,也消除了内核态与用户态之间的数据拷贝开销。这种硬件级旁路的极致优化,让STX平台的内存页处理数量翻倍,集群整体Token处理性能与能效同步提升。
存储瓶颈解决的同时,安全层面的隐患同样不容忽视。
代理式AI的自主代码执行能力,本质上是一个巨大的攻击面。传统端点安全方案依托主机操作系统构建信任边界——一旦智能体遭遇Prompt Injection等恶意诱导发生越权操作,攻击者便能从内部突破信任体系,隐蔽渗透、窃取数据、横向扩散。
NVIDIA的安全哲学在这里发生了根本性的转变:不再信任主机,而是将安全防御体系完全下沉至物理隔离的BlueField-4 DPU硬件层,依托DOCA软件栈构建芯片级的零信任安全架构。
DOCA Argus是这套体系的核心检测引擎。它独立运行在DPU内部的ARM核心上,完全脱离主机操作系统的管控。通过PCIe DMA直接内存访问能力,它以零拷贝、非侵入式的带外方式持续采集、分析主机物理内存镜像。即便攻击者植入了Rootkit来隐藏恶意进程,其在物理内存中留下的执行痕迹也无法隐匿——DOCA
Argus通过重构虚拟内存映射与系统页表,能够在主机毫无感知的情况下完整还原运行进程、命令行参数与程序调用链路。
在检测之外,DOCA Vault和DOCA
Flow构筑了存储与网络层面的防御闭环。DOCA Vault利用DPU的存储仿真能力,将远程网络存储虚拟为本地磁盘,所有智能体的文件读写请求在抵达物理介质前便被前置拦截,通过细粒度授权策略实时阻断越权访问。DOCA Flow则将DPU转化为高性能四层防火墙,实现机架内、跨节点的精细化微隔离,切断恶意负载在AI工厂内部的横向移动路径。
从内存监测、存储管控到网络隔离,BlueField-4与DOCA共同构筑了三层硬件级零信任安全体系——在芯片层面强制执行安全策略,让AI工厂在快速扩张的同时,守住信任的底线。
写在最后
当代理式AI将计算模式从“大规模并行矩阵运算”转变为“计算、访存、网络通信与控制流高度交织的混合负载”时,传统的芯片性能提升路径——依赖先进制程堆叠晶体管、拉升峰值FLOPS——正在快速触及天花板。单颗芯片再强,也无法弥补系统架构层面的撕裂。
NVIDIA的极致协同设计,本质上是在做一件事:打通计算、网络、存储与安全之间的架构边界,将整个AI工厂作为一个完整的系统来进行端到端优化。Vera CPU解决了控制流和内存访问的串行瓶颈,NVL72和AFD解耦架构重塑了纵向扩展的效率,Spectrum-6 CPO打破了横向扩容的功耗天花板,BlueField-4 STX则在存储和安全维度填补了最后的关键拼图。
这套全栈架构的背后,是对AI基础设施价值衡量体系的重新定义。行业正在从“这颗芯片有多少FLOPS”转向“这个系统生产每个Token的成本是多少”、“每兆瓦吞吐量能达到多少”、“集群的实际利用率有多高”。这些指标,才是决定AI服务能否实现规模化盈利的关键。
未来十年,AI基础设施的竞争,不再是单一芯片的军备竞赛,而是系统级效率的全面比拼。谁能在更低的功耗下产出更多的Token,谁能在更高的并发下维持更低的延迟,谁能在大规模扩张中守住安全和稳定——这些,才是真正决定胜负的战场。而NVIDIA正在用这套从芯片到机架、从互连到安全的完整拼图,为整个行业树立新的标杆。
©本文为清一色官方代发,观点仅代表作者本人,与清一色无关。清一色对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文不作为投资理财建议,请读者仅作参考,并请自行承担全部责任。文中部分文字/图片/视频/音频等来源于网络,如侵犯到著作权人的权利,请与我们联系(微信/QQ:1074760229)。转载请注明出处:清一色财经

微信扫码打赏
支付宝扫码打赏 