存算协同方案:以技术突破破解存储IO瓶颈

构建高效的存算协同体系,已成为AI时代算力基础设施升级的核心命题,也是突破AI技术落地瓶颈的关键所在。

构建高效的存算协同体系,已成为AI时代算力基础设施升级的核心命题,也是突破AI技术落地瓶颈的关键所在。

当前,人工智能技术正在千行百业中落地应用,从生物医药领域的蛋白质折叠模拟,到气象预测中的超大规模数值计算,再到自动驾驶系统的实时环境感知,AI应用对算力的需求呈现出指数级增长态势。然而,在算力基础设施快速扩张的同时,存储与计算的协同效率成为制约AI效能释放的关键。

传统IT架构中,计算与存储系统相对独立,数据在两者间的传输依赖于传统网络协议。在AI大模型训练场景下,这种架构的弊端暴露无遗:万亿级参数模型训练需要调用海量训练数据,传统存储系统的IO吞吐能力难以匹配算力集群的运算速度,导致大量计算资源因等待数据而闲置;在推理阶段,GPU显存空间有限,频繁的数据交互进一步加剧了存储IO瓶颈,不仅降低了推理响应速度,还推高了整体运营成本。

存算协同方案:以技术突破破解存储IO瓶颈

根据相关测算,当前AI计算中约有30%的算力资源被消耗在数据传输环节,而非核心的模型运算。这一数据背后,是存算协同效率不足带来的巨大资源浪费。因此,构建高效的存算协同体系,已成为AI时代算力基础设施升级的核心命题,也是突破AI技术落地瓶颈的关键所在。

技术突破:从芯片到应用的三层协同架构

为破解存储IO瓶颈,中科曙光、华为、浪潮等科技企业均提出了算存协同的技术路径,通过超级隧道、AI数据加速等创新设计,实现从芯片、系统到应用的三层传输协同,为AI计算打造高效的数据供给体系。

存算协同的底层支撑在于芯片级的硬件优化。在AI计算集群中,计算芯片与存储芯片的交互效率直接决定了整体系统性能。

以中科曙光为例,其通过自主研发的核心芯片,实现了计算与存储单元的紧密耦合。一方面,芯片内置的高速互联接口支持PCIe 5.0甚至更高级别的数据传输速率,大幅提升了芯片间的数据吞吐能力;另一方面,通过NUMA(非统一内存访问)亲和性优化,为不同数据域配置独享的硬件通道,避免了多任务并发时的资源冲突,确保数据传输的稳定性与高效性。

与此同时,针对AI计算对数据精度的多样化需求,自主可控核心芯片支持8/16/32/64位宽的全精度计算。在蛋白质折叠模拟等场景中,高精度计算能够保证分子结构预测的准确性;而在部分推理场景下,采用低精度计算则可在不影响结果可靠性的前提下,大幅提升数据处理速度。这种灵活的精度配置能力,为存算协同提供了更广阔的优化空间。

此外,华为以昇腾AI芯片为核心,实现“算-存”高效协同。其基于达芬奇架构,通过张量、向量、标量计算单元的深度协同,优化数据流动路径,减少冗余搬运。此外,华为还通过UCM推理记忆数据管理器,将推理过程中的历史记忆数据进行池化存储与统一管理,避免重复计算,实现了存得越多推得越快。在接口方面,华为还通过HiBL高速存储接口,配合自研高速互联技术,大幅提升数据吞吐效率,降低访问延迟,支撑FP4/FP8等低精度推理场景下的高效运行。

这些技术,共同构成了从近存计算到存内处理的演进路径,逐步形成内存即计算的理想架构。

系统层协同调度算力存储,破解IO瓶颈,释放极致性能。中科曙光通过自研的超级隧道技术打破IO壁垒。传统存储系统中,数据从存储节点传输到计算节点需要经过多层协议转换,不仅增加了传输延迟,还容易出现网络拥堵。超级隧道技术则构建了一条从存储到计算的专属数据通道,以CPU为核心,将计算、内存、网络与存储等关键资源划入独立的数据域,实现资源级隔离与路径优化。

具体而言,超级隧道技术利用RDMA(远程直接数据存取)高速网络的高性能和低延时特点,通过独有的虚拟网卡技术,将高速网卡切分为多个虚拟网卡,为不同任务分配独立的传输链路。同时,在连接建立初期仅分配最小必要内存保障基础通信,在实际运行过程中再根据链路流量动态分配共享内存资源,从源头上保障了链路利用率。这种设计使得数据能够沿最优路径高速流动,避免了传统架构中的协议转换开销,将存储IO延迟降低至微秒级。

此外,AI数据加速技术通过智能算法对数据进行预处理与压缩,进一步提升了数据传输效率。在训练阶段,系统可根据模型特征对训练数据进行针对性压缩,减少数据传输量;在推理阶段,通过缓存热点数据,避免了重复读取存储资源,有效提升了推理响应速度。

华为则通过软硬件协同设计,实现资源的全局调度与故障自愈,保障高可用性。作为连接芯片与AI框架的桥梁,CANN全面兼容主流框架(如PyTorch、TensorFlow),算子覆盖率100%,模型迁移成本降低70%,让开发者无需关注底层数据搬运细节。

此外,华为构建AIDC 7层全系统数字孪生,结合专业大模型EDNS2.0,实现秒级状态感知、分钟级故障定位与自动倒换,将算力集群可用率从90%提升至99.9%。

华为的Atlas 950 SuperPoD超节点基于灵衢高速互联协议,实现数千颗芯片的深度协同,支持千卡级集群线性扩展,算力利用率提升至70%以上。这些能力使得华为在超大规模智算中心中,实现了数据在哪,算力就在哪的动态匹配。

最后,存算协同的最终目标是为AI应用提供高效支撑,因此应用层的场景化适配至关重要。中科曙光AI4S计算集群通过与高校、科研机构及企业的深度合作,针对不同行业的AI应用需求,对存算协同架构进行定制化优化。

在应用层优化中,智能调度机制发挥了关键作用。系统可根据任务需求灵活匹配、调度集群的计算存储网络等资源,并发作业调度效率超每秒万次。例如,在大模型训练任务中,系统可优先为数据密集型阶段分配更多存储IO资源;而在模型推理阶段,则侧重优化计算资源的利用效率,实现了资源的动态平衡与高效配置。

总结:存算协同引领算力基础设施新方向

AI时代,算力已成为核心生产力,而存算协同则是释放算力效能的关键钥匙。

随着AI技术的持续发展,存算协同将朝着更深度、更智能的方向演进。未来,计算单元与存储单元将进一步融合,实现数据的原地计算,彻底消除数据传输瓶颈;同时,AI算法与存算协同架构的结合将更加紧密,通过智能算法实时预测数据需求,提前调度存储资源,实现数据供给的“预判式”优化。

可以说,随着存算协同技术的持续演进,必将推动算力基础设施实现质的飞跃,为各行业的智能化转型注入强大动力,引领人类社会迈向更加智能、高效的未来。

©本文为清一色官方代发,观点仅代表作者本人,与清一色无关。清一色对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文不作为投资理财建议,请读者仅作参考,并请自行承担全部责任。文中部分文字/图片/视频/音频等来源于网络,如侵犯到著作权人的权利,请与我们联系(微信/QQ:1074760229)。转载请注明出处:清一色财经

(0)
打赏 微信扫码打赏 微信扫码打赏 支付宝扫码打赏 支付宝扫码打赏
清一色的头像清一色管理团队
国内最大规模六万卡AI4S计算集群投入使用:六大优势打破传统超算与智算壁垒
上一篇 2026年4月15日 19:00
下一篇 2026年4月15日 20:00

相关推荐

发表回复

登录后才能评论

联系我们

在线咨询:1643011589-QQbutton

手机:13798586780

QQ/微信:1074760229

QQ群:551893940

工作时间:工作日9:00-18:00,节假日休息

关注微信