智算网络专题导读
赵慧玲;<正>智算网络作为算力高效调度与资源协同联动的核心载体,直接决定了算力资源的利用效率,是支撑AI大模型训练及“东数西算”工程落地的关键基础设施。当前,智算网络面临的核心技术挑战主要集中在4个方面:一是万卡级集群互联扩展性不足,传统网络架构难以支撑高带宽、低时延、无阻塞的大规模组网需求;二是广域无损传输难以保障,远程直接内存访问(RDMA)对丢包极为敏感,在长距场景下,现有拥塞控制与流控机制往往失效;三是大模型流量特征与调度策略不匹配,低熵大象流以及点对多点(P2MP)、全互联(All-to-All)等通信模式易导致负载不均、资源利用率低下;四是存算网边全栈协同缺失,键值缓存(KV-Cache)复用效率偏低,边缘侧资源受限,异构算力与光电混合组网缺乏统一的调度机制。
长距高性能网络关键技术研究
王亚晨;杨峰;耿竞一;针对AI大模型训练规模突破万卡、需跨园区长距组网的新需求,提出了一套端到端的联合优化解决方案:分级流控技术将任务完成时间(JCT)降低一个数量级;快速拥塞反馈机制将拥塞反馈延迟从毫秒压缩至数十微秒;逐流负载均衡协议消除端口负载不均问题;采用拓扑亲和的ZeRO 1策略替代ZeRO 3,大幅减少跨园区通信次数。实验网测试表明,通过整合上述关键技术,在千亿参数模型训练场景下可将跨园区训练的算力损失从10%~15%降低至5%以内,验证了长距网络支撑超大规模AI训练的可行性。
广域无损智算网络关键技术研究与实践
雷波;潘永琛;唐静;智算中心跨域互联已成为支撑规模化人工智能服务的关键网络新形态。系统分析了广域智算网络面临的传输需求与挑战,提出了构建广域无损智算网络的核心概念,以精准流量控制和队列缓存增强为关键技术路径,推动广域智算互联从尽力而为传输向无损承载演进。广域无损智算网络面向存算分离训练、云边协同推理等多类智算服务场景,实现了网络拥塞条件下的无损高效传输,为规模化智算服务构建了稳定可靠的网络底座。
Scale-Up网络内GPU卡间互联及OISA技术体系
宋晓勇;李锴;陈佳媛;针对图形处理器(GPU)Scale-Up卡间互联,系统梳理了其发展背景、核心需求与现实挑战,总结了从通用总线、私有协议到开放标准的3阶段演进历程及技术趋势。以中国移动提出的全向智感互联架构(OISA)为分析对象,详细阐述了其架构设计、核心技术特征与创新优势。在此基础上,结合大模型推理阶段键值缓存(KV Cache)的存储通信需求,以及超节点场景下Scale-Up互联面临的新挑战,对其未来发展方向进行了展望与探讨,为智算网络体系构建及超节点演进提供了参考。研究结果表明,各协议技术正逐渐趋同,开放互联已成为重要发展态势。OISA依托分层协议栈设计与关键技术创新,构建了高效、可靠、灵活、开放的GPU高速互联体系,为智算服务器向超节点迭代升级提供了关键支撑。
智算中心光电混合组网下的流量差异化调度技术研究
韩博文;刘千仞;廖思忆;胡雅坤;曹畅;光电混合组网凭借“电交换的灵活可控”与“光交换的高带宽低时延”双重特性,已成为智算中心网络的核心发展趋势。聚焦智算中心光电混合组网场景,深入分析AI训练流量的差异化特征,并提出一种基于流量特征的差异化调度机制。该机制通过构建“感知-决策-执行-反馈”的闭环调度框架,实现了对数据并行(DP)流量、流水线并行(PP)流量等多种类型流量的精准识别与链路优势匹配。研究成果为智算中心光电混合组网下的流量差异化调度提供了理论依据与实践参考。
面向边缘场景的高效大模型分层部署机制
万卓然;谢人超;王媛;王芳;唐琴琴;黄韬;针对边缘设备资源受限导致大模型推理延迟高、吞吐量低的问题,提出了一种高效的分层部署优化机制,构建了“数据供给-空间保障-时间重叠”协同架构。具体而言,首先利用内存映射(mmap)实现权重按需加载以打破大模型加载的输入/输出瓶颈。其次通过静态内存预分配与指针偏移复用,彻底规避垃圾回收引发的系统抖动。最后提出基于权重矩阵粒度的流水线调度,拆解并行计算与加载任务,有效重叠显存访问延迟。实验表明,该机制在不增加显存占用的前提下显著提升了推理效率,推理吞吐量提升1倍以上,有效支撑了边缘侧大模型的实时推理需求。
Token原生的Scale Across网络
苏远超;传统广域网架构的设计初衷是承载普通流量,并未考虑人工智能(AI)工作负载的特殊性。基于第一性原理,提出一种新的Token原生Scale Across网络,支持各类AI负载在广域网中的传送。该网络采用模型与基础设施协同设计、每任务流量工程以及统一的互联网协议第6版(IPv6)寻址方案。相比传统网络,其容量扩展能力提升100倍,收敛时间缩短至原来的1/10,成本降低50%。