随着人工智能模型规模与算力集群持续扩大,集群内部各计算单元之间的数据传输效率,已成为影响整体算力利用率的关键因素。近日,天津大学—凌波智芯先进算力互联技术联合实验室在天津大学正式成立。联合实验室聚焦人工智能算力互联,将围绕高性能AI网卡、Scale-out网络、无链接RoCE、先进流量控制、高并发状态管理和可靠传输等方向开展联合攻关,推动高校科研成果的工程化落地与产业化转化。
近年来,随着AI集群进入高并发、强同步的训练与推理阶段,算力互联的瓶颈正从“端口带宽是否充足”下沉至网卡内部的数据通路、连接状态组织、队列调度、拥塞反馈等环节。在大模型训练中,Collective通信的完成时间直接影响每一轮迭代效率;在推理侧,专家并行、跨节点KV数据交换和请求突发也会放大网络延迟的长尾效应——如同高速公路上个别车道的偶发卡顿,足以拖垮整条道路的通行效率。尤其是在十万卡级以上的超大规模集群中,传统网络架构面临严峻的通信瓶颈,对网卡芯片架构、拥塞控制及高并发处理技术提出了更高要求。
针对这一痛点,凌波智芯研发了LINGBO系列高性能AI网卡,并提出“无链接RoCE”技术路线。与简单提高SerDes速率、或将现有RoCE逻辑移植到更高速芯片上的思路不同,该路线在保持RoCEv2协议和开放以太网生态兼容的前提下,重构网卡内部的通信状态组织、队列调度与可靠传输机制,使网卡在高并发AI通信下仍能维持高效的数据面处理。由于创新集中于网卡内部实现,对外仍沿用Ethernet/IP/UDP/RoCEv2基本封装和现有交换网络,客户无需改动组网架构即可部署。
按照分工,天津大学发挥在网络体系、拥塞控制等领域的科研优势,凌波智芯则依托其在FPGA验证、芯片RTL设计、板卡与驱动开发及客户场景验证方面的工程能力,双方共同打通从论文原理、硬件IP到产品化和真实业务验证的完整链条。
凌波智芯创始人、天津大学教授李文信表示,LINGBO系列AI网卡是当前技术落地的重要产品载体,联合实验室的长期目标是沉淀协议、架构、算法等底层能力和核心知识产权。未来,双方将围绕Scale-out网络性能优化持续推进核心技术工程化,提升现有AI集群的有效算力利用水平。(中国经济网记者杨秀峰)
(责任编辑:李冬阳)