报告概述
IFEC(In Fabric Extended-Computation)是一种xPU与交换芯片的协同计算范式,专为超节点架构中跨xPU的通信加速与卸载而设计。报告详细阐述了IFEC的规范和实现细节,包括扩展计算头(ECH)协议设计、通信流程(如Dispatch、Combine、Broadcast等)、流控与内存一致性机制,以及xPU与片上总线的实现参考。该规范旨在为xPU厂商、交换机厂商和IP厂商提供设计参考,推动开放解耦、分层设计的在网计算标准。
报告的核心结论
IFEC支持动态与静态通信组,优化MoE ALL2ALL性能
针对MoE ALL2ALL这类算子,IFEC可通过数据平面创建动态多播组,确保其时延性能;同时支持通过GNMI等控制面下发静态通信组,灵活适应不同场景。
下一代交换芯片需具备动态多播与可计算能力
报告指出,高带宽域内的交换芯片必须支持动态多播(按需创建组播组)和在网计算能力(如Min/Sum/Max等规约操作),以实现与xPU的高质量协同。
IFEC与上层协议完全解耦,通过ECH头识别加速操作
IFEC通过扩展计算头(ECH)携带加速信息,上层协议(如标准以太网或ETH+)无需携带通信卸载相关信息,降低了协议耦合度,增强了通用性和可扩展性。
非对称集合通信可通过收地址映射实现连续显存布局
针对Dispatch等非对称集合通信,报告提出一种收发联动的机制:使用虚拟地址和计数器,使接收端数据连续排布,最小化显存开销。
报告回答的关键问题
什么是IFEC?
IFEC(In Fabric Extended-Computation)是一种在网计算范式,允许交换芯片在数据传输路径中直接完成分布式数据的汇聚、计算及结果分发,适用于超节点架构中跨xPU的通信加速和卸载。
IFEC如何加速MoE ALL2ALL通信?
IFEC通过动态多播组支持MoE ALL2ALL中的Dispatch和Combine操作。交换机识别ECH头后,对Dispatch请求进行数据复制分发,对Combine数据进行规约,从而减少通信次数和延迟。
IFEC与传统交换芯片有何不同?
传统交换芯片仅负责数据转发,而IFEC交换芯片集成了在网计算引擎,支持动态多播和规约运算(如Sum/Min/Max),能够在数据路径上直接完成集合通信加速,无需xPU参与中间步骤。
完整报告包含什么
- IFEC协议设计细节:包括扩展计算头(ECH)的标准头与精简头结构、字段定义(Version、Instruction id、Type、Status、Data type、Op type等)。
- 多播头定义:提供256MH、64MH、xPUid16、xPUid8四种多播头格式,适用于不同规模的EP场景。
- IFEC域建立方式:支持动态方式(LLDP扩展TLV)和静态方式(配置xPUid),并绑定xPUid与端口映射。
- 各种通信流程加速:详细描述Dispatch、Combine、Broadcast等操作的加速流程,以及分批加速、单卡多专家场景支持。
- 对称显存加速功能:利用IFEC多播和规约操作提升对称显存性能,加速小消息集合通信和Barrier操作。
- 流控与内存一致性:基于CBFC建立VC,建议区分请求与数据VC避免死锁,并说明IFEC不破坏内存一致性保证。
- 对称与非对称集合通信内存地址连续性实现参考:分别给出基于虚拟地址的PUSH/PULL机制和收发联动的连续显存布局方案。
- xPU与片上总线实现参考:提供类AXI Sideband、AXI Userbit、Streaming以及SM编址映射静态组播表四种实现方式。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





