训练场国产 GPU 推理集群
在国产智算生态中,对比 ZCube 与传统 Clos 架构在集合通信、训练和推理维度的表现。
14.5%
All-to-All 吞吐提升
22%–30%
TTFT P99 降低
7%–10%
推理吞吐提升
基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。
项目信息
项目环境、业务场景和验证方式。
背景与挑战
大规模推理业务中的动态流量容易带来网络拥塞、尾时延和 GPU 空转。项目在千卡生产集群中完成 ZCube 规模交付,以真实业务观察网络架构优化对推理产能和单位 Token 成本的影响。
验证结果
以下指标仅适用于本案例所述千卡集群、Coding 推理业务和网络改造条件。
15%
GPU 平均推理吞吐提升
仅升级网络架构释放更多有效算力。
40.6%
首 Token 时延(TTFT)P99 降低
高并发推理尾时延显著改善。
33%
网络硬件成本减少
交换机与光模块所需数量锐减。
27%–46%
KV Cache 传输时延降低
改善 Prefill 与 Decode 节点之间的数据交换。
30%–50%
网络传输性能提升
来自生产环境持续运行的综合表现。
79%
PFC 均值降低
网络拥塞和 PFC 反压频率明显下降。
价值总结
ZCube 在主流 NVIDIA 大规模推理集群中,可通过网络架构优化释放更多有效算力,并降低单位 Token 成本。
客户案例
查看更多 ZCube 在不同算力环境、业务场景与项目阶段中的验证和生产实践。
在国产智算生态中,对比 ZCube 与传统 Clos 架构在集合通信、训练和推理维度的表现。
14.5%
All-to-All 吞吐提升
22%–30%
TTFT P99 降低
7%–10%
推理吞吐提升
对比 ZCube 与 Clos 架构,在集合通信、模型训练和多租户端到端推理场景中验证性能收益。
119%
集合通信性能提升
20.1%
模型训练吞吐提升
11.5%
推理时延降低
国产算力千卡级集群已上线稳定运行数月,持续承载真实业务流量,并面向真实用户提供服务。
千卡规模
国产算力集群部署
数月
生产环境稳定运行
真实用户
持续提供服务
围绕新建集群、存量改造、性能调优或智能运维,与我们一起评估网络如何释放更多有效算力。