跳到主要内容
客户案例

大模型公司 NVIDIA 千卡推理生产集群

基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。

国产大模型公司千卡 NVIDIA 推理集群生产交付

项目信息

项目概览

项目环境、业务场景和验证方式。

客户类型
国产大模型公司
项目阶段
生产交付
硬件生态
千卡 NVIDIA 推理集群
业务场景
Coding 推理服务
对比基线
传统 ROFT 网络架构
案例类型
量化验证型案例

背景与挑战

项目背景

大规模推理业务中的动态流量容易带来网络拥塞、尾时延和 GPU 空转。项目在千卡生产集群中完成 ZCube 规模交付,以真实业务观察网络架构优化对推理产能和单位 Token 成本的影响。

验证或交付方式

  • 保持 GPU、软件栈和应用不变,对比网络架构改造前后的生产表现
  • 采用 ZCube 扁平化组网与更均衡网络通信
  • 持续观察推理吞吐、TTFT、KV Cache 传输时延和 PFC 等关键指标

验证结果

验证结果

以下指标仅适用于本案例所述千卡集群、Coding 推理业务和网络改造条件。

15%

GPU 平均推理吞吐提升

仅升级网络架构释放更多有效算力。

40.6%

首 Token 时延(TTFT)P99 降低

高并发推理尾时延显著改善。

33%

网络硬件成本减少

交换机与光模块所需数量锐减。

27%–46%

KV Cache 传输时延降低

改善 Prefill 与 Decode 节点之间的数据交换。

30%–50%

网络传输性能提升

来自生产环境持续运行的综合表现。

79%

PFC 均值降低

网络拥塞和 PFC 反压频率明显下降。

价值总结

案例价值

ZCube 在主流 NVIDIA 大规模推理集群中,可通过网络架构优化释放更多有效算力,并降低单位 Token 成本。

  • 验证网络架构创新可以直接转化为生产推理收益
  • 在不更换 GPU、软件栈和应用的条件下释放更多有效算力
  • 为千卡级推理集群的网络改造提供可复用实践

客户案例

其他客户案例

查看更多 ZCube 在不同算力环境、业务场景与项目阶段中的验证和生产实践。

训练场国产 GPU 推理集群独立验证

训练场国产 GPU 推理集群

在国产智算生态中,对比 ZCube 与传统 Clos 架构在集合通信、训练和推理维度的表现。

14.5%

All-to-All 吞吐提升

22%–30%

TTFT P99 降低

7%–10%

推理吞吐提升

查看案例
某运营商国产 GPU 集群独立验证

运营商国产 GPU 集群

对比 ZCube 与 Clos 架构,在集合通信、模型训练和多租户端到端推理场景中验证性能收益。

119%

集合通信性能提升

20.1%

模型训练吞吐提升

11.5%

推理时延降低

查看案例
国产算力芯片公司国产 GPU 千卡集群生产交付

国产算力芯片公司千卡生产集群

国产算力千卡级集群已上线稳定运行数月,持续承载真实业务流量,并面向真实用户提供服务。

千卡规模

国产算力集群部署

数月

生产环境稳定运行

真实用户

持续提供服务

查看案例
从网络开始

让下一座智算中心,从网络开始更高效

围绕新建集群、存量改造、性能调优或智能运维,与我们一起评估网络如何释放更多有效算力。

联系我们