国产大模型公司千卡 NVIDIA 推理集群生产交付
大模型公司 NVIDIA 千卡推理生产集群
基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。
15%
GPU 平均推理吞吐提升
40.6%
首 Token 时延(TTFT)P99 降低
33%
网络硬件成本减少
国产算力千卡级集群已上线稳定运行数月,持续承载真实业务流量,并面向真实用户提供服务。
项目信息
项目环境、业务场景和验证方式。
背景与挑战
项目面向国产算力芯片公司的千卡级生产集群,目标不仅是完成测试验证,还要让网络长期承载真实业务负载并持续对外提供服务。
验证结果
本案例以生产事实呈现项目价值,不将缺少统一对比口径的运行表现包装为性能百分比。
国产算力集群完成上线。
持续承载业务负载并稳定运行数月。
面向真实用户持续提供服务。
形成从集群交付到用户反馈的生产闭环。
价值总结
ZCube 从测试验证走向生产验证,在国产算力千卡集群中形成可持续运行、真实服务和客户反馈闭环。
客户案例
查看更多 ZCube 在不同算力环境、业务场景与项目阶段中的验证和生产实践。
基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。
15%
GPU 平均推理吞吐提升
40.6%
首 Token 时延(TTFT)P99 降低
33%
网络硬件成本减少
在国产智算生态中,对比 ZCube 与传统 Clos 架构在集合通信、训练和推理维度的表现。
14.5%
All-to-All 吞吐提升
22%–30%
TTFT P99 降低
7%–10%
推理吞吐提升
对比 ZCube 与 Clos 架构,在集合通信、模型训练和多租户端到端推理场景中验证性能收益。
119%
集合通信性能提升
20.1%
模型训练吞吐提升
11.5%
推理时延降低
围绕新建集群、存量改造、性能调优或智能运维,与我们一起评估网络如何释放更多有效算力。