微信扫码
添加专属顾问
我要投稿
前段时间写了篇英伟达IB组网的文章《256台H100如何组建集群?》,很多网友要求分享1024台服务器怎么组集群。刚好最近公司在建设华为昇腾910B集群,简单分享一下采用RoCE组网的“万卡集群”。
集群的物理网络按不同功能设计为4个网络:
业务网络/带内管理网络:主要用于系统业务调度与管理。当然,也可以将业务网络与带内管理网络可以分开。
带外管理网络:每个AI服务器或存储服务器提供1个GE网口接入到GE 交换机,接入到管理区网络,主要用于集群设备的带外管理与操作。
Spine采用华为框式RoCE交换机CE16808,Leaf采用华为盒式RoCE交换机CE9860。
Spine交换机(CE16808):每台交换机8块业务板,8业务板* 36端口/业务板*400G=288个400G端口。
Leaf交换机(CE9860):每台交换机4块业务子板,共16个上行400G端口+16个下行400G端口(一分二变为32个下行200G端口)。
再附上一张“Spine交换机-Leaf交换机-AI服务器”端口连线图,有点复杂,感兴趣的可以仔细琢磨一下,不感兴趣的直接跳过,哈哈。
以上16台Spine交换机(CE16808)最多可以接入288台Leaf交换机(CE9860),288台Leaf交换机下行组多可以提供288*32=9216个200G端口,即9216张昇腾910B卡(1152台昇腾910B服务器),四舍五入,勉强称为“万卡集群”。
如果将Spine交换机从CE16808换成16块业务板的CE16816,则16台Spine交换机最多可以接入576台Leaf交换机(CE9860),可以接入的昇腾910B卡也翻倍到18432张(2304台昇腾910B服务器),名副其实的“万卡集群”。
再进一步,如果Leaf交换机采用CE16808,最多可以提供288个400G端口,其中128个400G上行端口,128个下行400G端口(一分二变为256个下行200G端口)。与之对应,128台Spine交换机(CE16816),每台CE16816可以提供576个400G端口。如下图所示:
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-03-27
林俊旸离职后首次发声!复盘千问的弯路,指出AI的新路
2026-03-26
GitHub 悄悄改了规则,你的代码可能正在被拿去训练 AI
2026-03-26
Harness is the New Dataset:模型智能提升的下一个关键方向
2026-03-26
Google 亲手证明:GUI 已死,但尸体还在动
2026-03-26
Claude Code 太烧钱了?我用这 5 招,把 token 成本砍了一半!
2026-03-26
治愈 Cursor AI 编程的 “幻觉”?用它就够了!
2026-03-26
Anthropic官方复盘Claude Code:智能体系统设计的四个核心
2026-03-26
Claude Code auto mode 解析:如何用 AI 分类器替代人工审批
2026-01-24
2026-01-10
2026-01-01
2026-01-26
2026-01-09
2026-01-09
2026-01-23
2025-12-30
2026-01-14
2026-01-21
2026-03-22
2026-03-22
2026-03-21
2026-03-20
2026-03-19
2026-03-19
2026-03-19
2026-03-18