Skip to content

Atlas 800 训练服务器(9010)

Atlas 800 训练服务器(型号 9010)是一款 4U 机架式 AI 训练服务器,基于 Intel® Cascade Lake CPU + 华为昇腾 910 处理器 打造,面向深度学习模型训练与大规模 AI 数据中心集群场景,具有高算力密度、高能效比、高网络带宽的特点。本平台的训练算力底座即采用这款服务器。

1. 整机规格

项目规格
外形4U 机架式服务器
CPU2 × Intel® Cascade Lake(Xeon Gold 系列)
AI 处理器8 × 昇腾 910(2 块 NPU 板,每块 4 颗)
整机 AI 算力2.24 PFLOPS @ FP16(标称)
内存24 × DDR4 DIMM(每 CPU 12 根)
高速网络8 × 100GE RoCE v2 接口
NPU 互联HCCS 片间高速互联
散热风冷(部分形态支持液冷)
电源冗余电源

为什么是 8 颗 NPU

整机的 8 颗昇腾 910 通过片间高速互联(HCCS)组成一个计算整体,配合 8 个 100GE RoCE 端口,既能在单机内做 8 卡并行训练,也能多台服务器组网扩展到大规模集群。这正是「分布式训练」在硬件上的基础。

2. 型号 9010 与 9000 的区别

Atlas 800 训练服务器有两个常见型号,NPU 都是昇腾 910,区别在 CPU

型号CPU架构
9010(本平台)Intel® Cascade Lakex86
9000华为鲲鹏 920ARM(国产化)

对上层 PyTorch / CANN 使用者而言,两者的 NPU 开发体验一致;型号差异主要影响底层 CPU 指令集与生态。

3. 组网与扩展

  • 单机 8 卡:整机内 8 颗昇腾 910 通过 HCCS 高带宽互联,适合单机多卡数据并行 / 模型并行训练。
  • 多机集群:通过 8 × 100GE RoCE v2 端口横向组网,多台 Atlas 800 可扩展为大规模训练集群。
  • 下一步:算力之上的软件如何调度这些 NPU,见 硬件使能 CANN