Appearance
Atlas 800 训练服务器(9010)
Atlas 800 训练服务器(型号 9010)是一款 4U 机架式 AI 训练服务器,基于 Intel® Cascade Lake CPU + 华为昇腾 910 处理器 打造,面向深度学习模型训练与大规模 AI 数据中心集群场景,具有高算力密度、高能效比、高网络带宽的特点。本平台的训练算力底座即采用这款服务器。
1. 整机规格
| 项目 | 规格 |
|---|---|
| 外形 | 4U 机架式服务器 |
| CPU | 2 × Intel® Cascade Lake(Xeon Gold 系列) |
| AI 处理器 | 8 × 昇腾 910(2 块 NPU 板,每块 4 颗) |
| 整机 AI 算力 | 约 2.24 PFLOPS @ FP16(标称) |
| 内存 | 24 × DDR4 DIMM(每 CPU 12 根) |
| 高速网络 | 8 × 100GE RoCE v2 接口 |
| NPU 互联 | HCCS 片间高速互联 |
| 散热 | 风冷(部分形态支持液冷) |
| 电源 | 冗余电源 |
为什么是 8 颗 NPU
整机的 8 颗昇腾 910 通过片间高速互联(HCCS)组成一个计算整体,配合 8 个 100GE RoCE 端口,既能在单机内做 8 卡并行训练,也能多台服务器组网扩展到大规模集群。这正是「分布式训练」在硬件上的基础。
2. 型号 9010 与 9000 的区别
Atlas 800 训练服务器有两个常见型号,NPU 都是昇腾 910,区别在 CPU:
| 型号 | CPU | 架构 |
|---|---|---|
| 9010(本平台) | Intel® Cascade Lake | x86 |
| 9000 | 华为鲲鹏 920 | ARM(国产化) |
对上层 PyTorch / CANN 使用者而言,两者的 NPU 开发体验一致;型号差异主要影响底层 CPU 指令集与生态。
3. 组网与扩展
- 单机 8 卡:整机内 8 颗昇腾 910 通过 HCCS 高带宽互联,适合单机多卡数据并行 / 模型并行训练。
- 多机集群:通过 8 × 100GE RoCE v2 端口横向组网,多台 Atlas 800 可扩展为大规模训练集群。
- 下一步:算力之上的软件如何调度这些 NPU,见 硬件使能 CANN。
