Appearance
昇腾硬件
昇腾硬件是整个 AI 全栈的最底层,决定了算力的上限。本页先总览昇腾硬件全貌,再聚焦本平台所用的训练服务器及其 NPU 处理器。
1. 昇腾硬件总览
华为昇腾(Ascend)围绕自研的 AI 处理器,构建了从芯片、加速模块/卡到整机服务器、集群的完整硬件体系:
| 层次 | 形态 | 说明 |
|---|---|---|
| AI 处理器 | 昇腾 310 / 310P、昇腾 910 系列 | 算力的源头,基于达芬奇(DaVinci)架构 |
| 模块 / 加速卡 | Atlas 200/300 等 | 将处理器封装为可插拔的加速部件 |
| 服务器 / 整机 | Atlas 800 系列等 | 集成多颗 NPU 的训练 / 推理服务器 |
| 集群 | 多台服务器组网 | 通过高速网络扩展为大规模算力集群 |
按用途,昇腾 AI 处理器分为两条线:
- 训练:昇腾 910 系列,高算力,面向模型训练。
- 推理:昇腾 310 / 310P,低功耗,面向推理部署。
2. 本平台的训练服务器
本平台的训练算力底座采用华为 Atlas 800 训练服务器(型号:9010)——一款 4U 机架式 AI 训练服务器。
它的核心算力来自 8 颗昇腾 910 处理器:
- NPU 处理器:8 × 昇腾 910,单颗约 256 TFLOPS @ FP16,整机约 2.24 PFLOPS @ FP16(标称)。
- 片间互联:8 颗 NPU 通过 HCCS 高速互联,可在单机内做 8 卡并行训练。
- CPU:2 × Intel® Cascade Lake(型号 9010 采用 x86 平台)。
- 组网:8 × 100GE RoCE v2 端口,多台服务器可横向扩展为训练集群。
简单说:本平台训练任务最终运行在 Atlas 800(9010)整机里的昇腾 910 NPU 上,由 CANN 调度、PyTorch 接入。
3. 本章导航
本章自顶向下,从整机形态到芯片架构逐层展开:
| 页面 | 内容 |
|---|---|
| Atlas 800 训练服务器(9010) | 整机规格、型号区别、组网形态 |
| 昇腾 910 AI 处理器 | 训练芯片定位、算力、互联 |
| 达芬奇(DaVinci)架构 | AI Core 与 Cube/Vector/Scalar 计算单元 |
| NPU 与 GPU 对比 | 与 CUDA 生态的类比理解 |
阅读路线
想快速了解平台用的是什么机器,从 Atlas 800(9010) 看起即可;想理解算力从何而来,再依次读 昇腾 910 与 达芬奇架构。
