Skip to content

昇腾硬件

昇腾硬件是整个 AI 全栈的最底层,决定了算力的上限。本页先总览昇腾硬件全貌,再聚焦本平台所用的训练服务器及其 NPU 处理器。

1. 昇腾硬件总览

华为昇腾(Ascend)围绕自研的 AI 处理器,构建了从芯片、加速模块/卡到整机服务器、集群的完整硬件体系:

层次形态说明
AI 处理器昇腾 310 / 310P、昇腾 910 系列算力的源头,基于达芬奇(DaVinci)架构
模块 / 加速卡Atlas 200/300 等将处理器封装为可插拔的加速部件
服务器 / 整机Atlas 800 系列等集成多颗 NPU 的训练 / 推理服务器
集群多台服务器组网通过高速网络扩展为大规模算力集群

按用途,昇腾 AI 处理器分为两条线:

  • 训练昇腾 910 系列,高算力,面向模型训练。
  • 推理昇腾 310 / 310P,低功耗,面向推理部署。

2. 本平台的训练服务器

本平台的训练算力底座采用华为 Atlas 800 训练服务器(型号:9010)——一款 4U 机架式 AI 训练服务器。

它的核心算力来自 8 颗昇腾 910 处理器

  • NPU 处理器:8 × 昇腾 910,单颗约 256 TFLOPS @ FP16,整机约 2.24 PFLOPS @ FP16(标称)。
  • 片间互联:8 颗 NPU 通过 HCCS 高速互联,可在单机内做 8 卡并行训练。
  • CPU:2 × Intel® Cascade Lake(型号 9010 采用 x86 平台)。
  • 组网:8 × 100GE RoCE v2 端口,多台服务器可横向扩展为训练集群。

简单说:本平台训练任务最终运行在 Atlas 800(9010)整机里的昇腾 910 NPU 上,由 CANN 调度、PyTorch 接入。

3. 本章导航

本章自顶向下,从整机形态到芯片架构逐层展开:

页面内容
Atlas 800 训练服务器(9010)整机规格、型号区别、组网形态
昇腾 910 AI 处理器训练芯片定位、算力、互联
达芬奇(DaVinci)架构AI Core 与 Cube/Vector/Scalar 计算单元
NPU 与 GPU 对比与 CUDA 生态的类比理解

阅读路线

想快速了解平台用的是什么机器,从 Atlas 800(9010) 看起即可;想理解算力从何而来,再依次读 昇腾 910达芬奇架构

参考资料