什么是 AI 加速器?

AI 加速器是为机器学习训练或推理负载提供高效执行能力的专用硬件及其配套软件栈,相比只使用通用处理器,它通常会针对矩阵、张量或数据搬运进行优化。

快速了解

规范文档官方规范

工作原理

测速度前先通过兼容性资格审查

固定准确的模型图与权重、数值格式、算子、Tokenizer 或特征流水线、Runtime、编译器和 Driver;采集性能前先验证输出质量、内存容量、拓扑、故障恢复和必要可观测性。不支持算子回退、精度变化或静默截断上下文都可能让结果看似更快,却已经改变负载。经典 [Roofline Model](https://arxiv.org/abs/1911.02549)有助于区分算力与内存瓶颈,但生产资格审查还必须覆盖软件和分布式系统约束。

只比较同一个版本化工作负载契约

统一输入输出分布、序列或 Feature Shape、并发、Batching Policy、Warmup、测量窗口、质量目标和请求级延迟指标,并声明硬件数量、Host、内存、互联、功耗边界及全部软件 Revision。MLCommons 发布架构中立且可复现的 [MLPerf Inference 结果](https://mlcommons.org/2026/09/mlperf-inference-v6-1-results/),并为不同负载定义专门规则;真正可迁移的方法是只在场景与约束一致时比较,不能拼接互不相关的宣传数字。

优化已验收 Goodput 与完整成本

先拒绝未通过兼容性、质量、可靠性或延迟门禁的运行,再对合格结果报告每秒已验收输出、尾延迟、错误、峰值内存、实测能耗和每个已验收输出的成本。TCO 应纳入加速器、Host、网络、存储、License、预留容量、空闲余量、迁移研发和运维支持。原始 Throughput 更高的系统,在计入重试、无效输出、Queue Delay 或低利用率后可能反而落后。

让选型决策可以复核与撤销

在架构决策中记录工作负载 Revision、Benchmark Harness、结果制品、假设和 Owner,并在投入集群前验证模型打包、部署、回滚、Debug 和容量故障。模型、精度、流量形态、SLO、Runtime、Driver、硬件拓扑、供给或价格合同发生变化时重新审查。正确选择是当前产品边界下风险最低的合格系统,而不是对芯片家族做永久排名。

主要特点

  • 把专用矩阵或张量执行单元与编译器、Runtime 和 Kernel 栈组合为完整系统
  • 内存层级与互联拓扑可能主导端到端性能
  • 可能用通用可编程性和可移植性换取特定负载效率
  • 必须按完整系统评测,不能只看单芯片峰值算力
  • 需要分别提供兼容性、质量、延迟、可靠性与成本证据
  • 模型、精度、流量或软件变化都可能改变相对性能

常见用途

  1. 在单节点或多加速器节点上训练与微调神经网络
  2. 在 TTFT 与 Token 间延迟目标下服务自回归语言模型
  3. 规模化执行视觉、语音、推荐和 Embedding 负载
  4. 在端侧运行注重隐私或低延迟的模型推理
  5. 用已验收 Goodput 与完整 TCO 比较通过资格审查的硬件平台

示例

loading...
Loading code...

常见问题

AI 加速器和 GPU 是同一个概念吗?

不是。GPU 是 AI 加速器的一类,其他类型还包括 TPU、自研 ASIC、推理专用处理器、晶圆级系统和端侧 NPU。生产系统还包含编译器、Runtime、Kernel、内存、互联、Host 与服务软件。

哪些因素决定 AI 加速器是否适合某个负载?

关键因素包括模型与算子支持、数值格式、权重与 KV Cache 容量、内存带宽、拓扑、序列分布、并发、延迟目标、质量门禁、区域供给以及软件和运维栈成熟度。

为什么不同 AI 加速器基准会得出冲突结论?

基准可能使用不同模型、精度、Batch、序列长度、硬件数量、Runtime、质量目标和延迟约束;有些报告单芯片理论值,另一些测量整机。只有这些身份和边界一致时,结果才具有可比性。

比较 AI 加速器最重要的指标是什么?

不存在单个充分指标。应先执行兼容性与质量硬门禁,再报告延迟分位数、已验收输出 Goodput、错误、内存、可靠性、实测能耗、每个已验收单位的完整成本与迁移风险。

什么时候需要重新评估 AI 加速器选型?

模型、精度、上下文或 Feature 分布、并发、延迟目标、Runtime、Driver、供给、价格合同或产品验收策略发生实质变化时都应重评。版本化工作负载契约能指出必须重跑哪些资格门禁。

相关术语

相关文章