行业资讯

读懂 AI 芯片规格表:精度、稀疏与算力完全指南

发布时间:2026/8/24 1:21:01
读懂 AI 芯片规格表:精度、稀疏与算力完全指南 每次看到 2070 TFLOPSFP4Sparse 这样的参数你是不是觉得每个字都认识连在一起就开始恍惚这篇文章把 AI 算力规格表里反复出现的那几个核心概念——精度、稀疏、算力单位、模型压缩——一次性讲透。不灌水不劝退看完之后你再读任何一颗芯片的 datasheet都不会再卡壳。0. 为什么这件事值得搞懂2024 年以前你买显卡大概只关心一个数多少 TFLOPS。但到了 2025–2026 年一颗 AI 加速芯片的规格表可能长这样精度稠密算力稀疏算力FP6440 TFLOPS—FP3280 TFLOPS—TF32160 TFLOPS320 TFLOPSFP16 / BF16320 TFLOPS640 TFLOPSFP8640 TFLOPS1280 TFLOPSFP41280 TFLOPS2560 TFLOPSINT8640 TOPS1280 TOPS上表为示意结构非某一颗具体芯片的精确参数。你会发现同一颗芯片能标出七八个算力数字彼此之间差了几十倍。这不是厂商在耍花招——每一个数字背后都对应着不同的数据精度和是否启用稀疏加速。如果你不搞清楚这些前提条件拿 A 芯片的 FP4 稀疏算力去和 B 芯片的 FP16 稠密算力比大小得出的结论毫无意义。所以我们从最底层开始。1. 算力到底在算什么FLOPS 与 OPS1.1 一次运算是什么神经网络的核心操作是矩阵乘法大量的乘一下再加起来Multiply-Accumulate, MAC。一次 MAC 包含一次乘法和一次加法算2 次浮点运算。FLOPSFloating-point Operations Per Second就是每秒能做多少次浮点运算。1 TFLOPS 10¹² 次浮点运算/秒Tera万亿1 PFLOPS 10¹⁵ 次浮点运算/秒Peta千万亿TOPSTera Operations Per Second结构相同但通常用于整数运算INT8、INT4。你会在推理芯片、NPU、手机 SoC 的规格里频繁看到它。简单记FLOPS 对应浮点TOPS 对应整数。两者量纲一样但数据类型不同不能直接互比。1.2 峰值算力 vs 有效算力规格表上印的数字几乎都是峰值算力Peak / Theoretical——假设每个时钟周期、每个计算单元都满载运行且数据搬运零延迟。现实中内存带宽瓶颈、kernel 调度开销、算子融合程度、batch size 大小……都会让实际利用率大打折扣。工程经验上有效算力Sustained / Effective Throughput通常只有峰值的 30%–70%在 LLM 推理的 decode 阶段逐 token 生成、严重受限于显存带宽甚至可能低于 10%。所以看到XX PFLOPS 集群的新闻时心里自动打个折。2. 精度每一个 bit 都有代价这是整篇文章最核心的部分。芯片规格表上那些 FP32、BF16、FP8、FP4 到底在说什么2.1 浮点数的解剖一个浮点数由三段二进制位拼接而成┌──────┬──────────┬──────────────┐ │ 符号 │ 指数 │ 尾数 │ │ Sign │ Exponent │ Mantissa │ │ 1bit │ E bit │ M bit │ └──────┴──────────┴──────────────┘符号位S正还是负永远 1 bit。指数位E决定数值的动态范围能表示多大或多小的数。尾数位M决定数值的精度有效数字有几位。三者的位宽分配就是不同格式之间最本质的区别。2.2 主流格式全景下面这张表覆盖了你在 2026 年的 AI 芯片规格表中可能遇到的所有主流格式格式总位宽SEM动态范围约典型用途备注FP646411152±1.8×10³⁰⁸HPC / 科学计算双精度AI 训练几乎不用FP32321823±3.4×10³⁸传统训练基准单精度标准浮点TF32191810±3.4×10³⁸NVIDIA Ampere 训练存储仍为 32bit计算时截断尾数FP16161510±6.5×10⁴混合精度训练 / 推理半精度范围小易溢出BF1616187±3.4×10³⁸训练主流TPU / GPU范围同 FP32精度换范围FP8 E4M38143±448推理前向OCP MX 标准NVIDIA HopperFP8 E5M28152±57344训练反向梯度范围更大精度更低FP6 E2M36123±7.5实验性推理OCP MX 标准FP6 E3M26132±28实验性推理OCP MX 标准正常范围最大 ±28FP4 E2M14121±6.0超低精度推理NVIDIA Blackwell 原生支持INT88———-128 ~ 127推理量化经典整数无指数/尾数概念INT44———-8 ~ 7极致推理量化常配合 group-wise scale几个值得展开说的点FP16 vs BF16同样 16 位取舍完全不同FP16: [S][E E E E E][M M M M M M M M M M] ← 精度好范围窄 BF16: [S][E E E E E E E E][M M M M M M M] ← 范围大精度粗FP16 的指数只有 5 位最大只能表示到 ±65504。训练时梯度动辄出现很大的值FP16 直接溢出变Inf​所以必须搭配 loss scaling 等技巧。BF16 把指数扩到 8 位和 FP32 一样范围完全够用代价是尾数只剩 7 位FP32 是 23 位。Google 的 TPU 从一开始就押注 BF16后来 NVIDIA 在 Ampere 架构上也加入了 BF16 支持现在它已经是大模型训练的事实标准精度。FP8 的两个变体不是随便选的OCPOpen Compute Project在 2022 年先发布了 FP8 子格式E4M3 / E5M2随后于 2023 年发布完整的 MXMicroscaling格式族规范MXFP8 / MXFP6 / MXFP4其中 FP8 有两个子格式E4M34 位指数 3 位尾数范围较小但精度稍好适合前向传播激活值、权重。E5M25 位指数 2 位尾数范围更大但精度更粗适合反向传播梯度值的动态范围更大。NVIDIA 从 HopperH100, 2022开始在硬件层面支持 FP8训练时前向用 E4M3、反向用 E5M2已经成为 8-bit 训练的标准做法。FP42025–2026 年的新战场FP4E2M1只有 4 个 bit1 位符号、2 位指数、1 位尾数。它能表示的非零值极其有限大约只有 {±0.5, ±1, ±1.5, ±2, ±3, ±4, ±6} 这几个离散值加上 0。单独看这个精度粗糙到令人不安。但它能 work 的关键在于Microscaling微缩放不是每个数独立用 4 bit 表示而是一小组数比如 32 个共享一个高精度的缩放因子scale组内每个元素只存相对值。这样既保留了组间的动态范围又把每个元素的存储压到了 4 bit。NVIDIA Blackwell 架构B200 / GB200, 2025在硬件层面原生支持 MXFP4配合 Transformer Engine 自动管理缩放使得 FP4 推理在 LLM 场景下的精度损失被控制在了可接受范围内。INT8 / INT4整数量化整数格式没有指数和尾数的概念就是一个定点数。INT8 量化把 FP32 权重线性映射到 -128~127是推理部署的经典手段TensorRT、ONNX Runtime、llama.cpp 都支持。INT4 更激进通常需要group-wise quantization每 32 或 128 个权重共享一个 scale 和 zero-point来保住精度。GPTQ、AWQ、GGUF 等主流量化方案的核心都是 INT4。2.3 精度越低算力越高——为什么芯片的算力本质上取决于每个时钟周期能完成多少次乘加运算。一个乘法器的硬件面积和功耗大致粗略与操作数的位宽的平方成正比——这是忽略布线成本与数据类型差异的教学近似因为要做位宽 × 位宽的乘法阵列。所以FP32 乘法器面积 ∝ 32² 1024 FP16 乘法器面积 ∝ 16² 256 → 同样芯片面积能放 4 倍的 FP16 乘法器 FP8 乘法器面积 ∝ 8² 64 → 16 倍 FP4 乘法器面积 ∝ 4² 16 → 64 倍这就是为什么同一颗芯片FP4 算力可以是 FP32 的几十倍——不是芯片变快了是每次运算变便宜了同样面积塞进了更多计算单元。当然精度降低必然带来数值误差。整个 AI 系统工程的演进史某种程度上就是一部在保证模型效果的前提下把精度一降再降的历史。2.4 一张图看清位宽演进FP64 ████████████████████████████████████████████████████████████ 64 bit FP32 ████████████████████████████████ 32 bit TF32 ███████████████████ 19 bit (计算) BF16 ████████████████ 16 bit FP16 ████████████████ 16 bit FP8 ████████ 8 bit FP6 ██████ 6 bit FP4 ████ 4 bit INT8 ████████ 8 bit INT4 ████ 4 bit趋势一目了然。从 2017 年 Volta 引入 Tensor Core 支持 FP16到 2022 年 Hopper 支持 FP8再到 2025 年 Blackwell 支持 FP4——大约每三年主流推理精度降一半算力翻几倍。3. 稀疏跳过那些没用的零3.1 什么是稀疏一个训练好的神经网络权重矩阵里可能有 50%、70% 甚至 90% 的值是零或接近零。这些零对输出没有贡献但如果你老老实实做矩阵乘法每个零都要参与一次0 × x 0的运算——纯粹的浪费。稀疏Sparsity描述的就是矩阵中零元素的比例。而稀疏计算的核心思想是识别出零跳过它只算非零的部分。3.2 结构化稀疏 vs 非结构化稀疏零的分布方式决定了硬件能不能高效利用它非结构化稀疏Unstructured Sparsity零的位置完全随机像这样[ 0.3, 0, 0, 0.7 ] [ 0, 0.1, 0.5, 0 ] [ 0, 0, 0.2, 0 ] [ 0.9, 0, 0, 0.4 ]稀疏率可能很高比如 80%但零散布在各处硬件要跳过它们就需要额外的索引数组来记录哪些位置是非零的访存模式变得不规则cache 命中率暴跌。实际加速效果往往远低于理论值。结构化稀疏Structured Sparsity零的位置遵循固定规则。NVIDIA 从 Ampere 架构A100, 2020开始硬件原生支持的格式是2:4 结构化稀疏每连续 4 个权重中恰好有 2 个为零。[ 0.3, 0, 0, 0.7 ] ← 4个里2个非零 ✓ [ 0, 0.1, 0.5, 0 ] ← 4个里2个非零 ✓ [ 0, 0, 0.2, 0.8 ] ← 4个里2个非零 ✓ [ 0.9, 0, 0, 0.4 ] ← 4个里2个非零 ✓因为模式固定硬件不需要存索引——它知道每 4 个里一定有 2 个零只需要存 2 个非零值和 2 bit 的位置标记。计算单元可以设计成每次读 4 个、算 2 个的固定流水线稳定实现 2× 加速。这就是为什么你在规格表上看到的稀疏算力通常恰好是稠密算力的2 倍——它对应的就是 2:450% 稀疏率这个特定配置。3.3 稀疏是怎么产生的剪枝模型训练完之后权重不会自动变成零。你需要一个额外的步骤——剪枝Pruning训练一个完整的稠密模型。评估每个权重的重要性常用标准绝对值大小、梯度敏感度、Taylor 展开估计等。置零把最不重要的那批权重直接设为 0同时满足 2:4 约束。微调Fine-tune用少量训练数据再跑几个 epoch让剩余权重补偿被剪掉的那些恢复精度。NVIDIA 的 ASPAutomatic SParsity库和 SparseML 等工具可以自动化这个流程。在大量实验中2:4 稀疏对模型精度的影响通常在0.1%–0.5%以内在 ImageNet、GLUE 等基准上工程上完全可以接受。3.4 规格表上的稀疏算力到底意味着什么回到开头那个例子2070 TFLOPSFP4稀疏这句话的完整含义是FP4数据精度为 4 位浮点E2M1 microscaling。稀疏假设模型经过 2:4 结构化剪枝硬件启用跳零加速。2070 TFLOPS在上述两个条件下芯片的理论峰值浮点吞吐量为每秒 2070 万亿次运算。如果你用同一个模型但不做剪枝稠密推理算力大约是~1035 TFLOPS。如果你把精度换回FP8 稠密数字还会再变。所以脱离精度和稀疏条件谈算力数字是没有意义的。4. 模型压缩三件套稀疏剪枝只是模型压缩的手段之一。实际部署中三种技术经常组合使用4.1 剪枝Pruning→ 产生稀疏如前所述把不重要的权重置零。非结构化剪枝稀疏率可以做到 90%但硬件加速困难。结构化剪枝2:450%是当前硬件加速的甜点也有 1:2、4:8 等变体。通道剪枝 / 层剪枝直接砍掉整个卷积核或 Transformer 头模型结构变小。4.2 量化Quantization→ 降低精度把 FP32 权重映射到低精度格式训练后量化PTQ, Post-Training Quantization模型训练完直接转 INT8/INT4不需要重新训练。代表工具TensorRT、GPTQ、AWQ、llama.cppGGUF。量化感知训练QAT, Quantization-Aware Training在训练过程中模拟量化误差让模型学会在低精度下工作。精度损失更小但需要重新训练。量化和稀疏是正交的可以叠加一个 INT4 2:4 稀疏的模型理论上可以获得 8× 的存储压缩和显著的推理加速。4.3 知识蒸馏Distillation→ 缩小模型用一个大的教师模型Teacher去指导一个小的学生模型Student训练。学生模型的参数量可以只有教师的 1/10 甚至 1/100但在特定任务上能逼近教师的性能。蒸馏不直接改变精度或稀疏性但它从模型规模这个维度降低计算量和前两者互补。三者的关系┌─────────────┐ │ 知识蒸馏 │ ← 减小模型规模 └──────┬──────┘ │ ┌────────────┴────────────┐ ▼ ▼ ┌────────────────┐ ┌────────────────┐ │ 剪枝 │ │ 量化 │ │ (→ 稀疏) │ │ (→ 低精度) │ └────────────────┘ └────────────────┘ │ │ └────────────┬────────────┘ ▼ 更小、更快、更省的模型5. 如何正确地对比两颗芯片的算力理解了上面的概念之后我们来看一个实际场景。假设你在对比两颗芯片芯片 A芯片 B标称算力2000 TFLOPSFP4, Sparse1000 TFLOPSFP16, Dense能直接说A 比 B 快两倍吗不能。原因精度不同FP4 的每次运算处理的信息量远少于 FP16。2000 TFLOPS FP4 和 1000 TFLOPS FP16 的有效计算量不在一个量级。稀疏 vs 稠密A 的数字假设了 2:4 稀疏。如果你的模型没有做剪枝A 的实际算力要减半。峰值 vs 实际两个数字都是峰值。实际利用率取决于你的 workload、batch size、显存带宽等。正确的对比方式统一精度比如都比 FP16 Dense。统一稀疏条件都比 Dense或都比 2:4 Sparse。看内存带宽HBM 带宽单位 GB/s——对于 LLM 推理这种 memory-bound 任务带宽比算力更决定实际速度。看实际 benchmarkMLPerf、vLLM throughput 等而不是只看峰值。6. 2026 年的格局速览截至 2026 年中主流 AI 芯片在精度支持上的大致情况芯片 / 平台最低支持精度稀疏支持备注NVIDIA BlackwellB200 / GB200FP4MXFP42:4 结构化原生 FP4 Tensor CoreTransformer Engine 自动管理 scalingNVIDIA HopperH100 / H200FP8E4M3 / E5M22:4 结构化FP8 训练/推理主力NVIDIA AmpereA100FP16 / BF16 / TF322:4 结构化首次引入结构化稀疏硬件支持AMD Instinct MI300XCDNA3FP8结构化稀疏ROCm 生态原生支持到 FP8不提供 FP6 / FP4AMD Instinct MI350CDNA4FP8 / FP6 / FP4MXFP4结构化稀疏新增 FP6 / FP4 原生支持Google TPU v5pBF16 / INT8—自研 XLA 编译器管理精度Google TPU v6eTrilliumBF16 / INT8 / FP8MXFP8—新增 FP8 原生支持自研 XLA 编译器各类推理专用芯片 / NPUINT4 / INT8视架构而定手机端、边缘端为主趋势很明确训练精度稳定在 BF16 / FP8推理精度正在从 INT8 向 FP4 快速下探。每一代新硬件都在更低精度上提供原生加速而软件栈Transformer Engine、TensorRT-LLM、vLLM 等负责自动处理精度转换和 scaling让上层用户尽量不用手动操心。面向 2026 下半年至 2027 年各家路线图继续下探NVIDIA Blackwell Ultra / Rubin、AMD MI400CDNA5、Google TPU v7Ironwood均在更低精度与更高带宽上迭代。7. 总结一张速查表概念一句话解释你在规格表上看到的形式FLOPS / TOPS每秒运算次数浮点 / 整数2070 TFLOPSFP32 / FP16 / BF16不同位宽的浮点格式精度列FP8 / FP4 / INT8 / INT4低精度格式用于推理加速精度列Dense稠密所有参数参与计算默认不标注或写 DenseSparse稀疏跳过零值参数通常指 2:4 结构化稀疏Sparse 或 with Sparsity峰值算力理论最大值规格表上的数字有效算力实际跑出来的需要看 benchmark剪枝把权重置零 → 产生稀疏模型侧操作不在芯片规格里量化降低数值精度模型侧操作蒸馏大模型教小模型模型侧操作下次再看到 2070 TFLOPSFP4稀疏你可以把它翻译成一句人话这颗芯片在 4 位浮点精度下假设模型做了一半权重的结构化剪枝理论上每秒能完成 2070 万亿次浮点运算。实际跑你的模型时大概率打个三到七折。够用了。去选芯片吧。参考标准与资料OCP Microscaling Formats (MX) Specification v1.0NVIDIA Blackwell / Hopper / Ampere Architecture WhitepaperIEEE 754-2019 浮点标准。免责声明本文为科普向技术解读具体数值与精度支持以各厂商官方 datasheet / 架构白皮书为准。