行业资讯

P99 IB网卡 DP

发布时间:2026/8/14 22:47:04
P99 IB网卡 DP 这三个词在 AI 大模型尤其是分布式训练与推理工程里属于出现频率极高的高频词。用最接地气的话来逐一解释1. P99P99 延迟 / 99 分位延迟是什么这是一个统计性能的指标全称叫99th Percentile。指的是把 100 次请求按延迟从快到慢排序第 99 名也就是最慢的那 1% 里的临界点的耗时。通俗比喻假设有 100 个用户在用大模型聊天99 个人的回答都在 0.5 秒内吐出来了只有最后 1 个人等了 3 秒。那么 P99 延迟就是3 秒。为什么 MoE 部署特别看重 P99在 EP专家并行中All-to-All 通信需要所有 GPU 互相等待并同步数据这就是“木桶效应”/ 长尾效应。只要网卡抖了一下或者某张卡上的专家遇到了热点数据计算变慢整组 GPU 都会被卡住。P99 能直接反映系统稳不稳定有没有偶尔卡顿的现象。2. IB 网卡InfiniBand 网卡是什么InfiniBand无限带宽技术网卡是高性能计算HPC和 AI 算力集群如 NVIDIA HGX/DGX 服务器专用的跨服务器超高速网络硬件。核心优势超低延迟 高带宽延迟只有几微秒普通的千兆/万兆以太网延迟高达几十甚至上百微秒。支持 GPUDirect RDMA跨机器传输数据时可以绕过 CPU 和内存GPU 显存直接通过 IB 网卡把数据吐给另一台机器的 GPU 显存。对比物理位置NVLink同一个机箱内 8 张 GPU 之间的超高速总线相当于“同屋开门”。IB 网卡不同服务器/机柜之间的专用高速公路相当于“跨城高铁”。在前面的 EP 选型中EP16和EP32意味着 All-to-All 通信必须跨出机箱走 IB 网卡通信延迟因此陡增。3. DPData Parallelism / 数据并行是什么最经典的一种分布式并行策略。模型权重在每组设备上各复制一份完全一样的副本不同的设备分头去处理不同的数据/请求。通俗比喻银行办理业务开 4 个一模一样的窗口DP41 号窗口处理张三2 号窗口处理李四各个窗口互不干涉。在 MoE 推理如EP8 × DP4中的语义EP88 张 GPU 组合起来存下了 1 套完整的 MoE 专家权重。DP4把这 8 张 GPU 构成的整体完整“复印”了 4 份一共用了 32 张 GPU。效果系统可以同时独立响应 4 个不同的并发请求量吞吐量直接翻 4 倍而且每个请求的通信都锁在各自单机 8 卡的 NVLink 内部保证了极低延迟。