M.2 算力卡的多卡级联无法实现严格的算力线性叠加(1+1=2),仅在特定的边缘推理场景下接近线性,多数场景下实际性能提升幅度显著低于理论标称值。厂商宣传的 “算力线性扩展” 存在明确的场景前提,不能等同于通用场景下的算力翻倍。

一、厂商宣传的 “线性叠加” 有明确前提
目前市面上 M.2 算力卡(如瑞芯微 RK1828、DEEPX DX-M1M 等)宣传的 “算力线性叠加”,均针对多路独立视觉推理这一特定场景:
任务模式:每张卡独立处理一路 / 多路视频流,各自完成检测、识别等任务,卡与卡之间几乎没有数据交互;
本质是任务吞吐量的线性增长,而非单任务的算力线性堆叠。
这类场景下,2 卡可以达到单卡 85%~95% 的性能提升,是最接近 “线性” 的情况,也是厂商宣传的典型场景。
二、无法实现严格线性叠加的核心瓶颈
1. PCIe 带宽与通道共享瓶颈
M.2 算力卡普遍采用 PCIe Gen3 x4 接口(理论带宽约 8GB/s),少数高端型号为 PCIe Gen4 x4(约 16GB/s),带宽本身就远低于标准 PCIe 全高卡:
若通过 PCIe Switch 转接板扩展多卡,上游端口带宽固定(例如上游 x4 下接 4 个 M.2),单卡可分配带宽仅为原来的 1/4,高带宽需求任务(大模型推理、高清视频帧传输)会直接卡在数据传输环节,算力跑不满;
若使用主板原生 M.2 插槽,多数消费级 / 工业级主板的 M.2 通道共享 PCH 总带宽,多卡同时工作时同样存在带宽争抢。
2. 任务调度与软件栈开销
多卡协同需要驱动、推理框架(RKNN、TensorRT、ONNX Runtime 等)完成任务分发、数据同步、结果聚合,存在固定的调度开销:
小 batch、低负载场景:调度开销占比高,多卡提升极小,甚至可能因调度延迟出现性能下降;
大 batch、高并发场景:开销占比降低,但仍有 5%~15% 的固定损耗;
边缘 NPU 的多卡软件优化远不如桌面 GPU 成熟,很多场景下单卡都只能跑到标称算力的 60%~80%,多卡叠加效率进一步打折。
3. 缺失卡间高速互联
M.2 形态的算力卡没有专用的卡间高速互联(类似 NVIDIA NVLink、AMD Infinity Fabric),所有数据交互必须绕经 PCIe 总线和 CPU 内存:
数据并行推理(各卡跑独立任务):影响很小,是效率最高的模式;
模型并行 / 张量并行(拆分单个大模型到多卡):需要频繁传输中间张量,PCIe 带宽成为严重瓶颈,2 卡性能通常只有单卡的 1.2~1.5 倍,卡数越多效率越低。
4. 散热与供电的物理限制
M.2 卡体积小巧,散热能力有限,多卡密集部署时热堆积严重,芯片会主动降频,实际运行算力低于标称峰值;
M.2 插槽供电上限通常为 10~15W,若主板或转接板供电冗余不足,多卡同时满载时会出现功耗受限,无法达到理论叠加值。
三、不同场景的实际叠加效率参考
以 2 卡 M.2 算力卡相对单卡的性能提升为例,不同场景差异极大:
应用场景 | 实际叠加效率 | 说明 |
多路独立视频流检测 | 85% ~ 95% | 无卡间通信,最接近线性,也是厂商主打场景 |
高并发批量推理(大 batch) | 70% ~ 85% | 存在调度和带宽开销 |
大模型单任务推理(模型分片) | 40% ~ 70% | 受 PCIe 带宽限制明显,卡数越多效率越低 |
模型训练(张量并行) | 20% ~ 50% | 效率极低,M.2 算力卡本身不定位训练场景 |
四、关键误区澄清
1. 标称算力 ≠ 实际可用算力:宣传的 TOPS 是芯片 INT8 理论峰值,受算子支持、数据带宽、功耗限制,单卡实际可用算力通常只有标称值的 60%~80%,多卡叠加自然达不到 “标称值 × 卡数”。
2. 吞吐量增长 ≠ 算力线性叠加:多路独立任务的处理路数翻倍,是任务并行的结果,不代表单个任务的计算能力翻倍。
总结
M.2 算力卡多卡级联的定位是边缘端扩展多路并行推理能力,而非追求单任务算力的线性堆叠。如果应用场景是多路视频分析、多传感器数据并行处理,多卡方案的性价比和空间优势非常突出;如果目标是跑大模型、做训练,指望多卡实现算力线性翻倍,会与预期有较大差距,更建议选择标准 PCIe 全高加速卡或更高端的算力方案。
需求留言: