测试对象:算能 BM1684X M.2、瑞芯微 RK1828(TL182X)、力擎 LQ50 Duo、DEEPX DX‑M1M(LM2‑100)、AX650N;测试环境:X86 工控,PCIe Gen3 x4,恒温 40℃持续 72h 压测;两大业务场景:多路视频目标检测(YOLOv8s 640×640)、端侧大模型 Qwen‑2.5‑7B INT4,统计端到端真实吞吐,不采用芯片实验室峰值 TOPS 跑分。
一、纸面参数 vs 真实业务压测汇总
算力卡 | 标称 INT8 算力 | 功耗 | YOLOv8s 最大稳定路数 (1080P25fps) | Qwen2.57B INT4 tokens/s | 算力实际利用率 | 核心硬件特征 |
BM1684X M.2 | 32 TOPS | 2228W | 18 路 | 2124 | 4555% | 板载 16GB DDR4,PCIe Gen3 x4 |
RK1828(TL182X) | 20 TOPS | 710W | 14 路 | 6268 | 6575% | 5GB 3D 堆叠片内 LPDDR,1TB/s 带宽 |
LQ50 Duo | 2×13TOPS=26TOPS | 1215W | 16 路 | 4448 | 5060% | 双 NPU,共享 M.2 带宽 |
DXM1M(LM2100) | 25 TOPS | 1012W | 12 路 | 1215 | 3848% | 片上内存,视觉优化,LLM 能力弱 |
AX650N | 24 TOPS | 811W | 11 路 | 911 | 3542% | PCIe Gen2,带宽瓶颈明显 |
关键现象:标称算力最高的 BM1684X,视觉并发领先,但大模型吞吐远低于 RK1828;RK1828 纸面仅 20TOPS,凭借 3D 堆叠高带宽,大模型场景利用率最高;DX‑M1M、AX650N 视觉尚可,大模型解码成为短板。
二、为什么纸面 TOPS 和真实业务差距巨大
1、TOPS 是脉冲峰值,不是持续业务算力
厂商 TOPS 是短时间理想实验室跑分,25℃空载、无数据搬运压力。真实机箱密闭高温,长时间跑业务会触发温控降频,算力直接掉到峰值 60‑70%。
视觉 CNN:算力瓶颈经常不是计算单元,而是PCIe 带宽、内存带宽、预处理 / 后处理 CPU 开销;大量时间 NPU 空闲,在等待图像数据搬运,NPU 算力利用率经常不足 50%。
LLM 大模型:解码阶段是内存带宽密集型,不是计算密集型。每生成 1 个 token 需要反复读取权重,TOPS 再高,带宽不够,算力单元大部分空转。
2、PCIe M.2 接口是隐形枷锁
M.2 2280 算力卡普遍受 PCIe 通道约束:
Gen3 x4 理论带宽 4GB/s,Gen2 x2 直接减半;
上位机主板布线坑:部分主板 M.2 只引出 PCIe x1,直接把算力卡性能腰斩,硬件无报错,只体现吞吐低,很多项目踩坑于此。
现象:同一张卡,在不同工控主板上,实测吞吐差距可达 1.8‑2.2 倍。
3、编译器、算子适配是最大软性损耗
标准卷积算子表现接近官方;一旦出现非标准算子、动态 shape,算子 fallback 到 CPU,数据来回拷贝,性能断崖下跌,纸面算力完全作废。
各家 SDK 工具链差异巨大:同样模型,A 厂商编译后利用率 70%,B 厂商只有 35%,硬件芯片本身差距不大,是编译优化差距。
4、端到端链路不能只看 NPU 推理耗时
完整业务链路:视频解码→图像预处理缩放归一化→NPU 推理→NMS 后处理→业务逻辑输出。很多测试只统计 NPU 内部推理耗时,忽略 CPU 侧解码、预处理、NMS 耗时,实际业务帧率会大幅缩水。
三、不同业务场景选型启示
场景 1:智慧工地、明厨亮灶、光伏巡检,多路视频检测(CNN 为主)
多路>16 路:优先 BM1684X M.2,板载大内存,多路视频缓存友好;
8‑14 路,功耗敏感:RK1828,功耗仅 8W 左右,兼顾预留部分大模型能力;
纯视觉,完全不跑大模型:DX‑M1M,成本优势明显。
避坑:不要直接按 “标称 TOPS÷ 单路算力” 估算最大视频路数,会严重高估并发。
场景 2:边缘本地大模型,私有化问答、RAG(LLM 为主)
优先看片内内存带宽,而不是 TOPS 数字。RK1828 3D 堆叠内存优势凸显;LQ50 Duo 双芯并行次之;BM1684X 受外部 DDR+PCIe 传输拖累,tokens/s 表现一般。
重点:LLM 场景,带宽>标称 TOPS。
场景 3:视觉 + 大模型多模态混合业务
RK1828 综合平衡,视觉并发不错,大模型吞吐强,功耗低,适合一体机、边缘网关。
四、落地压测实操建议(选型必做)
1. 拒绝只看 datasheet TOPS;拿到硬件,做长时间恒温压测 72h,观察降频后的稳定吞吐,不要看几秒 demo 峰值。
2. 使用真实业务模型,不要用 resnet50 标准 demo 跑分;带上完整 pipeline:解码 + 预处理 + 推理 + 后处理,统计端到端帧率 /tokens/s。
3. 确认主板 M.2 物理通道:确认是 PCIe Gen3 x4,部分工控机 M.2 仅 x1 通道,会直接废掉算力卡性能。
4. 算子验证:把自己业务完整模型编译跑一遍,确认没有大量算子 fallback 到 CPU,这是很多项目上线翻车根源。
5. 多卡扩展:M.2 多卡级联,注意 PCIe 总带宽分配,不是卡数量翻倍性能就线性翻倍。
五、总结
国产 M.2 NPU 算力卡,TOPS 只是参考参数,不能作为选型依据。
多路视频场景:重点看板载内存大小、SDK 多路优化;
边缘大模型场景:优先看片上内存带宽;
真实落地性能 = 芯片硬件 × PCIe 链路 × SDK 编译器优化 × 温度功耗条件。
很多项目选型时,拿着纸面 TOPS 做算力预算,上线后并发、吞吐达不到预期,根源就是混淆芯片峰值算力与真实业务持续吞吐。
需求留言: