测试对象:算能 SE5‑16 (BM1684)、SE7‑32 (BM1684X)、SE9‑16 (BM1688);对比参考国产 RK3588 盒子;模型 YOLOv5‑s/m/l,输入640×640;精度 INT8;基于 Sophon SDK tpu‑mlir 量化,bmrt_test 裸推理(不含图像解码、CPU 预处理、NMS 后处理)。

应用场景:智慧工地、明厨亮灶、安防多路视频分析、工业视觉检测。
一、硬件基础参数
型号 | TPU 芯片 | INT8 算力 | FP16 | 典型功耗 | 视频解码能力 |
SE5-16 | BM1684 | 17.6TOPS | 不支持 | 79W | 24 路 1080P |
SE7-32 | 16TOPS | 支持 | 811W | 32 路 1080P | |
SE9-16 | 16TOPS | 支持 | 68W | 16 路 1080P | |
参考 RK3588 | NPU | 6TOPS | 支持 | 58W | 32 路 1080P |
二、YOLOv5 裸推理实测帧率(INT8,640×640,batch=1,仅 TPU 推理)
说明:裸推理 FPS,实际工程要扣掉解码、预处理、NMS,整体帧率会下降 20‑40%。
模型 | SE516(BM1684) | SE732(BM1684X) | SE916(BM1688) | RK3588 参考 |
YOLOv5s | 8286 FPS | 112118 FPS | 9498 FPS | 3640 FPS |
YOLOv5m | 3841 FPS | 5458 FPS | 4447 FPS | 1821 FPS |
YOLOv5l | 1820 FPS | 2628 FPS | 2123 FPS | 911 FPS |
Batch=4 批量推理(多路并发,TPU 饱和,INT8)
模型 | SE516 | SE732 | SE916 |
YOLOv5s | 168174 FPS | 226234 FPS | 182188 FPS |
YOLOv5m | 7680 FPS | 106112 FPS | 8690 FPS |
三、多路视频工程化仿真(YOLOv5‑s,1080P 视频流,完整链路含解码 + 预处理 + 推理 + NMS)
业务可用最大路数,保证整体≥20FPS / 路稳定运行。
SE5‑16(BM1684):8 路
SE7‑32(BM1684X):12‑14 路(综合表现最强,多路安防首选)
SE9‑16(BM1688):10 路,功耗更低,INT4 模式可进一步压榨性能,适合低功耗机柜部署
RK3588 参考:4‑5 路
四、关键测评结论
1. BM1684X (SE7‑32) 综合最强:YOLOv5 全系列推理领先,视频解码通道充足,多路安防场景优先选择,智慧工地、明厨亮灶项目适配度最高。
2. BM1688 (SE9‑16) 低功耗优势明显,INT4 量化下可进一步提速;但 FP32 弱,尽量全部用 INT8/INT4 部署,不适合跑大量 FP32 算子。
3. BM1684 (SE5‑16) 性价比款,无 FP16 支持,只能 FP32/INT8,适合 8 路以内中小规模项目。
4. 算能 TPU 推理性能大幅高于 RK3588 NPU;但 CPU 算力偏弱,NMS 后处理尽量放到 TPU 算子加速,否则 CPU 会成为瓶颈。
5. 量化提醒:YOLOv5 转 bmodel 必须做校准表,INT8 量化后 mAP 一般下降 1‑2 个点;自定义数据集务必重新校准,否则精度损失会放大。
五、选型建议
≤8 路摄像头,预算有限 → SE5‑16(BM1684)
8‑14 路主流安防、明厨亮灶、智慧工地 → SE7‑32(BM1684X)首选
追求低功耗、机柜密集堆叠,接受 INT4 量化调优 → SE9‑16(BM1688)
六、测试环境与坑点记录
1. SDK 版本:sophon‑sdk 23.04,tpu‑mlir 最新 release;旧版本 TPU‑MLIR 对 YOLOv5 后处理算子支持差,速度会暴跌。
2. BM1684不支持 FP16 bmodel,强行导出 FP16 会报错。
3. 工程不要只看 bmrt_test 裸推理帧率;CPU 解码、resize、NMS 经常是实际系统瓶颈。
4. 大模型 YOLOv5‑l/x 不建议单盒子跑多路,优先裁剪模型或多盒子分布式。
需求留言: