一、先理清核心误区(90% 项目踩坑根源)
误区 1:只看峰值 TOPS,忽略有效算力
厂商标注 TOPS 多为 INT4 峰值,实际推理只用 INT8;还要扣除硬件解码、图像预处理、后处理、内存拷贝开销,真实可用算力仅为标称 30%~60%。
例:RK3588 标称 6TOPS INT8,多路视频并发时有效算力仅 2.5~3.5TOPS。
误区 2:“支持 XX 种算法”=“可同时跑 XX 算法”
算法库总数 = 可存储模型;并发算法数 = 单路视频同步运行模型数量,由算力 / 内存决定,二者无关联。
误区 3:路数标注是抽帧轮巡,非 25fps 实时分析
商家宣传 16 路 / 32 路常为10fps 抽帧、轮询推理;工业 / 工地监管要求 25fps 全实时,实际承载路数直接减半。
误区 4:算力足够就能跑,无视解码瓶颈
软解码占满 CPU,NPU 算力再高也会卡顿;必须优先看硬件硬解通道数量,而非单纯 AI 算力。

二、第一步:量化业务需求(算力 / 并发计算标准公式)
1. 算力需求计算公式(2026 行业通用)
所需总算力 = 单路视频算力消耗 × 接入路数 × 单路并发算法数 × 冗余系数 1.2~1.5
冗余系数:工业 7×24 小时满载取 1.5;室内轻负载取 1.2。
2. 1080P@25fps 单路算力消耗参考(INT8 实测)
算法类型 | 单路 TOPS 消耗 | 典型场景 |
轻量目标检测(YOLOv5n/m、安全帽、人形) | 0.5~1.0 | 工地安全帽、区域入侵、电动车识别 |
中等结构化(人脸抓拍、客流统计、车辆识别) | 1.0~2.0 | 园区人脸、停车场车牌、客流统计 |
复杂行为 / 多目标(烟火、摔倒、离岗、越界追踪) | 2.0~3.5 | 明厨亮灶、车间离岗、高空烟火 |
大模型本地推理(3B/7B) | 5~20 | 语音交互、图文理解、通用识别 |
3. 分辨率算力换算
4K=2 倍 1080P 算力;720P=0.6 倍 1080P 算力;
帧率降低至 10fps,算力消耗降低 40%。
4. 实战算力测算案例
场景:智慧工地,8 路 1080P@25fps,每路同时跑安全帽 + 烟火 + 反光衣3 种算法(平均单路 2.2TOPS)
计算:2.2 × 8 × 3 × 1.5 = 79.2TOPS 有效算力
硬件选型:单 RK3588(6T)不够;RK3588+RK1828 异构(26T 有效)单盒不足,需双盒或 BM1688 多盒集群。
三、第二步:算力档位选型(国产主流芯片 2026 对比)
档位 1:入门轻量 2~6TOPS(RK3568/RK3588 单芯片)
代表芯片:RK3588(6TOPS INT8)、RK3568(2TOPS)
承载上限:4 路 1080P,单路 1~2 种轻量算法(仅安全帽 / 人形)
适用:小型门店、小区 2~4 路监控、门禁人脸抓拍
短板:多算法并发算力不足,无法跑行为识别、本地大模型
档位 2:中端主流 12~30TOPS(BM1688、RK3588+RK1820 协卡)
代表芯片:算能 BM1688(16TOPS)、RK3588+RK1820(22TOPS)
承载上限:8\16 路 1080P,单路 2\3 种混合算法(人脸 + 车辆 + 周界)
适用:中小型工地、工厂、校园、明厨亮灶;可本地 3B 轻量化大模型
优势:硬解通道充足,功耗 10~20W,工业宽温稳定,性价比最高
档位 3:高端算力 30~60TOPS(RK3588+RK1828、Jetson Orin Nano)
代表芯片:RK3588+RK1828(26TOPS 纯 NPU 推理)、Orin Nano(40TOPS)
承载上限:16~32 路 1080P 全实时,多路同步烟火 / 摔倒复杂算法;稳定跑 7B 本地大模型
适用:大型智慧工地、园区集群、工业高精度质检、边缘大模型私有化部署
特点:M.2 算力卡可扩展算力,异构分工,解码与推理资源不抢占
档位 4:集群算力 60TOPS+(多盒堆叠 / 算力服务器)
适用:64 路以上摄像头、城市边缘节点、多场景融合分析,推荐多台 LQ50 算力卡集群方案。
四、第三步:并发算法四大核心约束(决定实际承载路数)
1. 硬件硬解码通道(第一瓶颈)
RK3588:硬解 8 路 1080P@30fps;
BM1688:硬解 16 路 1080P@30fps;
RK3588+RK1828:主控负责 8K 硬解,协卡不占用解码资源;
避坑:接入摄像头路数不能超过硬件硬解上限,超过只能软解码,CPU 满载延迟翻倍。
2. 运行内存 RAM(并发第二瓶颈)
每路 1080P 多算法占用 0.4\0.8GB 内存;7B 大模型单独占用 4\6GB 内存。
选型标准:
≤4 路:4GB LPDDR4 起步;
8~16 路混合算法:8GB LPDDR5 标配;
跑 7B 大模型:最低 16GB 内存,优先 32GB。
坑:商家只标存储 eMMC,不标运行内存,小内存设备多路并发直接 OOM 崩溃。
3. NPU 调度架构(多算法并行关键)
1. 单 NPU 串行调度:低端盒子,多算法轮流跑,高并发延迟 200ms+,不适合实时预警;
2. 异构多 NPU 并行(RK3588+RK1828):主控处理视频,协卡专职 AI 推理,多模型并行无抢占,2026 工业首选方案;
3. TPU 多核心独立调度(BM1688):多模型分片推理,多路视频负载均衡。
4. 模型量化与 SDK 适配
相同算力下,SDK 优化度决定并发能力:
瑞芯微 RKNN、算能 SophonSDK 支持 INT4/INT8 混合量化,路数提升 50%;
无官方 SDK、第三方移植模型,算力利用率不足 40%,同硬件路数减半。
五、2026 主流硬件方案选型对照表(国产商用 / 工业)
方案架构 | 有效 INT8 算力 | 最大硬解路数 | 最大并发能力 | 功耗 | 最佳场景 |
RK3588 单盒(摩 HM50 核心板) | 3.5~6T | 8 路 1080P | 8 路单算法 / 4 路三算法 | 12W | 小型门店、门禁、8 路以内工地 |
BM1688 独立盒子 | 14~16T | 16 路 1080P | 16 路双算法 / 10 路三算法 | 18W | 中型工厂、校园、16 路监控 |
RK3588+RK1820 M.2 算力卡 | 20~22T | 8 路 1080P | 16 路混合算法 | 22W | 中小型工地 + 本地 3B 大模型 |
RK3588+RK1828(力擎 LQ50) | 24~28T | 8 路 1080P | 32 路轻算法 / 22 路复杂算法 | 28W | 大型工地、7B 端侧大模型 |
Jetson Orin Nano | 35~40T | 12 路 1080P | 32 路全实时复杂算法 | 30W | 工业质检、高端私有化项目 |
六、全维度避坑清单(落地必查,2026 高频踩坑点)
1. 算力参数避坑
1. 区分INT4 峰值 / INT8 实测算力,只认 INT8 有效算力;
2. 要求厂商提供同算法压测报告:8 路三算法 24 小时延迟、CPU/NPU 占用曲线;
3. 拒绝 “理论最大路数”,必须标注25fps 实时全算法路数,抽帧路数无参考价值。
2. 内存 / 存储避坑
1. 运行内存最低 8GB 起步,多路并发 / 大模型必须 16GB+;
2. 区分运行内存 LPDDR 与存储 eMMC,商家常用 128G 存储掩盖 2GB 小内存;
3. 大模型场景确认是否支持内存扩展,避免 KV 缓存溢出闪退。
3. 视频编解码避坑
1. 清点硬件硬解通道,摄像头数量≤硬解上限;
2. 确认支持 RTSP/ONVIF 国标摄像头,部分盒子仅适配自有摄像头;
3. 不支持 H.265 硬解的盒子直接淘汰,H.264 码流占用算力翻倍。
4. 散热与工业稳定性(7×24 运行刚需)
1. 户外 / 车间选 \\ 工业宽温 20~70℃\\ 机型,消费级盒子高温降频,算力缩水 50%;
2. 满载 12 小时测温,核心温度>85℃会持续降频,必须带主动散热;
3. 长期项目拒绝无风扇密封款,积热导致算法延迟漂移、误报激增。
5. 算法与软件生态避坑
1. 确认自研算法可直接导入硬件 SDK,不支持自定义模型的盒子扩展性为 0;
2. 询问多算法调度策略,串行调度不适合多模型并行场景;
3. 核查告警输出协议:GB/T1400、HTTP、MQTT,对接平台无协议等于无法落地。
6. 扩展与后期扩容
1. 多路扩容优先选M.2 算力卡可扩展机型(RK1820/RK1828 LQ50),无需整盒更换;
2. 多网口需求确认千兆 POE、双网口,避免外接交换机增加布线成本。
七、标准化选型落地流程(可直接套用)
1. 梳理业务:摄像头分辨率 / 帧率、总路数、每路同步运行算法清单;
2. 算力测算:代入公式算出所需有效算力,预留 1.2~1.5 冗余;
3. 硬件初筛:匹配算力档位,核对硬解通道、内存、温度等级;
4. 现场 POC 实测:
满载跑全部算法 24 小时,监控端到端延迟(预警要求<150ms);
记录 CPU/NPU/ 内存占用,满载不超 80% 为安全阈值;
高温环境持续运行,确认无降频、无断流、无算法崩溃;
5. 最终选型:优先异构可扩展方案,平衡算力、成本、后期扩容。
八、场景快速选型推荐
1. 小型工地 / 门店(≤8 路,2~3 种轻算法):摩 HM50(RK3588 核心板),6TOPS,成本最低;
2. 中型园区 / 工厂(8~16 路,混合算法):算能 BM1688 盒子,16TOPS,16 路硬解;
3. 大型工地 / 本地大模型(16~32 路,7B 模型):RK3588 + 力擎 LQ50(RK1828 算力卡),异构并行,算力可扩容;
4. 工业高精度质检:Jetson Orin Nano,高浮点算力,图像分割 / 缺陷检测专用。
需求留言: