传统单 SoC 边缘设备普遍痛点:既要做多路视频解码、业务调度,又要跑 LLM/VLM 大模型,CPU/NPU/ 内存资源互相抢占,视频卡顿、大模型掉速、系统雪崩,二者很难同时拉满性能。RK3588+RK182X 异构方案采用主控 + AI 协处理器架构,把多媒体、系统业务和重型 AI 推理物理拆分,真正做到多路视频流分析与本地大模型并发运行。

一、硬件分工架构
芯片 | 角色 | 核心能力 |
RK3588 | 系统主控中枢 | 八核 ARM,内置 VPU 硬编解码、6TOPS NPU;负责操作系统、RTSP / 相机视频拉流、MPP 硬件解码、帧预处理、外设通信、业务逻辑调度、结果输出存储。 |
RK182X(RK1820/RK1828) | AI 算力协处理器 | PCIe 高速直连,3D 堆叠片上 DRAM;RK1820:2.5GB 内存,20TOPS;RK1828:5GB 内存,20TOPS;专职 LLM、VLM、重型 AI 推理,推理内存完全独立,不占用 RK3588 系统内存。 |
核心价值:视频解码、业务跑在 RK3588;大模型、多模态重型推理卸载到 RK182X,两套硬件资源隔离,不会出现大模型吃满内存导致视频丢帧的现象。单主板可扩展 1‑2 片 RK182X,整机峰值算力最高 46TOPS INT8。
二、实测关键性能数据
1)多路视频并发实测
单 RK3588 + 单 RK1828:稳定8‑12 路 1080P@25fps RTSP;解码由 RK3588 VPU 硬件完成,YOLO 目标检测、帧预处理完成后送入 RK182X 做 VLM 多模态理解。
RK3588 + 双 RK1828:最高16 路 1080P视频流并行 Pipeline,支持目标检测、行为识别、画面语义解析、异常告警,各路流独立队列,无明显丢帧、延迟抖动。
支持输入源:RTSP 网络摄像头、MIPI、UVC 工业相机、本地视频文件。
2)本地大模型(RK1828 实测,RKNN3 SDK w4a16 量化)
模型 | 首 Token 延迟 TTFT | 生成速度 TPS |
Qwen2.53B | 84ms | 87 tokens/s |
Qwen2.57B | 161ms | 59 tokens/s |
Qwen3VLM2B(多模态) | 92ms | 72 tokens/s |
RK1820 可流畅跑 3B 级模型,TPS 可达 100+;适合预算有限的轻量化多模态场景。
实测现象:12 路视频持续跑 YOLO + 帧送入 VLM,同时后台持续跑 Qwen‑7B 问答,视频解码帧率不掉,大模型 TPS 衰减幅度小于 10%,这是单 RK3588 很难实现的效果。单 RK3588 本地跑 7B 大模型时,只要开启 4 路以上视频,系统内存、NPU 资源争抢,推理速度会腰斩甚至卡顿。
三、软件工作流完整链路
1. RK3588 拉取多路视频流,MPP 硬件解码,做缩放、裁剪预处理;
2. 帧队列调度,将图像帧通过 PCIe 传给 RK182X;
3. RK182X 运行 YOLO 检测、VLM 视觉大模型,输出结构化描述、告警事件;
4. 同时 RK182X 并行承接本地 LLM 问答业务请求;
5. 推理结果回传给 RK3588,完成告警、存储、上报、外设联动;
6. 网络断连状态下整套链路完全本地闭环运行,不需要云端,保护视频数据隐私。
四、适用落地场景
智慧工地 / 园区安防:多路摄像头,安全帽 / 烟火 / 越界检测,VLM 理解现场行为,本地大模型做告警摘要、事件复盘;
工业边缘网关:工业相机 + 传感器,缺陷检测、设备异常语义分析,本地知识库问答;
AI 机器人、具身智能:多相机感知,VLM 视觉理解 + LLM 决策;
明厨亮灶、加油站、机房监控:多路视频语义分析,离线私有化部署,降低带宽与云 API 成本。
五、方案优劣势与坑点
✅ 优势
1. 资源物理隔离:多路视频与大模型互不打架,解决端侧最头疼的资源争抢问题;
2. 片上高带宽 DRAM,大模型推理不啃主控内存;
3. PCIe 扩展,算力可弹性选 1 片 / 2 片 RK182X;
4. RKNN‑Toolkit2、RKNN3、RKLLM 完整 SDK 生态,兼容 YOLO、Qwen 系列主流模型;
5. 工业级硬件底座,宽温,支持离线全本地运行。
注意事项
1. RK182X 是协处理器,不能独立跑操作系统,必须搭配 RK3588 等主控;
2. M.2 PCIe 插槽需要满足供电,RK182X 模组建议外接 12V 供电,避免供电不足降性能;
3. 多路 VLM 并发会消耗 RK182X 算力,路数越多,单路 VLM TPS 会线性下降;16 路场景建议优先用 YOLO 做初筛,异常帧才送入 VLM,优化算力开销;
4. 模型需要做 RKNN3 量化适配,直接原生 PyTorch 模型无法运行。
六、对比单 RK3588 方案
单 RK3588:6TOPS NPU,系统内存共享;跑 7B 大模型时多路视频就会受限,适合≤4 路视频 + 轻量 LLM;成本低,但高并发场景瓶颈明显。
RK3588+RK182X:硬件算力拆分,多路视频 + 3‑7B 大模型可以同时高性能运行;硬件成本上升,但大幅降低开发调优难度,是当前国产端侧兼顾多路视觉 + 本地大模型的主流优选异构方案。
七、总结
RK3588+RK182X 这套组合拳本质是把服务器 “CPU 主机 + AI 加速卡” 的异构思路下沉到嵌入式端。RK3588 发挥多媒体、外设调度长板,RK182X 专门攻坚大模型与多模态推理短板,解决行业真实痛点:既要看多路摄像头,又要本地跑大模型做语义理解,不能上云、不能丢帧、不能降速。
需求留言: