RK3588 内置 NPU 为6TOPS INT8,适合轻量目标检测、少量视频流分析;一旦跑多路视频(8 路以上 1080P)、3B‑7B LLM/VLM 多模态、多模型并发推理,会出现推理延迟飙升、CPU‑NPU 资源抢占、内存吃紧、帧率暴跌等问题。
RK182X(RK1820/RK1828)是瑞芯微专为边缘设计的AI 协处理器,不跑完整操作系统,只专职做神经网络推理,通过 PCIe 和 RK3588 组成异构计算架构,解决 RK3588 算力瓶颈,不用更换主控主板即可完成算力升级。

一、RK3588 算力不足核心痛点
1. 算力上限低:原生 6TOPS,跑 7B 大模型吞吐很低,多路视频 AI 分析并发能力不足。
2. 资源争抢严重:RK3588 既要做视频编解码、系统调度、外设驱动,又跑 AI 推理,CPU/GPU/NPU 互相抢占资源,系统稳定性下降。
3. 片上内存受限:RK3588 系统内存要分给系统、图形、视频、NPU,大模型权重加载容易 OOM。
4. Transformer 优化弱:RK3588 NPU 偏向 CNN 视觉模型,对 LLM 注意力算子优化一般,大模型推理效率差。
典型场景触发算力不足:10 路以上摄像头同时 AI 分析、本地部署 Qwen‑3B/7B、机器人 VLM 多模态、工业多模型并发检测。
二、RK182X 协处理器硬件参数
RK182X 分为两个型号,算力相同,差异在板载独立 DRAM 大小,DRAM 决定可跑模型最大参数量。
参数 | RK1820 | RK1828 |
NPU 算力 | 20TOPS@INT8 | 20TOPS@INT8 |
独立片上 DRAM | 2.5GB | 5GB |
推荐最大模型 | ≤3B LLM/VLM | ≤78B LLM/VLM |
典型功耗 | ~5W | ~57W |
接口形态 | M.2 KeyB / SODIMM 260P | M.2 KeyB / SODIMM 260P |
互联 | PCIe2.0 x1 | PCIe2.0 x1 |
RK3588 主板最多可外接2 片 RK1828,总 AI 算力 = 6TOPS (RK3588)+20+20 = 46TOPS INT8。
架构分工:
RK3588 主控:系统、视频解码预处理、网络、外设、业务逻辑调度;
RK182X 协处理器:纯 AI 推理,LLM、VLM、大检测模型全部卸载到此,不占用 RK3588 的 NPU / 内存资源。
三、硬件部署方案
1. 硬件前提条件
1. RK3588 主板必须引出可用PCIe2.0 x1 通道(M.2 插槽或 SODIMM 连接器);普通 RK3588 核心板若无引出 PCIe,无法直接扩展。
2. RK182X 模组需要独立 12V 供电,不能只靠 M.2 插槽供电,否则会出现掉卡、算力不稳、死机现象。
3. 散热:RK182X 满载 5‑7W,必须带散热器,工业盒子做好整机散热。
4. 上电顺序:先启动 RK3588 主控,再给 RK182X 上电;反序容易 PCIe 枚举失败识别不到卡。
2. 两种硬件形态
1. M.2 Key‑B 模组:适合带 M.2 插槽的 RK3588 工控板,装机简单;
2. SODIMM‑Edge 260P 金手指模组:工业板卡设计,适合定制底板,可双卡并联扩展。
3. 整机典型组合
单卡方案:RK3588 + RK1828(26TOPS),跑 7B 以内大模型、8‑12 路 1080P 视频 AI 分析;
双卡方案:RK3588 + 双 RK1828(46TOPS),16 路 1080P 视频分析、多模型并发、Qwen3‑9B 多卡级联推理。
四、软件环境搭建(RKNN3 SDK)
RK182X 必须使用 RKNN3 SDK + rkllm runtime,旧 RKNN2 不支持协处理器模式。
1. 内核与驱动
Linux 内核版本要求,加载pcie‑rkep.koPCIe 协处理器驱动;RT 内核使用 rt 版本驱动。
验证设备:
lspci #查看PCIe设备是否枚举成功
lsmod | grep pcie_rkep#确认驱动加载
rknn‑smi info #查看RK182X算力卡状态、温度、显存
2. 模型转换
使用 RKNN3 Toolkit,导出模型目标平台指定为RK1820/RK1828。
LLM 推荐量化:w4a16(4bit 权重,16bit 激活),平衡显存占用与推理质量。
CNN 检测模型支持 INT8,直接卸载给 RK182X 运行。
3. 推理调用模式
1)RKLLM API:C/Python 接口直接调用 RK182X 做 LLM/VLM 推理;
2)rkllm3‑server:提供 OpenAI 兼容 HTTP API,上层业务像调用云端大模型一样调用本地协处理器算力,便于私有化 AI Agent 部署;
3)多卡级联:双卡 RK1828 支持模型分片,运行更大参数量模型(Qwen3‑9B、27B)。
任务调度策略:轻量小模型可继续跑 RK3588 自带 NPU;大模型、多路重负载全部卸载 RK182X,实现异构分流。
五、实测业务效果
1. 大模型场景
RK3588+RK1828 运行 Qwen3‑3B:可达 100+ TPS;Qwen‑7B 可流畅本地离线推理,数据不出边缘设备,适合机器人、私有化问答网关。
2. 多路视频分析
RK3588 负责视频解码,推理卸载 RK182X:单卡可稳定 8‑12 路 1080P 目标检测;双卡最高支持 16 路 1080P 同时 AI 分析,适合智慧工地、明厨亮灶、NVR 智能分析盒子。
3. 工业机器人多模态
RK3588 做运动控制、传感器采集;RK1828 跑 VLM 视觉语言模型,两者互不抢占资源,交互延迟降低。
六、关键风险与踩坑点
1. 供电问题:M.2 插槽供电不足,务必外接 12V 独立供电,否则偶发掉卡、重启、推理报错。
2. PCIe 通道资源:RK3588 PCIe 通道有限,如果同时接 SSD+RK182X,要确认底板通道分配,避免通道冲突。
3. 选型不要混淆 RK1820/RK1828:跑 7B 模型必须 RK1828(5GB DRAM),RK1820 2.5GB 显存不够,会 OOM。
4. 上电顺序:RK3588 先启动,后给 RK182X 上电;部分底板硬件设计不合理会导致 PCIe 识别失败。
5. SDK 版本:必须 RKNN3,RKNN2 完全不支持 RK182X 协处理器;固件、驱动、runtime 版本必须配套。
6. 带宽开销:PCIe2.0 x1 带宽有限,大量图像数据频繁传输会引入延迟,尽量在 RK3588 端完成图像预处理,只把推理数据传给协处理器。
七、什么时候选 RK182X 扩展,什么时候选别的方案
✅适合 RK182X 协处理器方案
已有 RK3588 硬件产品,不想重新换主控主板,需要低成本算力升级;
需要本地离线跑 3‑7B 大模型 / VLM;
多路视频并发推理,希望系统业务和 AI 推理硬件隔离互不干扰;
国产化边缘设备,不希望引入国外算力模组。
❌不适合场景
只有极少 PCIe 通道,底板无法引出可用 PCIe;
追求超高 FPS 超高带宽 4K@60 多路,PCIe 带宽成为瓶颈;
预算极低,只跑简单 YOLOv5 小模型,RK3588 原生 NPU 已经够用。
八、总结
RK3588 遇到算力瓶颈,RK182X 协处理器是存量 RK3588 设备升级算力的最优国产方案,采用主控 + 独立 AI 加速卡异构解耦架构,AI 推理完全卸载,不抢占 RK3588CPU、内存资源。RK1820 适合 3B 以内模型,RK1828 适合 7‑8B 模型,双卡并联最高 46TOPS,适配多路视频、本地大模型、机器人多模态场景。硬件重点解决 PCIe 引出、独立 12V 供电、上电顺序,软件使用 RKNN3 完整 SDK,即可完成整套边缘 AI 算力扩容。
需求留言: