瑞芯微最新 RKNN3 Toolkit & RKNN3 Runtime SDK(V1.1.0)针对RK1828 M.2 Key-M 算力卡完成多卡级联核心优化,打通多片 RK1828 M.2 模组并行协同推理瓶颈,面向边缘多卡 AI 服务器、多模态集群、工业视觉一体机等高算力需求场景,实现算力弹性扩容。

一、本次多卡级联关键优化点
1. PCIe 链路调度优化(适配 M.2 形态)
优化多卡 PCIe 数据传输冲突,降低多 RK1828 M.2 卡之间数据交互时延,减少主控 PCIe 带宽争抢;
新增负载均衡调度器,支持任务自动分发至多片 RK1828 算力卡;支持数据并行、模型分片并行两种部署模式。
针对 M.2 硬件特性优化:M.2 插槽硬件带宽、供电约束做软件适配,避免多卡并发时性能跳水。
2. LLM 大模型多卡分片推理正式落地
单张 RK1828 内置 5GB 片上 DRAM,可独立运行 7B 模型;多卡级联后支持模型张量分片,可在边缘硬件部署 9B/12B 级大语言、多模态模型(Gemma4、Qwen3.5 系列)。
优化跨卡 KV Cache 同步机制,大幅降低多卡大模型上下文交换开销;
支持 rkllm3 服务原生识别多张 RK1828 M.2 设备,一行配置开启多卡协同。
3. 多设备统一管理 API
RKNN3 Runtime 新增多卡设备枚举、会话资源隔离接口;
支持多卡独立运行不同任务(多路视频检测 + 大模型并行),互不抢占算力;
完善异常处理:单卡故障自动降级,不中断整套 AI 业务。
4. 工具链配套升级(PC 端 RKNN3-Toolkit)
1. 模型转换阶段支持多卡分片导出,无需手动拆分权重;
2. 新增多卡仿真评估功能:PC 上提前模拟 2~4 片 RK1828 联合推理性能;
3. 性能分析工具新增跨卡带宽监控、负载热力图,快速定位多卡通信瓶颈;
4. 降低多卡联合推理额外显存开销,减少片间数据拷贝。
二、硬件部署形态
载体:搭载多 M.2 Key-M 插槽的 RK3588/RK3576 工控主板、边缘 AI 服务器;
算力单元:RK1828 M.2 2280 算力卡(20TOPS@INT8,5GB 堆叠 DRAM);
典型配置:主板搭载 2/4 张 RK1828 M.2 卡,实现 40TOPS~80TOPS 边缘聚合算力。
三、适用行业场景
1. 工业视觉集群:多路高清摄像头同时目标检测、缺陷识别,多卡分担视频流推理;
2. 本地多模态 AI 一体机:同时运行语音识别、视觉感知、本地大模型 Agent;
3. 电力 / 矿山边缘网关:多通道传感数据分析 + 大模型本地研判;
4. 小型边缘私有算力节点:替代部分云端推理,保障数据本地不出网。
四、开发重点注意事项
1. RKNN3 与旧版 RKNN-Toolkit2不兼容,项目必须完整迁移至 RKNN3 工具链;
2. M.2 多卡硬件设计需关注主板 PCIe 通道分配、散热、供电,避免硬件瓶颈抵消软件优化收益;
3. 多卡级联分为任务并行(推荐视觉场景)、模型分片并行(推荐大模型场景),根据业务选择调度模式;
4. 当前稳定支持 Linux 系统,Android 多卡级联为 Beta 状态。
需求留言: