RKNN3 SDK 针对RK1820/RK1828(RK182X) AI 协处理器持续演进,补齐端侧 AI 智能体两大核心能力:原生 Function‑Call 工具调用、多模型 / 多会话并发推理,让 RK3588/RK3576+RK182X 双芯异构方案可本地运行 AI Agent、多模态混合业务,大幅降低边缘大模型智能体落地门槛。

一、大模型 Function‑Call(工具调用)能力强化
1. 原生端侧支持:RKNN3 Runtime 内置对 mRoPE、Function‑Call 格式解析,Qwen、Llama、MiniCPM 等支持工具调用的开源大模型,经 RKNN3‑Toolkit 量化转换后,在 RK182X 协处理器上可直接输出 function call 调用指令,不需要 CPU 侧做额外 prompt 硬编码改写。
2. rkllm3‑server 适配 OpenAI 兼容接口,完整透传 tools 参数,端侧完成函数识别输出;业务层只需要解析返回的 function name、parameters,完成工具调用后把结果回传给大模型闭环推理,实现离线本地 Agent 链路。
3. 迭代优化点:后续版本优化工具调用输出解码稳定性,降低错触发、乱输出概率;支持会话内多轮 Function‑Call 循环;KVCache 会话可保存工具调用上下文,减少重复计算开销。
适用场景:边缘机器人本地规划、工业设备离线知识库查询、网关本地智能体、私有化算力盒子。
二、多模型并发与多会话并行能力
RK182X 通过 3D 堆叠高带宽 DRAM+RKNN3 SDK 调度层,实现多模型同时加载、多核并行推理、数据传输与推理流水线重叠,不再是单模型独占 NPU 算力。
1. 异构多模型混跑:可同时加载 LLM 大语言模型 + VLM 多模态模型 + YOLO 检测 / Embedding 向量模型,NPU 硬件资源由 SDK 动态分片调度;例如一路做视频目标检测,一路跑大模型问答,一路做向量召回推理并行执行。
2. 多会话(Multi‑session)并发:SDK 新增多会话并行接口,单 RK1828 支持多路 LLM 会话同时服务,会话之间 KVCache 做隔离与动态复用,控制内存峰值,满足多客户端同时访问本地大模型服务。
3. 流水线并行:PCIe 数据传输与 NPU 推理重叠执行,消除 “等数据再推理” 的空闲窗口;多 batch、多核调度提升吞吐量,工业视觉、多路视频 AI 分析场景帧率可倍数提升。
4. 内存优化机制:支持会话暂停 / 恢复、KVCache 导入导出、流式权重加载,大并发场景减少模型反复卸载加载耗时,提升系统响应速度。
硬件差异:RK1820 侧重轻量并发;RK1828 更大 HBM,更适合多模型 + 多会话重负载并发业务。
三、配套关键性能提升
1. LLM 解码效率整体提升15%+,RK1828 上 Qwen2.5‑3B 解码 TPS 突破 100 tokens/s,保障 Function‑Call 多轮对话流畅度。
2. 量化策略:LLM/VLM 采用 W4A16 G32,视觉 CNN 采用 W8A8,兼顾精度与吞吐,适配并发下多模型混合量化部署。
3. 完整工具链:PC 端 RKNN3‑Toolkit 做模型转换、精度评估;板端 C/Python API;rkllm3‑server 提供 HTTP 服务,兼容 OpenAI 接口,方便上层业务快速对接 Agent 应用。
四、典型业务落地组合示例
工业 AI 盒子:YOLO 缺陷检测(视觉并发) + LLM 本地 Function‑Call 调用设备数据库 + Embedding 知识库检索,全部跑在 RK1828 协处理器,主控 RK3588 只负责业务逻辑与 IO。
机器人端侧 Agent:VLM 视觉理解 + LLM Function‑Call 调用导航、运动控制工具,多模型并行,实现完全离线自主任务规划。
五、开发注意点
1. RKNN3 与旧 RKNN‑Toolkit2不兼容,RK182X 必须使用 RKNN3 整套工具链,不能混用旧 Runtime。
2. 多模型并发会拉高 HBM 内存占用,需要根据模型大小、会话数做内存预算;优先开启会话复用、流式权重加载降低峰值。
3. Function‑Call 效果高度依赖原始模型本身能力,优先选择官方已经微调支持 tool call 的权重再做 RKNN 转换。
需求留言: