一、两种离线部署路线(瑞芯微 AIBOX 实测)
方案 1:RKLLM(NPU 硬件加速,首选)
瑞芯微官方大模型推理框架,支持 W8A8 / W4A16 量化,模型卸载至 NPU,速度显著高于纯 CPU。
✅ 优点:原生 NPU 加速、功耗低、首 token 延迟更低、支持 HTTP API 服务
❌ 缺点:需要提前在 PC 端转换.rkllm 模型;部分新模型存在兼容性 bug
方案 2:llama.cpp(GGUF 量化,零转换,灵活调试)
无需 RKNN 模型转换,直接加载通用 GGUF (Q4_K_M/Q5_K_M) 模型,依靠 ARM CPU 推理。
✅ 优点:模型通用、上手快、支持几乎所有开源 LLM
❌ 缺点:无法调用 NPU,推理速度比 RKLLM 慢 30%~80%
二、真机实测性能(AIBOX-3588,16GB LPDDR5,Ubuntu22.04,RKLLM NPU 加速)
模型 | 量化方式 | 内存占用 | 推理速度 (tokens/s) | 实用评价 |
Qwen3-0.6B | W8A8 | ~1.1GB | 18~24 | ✅非常流畅,离线客服、指令处理首选 |
Qwen2.5-1.5B | W8A8 | ~2.0GB | 10~14 | ✅日常对话、文本总结稳定 |
Phi3-mini-3.8B | W4A16 | ~3.6GB | 5~7 | ⭕可用,长文本会变慢 |
Qwen3-4B-Instruct | W4A16 | ~4.3GB | 3.5~6 | ⭕勉强可用,不适合高并发 |
Llama3-8B / Qwen2-7B | INT4 量化 | ≥7.5GB | 1~2.5 | ❌不推荐,响应极慢,长上下文容易崩溃 |
补充实测现象:
1. 4GB 内存 AIBOX:无法稳定跑 3B 以上模型,加载直接 OOM;
2. 上下文窗口 4K 最稳妥;开启 8K 上下文内存占用暴涨 50%;
3. 满载整机功耗 4~6W,散热正常情况下 7×24 小时持续运行无死机。
三、适合 & 不适合场景
✅推荐使用场景(离线私有化需求)
1. 工业现场本地离线 AI 问答、设备故障文本分析
2. 涉密内网、无网络环境本地知识库问答
3. 离线语音 ASR+LLM 本地语音助手
4. 园区 / 工地边缘端文本识别、工单自动摘要
5. 本地小知识库 RAG 检索(搭配轻量 LLM)
❌不适合场景
1. 需要流畅运行 7B/13B 及以上通用大模型(建议上 RK1828 算力卡、国产 GPU 服务器)
2. 多用户并发请求(RK3588 适合单路 / 2 路并发)
3. 高实时性对话(要求 > 15 token/s,只能选择 1.5B 以内模型)
四、部署常见踩坑(实测高频问题)
1. NPU 内存不足报错
默认 NPU 内存池偏小,执行命令扩容:
echo 2048 > /sys/kernel/debug/rknpu/mem_pool_size_mb
2. 模型转换后输出乱码
部分蒸馏模型(早期 DeepSeek-R1 蒸馏版)RKLLM 存在兼容问题,更换 Qwen 系列模型更稳。
3. llama.cpp 无法调用 NPU
原生 llama.cpp 不支持 RK3588 NPU,想要硬件加速必须使用 RKLLM。
4. 开机运行 RAG+LLM 双进程
内存紧张,建议使用向量数据库轻量化配置,限制上下文长度。
五、选型建议
1. 新项目优先:AIBOX-3588 16GB 内存版本,兼顾 3~4B 模型部署余量;
2. 预算有限、仅简单指令:最低 8GB 内存;坚决避开 4GB 版本跑大模型;
3. 如果需要稳定跑 7B 离线大模型:不要选用 RK3588 盒子,升级带 RK1828 算力扩展的边缘整机。
六、总结
RK3588 瑞芯微 AIBOX具备离线大模型运行能力,属于合格的轻量化边缘 LLM 硬件。最优选择部署 0.5B~3B 参数开源量化模型,满足离线私有化、内网无公网场景;如果追求更强推理能力、运行 7B 模型,需要升级更高算力平台。
需求留言: