瑞芯微 RK1828 M.2 AI 协算力卡,依托RKNN3 多卡张量并行级联,在边缘盒子硬件上本地部署 Qwen3.8‑27B 稠密大模型,实现离线私有化推理,不用依赖云端 GPU 服务器。

一、RK1828 核心硬件参数
项目 | 参数 |
NPU 算力 | 20 TOPS INT8,支持 INT4/INT8/FP8/BF16 混合精度 |
片上 DRAM | 5GB 3D 堆叠高带宽内存(单卡),大模型关键,RK1820 仅 2.5GB 无法跑大模型 |
接口 | M.22280 PCIe2.0,对接 RK3588 主控主板 |
功耗 | 710W / 卡,工业低功耗,适合边缘盒子 7×24h 运行 |
单卡上限 | 原生单卡最高稳定跑 78B 模型(Qwen38B) |
重点:单张 RK1828 无法跑 27B,必须多卡级联做张量切分,权重分散到多张卡片上 DRAM。
二、边缘盒子硬件架构(跑 27B)
主控:RK3588 平台边缘盒子(多 M.2 PCIe 插槽)
RK3588 职责:运行 Linux 系统、网络、视频编解码、RAG 检索、API 服务、业务调度,不参与大模型 NPU 推理
加速层:多片 RK1828 M.2 算力卡并行级联,模型权重张量拆分,分布在多张卡 5GB 片内 DRAM,协同完成 LLM 推理
互联:PCIe 高速传递张量数据,使用 RKNN3 Runtime 多卡调度;对外兼容 OpenAI API,业务层直接调用
硬件形态:工业边缘算力盒子,无台式 GPU,ARM 架构,低功耗,可部署在机房、车间、工控现场,断网可用。
三、官方实测性能 Qwen3.8‑27B(w4a16 量化)
模型:Qwen3.8‑27B‑Instruct(稠密 27B)
推理解码 TPS:13 tokens/s
同方案 Qwen3.5‑9B:35 tokens/s
工具链:RKNN3 + RKLLM3‑server,支持 16K 上下文窗口
说明:27B 在边缘盒子属于可用但非高速,适合知识库问答、文档解析、本地 Agent、工业运维助手;不适合高并发聊天场景。
四、部署关键要点
1. 量化要求:必须 w4a16 INT4 量化,FP16 原始权重内存需求巨大,边缘硬件放不下;RKNN‑Toolkit2 做模型转换、权重切分,生成多卡分片模型文件。
2. 插槽与供电:每块 RK1828 约 7‑10W,盒子 M.2 插槽必须足够供电,部分主板需要外接 12V 辅助供电,否则降频、死机。
3. 散热:多卡满载热量高,边缘盒子需要强化风道、金属散热片,工业宽温环境重点处理散热,防止降速降频。
4. 系统适配:RK3588 Debian/Ubuntu,银河麒麟 V10;不支持 Android 做 27B 大模型推理。
5. 模型生态:除 Qwen 系列,支持 Llama3、DeepSeek 等,但是27B 级别仅 Qwen3.8 完成 Day0 官方调优,其他大模型需要自行适配多卡切分逻辑。
五、适用业务场景
工业现场私有化大模型:设备故障分析、运维知识库、本地文档解析
智慧工地 / 明厨亮灶边缘盒子:视频 + 本地 LLM,视频语义摘要,不上传原始数据
离线 AI Agent,RAG 本地知识库,完全断网运行,数据不出设备
中小型企业私有化部署,替代云端 API,消除 token 计费
六、局限与选型提示
1. 对比 GPU:27B 性能远低于 NVIDIA 显卡,优势是低功耗、ARM 工业形态、整机成本低、无云端依赖。
2. 并发:27B 多卡级联更适合单会话 / 少量并发;多用户高并发建议降级 9B/8B 模型。
3. 不要混淆 RK1820:RK1820 只有 2.5GB 内存,不支持多卡跑 27B,只能做 3B 以内小模型。
需求留言: