一、硬件核心规格
RK1828 是瑞芯微 RK182X 系列 M.2 2280 形态 AI 协算力卡,定位边缘端本地大模型推理,峰值算力 20TOPS@INT8
接口:M.2 Key-M,PCIe2.0 x1
片上存储:5GB 3D 堆叠 DRAM,带宽 1024GB/s(不占用主控内存,是流畅跑 7B 模型的核心)
核心:3 核 RISC-V 64 位 + NPU,支持 INT4/INT8/BF16/FP8 混合精度
功耗:典型 7~10W,被动散热可基础运行,持续负载建议带小风扇
适配主控:RK3588/RK3576/RK3572 等瑞芯微平台,主控只做调度,LLM 推理全部交给 RK1828
架构特点:算力解耦。主控负责系统、视频编解码、外设业务;RK1828 专职跑 LLM/VLM,多路视觉检测 + 大模型对话同时跑,资源不打架

二、7B 大模型本地推理实测(RKNN3 SDK,W4A16 量化)
测试模型:Qwen2.5-7B(最常用 7B 文本大模型)
TTFT(首 token 延迟):161ms,提问后反馈快,无明显等待卡顿
生成速度:59 tokens/s,正常聊天、文档摘要、指令调用流畅;长文本输出会略有下降
Qwen2.5-VL-7B(7B 多模态模型图文理解):TTFT≈161ms,58.94 tokens/s,可本地图片理解 + 对话
量化说明:W4A16 INT4 量化是 RK1828 跑 7B 模型的最优方案;INT8 量化 7B 会超出 5GB 片上内存,需要权重分片,速度明显下降。
对比参考
纯 RK3588 内置 NPU 跑 7B:约 18~25 tokens/s,系统内存带宽瓶颈明显,多任务极易卡顿
RK1828 单卡 7B:59 tokens/s,独立片上 DRAM,视频业务和大模型并行稳定
三、部署要点
1. 工具链:RKNN3 SDK,模型需要用 RKNN 工具做量化、算子转换,原生支持 Qwen、Llama3、DeepSeek 等主流开源模型
2. 内存边界:5GB 片上 DRAM 刚好承载 INT4 量化 7B 模型;更大模型(9B/27B)需要多卡级联,最多 4 卡,4 卡可跑 Qwen3.8-27B
3. 场景优势:离线本地 AI 助手、工业文档问答、摄像头多模态分析、本地 RAG 知识库;数据不出设备,隐私可控
4. 短板:面向推理优化,不支持模型训练;PCIe2.0 带宽有限,多卡级联时要注意主板 PCIe 链路调度
四、适用选型建议
✅ 推荐场景:边缘盒子、智能工控、机器人、明厨亮灶 / 智慧工地,需要本地 7B 大模型 + 多路视频视觉同时跑
❌ 不适合:云端训练、超大 batch 高并发推理、PC x86 主机直接使用(原生适配瑞芯微 ARM 主控)
五、总结
RK1828 M.2 算力卡依靠5GB 高带宽 3D 堆叠内存突破端侧 LLM 内存瓶颈,单卡 20TOPS,INT4 量化 Qwen2.5-7B 可跑到近 60token/s;以很低功耗,给 RK3588 等开发板低成本外挂 7B 本地大模型能力,非常适合私有化边缘 AI 落地。
需求留言: