华北地区负责人:17340067106(毛经理)
华东地区负责人:17358670739(甘经理)
华南、华西地区负责人:19113907060(耿女士)
软件算法咨询:18982151213(刘先生)

联系我们
产品咨询

RK1828 M.2 算力卡实测:单卡 20TOPS,7B 大模型本地推理测试

作者:万物纵横
发布时间:2026-09-17 09:27
阅读量:

一、硬件核心规格


RK1828 是瑞芯微 RK182X 系列 M.2 2280 形态 AI 协算力卡,定位边缘端本地大模型推理,峰值算力 20TOPS@INT8


接口:M.2 Key-M,PCIe2.0 x1


片上存储:5GB 3D 堆叠 DRAM,带宽 1024GB/s(不占用主控内存,是流畅跑 7B 模型的核心)


核心:3 核 RISC-V 64 位 + NPU,支持 INT4/INT8/BF16/FP8 混合精度


功耗:典型 7~10W,被动散热可基础运行,持续负载建议带小风扇


适配主控:RK3588/RK3576/RK3572 等瑞芯微平台,主控只做调度,LLM 推理全部交给 RK1828


架构特点:算力解耦。主控负责系统、视频编解码、外设业务;RK1828 专职跑 LLM/VLM,多路视觉检测 + 大模型对话同时跑,资源不打架


RK1828 M.2 算力卡实测:单卡 20TOPS,7B 大模型本地推理测试(图1)


二、7B 大模型本地推理实测(RKNN3 SDK,W4A16 量化)


测试模型:Qwen2.5-7B(最常用 7B 文本大模型)


TTFT(首 token 延迟):161ms,提问后反馈快,无明显等待卡顿


生成速度:59 tokens/s,正常聊天、文档摘要、指令调用流畅;长文本输出会略有下降


Qwen2.5-VL-7B(7B 多模态模型图文理解):TTFT≈161ms,58.94 tokens/s,可本地图片理解 + 对话


量化说明:W4A16 INT4 量化是 RK1828 跑 7B 模型的最优方案;INT8 量化 7B 会超出 5GB 片上内存,需要权重分片,速度明显下降。


对比参考


纯 RK3588 内置 NPU 跑 7B:约 18~25 tokens/s,系统内存带宽瓶颈明显,多任务极易卡顿


RK1828 单卡 7B:59 tokens/s,独立片上 DRAM,视频业务和大模型并行稳定


三、部署要点


1. 工具链:RKNN3 SDK,模型需要用 RKNN 工具做量化、算子转换,原生支持 Qwen、Llama3、DeepSeek 等主流开源模型


2. 内存边界:5GB 片上 DRAM 刚好承载 INT4 量化 7B 模型;更大模型(9B/27B)需要多卡级联,最多 4 卡,4 卡可跑 Qwen3.8-27B


3. 场景优势:离线本地 AI 助手、工业文档问答、摄像头多模态分析、本地 RAG 知识库;数据不出设备,隐私可控


4. 短板:面向推理优化,不支持模型训练;PCIe2.0 带宽有限,多卡级联时要注意主板 PCIe 链路调度


四、适用选型建议


✅ 推荐场景:边缘盒子、智能工控、机器人、明厨亮灶 / 智慧工地,需要本地 7B 大模型 + 多路视频视觉同时跑


❌ 不适合:云端训练、超大 batch 高并发推理、PC x86 主机直接使用(原生适配瑞芯微 ARM 主控)


五、总结


RK1828 M.2 算力卡依靠5GB 高带宽 3D 堆叠内存突破端侧 LLM 内存瓶颈,单卡 20TOPS,INT4 量化 Qwen2.5-7B 可跑到近 60token/s;以很低功耗,给 RK3588 等开发板低成本外挂 7B 本地大模型能力,非常适合私有化边缘 AI 落地。

- END -

家具美容培训

家具维修培训

分享:
留言 留言 试用申请
产品咨询 产品咨询 硬件设备咨询
华北地区负责人:17340067106(毛经理)
华东地区负责人:17358670739(甘经理)
华南、华西地区负责人:19113907060(耿女士)
技术咨询 技术咨询 软件算法咨询
18982151213(刘先生)
微信在线客服 微信在线客服 在线客服
返回官网顶部 返回官网顶部 回到顶部
关闭窗口
产品订购
  • *

  • *

  • *

  • *

  • *