RK1828 支持的大语言模型清单(RKNN3 / RKLLM3,单卡 / 多卡级联)
底层依靠 RKNN3+RKLLM3,原生支持 mRoPE、Function Call,支持 W4A16/W6A16 混合量化,单卡 5GB 片上 DRAM 适合 7B 及以内;双卡 / 四卡级联可上 9B~27B
✅ Qwen 通义千问系列(官方深度优化,优先推荐)
1. Qwen2.5:0.5B、1.5B、3B、7B(单卡 RK1828 直接跑)
2. Qwen3:0.6B、1.7B、4B、8B
3. Qwen3.5-9B(2 卡 RK1828 级联)
4. Qwen3.8-27B(4 卡 RK1828 级联,就是你前面测的)
配套还有 Qwen 嵌入、重排、ASR/TTS 语音模型,可直接搭本地 RAG
✅ MiniCPM 面壁智能(端侧 Agent 优选)
MiniCPM3 / MiniCPM4 / MiniCPM5(1B、2B、4B)
MiniCPM-V 多模态版本(VLM,图文问答)
原生适配,擅长工具调用、本地智能体闭环,单卡跑 4B 级别很稳
✅ DeepSeek 深度求索
DeepSeek-R1-Distill 蒸馏系列(1.5B、7B)
DeepSeek-V2 轻量版、DeepSeek-Coder 代码模型
适合本地代码分析、数学推理场景
✅ LLaMA / Llama3 家族
LLaMA2 7B、13B(13B 需要双卡级联)
Llama3、Llama3.1 8B
通用开源底座,很多微调模型基于此
✅ 其他国产主流 LLM
ChatGLM3-6B、GLM Edge
InternLM2 书生・浦语(1.8B、7B)
TeleChat2 天工模型
✅ 海外轻量模型
Phi-2、Phi-3(微软小模型,推理快)
Gemma / Gemma2 / Gemma3n(Google 端侧模型)
RWKV7(RNN 架构,长文本,适合文档摘要)
✅ 多模态 VLM(语言 + 视觉一体,RK1828 单卡可跑)
Qwen2.5-VL、Qwen3-VL、InternVL3、InternVL3.5、MiniCPM-V、DeepSeek-VL,视频内容理解、图片 OCR + 问答,明厨亮灶 / 工地视频语义分析常用
硬件选型速记(RK1828)
单卡(5GB DRAM):0.5B~7B,W4 量化,7B 模型流畅
双卡级联:最高 9B~13B(Qwen3.5-9B、Llama3 8B/13B)
四卡级联:最高 27B(Qwen3.8-27B)
超过显存容量的模型,必须张量并行拆分权重到多卡,依赖 RKLLM3 多卡推理能力
限制说明
1. 不是所有大模型开箱即用,部分模型需要:算子适配、权重转换、W4 量化调优;官方 model zoo 提供预转换 rkllm 包,拿来直接部署。
2. 超大稠密模型(>27B)RK1828 多卡方案不推荐,显存总量上限在这里。
3. RWKV 这类非 Transformer 模型,RKNN 支持,但推理性能会低于 RoPE 类 LLM。
需求留言: