在端侧 AI 加速普及的 2026 年,一个核心问题始终困扰着开发者和企业用户:边缘设备到底能不能流畅运行百亿参数大模型?传统 GPU 功耗高、体积大,普通 NPU 算力又不足以支撑复杂推理。后摩智能力擎 LQ50 M.2 算力卡以 "口香糖尺寸 + 160TOPS 算力 + 13W 功耗" 的参数闯入市场,号称能在边缘端跑起 35B 大模型。
这篇评测我们将从硬件架构、实测性能、软件生态、功耗散热四个维度全面拆解 LQ50,看看存算一体架构能否真正解决边缘大模型的落地难题。
一、硬件速览:M.2 尺寸下的百亿算力
外观与规格
力擎 LQ50 采用标准 M.2 2280 形态,尺寸仅 22×80mm,和一块普通 NVMe 固态硬盘无异。这意味着任何带有 M.2 M-Key 插槽的设备 —— 从迷你主机、工业网关到 AI PC、嵌入式主板 —— 都能即插即用升级大模型能力。

核心硬件参数:
AI 加速器:1× 后摩漫界 ® M50 存算一体芯片
物理算力:160 TOPS @INT8 / 100 TFLOPS @bFP16
内存配置:12GB 192-bit LPDDR5(最大支持 48GB 版本)
内存带宽:153.6 GB/s
接口:PCIe Gen4 ×4,M.2 M-Key
典型功耗:≤ 13W
待机功耗:低至 4mW
工作温度:0-50℃
系统支持:Windows 11 / Linux / Android
从参数上看,153.6 GB/s 的内存带宽是亮点之一 —— 这一数值已经接近中端桌面 GPU 的显存带宽水平,为大模型推理提供了关键的数据吞吐保障。
核心芯片:M50 存算一体架构
LQ50 的性能根基来自后摩自研的漫界 M50 芯片,这是一颗基于第二代 SRAM-CIM(静态随机存取存储器内计算)架构的存算一体 AI 芯片, die 尺寸仅 20×23mm。
传统冯・诺依曼架构中,数据需要在存储单元和计算单元之间反复搬运,这个过程消耗了约 70% 的功耗和延迟。存算一体则将计算直接融入存储单元内部,权重数据加载和矩阵运算可以并行执行,从根源上突破 "存储墙" 和 "功耗墙"。
M50 的技术特性包括:
双端口存算架构:权重加载与矩阵计算完全并行
混合精度设计:支持 8bit/16bit 混合运算,兼顾精度与性能
天璇 IPU 架构:第二代自研计算架构,自适应计算周期可带来最高 160% 加速
多芯互联:支持多卡级联扩展算力
官方宣称相比传统架构,能效比提升 5-10 倍。这个数字是否属实,我们在后文的实测环节验证。
二、性能实测:边缘跑大模型到底有多快?
大语言模型推理性能
这是大家最关心的部分。我们整理了官方公布数据以及第三方实测数据,覆盖从 7B 到 35B 参数量级的主流模型:
模型规格 | 量化精度 | 推理速度 (tokens/s) | 数据来源 |
Qwen 7B / Llama 3 8B | INT8 | 25+ | 官方标称 |
Qwen3.5 35B-A3B (MoE) | INT8 | ~12 (单卡) | 第三方实测推算 |
Qwen3.5 35B-A3B (MoE) | INT8 | 24.06 (双 LQ50) | 纵横智控 EC700 实测 |
解读:
7B 级别模型:单卡 25+ tokens/s 的速度,基本达到可用水平。作为对比,移动端旗舰处理器跑 7B 模型通常在 10-15 tokens/s 左右,LQ50 提升明显。这个速度足以支撑流畅的单轮对话,首字延迟也控制在可接受范围内。
35B 级别模型:单卡可以运行但速度偏慢,更适合非实时场景如离线文档总结、知识库问答。双卡级联后 24 tokens/s 的表现则进入了实用区间,接近 RTX 3090 运行同规格 MoE 模型的表现(约 30-40 tokens/s),但功耗仅为后者的约 1/8。
官方还提到 M50 已完成 DeepSeek 70B 模型适配,最高可支持 100B-120B 参数模型。但这类超大模型在单卡上必然需要分层调度和重度量化,推理速度会进一步下降,更多是验证 "能跑" 而非 "好用"。
视觉与多模态能力
除了纯文本大模型,LQ50 同样支持 VLM(视觉语言模型)推理。在工业质检、安防监控等边缘场景中,多模态能力往往比纯 LLM 更有价值。
配合 RK3588 等主控 SoC 的架构中,LQ50 专注承担神经网络推理部分,主控负责视频编解码、预处理和业务逻辑,分工明确。在赋创 FR50 AI BOX 这类产品中,单颗 LQ50 Duo(双 M50)可同时处理多路视频分析 + 大语言模型语义理解,这是传统边缘网关难以做到的。
并发与多任务
边缘场景往往不是单用户对话,而是多路传感器数据同时处理。M50 架构支持多并发推理,在高负载下仍能保持稳定延迟。对于工业网关这类设备,同时运行目标检测、异常识别、语义分析多个模型是常态,LQ50 的 160TOPS 算力可以较好地承载这类混合负载。
三、软件生态:从开箱到部署要踩多少坑?
硬件算力只是基础,软件工具链的成熟度直接决定了开发成本和落地周期。
后摩大道软件栈
后摩自研的 "大道" 软件平台是整个生态的核心,覆盖模型转换、量化优化、编译部署全流程:
模型转换:支持 PyTorch、TensorFlow 等主流框架模型导入
自动量化:内置 INT8/bFP16 混合量化工具,无需手动调参
优化算子库:针对 Transformer、CNN 等常见算子做了存算一体架构的深度优化
标准模型库:内置常用开源模型的优化版本,开箱即用
根据官方披露,超过 80% 的客户可以直接使用标准模型库中的预优化模型,无需从零开始适配。对于有自研模型的客户,工具链提供转换工具 + 技术支持的组合方案。
系统兼容性
Linux:完整支持,是工业和边缘场景的主力系统
Windows 11:支持,面向 AI PC 和桌面终端
Android:支持,面向移动终端和智能设备
对于边缘计算最常用的 Ubuntu 系统,LQ50 提供完整的驱动和 SDK,开发者可以像调用 GPU 一样通过标准接口调用算力。
生态成熟度评价
客观来说,相比 NVIDIA CUDA 生态,后摩大道的软件栈还处于成长期。优势在于针对大模型推理做了深度垂直优化,常用模型开箱即用;劣势在于算子覆盖度和社区资源远不如 CUDA 丰富,小众算子或自定义 OP 可能需要官方支持。
但换个角度看,边缘大模型部署本身就是场景化、固定化的 —— 一旦模型选定并优化完成,后续很少频繁更换。对于确定的落地项目,LQ50 的软件成熟度已经足够支撑商用。
四、功耗与散热:13W 意味着什么?
能效比才是边缘场景的核心指标
在数据中心,你可以用 300W 的显卡追求极致性能;但在边缘网关、工业设备、电池供电终端中,每瓦性能才是黄金指标。
产品 | 算力 (INT8) | 典型功耗 | 能效比 (TOPS/W) |
力擎 LQ50 | 160 TOPS | 13W | ~12.3 TOPS/W |
主流边缘 GPU 方案 | ~100 TOPS | ~70W | ~1.4 TOPS/W |
高端消费级 GPU | ~1000 TOPS | ~300W | ~3.3 TOPS/W |
可以看到,存算一体架构在能效比上形成了数量级优势。12 TOPS/W 是什么概念?这意味着用手机快充级别的功耗,就能提供百亿参数大模型的推理能力。
散热设计
13W 的功耗带来一个巨大优势:可以无风扇被动散热。
LQ50 标配定制散热片,支持自然散热和主动散热两种方案。在常温环境下,单靠被动散热就能维持满负载运行,这对噪音敏感场景(如办公室、智能家居)和防尘要求高的工业场景至关重要 —— 没有风扇意味着更少的故障点、更长的设备寿命。
待机功耗低至 4mW 也值得一提,对于电池供电的移动终端或间歇工作的物联网设备,这个特性能显著延长续航。
五、适用场景与选型建议
最适合的场景
1. 工业边缘网关:产线质检、设备预测性维护、多模态数据分析。一台网关加装 1-2 块 LQ50,即可同时处理视觉检测和大模型语义分析,数据无需上传云端。
2. AI PC / 迷你主机升级:普通办公电脑通过 M.2 插槽升级本地大模型能力,离线处理文档写作、会议纪要、知识库问答,适合对数据隐私有要求的政务、金融、律所等行业。
3. 智能终端设备:服务机器人、智能交互屏、AI NAS。低功耗和无风扇设计使其可以轻松集成进各类终端产品。
4. 私有化知识库一体机:类似可道云 TeamSilo A10 的形态,将企业文件存储与本地大模型结合,内网环境下实现知识检索和智能问答。
不建议的场景
1. 追求绝对推理速度:如果你需要每秒上百 token 的生成速度,或者同时服务几十上百个并发用户,还是应该选择桌面级 GPU 甚至服务器方案。
2. 训练场景:LQ50 是纯推理卡,不支持模型训练。微调也只能做非常轻量级的 LoRA 适配。
3. 需要丰富 CUDA 生态:如果你的工作流重度依赖 CUDA 生态、需要频繁尝试各种开源项目和新模型,传统 GPU 的适配成本会更低。
选型参考
7B 及以下模型、单路应用:单块 LQ50 12GB 版本足够
14B-35B 模型、追求流畅度:建议 LQ50 Duo 双芯版本,或两块单卡级联
70B 以上超大模型:建议选择力谋 LM5070 加速卡(4 颗 M50,640TOPS)
六、总结:边缘大模型的可行解
回到标题的问题:边缘端跑大模型到底行不行?
答案是:行,但有边界。
力擎 LQ50 用存算一体架构证明了一件事 —— 在 13W 功耗、M.2 尺寸的约束下,确实可以运行 35B 参数量级的大模型,7B 模型更是能达到流畅可用的速度。对于绝大多数边缘场景来说,这已经跨过了 "能用" 的门槛,进入了 "好用" 的区间。
核心优势:
极致能效比,12 TOPS/W 领先传统架构一个数量级
M.2 标准形态,部署灵活,适配海量现有设备
无风扇被动散热,可靠性高、噪音为零
国产自主架构,供应链安全可控
待完善之处:
软件生态与 CUDA 仍有差距,小众模型适配成本较高
35B 以上大模型推理速度偏慢,更适合离线场景
社区资源和开发者数量还在积累阶段
总体而言,如果你正在寻找边缘侧的大模型推理方案,功耗、体积、散热是硬约束,同时需要兼顾数据隐私和低延迟,那么力擎 LQ50 是目前市场上极具竞争力的选项。存算一体这条技术路线,正在从实验室走向规模化商用,而 LQ50 就是一个标志性的量产产品。
需求留言: