华北地区负责人:17340067106(毛经理)
华东地区负责人:17358670739(甘经理)
华南、华西地区负责人:19113907060(耿女士)
软件算法咨询:18982151213(刘先生)

联系我们
产品咨询

Day 0 适配达成!后摩智能 M50 完成 Qwen3.8‑27B 端侧深度部署

作者:万物纵横
发布时间:2026-08-18 10:25
阅读量:

8 月 14 日晚,阿里巴巴通义实验室正式开源 Qwen3.8‑27B 大模型。作为千问的核心合作伙伴,后摩智能同步完成该模型在漫界 M50 芯片上的深度适配,将 27B 级别高性能大模型的端侧部署推进到Day 0水平,实现模型开源发布当日即可在端侧硬件完成推理落地。


Day 0 适配达成!后摩智能 M50 完成 Qwen3.8‑27B 端侧深度部署(图1)


Qwen3.8‑27B 是千问最新原生多模态稠密大模型,原生支持 262K 上下文,借助 YaRN 技术可外推至 1M Tokens。对比前代 Qwen3.6‑27B,其编程、办公任务能力大幅提升,性能超越 Qwen3.7‑Plus;新增reasoning_effort能力,可根据任务复杂度动态调节思考深度,有效节约算力资源,十分适配端侧本地推理场景。


实测数据显示,M50 平台运行 Qwen3.8‑27B,decode 速度可达 32.57 Tokens/s,输入长度支持 8K,最大上下文窗口 256K;双 M50 芯片整机功耗小于 30W。单颗 M50 芯片典型功耗仅 10‑15W,4‑bit 量化版本模型占用约 17GB,双芯片方案总功耗不到 30W,依靠移动电源就可以为整套端侧设备供电,让 27B 级大模型真正走进轻量化本地终端。


本次 Day0 适配的核心来自后摩大道工具链架构化适配思路:工具链以模型架构为适配单元,而非针对单个模型定制开发。Qwen3.8‑27B 与已经完成适配的 Qwen3.6 系列共享底层架构,算子映射、推理引擎均已提前完成,新模型权重发布后无需底层重新开发,直接进入量化编译流程,大幅压缩适配周期。


后摩大道工具链完整覆盖模型下载、GPTQ 量化、HMONNX 导出、编译、推理全链路。开发者从 Hugging Face、ModelScope 获取权重,使用工具链完成 4‑bit GPTQ 量化,系统自动执行余弦相似度校验保障精度;编译输出 M50 专用 HMM 推理文件。编译产物还可以转为 GGUF 格式,依托 llama.cpp、vLLM、SGLang 部署 OpenAI 兼容 API,无缝对接 OpenClaw 等 Agent 框架,快速构建本地智能体业务。单芯片、双芯片多芯互联部署模式均完整支持,量产终端设备可直接运行 Qwen3.8‑27B 本地推理。


未来,后摩智能将持续深化与千问的生态协同,依托存算一体 M50 芯片与大道软件栈,推动更高性能大模型低功耗端侧落地,助力本地 AI、端侧 Agent 产业规模化发展。

家具美容培训

家具维修培训

- END -
分享:
留言 留言 试用申请
产品咨询 产品咨询 硬件设备咨询
华北地区负责人:17340067106(毛经理)
华东地区负责人:17358670739(甘经理)
华南、华西地区负责人:19113907060(耿女士)
技术咨询 技术咨询 软件算法咨询
18982151213(刘先生)
微信在线客服 微信在线客服 在线客服
返回官网顶部 返回官网顶部 回到顶部
关闭窗口
产品订购
  • *

  • *

  • *

  • *

  • *