8 月 14 日晚,阿里巴巴通义实验室正式开源 Qwen3.8‑27B 大模型。作为千问的核心合作伙伴,后摩智能同步完成该模型在漫界 M50 芯片上的深度适配,将 27B 级别高性能大模型的端侧部署推进到Day 0水平,实现模型开源发布当日即可在端侧硬件完成推理落地。

Qwen3.8‑27B 是千问最新原生多模态稠密大模型,原生支持 262K 上下文,借助 YaRN 技术可外推至 1M Tokens。对比前代 Qwen3.6‑27B,其编程、办公任务能力大幅提升,性能超越 Qwen3.7‑Plus;新增reasoning_effort能力,可根据任务复杂度动态调节思考深度,有效节约算力资源,十分适配端侧本地推理场景。
实测数据显示,M50 平台运行 Qwen3.8‑27B,decode 速度可达 32.57 Tokens/s,输入长度支持 8K,最大上下文窗口 256K;双 M50 芯片整机功耗小于 30W。单颗 M50 芯片典型功耗仅 10‑15W,4‑bit 量化版本模型占用约 17GB,双芯片方案总功耗不到 30W,依靠移动电源就可以为整套端侧设备供电,让 27B 级大模型真正走进轻量化本地终端。
本次 Day0 适配的核心来自后摩大道工具链架构化适配思路:工具链以模型架构为适配单元,而非针对单个模型定制开发。Qwen3.8‑27B 与已经完成适配的 Qwen3.6 系列共享底层架构,算子映射、推理引擎均已提前完成,新模型权重发布后无需底层重新开发,直接进入量化编译流程,大幅压缩适配周期。
后摩大道工具链完整覆盖模型下载、GPTQ 量化、HMONNX 导出、编译、推理全链路。开发者从 Hugging Face、ModelScope 获取权重,使用工具链完成 4‑bit GPTQ 量化,系统自动执行余弦相似度校验保障精度;编译输出 M50 专用 HMM 推理文件。编译产物还可以转为 GGUF 格式,依托 llama.cpp、vLLM、SGLang 部署 OpenAI 兼容 API,无缝对接 OpenClaw 等 Agent 框架,快速构建本地智能体业务。单芯片、双芯片多芯互联部署模式均完整支持,量产终端设备可直接运行 Qwen3.8‑27B 本地推理。
未来,后摩智能将持续深化与千问的生态协同,依托存算一体 M50 芯片与大道软件栈,推动更高性能大模型低功耗端侧落地,助力本地 AI、端侧 Agent 产业规模化发展。
需求留言: