产品咨询:17340067106(毛经理)
软件算法咨询:18982151213(刘经理)

联系我们
产品咨询

算能 BM1684X 算力盒子新增 Qwen-VL 多模态官方适配,多路视频 + 图文理解一体化

作者:万物纵横
发布时间:2026-10-09 09:19
阅读量:

算能在 BM1684X 平台完成Qwen3-VL 4B/8B多模态模型官方适配,开源在 LLM-TPU 仓库,所有 BM1684X 算力盒子、计算卡、微服务器均可直接部署;依托芯片原生 32 路硬解码能力,实现多路视频流 + 图片 + 文本一体化理解,纯本地边缘推理,不上云。


算能 BM1684X 算力盒子新增 Qwen-VL 多模态官方适配,多路视频 + 图文理解一体化(图1)


一、核心硬件底座:BM1684X


INT8 峰值算力:32TOPS,8 核 A53@2.3GHz,典型功耗约 16W


视频硬编解码:32 路 1080P@25fps H.264/H.265 硬解码,12 路 1080P 编码,支持单路 8K 解码;内置 VPU 硬件预处理,多路视频帧截取、缩放、颜色转换硬件加速,不占用 TPU 算力


模型性能:Qwen3-VL 4B 推理可达13.7 tokens/s;8B 版本 7.2 tokens/s,满足边缘实时图文问答、视频帧理解需求


部署方式:Sophon SDK + LLM-TPU 工具链,AIGC-SDK 封装 REST API,一行脚本bash scripts/init_app.sh qwen3vl拉起服务,支持自定义微调模型转 bmodel 部署


二、多模态一体化能力


✅ 多路视频理解:同时接入多路摄像头 / RTSP 流,定时截取视频帧送入 Qwen-VL,支持视频画面描述、异常识别、目标属性问答、场景推理;区别传统 YOLO 检测,可做自然语言交互:“描述第 3 路画面有什么异常”


✅ 图文混合问答:本地图片上传、截图、图纸、表单识别,图文结合问答、OCR + 理解、图表解读


✅ 文本 + 视觉联动:支持指令引导,框选区域识别、视觉定位、内容总结,完整复用 Qwen-VL 原生多模态能力


✅ 私有化本地推理:所有视频流、图片数据在盒子本地完成解码 + 多模态推理,无公网传输,低延迟,适合安防、工地、产线、机房等数据敏感场景


三、典型落地场景


1. 智慧工地 / 明厨亮灶:多路摄像头实时画面大模型理解,识别违规操作、安全帽、烟火、离岗,输出自然语言告警


2. 工业产线质检:多相机画面 + 图纸比对,缺陷描述、尺寸图文问答


3. 机房 / 园区安防:多路视频同时接入,自然语言检索画面内容,事件总结


4. 本地文档 / 图纸智能分析:图纸、票据、现场照片批量图文解析


四、对比优势


1. 视频编解码与多模态大模型同芯片融合:RK3588 等方案 CPU 软解多路视频会抢占大模型算力;BM1684X VPU 独立硬解,TPU 专心跑 Qwen-VL,多路并发稳定性更强


2. 成熟开源工具链:LLM-TPU 持续维护,bmodel 模型转换、量化、性能调优文档齐全,二次开发成本低


3. 功耗可控:单盒十几瓦功耗,无风扇 / 低风扇工业形态可选,适合长期 7×24 小时边缘部署

- END -

家具美容培训

家具维修培训

分享:
留言 留言 试用申请
产品咨询 产品咨询 产品咨询
17340067106(毛经理)
技术咨询 技术咨询 软件算法咨询
18982151213(刘经理)
微信在线客服 微信在线客服 在线客服
返回官网顶部 返回官网顶部 回到顶部
关闭窗口
产品订购
  • *

  • *

  • *

  • *

  • *