模型

Qwen: Qwen2.5 VL 72B Instruct

仅 API 开源
阿里通义千问 · Tongyi Qianwen License · 72B · 上下文 128K
能做什么
OCR识别长文档分析逻辑推理多模态理解Agent工作流
部署门槛
多卡
≥ 48GB
上下文
128K
token 窗口
参数
72B

01基础参数

参数规模
72B
上下文窗口
128K
输入模态
image / text
可生成
text
模型系列
开源许可
Tongyi Qianwen License
主要语言
zh

02部署门槛详情

硬件等级 多卡 · 最低显存 48GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要高精度多模态理解的复杂任务、文档密集型的自动化处理流程、长视频内容分析与事件捕捉、视觉Agent与GUI自动化场景
✗ 不适用
显存受限的单卡消费级环境、对实时性要求极高的轻量级应用、纯文本场景(模型能力过剩)

05部署与限制

⚙ 本地部署建议
72B模型全精度(BF16)加载约需144GB显存;推荐使用AWQ 4-bit量化(约36GB显存) 或GGUF Q4_K_M量化(约49GB)进行本地部署。建议使用多卡并行(如2×A100)或搭配vLLM框架。消费级单卡(如RTX 4090 24GB)难以承载,需使用量化+多卡方案或通过API调用。
⚠ 已知限制
72B版本对月活跃用户超过1亿的开发者不免费开放商业使用;全精度部署显存要求极高;模型文件约144GB;视觉编码器采用窗口注意力机制,在处理极高分辨率图像时可能影响细节捕捉精度。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Qwen2.5-VL-72B-Instruct 是阿里巴巴通义千问团队于 2025 年 1 月发布的旗舰级视觉-语言模型。作为 Qwen2.5-VL 系列中参数规模最大的版本(72B),它在上一代 Qwen2-VL 的基础上实现了多项关键增强:视觉理解能力大幅提升,不仅能识别常见物体,还能深度分析图像中的文本、图表、图标、图形和布局;模型直接作为视觉 Agent 运行,可进行推理并动态调用工具,支持计算机和手机操作;可理解超过 1 小时的长视频并精准定位相关事件;支持通过生成边界框或点进行精确的视觉定位,并输出稳定的 JSON 格式坐标与属性;同时支持发票、表格等扫描件的结构化内容输出。

该模型采用密集架构,视觉编码器基于 ViT 并引入窗口注意力机制,配合 SwiGLU 和 RMSNorm 优化。模型上下文长度为 128K,支持图像和文本输入、文本输出。在 DocVQA 上取得 96.40 分,MMMU 得分 70.20。模型采用 Qwen LICENSE AGREEMENT(通义千问研究许可协议),72B 版本对月活跃用户少于 1 亿的开发者免费。适用于文档理解、视觉问答、长视频分析、视觉 Agent 等复杂多模态场景。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Parasail0.81.0fp8128K

代表价(满血最低):Parasail 输入 0.8 / 输出 1.0 USD/1M(量化版,另有满血版见上表)。按 provider 选择可进一步降本。

07官方资源

08同类模型