来源:OpenRouter API(scraper 采集,2026-06-30)
Qwen2.5-VL-72B-Instruct 是阿里巴巴通义千问团队于 2025 年 1 月发布的旗舰级视觉-语言模型。作为 Qwen2.5-VL 系列中参数规模最大的版本(72B),它在上一代 Qwen2-VL 的基础上实现了多项关键增强:视觉理解能力大幅提升,不仅能识别常见物体,还能深度分析图像中的文本、图表、图标、图形和布局;模型直接作为视觉 Agent 运行,可进行推理并动态调用工具,支持计算机和手机操作;可理解超过 1 小时的长视频并精准定位相关事件;支持通过生成边界框或点进行精确的视觉定位,并输出稳定的 JSON 格式坐标与属性;同时支持发票、表格等扫描件的结构化内容输出。
该模型采用密集架构,视觉编码器基于 ViT 并引入窗口注意力机制,配合 SwiGLU 和 RMSNorm 优化。模型上下文长度为 128K,支持图像和文本输入、文本输出。在 DocVQA 上取得 96.40 分,MMMU 得分 70.20。模型采用 Qwen LICENSE AGREEMENT(通义千问研究许可协议),72B 版本对月活跃用户少于 1 亿的开发者免费。适用于文档理解、视觉问答、长视频分析、视觉 Agent 等复杂多模态场景。
OpenRouter Provider 比价
共 1 家 provider(2026-06-30 采集),按输入价升序:
| Provider | 输入(USD/1M) | 输出(USD/1M) | 量化 | 上下文 |
|---|---|---|---|---|
| Parasail | 0.8 | 1.0 | fp8 | 128K |
代表价(满血最低):Parasail 输入 0.8 / 输出 1.0 USD/1M(量化版,另有满血版见上表)。按 provider 选择可进一步降本。