模型

ByteDance: UI-TARS 7B

仅本地 开源 可商用
— · Apache-2.0 · 7B · 上下文 128K
能做什么
计算机操控多模态理解聊天问答Agent工作流
部署门槛
消费级 8-12G
≥ 8GB
上下文
128K
token 窗口
参数
7B

01基础参数

参数规模
7B
上下文窗口
128K
输入模态
text / image
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
en

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 8GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
计算机与浏览器自动化操作、图形界面智能代理任务、游戏场景中的视觉与操作任务
✗ 不适用
纯文本对话(视觉能力是核心)、传统RAG或长文档分析

05部署与限制

⚙ 本地部署建议
建议本地部署使用量化版本以降低显存需求。根据社区反馈,F16版本可能需要约20GB显存,Q4_K_M等量化可将显存需求降至4-5GB左右。可使用LM Studio或llama.cpp进行本地推理。
⚠ 已知限制
作为GUI代理模型,其设计目标并非通用文本模型。在多模态能力方面,对模糊或陌生环境的元素识别和推理仍有提升空间。7B版本在游戏场景优化上不如完整版1.5模型。

06详细介绍

UI-TARS-1.5-7B 是字节跳动研究团队于 2025 年 4 月开源的新一代原生 GUI 代理模型。它基于 Qwen VL 推理模型微调而来,将感知、推理、定位与记忆等关键能力集成于单一视觉语言模型(VLM)中,旨在实现端到端的图形界面任务自动化,无需预设工作流或人工规则。该模型支持 128K 上下文,可接受文本和图像输入,输出文本形式的操作指令。

UI-TARS 在计算机与浏览器操作基准测试中展现了优秀性能,例如在 OSWorld(100步)上达到 42.5% 的得分,在 WebVoyager 上达到 84.8%。其 GUI 定位能力在 ScreenSpot-V2 基准上达到 94.2%,在更具挑战性的 ScreenSpotPro 上达到 61.6%。它适用于计算机与浏览器自动化、GUI 智能代理任务,以及游戏场景中的视觉与操作任务。需要注意的是,该模型为视觉语言模型,其核心能力依赖图像理解,并非通用纯文本模型。

07官方资源

08同类模型