UI-TARS-1.5-7B 是字节跳动研究团队于 2025 年 4 月开源的新一代原生 GUI 代理模型。它基于 Qwen VL 推理模型微调而来,将感知、推理、定位与记忆等关键能力集成于单一视觉语言模型(VLM)中,旨在实现端到端的图形界面任务自动化,无需预设工作流或人工规则。该模型支持 128K 上下文,可接受文本和图像输入,输出文本形式的操作指令。
UI-TARS 在计算机与浏览器操作基准测试中展现了优秀性能,例如在 OSWorld(100步)上达到 42.5% 的得分,在 WebVoyager 上达到 84.8%。其 GUI 定位能力在 ScreenSpot-V2 基准上达到 94.2%,在更具挑战性的 ScreenSpotPro 上达到 61.6%。它适用于计算机与浏览器自动化、GUI 智能代理任务,以及游戏场景中的视觉与操作任务。需要注意的是,该模型为视觉语言模型,其核心能力依赖图像理解,并非通用纯文本模型。