昨天字节开源多模态智能体 UI-TARS-1.5,这是一款基于视觉-语言模型构建的开源多模态智能体,能够在虚拟世界中高效执行各类任务。
Website:https://seed-tars.com/
UI-TARS-1.5 的技术亮点十分显著。它建立在上一代原生 GUI 智能体的基础之上,通过引入强化学习机制,对高阶推理能力进行了针对性优化。新增的 “行动前思考” 功能,让模型能够在面对复杂任务时,预先对多步骤任务决策进行规划,大幅提升执行的精准度与合理性 。

整合强化学习能力
UI-TARS 是一个原生 GUI 智能体,具备真实操作电脑和手机系统的能力,同时,还可操控浏览器、完成复杂交互任务。
在 7 项典型 GUI 使用能力的评估结果:

在 1.5 版本中,模型在 GUIGrounding能力上有显著进步,这是 UI-TARS-1.5 能够完成各式复杂任务的重要基础。尤其是在高难度的 ScreenSpotPro 上,UI-TARS-1.5 的准确率为61.6%,超过 Claude 的 27.7%、CUA 的 23.4%,以及此前领域最优模型的 43.6%。

UI-TARS-1.5 在推理过程中表现出随交互轮数提升而持续增强的趋势(Inference-time Scaling),即使用越多越聪明。其稳定性与泛化能力在长程任务中更为突出。

游戏中的长时推理和 Minecraft 中的开放式交互能力
UI-TARS-1.5 在游戏任务中呈现出稳定的推断时扩展性。

UI-TARS-1.5 的推断时拓展能力
在开放环境《我的世界》游戏中评估了 UI-TARS-1.5 的能力。不同于静态 GUI 评测,Minecraft 要求模型在动态三维空间中基于视觉输入进行实时决策操作。
本次采用 MineRL(v1.16.5) 标准评测任务,比较了 UI-TARS-1.5 与 OpenAI VPT、DeepMind DreamerV3、JARVIS-VLA 等主流智能体在两个任务中的表现:
Mine Blocks:寻找并破坏特定方块
Kill Mobs:搜索并击败敌对生物
所有模型均在相同条件下运行:仅使用视觉输入(无状态信息)、原生键鼠操作、第一人称视角。

UI-TARS-1.5 在 MineRL 中的测评表现
UI-TARS-1.5 在两个任务中均取得最高成功率,特别是在启用“思考模块”后表现更加突出,验证了“思考-再行动”机制的有效性。
同样地,UI-TARS-1.5 在 Minecraft 中也展现出良好的扩展趋势:随着交互轮次的增加,模型的任务完成效果持续提升。它能够在交互过程中不断优化自身策略,并利用以往经验指导后续决策。

UI-TARS-1.5 在 Minecraft 中的拓展能力
总 结
从技术实现的维度来看,团队通过四大关键策略实现了能力的全面升级 。
视觉感知增强:依托大规模的界面截图数据,UI-TARS-1.5 能够深入理解界面元素的语义,对各类元素形成精准描述。例如,在复杂的软件操作界面中,它能快速识别不同功能按钮的含义,为后续操作奠定基础 。
构建跨平台标准动作空间:这一举措有效提升了模型在不同平台上的执行精度。无论是电脑系统、手机系统,还是浏览器交互,它都能根据统一的标准动作空间,流畅且准确地完成操作,打破了平台差异带来的限制 。
采用 System 2 推理机制:该机制促使模型在处理任务时生成连贯的思维链,面对复杂问题,能够有条不紊地进行逻辑推导,提升任务处理的连贯性与逻辑性 。
建立自动化交互轨迹采集与反思训练范式:借助这一范式,UI-TARS-1.5 能够实现持续优化。在执行任务的过程中,自动采集交互轨迹,对错误进行反思学习,不断调整自身策略,以更好地适应复杂多变的环境 。
