分享自:

OSWorld:在真实计算机环境中对多模态代理进行开放式任务基准测试

期刊:Advances in Neural Information Processing Systems

OSWORLD:真实计算机环境中多模态智能体的基准测试

本文介绍了由谢天宝、张丹阳、陈继轩、李晓川、赵思恒等来自香港大学、卡内基梅隆大学、Salesforce Research及滑铁卢大学的研究团队共同完成的研究。该论文作为预印本正处于审稿阶段,其代码、环境和数据已在官方网站 https://os-world.github.io 上公开发布。研究团队推出了 OSWORLD,这是首个可扩展的真实计算机环境,旨在为多模态智能体在开放任务上的测试与开发提供一个统一、交互式的平台。

研究背景与动机

该研究属于多模态人工智能智能体与数字交互的交叉领域。其核心动机在于,虽然基于大型视觉-语言模型(Vision-Language Models, VLMs)的自主智能体有潜力通过遵循自然语言指令来彻底改变人机交互,但该领域的发展长期受困于基准测试的缺失。现有的基准测试要么缺乏可交互的执行环境(如 Mind2Web、GAIA),仅提供静态数据演示;要么将任务范围限制在特定的应用或领域内(如 WebArena 仅限于网页导航,InterCode 仅限于代码)。这些局限性导致开发者无法在多样且复杂的真实计算机使用场景中评估和训练智能体,严重阻碍了通用型数字助手的开发。因此,本研究的目标是填补这一空白,构建一个能够覆盖不同操作系统(Ubuntu、Windows、macOS)、支持自由形态键盘与鼠标操控、并能对涉及任意应用的开放式任务进行基于执行可靠评估的真实环境。

研究工作流程

本研究的工作流程主要分为两大部分:OSWORLD 环境基础设施的构建基准任务集(Benchmark)的创建与评估

第一部分:构建 OSWORLD 真实计算机环境 OSWORLD 是一个以虚拟机(Virtual Machine)技术为核心的可执行、可操控环境,设计上遵循部分可观察马尔可夫决策过程(Partially Observable Markov Decision Process, POMDP)。其构建包含以下关键过程: 1. 环境基础设施设计:研究团队设计了协调器(Coordinator)和任务管理器(Task Manager),通过解析配置文件(Config File)来自动完成虚拟机的创建、状态初始化、交互模拟和评估。配置文件是整个过程的核心,详细规定了任务初始状态的设置(如下载文件、打开软件)、交互完成后的后处理(Post-config,如保存文件、激活窗口)、结果数据的获取(如获取最终表格文件、浏览器Cookie)以及评估函数(Evaluation Function)及其参数。 2. 观测与动作空间定义:环境的观测空间(Observation Space) 包含完整的桌面截图、可访问性树(Accessibility Tree, a11y tree,一种XML格式的界面元素结构化数据),并可提供如终端输出等自定义流。其动作空间(Action Space) 则极为全面,利用 pyautogui 库实现了对所有键盘与鼠标操作的模拟,包括移动、点击(左/右键、多次)、拖拽、按键、组合热键等,并定义了waitfaildone三个特殊操作,允许智能体进行等待、判断任务不可行或完成任务。 3. 基于执行的评估机制:这是该研究的一大方法革新。研究团队没有采用单一指标,而是为每个任务示例人工设计了专属的评估脚本。总共创建了134个独特的评估函数。评估流程包括从虚拟机或云端获取最终状态数据,然后通过专用的评估函数进行比较和判断。例如,检查表格任务是否正确,会使用 compare_table 函数,对表格数据进行模糊匹配。这种评估方式能够可靠地验证任务的函数性正确性(Functional Correctness),并对时间敏感的实时任务(如论文引用数)使用动态爬虫获取真实值进行比对。

第二部分:创建 OSWORLD 基准任务集并进行智能体测试 1. 基准任务集的构建:研究团队耗时超过1800人时,创建了包含 369个基于Ubuntu系统的真实计算机任务 的基准,并额外提供了43个可迁移至Windows系统的任务。任务来源包括官方教程、视频网站、问答论坛、在线课程等,以确保多样性和真实性。任务场景涵盖八类代表性应用及其组合:用于网页浏览的Chrome、媒体播放的VLC、邮件管理的Thunderbird、编程开发的VS Code、办公套件 LibreOffice(Calc, Writer, Impress)、图像编辑的GIMP以及系统自带应用(如终端、文件管理器)。 2. 任务特点与质量控制:369个任务中,单应用任务占268个(72.6%),多应用工作流任务有101个(27.4%),并包含30个(8.1%)由于功能弃用或用户幻觉而无法完成的任务,以测试智能体的判断能力。每个任务都经过精心标注,包含一个初始状态设置配置和自定义的执行评估脚本。为确保质量,每个示例都由两名未参与标注的作者交叉验证其可行性、指令清晰度和来源一致性,并进行了四轮、总计超400小时的检查和修订。 3. 智能体基准测试:研究团队广泛评估了当时最先进的LLM和VLM模型,包括闭源的GPT-4V系列Gemini系列Claude-3 OpusQwen-max,以及开源的MixtralLlama-3CogAgent。实验中设置了四种输入模态:纯可访问性树(a11y tree)、纯截图(Screenshot)、截图加可访问性树、以及在截图上标记元素编号的集合标记法(Set-of-Marks, SoM)。所有智能体在与环境交互最多15步的限制下执行任务。

主要研究结果

研究结果揭示了当前多模态智能体在真实计算机操作中的严重不足。 1. 总体性能低下:在所有测试的模型中,最佳表现来自使用可访问性树输入的 GPT-4,但成功率也仅有 12.24%。相比之下,即使是计算机科学背景但对测试软件不熟悉的人类,也能达到 72.36% 的成功率,两者之间存在巨大鸿沟。值得注意的是,在多应用工作流任务中,表现最好的智能体(GPT-4V with SoM)的成功率也仅为 6.57%。 2. 模型性能的不稳定性:智能体在不同类型任务上的表现差异远大于人类。例如,偏向命令行(CLI)的系统操作类任务(OS类型)表现相对较好,但在依赖图形用户界面(GUI)的办公任务(Libreoffice Calc、Writer)上得分极低,甚至部分模型在办公任务子集上的成功率为零。这种剧烈波动与人类表现(稳定在70%左右)形成鲜明对比。 3. 不同输入模态的有效性各异: * 纯视觉方法挑战巨大:仅使用截图的GPT-4V成功率仅为5.26%,说明当前的VLM在从高分辨率图像中进行精确坐标定位和GUI元素理解方面能力有限。 * 文本信息作用关键但效果不一:a11y树的加入对部分模型(如GPT-4V)提升显著(从5.26%升至12.17%),但对另一些模型(如Gemini-pro-vision)则效果不佳。SoM标记法在GPT-4V上从纯截图表现提升至11.77%,但与截图+a11y树的设置相比反而下降,这可能是由于桌面环境元素过多且密集,导致标记框和编号产生大量噪声,干扰了模型判断。 4. 影响因素分析: * 分辨率影响:提高输入截图的原始分辨率直接提升纯截图设置的性能,但SoM方法在降至0.4倍原始分辨率时表现最佳,提示盲目的高分辨率并非对所有方法都有效。 * 历史上下文影响:在SoM设置下,提供更多轮的交互历史(文本形式)可以持续提升性能,但在纯截图设置下,增加图像形式的历史记录并未带来增益,表明当前VLM在理解图像序列上下文方面存在严重缺陷。 * 对窗口扰动的脆弱性:对应用窗口的位置、大小进行微扰,或引入不相关的杂乱窗口,会导致已见任务性能下降高达60%-80%,暴露出智能体在GUI操作知识和环境抗噪能力上的短板。

结论与价值

研究得出结论,当前的LLM和VLM距离成为合格的计算机助手仍有显著差距。智能体的主要失败模式在于:GUI视觉定位能力弱(如频繁的鼠标点击偏移,这是超过75%失败样本中的主要错误)、缺乏软件操作的基本常识(如不知道在GIMP中如何调整亮度)、重复操作与环境噪声困境(误点击产生弹窗后无法恢复)。

OSWORLD 的研究价值体现在以下方面: * 科学价值:首次提供了一个可统一、可扩展、支持跨应用工作流的真实交互式环境与基准,填补了领域内的一大空白。其细粒度的、基于执行的评估体系(134个独特评估函数)为通用型数字智能体的能力评估设立了新的标准。 * 应用价值:该研究为开发能够覆盖医疗、教育、工业设计等更广泛计算机任务的通用智能体指明了方向。分析所得出的关于分辨率、历史编码、GUI定位等核心挑战,为未来的模型增强和算法设计提供了具体方向,例如要着力提升VLM的精确坐标预测能力和注入交互常识知识。 * 重要观点:研究明确提出,尽管依赖a11y树等额外信息在短期内能提升性能,但纯视觉交互才是更本质、更具泛化潜力的长期目标,这为领域发展提供了清晰的路线图。

研究亮点

  1. 首创性环境:OSWORLD 是首个统一的、基于真实计算机环境的可扩展平台,支持任务配置、交互式学习和基于执行的评估。
  2. 突破性基准:369个任务基准覆盖了广泛的操作系统和应用组合,特别是包含27.4%的多应用工作流任务,极大地提升了任务的真实性与复杂度。
  3. 精细化的评估方法:通过投入巨大的人力,为每个任务定制了基于执行的评估脚本,首次实现了对开放式计算机任务的可靠、可复现评估。
  4. 深刻的分析洞察:通过综合性消融实验和定性分析,首次系统性地揭示了当前顶尖VLM在GUI交互中的局限性和行为逻辑,尤其是指出了“规划强但执行弱”、“历史图像信息利用低效”等关键短板,为后续研究提供了宝贵的线索。
上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com