从12.2%到90.2%:Computer-Use Agent两年跃迁之路

从12.2%到90.2%:Computer-Use Agent两年跃迁之路 2026年7月实在Agent以90.2%的成功率登顶OSWorld全球榜单成为该基准发布以来首个突破90%大关的计算机使用智能体。回顾过去两年这条从12.24%到90.2%的曲线勾勒出一条极为陡峭的技术跃迁轨迹——其速度被业界称为“智能体评估领域有记录以来最快的能力提升之一”。从几乎无法完成任何电脑操作到超越人类水平、再到逼近“超人类”高度Computer-Use Agent走完了其他AI领域可能需要五年甚至十年才能走完的路。起点2024年AI还“不会用电脑”2024年OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构联合发布发表于人工智能顶级会议NeurIPS。这是全球首个让AI在真实操作系统Ubuntu、Windows中操作原生软件——Chrome、VS Code、LibreOffice、GIMP等——来完成开放式任务的基准。每个任务都配有自动校验脚本做对做错由机器判定没有任何人工评价的偏差。OSWorld的发布揭示了一个令人震惊的现实人类用户可以完成72.36%的任务而当时最强的模型-智能体配置成功率仅为12.24%。论文将失败的主因归结为四个方面GUI定位不准确操作知识不足长链路规划薄弱错误恢复能力欠缺彼时就连刚刚发布Computer Use功能的Claude 3.5 Sonnet在OSWorld上的得分也只有14.9%。AI会聊天、会写诗但面对真实的电脑屏幕它几乎是个“电脑盲”。破局2025年从“看不懂”到“勉强能用”2025年行业开始系统地解决“AI看不懂屏幕”的问题。视觉语言模型VLM的进步让智能体对图形界面的理解能力大幅提升研究者开始探索如何将大模型的推理能力转化为精准的鼠标和键盘操作。UI-Evol动态界面理解的突破2025年5月微软亚洲研究院提出的UI-Evol是一个重要信号。这个即用型组件让智能体不再依赖静态的外部知识而是从真实的软件界面中获取动态指导持续更新对界面的理解。在OSWorld基准上UI-Evol以同等基础模型刷新了最高成功率。从12.24%到22.0%虽然绝对数字仍不高但标志着智能体从“完全不会”走向了“勉强能做”。基准进化OSWorld-Verified建立公平赛场2025年7月XLANG Lab发布了OSWorld-Verified。这个升级版修复了超过300个社区反馈的问题——网页DOM变化、验证码、IP封禁、指令模糊等——并将基础设施从VMware/Docker迁移到AWS云平台支持大规模并行评估评估时间从10小时以上缩短至1小时以内。更重要的是Verified设立了官方评估平台要求所有上榜结果必须通过该平台运行并公开代码与操作轨迹。从此OSWorld成为一个真正“苹果对苹果”的公平比较平台。质变2025年底首次超越人类2025年12月成为Computer-Use Agent发展史上最重要的转折点之一。Agent S2组合式架构的胜利Simular公司宣布其Agent S2框架在OSWorld上达到72.6%的成功率首次超越了72.36%的人类基线。从12.24%到72.6%AI只用了不到20个月。Agent S2的核心思路是“组合式通用-专家框架”——让不同的专家模块分别处理不同类型的任务再通过通用模块进行协调。这种架构上的创新证明了智能体的能力提升不仅来自模型本身的进化也来自工程框架的优化。多条技术路线同时逼近同期多个研究团队通过不同的技术路径逼近了这一水平。有研究利用多次尝试multiple rollouts和专门的评判机制同样在OSWorld上达到了72.6%的成绩。多条技术路线同时超越人类基线说明Computer-Use Agent的底层能力已经跨越了一个关键阈值——它不是某一家公司的偶然突破而是整个技术生态走向成熟的标志。登顶2026年从超越到领跑进入2026年OSWorld榜单的竞争进入了白热化阶段。各路人马轮番刷新1月UiPath Screen Agent基于Claude Opus 4.5在OSWorld-Verified基准上获得排名第一。3月GPT-5.4取得了75.0%的成功率。4月Claude Opus 4.7在Verified榜单上达到78.0%超过了此前19个月未曾被动摇的人类基线。Pointer的83.6%与实在Agent的90.2%2026年5月Pointer以83.6%的成功率再创新高。从72%到83%这11个百分点的跨越仅用了不到半年。而2026年7月实在Agent以90.2%登顶将纪录推向了新的高度。更重要的是实在Agent同时拿下了Agentic Framework分榜第一证明了其在Harness工程化上的系统性优势。三大技术主线驱动能力跃升回顾两年的能力跃迁三条技术主线清晰可见视觉理解能力的跃升从2024年连按钮都找不到到2026年能在GIMP这种充满浮动面板和非标准工具栏的复杂界面中完成像素级操作视觉语言模型的进步是底层驱动力。智能体对屏幕的理解从“看见”升级为“看懂”。长链路规划的突破早期智能体只能处理单步或两步的简单任务面对跨应用协同如Chrome下载→LibreOffice编辑→Thunderbird发送几乎束手无策。到2026年以实在Agent在93个跨应用任务中获得78.81分为代表智能体已经能够在四五个软件之间连续穿梭、稳定完成数十步的操作链路。Harness工程的成熟智能体 模型 Harness。当模型能力逐渐同质化Harness工程化成为拉开差距的关键变量。斯坦福、清华等机构的研究证明在固定同一底层模型的前提下仅改进Harness工程设计即可带来6-10个百分点的性能差距。实在Agent的登顶本质上是八年自动化领域深耕积累的Harness工程能力的集中兑现。结语旧考场接近终点新赛道已经开启从12.24%到90.2%Computer-Use Agent用两年时间完成了从“电脑盲”到“电脑高手”的蜕变。这背后是视觉语言模型的进步、智能体架构的创新、以及Harness工程化打磨三者共同驱动的结果。但90.2%也提醒我们旧基准上的成绩趋于饱和时衡量标准的升级便势在必行。行业已经意识到短任务基准无法反映智能体在真实工作场景中的价值。真正的考验在于当任务从“两分钟短跑”变成“一下午的长征”当操作从单应用拓展到跨系统协同当环境从干净的虚拟机变成充满弹窗和版本变化的真实桌面——智能体还能不能保持同样高的完成率90.2%是一份漂亮的里程碑答卷但它绝非终点。从“考高分”到“真顶用”从实验室到企业生产环境Computer-Use Agent的下半场才刚刚开始。