全球AI智能体领域迎来重大突破——中国团队研发的“实在Agent”以90.2%的任务成功率登顶OSWorld权威榜单,成为首个突破90%大关的智能体,同时包揽总榜与Agentic framework分榜双料冠军。这一成绩刷新了meta、Anthropic、OpenAI等海外科技巨头保持的公开纪录,标志着中国在计算机使用型智能体领域实现全球领跑。
OSWorld被誉为AI智能体的“计算机驾驶执照考试”,由香港大学、卡内基梅隆大学等机构于2024年提出。该基准测试要求智能体在真实操作系统环境中,通过鼠标、键盘等交互方式完成跨应用复杂任务,涵盖办公、编程、UI设计等361个实战场景。与传统网页或API调用测试不同,OSWorld提供完整桌面沙盒环境,任务完成度由机器自动判定,避免人工评价偏差,成为全球公认的权威标准。各大科技巨头发布旗舰模型时均以OSWorld成绩为重要参考,此前最高纪录为2026年5月Pointer智能体创造的83.6%。
实在Agent的登顶之路堪称“技术跃迁”。2024年基准发布时,GPT-4o等顶级模型成功率仅12.2%;2025年UI-Evol增强智能体提升至22.0%;同年12月Simular Agent S2以72.6%首次超越人类基线;2026年Pointer将纪录推至83.6%。而实在Agent在短短两个月后便以90.2%的成绩实现质的飞跃,将计算机使用型智能体带入“超高可靠性”新阶段。
深入分析实在Agent的325.59分(总成功率90.2%)构成,其技术优势呈现“全面领先+核心突破”特征:在常用办公场景中,LibreOffice表格处理获46.0/47分,VS Code编程达22.0/23分;核心难点场景表现更为突出——跨应用协同任务(如“Chrome下载→LibreOffice编辑→截图存档→邮件发送”四步长链路)以78.81分领先第二名近10个百分点;图像处理软件GIMP的26个像素级微操任务中拿下24个(成功率92.3%);系统底层操作(文件权限修改、进程管理等)更以24.0/24的满分展现绝对稳定性。这些数据印证了实在Agent在长链路规划、非标准界面理解、执行闭环可靠性三大维度的综合优势。
登顶背后是八年技术沉淀与工程化突破。智能体领域存在“Agent=Model+Harness”的共识——模型提供基础智力,而Harness工程体系(类似汽车的方向盘与安全系统)决定智力能否转化为可靠行动。斯坦福大学等机构研究表明,在相同模型基础上,Harness优化可使OSWorld性能提升6-10个百分点,某些复杂任务中甚至能将得分从30.4%跃升至47.2%。实在智能自2018年成立便聚焦“多模态Harness”能力,通过API与GUI混合交互方式,像人类一样处理屏幕信息与鼠标操作,这种技术路线为其积累了独特优势。
企业级场景的深度耕耘更是关键。作为服务超6000家客户的自动化领域领军企业,实在智能积累了海量真实桌面操作数据、异常处理机制和行业流程模板。这些数据反哺Harness工程迭代,形成“行业Know-how+真实数据+工程体系”的闭环。例如,在金融、制造等领域的部署中,实在Agent已能自主处理90%的常规操作,并在涉及高风险操作时触发人机协同确认机制,确保绝对安全。
从基准测试到产业落地仍需跨越三重门槛:将可靠性从90.2%提升至工业级99.99%,以避免财务、供应链等场景中的业务风险;增强抗干扰能力,应对软件更新、弹窗干扰等真实环境挑战;优化商业ROI,通过端侧轻量模型与云端混合调度降低运行成本,同时构建符合企业安全标准的沙盒环境与审计日志。实在智能正通过“操作撤销与回滚”“动态环境自适应”等技术攻关,推动智能体从“能干活”向“可靠干活”进化。
OSWorld的登顶不仅是中国团队的胜利,更预示AI技术形态的深刻变革——当智能体摆脱“对话框”限制,真正接管屏幕与软件系统,数字劳动力的时代正在到来。实在智能八年坚守的自动化技术底座,正在为这场变革提供核心支撑。
