AI能否像人一样,看到屏幕后知道该点哪里?全球“最难考”的GUI定位基准榜单更新,杭企包揽冠亚军

杭州日报 2026-09-10 16:34:00 5281阅
记者 蔡杨洋

日前,全球公认“最难考”的GUI(Graphical User Interface)定位基准ScreenSpot-Pro榜单更新。实在智能的大模型Indeed-UI-32B,以82.7%的任务成功率排名全球第一;Indeed-UI-8B,以81%的成绩紧随其后,位列全球第二,且在同参数量级模型中位列第一。

ScreenSpot-Pro由新加坡国立大学、华东师范大学、香港浸会大学等高校联合研究团队提出,已入选Hugging Face官方基准测试体系,是全行业公认的GUI Grounding能力评估标准。它考察的核心问题是,AI能不能像人一样,在复杂的软件界面中,精准找到并定位到该点击的按钮、菜单或输入框。

打个比方,如果说“在Photoshop中批量导出多张设计稿”是一项完整任务,那ScreenSpot-Pro考的是模型能不能准确找到“导出图层”的按钮。

根据ScreenSpot-Pro官方榜单,Indeed-UI-32B在办公软件测试中取得了93%的平均成绩,在开发与编程类软件测试中更是达到97.6%。Indeed-UI-8B在同参数量级模型中位列第一,超越了包括更大参数规模在内的多个竞品。值得关注的是,在2025年基准发布时,全球顶尖模型的任务成功率不到20%。一年后的现在,实在智能把分数推到了82.7%。

这意味着实在智能不仅在绝对性能上登顶,而且在效率维度上展现出优势——以更小参数实现高精度,为企业低成本部署提供了切实可行的路径。

在ScreenSpot-Pro登顶,证明的是AI“看得准”的能力。但在企业真实场景中,“看得准”只是起点。此前,实在智能已在OSWorld上取得全球第一。ScreenSpot-Pro考的是“看得准”,那OSWorld考的就是“做得完”。两个榜单,一个指向GUI定位,一个指向端到端任务执行。接连登顶,说明实在智能在AI操作电脑的核心链路上,已经形成从感知到执行的体系化能力。

“从OSWorld全球第一到ScreenSpot-Pro包揽冠亚军,我们的目标从来不是榜单排名。”实在智能相关负责人表示,实在智能希望让每一家企业都能拥有一支“看得准、做得稳、跑得通”的数字员工团队,让AI自动化成为企业基础设施级的能力。


责任编辑:赵文浩
审核:吴静 骆剑伟 校对 姚敏
评论
我要参与评论