9 月 9 日晚,我看到 ScreenSpot-Pro 榜单更新的截图,第一反应是:8B 模型 81%?点开一看,Indeed-UI-8B 排在第二,仅次于自家 32B 版本。它身后是微软 GUI-Actor、GPT-5、Claude、Qwen。作为一个在本地折腾过多个 GUI Agent 的开发者,我立刻去 ModelScope 拉了这个模型。这篇文章,就是我的技术拆解和实测感受。
一、榜单背景:这个第二名的含金量
先交代事实:2026 年 9 月 9 日,ScreenSpot-Pro 更新,实在智能开源的 Indeed-UI-32B(82.7%)与 Indeed-UI-8B(81%)包揽全球冠亚军。
ScreenSpot-Pro 不是自办考试,几个硬指标:
- 由新加坡国立大学、华东师范大学、香港浸会大学联合发布
- 论文被 ACM Multimedia 2025(CCF A 类)收录
- 已入选 Hugging Face 官方基准测试体系
- 26 款真实专业应用,Windows / macOS / Linux 三平台,1581 条专家标注指令
- 整屏高分辨率截图,目标元素平均面积占比仅 0.07%
同榜竞品包括微软 GUI-Actor、GPT-5、Claude、Qwen。在这个榜单上拿第二,含金量不需要自证。
二、技术拆解:8B 凭什么越级
基座:GUI-Owl 1.5
Indeed-UI 并非从零训练,它构建在 GUI-Owl 1.5 之上——阿里通义 mPLUG 团队开源的 GUI Agent 基座,基于 Qwen3-VL,支持 instruct / thinking 双变体。
ModelScope 模型卡片显示:8.77B 参数,BF16,qwen3_vl 架构。BF16 下显存约 18GB,一张 RTX 4090 就能跑;4-bit 量化后压到 6-7GB,RTX 4060 Ti 也能推理。
训练:混合数据飞轮 + GRPO
实在智能在基座上做了三层训练:
- 开源数据打底:建立基础定位能力。
- 混合数据飞轮:开源数据 + 合成高分辨率数据,在模拟/云沙箱中自动生成交互轨迹,每轮用当前模型表现指导下一轮数据生成,专攻薄弱场景。
- 多平台 GRPO:奖励信号来自多平台 GUI 环境。GRPO 省去价值网络,组内相对比较,在稀疏奖励的 GUI 任务中更稳定。
另有 Unified Agent Enhancement 机制,保证跨平台行为一致性。
推理:Zoom-In 两阶段定位
这是 8B 越级的关键。看 ModelScope 基准数据:
| 基准 | 得分 |
|---|---|
| ScreenSpot-Pro | 73.4 |
| ScreenSpot-Pro (Zoom-In) | 81.0 |
| ScreenSpot-V2 | 94.4 |
| OSWorld-G | 68.3 |
Zoom-In 带来 7.6 个百分点提升。逻辑是“由粗到细”:第一阶段在整屏截图上给出候选区域,第二阶段裁剪后二次精定位。8B 模型不需要在单次前向中同时处理“全图理解”和“像素级定位”,计算资源集中在候选区域的高分辨率细节上。
GitHub 提供了专门脚本 eval_sspro_zoomin_hf_dp.py,支持多卡分布式推理。
三、数据对比:8B 的真实位置
| 模型 | 参数规模 | ScreenSpot-Pro (Zoom-In) |
|---|---|---|
| Indeed-UI-32B | 32B | 82.7 |
| Indeed-UI-8B | 8.77B | 81.0 |
| 金智维 KV-Ground-8B | 8B | 80.5 |
| Claude Opus 4.8 (w/ tools) | 未公开 | 87.9 |
| GPT-5.4 | 未公开 | 85.4 |
| Qwen3.8 Max | 未公开 | 84.5 |
结论很直接:GUI Grounding 任务上,参数量的边际收益已经显著递减。从 8B 到 32B,绝对分数提升不到 2 个百分点;但从“不可用”到“可用”的跨越,8B 级别已经完成。
四、实在智能的落地视角:8B 为什么重要
技术指标之外,8B 解决的是部署经济学问题。
- 硬件门槛:BF16 约 18GB 显存,单张 RTX 4090 可跑;4-bit 量化后 6-7GB,中端显卡即可。万元级工作站达到可用精度。
- 数据安全:完全本地部署,屏幕语义理解、操作执行全部在内网完成。敏感数据不出服务器。
- 老旧系统:企业真实链路中大量无 API、无文档的 C/S 架构软件(20 年前的 MES、十年前的 ERP 客户端),AI 直接模拟键鼠操作,像人一样“硬控”界面。
- 长链路稳定:遇到弹窗、改版、限流,自主重试、切换兜底路径,不“一卡就死”。
实在智能的 Harness 工程底座负责模拟鼠标键盘,Indeed-UI 负责“看懂界面并定位元素”,两者配合打通企业全链路。
五、快速上手:开源地址与评测
- ModelScope:
https://www.modelscope.cn/models/IntellgenceIndeed/Indeed-UI-8B - GitHub:
https://github.com/intelligence-indeed/Indeed-UI
一键评测:
pip install -r requirements.txt
bash run_eval_sspro.sh
手动分步:
# Step 1: 基础评测
torchrun --nproc_per_node=8 --master_port=29502 \
eval_sspro_hf_dp.py \
--model_dir /path/to/Indeed-UI-8B \
--data_dir /path/to/ScreenSpot-Pro \
--output_dir ./Indeed-UI-8B
# Step 2: Zoom-In 增强评测
torchrun --nproc_per_node=8 --master_port=29502 \
eval_sspro_zoomin_hf_dp.py \
--model_dir /path/to/Indeed-UI-8B \
--data_dir /path/to/ScreenSpot-Pro \
--output_dir ./Indeed-UI-8B-Zoomin \
--step1_output_dir ./Indeed-UI-8B
在 run_eval_sspro.sh 中配置模型路径、数据集路径、输出路径即可。
六、我的总结
Indeed-UI 8B 在 ScreenSpot-Pro 上拿到 81%,技术贡献可以归结为三点:
- 成熟基座:GUI-Owl 1.5 / Qwen3-VL 提供扎实的视觉语言底子。
- 数据质量:混合数据飞轮持续补齐高分辨率专业场景。
- 推理策略:Zoom-In 两阶段定位,把计算花在刀刃上。
它证明了一件事:在 GUI Grounding 这个任务上,“小模型 + 好数据 + 好推理策略”的路径已经跑通。屏幕定位只是 Agent 执行链路的第一环,但当这一环从“大厂专属”变成“一张显卡就能跑”,后续的规划、执行、纠错才有了规模化的可能。我已经把 8B 模型挂到本地工作流里试跑,后续会继续分享实际场景的踩坑记录。
参考内容
- ModelScope 模型页:www.modelscope.cn/models/Inte…
- GitHub 仓库:github.com/intelligenc…