8B 参数越级打赢大模型:Indeed-UI 的轻量化 GUI 定位技术方案解析

17 阅读5分钟

9 月 9 日晚,我看到 ScreenSpot-Pro 榜单更新的截图,第一反应是:8B 模型 81%?点开一看,Indeed-UI-8B 排在第二,仅次于自家 32B 版本。它身后是微软 GUI-Actor、GPT-5、Claude、Qwen。作为一个在本地折腾过多个 GUI Agent 的开发者,我立刻去 ModelScope 拉了这个模型。这篇文章,就是我的技术拆解和实测感受。


一、榜单背景:这个第二名的含金量

先交代事实:2026 年 9 月 9 日,ScreenSpot-Pro 更新,实在智能开源的 Indeed-UI-32B(82.7%)与 Indeed-UI-8B(81%)包揽全球冠亚军。

ScreenSpot-Pro 不是自办考试,几个硬指标:

  • 由新加坡国立大学、华东师范大学、香港浸会大学联合发布
  • 论文被 ACM Multimedia 2025(CCF A 类)收录
  • 已入选 Hugging Face 官方基准测试体系
  • 26 款真实专业应用,Windows / macOS / Linux 三平台,1581 条专家标注指令
  • 整屏高分辨率截图,目标元素平均面积占比仅 0.07%

同榜竞品包括微软 GUI-Actor、GPT-5、Claude、Qwen。在这个榜单上拿第二,含金量不需要自证。

11.png

二、技术拆解:8B 凭什么越级

基座:GUI-Owl 1.5

Indeed-UI 并非从零训练,它构建在 GUI-Owl 1.5 之上——阿里通义 mPLUG 团队开源的 GUI Agent 基座,基于 Qwen3-VL,支持 instruct / thinking 双变体。

ModelScope 模型卡片显示:8.77B 参数,BF16,qwen3_vl 架构。BF16 下显存约 18GB,一张 RTX 4090 就能跑;4-bit 量化后压到 6-7GB,RTX 4060 Ti 也能推理。

训练:混合数据飞轮 + GRPO

实在智能在基座上做了三层训练:

  1. 开源数据打底:建立基础定位能力。
  2. 混合数据飞轮:开源数据 + 合成高分辨率数据,在模拟/云沙箱中自动生成交互轨迹,每轮用当前模型表现指导下一轮数据生成,专攻薄弱场景。
  3. 多平台 GRPO:奖励信号来自多平台 GUI 环境。GRPO 省去价值网络,组内相对比较,在稀疏奖励的 GUI 任务中更稳定。

另有 Unified Agent Enhancement 机制,保证跨平台行为一致性。

推理:Zoom-In 两阶段定位

这是 8B 越级的关键。看 ModelScope 基准数据:

基准得分
ScreenSpot-Pro73.4
ScreenSpot-Pro (Zoom-In)81.0
ScreenSpot-V294.4
OSWorld-G68.3

Zoom-In 带来 7.6 个百分点提升。逻辑是“由粗到细”:第一阶段在整屏截图上给出候选区域,第二阶段裁剪后二次精定位。8B 模型不需要在单次前向中同时处理“全图理解”和“像素级定位”,计算资源集中在候选区域的高分辨率细节上。

GitHub 提供了专门脚本 eval_sspro_zoomin_hf_dp.py,支持多卡分布式推理。


三、数据对比:8B 的真实位置

模型参数规模ScreenSpot-Pro (Zoom-In)
Indeed-UI-32B32B82.7
Indeed-UI-8B8.77B81.0
金智维 KV-Ground-8B8B80.5
Claude Opus 4.8 (w/ tools)未公开87.9
GPT-5.4未公开85.4
Qwen3.8 Max未公开84.5

结论很直接:GUI Grounding 任务上,参数量的边际收益已经显著递减。从 8B 到 32B,绝对分数提升不到 2 个百分点;但从“不可用”到“可用”的跨越,8B 级别已经完成。


四、实在智能的落地视角:8B 为什么重要

技术指标之外,8B 解决的是部署经济学问题。

  • 硬件门槛:BF16 约 18GB 显存,单张 RTX 4090 可跑;4-bit 量化后 6-7GB,中端显卡即可。万元级工作站达到可用精度。
  • 数据安全:完全本地部署,屏幕语义理解、操作执行全部在内网完成。敏感数据不出服务器。
  • 老旧系统:企业真实链路中大量无 API、无文档的 C/S 架构软件(20 年前的 MES、十年前的 ERP 客户端),AI 直接模拟键鼠操作,像人一样“硬控”界面。
  • 长链路稳定:遇到弹窗、改版、限流,自主重试、切换兜底路径,不“一卡就死”。

实在智能的 Harness 工程底座负责模拟鼠标键盘,Indeed-UI 负责“看懂界面并定位元素”,两者配合打通企业全链路。

12.png

五、快速上手:开源地址与评测

  • ModelScopehttps://www.modelscope.cn/models/IntellgenceIndeed/Indeed-UI-8B
  • GitHubhttps://github.com/intelligence-indeed/Indeed-UI

一键评测:

pip install -r requirements.txt
bash run_eval_sspro.sh

手动分步:

# Step 1: 基础评测
torchrun --nproc_per_node=8 --master_port=29502 \
  eval_sspro_hf_dp.py \
  --model_dir /path/to/Indeed-UI-8B \
  --data_dir /path/to/ScreenSpot-Pro \
  --output_dir ./Indeed-UI-8B

# Step 2: Zoom-In 增强评测
torchrun --nproc_per_node=8 --master_port=29502 \
  eval_sspro_zoomin_hf_dp.py \
  --model_dir /path/to/Indeed-UI-8B \
  --data_dir /path/to/ScreenSpot-Pro \
  --output_dir ./Indeed-UI-8B-Zoomin \
  --step1_output_dir ./Indeed-UI-8B

run_eval_sspro.sh 中配置模型路径、数据集路径、输出路径即可。


六、我的总结

Indeed-UI 8B 在 ScreenSpot-Pro 上拿到 81%,技术贡献可以归结为三点:

  1. 成熟基座:GUI-Owl 1.5 / Qwen3-VL 提供扎实的视觉语言底子。
  2. 数据质量:混合数据飞轮持续补齐高分辨率专业场景。
  3. 推理策略:Zoom-In 两阶段定位,把计算花在刀刃上。

它证明了一件事:在 GUI Grounding 这个任务上,“小模型 + 好数据 + 好推理策略”的路径已经跑通。屏幕定位只是 Agent 执行链路的第一环,但当这一环从“大厂专属”变成“一张显卡就能跑”,后续的规划、执行、纠错才有了规模化的可能。我已经把 8B 模型挂到本地工作流里试跑,后续会继续分享实际场景的踩坑记录。

参考内容

  1. ModelScope 模型页:www.modelscope.cn/models/Inte…
  2. GitHub 仓库:github.com/intelligenc…