← 返回目录
e3科普⏱ 约 6 分钟

选修 · GUI Agent 科普

能「看屏幕、点按钮」的智能体——像人一样操作软件

🔎 最后验证 2026-06📚 来源:
为什么学这个

前面小雅靠"工具(API)"办事——但很多软件没有 API(老旧系统、网页后台、桌面程序)。怎么办?

让智能体像人一样用电脑:看屏幕、移动鼠标、点按钮、敲键盘。这类能直接操作图形界面的智能体,叫 GUI Agent。这一篇带你认识它的原理和现状。

它是怎么"用电脑"的

📸看(截屏)
截取当前屏幕画面
🧠理解+决策
看懂界面,决定点哪个/输什么
🖱️操作
移动鼠标、点击、输入
👀看结果
再截屏,确认是否成功
循环:回到第一步,直到完成
GUI Agent 的循环:截屏看 → 理解界面 → 决定点哪 → 操作 → 再截屏看

你会发现:这还是 ReAct 的"想→做→看"循环(a1.2),只不过:

  • "看" = 截屏 + 多模态模型读懂画面(按钮在哪、输入框在哪);
  • "做" = 真实的鼠标点击 / 键盘输入;
  • "看结果" = 再截一张屏,确认操作有没有生效。

代表能力:Anthropic 的"computer use"、各家的"电脑操作 Agent"——给它一个目标("帮我在这个后台导出上月报表"),它自己截屏、找按钮、一步步点完。

强在哪、弱在哪

  • :能操作没有 API 的一切软件——老系统、网页后台、桌面程序,人能点的它都能点。
  • ⚠️ :(每步要截屏+推理)、(界面一改就可能点错)、有风险(点错按钮后果可能严重)。
❓ 测验
GUI Agent 最大的独特价值是?
⚠️ 避坑能 API 就别 GUI——GUI 是「最后手段」

GUI 操作慢、脆、风险高。只要目标软件有 API 或 MCP 接口,优先用接口(又快又稳)。GUI Agent 是"实在没接口了"才用的兜底方案。

而且它"能替你点任何按钮"也意味着风险——务必配人工确认 + 在受控环境里跑(呼应 a3.4 安全)。

🤖 判断你的任务该用哪种
我要让 AI 自动完成这个操作:『___』(我来描述)。请帮我判断:目标系统有没有 API/MCP 可用?如果有,优先怎么接;如果没有,用 GUI Agent 要注意哪些慢/脆/安全问题?
✅ 小结

GUI Agent 让智能体走出"对话框",像人一样操作软件——本质还是"想→做→看",只是"看"变成了截屏、"做"变成了点鼠标。记住:能用 API 就别用 GUI,它是兜底手段。

下一篇是它的近亲:专门自动逛网页、填表单、抓信息的 Web Agent。

下一节 → 选修:Web Agent 科普
智图软件的赞赏码
都看到这了,打个赏呗!
接下来 · e4
选修 · Web Agent 科普
继续读下一节 →