AI 新手村:让大模型学会操作浏览器怎么做-执行顺序和关键限制

作者:袖梨 2026-08-30

大模型适合从架构、配置和使用边界三处入手判断,避免把概念和实际流程混在一起。

安装skill 之后

先看原文给出的关键信息:传统的 LLM 只是一个文本语言模型,只能以 chat bot 的形式和我们完成对话。;但是在日常工作生活中,浏览器是一个占据我们大多数时间的工具,如何让大语言模型也具备操作浏览器的能力呢?;最近我做了一个小实验:用 Agent Playwright,让大模型自己打开网页、看懂页面结构、决定点哪个按钮,最终完整处理了一个客服工单。。继续往下处理时,重点放在这些条件上:从宏观上看,给 LLM 配置上工具、组成一个 Agent,就能实现与浏览器的交互。;这个 Agent 不断执行「观察 执行」的循环:Agent 接受任务和当前浏览器状态根据任务分析当前状态,决定下一步操作把操作交给工具执行执行后浏览器产生新的状态,作为下一次循环的;默认为无头模式,不加 headed 参数即可,节省内存但看不到页面。。收尾检查时,再把这些细节对上:在命令行里跑的时候更适合用无头模式,减少干扰,运行更清爽。;持久化会话代码语言:shell复制playwright-cli open google.com --headed --persistentCookie 等信息会存储在本;如何与大模型配合playwright cli 是微软推出的一个命令行工具,大模型并不知道如何使用,但是搭配上 skill 这个说明文档随后,大模型就能立即掌握工具的所有。

前端网页

观察

行动

修改之后的前端

前端页面

整个流程

相关文章

精彩推荐