Browser-use:是一套把 LLM(大型語言模型)接上瀏覽器自動化的 Python 工具。
你不用給它 XPath,只要跟它說「點登入按鈕」,它自己去畫面上找哪個是登入按鈕。
傳統自動化,你要手刻 Xpath 找元素位置以及腳本生成撰寫,才能讓自動化成功驅動
Browser-use 則是反過:你告訴它「點登入按鈕」,它自己去畫面上找哪個是登入按鈕並自己執行動作。
當用戶給出測試案例(Prompt)後,他底層大致是這樣執行:

browser-use 有兩種用法,差別在你是不是要寫程式:
| 項目 | browser-use(程式版) | web-ui(圖形介面版) |
|---|---|---|
| 主要用途 | 程式化控制 AI 操作瀏覽器 | 提供圖形介面來使用 AI 操作瀏覽器 |
| 技術堆疊 | Python、Playwright、LangChain | Gradio(前端)+ browser-use 核心(左側) |
| 怎麼用 | 寫 Python / 下指令 | 開網頁,把指令填進去就好 |
| 適合誰 | 開發者、要接進 CI 的人 | 不寫程式的人、想快速驗證想法或做展示 |
簡單說:左側可以想成是程式底層包,右側就是有漂亮前端可以操作
兩種共同的特點:
注意:這套工具讓我驚艷的點在於讓我首次了解 AI「自我修復」的能力之強大
這條路的好處是:團隊裡不寫程式的人也能自己跑。
git clone https://github.com/browser-use/web-ui.git
cd web-ui
(裝的時候覺得有點久是正常的,底層依賴套件很多)
官方採用 uv 做 Python 版本控制,免得動到本機原有的設定(注意:只支援 Python 3.11 以上):
uv venv --python 3.11
# Mac / Linux
source .venv/bin/activate
# Windows
.venv\Scripts\activate
uv pip install -r requirements.txt
playwright install --with-deps
# Mac / Linux
cp .env.example .env
# Windows
copy .env.example .env
.env 裡面要指到你本機的 Chrome:
# Mac
BROWSER_PATH="/Applications/Google Chrome.app/Contents/MacOS/Google Chrome"
BROWSER_USER_DATA="/Users/YourUsername/Library/Application Support/Google/Chrome"
# Windows
BROWSER_PATH="C:\Program Files\Google\Chrome\Application\chrome.exe"
BROWSER_USER_DATA="C:\Users\YourUsername\AppData\Local\Google\Chrome\User Data"
python webui.py --ip 127.0.0.1 --port 7788
看到下面這個畫面,就表示成功了,點那個 URL 就會直接開啟網頁:


幾個區塊的用途:
| 區塊 | 做什麼 |
|---|---|
| Agent Setting | AI 的基礎設定(例如選哪個語言模型、設定 System Prompt) |
| Browser Setting | 瀏覽器設定(例如視窗大小) |
| Run Agent | 實際輸入 prompt 的地方 |
| Agent Marketplace | 操作多個 AI 代理(例如 OpenAI 跑日常自動化、DeepSeek 處理大量數據) |
| Load & Save Config | 快速切換或共享設定(例如在家用 A Key、在公司用 B Key) |
Load & Save Config 這個比想像中實用,設定可以直接丟給同事,他載進去就跟你跑的是同一組環境。
要接進測試流程、要進 CI,遲早得走這條。
uv venv --python 3.11
# Mac / Linux
source .venv/bin/activate
# Windows
.venv\Scripts\activate
uv pip install browser-use
uv run playwright install
建一個 .env:
OPENAI_API_KEY={你的 OPENAI KEY}
到這裡環境就好了,剩下的就是寫程式。
不需要什麼複雜設定,核心大概就這幾行:
from browser_use import Agent
from langchain_openai import ChatOpenAI
from dotenv import load_dotenv
import asyncio
load_dotenv()
async def main():
agent = Agent(
task="打開 google,搜尋「QA 三十天養成日記」,確認搜尋結果有出現列表",
llm=ChatOpenAI(model="gpt-4o"),
)
result = await agent.run()
print(result)
asyncio.run(main())
python agent.py
跑下去之後,瀏覽器會自己開起來,然後你會看到游標自己動、自己輸入、自己點下去。
恭喜你,到這裡你已經跑完第一支不用寫 selector 的自動化了 🎉
所以回到標題那個問題:QA 要失去自動化技能了嗎?
當然不會!是工作內容會改變。
它雖然把「怎麼點到那顆按鈕」這件事變簡單了,卻同時製造了一個新問題:你要怎麼確定它點對了?
第一個問題以前佔掉我大部分時間,現在幾乎不用管。
第二個問題以前根本不存在,現在變成我最花心力的地方,坑是沒有變少啦,只是換了一種 XD
不過大家還是要擁抱新技術,AI 時代本身就回崛起很多新的工具應用,只要懂的結合新技術的人、團隊,才不會成爲被 AI 取代的那一方