iT邦幫忙

2026 iThome 鐵人賽

DAY 23
0

從一個簡單的問題開始

9 月初的某個晚上,我問幫我做事的 AI:「agy(Google 的 Antigravity 命令列工具)現在可以開瀏覽器了嗎?」

會問這個,是因為我的工作很多都要開網頁:去後台貼公告、檢查頁面有沒有跑版、確認外部連結還活著。如果它能操作瀏覽器,這些就能交出去。

幫我查的 AI 回答:可以,它的更新紀錄寫著內建了瀏覽器控制的功能。

我自己進 agy 問了一次。它說得比較保守:沒有完整的互動式瀏覽器,但可以用 /browser 這個指令處理網頁任務。我照著輸入「/browser 開啟 google」,它回:

我已經為您啟動了 /browser 瀏覽器小助手,並指示它前往 Google。它會在背景執行……

我注意到少了一樣東西

我看過另一套工具開瀏覽器:螢幕上會跳出一個新的 Chrome 視窗。這次什麼都沒有跳出來。

所以我跟幫我查證的 AI 說:「它不能跟你一樣開一個 Chrome 出來。」接著要它「再抓一次程序清單,看有沒有它開的 Chrome」。

「程序清單」就是電腦上目前正在執行的所有程式,Windows 工作管理員裡「處理程序」那一頁就是它。開了一個瀏覽器,清單上就會多一個 Chrome。這份清單是作業系統自己記的,AI 說什麼都改變不了它。

AI 把檢查做成程式

接下來是 AI 擅長的部分。它寫了一支小程式,每 2 秒記一次「現在有幾個 Chrome、agy 有沒有在跑」,然後叫 agy 去開網頁。

結果:記了 22 筆,其中 5 筆 agy 正在跑,Chrome 從頭到尾都是 2 個,而且是原本就在的那兩個(一個是我自己的,一個是那套 AI 工具之前開的)。agy 最後吐出一則錯誤,說它需要「讀取網址」的權限。

幫我查證的 AI 下了結論:「抓到了,而且是決定性的:agy 全程沒有開任何 Chrome。」我也照這個結論寫了這篇的初稿。

坑:連幫我查證的 AI 都說過頭了

這篇原本預定今天照初稿發。發文前重查,監看的原始檔已經找不到了,只剩當天的對話紀錄。我把紀錄一行一行翻出來,才發現那個「決定性」的結論撐不住:

  • 被監看的那一次,agy 第一步就被權限擋下,整個任務直接結束。 它根本還沒走到「開瀏覽器」那一步,Chrome 當然不會多。
  • 真正會讓它放手去做的那一次(給它全部權限),被幫我查證的 AI 自己的安全檢查擋下來,從來沒跑過。
  • 「23 筆」其實是 22 筆,多算了開頭那一行標題。
  • 初稿裡有一段寫「我看了更新紀錄,判斷它應該能開瀏覽器,我錯了」。翻紀錄才知道,說「可以」的是 AI,不是我。

所以那次實驗只證明了一件事:它被擋下來了。 它到底會不會開瀏覽器,沒有測到。

這跟 Day 22 是同一個坑:驗證的那一方也會錯,而且錯在把話說滿。

今天重測:這次每一步都留紀錄

agy 已經從 9 月的版本更新到 1.2.16。這次除了監看程序清單,也讓 agy 把每一步用了什麼工具輸出成紀錄。權限維持預設,沒有全開。

  1. 一般的 /browser 任務:它第一步選的是「讀網址」,不是開瀏覽器,被擋下後結束。
  2. 它開機時列出的工具清單裡,確實有一整組瀏覽器工具:開網址、點擊、截圖都有。但我指名要它用「開網址」和「截圖」這兩個工具,它回:「這兩個工具不在我當前的可用工具列表中。」
  3. 我要它交給瀏覽器小助手,用真正的瀏覽器打開網頁並截圖。紀錄顯示:
    • 它自己臨時定義了一個小助手,說明寫著「配備真正的瀏覽器」,但沒給它任何瀏覽器工具。
    • 小助手自己判斷「沒有瀏覽器工具」,改寫一支腳本,想先安裝一套自動操作瀏覽器的套件,這一步被權限擋下。
    • 這時 agy 回我:「已經交給瀏覽器小助手,它會用真正的瀏覽器打開、截圖,完成後馬上回報。」 20 秒後程式就結束了,不會再有任何回報。
    • 同一段時間的程序清單:記了 31 筆,Chrome 全程只有我自己那 1 個。資料夾裡沒有截圖,只多了那支沒跑成的腳本。

它說的是「已經交辦、會回報」,三個不經過它的地方都說「什麼都沒發生」。

示意圖:左邊是 agy 回覆「已經交給瀏覽器小助手、完成後回報」,右邊是同一時間的逐步紀錄、程序清單與資料夾,顯示小助手沒有瀏覽器工具、安裝被擋、Chrome 數量不變、沒有截圖檔

這些證據能說到哪裡

要老實講清楚的限制:

  • 不能說它「說謊」。 它確實交辦了,只是交辦之後的事它沒有確認就先回報了。
  • 不能說它「永遠不會開瀏覽器」。 我沒有放行讓它安裝套件。就算放行後成功,證明的也只是它會自己寫程式開瀏覽器,不是 /browser 本身的能力;代價是在電腦上裝一堆東西,這篇不值得。
  • 「Chrome 沒變多」不等於「一定沒開」。 如果它用的是我本來就開著的那個 Chrome,清單上不會多出東西。今天能下結論,是因為它自己的逐步紀錄也顯示它在碰到瀏覽器之前就被擋了。兩個管道對得上,結論才站得住。
  • 今天跑監看、讀紀錄的,是幫我查證的 AI,不是我親手數的。我看的是它整理出來的紀錄。

留下什麼

一、分工。 回頭看整件事:

誰做的
覺得不對勁(視窗沒跳出來) 我
決定去查哪裡(程序清單) 我
把檢查寫成程式、每 2 秒記一次 AI
說「可以」、說「決定性的」 AI(一次說錯,一次說過頭)
發現結論撐不住 AI,發文前重翻原始紀錄時

AI 很會「把檢查跑出來」,但「該查什麼」那一下,這次是人想到的。

二、它說的,去問誰。

它說 去問誰
我開了瀏覽器 程序清單,加上它自己的逐步紀錄
我建立了檔案/截了圖 資料夾裡有沒有那個檔案
我交辦了,會回報 程式結束後有沒有真的回報
任務成功 不看「成功」兩個字,看它應該留下的東西

三、留原始紀錄,不只留結論。 9 月那次如果只剩一句「它沒開瀏覽器」,今天就沒辦法發現錯在哪。這次能翻案,靠的是當天的對話紀錄還在。

明天

Day 24:把判準寫成規則,而不是每次提醒。


上一篇
Day 22:它說「完美」,但錯的不只是它
下一篇
Day 24:把判準寫成規則,而不是每次提醒
系列文
用 Google AI 簡化行政工作流程:一個學校行政人員的 30 天實作紀錄 共 24 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言