在過去幾天,我們驗證了 Gemini 3 Flash 針對單張圖片的 UI 元件拆解、發票 OCR 結構化擷取以及商業圖表分析。然而在真實的軟體工程、UI/UX 驗收與設計審查(Design Review)場景中,最耗費人力的任務往往是跨版本的版本對比(Visual Diff)。
工程師改了程式碼,畫面有沒有跑版?設計師交付了 V2 草圖,到底調整了哪些字級、按鈕間距或功能項目?今天我們要實測 Gemini 3 Flash 的多圖空間推理與跨影像關聯能力:在 Google AI Studio 中同時掛載兩張獨立圖片,透過專屬提示詞讓 AI 化身為像素級的視覺 QA,自動產出標準化變更矩陣。
為什麼直接丟兩張圖容易失焦?
當在對話框中同時上傳多個影像檔案並隨意提問「這兩張圖有什麼不同?」時,模型通常會遇到三個瓶頸:
【影像標定】
【比對與分析規範】
請由上至下、由左至右逐區掃描兩張圖片的介面元素、佈局間距、文字標籤與色彩細節。
請以 Markdown 表格產出【視覺變更矩陣表(Visual Diff Matrix)】,欄位包含:
【整體版本總結】
【驗收底線】

