很多人在平板上使用 AI Studio 上傳圖片時,往往只會附上一句模糊的「這張圖是什麼?」或「幫我分析一下」。結果模型不是泛泛而談,就是抓錯重點。今天我們要探討:當輸入媒介從「純文字」變成「圖片 + 文字」時,提示詞的結構該如何升級,才能精準引導模型的視覺注意力?
為什麼傳統文字 Prompt 套在圖片上容易失效?
實測設計:手繪 Google 登入流程 Wireframe
我在平板的繪圖軟體上隨手畫了一張經典的 Google 登入介面手繪草圖(包含頂部標題、說明字樣、Email 輸入框、忘記帳號連結、建立帳號與 Next 圓角按鈕),並上傳至 Google AI Studio 進行對照測試。
實驗 1:模糊視覺提問(對照組)

實驗 2:套用 VIC 視覺提示法則(實驗組)

今日結語
多模態的核心價值,從來不只是讓 AI「看見圖裡有什麼」,而是透過專業視角,把圖像資訊「翻譯」成高價值的結構化成果。
從今天的實測可以看到,在純文字對話下隨手繪製的草圖,只要套用 VIC 提示法則(視覺錨點、角色定義、交付規格),Gemini 就能瞬間展現出像素級的審查能力——從幫你抓出「Sigh In」手寫筆誤,到寫出標準的 Flexbox 佈局建議。這讓平板搭配 Apple Pencil 不再只是做筆記的工具,而是成為隨手產出工程規格的超級 AI 工作站!