我們已經成功打造了具備容錯機制的自動化 AI 客服總機。但假設今天客戶寄來一封信,內文只有短短一句:「系統報錯了,畫面如附圖,請盡快處理!」
如果我們的系統只停留在前兩週的「純文字」處理階段,AI 遇到這種信件就會瞬間變成瞎子,無法給出正確的分類。為了補足這塊拼圖,今天我們要解鎖現代大語言模型最強大的超能力:多模態 (Multimodal) 視覺辨識。
1. 超越傳統 OCR 的視覺推理能力
過去,工程師處理圖片文字通常會引入 OCR(光學字元辨識)技術。但 OCR 只能「把圖片轉成死板的文字」,它不懂排版,也不懂圖片背後的情境。
現在的主流多模態模型(如 GPT-4o 或 Gemini 1.5 Pro)具備了原生的視覺能力。它們不僅能精準讀出截圖上的 Error Code,還能理解 UI 介面的狀態(例如:「這個紅色的彈出視窗代表資料庫連線失敗」)。
2. 工程實作:圖片如何傳給 API?
在系統整合時,我們不能直接把一張 .png 檔案塞進字串裡。在呼叫多模態模型的 API 時,通常有兩種傳遞圖片的方式:
Image URL(圖片網址): 傳遞一個公開的 HTTPS 圖片網址給模型。這適合處理網路上的公開素材。
Base64 編碼(工程主流): 在處理客戶機密的信件附件時,我們不能把圖片上傳到公開圖床。我們會在程式碼中將圖片檔案轉換成一長串的 Base64 字串,並將其包裝在 JSON Payload 中直接發送給 API。這確保了資料不落地的高安全性。
3. n8n 與 Dify 的視覺管線整合
將這個觀念帶回我們的實戰畫布中,流程會升級成這樣:
擷取附件: n8n 的 Gmail 節點不僅抓取信件內文,還將信件附帶的截圖以 Binary(二進位)格式下載。
轉換編碼: 透過 n8n 內建的檔案轉換節點,將截圖瞬間轉換為 Base64 字串。
多模態分析: 將信件內文與 Base64 圖片一同發送給 Dify。在 Dify 的工作流中,我們選用具備 Vision 標籤的模型(如 GPT-4o)。
精準分類: Prompt 設定為:「請綜合參考信件內文與附圖。若截圖中包含 SQL Exception 或 500 等字眼,請分類為【技術報修】並提取錯誤代碼。」
透過解鎖多模態能力,我們的 AI 總機不僅聽得懂人話,還長出了敏銳的眼睛,真正達到了企業級的實用標準。
然而,無論 AI 多聰明、看得多清楚,它目前依然是在我們設定好的「固定工作流 (Workflow)」中按表操課。如果我們希望 AI 能像真正的資深工程師一樣,「自主決定」要先去查閱知識庫、還是先去 Google 搜尋解法呢?
明天 [Day 20],我們將進入整個系列最具顛覆性的高階主題:從 Workflow 晉升為自主思考的 Agent(代理)!