在多模態的日常與商業落地中,最常見且剛需的情境就是 光學字元辨識(OCR, Optical Character Recognition)。傳統 OCR 工具常受限於字體潦草、光線陰影、摺痕或繁雜排版,且辨識出來的通常是一長串缺乏語意的雜亂純文字,後續仍需大量人工整理。
今天我們要在 Google AI Studio 中,用平板直接拍照或上傳真實生活中的兩大硬核場景——「手寫會議筆記」 或 「超商/餐飲電子發票」,實測如何運用專屬的 OCR 提示詞技巧,讓 Gemini 不只「辨識文字」,還能「自動校正語意」並「輸出結構化資料」。
為什麼大模型多模態 OCR 遠勝傳統 OCR?
設計 OCR 提示詞時,切忌只寫「幫我辨識圖中文字」,請套用以下五步架構:
實測設計:便利商店電子發票結構化辨識
本實驗使用一張真實拍攝的「7-ELEVEN 電子發票證明聯」作為測試樣本。發票含有傳統 OCR 容易產生判讀錯誤的要素:粗黑標題、時間戳記、隨機碼、賣方統編,以及底部細小的門市代號與機台資訊。
測試目標

今日結語
在平板上隨手拍下一張發票或手寫筆記,無需任何繁瑣的預處理影像代碼,僅靠一段規格嚴謹的提示詞,就能在幾秒內完成「視覺解析➡️語意校正➡️結構化數據落庫」的全流程。這不僅是技術的革新,更是打造無紙化、自動化辦公流程的最強利器!