前情提要:昨天我們建立好了各年齡層保險配置的動態矩陣。
本日目標:今天要解決保險界最大的痛點——「保單條款根本不是寫給人看的」。我們不寫複雜易錯的爬蟲,而是教大家如何用現代「AI 協作」的工作流來處理這些髒資料。
如果你嘗試過用 Python (例如 pypdf 或 pdfplumber) 去爬取台灣各家保險公司的 PDF,你一定會崩潰。每家公司的排版、表格結構完全不同,花費大量心力寫的正則表達式,只要換一家公司就會全部失效。
在現代 AI 開發中,處理這種非結構化髒資料的最佳解法,就是**「AI 前置萃取 (AI Pre-processing)」**。
與其我們自己在程式碼裡跟 PDF 奮鬥,不如把這個重擔交給地表最強的 LLM(例如 Claude 或 ChatGPT)。我們將設計一段「萃取 Prompt」,讓使用者自己把保單丟給外部 AI 工具,要求它們將亂七八糟的 PDF 轉換成標準化的 Markdown 格式。然後,我們專案內的 first-policy AI 再來讀取這份乾淨的 Markdown 進行專業健檢。這就是 AI 互相協作的最佳實踐!
請建立一個給玩家使用的提示詞文件 extract-prompt.md。未來玩家只要把這段文字,連同保單 PDF 丟給 ChatGPT 或 Claude 即可:
# 保單萃取 Prompt
請幫我閱讀這份保單 PDF,並嚴格按照以下 Markdown 格式萃取重點。
遇到艱澀的法律條文,請將其濃縮為「一句話的白話文」。若未提及則寫「無」。
## 保單萃取結果
- **保單名稱**:(填寫保單名稱)
- **保險公司**:(填寫保險公司)
- **主要險種分類**:(從 意外/醫療實支/壽險/重大傷病/失能/其他 中擇一)
- **是否為主約**:(是/否)
- **年繳保費**:(填寫數字 TWD)
- **主要保額**:(填寫數字 TWD)
- **主要理賠項目摘要**:
- (白話項目一,例如:住院實支實付上限12萬)
- (白話項目二...)
- **除外責任與不賠項目**:
- (白話項目一,例如:美容牙科門診不賠)
這個工作流最棒的地方在於,我們要求外部 AI 必須把艱澀的法律條文,濃縮成「一句話的白話文」。這不僅減輕了我們專案內部 AI 的運算負擔,也直接解決了人類看不懂條款的痛點。
今天我們學到了非常重要的一課:「不要為了展現技術而硬刻程式碼」。善用外部強大 AI 的泛化能力來處理髒資料,專注在我們專案核心的「財務健檢邏輯」,這才是最高效的開發思維。
降級選項:如果你或你的使用者不熟悉操作 Claude 等外部工具怎麼辦?別擔心,你也可以直接提供一份「免解析版」的空白 Markdown 範本,讓使用者手動把保單上的關鍵數字填進去,一樣能順利通關!
明日預告:資料準備好了!明天(Day 19),我們將正式撰寫 /insurance-review 指令,讓我們的 first-policy AI 讀取這份乾淨的 Markdown,開啟一場「多輪對話的保單斷捨離」!