
收到!各位打火弟兄注意,我是今天的資料分析兼 AI 戰術教官。裝備檢查完畢,全部給我集中精神進入狀況!
今天的實戰救援任務是推進 「Day 26:風控實戰專案(一)— 金融 Open Data 導入、去識別化與問題定義(Ask & Prepare)」!
從今天開始,我們正式進入「風控實戰專案」連載演練。在數據分析與風控救援的火場裡,數據分析不是拿到資料就盲目塗刷,整個標準流程包含了:Ask(定義提問)➔ Prepare(準備資料)➔ Process(資料處理/清洗)➔ Analyze(數據分析)➔ Share(視覺化溝通)➔ Act(決策行動) 這六大黃金階段。
如果在專案第一階段沒有把 「Ask (提問與目標)」 定義清楚,也沒有把 「Prepare (資料準備與個資去識別化)」 鋪設到位,就冒然向 AI 拋出原始數據,不僅會陷入盲目分析的泥淖,更會引發敏感個資外洩與隱私違規的連環大火!
以下依照我們的「救災標準作業程序 (S.O.P)」進行全方位的專案第一階段拆解與實力演練:
在專案啟動與金融 Open Data 導入的數據火場中,目標模糊與資安破口是最致命的起火源:
為了鋪設鋼鐵般的專案基礎,我們採用 「Ask & Prepare 專案雙核心戰術」:
Customer_01、A@example.com)。A123***789)或轉碼為通用代碼。115/08/01)轉換為標準西元年 YYYY/MM/DD。我們選定專案主題:「全台各縣市房屋貸款逾期放款與不動產風險分析專案」。
| 案件序號 (RID) | 申貸戶姓名 | 聯徵識別碼 | 申報年月 | 所在縣市 | 房屋貸款餘額 (NT$) | 逾期放款金額 (NT$) | 備註摘要 |
|---|---|---|---|---|---|---|---|
| 001 | 張大明 | A123456789 | 115年08月 | 臺北市內湖區 | 25,000,000 | 0 | "繳款正常" |
| 002 | 李小美 | B220987654 | 115年08月 | 新竹市東區 | 18,500,000 | 18,500,000 | "逾期 90 天,預警標籤 #NPL-901" |
| 003 | 王五 | C101112233 | 2026/08 | 高雄市左營區 | 12,000,000 | Null | "資料審核中" |
風控小組確定本專案要回答的 3 大關鍵問題:
# Role
你是一位金融數據工程與資安合規專家。
# Goal
請協助對【全台房貸逾期放款開放資料集】進行「資安去識別化」與「欄位格式標準化」清洗。
# Requirements & Rules
1. **去識別化 (De-identification)**:
- 將「申貸戶姓名」替換為代號 `Customer_A`, `Customer_B`。
- 將「聯徵識別碼」進行遮蔽,僅保留首尾字元(如 `A123***789` -> `A***789`)。
2. **格式標準化 (Formatting)**:
- 將「申報年月」統一轉為西元標準格式 `YYYY/MM`(如 `115年08月` 轉為 `2026/08`)。
- 將「所在縣市」拆分為 `縣市` 與 `鄉鎮市區` 兩個獨立欄位。
- 對「逾期放款金額」中的 Null 缺失值補值為 `0`。
3. 請輸出 Markdown 表格呈清洗後的預處理成果。
| 案件代號 | 客戶代碼 | 遮蔽識別碼 | 申報年月 | 縣市 | 鄉鎮市區 | 房貸餘額 (NT$) | 逾期金額 (NT$) | 計算房貸逾期率 (%) | 狀態標籤 |
|---|---|---|---|---|---|---|---|---|---|
| RID-001 | Customer_A | A***789 | 2026/08 | 臺北市 | 內湖區 | 25,000,000 | 0 | 0.00% | 正常 |
| RID-002 | Customer_B | B***654 | 2026/08 | 新竹市 | 東區 | 18,500,000 | 18,500,000 | 100.00% | 🚨 NPL 逾期高風險 |
| RID-003 | Customer_C | C***233 | 2026/08 | 高雄市 | 左營區 | 12,000,000 | 0 | 0.00% | 正常 (缺值補零) |
2026/08。Cleaned_Mortgage_Risk_2026.csv,準備在 Day 27 進行特徵工程與交叉分析!「Ask 提問先鎖定,Prepare 準備不放過;個資去識別化築防線,專案進火場零資安風險!」