拋開乾淨的玩具資料,迎接真實世界的數據挑戰!
本系列是我針對真實商業數據的端到端處理實戰,
我使用涵蓋 9 張關聯表的巴西電商數據(Olist Dataset),30 天挑戰聚焦三大核心:
1.Extract & Load:實作多表關聯讀取與輕量資料庫寫入。
2.Transform 實戰:運用 Pandas 清洗髒數據、處理遺失與異常值。
3.商業洞察:實作 RFM 顧客分群與留存率等核心指標。
完成從實驗室理論走向業界實務的最後一哩路!
為什麼會想寫這個系列?過去在實驗室專注於深度學習與模型訓練時,我們往往習慣了高度標準化的資料集。無論是調整演算法還是優化網路架構,重點多半放在「如何提升模型的預...
為什麼不直接開始寫 Code? 拿到資料的直覺往往是直接用 read_csv 讀取,但這在業界可以說是大忌!資料不是平的: 企業數據通常分散在多張關聯式資料表...