iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
自我挑戰組

拯救混亂數據:30 天 Python 輕量級 ETL 與電商關聯資料分析 系列

拋開乾淨的玩具資料,迎接真實世界的數據挑戰!
本系列是我針對真實商業數據的端到端處理實戰,
我使用涵蓋 9 張關聯表的巴西電商數據(Olist Dataset),30 天挑戰聚焦三大核心:
1.Extract & Load:實作多表關聯讀取與輕量資料庫寫入。
2.Transform 實戰:運用 Pandas 清洗髒數據、處理遺失與異常值。
3.商業洞察:實作 RFM 顧客分群與留存率等核心指標。
完成從實驗室理論走向業界實務的最後一哩路!

參賽天數 2 天 | 共 2 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

[Day 01] 啟航!告別乾淨假資料,真實電商數據的 30 天挑戰

為什麼會想寫這個系列?過去在實驗室專注於深度學習與模型訓練時,我們往往習慣了高度標準化的資料集。無論是調整演算法還是優化網路架構,重點多半放在「如何提升模型的預...

2026-09-08 ‧ 由 yu 分享
DAY 2

[Day 02] 掌握全局:用 ER Diagram 釐清 9 張電商資料表的關聯邏輯

為什麼不直接開始寫 Code? 拿到資料的直覺往往是直接用 read_csv 讀取,但這在業界可以說是大忌!資料不是平的: 企業數據通常分散在多張關聯式資料表...

2026-09-09 ‧ 由 yu 分享