大部分人在學習資料分析或資料工程時,都是從 Python、SQL 開始,卻很少知道一個完整的資料專案是如何一步一步完成的。本系列將以臺北捷運政府開放資料為例,記錄我從零開始建立第一個 Data Engineering 專案的過程。內容涵蓋資料探索(Data Profiling)、Python ETL、PostgreSQL、dbt、Airflow、Docker,以及 Git/GitHub 版本控制,並逐步完成一條可重現的 Data Pipeline。這不是語法教學,也不是宣稱業界標準,單純是整理自己的學習歷程、踩坑紀錄與技術選擇,希望能為同樣正在建立第一個資料工程作品集的人提供一份參考。
本系列主要聚焦於資料工程(Data Engineering),透過建立一條完整的資料處理 Pipeline,學習如何擷取、儲存、轉換與管理資料的相關概念。Pyt...
好,系列正式開始。不過我們還沒有要立刻寫程式。在開始寫 Python、PostgreSQL、dbt、Airflow、Docker 之前,我想先花一篇文章把這張「...
現在終於可以開啟 VS Code。還沒有 VS Code 的朋友可以先到官方網站下載安裝(這裡)。這裡就不另外介紹安裝流程,我們直接開始建立專案。 先建立專案架...
專案資料夾跟 Python 虛擬環境都準備好。現在要處理一件專案越做越大就會越重要的事情,版本控制。想像一下,你今天修改了一段 Code,跑得很好,明天又覺得:...
終於,我們要正式碰資料。這個專案會使用政府資料開放平台提供的「臺北捷運每日分時各站 OD 流量統計資料」。這一階段先下載 2026 年 6 月 CSV,放進上一...
上一篇我們先從整張資料表開始做資料剖析,確認了資料粒度(Grain)、缺失值(Missing Value)、重複資料(Duplicate)、日期與時段。其中我們...
前一個 Stage,我們用少量樣本進行資料剖析(Data Profiling),確認臺北捷運 OD 資料的結構、資料粒度與可能存在的品質問題。接下來要進入 St...