iT邦幫忙

2026 iThome 鐵人賽

DAY 4
0
Vibe Coding

與Claude一起從零打造產值評估工具系列 第 4

Day 4| 台灣企業/產業產值資料去哪找?如何設計「預先抓取」策略?

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20260806/201831961CHkevDlRU.png

昨天我確認了後續的全免費架構
「AI 只用在開發期,執行期零API呼叫」
這是最省錢的做法,當然前置作業就變很多~~

這也是為什麼會有今天這個部分。
因此今天要先解決整套工具核心問題之一:
資料從哪裡來、怎麼放進這個「執行期不呼叫任何外部來源」的架構裡。
畢竟產值評估的資料可信度,完全建立在資料品質上,
因此今天的整套決策,將決定了未來工具中各種模型是否能落實

一、今日目標

  • 完成台灣官方資料源盤點表
  • 確立資料取得策略
  • 寫出第一支解析程式(擬用一份官方數據,轉成隨網站部署的型態)。

二、資料策略:預先抓取,而非即時呼叫

我原本的構想是「使用者按下評估,系統即時去抓官方資料」,但思考後自行翻篇,原因有三點:

  1. 公開資訊觀測站(MOPS)沒有正式 API,而且有反爬限制:即時抓取不只慢,還隨時可能失敗,使用者體驗完全不可控
  2. 官方統計的更新頻率是月/季:即時抓取所換來的「新鮮度」是無意義的,因為官方資料不會天天更動
  3. 全免費架構要求執行期零外部呼叫——即時抓取違反 Day 3 定下的第一原則

所以策略定為:每季跑一次抓取腳本,把官方資料整理成靜態 JSON 放進專案的 data/ 資料夾,隨網站一起部署
執行期前端只讀自己站內的 JSON,這種方式能確保工具執行速度快、百分之百穩定、零成本。
代價是資料非即時,因此 Dashboard 上會固定顯示「資料時程區間」區塊。

三、台灣產值資料地圖

說真的,以產業分析師日常來說,產值資料實際多數仍為公開項目,畢竟如果非公開,也不用做產值評估,當然就經驗老到的分析師來說,產值評估是沒有一個標準答案,重點在於你如何解析資料、如何讓數據變得有價值,我想這才是關鍵點。

當然在這邊,我就是先透過與Claude討論的方式,整理出以下資料源:

資料源 能回答的問題 更新頻率 取得方式
經濟部統計處:工業產銷存動態調查 製造業各行業產值(產業模型①②的主資料) 逐月 網站下載 CSV
財政部:營利事業家數與銷售額 全行業銷售額(服務業產值的替代指標) 雙月 網站下載/API
主計總處:產業關聯表 產業間投入產出關係(產業模型③的核心) 約 5 年 網站下載
公開資訊觀測站 上市櫃財報:營收、毛利(企業模型①④) 逐月/季 查詢下載(無正式 API、有反爬)
政府資料開放平臺 data.gov.tw 各式補充性開放資料 不一 API/下載

取得策略統一為:每季預先抓取 → 轉靜態 JSON 放 data/ 隨站部署,執行期不即時呼叫任何來源。

https://ithelp.ithome.com.tw/upload/images/20260806/20183196UCZP2KGBsM.png

四、解析程式實作

我先從經濟部統計處下載一份工業產銷存的 CSV,然後把「檔案的前 10 行原始內容」直接貼給 Claude:

這是經濟部工業產銷存動態調查的 CSV 前 10 行(貼上原始內容)。請幫我寫一支解析程式:讀取檔案、整理成〔行業別、年月、產值〕的乾淨結構,輸出成 data/industry_output.json,這份 JSON 會隨 Next.js 專案部署、由前端直接讀取。注意:金額單位與年份格式請依檔案實際內容處理。

https://ithelp.ithome.com.tw/upload/images/20260806/201831960oTJP00Jzg.png

五、資料驗收

程式能跑不代表資料是對的。我做了兩層驗收:

  • 數字核對:抽兩個熟悉的行業,把 JSON 內容與統計處官網公布的數字人工核對——一致才算過關。這是鑑識工作留下的習慣:工具可以自動化,但驗證不能省略
  • 結構檢查:請 Claude 在 JSON 裡加上 meta 欄位(資料來源、抓取日期、基準期間、單位)——資料檔案自己說明自己的出處,之後 Dashboard 的「資料基準期」區塊直接從這裡讀

驗收內容: 檔案第一筆是 1,245,678,901 千元,而 1 億元 = 100,000 千元,所以 1,245,678,901 ÷ 100,000 = 12,456.79 億元

https://ithelp.ithome.com.tw/upload/images/20260806/20183196LqT5Ls8h7W.png

六、小結

今天整體來說主要就是著重於資料抓取與呈現,從Claude先確認資料來源之後,然後請Claude給我一個實作分析結果,確認資料是否有辦法讀取。
透過這種方式讓我體會到,Vibe Coding 處理資料工程時,「把真實檔案內容貼給 AI」遠比「描述」的方式來的有效。因此透過「預先抓取」這個策略,能夠建構出更透明的開發過程。


上一篇
Day 3|與AI協商技術選定時,出現大trouble~!!!
系列文
與Claude一起從零打造產值評估工具4
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言