這一篇跟前面十一天不一樣:它不是我的行政工作。
這是我下班後自己做的專案——把幾份公開的政府統計做成可以看的圖表,放在網路上。沒有人交辦,也不算在我的職務裡。
那為什麼放進這個系列?因為同一條紀律在這裡被考得最兇。上班做的盤點、報表,錯了會有人來問;下班自己做的東西,沒有人會來問——所以錯了就會一直錯下去。這篇要講的坑,我全部是在沒有人監督的情況下踩的。
要找官方統計,多數人的做法是 Google 搜尋,或到開放資料平台打關鍵字。找不到,就得出結論:政府沒有公布。
通常不是沒有,是不在搜尋得到的地方。
例一:教育部的統計。 大家熟悉的是開放資料平台上那些檔案,但統計處網站底下還有另一批「明細統計表」——分到縣市、分到學制的細項都在那裡。它們沒有被做成資料集,所以不會出現在關鍵字搜尋結果裡,得從統計表頁面一層一層點進去。
例二:社會經濟資料服務平台。 這裡的教訓更明確:先看產品總目錄,不要用關鍵字搜。 那個平台有一份三千多列的目錄檔,列出所有資料產品的名稱與代碼。正確做法是先下載目錄、在裡面找到要的東西、記下代碼,再去取資料。
直接搜關鍵字的問題是:資料的正式名稱跟你想的不一樣。 你搜不到,就以為沒有。
這是這篇最該記下來的一段。
同一份統計,那個平台常常有兩種版本:一種照行政區切(縣市、鄉鎮),一種照統計區切(另一套網格化的單元)。我用關鍵字搜,只撈到其中一種。
於是我得到一個結論:這份資料最細只到縣市。
然後我把這個結論寫進了四份文件。當成「資料本身的限制」寫的——語氣很肯定,因為我以為自己查過了。
後來我去翻產品總目錄,才發現行政區版一直都在,而且有鄉鎮層級。那不是資料的限制,是我的搜尋方式的限制。
這件事後來我修正了,但我想講的是它的形狀:我沒有算錯任何數字,我錯在替資料下了一個它沒說過的結論。 而這種錯誤不會有人來糾正,因為它讀起來就像一個查證過的事實。
技術問題其實都還好,因為會報錯。真正危險的是不會報錯的那些。
一、百分比的分母不一樣。 同一份報表裡的兩個百分比,一個可能是全體人口,一個是有回答該題的人數。拿來比較看起來很合理,實際上在比不同的東西。
二、同一個名詞,不同年度定義不同。 某個類別的認定標準改過,改之前和改之後的數字不能直接連成趨勢線——但表格不會告訴你這件事。
三、你拿到的可能只有最新一期。 有些平台的資料介面只回傳當期數字,不含年度參數;想要歷年是另一條完全不同的路。如果你沒注意到,畫出來的「趨勢」可能是同一年的資料重複了好幾次。
我的處理方式:只要用到某個欄位,就去看那份資料的欄位說明,確認它的定義和分母。 這一步很煩,但省不得——因為這類錯誤不會被發現,只會被拿去用。
(檔案本身的髒亂——編碼、分隔符號、多層表頭——那是另一個故事,留到 Day 28。)
幫得上的:格式轉換、大量檔案的整理、把不同來源的資料對起來。這些做完可以驗證。
幫不上、而且要特別小心的:它會很有信心地告訴你「這份資料在某某網址」,而那個網址不存在。政府網站的路徑結構它不見得掌握得準。
但這一篇真正的教訓不在這裡。 前面那個「只能到縣市」的結論,不是 AI 告訴我的,是我自己下的。工具再準,也擋不住一個人用不完整的搜尋結果去推論全貌。
所以我現在的習慣是:它給的網址一律自己點開;而我自己下的結論,要能講出「我是查了什麼才敢這樣說」。後面那句比前面那句難做到。
Day 13:回到職務工作。一個公部門的官網,由 AI 協助設計,而且真的上線了。