📝 本系列為 iThome 鐵人賽學習筆記,屬個人教學與非商業用途;文中法規與標準內容均以自身理解後的話轉述並註明出處,非逐字引用。
階段三|台灣有哪些機構與資源

昨天(Day 15)攤開了台灣 AI 治理制度的三層地圖,最底下那層「評測驗證層」出現了幾個新名字:AI 產品與系統評測中心、AI 測試實驗室、AI 驗證機構,以及背後的財團法人全國認證基金會。今天起的三天,就把這一層逐站走深。
第一站,也是這整層的入口——AI 產品與系統評測中心(Artificial Intelligence Evaluation Center,以下簡稱 AIEC)。它是台灣官方為「AI 可不可以信任」這個問題所建立的評測機構,也是本系列最終那份檢核表的骨架來源。今天要回答三件事:AIEC 為什麼要設、它的制度怎麼設計、它實際上為產業做了什麼。
一個對開發者最直接的切入點先講在前面:如果你手上有一個大型語言模型(Large Language Model,以下簡稱 LLM)應用,想找一個「官方認可、又不必花大錢」的地方檢測它可不可信,AIEC 就是台灣目前唯一的答案。這不是遠在天邊的政策,而是開發者現階段即可申請的服務。
國際的 AI 評測榜單(benchmark)眾多,台灣為何仍要自建一套?原因有三個,都與「在地」與「可信任」有關,如下圖所示。

第一,國際榜單量不到台灣在地的能力。 國際上熱門的評測,題目大多以英文、以歐美的知識與情境為主。一個模型在英文考題上拿高分,不代表它讀得懂台灣的用語、法規、社會情境。台灣需要一套用繁體中文、貼台灣脈絡的題目,才測得出「這個模型在台灣用起來到底行不行」。
第二,可信任不只是「答得準」。 一個模型答題正確率高,但會不會洩漏個資、會不會被繞過安全限制、會不會產生歧視性輸出?這些「可信任度」的面向,一般的能力榜單不會測。台灣需要一套把安全、隱私、公平、可解釋等治理面向一起納入的評測,才對得上前面兩階段講的法規原則。
第三,官方基礎設施才有公信力。 廠商自己說「我的模型很安全」沒有說服力;由官方認可的第三方機構來測、來背書,這張成績單在標案、採購、合規場景才站得住腳。這正是 Day 15 講的「驗證與認證」在產品端的落點。
把這三點合起來,就是 AIEC 存在的理由:替台灣建立一套在地化、涵蓋可信任度、且具官方公信力的 AI 評測基礎設施。
AIEC 的起點是一場公開活動。2023 年 12 月 6 日,數位發展部(以下簡稱數位部)在臺北科技大學舉辦「AI 產品與系統評測中心」啟動活動,時任數位部部長唐鳳、行政院政務委員兼國家科學及技術委員會主任委員吳政忠等人出席,TAIDE、Meta、微軟等語言模型開發商也到場——這個陣仗本身就說明了它的定位:不是內部研究計畫,而是要對產業、對國際亮相的公共基礎設施。

從啟動到兩個執行機構到位的時間軸,如上圖所示。它的承接分工,Day 15 已經點過,這裡補上完整脈絡:AIEC 由數位部轄下的數位發展部數位產業署(以下簡稱數產署)主辦,與國家資通安全研究院(以下簡稱資安院)、財團法人工業技術研究院(以下簡稱工研院)合作設立。啟動時就宣告了後續兩步:隔年(2024 年)陸續成立測試實驗室與驗證機構,正式提供評測與驗證服務——這兩個機構的成立與分工,是明天 Day 17 的主題。
換句話說,2023 年底啟動的是「中心與制度」,2024 年落地的是「執行的手腳」。今天先把「中心與制度」講清楚。
這裡要破除一個常見的誤解:AIEC 不是「一間實驗室」,而是一套由三種角色構成的評測體系。理解這三種角色的分工,是讀懂整個台灣 AI 評測制度的關鍵。下圖呈現三種角色的分工與產出:

用一個比喻來記:AIEC 中心像是「出題與定規則的考試院」,測試實驗室像「監考與閱卷的試務單位」,驗證機構像「複核成績、簽發證明的審查單位」。 三者各司其職,才能讓一張成績單既專業又可信。今天的主角是最上層的「中心」;測試與驗證這兩個角色的差別,留到明天細講。
依啟動時的官方說明,AIEC 中心本身由三個部分組成:
一個管方向、一個管專業、一個管行政運作,讓評測制度「既符合政策目標,又站得住技術腳跟,還推得動日常事務」。
AIEC 要產出的最重要成果,是兩份文件:「AI 產品與系統評測制度」與「AI 產品與系統評測指引」。前者定「這套評測怎麼運作、誰來測、怎麼認定」;後者定「具體要測什麼、怎麼測」。對想送測的廠商而言,這兩份文件就是遊戲規則書。
制度講完,來看 AIEC 具體端出了什麼。
AIEC 參考美國國家標準暨技術研究院(National Institute of Standards and Technology,NIST)、國際標準化組織(International Organization for Standardization,ISO)與歐盟等國際規範,先針對語言模型規劃出十大評測項目:安全性、可解釋性、彈性(Resilient,或譯韌性)、公平性、準確性、透明性、當責性、可靠性、隱私、資安。
這十項是本系列的重要資產——它幾乎可以直接當作一份「AI 系統該檢查哪些面向」的檢核表骨架,也是本系列最終白皮書的欄位藍本。它的逐項拆解是後天(Day 18)的專題,今天先讓它在地圖上就位。
在體系仍處試營運(概念驗證,Proof of Concept,以下簡稱 PoC)階段時,AIEC 中心同時扮演送測的統一窗口:AI 產品開發者透過 AIEC 提出申請,由 AI 測試實驗室執行測試、出具測試報告。也就是說,現階段你不需要分別找不同機構,一個窗口就能啟動整個流程。
制度不是紙上談兵。AIEC 從啟動至今,已經累積了實際的評測成果——這是一個仍在成長的體系,而不是一份靜態的文件。

如上圖所示,截至 2025 年,AIEC 的試營運已有具體數字與成果:
這些數字會隨時間更新,但趨勢很清楚:台灣已經有一個實際運轉、且以在地化為特色的官方 AI 評測機構。 對開發者來說,這代表「送交官方檢測」從一個概念,變成了一個可操作的選項。
把今天的內容收攏起來,就能理解為什麼 Day 15 把 AIEC 定位為「台灣 AI 可信任度的官方基礎設施」:
「基礎設施」這個詞是關鍵:就像自來水廠之於供水、電網之於供電,AIEC 是台灣 AI 產業「可信任度」這件事的公共供給者。它不生產某一個模型,但它讓所有模型都有一個共同的、可信的檢驗基準。
把 AIEC 接回本系列的檢索增強生成(Retrieval-Augmented Generation,以下簡稱 RAG)客服範例,有兩層意義:
換句話說,AIEC 的十大評測項目,會是本系列後半「從法條到程式碼」的驗收清單。今天先把這個機構與它的十項考題放上桌,後面再逐一把技術控制對上去。
今天走進了台灣 AI 評測地圖的核心機構 AIEC:
明天(Day 17)把三角色中的兩個執行機構拆開細看——AI 測試實驗室與 AI 驗證機構。 「測試」和「驗證」到底差在哪?一個產品從送測到取得證明,要走過哪些關卡?這組分工,是理解整個評測體系可信度的關鍵。