iT邦幫忙

2026 iThome 鐵人賽

DAY 16
0

📝 本系列為 iThome 鐵人賽學習筆記,屬個人教學與非商業用途;文中法規與標準內容均以自身理解後的話轉述並註明出處,非逐字引用。

階段三|台灣有哪些機構與資源

AIEC 是台灣 AI 可信任度的官方評測中心

把地圖第三層放大來看

昨天(Day 15)攤開了台灣 AI 治理制度的三層地圖,最底下那層「評測驗證層」出現了幾個新名字:AI 產品與系統評測中心、AI 測試實驗室、AI 驗證機構,以及背後的財團法人全國認證基金會。今天起的三天,就把這一層逐站走深。

第一站,也是這整層的入口——AI 產品與系統評測中心(Artificial Intelligence Evaluation Center,以下簡稱 AIEC)。它是台灣官方為「AI 可不可以信任」這個問題所建立的評測機構,也是本系列最終那份檢核表的骨架來源。今天要回答三件事:AIEC 為什麼要設、它的制度怎麼設計、它實際上為產業做了什麼。

一個對開發者最直接的切入點先講在前面:如果你手上有一個大型語言模型(Large Language Model,以下簡稱 LLM)應用,想找一個「官方認可、又不必花大錢」的地方檢測它可不可信,AIEC 就是台灣目前唯一的答案。這不是遠在天邊的政策,而是開發者現階段即可申請的服務。

為什麼台灣需要自己的評測中心

國際的 AI 評測榜單(benchmark)眾多,台灣為何仍要自建一套?原因有三個,都與「在地」與「可信任」有關,如下圖所示。

台灣自建評測中心的三個理由

第一,國際榜單量不到台灣在地的能力。 國際上熱門的評測,題目大多以英文、以歐美的知識與情境為主。一個模型在英文考題上拿高分,不代表它讀得懂台灣的用語、法規、社會情境。台灣需要一套用繁體中文、貼台灣脈絡的題目,才測得出「這個模型在台灣用起來到底行不行」。

第二,可信任不只是「答得準」。 一個模型答題正確率高,但會不會洩漏個資、會不會被繞過安全限制、會不會產生歧視性輸出?這些「可信任度」的面向,一般的能力榜單不會測。台灣需要一套把安全、隱私、公平、可解釋等治理面向一起納入的評測,才對得上前面兩階段講的法規原則。

第三,官方基礎設施才有公信力。 廠商自己說「我的模型很安全」沒有說服力;由官方認可的第三方機構來測、來背書,這張成績單在標案、採購、合規場景才站得住腳。這正是 Day 15 講的「驗證與認證」在產品端的落點。

把這三點合起來,就是 AIEC 存在的理由:替台灣建立一套在地化、涵蓋可信任度、且具官方公信力的 AI 評測基礎設施。

AIEC 怎麼來的:從一場啟動活動說起

AIEC 的起點是一場公開活動。2023 年 12 月 6 日,數位發展部(以下簡稱數位部)在臺北科技大學舉辦「AI 產品與系統評測中心」啟動活動,時任數位部部長唐鳳、行政院政務委員兼國家科學及技術委員會主任委員吳政忠等人出席,TAIDE、Meta、微軟等語言模型開發商也到場——這個陣仗本身就說明了它的定位:不是內部研究計畫,而是要對產業、對國際亮相的公共基礎設施。

AIEC 的設立時間軸

從啟動到兩個執行機構到位的時間軸,如上圖所示。它的承接分工,Day 15 已經點過,這裡補上完整脈絡:AIEC 由數位部轄下的數位發展部數位產業署(以下簡稱數產署)主辦,與國家資通安全研究院(以下簡稱資安院)財團法人工業技術研究院(以下簡稱工研院)合作設立。啟動時就宣告了後續兩步:隔年(2024 年)陸續成立測試實驗室驗證機構,正式提供評測與驗證服務——這兩個機構的成立與分工,是明天 Day 17 的主題。

換句話說,2023 年底啟動的是「中心與制度」,2024 年落地的是「執行的手腳」。今天先把「中心與制度」講清楚。

AIEC 的制度設計:一個中心,三種角色

這裡要破除一個常見的誤解:AIEC 不是「一間實驗室」,而是一套由三種角色構成的評測體系。理解這三種角色的分工,是讀懂整個台灣 AI 評測制度的關鍵。下圖呈現三種角色的分工與產出:

AIEC 評測體系的三種角色

用一個比喻來記:AIEC 中心像是「出題與定規則的考試院」,測試實驗室像「監考與閱卷的試務單位」,驗證機構像「複核成績、簽發證明的審查單位」。 三者各司其職,才能讓一張成績單既專業又可信。今天的主角是最上層的「中心」;測試與驗證這兩個角色的差別,留到明天細講。

中心內部:三個組成部分

依啟動時的官方說明,AIEC 中心本身由三個部分組成:

  • 制度推動委員會:負責政策面——決定評測制度的方向、範圍與推動節奏。
  • 技術審議小組:負責技術面——審議評測項目、題庫、方法等專業內容。
  • 秘書組:負責行政面——承擔中心日常運作的幕僚與協調工作。

一個管方向、一個管專業、一個管行政運作,讓評測制度「既符合政策目標,又站得住技術腳跟,還推得動日常事務」。

兩份核心文件

AIEC 要產出的最重要成果,是兩份文件:「AI 產品與系統評測制度」「AI 產品與系統評測指引」。前者定「這套評測怎麼運作、誰來測、怎麼認定」;後者定「具體要測什麼、怎麼測」。對想送測的廠商而言,這兩份文件就是遊戲規則書。

AIEC 實際做了什麼:十大評測項目與送測窗口

制度講完,來看 AIEC 具體端出了什麼。

十大評測項目

AIEC 參考美國國家標準暨技術研究院(National Institute of Standards and Technology,NIST)、國際標準化組織(International Organization for Standardization,ISO)與歐盟等國際規範,先針對語言模型規劃出十大評測項目:安全性、可解釋性、彈性(Resilient,或譯韌性)、公平性、準確性、透明性、當責性、可靠性、隱私、資安。

這十項是本系列的重要資產——它幾乎可以直接當作一份「AI 系統該檢查哪些面向」的檢核表骨架,也是本系列最終白皮書的欄位藍本。它的逐項拆解是後天(Day 18)的專題,今天先讓它在地圖上就位。

當前的送測窗口

在體系仍處試營運(概念驗證,Proof of Concept,以下簡稱 PoC)階段時,AIEC 中心同時扮演送測的統一窗口:AI 產品開發者透過 AIEC 提出申請,由 AI 測試實驗室執行測試、出具測試報告。也就是說,現階段你不需要分別找不同機構,一個窗口就能啟動整個流程。

一個活的進展:它已經開始運轉了

制度不是紙上談兵。AIEC 從啟動至今,已經累積了實際的評測成果——這是一個仍在成長的體系,而不是一份靜態的文件。

AIEC 試營運階段的評測進展

如上圖所示,截至 2025 年,AIEC 的試營運已有具體數字與成果:

  • 送測踴躍:試營運期間累積約 8 家廠商、超過 80 款模型送測,是實際有人在用的服務,而非樣板。
  • 首度公布評測結果:2025 年 10 月,AIEC 首度對外公布語言模型的基準評測結果,涵蓋數十個中外語言模型。
  • 在地化是核心指標:這批評測特別納入貼近台灣脈絡的題目——例如以高中學科能力測驗(學測)的國文、社會科題目測「讀不讀得懂台灣的知識」,並以「臺灣價值觀」指標測模型回應是否貼合本地社會情境。這正是前面說的「國際榜單量不到的東西」。

這些數字會隨時間更新,但趨勢很清楚:台灣已經有一個實際運轉、且以在地化為特色的官方 AI 評測機構。 對開發者來說,這代表「送交官方檢測」從一個概念,變成了一個可操作的選項。

為什麼說它是「官方基礎設施」

把今天的內容收攏起來,就能理解為什麼 Day 15 把 AIEC 定位為「台灣 AI 可信任度的官方基礎設施」:

  • 它由政府機關(數產署)主辦、國家級法人(資安院、工研院)執行,具官方公信力
  • 它建立的是制度與方法,而非一次性的測試,是可長可久的基礎設施
  • 它以在地化與可信任度為核心,補上國際榜單的空缺。

「基礎設施」這個詞是關鍵:就像自來水廠之於供水、電網之於供電,AIEC 是台灣 AI 產業「可信任度」這件事的公共供給者。它不生產某一個模型,但它讓所有模型都有一個共同的、可信的檢驗基準。

對映到本系列與 RAG 範例

把 AIEC 接回本系列的檢索增強生成(Retrieval-Augmented Generation,以下簡稱 RAG)客服範例,有兩層意義:

  • 它是我們技術實作的「驗收標準」:第四階段(Day 21–30)每做一道防禦——資料治理、輸入過濾、輸出揭露、存取控制、稽核日誌——都可以問一句「這對應 AIEC 十大評測項目的哪一項?」讓每一段程式都對準官方的評測語言。
  • 它讓合規有了具體終點:當這個 RAG 客服真的要投入醫院或政府場景時,「送 AIEC 檢測、拿到評測結果」就是一條具體可走的可信任度證明路徑,而不是空喊「我們很安全」。

換句話說,AIEC 的十大評測項目,會是本系列後半「從法條到程式碼」的驗收清單。今天先把這個機構與它的十項考題放上桌,後面再逐一把技術控制對上去。

小結與明日預告

今天走進了台灣 AI 評測地圖的核心機構 AIEC:

  • 為什麼要設:國際榜單量不到台灣的在地能力與可信任度,官方基礎設施才有公信力;
  • 怎麼來的:2023 年 12 月 6 日由數位部啟動,數產署主辦、資安院與工研院合作設立,2024 年再成立測試實驗室與驗證機構;
  • 制度怎麼設計:一個中心、三種角色(中心制定制度、測試實驗室測試、驗證機構驗證),中心內部由制度推動委員會、技術審議小組與秘書組三部分組成,產出評測制度與評測指引兩份文件;
  • 實際做了什麼:規劃十大評測項目、擔任試營運送測窗口,截至 2025 年已累積逾 80 款模型送測,並於該年首度公布涵蓋數十個中外語言模型的在地化評測結果。

明天(Day 17)把三角色中的兩個執行機構拆開細看——AI 測試實驗室與 AI 驗證機構。 「測試」和「驗證」到底差在哪?一個產品從送測到取得證明,要走過哪些關卡?這組分工,是理解整個評測體系可信度的關鍵。


  • 程式碼:本篇為機構與制度介紹,無對應程式碼;十大評測項目與技術控制的對映見第四階段(Day 21–30)。
  • 參考條文/出處:數位發展部新聞發布〈數位發展部「AI產品與系統評測中心」啟動〉(2023/12/6,moda.gov.tw/ADI/news/latest-news/9295);AIEC 官方網站(aiec.org.tw)之成立背景、主要評測項目與送測說明;數位產業署〈AIEC 公布最新語言模型評測結果〉新聞發布(2025,moda.gov.tw);iThome、TechNews 等媒體對 AIEC 試營運進展之公開報導。以上均為政府公開資料與公開報導,本文以自己的話摘述並註明出處。

上一篇
Day 15:台灣 AI 治理制度地圖
下一篇
Day 17:測試實驗室 × 驗證機構
系列文
從法條到程式碼:台灣 AI 治理與資安合規實戰指南18
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言