上一篇,我們比較了台灣急診檢傷與急迫度分級量表、韓國急診檢傷與急迫度分級量表,以及急診嚴重度指數。三套制度都輸出第一級到第五級,但主訴、規則、判斷順序與版本不能混用。
現在問題往前一步:既然大型語言模型(Large Language Model, LLM)可以閱讀病患主訴、整理病史,甚至寫出很完整的理由,能不能把一段急診紀錄直接交給它,請它決定檢傷級數?
答案不是「LLM 完全不能用」,而是:不能把一個語句流暢的回答,直接當成已經通過規則核對與臨床覆核的決策。
沿用前一篇的教學情境:病患主訴呼吸困難,呼吸速率每分鐘 28 次,血氧飽和度(Peripheral Oxygen Saturation, SpO2)為 91%。如果其他必要資訊沒有提供,模型卻自行補上「意識清楚、生命徵象穩定」,再給出肯定的級數與一組看似正式的規則編號,文字可能很完整,判斷基礎卻是虛構的。
這段情境刻意沒有提供正式級數。單靠三個欄位不足以替真實病患完成檢傷,本文也不提供可以自行使用的醫療分級規則。它要凸顯的是:系統不知道的事,不能因為句子寫得自然就變成已知事實。
下圖把這個問題畫成一張概念圖。左側的回答卡看起來整齊而有說服力,右側的檢傷人員仍需要逐項查看來源、版本、缺失資料與規則是否真的成立。

上圖提醒我們:回答讀起來流暢,不代表來源、門檻、版本與缺失資料都已經通過檢查。這是概念示意,不是正式的急診檢傷操作介面。
讀完 Day 04 後,你應該能夠:
這篇的新名詞比較多,先建立一張快速索引。正文仍會用例子逐一解釋。
| 中文名稱 | 英文全名/縮寫 | 在本篇的用途 |
|---|---|---|
| 生成式人工智慧 | Generative Artificial Intelligence, Generative AI | 根據輸入產生文字、影像或其他內容的人工智慧系統類型 |
| 詞元 | Token | LLM 閱讀與產生文字時處理的基本片段 |
| 虛構 | Confabulation | 模型自信地產生錯誤或不存在的內容;也常被稱為幻覺 |
| 提示工程 | Prompt Engineering | 設計模型指令、範例與輸出格式的方法 |
| 自動化偏誤 | Automation Bias | 人在使用系統時,過度相信自動化建議而忽略錯誤的傾向 |
| 臨床決策支援 | Clinical Decision Support, CDS | 提供資訊或建議,協助而非取代醫療專業人員判斷的系統功能 |
| 拒答 | Abstention | 資訊不足或風險過高時,系統明確不產生確定判斷 |
| 證據錨定 | Grounding | 讓回答連回可查證的外部資料或規則來源 |
生成式人工智慧(Generative Artificial Intelligence, Generative AI)是能根據輸入產生新內容的人工智慧系統。LLM 是其中專門處理語言的一類模型。
在急診文字處理上,LLM 確實具有價值。例如,它可以協助:
自然語言是人平常說話與書寫的語言。它不像資料庫欄位那樣整齊:同一個症狀可能有多種說法,時間、程度與否定語氣也可能散落在句子不同位置。LLM 能處理這些變化,正是它比單純關鍵字搜尋更有吸引力的地方。
不過,「能整理輸入」和「能對每一項規則給出可重現的正確判斷」是兩個不同能力。前者可以容許語句有不同表達;後者必須面對精確門檻、缺失資料、正式版本與責任歸屬。
詞元(Token)是 LLM 處理文字時的基本片段。它可能是一個中文字、一個英文字的一部分、標點符號或其他文字單位,不一定等於完整的一個「詞」。
LLM 在產生回答時,會根據先前的輸入與已產生內容,估計下一個詞元的可能性,再一步一步延伸成完整回答。這種訓練方式讓模型很會延續語意、改寫文字與整理模式,也可能完成多步推理。
但它和傳統規則程式仍有根本差別。
確定性程式(Deterministic Program)是相同輸入與條件會產生相同結果的程式。假設它收到一條條件 x < 92,程式會按照比較運算子的定義處理:91 符合、92 不符合;如果 x 缺失,程式還可以被明確設計成停止並回報缺值。只要程式、輸入與規則版本相同,結果就應該相同。
LLM 則是產生最可能符合上下文的文字。它可能正確解釋 x < 92,卻沒有一個自動保證,確保每次回答都遵守所有數值比較、例外條件與缺值規則。
美國國家標準暨技術研究院(National Institute of Standards and Technology, NIST)在生成式人工智慧風險管理文件中也指出,LLM 的統計式預測可能產生準確內容,也可能產生錯誤或不一致內容;這類風險在醫療等後果重大的情境尤其重要。NIST:生成式人工智慧風險管理框架概要
因此,我們不能把「模型常常答對」改寫成「模型已經保證會逐條執行規則」。前者是需要測量的經驗表現;後者是系統設計必須另外提供的約束。
下圖整理六種需要在設計階段先處理的失敗模式。這些問題不表示每一次回答都會出錯,而是表示系統不能假設它們永遠不會發生。

上圖把六種風險放在同一個位置,方便後續逐項拆解。它們可能單獨發生,也可能在同一次回答中互相影響。
虛構(Confabulation)是模型產生錯誤或不存在內容,卻用流暢而肯定的方式表達的現象。日常討論也常把它稱為「幻覺」(Hallucination);這裡的幻覺是人工智慧技術用語,不是病患的臨床症狀。
模型可能虛構規則名稱、條文、網址、研究引用,甚至補出一段看似合理的推理。NIST 特別把這種「自信但錯誤的內容」列為生成式人工智慧的核心風險,並提醒模型也可能捏造背後邏輯或引用。
在一般聊天中,一個錯誤書名可能只是麻煩;在急診決策支援中,一條不存在的門檻可能改變人員處理順序。兩者的錯誤成本不同,驗證要求也不能相同。
數值規則在意的不只是大概高或大概低,而是精確比較:小於、等於、小於或等於,以及不同年齡或情境適用的門檻。
模型可能正確算出大多數案例,卻在臨界值、單位轉換或多條件組合中出錯。高風險系統不能因為錯誤只發生在少數邊界,就把它視為可以忽略的文字差異。
如果紀錄只寫「呼吸困難」,模型可能受到常見敘事模式影響,自行補成「意識清楚」或「生命徵象穩定」。這些句子在語言上很自然,資料上卻沒有根據。
缺失值不是零,也不是正常值。它只代表「目前沒有資料」。正確設計應該保留未知狀態,必要時要求補充或停止自動判斷。
模型訓練資料可能包含不同年份、不同地區或不同制度的資訊。即使回答引用了真的規則,仍可能不是本次實驗指定的版本。
這就是版本漂移(Version Drift):模型、知識來源或系統設定隨時間改變,導致同一個名稱背後的實際內容不再相同。Day 03 已經看過三套五級制度不能直接換名字;同一套制度的不同版本也必須分開記錄。
相同問題在不同模型版本、不同提示詞或不同產生設定下,可能得到不同答案。這不一定是錯誤,因為語言本來就可以有多種合理說法;但當輸出被拿來支援高風險決策時,系統必須知道這次究竟用了哪個模型、哪份提示詞與哪套規則。
如果只保留最後的級數,沒有保留輸入、模型版本、規則版本與執行紀錄,日後就很難重現為什麼得到這個結果。
自動化偏誤(Automation Bias)是使用者過度依賴自動化建議,因而忽略相反證據或停止獨立檢查的傾向。
大型多模態模型(Large Multi-Modal Model, LMM)是能接收文字、影像或其他多種資料形式的大型生成模型。世界衛生組織(World Health Organization, WHO)在 2024 年的 LMM 指引中提醒,模型可能產生錯誤、不準確、有偏見或不完整的陳述;醫療人員與病患也可能因自動化偏誤而忽略錯誤,或把困難選擇不當地交給模型。WHO:大型多模態模型的倫理與治理指引
所以問題不只是「模型會不會錯」,也包括「人看到很有自信的答案後,還會不會繼續檢查」。介面如果只顯示醒目的級數,卻把證據、缺值與不確定性藏起來,就會放大這項風險。
接下來用一條純數學的合成規則說明數值邊界。合成表示這是為教學刻意建立的例子,不是真實檢傷制度的門檻,也不能拿來判斷病患。
規則只有一行:
如果 x < 92,走「是」分支;否則走「否」分支。
下圖請依序看 91、92 與未知值三張卡。重點不是數字 92,而是小於符號、等於邊界與缺失值必須被精確區分。

上圖把小於門檻、等於門檻與未知值分開呈現。三種輸入應該這樣處理:
x = 91:因為 91 小於 92,條件成立。x = 92:因為 92 等於 92,不符合「小於 92」。x = 未知:沒有足夠資料比較,不能擅自改成零、正常或任意數值。確定性程式適合負責這種可明確編碼的比較,因為每一條分支都能測試。LLM 可以把結果翻成易懂說明,卻不應成為唯一的數值比較保證。
真正的檢傷規則還會比這個例子複雜:相同數值可能因年齡、主訴、病史、量測單位或其他臨床表現而有不同意義。因此,不能從上圖推論「任何一個數字都能單獨決定級數」。
提示工程(Prompt Engineering)是設計模型指令、背景資料、範例與輸出格式的方法。好的提示詞非常重要,它可以要求模型:
這些要求能改善回答,卻不能單獨提供下列保證:
提示詞像一份清楚的工作說明,可以降低誤解;但工作說明不能取代資料驗證、規則執行、版本管理與人工覆核。
臨床決策支援(Clinical Decision Support, CDS)是向醫療專業人員提供資訊或建議,協助他們做出判斷的系統功能。這裡的關鍵字是「支援」:系統輸出不是自動取代臨床人員的最終決定。
下圖將本系列規劃的責任邊界分成六個步驟。從左到右讀,可以看到 LLM 只負責其中一部分,不直接包辦整條流程。

上圖中的六個步驟各自解決不同問題:
系統先確認必要欄位是否存在、數值能否解析、單位是否一致,以及哪些資料仍是未知。這一步的輸出是一份保留缺值狀態的結構化資料,而不是先猜出缺少的內容。
能寫成清楚比較式的數值條件、安全門檻與必要欄位檢查,由一般程式執行並建立單元測試。單元測試(Unit Test)是用小型、可預期的輸入檢查單一程式行為是否正確的方法。
證據錨定(Grounding)是讓回答連回可查證外部資料的做法。系統不只告訴模型「請依規則回答」,而是從指定制度、指定版本的知識庫取回相關段落,並保留來源網址、文件日期與規則識別碼(Rule Identifier, Rule ID)。
模型接收已驗證欄位與取回的證據,負責摘要主訴、整理候選依據與產生可讀說明。輸出格式必須把「病患原始資料」「規則原文」「模型解釋」分開,避免讀者分不出哪一句來自哪裡。
拒答(Abstention)是系統在資訊不足、證據互相衝突或超出設計範圍時,不產生確定判斷,而是回報缺少什麼以及需要交由誰處理。
拒答不是系統壞掉,也不是把空白包裝成答案。它是刻意保留安全出口:與其很有自信地猜,不如讓不確定案例回到人工流程。
臨床人員需要看得到輸入、缺值、規則來源、版本與系統理由,並能接受、修改或否決建議。系統也應保存操作紀錄,讓團隊日後知道錯誤發生在輸入、規則檢索、模型整理或人工使用哪一層。
美國食品藥物管理局(U.S. Food and Drug Administration, FDA)在 2026 年更新的臨床決策支援軟體指引中,也把「醫療專業人員能獨立檢視建議基礎,而不是主要依賴系統」列為重要判準。FDA:Clinical Decision Support Software 指引
這份 FDA 文件屬於美國法規脈絡,且指引本身說明其建議不具法律強制力。本文引用它作為可檢視建議基礎的設計參考,不用它推定台灣產品的法規分類或合規狀態。
把系統拆成角色後,就能更精確地說明誰負責什麼。
| 角色 | 適合負責 | 不應被假設能單獨保證 |
|---|---|---|
| 確定性程式 | 欄位驗證、單位檢查、固定數值比較、安全門檻 | 理解所有自然語言語意與臨床例外 |
| LLM | 摘要主訴、抽取候選資訊、整理證據、產生可讀說明 | 規則永遠正確、資料永不虛構、最終級數必然安全 |
| 臨床人員 | 結合病患當下狀況、正式制度與專業判斷完成覆核 | 在缺少來源與介面線索時自動察覺所有模型錯誤 |
最後一列尤其重要。把人放在流程裡,不代表安全問題就自動消失。如果介面用巨大字體顯示級數,卻把證據藏在很多層之後,臨床人員仍可能受到自動化偏誤影響。
WHO 在 2023 年針對健康領域生成式人工智慧提出警告:模型回答可能看起來合理而權威,內容卻完全錯誤或包含嚴重錯誤;導入前需要透明度、專家監督與嚴謹評估。WHO:健康領域大型語言模型的安全與倫理呼籲
因此,完整責任邊界還要包含介面設計、教育訓練、異常通報與上線後監測,而不是在流程圖最後放一個「人工確認」方框就宣告完成。
目前這套責任邊界仍是系統設計計畫,不是已完成的臨床結果。後續實作至少要分層驗證:
這種分層測試還有一個好處:結果錯誤時,我們可以問「是哪一層失敗」,而不只是得到一句籠統的「模型答錯了」。
模型可能正確完成許多推理題,但這不等於每次都會精確執行所有數值邊界、缺值處理與版本限制。可明確編碼的條件仍應交給可測試的程式。
產生溫度(Generation Temperature)是調整模型輸出多樣性的設定。降低它通常能減少文字變化,卻不會把錯誤知識變正確,也不能保證所有執行環境都完全重現。
這是一項有用指令,不是可驗證保證。系統仍需要真實證據、引用核對、缺值處理與拒答機制。
可追溯不只要有網址,還要確認網址真的存在、段落支持結論、文件版本正確,並保存當次系統實際使用的內容。
如果人員看不到模型依據、缺失資料與替代選項,按鈕可能只是形式。有效覆核需要足夠資訊、時間、權限與清楚的責任分工。
不能。本系列建立的是可重現的研究型決策支援原型。資料品質、臨床效能、偏差、資訊安全、人因介面、法規與真實流程整合都需要額外驗證。
Day 04 建立了五條系統邊界:
你可以用下面五個問題自行檢查:
如果五題都能回答,就已經掌握下一步設計知識檢索與證據引用時最重要的安全前提。
大型語言模型不是規則手冊,也不是數值比較器。它最有價值的角色,是把不規則的自然語言整理成可理解資訊,再根據已驗證資料與可查證證據產生說明。
一個比較可靠的決策支援流程,會把輸入驗證、確定性規則、版本化證據、語言整理、拒答與臨床覆核分開。這種拆分不保證系統永遠不出錯,但能讓錯誤更容易被測試、發現、追查與修正。
真正要追求的不是讓模型「任何問題都敢回答」,而是讓系統知道自己用了什麼、缺少什麼、何時應該停止,以及誰負責最後決定。
Day 05 會介紹檢索增強生成(Retrieval-Augmented Generation, RAG):先從外部知識庫找出相關內容,再把內容交給 LLM 產生回答。
RAG 能改善模型不知道最新規則或找不到來源的問題,但不會自動消除所有風險。下一篇會把「沒有找到正確資料」的檢索失敗,和「拿到正確資料卻說錯」的生成失敗分開說清楚。