iT邦幫忙

2026 iThome 鐵人賽

DAY 4
0
佛心分享-SideProject30

30 天打造公開資料版急診檢傷系統:Side Project 與實驗計畫系列 第 4

Day 04|大型語言模型很會讀文字,為什麼不能直接決定檢傷級數?

  • 分享至 

  • xImage
  •  

上一篇,我們比較了台灣急診檢傷與急迫度分級量表、韓國急診檢傷與急迫度分級量表,以及急診嚴重度指數。三套制度都輸出第一級到第五級,但主訴、規則、判斷順序與版本不能混用。

現在問題往前一步:既然大型語言模型(Large Language Model, LLM)可以閱讀病患主訴、整理病史,甚至寫出很完整的理由,能不能把一段急診紀錄直接交給它,請它決定檢傷級數?

答案不是「LLM 完全不能用」,而是:不能把一個語句流暢的回答,直接當成已經通過規則核對與臨床覆核的決策。

沿用前一篇的教學情境:病患主訴呼吸困難,呼吸速率每分鐘 28 次,血氧飽和度(Peripheral Oxygen Saturation, SpO2)為 91%。如果其他必要資訊沒有提供,模型卻自行補上「意識清楚、生命徵象穩定」,再給出肯定的級數與一組看似正式的規則編號,文字可能很完整,判斷基礎卻是虛構的。

這段情境刻意沒有提供正式級數。單靠三個欄位不足以替真實病患完成檢傷,本文也不提供可以自行使用的醫療分級規則。它要凸顯的是:系統不知道的事,不能因為句子寫得自然就變成已知事實。

下圖把這個問題畫成一張概念圖。左側的回答卡看起來整齊而有說服力,右側的檢傷人員仍需要逐項查看來源、版本、缺失資料與規則是否真的成立。

檢傷人員用放大鏡檢查一張看似完整的模型回答卡,周圍以斷裂連結、儀表、時鐘和空白資料夾表示來源、門檻、版本與缺失資料風險

上圖提醒我們:回答讀起來流暢,不代表來源、門檻、版本與缺失資料都已經通過檢查。這是概念示意,不是正式的急診檢傷操作介面。


讀完這篇,你會知道什麼?

讀完 Day 04 後,你應該能夠:

  1. 說明 LLM 適合協助哪些醫療文字工作。
  2. 解釋「預測下一個詞元」和「執行固定規則」的差別。
  3. 辨認虛構內容、數值邊界、缺失資料、版本漂移與過度信任等風險。
  4. 說明為什麼改善提示詞仍不能單獨解決上述問題。
  5. 畫出 LLM、確定性程式與臨床人員之間的責任邊界。

這篇會用到的名詞

這篇的新名詞比較多,先建立一張快速索引。正文仍會用例子逐一解釋。

中文名稱 英文全名/縮寫 在本篇的用途
生成式人工智慧 Generative Artificial Intelligence, Generative AI 根據輸入產生文字、影像或其他內容的人工智慧系統類型
詞元 Token LLM 閱讀與產生文字時處理的基本片段
虛構 Confabulation 模型自信地產生錯誤或不存在的內容;也常被稱為幻覺
提示工程 Prompt Engineering 設計模型指令、範例與輸出格式的方法
自動化偏誤 Automation Bias 人在使用系統時,過度相信自動化建議而忽略錯誤的傾向
臨床決策支援 Clinical Decision Support, CDS 提供資訊或建議,協助而非取代醫療專業人員判斷的系統功能
拒答 Abstention 資訊不足或風險過高時,系統明確不產生確定判斷
證據錨定 Grounding 讓回答連回可查證的外部資料或規則來源

先肯定模型真正擅長的事

生成式人工智慧(Generative Artificial Intelligence, Generative AI)是能根據輸入產生新內容的人工智慧系統。LLM 是其中專門處理語言的一類模型。

在急診文字處理上,LLM 確實具有價值。例如,它可以協助:

  • 從自然語言主訴中找出症狀、時間與否定敘述。
  • 把「喘了兩天,今天更嚴重」整理成較一致的結構。
  • 將很長的紀錄濃縮成供人員查看的摘要。
  • 把已經取得的欄位整理成固定格式,減少人工複製。
  • 用白話解釋一條已找到的規則,幫助讀者理解。

自然語言是人平常說話與書寫的語言。它不像資料庫欄位那樣整齊:同一個症狀可能有多種說法,時間、程度與否定語氣也可能散落在句子不同位置。LLM 能處理這些變化,正是它比單純關鍵字搜尋更有吸引力的地方。

不過,「能整理輸入」和「能對每一項規則給出可重現的正確判斷」是兩個不同能力。前者可以容許語句有不同表達;後者必須面對精確門檻、缺失資料、正式版本與責任歸屬。

模型是在產生文字,不是在執行一本看得見的規則手冊

詞元(Token)是 LLM 處理文字時的基本片段。它可能是一個中文字、一個英文字的一部分、標點符號或其他文字單位,不一定等於完整的一個「詞」。

LLM 在產生回答時,會根據先前的輸入與已產生內容,估計下一個詞元的可能性,再一步一步延伸成完整回答。這種訓練方式讓模型很會延續語意、改寫文字與整理模式,也可能完成多步推理。

但它和傳統規則程式仍有根本差別。

確定性程式(Deterministic Program)是相同輸入與條件會產生相同結果的程式。假設它收到一條條件 x < 92,程式會按照比較運算子的定義處理:91 符合、92 不符合;如果 x 缺失,程式還可以被明確設計成停止並回報缺值。只要程式、輸入與規則版本相同,結果就應該相同。

LLM 則是產生最可能符合上下文的文字。它可能正確解釋 x < 92,卻沒有一個自動保證,確保每次回答都遵守所有數值比較、例外條件與缺值規則。

美國國家標準暨技術研究院(National Institute of Standards and Technology, NIST)在生成式人工智慧風險管理文件中也指出,LLM 的統計式預測可能產生準確內容,也可能產生錯誤或不一致內容;這類風險在醫療等後果重大的情境尤其重要。NIST:生成式人工智慧風險管理框架概要

因此,我們不能把「模型常常答對」改寫成「模型已經保證會逐條執行規則」。前者是需要測量的經驗表現;後者是系統設計必須另外提供的約束。

只靠大型語言模型,會遇到哪些失敗?

下圖整理六種需要在設計階段先處理的失敗模式。這些問題不表示每一次回答都會出錯,而是表示系統不能假設它們永遠不會發生。

只靠大型語言模型的六種失敗模式,包含虛構規則、數值邊界誤判、補完缺失資料、規則版本未鎖定、輸出隨設定改變,以及過度自信與過度信任

上圖把六種風險放在同一個位置,方便後續逐項拆解。它們可能單獨發生,也可能在同一次回答中互相影響。

寫出不存在的規則或來源

虛構(Confabulation)是模型產生錯誤或不存在內容,卻用流暢而肯定的方式表達的現象。日常討論也常把它稱為「幻覺」(Hallucination);這裡的幻覺是人工智慧技術用語,不是病患的臨床症狀。

模型可能虛構規則名稱、條文、網址、研究引用,甚至補出一段看似合理的推理。NIST 特別把這種「自信但錯誤的內容」列為生成式人工智慧的核心風險,並提醒模型也可能捏造背後邏輯或引用。

在一般聊天中,一個錯誤書名可能只是麻煩;在急診決策支援中,一條不存在的門檻可能改變人員處理順序。兩者的錯誤成本不同,驗證要求也不能相同。

看錯數值邊界

數值規則在意的不只是大概高或大概低,而是精確比較:小於、等於、小於或等於,以及不同年齡或情境適用的門檻。

模型可能正確算出大多數案例,卻在臨界值、單位轉換或多條件組合中出錯。高風險系統不能因為錯誤只發生在少數邊界,就把它視為可以忽略的文字差異。

把沒有提供的資料補成正常

如果紀錄只寫「呼吸困難」,模型可能受到常見敘事模式影響,自行補成「意識清楚」或「生命徵象穩定」。這些句子在語言上很自然,資料上卻沒有根據。

缺失值不是零,也不是正常值。它只代表「目前沒有資料」。正確設計應該保留未知狀態,必要時要求補充或停止自動判斷。

混用不同版本的規則

模型訓練資料可能包含不同年份、不同地區或不同制度的資訊。即使回答引用了真的規則,仍可能不是本次實驗指定的版本。

這就是版本漂移(Version Drift):模型、知識來源或系統設定隨時間改變,導致同一個名稱背後的實際內容不再相同。Day 03 已經看過三套五級制度不能直接換名字;同一套制度的不同版本也必須分開記錄。

輸出隨模型或設定改變

相同問題在不同模型版本、不同提示詞或不同產生設定下,可能得到不同答案。這不一定是錯誤,因為語言本來就可以有多種合理說法;但當輸出被拿來支援高風險決策時,系統必須知道這次究竟用了哪個模型、哪份提示詞與哪套規則。

如果只保留最後的級數,沒有保留輸入、模型版本、規則版本與執行紀錄,日後就很難重現為什麼得到這個結果。

肯定語氣讓人忽略不確定性

自動化偏誤(Automation Bias)是使用者過度依賴自動化建議,因而忽略相反證據或停止獨立檢查的傾向。

大型多模態模型(Large Multi-Modal Model, LMM)是能接收文字、影像或其他多種資料形式的大型生成模型。世界衛生組織(World Health Organization, WHO)在 2024 年的 LMM 指引中提醒,模型可能產生錯誤、不準確、有偏見或不完整的陳述;醫療人員與病患也可能因自動化偏誤而忽略錯誤,或把困難選擇不當地交給模型。WHO:大型多模態模型的倫理與治理指引

所以問題不只是「模型會不會錯」,也包括「人看到很有自信的答案後,還會不會繼續檢查」。介面如果只顯示醒目的級數,卻把證據、缺值與不確定性藏起來,就會放大這項風險。

用一條合成規則看懂數值問題

接下來用一條純數學的合成規則說明數值邊界。合成表示這是為教學刻意建立的例子,不是真實檢傷制度的門檻,也不能拿來判斷病患。

規則只有一行:

如果 x < 92,走「是」分支;否則走「否」分支。

下圖請依序看 91、92 與未知值三張卡。重點不是數字 92,而是小於符號、等於邊界與缺失值必須被精確區分。

合成數值規則示範,當 x 為 91 時小於 92 的條件成立,x 為 92 時條件不成立,x 未知時不能自行補成正常或零

上圖把小於門檻、等於門檻與未知值分開呈現。三種輸入應該這樣處理:

  1. x = 91:因為 91 小於 92,條件成立。
  2. x = 92:因為 92 等於 92,不符合「小於 92」。
  3. x = 未知:沒有足夠資料比較,不能擅自改成零、正常或任意數值。

確定性程式適合負責這種可明確編碼的比較,因為每一條分支都能測試。LLM 可以把結果翻成易懂說明,卻不應成為唯一的數值比較保證。

真正的檢傷規則還會比這個例子複雜:相同數值可能因年齡、主訴、病史、量測單位或其他臨床表現而有不同意義。因此,不能從上圖推論「任何一個數字都能單獨決定級數」。

把提示詞寫得更嚴格,還是不夠嗎?

提示工程(Prompt Engineering)是設計模型指令、背景資料、範例與輸出格式的方法。好的提示詞非常重要,它可以要求模型:

  • 按照固定欄位輸出。
  • 把已知資訊和未知資訊分開。
  • 引用提供的規則片段。
  • 在證據不足時回答「無法判斷」。
  • 不輸出超出指定範圍的內容。

這些要求能改善回答,卻不能單獨提供下列保證:

  1. 不能憑空建立權威規則來源:如果沒有把正確文件提供給模型,寫上「只用官方規則」不會讓文件自動出現。
  2. 不能鎖定知識版本:提示詞沒有記錄文件版本、日期與識別碼時,模型仍可能混用內容。
  3. 不能把語言模型變成確定性比較器:一句「請仔細計算」不是所有數值與例外都正確的形式證明。
  4. 不能保證引用真的支持結論:即使輸出有網址或段落編號,系統仍要核對來源是否存在且內容相符。
  5. 不能自動決定何時應該停止:拒答門檻、缺失欄位與高風險情境需要另外設計和測試。

提示詞像一份清楚的工作說明,可以降低誤解;但工作說明不能取代資料驗證、規則執行、版本管理與人工覆核。

比較安全的做法,是把責任拆開

臨床決策支援(Clinical Decision Support, CDS)是向醫療專業人員提供資訊或建議,協助他們做出判斷的系統功能。這裡的關鍵字是「支援」:系統輸出不是自動取代臨床人員的最終決定。

下圖將本系列規劃的責任邊界分成六個步驟。從左到右讀,可以看到 LLM 只負責其中一部分,不直接包辦整條流程。

安全決策支援流程由輸入驗證、確定性規則、版本化證據、大型語言模型整理、引用與拒答,以及臨床人員覆核依序組成

上圖中的六個步驟各自解決不同問題:

先驗證輸入

系統先確認必要欄位是否存在、數值能否解析、單位是否一致,以及哪些資料仍是未知。這一步的輸出是一份保留缺值狀態的結構化資料,而不是先猜出缺少的內容。

讓確定性程式處理明確門檻

能寫成清楚比較式的數值條件、安全門檻與必要欄位檢查,由一般程式執行並建立單元測試。單元測試(Unit Test)是用小型、可預期的輸入檢查單一程式行為是否正確的方法。

從指定版本取得規則

證據錨定(Grounding)是讓回答連回可查證外部資料的做法。系統不只告訴模型「請依規則回答」,而是從指定制度、指定版本的知識庫取回相關段落,並保留來源網址、文件日期與規則識別碼(Rule Identifier, Rule ID)。

讓 LLM 整理,而不是暗中補完

模型接收已驗證欄位與取回的證據,負責摘要主訴、整理候選依據與產生可讀說明。輸出格式必須把「病患原始資料」「規則原文」「模型解釋」分開,避免讀者分不出哪一句來自哪裡。

證據不足時明確拒答

拒答(Abstention)是系統在資訊不足、證據互相衝突或超出設計範圍時,不產生確定判斷,而是回報缺少什麼以及需要交由誰處理。

拒答不是系統壞掉,也不是把空白包裝成答案。它是刻意保留安全出口:與其很有自信地猜,不如讓不確定案例回到人工流程。

由臨床人員完成覆核

臨床人員需要看得到輸入、缺值、規則來源、版本與系統理由,並能接受、修改或否決建議。系統也應保存操作紀錄,讓團隊日後知道錯誤發生在輸入、規則檢索、模型整理或人工使用哪一層。

美國食品藥物管理局(U.S. Food and Drug Administration, FDA)在 2026 年更新的臨床決策支援軟體指引中,也把「醫療專業人員能獨立檢視建議基礎,而不是主要依賴系統」列為重要判準。FDA:Clinical Decision Support Software 指引

這份 FDA 文件屬於美國法規脈絡,且指引本身說明其建議不具法律強制力。本文引用它作為可檢視建議基礎的設計參考,不用它推定台灣產品的法規分類或合規狀態。

三種角色的邊界要寫清楚

把系統拆成角色後,就能更精確地說明誰負責什麼。

角色 適合負責 不應被假設能單獨保證
確定性程式 欄位驗證、單位檢查、固定數值比較、安全門檻 理解所有自然語言語意與臨床例外
LLM 摘要主訴、抽取候選資訊、整理證據、產生可讀說明 規則永遠正確、資料永不虛構、最終級數必然安全
臨床人員 結合病患當下狀況、正式制度與專業判斷完成覆核 在缺少來源與介面線索時自動察覺所有模型錯誤

最後一列尤其重要。把人放在流程裡,不代表安全問題就自動消失。如果介面用巨大字體顯示級數,卻把證據藏在很多層之後,臨床人員仍可能受到自動化偏誤影響。

WHO 在 2023 年針對健康領域生成式人工智慧提出警告:模型回答可能看起來合理而權威,內容卻完全錯誤或包含嚴重錯誤;導入前需要透明度、專家監督與嚴謹評估。WHO:健康領域大型語言模型的安全與倫理呼籲

因此,完整責任邊界還要包含介面設計、教育訓練、異常通報與上線後監測,而不是在流程圖最後放一個「人工確認」方框就宣告完成。

我們會怎麼驗證這條邊界?

目前這套責任邊界仍是系統設計計畫,不是已完成的臨床結果。後續實作至少要分層驗證:

  1. 輸入層:故意拿掉必要欄位,確認系統會保留未知或拒答,不會補成正常。
  2. 規則層:使用小於、等於、略高於門檻的合成案例,確認比較結果符合程式定義。
  3. 檢索層:檢查取回的段落是否來自指定制度與版本,且真的包含回答所需證據。
  4. 生成層:核對模型說明是否只使用輸入與取回內容,引用是否支持結論。
  5. 安全層:觀察高急迫案例的檢傷不足、拒答案例分布,以及人工覆核是否能看見必要證據。
  6. 重現層:保存資料版本、模型名稱、提示詞版本、規則版本與執行時間,確認結果可以追查。

這種分層測試還有一個好處:結果錯誤時,我們可以問「是哪一層失敗」,而不只是得到一句籠統的「模型答錯了」。

幾個容易誤解的地方

「LLM 會推理,所以不需要規則程式」

模型可能正確完成許多推理題,但這不等於每次都會精確執行所有數值邊界、缺值處理與版本限制。可明確編碼的條件仍應交給可測試的程式。

「把溫度設成零,答案就一定正確」

產生溫度(Generation Temperature)是調整模型輸出多樣性的設定。降低它通常能減少文字變化,卻不會把錯誤知識變正確,也不能保證所有執行環境都完全重現。

「提示詞寫上不得虛構,就不會虛構」

這是一項有用指令,不是可驗證保證。系統仍需要真實證據、引用核對、缺值處理與拒答機制。

「有附來源網址就代表可追溯」

可追溯不只要有網址,還要確認網址真的存在、段落支持結論、文件版本正確,並保存當次系統實際使用的內容。

「最後有人按確認,就算人工覆核」

如果人員看不到模型依據、缺失資料與替代選項,按鈕可能只是形式。有效覆核需要足夠資訊、時間、權限與清楚的責任分工。

「這套架構完成後就能直接放進急診」

不能。本系列建立的是可重現的研究型決策支援原型。資料品質、臨床效能、偏差、資訊安全、人因介面、法規與真實流程整合都需要額外驗證。


今天走到了哪裡?

Day 04 建立了五條系統邊界:

  1. LLM 適合整理自然語言,但流暢回答不等於規則正確。
  2. 數值邊界與缺失資料需要確定性程式明確處理。
  3. 提示詞可以改善行為,不能取代權威資料、版本控制與引用核對。
  4. 證據不足時,系統必須能拒答,而不是硬猜一個級數。
  5. 最終輸出屬於臨床決策支援,必須讓專業人員能獨立檢視基礎並完成覆核。

你可以用下面五個問題自行檢查:

  1. 為什麼 LLM 能解釋一條數值規則,仍不適合成為唯一的比較器?
  2. 缺失值為什麼不能自動補成正常?
  3. 提示工程不能單獨解決哪五類問題?
  4. 拒答和系統故障有什麼不同?
  5. 臨床人員要看到哪些資訊,才可能獨立檢視系統建議?

如果五題都能回答,就已經掌握下一步設計知識檢索與證據引用時最重要的安全前提。

本日小結

大型語言模型不是規則手冊,也不是數值比較器。它最有價值的角色,是把不規則的自然語言整理成可理解資訊,再根據已驗證資料與可查證證據產生說明。

一個比較可靠的決策支援流程,會把輸入驗證、確定性規則、版本化證據、語言整理、拒答與臨床覆核分開。這種拆分不保證系統永遠不出錯,但能讓錯誤更容易被測試、發現、追查與修正。

真正要追求的不是讓模型「任何問題都敢回答」,而是讓系統知道自己用了什麼、缺少什麼、何時應該停止,以及誰負責最後決定。

下一篇預告

Day 05 會介紹檢索增強生成(Retrieval-Augmented Generation, RAG):先從外部知識庫找出相關內容,再把內容交給 LLM 產生回答。

RAG 能改善模型不知道最新規則或找不到來源的問題,但不會自動消除所有風險。下一篇會把「沒有找到正確資料」的檢索失敗,和「拿到正確資料卻說錯」的生成失敗分開說清楚。


參考資料


上一篇
Day 03|三套五級急診檢傷制度有什麼不同?同樣五級,規則不能直接換名字
下一篇
Day 05|檢索增強生成是什麼?讓模型回答前先找到證據
系列文
30 天打造公開資料版急診檢傷系統:Side Project 與實驗計畫5
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言