iT邦幫忙

2026 iThome 鐵人賽

DAY 16
0
Build on Google AI

打造高風險場域的智慧決策支援系統(AI for Social Good)系列 第 16

Day 16|被資訊淹沒的醫護人員:醫藥 AI 導入,先確保它不是另一種負擔

  • 分享至 

  • xImage
  •  

Day 15 談完責任歸屬後,留下一個問題:即使系統設計得夠安全,醫護人員真的有足夠的注意力去用它嗎?想像一位醫師的日常——病歷、檢驗、影像、用藥紀錄、病人主訴,每一項都在爭奪同一顆大腦。醫療現場最稀缺的資源,從來都是人的注意力與判斷時間。

正因為注意力這麼貴,這一篇我想把順序倒過來談。先看那些「導入之後,現場反而更累」的失敗案例——看清楚 AI 是怎麼把負荷從一種形式偷偷換成另一種形式的;等我們知道坑在哪裡,再來看那些真的把事情做對的導入經驗,以及各國怎麼把這件事放進制度裡。

一、導入之後更累:失敗案例先看

案例 A:AI 生成病歷,十份草稿七份有錯

先介紹這一節反覆登場的主角:ambient AI scribe(環境式 AI 錄音病歷工具)。它就像診間裡一位隱形的抄寫員——醫師和病人照常對話,不需要對著機器口述,AI 在背景把整段對話聽完,自動整理成一份病歷草稿,醫師確認後簽入系統。「ambient(環境式)」指的就是它安靜待在背景、不打斷看診的特性;賣點很誘人:醫師終於不用一邊看診一邊打字,可以把眼神還給病人。

問題正是出在那份「自動生成的草稿」上。一項 2025 年發表、針對兩種商用 ambient AI scribe 的安全性研究,用 44 個模擬門診對話做測試:44 份草稿裡,31 份至少含一個錯誤——換算下來,每十份草稿,七份有錯;總共揪出 127 個錯誤,平均每份 2.9 個,最常見的是 omission,也就是漏掉重要資訊。錯誤的樣子五花八門:漏記症狀與治療計畫、把否定句聽成肯定句、把 A 說的話記在 B 頭上,甚至把患者隨口的猜測,寫成醫師確認過的事實。

更麻煩的是,錯誤正在「進化」。2025 年 npj Digital Medicine 的回顧指出,現代 LLM 式 scribe 的整體錯誤率雖然比傳統語音辨識低,但錯誤換了一副面孔:

  • 憑空生出對話裡沒有的內容(AI hallucination)
  • 遺漏關鍵資訊(critical omission)
  • 內容歸屬錯誤(misattribution)
  • 語境誤解(contextual misinterpretation)
  • 用藥誤記(medication error)

這比打錯字危險得多——錯誤內容看起來專業又完整,像穿著白袍的謊言,醫師不一定第一眼就能識破。

於是出現一個結構性的兩難:機構若要求醫師把 AI 草稿直接當正式病歷,等於讓錯誤直通病歷系統;若要求逐句確認,「寫病歷」就悄悄變成了「審核 AI」。

案例 B:省下的時間,被校對一口一口吃回去

往下挖一層,底層語音模型本身也會出錯。2024 年底的公開報導揭露,被多家醫療 scribe 產品採用的 Whisper 語音辨識,約 1% 的音訊片段會生出完全不存在的句子,其中部分內容具潛在傷害性。1% 聽起來很小,但它的可怕之處在於:底層辨識的錯誤,會被上層摘要模型重新包裝,變成一段看起來合情合理的醫療內容——錯誤被洗白了。

於是實務上出現一種諷刺的迴圈:醫師用了 scribe,接著回聽音檔、修正漏記與幻覺內容、調整不符合專科慣例的格式,最後手動貼回 EHR——繞了一圈,工作換了名字,沒有消失。2026 年的臨床醫師訪談研究記錄了這一切,也記錄了專科醫師對 AI 格式的不滿:不能自訂 note template、Physical Exam 不符自己專科、段落太長、重要與次要資訊攪在一起。紐西蘭急診的臨床調查給了一組對照:醫師估計每位患者可省下最多 10 分鐘,但編輯 AI 輸出的工夫可能把這些節省吃回去;NSW Health 的證據回顧也得出類似結論——宣稱的紀錄時間減少常來自小型單點研究,且可能被人工校對抵銷。

根本原因在於:病歷是一種專業工作語言,各科說著不同的方言。急診重視時間線與處置、外科重視術前術後、精神科重視患者原話與風險評估——一份通用型的漂亮摘要,未必接得上任何一科的工作流程。

案例 C:警示疲勞——生成式 AI 之外的教訓

失敗不限於生成式 AI,傳統系統早就示範過了。一個護理 EHR 警示的品質改善案例中,團隊重新檢視四個高頻率、低可操作性的警示,把它們移除或改為被動通知——光是這個動作,就釋放了 877 小時「無法採取任何行動」的護理工作時間。877 個小時,全部花在閱讀、點選、輸入 override 理由,然後什麼也做不了。系統的初衷是病人安全,設計不良的 alert 卻讓安全功能本身,變成了新的認知負荷。

從案例歸納:四種典型失敗模式

  1. 把 AI 當成強制政策:不同科別格式不同、有人打字比校對快、簡單問診根本不值得開錄音——一刀切的強制使用,抹平了工作方式的異質性。
  2. 把「AI 生成」誤當成「完成」:系統只計時「生成一份紀錄要幾秒」,卻不計算回聽、修改、核對、貼回 EHR 的總流程時間——碼表按錯了地方。
  3. UI 沒有針對角色設計:醫師要的是診斷評估與治療計畫、護理師要的是生命徵象紀錄與交班重點、藥師要的是劑量與藥物交互作用,全部餵同一種「AI 摘要」,重要欄位注定被淹沒。
  4. AI 與 EHR 分離:不能寫入正確欄位、只能整段複製、無法局部接受、沒有變更追蹤——AI 沒有融入系統,只是在旁邊又蓋了一座孤島。

把這些放在一起,可以得到一個比「AI 有沒有讓大家更快」更誠實的評估指標:

Net Cognitive Load = AI 節省的搜尋、輸入與記憶負荷 − AI 新增的驗證、切換、校對與責任負荷。

只有這個淨值為正,導入才算成功。看清楚失敗長什麼樣子之後,接下來就能問:誰已經把這個淨值做成正的?

二、有實質效果的導入:各國經驗

澳洲:工具還沒上線,失敗模式已先寫進規範

澳洲把醫療 AI 的導入直接放進國家與州級的治理架構來處理,適合放在第一個看。澳洲醫療安全與品質委員會(ACSQHC)在 2025 年 8 月發布三份臨床 AI 實用指引,涵蓋臨床 AI 使用、環境式錄音病歷與醫療影像判讀;TGA 也在 2025 年 7 月基於六百多位利害關係人的公開諮詢,發布醫療器材軟體(含 AI)法規的檢討報告。

維多利亞州更在 2025 年 5 月發布全州級的 AI scribe 部門建議,一條一條讀下來會發現熟悉的影子:

  • 資料蒐集告知改用病人衛教手冊統一處理,避免每次看診都得由前線人員口頭解釋——省下的時間又被同意流程吃回去
  • 要求在標準化與專科自訂格式之間取得平衡,防止通用格式逼醫師「第二次寫病歷」;
  • 工具理想上應整合進機構的 EHR——連「剪下貼上」跨系統轉移的工作流程,官方都直接點名其風險,因為每一次人工轉移都是一個出錯點,多視窗切換本身就是新增的認知負荷。

看出來了嗎?上一節列出的失敗模式——同意流程、專科格式、EHR 整合——澳洲在工具上線之前,就先寫進了規範裡

美國:8,581 位臨床人員的規模化效益證據

一項涵蓋五個學術醫學中心、8,581 位臨床人員的 JAMA 研究發現,採用 AI scribe 的醫師每個 8 小時臨床日,總 EHR 時間減少 13.4 分鐘、文件處理時間減少 16 分鐘;微軟 DAX 的隨機階梯式研究也顯示,使用後醫師的文件處理挫折感與 burnout 下降,每週非工作時間的文件處理減少約 2.5 小時——那是每週還給醫師的兩個半小時晚餐時間。效益是可測量的,但個體差異大、各研究的測量標準也尚未統一。

瑞典:37.5 萬份病歷,量出體感與碼表的落差

Capio Ramsay Santé 在 2024 年 4 月至 2025 年 10 月間,於初級、次級與醫院照護的多個專科進行大規模常規導入研究,累積 37.5 萬份病歷。最耐人尋味的發現,是主觀與客觀之間的巨大落差:臨床人員自我回報每份病歷花 4.7 分鐘,但客觀測得的編輯時間只有 93 秒 —— 體感將近三倍於碼表。這正好呼應前半段的論點:只看主觀滿意度或只看客觀秒數,都會得到偏頗的結論,兩者都要量。

新加坡:縮小範圍,換取可驗證的安全性

Duke-NUS 與 SGH 共同開發的 AI 心臟風險分層系統,鎖定胸痛患者的急性心臟風險辨識,已獲主管機關核准進行臨床試驗。

它代表另一種路線:與其做什麼都會一點的通才,讓 AI 把一個定義清楚、風險可控的臨床問題做到可驗證 —— 用範圍換取安全性。

三個核心能力:Filter → Prioritize → Contextualize

把成功與失敗的案例放在一起看,醫療 AI 的 UX 可以收斂成三個能力:先過濾資訊,降低使用者要處理的資料量;再依風險與任務排序;最後把資訊放回目前的臨床情境,讓使用者理解「這件事為什麼現在重要」。一個好的 AI 介面,不該把模型輸出全部攤開,需要懂得什麼時候該提醒、什麼時候該安靜。AI 的價值,正在從「產生更多資訊」走向「管理資訊」——因為醫護真正缺乏的,往往是時間與注意力。

結語:先減法,再加法

這一篇的順序是刻意的:先看失敗,再看成功。因為醫療 AI 最危險的情況,是它看起來大部分時間都有效,卻把錯誤校對與責任留給最忙的前線人員。當機構只計算 AI 產生一份紀錄需要幾秒,卻不計算醫護回聽、修改、核對、重新貼入 EHR 的時間,所謂的效率提升,可能只是把工作從系統悄悄搬到人身上。

這些導入經驗指向同一件事:成功的導入,會先把失敗模式制度化地排除掉——資料在哪、格式誰訂、錯誤怎麼修、時間怎麼量——AI 節省的負荷,才能真正留在醫護手上。

人與 AI 的合作要怎麼設計,才值得信任?這會是 Day 17 要談的主題——建立值得信任的人機合作模式,讓 AI 真正融入醫療現場:從醫藥領域未來與 AI 協作的設計出發,分享我如何借助 AI 工具,設計一套為未來導入 AI 預留空間的醫療人員決策支援系統(Decision Support System),並盤點哪些研究已經走在這條路上。


參考文獻

  1. Accuracy and Safety of AI-Enabled Scribe Technology: Instrument Validation StudyPMC, 2025)— 44 個模擬門診、70% 草稿含錯誤
  2. Beyond Human Ears: Navigating the Uncharted Risks of AI Scribes in Clinical Practicenpj Digital Medicine, 2025)— AI scribe 錯誤型態回顧
  3. Researchers Say an AI-Powered Transcription Tool Used in Hospitals Invents Things No One Ever Said(AP 調查報導,Financial Times, 2024)— Whisper 語音辨識的幻覺問題
  4. Interviews with Clinicians about an Ambient Artificial Intelligence Documentation PlatformJAMIA, 2026)— 醫師回聽音檔與格式不滿的訪談研究
  5. A Tale of Two Systems: Ambient AI Scribes and Australia's Healthcare Documentation DivideJournal of Paediatrics and Child Health, 2026)— 澳洲 GP 採用率、紐西蘭急診調查與 NSW Health 證據回顧
  6. Navigating Alert Fatigue: A Case Study in Electronic Health Record Alert Design OptimizationPubMed, 2024)— 釋放 877 小時的護理警示改善案例
  7. Policy and Implementation NewsAi Health Alliance, 2025)— 澳洲臨床 AI 指引與 TGA 法規檢討彙整
  8. Ambient AI Scribes Sector AdvisorySafer Care Victoria, 2025)— 維多利亞州全州級部門建議
  9. Govt-Built AI Scribe Set to Expand with $1.9m GrantPulse+IT, 2026)— AUScribe 獲 MRFF 經費擴大試驗
  10. Impact of an AI Medical Scribe After 375 000 NotesmedRxiv, 2025)— Capio Ramsay Santé 大規模導入研究
  11. Are AI Scribes Safe?Medical Economics, 2026)— 測量標準討論(4.7 分鐘 vs 93 秒)

上一篇
Day 15|醫療領域 AI 應用,最重要的是責任歸屬:六個可落地的設計啟示
下一篇
Day 17|建立值得信任的人機合作模式:我如何應用 AI 打造醫療人員的 Decision Support System
系列文
打造高風險場域的智慧決策支援系統(AI for Social Good)17
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言