iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI 自動化

醫院裡的 AI 品管員:30 天,把品質管理交給 AI 試試看系列 第 6

Day 06|資料都在系統裡,為什麼工作還是接不起來 | The Data Is All in the System. The Work Still Doesn't Connect.

  • 分享至 

  • xImage
  •  

Day06_Cover

場景:白板中間,我們先空著

那是一場排計畫的會。品管室這邊坐了幾個人,資訊室的老周也在。

我在白板最左邊寫了兩個字:輸入。走到最右邊,寫上:輸出。中間一大片空著。

有人問:「中間放什麼?」

我說中間先不要填。先把兩邊填滿。

左邊很快就滿了:品管圈結案報告、事件通報的文字、稽核紀錄、指標月報。這些東西每個月都在產生,格式不一、長短不一,但它們確實存在,而且拿得到。

右邊卡住了。因為「輸出什麼」的答案不在資料裡,在誰要拿它去做什麼決定。給品質委員會看的東西、給單位主管看的東西、給品管團隊協調追蹤順序用的東西,是三種完全不同的東西。

大家卡了一陣子。後來老周走上去,在白板上補了一條線——從最右邊拉回最左邊。

他說:「不然這條先畫。」

那條線在你那邊也有,它叫 feedback loop。差別是在多數 pipeline 圖上,它是一條虛線,而且沒有人是它的 owner。

那條線就是今天整篇要講的東西。要說清楚它為什麼該先畫,得先看資料電子化之後,還有哪些工作留給人在系統之間銜接。

電子化、標準化、自動化,三層都要接上工作

醫院已經有 HIS、電子病歷與通報系統。AI 加進來時,面對的是既有的數位流程,以及流程之間尚未接好的環節。

第一層是電子化。 病歷、醫囑、護理紀錄都能在系統裡查閱。但能查閱,不代表稽核小組已經拿到同一批、同一時間點、足以做判斷的資料。

第二層是標準化。 作業規範與電子表單都有版本,仍要確認各單位用的是不是同一套定義,以及系統欄位能不能支援實際的交接。

第三層是自動化。 AI、LLM、agent 開始接手讀取、整理與初判。它們產生的結果,要交到哪個單位、由誰複核、如何回覆,也都需要安排。

這三層經常同時存在,各自有不同的斷點:

電子化 標準化 自動化
導入什麼 HIS、電子病歷與通報系統 作業規範、文件管制 AI/LLM
失敗長什麼樣 紀錄都在線上,仍需跨畫面查找、人工核對與轉填 規範有版本,單位對同一欄的理解卻不同 AI 分析做出來了,兩週後沒人開
要確認什麼 資料能不能在需要時被正確調閱 定義與現場流程能不能對上 結果由誰使用,能不能接著處理

以一個單位準備稽核回覆為例:病歷在電子病歷系統,相關的處理紀錄在另一個模組,前次回覆則存在電子報表。資料都找得到,但承辦同仁還得切換畫面、核對時間,再把同一件事的來龍去脈整理給稽核小組。

跨畫面查找、核對、轉填——這一段在你那邊叫做沒有 API 的整合:每一份資料都查得到,就是沒有一條 pipeline 把它們接起來,所以中間站著一個人。

這裡有兩種不同的負荷:一種是資料有了,卻沒有串起來;另一種是欄位有了,卻沒有說清楚下一步由誰處理。單位要確認紀錄,品管團隊要彙整差異,資訊單位要確認擷取範圍。光是多產生一張報表,不會讓這些交接自動完成。

於是電子化完成了資料儲存,跨單位的核對與交接仍然佔用人力。這正是 AI 進場時要接住的部分。

資料都在系統裡,工作卻仍卡在系統之間;多接一個 AI,不會自動接好那段交接。

你那邊也有類似的斷點:**沒有人看的 wiki、沒有接進 on-call 的 alert、deploy 完就再也沒有人讀的 runbook。**每一個都上線了,卻沒有接進人真正在做事的路徑。

三層都需要回頭查核

品質改善有一個形狀:計畫、執行、查核、行動,走完一圈回到起點。PDCA,教科書第一章。

你不需要記這四個字,只要知道它是閉環的——這是它跟一般專案流程唯一的差別,也是全部的重點。

而這個環在現場最常斷在同一個地方:查核

原因不難理解。查核花的力氣跟執行差不多,但它不產生任何看得見的成果。它永遠在 backlog 的最下面,是那張沒有人認領的票。 做完一輪改善,圈員想的是下一輪的主題,單位主管想的是這一季還有幾份稽核回覆沒交——沒有人想的是回頭確認上一輪到底有沒有效。於是現場的 PDCA 常常變成 PD、PD、PD。

你們的版本叫做「這次先上,測試下一版補」。

Check 跟 Study 不是同一件事

品管圈的電子範本寫的是 PDCA,但改善科學那一支用的是 PDSA——第三個字母不是 Check,是 Study

一個字母,差的是整件事。

  • Check 問的是:做到了沒有? 有沒有照計畫執行、進度有沒有落後。這是一個是非題,而且答案通常是「有做」。
  • Study 問的是:發生的事,跟我當初預測的一不一樣? 不一樣的地方,告訴了我什麼?

Check 可以在會議上三十秒結束。Study 不行,因為它要求你在動手之前先寫下你預期會發生什麼,事後再回來對。沒有那份預測,就沒有東西可以對照,於是 Study 只能退化成 Check。

這三層都可能出現同一種省略:

  • 電子化做完系統驗收就結束了——有上線嗎?有。沒有人回頭問「當初說交班會變快,後來呢」
  • 標準化做完文件查檢就結束了——有程序書嗎?有。沒有人回頭問「當初說這份程序書會改變現場行為,後來呢」
  • 自動化正在做同一件事——模型跑出來了嗎?跑出來了。然後就結束了

三層都可能做完 Check,卻沒有接著做 Study。

這件事在你那邊有一個一模一樣的形狀:上線後的 postmortem 你會寫;上線前寫下的那個預期指標,多久之後有人回去對過一次?

場景:六個月後那一格是空的

一份品管圈結案報告的最後有一張表,叫效果維持追蹤。欄位很簡單:改善後三個月的數字、六個月的數字、一年的數字。

三個月那一格通常有數字。六個月那一格,常常是空的。

不是有人偷懶。是六個月之後,那個圈調走了兩個成員,圈長換了人,而新一年的主題已經在選了。會議上要討論的是今年做什麼題目,不是去年那一題後來怎麼樣。上一輪的效果確認沒有被誰否決過——它只是一直沒有被排進任何一次議程,直到沒有人記得它還開著。

順安圈那份報告,六個月那一格也是空的。

這就是查核被砍掉的樣子。它從來不是一個決定,是一連串沒有人反對的省略。

而這件事在 AI 進來之後不會變好,只會變嚴重——因為 AI 讓「執行」那一段變得非常便宜,查核那一段卻沒有。當你一個晚上可以跑完過去三個月的工作量,唯一還留在原地的,就是確認它跑對了的那個環節。

比例一旦失衡,你會得到一個產出量暴增、但沒有人知道對不對的系統。在品質這個領域,那不是進步,那是把風險規模化。

這就是為什麼那條從右邊拉回左邊的線要先畫。

自動化這一層,要怎麼接回日常工作

先講一件跟模型能力完全無關的事:什麼時候一個 AI 用法才算一條流程。

我的判準是三樣東西有沒有離開對話框

  1. 判準有沒有離開對話框——它要有一個 commit 記錄,而不是承辦同仁每次重打一遍、每次都有點不一樣的那段話。順帶說,我們的稽核條目現在就是後面那個樣子:正式版存在文件管理系統裡,實際在用的那一版在幾個資深委員的腦子裡
  2. 輸入有沒有離開剪貼簿——它要是一組固定的、每次都用同一批的通報單與結案報告,而不是「我上次好像是貼這幾份」
  3. 輸出有沒有離開螢幕——它要 diff 得起來,而不是審閱者讀完就關掉、沒有留下處理紀錄的視窗

把 AI 從玩具變成流程的,不是模型換得更強,是判準、輸入、輸出這三樣東西從對話框裡搬出來。

搬出來之後才會多一個新的能力:你可以問「這個月跟上個月一不一樣」。搬出來之前,這個問題連問都問不了,因為沒有東西可以比——而不能比,就不可能有 Study。

所以我不用「AI 幫我做了什麼」來衡量進度。我用的是另一個問題:這件事我今天能不能不在場,它照樣跑完,而且跑完之後我看得出來它跑得對不對。 能,才叫自動化;不能,那只是我用得比較熟練而已。

這 30 天的路線,三行

那條線就是這 30 天的骨架:

  • 第一到第三週往右走:定義(把判準寫下來)→ 找問題(把一個月的通報單與病歷全量掃一遍)→ 分析(挑出來的少數案子往下挖)
  • 第四週就是那條線:驗證。它不排在第三週後面,它從右邊拉回第一週——放在最後的驗證只剩下 sign-off,放在中間的驗證才有機會改掉前面的設計
  • 第五週落地:真的上線,讓它每個月自己跑一次,而且監控得到它有沒有悄悄變了

那條先畫的線:第四週的驗證不排在第三週後面,它從右邊拉回第一週
就這樣。這 30 天我不會再貼第二次目錄。

三件我刻意不做的事

不做全自動決策。 所有模型輸出都停在「建議」,最後一格永遠是人——可能是品質委員會,也可能是 7B 的陳護理長。而那個人會有意見、會不同意,而且他不同意的理由通常跟模型準不準無關。一條沒有考慮過「使用者會不同意」的自動化流程,在醫院裡活不過三個月——那就是自動化沒有接上現場的失敗長相。

不用真實資料調 prompt。 理由昨天講過了。這帶來一個很硬的問題:沒有真實資料,你怎麼知道判準在真實資料上不會塌?第四週給解法。

不追求「不用人看」。 目標從來不是取代複核,是改變複核的抽樣方式——把有限的專家時間,從隨機的那一小撮,移到最可能有問題的那一批。一樣是每個月看二十份病歷,差別在於看的是哪二十份。

這條線會在四個層次壞掉

最後給一個框架,接下來 24 篇都會用到它。

這條流程不是「會壞」或「不會壞」。它會在四個不同的層次壞掉,而每一層的徵狀完全不一樣

壞在哪 徵狀 落在哪幾篇
判準層 spec 有歧義,同一條有兩種讀法 換一個模型結論就變,而且變的方向不一致——不是全部變嚴或全部變鬆,是各往各的方向跑 Day 8、21
理解層 判準沒有歧義,模型把它讀成另一個意思 理由跟判準對不上,但結論看起來很合理。最難抓,因為結論看起來對的時候,沒有人會去讀理由 Day 14、17、19
穩定層 flaky 同一份輸入重跑,結論不一樣。不重跑,你不會知道手上這個結論是不是擲一次骰子的結果 Day 20、23
漂移層 drift 上面三層都過了,但模型換版之後標準整體位移。單看每一份都對,統計起來分佈變了 Day 26

這四層不是憑空分的。它是把一條稽核條目從草擬到上線之間、實際會出事的位置排出來:第一層在我寫條目的當下就決定了;第二層要到我去讀模型給的理由才看得見;第三層要重跑一次才知道;第四層要等三個月的統計圖才浮出來。

這四層有一個很重要的性質:

下面的層次沒清乾淨,上面的層次就量不到。

一個判準還有歧義的系統,你去量它的漂移,量到的只是噪音。所以順序不能顛倒——這也正是這五週為什麼是這個順序。

大部分團隊只在第三層做過檢查,因為只有第三層可以用 retry 測到。retry 綠了,大家就當它過了。 那是 Check,不是 Study。

你明天可以做的一件事

不是裝什麼工具。

去把上一份品管圈結案報告、上一次 postmortem、上一季那份 OKR 收尾文件翻出來,找到「後續追蹤」那一欄,看六個月之後那一格填了沒有。

如果是空的,那你跟我一樣,跑的是 PD、PD、PD。而你現在要加上去的 AI 流程,也可能在同一個地方斷掉。

AI 不是取代品質管理,AI 是品質管理的新對象。 這 30 天做的事,是拿一套用了幾十年的老工具去管一個新的東西——而那套工具要做的第一件事,就是把查核那一段搶回來。

明天進入第二週的主題:當你只能看百分之二的時候,你其實在放棄什麼。



上一篇
Day 05|真實資料不能上雲端,那條線到底畫在哪 | Real Data Can't Go to the Cloud — So Where Do You Draw the Line?
系列文
醫院裡的 AI 品管員:30 天,把品質管理交給 AI 試試看6
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言