iT邦幫忙

2026 iThome 鐵人賽

DAY 7
0
Build on Google AI

打造高風險場域的智慧決策支援系統(AI for Social Good)系列 第 7

Day 07|高風險領域必學的四個 Human-AI Deliberation 設計啟示:打造更可靠的人機共同決策

  • 分享至 

  • xImage
  •  

上一篇(上)談到 Human-AI Deliberation 的概念、審辯式 AI 的三層架構,以及一個研究生錄取中關於 GPA 的具體審辯案例。這一篇接著談:這種互動方式為什麼真的有效、該用在哪裡、又不是越多越好——最後會整理成四個可以落地的設計啟示,讓 Deliberation 真的能被放進產品裡。

比 AI 的答案更有價值的是 AI 的理由

這和〈From Text to Trust〉這篇研究的發現很接近。

研究發現,只是把 LLM 產生的分析文字放在 AI 建議旁邊,並不一定能直接改善人的決策表現;真正有效的方向,是根據使用者的決策狀態,動態選擇什麼樣的分析值得被呈現,進而幫助使用者更適當地依賴 AI。

這件事情其實很重要,因為「Explainable AI」很容易變成:AI 給你一個答案,然後再附上一大段解釋。但解釋多,不代表人真的理解,如果一次把所有因素、所有數據、所有原因全部丟給使用者,反而可能增加認知負荷。

例如 AI 建議一名候選人錄取,比起直接給一段很長的文字,也許更有幫助的是讓使用者看到:
「這個結果主要受到哪些因素影響?」
「哪一個因素對結果影響最大?」
「這個判斷和你原本的想法最大的差異在哪裡?」
「如果改變這個條件,結果會不會改變?」

這些資訊才真正有可能幫助人重新思考。

從「解釋答案」,走向「支持思考」

這裡其實存在一個很重要的差別。傳統 XAI 常常在回答:「AI 為什麼得到這個答案?」但 Deliberation 更進一步問:「這個答案值得我們接受嗎?」前者是在解釋模型,後者是在支持決策。這兩件事情並不一樣。因為一個模型完全可以很清楚地解釋自己為什麼做出某個判斷,但這不代表人就應該接受它。

高風險決策真正需要的是:理解 → 質疑 → 比較 → 修正 → 再決定,而不是:推薦 → 解釋 → 接受。

人與 AI 都可能是錯的

我覺得 Deliberation 還有一個很重要的價值:

它不預設 AI 一定是對的,也不預設人一定是對的。

傳統 AI 輔助工具很容易形成一種權力關係:AI 給答案,人負責確認。但在真正複雜的場域裡,可能是:AI 看到了某些人沒看到的資訊,人則掌握了某些 AI 沒有的情境。兩者都有可能發現對方忽略的事情。

因此,好的 Human-AI Collaboration 不應該只是把 AI 的能力加到人的能力上,而是要讓兩者的不同觀點可以被交換。**AI 可以問:「你為什麼這麼判斷?」人也可以問:「你為什麼把這個因素看得這麼重要?」**這時候,對話才真正開始。

實驗結果也支持這個方向:相較於傳統的可解釋 AI,審辯模式能顯著提高決策的正確率,特別是在模糊邊緣的困難案例中;這種來回討論像是一種「認知強制」,會逼著人類去思考 AI 的局限性,從而減少對 AI 錯誤建議的過度依賴,同時也讓人有機會在 AI 的提示下,發現並修正自己邏輯上的錯誤。

Deliberation 的核心,其實是處理「分歧」

所以如果要把這種互動濃縮成一句話,我會說:Recommendation 的核心是提供答案,Deliberation 的核心是處理分歧。

當人和 AI 意見一致時,事情其實很簡單。真正困難的是:AI 說 A,人認為 B。這時候系統不應該立刻要求其中一方放棄,而應該先問:「為什麼?」,這個「為什麼」,才是共同決策真正有價值的地方。因為分歧會迫使人重新檢視自己的判斷,也迫使 AI 把自己的依據說清楚。最後的決策不一定要完全偏向人,也不一定要完全偏向 AI,而是:經過討論之後,雙方都對問題有了更完整的理解。

但 Deliberation 並不是越多越好

這裡也有一個我覺得很重要的限制。

如果每一個決策都要和 AI 深入討論,產品最後可能反而變得很難使用,因為討論本身就是有成本的,它需要更多時間,也需要更多認知投入;審辯過程也確實會增加人類的認知負擔、降低操作滿意度——畢竟「衝突」本身就是費力的。

因此,我不認為未來所有 AI 都應該變成「一直跟你辯論」。

真正值得做 Deliberation 的,應該是:高風險、高不確定,或人與 AI 出現重大分歧的情境。簡單的問題,AI 可以直接回答;明確的任務,AI 可以直接協助完成。但當風險很高、答案不確定,或者人和 AI 的判斷差異很大時,系統才需要把互動從 Recommendation 升級成 Deliberation。

這其實和上一篇談的 Appropriate Reliance 是連在一起的:不是每一次都要深入討論,而是在值得討論的時候,讓人有能力討論。

四個可以落地的設計啟示:怎麼把 Deliberation 真的做進產品裡

以上都是原則,但原則要能落地,還需要具體的設計決策。以下整理成四個可以直接對照到產品規格的方向。

https://ithelp.ithome.com.tw/upload/images/20260807/201202878kpqVUGr5J.png

1. 先做「觸發判斷」,不要預設每次都要審辯
在 AI 給出建議之後,系統應該先算一個內部訊號,再決定要不要進入 Deliberation 模式,而不是每次都跳出討論介面。

可以參考的觸發條件:

  • 模型自身的不確定性偏高(例如信心分數落在中段、多個候選答案分數接近)
  • 這個決策的下游影響大(金額、資格、健康、法律後果等)
  • 使用者的初始判斷與 AI 建議明顯不同
  • 這類案例過去的人工覆核率或錯誤率偏高

低於門檻的案例,AI 直接給答案加一句話理由即可;只有跨過門檻的案例,才觸發完整的審辯流程。這個門檻本身也該是可調的產品參數,而不是寫死的規則。

2. 把「解釋」拆成可以互動的最小單位,而不是一段長文字
與其輸出一大段解釋文字,不如把解釋拆成幾個可以個別點開、個別追問的元件,例如:「主要影響因素」「單一因素敏感度」「與你判斷的差異點」「反事實假設(改變 X 會不會變)」。使用者可以按需求點開其中一到兩個,而不是被迫讀完全部。這也讓每一次互動的認知成本可以被使用者自己控制。

3. 介面上要讓「分歧」被看見,而不是被隱藏
具體做法是在 UI 上並排呈現 AI 的判斷與使用者當下的判斷,並且明確標出兩者不一致的地方,而不是只用一個籠統的「信心分數」蓋過去。分歧被清楚標示出來後,系統再追問「為什麼」,而不是直接要求使用者接受或覆蓋 AI 的建議。這一步是把「Recommendation UI」和「Deliberation UI」真正區分開的關鍵。

4. 記錄「修正歷程」,讓討論本身變成資產
每一次審辯之後,無論最終決策偏向人或偏向 AI,都應該把「一開始的分歧」「討論中提出的理由」「最終決策與依據」記錄下來。這些資料除了作為稽核紀錄,長期還可以用來:校準前面第 1 點的觸發門檻、找出 AI 系統性容易出錯的案例類型、也找出使用者容易誤判的案例類型。也就是說,Deliberation 不只是單次互動的設計,也應該是一個能讓系統整體越來越準的回饋迴圈。

這四點合在一起,其實對應的是同一件事:不是讓 AI 更會說話,而是讓系統知道什麼時候該說話、該說多少、以及怎麼把分歧變成有用的資訊。

結語:AI 不應該只是給你第二個答案

AI 輔助決策的產品設計正在經歷一個轉變:從「Data → AI → Recommendation」,到「Data → AI → Explanation → Human Decision」,再走向「Data → Human + AI → Deliberation → Decision」。

https://ithelp.ithome.com.tw/upload/images/20260807/20120287Dv9QDmGoWU.png

在這個階段,AI 不只是提供另一個答案,它可以提出觀點、說明理由、指出你們的分歧、提供證據、挑戰你的假設,也根據新的資訊修正自己的判斷——這也讓我重新思考我們常說的 Human-in-the-loop。很多時候,我們把它理解成「AI 做事,人類最後確認」,但如果只是這樣,人其實還是被放在流程最後面,只是最後的審核者。真正成熟的協作,應該讓人參與的是:問題怎麼理解、證據怎麼解讀、分歧怎麼處理,以及最後怎麼做判斷——也就是從 Human-in-the-loop,走向 Human-AI Collaboration,而 Deliberation 正是其中一種重要的互動形式。

因為真正重要的決策,很少只是「哪一個答案比較好?」,更多時候是「為什麼我們會得出不同答案?」「我們各自看到了什麼?」「還缺少什麼資訊?」「什麼證據會讓我們改變想法?」當 AI 可以參與這個過程,它就不再只是替人回答問題,而是開始成為:幫助人把問題想得更深、更完整的決策夥伴。

這可能才是高風險 AI 真正值得發展的方向——不是 AI 替人決策,也不是人替 AI 做最後確認,而是人與 AI 一起思考,最後一起走向一個更好的決定。

參考文獻

Ma, S., Chen, Q., Wang, X., Zheng, C., Peng, Z., Yin, M., & Ma, X. (2025). Towards Human-AI Deliberation: Design and Evaluation of LLM-Empowered Deliberative AI for AI-Assisted Decision-Making. Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems.
Li, Z., Zhu, H., Lu, Z., Xiao, Z., & Yin, M. (2025). From Text to Trust: Empowering AI-assisted Decision Making with Adaptive LLM-powered Analysis. Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems.

第一章總結

這七天文章如果要總結成一個核心觀點,那就是:AI for Social Good 的價值,不在於 AI 做了多少事情,而在於:是否降低 Decision Latency、是否減少 Cognitive Load、是否維持人的 Decision Context、是否讓專業者做出更好的判斷。

下一章,我會開始進入第一個真實場域:運動科學 × AI:當資料很多時,如何真正支持人的決策?


上一篇
Day 06|當人與 AI 意見不同時,決策才真正開始:從 Recommendation 走向 Deliberation
下一篇
Day 08|打造國家級運動數據平台:我學到的第一堂決策課
系列文
打造高風險場域的智慧決策支援系統(AI for Social Good)10
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言