iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
IT Operation

給決策者的 30 堂 AI 素養課系列 第 6

【Day 6】AI 的運作可能和你想的不一樣

  • 分享至 

  • xImage
  •  

買最新的模型、餵最完整的資料、把整件事交給它做完。這三件事都做了,它還是可能交出一個看起來正確、過程卻不堪檢視的結果。

昨天提到:想讓 AI 幫得上忙,要給予足夠權限,而在這過程中,拓展的不僅僅是能力。今天想繼續聊聊:AI 運作的方式,可能不是你原本以為的那樣。

模型當然要用最新最大的?

的確,在 AI 剛出來的時候,模型的能力還是有限的,它可能沒有足夠的上下文窗口,或者是並沒有收集足夠的語料。因此,每當有新的模型出來的時候,通常它們都很自然地在很多工作上面表現得更好,可以懂得更多的脈絡,或者擁有某些專業的技能,像是:程式語言、文件審閱、行銷報表。不過,現在大語言模型的能力都已經做得非常好了。所以這個時候,如果你發現公司裡的 AI 工具表現得並不如預期,要看的可能不再只是「我有沒有用到最新、最好的模型」,而是要回頭檢視圍繞著這個模型的整個工作設計。同一個模型,在這家公司做得出東西,在那家公司做不出來。模型是一樣的,變數在它的運作方式是怎麼設計的。

古人的智慧已經告訴過我們:「殺雞焉用牛刀」,所以並不是這把刀越利、越大它就越好用,重點還是要看我們要 AI 代勞的是什麼樣的工作?要完成這一個工作的流程、需要的知識或者是工具,是不是都已經清楚的整理過?

給它完整的資料,就不會有幻覺了?

這大概是 AI 進辦公室之後最常見的場景之一:整理資料。

一場會議的逐字稿、一週來回十幾封的信件串、三種版本的提案,全部丟給它,請它收斂成一份。做過幾次之後,多數人會很自然地放下戒心,因為這個工作聽起來很直覺:資料都是我提供的,它只是幫我彙整,能出什麼錯?

會出錯。而且是最不容易被抓到的那一種錯。

問題出在「整理」這個動作本身。我們直覺以為整理是搬運,把重要的句子挑出來、整合語意、重新措辭。但事實上,AI 是把你給的東西讀完,然後重新生成一份新的文字。即便資料給得再齊,只要經歷語意壓縮與摘要,AI 依然可能在過程中產生扭曲或幻覺。

而且錯誤不會出現在你預期的地方,它很少憑空生出一個你從來沒提過的客戶或數字。它可能會:把「疑似、可能」的詞彙拿掉,一個風險預測頓時就變成了宣告。它可能把不同觀點的假設當成一手資料來整理,然後這個產出的報告又某種程度幫你坐實了原本的假設,結果一個懷疑的論點變成了事實。它也有可能會張冠李戴,當兩個不同的討論主題裡面都提到了某個名詞,它可能會把這兩個整理在一起,儘管可能分別是在敘述不同的事情。

像這一類型的失誤是不容易被察覺的,但是依據失誤的資訊做成的決策,代價卻很大。而儘管 RAG 或 grounding 這類「讓它先查資料再回答」的做法能減少這個問題,但還是沒辦法根治。

它做完了,但是跟你以為它做的事是一樣的嗎?

前面幾篇有說到,要讓 AI 能夠做事,你必須讓它長出手腳,給它工具。但是它是否正確地運用了它的手腳,操作工具,完成交辦的工作?

設想一個情況:一個 AI agent 在接到客戶要求修改訂單收件者資訊的時候,它可能運用它手上的工具,先是查詢了這個使用者的基本資料,拿到了出生年月日或者是身分證字號,也得到了綁定的信用卡或銀行帳戶,查詢所有已完成或未完成的訂單,甚至可能刪除了某個過期的訂單紀錄。最後,才正確地修改目前訂單內的寄送資訊。

雖然這個 AI agent 最後的確完成了客戶所交辦的任務,但在這個途中,它也觸碰了許多它不應該觸碰的東西,甚至造成不可逆的異動。

如果驗收的方式僅是看結果,很可能這個 AI agent 的工作結果是驗證通過的,但若看了它的操作路徑,應該沒有人敢讓它上線。

AI 碰得到的東西,由誰決定?

設想一家公司的市場資料庫分三層:公開、營運、隱私。銷售代表問客戶趨勢,AI 以代表的身分去查,讀不到隱私層,一切正常。後來有人要一份完整報告,流程轉到資訊長那裡批准。批准之後,AI 改以資訊長的身分去查,隱私層全部讀得到。

再看工具:採購流程要自動化,IT 開了一個能自動批核的帳號給它。這個帳號本來就是拿來核准的,所以它不只讀得到帳目,也改得動帳目,還能把款項核准送出。當初審的是這個流程能不能跑,沒有人審它該有多大的權限。

AI 的權限是跟著使用者走的。每一次為了讓它把工作順利做完,就多給一點,久了就成了現在這個樣子。沒有人故意給過大,是每一次「先給方便」,然後完成之後沒有人回頭收。

所以它能看到多少、能操作多少,就是它在沒有人盯著的時候,能拿到多少、能做多少。

對經營者意味著什麼:你要盯的東西變多了

以前導入一套軟體,驗收的是輸出,因為中間那一段是確定的。輸出對,整件事就對。

AI 不是這樣。你看到的是模型的名字,看不到圍繞著它的那一整套設計;你看到一份漂亮的整理,看不到它跟原文哪裡對不上;你看到一個正確的結果,看不到它路上做了什麼。

所以要問的不再只是「做出來的對不對」,還有它是怎麼做出來的、中途碰了什麼、有沒有留下你不知道的異動。這些面向不會因為換一個更好的模型就消失。

你沒辦法跟著它每一步,但可以先知道它能碰到什麼:它讀得到哪些資料,它能動哪些工具。你不知道它這一次走了哪條路,但可以知道它能走哪些路。

這兩件事同時決定兩個方向。它讀得到的越多、能動的越多,越有用;同樣也越是一旦出錯就收不回來。一端是你花錢買它的原因,另一端是你最不想發生的事。

OWASP 在《State of Agentic AI》裡有一句話:治理該問的不只是這是哪一種 agent,而是它在沒有人確認的情況下有多大的自主權限。

要拿走的問題

  • 執行層(CTO/CIO):挑一個我們覺得不好用的 AI 工具,檢視問題出在模型本身,還是在圍繞它的那一整套設計?
  • 經營層(董事會/CEO):團隊 demo 了一個能力很強的 AI 工具,除了它的功用,我還要注意什麼?

一句話帶走:它給你的結果對,不代表它做的事對。


上一篇
【Day 5】使用 AI 的那些挫折:為什麼它總是很有自信地答錯
下一篇
【Day 7】當 AI 進入工作場域
系列文
給決策者的 30 堂 AI 素養課11
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言