昨天驗了 AI 附的來源,今天來處理另一個很常見、也很讓人抓頭的問題:同一題問兩次,答案怎麼不一樣?
如果只是請 AI 想晚餐,一次滷肉飯、一次牛肉麵,倒也沒什麼。但換成競賽提案、研究方向或企畫建議,答案忽左忽右,就不能只挑自己喜歡的那一套。
我用一個示範題測試:
如何提升大學生參與校內外活動的意願?
我把同一句問題交給 AI 兩次,不補充背景,也不指定格式。這個測試不比較哪篇寫得漂亮,而是看兩次回答中,哪些是穩定結論、哪些只是臨場發揮。
常見情況是:一版把重點放在獎勵、學分與證明;另一版則強調資訊整合、同儕影響和時間安排。兩邊都可能合理,但「合理」不等於已被證明,也不代表能直接拿去做企畫。
我把兩份答案拆成同一張表,用五個角度檢查:
| 查核項目 | 要看什麼 |
|---|---|
| 正確性 | 建議是否符合題目,不把猜測說成事實 |
| 完整性 | 是否同時碰到動機、阻礙、資訊與執行 |
| 可追溯性 | 每個判斷能否找到資料或問卷題目驗證 |
| 可使用性 | 能不能轉成具體行動,而不是只喊口號 |
| 人工修正成本 | 整併兩版需要改多少、補多少背景 |
接著我把內容分成三類:
這次最重要的發現是:答案不同,不一定是哪一版錯;也可能是我的問題沒有交代對象、情境、資源和期待產出。AI 便會自行補空格,而每次補法未必相同。
修正方式不是一直重問到出現喜歡的答案,而是固定輸入條件,例如:
這樣再問一次,答案仍可能不完全相同,但差異會縮小,也比較看得出變動來自哪個條件。
遇到重要任務,我會用這個四步驟:
AI 回答不一致不是單純的缺點,它其實替我亮出一盞警示燈:這裡可能有沒說清楚的需求,也可能有尚未驗證的假設。真正可靠的做法,不是逼 AI 永遠講同一句話,而是讓每個結論都有一致的驗收依據。
剛剛整理表格時想到:如果兩份答案很長,可以先請 AI 各自濃縮成「主張、理由、證據需求」三欄,再由自己比對。這比直接比較整篇文字快,也比較不會被漂亮句子帶著走。
我做問卷與企畫時,也常遇到 AI 第一次談動機、第二次突然談宣傳。以前會直覺挑看起來完整的版本,現在反而把差異留下來,因為它常提醒我:原本的題目可能少了重要限制。
你有遇過 AI 同一題兩次回答差很多嗎?你會選比較有道理的、把兩份合併,還是追問它為什麼改口?很好奇大家怎麼判斷哪一版比較值得留下。