iT邦幫忙

2026 iThome 鐵人賽

DAY 1
0
ChatGPT & Codex

《AI 說完成,我偏要驗收:ChatGPT × Codex 的 30 天成果查核實驗》系列 第 1

Day 1|AI 說「完成了」,我驗收後只想問:完成的是哪個宇宙?

  • 分享至 

  • xImage
  •  

AI 很會交作業,但不一定會對答案

你一定看過這種場面:請 AI 整理一份企畫、分析一份問卷,幾秒後它很有自信地回答:「已完成!」

標題很漂亮、條列很整齊、語氣像顧問公司熬夜三天交出的報告。直到你真的拿去核對,才發現資料沒有來源、結論跑得比證據還快,甚至連題目問什麼都理解錯了。

AI 的「完成」,通常只代表它已經產出內容;我們要的完成,卻是成果正確、完整,而且真的能拿來用。兩者看似只差一張驗收單,實際上可能差了一整場災難。

這也是我參加這次鐵人賽的原因。

為什麼我要做 30 天成果查核實驗?

過去我經常接觸競賽提案、問卷研究、市場調查、企畫撰寫、簡報製作與資料整理。這些工作現在都能請 ChatGPT 協助,遇到檔案、資料夾、程式或需要實際操作的任務,也可以交給 Codex。

效率確實變快了,但新的問題也跟著出現:

  • AI 寫出的市場數據是真的嗎?
  • 問卷分析的百分比加起來合理嗎?
  • 企畫中的洞察、策略、執行與成效真的接得起來嗎?
  • Codex 說檔案已完成,公式、格式與功能都能正常使用嗎?
  • AI 省下的時間,會不會最後全部拿去修改錯誤?

如果沒有驗收,我們可能只是把「自己慢慢做錯」升級成「AI 快速做錯」。

這 30 天,我會怎麼驗收?

我會把 ChatGPT 與 Codex 放進真實的學習和企畫情境,從競賽、問卷、企畫、簡報、文件到數位工具逐一測試。每一天聚焦一個任務,不只展示 AI 做出了什麼,也記錄它在哪裡翻車、我如何發現,以及怎麼修改才真的能用。

所有成果都會用同一組五項標準檢查:

1. 正確性

資料、計算、引用與功能是否正確?

看起來合理,不代表真的合理。數據至少要能重新計算,資訊也要回到原始來源核對。

2. 完整性

AI 有沒有漏掉需求、限制或必要步驟?

例如企畫寫得很熱血,卻沒有目標客群、執行成本與 KPI,就像夜市攤位招牌做得超亮,結果忘了準備商品。

3. 可追溯性

結論能不能找到依據?

每一項重要判斷,都應該知道它來自哪份資料、哪個題目、哪段訪談或哪次測試。

4. 可使用性

成果能不能讓真正的使用者完成任務?

檔案能打開只是最低門檻;內容要看得懂、功能能操作,交給別人也不能立刻迷路。

5. 人工修正成本

AI 到底省了多少時間?

如果生成只花三分鐘,核對與重做卻花三小時,這份成果的效率就要重新計算。

ChatGPT 與 Codex,誰負責什麼?

在這個系列中,我會把 ChatGPT 當成一起拆需求、找盲點與整理表達的討論夥伴;Codex 則負責需要讀取檔案、執行操作、建立工具與實際驗證的工作。

但工具分工不是重點,真正的核心是:無論 AI 多有自信,最後都要留下人類可以檢查的證據。

今天的結論

從今天開始,我不再把「AI 有產出」當成「任務已完成」。

真正的完成至少要回答五個問題:

  • 結果正確嗎?
  • 需求做完整了嗎?
  • 每個結論找得到證據嗎?
  • 別人真的能使用嗎?
  • 加上修改時間後,還有效率嗎?

接下來 29 天,我會用真實任務一項一項測試。AI 可以當神隊友,也可能穿著神隊友的衣服偷偷挖坑。

既然它說完成了,那就打開成果,開始驗收。


下一篇
Day 2|AI 有做完,但真的有照題目嗎?
系列文
《AI 說完成,我偏要驗收:ChatGPT × Codex 的 30 天成果查核實驗》2
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中
0
lin1015
iT邦新手 5 級 ‧ 2026-09-10 21:30:40

補充一個簡單做法:每次交任務給 AI 前,先把「完成條件」寫成勾選清單,例如數據有來源、計算能重現、格式能開啟、結論有證據。驗收標準愈具體,AI 的「完成」才愈接近你心中的完成。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-10 21:31:16

我參加過近 60 次競賽,也做過問卷、簡報與研究整理。AI 最容易讓我放下戒心的時刻,就是它把內容排得超完整;但版面整齊不代表邏輯成立,真正花時間的常常是回頭確認每個數字和結論。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-10 21:31:40

你曾經遇過 AI 最離譜的「我完成了」嗎?是資料亂掰、程式不能跑,還是簡報看起來很厲害,實際上什麼都沒說?歡迎分享你的 AI 翻車現場。

我要留言

立即登入留言