iT邦幫忙

2026 iThome 鐵人賽

DAY 15
0
ChatGPT & Codex

2026 年,會用 AI 不等於會帶 AI:用 ChatGPT × Codex 從零開始實現一人 AI 團隊系列 第 15 篇

【Day 15】額度都燒到 0% 了,AI 卻不一定做得更好:重新理解 ChatGPT 的 Token 預算

  • 分享至 

  • xImage
  •  

摘要
當 ChatGPT 從聊天工具變成 AI 代理,一則提示詞已經很難代表一次工作。Work 與 Codex 可以在背後讀取上下文、搜尋資料、操作工具、推理,再依結果決定下一步;同樣一句要求,最後可能展開成完全不同規模的工作流程。這也是為什麼使用量不能只靠「今天問了幾次」估算。本文從一次每週使用額度歸零的經驗出發,拆開「使用額度、點數、詞元」三個容易混在一起的概念,再把 AI 用量重新理解成一筆「認知資源預算」:困難的工作可以多花,沒有邊界的探索則應該及早停下來。

引言

最讓我焦慮的,其實不是使用量顯示 0%,而是那一刻,我曉得怎麼消耗量這麼大。
之前初次跟 AI 聊天時,明明沒有跟 ChatGPT 聊上幾百輪。有些工作,我甚至只下了一兩個 Prompt:幫我查資料、讀幾份文件、整理一下結果。

結果某次工作做到一半,我準備叫它繼續,直接沒了。

剩餘用量
〔截圖 1:ChatGPT 使用量頁面,5 小時使用量剩餘 100%,但每週使用上限剩餘 0%,並顯示下一次重置時間〕

你以為自己只問了一次,Agent 可能已經工作很久了。

所以這篇我解決當時真正想知道的三件事:

  • 到底是什麼在吃 Usage?
  • 哪些消耗其實值得?
  • 又有哪些,只是 Agent 在替我做白工?

我也會拿同一個研究任務做一次對照:一邊讓 AI 代理自由探索,一邊先限制第一輪的搜尋邊界,看看兩條工作路徑到底會差多少。

cover_image

我只送出一個提示詞,AI 接到的可能是一整份工作

以前聊天時,我很容易用「今天問了幾次」估計自己用了多少 ChatGPT。到了 Work、Codex,這個算法開始失效。

同樣是一個提示詞,「幫我把這段文字改順」和「讀完這些資料、找官方來源、比較不同說法,再整理成一篇文章」,背後的工作量差很多。後者需要帶著更多前文往下做,也可能要判斷、搜尋、開網頁、讀檔案,找到資料後再繼續下一步。

OpenAI 在官方文件裡會把這些因素分成上下文(context)、推理強度(reasoning)、工具(tools) 等概念。對第一次碰到使用量限制的人,我覺得先不用急著背名詞。把它翻成日常語言,其實就是三件事:AI 這次要記住多少東西、這一題需要想多深、以及它為了完成任務還要出去跑多少步。

像我前幾天研究鐵人賽主題,看起來可能只下了一句「幫我查這個題目」。Work 真正做的事情卻可能是搜尋、打開來源、讀內容、比對,再根據前面找到的東西繼續查。最後我拿到的可能只有兩頁整理,前面其實已經跑過一串工作。

AI 代理執行紀錄
〔截圖 2:實際展開一次 ChatGPT Work/AI 代理任務的執行紀錄,可以看到搜尋、讀取、工具操作與耗時等步驟。〕

所以我現在比較少看提示詞的數量,而會看「這句話裡到底包了多少工作」。研究、篩選、比較、規劃、寫作,如果全部塞在同一個要求裡,它仍然只顯示成一則訊息,但對 Agent 來說已經是一段很長的工作流程。

還有一點要先釐清:使用量頁面的百分比不是「剩餘詞元 數」。依 OpenAI 目前的說明,部分方案中的 Work、Codex 等 Agent 功能會共用額度或點數池,而實際用量又會受到模型、任務複雜度、上下文、推理、速度與工具等因素影響。API 裡可以明確計算的詞元,則是另一套使用與計價概念。

知道這件事之後,我反而不太執著一句提示詞 到底用了幾個詞元。比較重要的是,我交出去的工作有多大。

有些工作值得多花,有些工作真的不用

如果只是統一二十個文章標題的格式,我希望 AI 趕快做完。要是碰到難重現的 Bug、架構取捨,或需要讀很多來源才能判斷的研究,我反而不希望它為了省資源草草回答。

差別在工作的難度,也在錯了之後要付出多少成本。

工作類型 例如 我比較在意什麼 使用方式
簡單執行 改格式、整理欄位、文字轉換 快速完成 不需要刻意拉高推理
整理分析 比較文件、整理資料、找差異 不漏重要資訊 給足必要背景,同時限制範圍
深度推理 Debug、系統架構、策略判斷 判斷品質 願意讓模型多想一點
長時間 Agent 工作 研究、跨檔案修改、完成一個專案 不要做到後面失控 分階段、設停止點

象限圖

〔圖 3:工作難度 × 錯誤成本 2×2 象限圖。橫軸為「工作難度:低 → 高」,縱軸為「錯誤成本:低 → 高」〕

看到這張表時,我才比較能說清楚自己現在怎麼看詞元。

我會把它當成一筆認知資源預算。

這不是詞元 的技術定義,而是我目前安排 AI 工作的一個方法。簡單工作不用動員太多資源;真的需要判斷的工作,就讓模型多花一點時間。我要避免的,是 AI 不知道我要什麼,只好反覆理解、到處搜尋,最後把資源花在沒有增加多少資訊的地方。

從這個角度看,「省詞元」反而不是最準確的目標。我真正想控制的是:這份工作值得多少 AI 的力氣。

知道錢花去哪裡之後,我現在比較在意別讓 AI 做白工

把詞元 當成認知資源預算後,我目前最想養成五個習慣。

做法 原本容易發生什麼 我現在會怎麼做
先圈出任務範圍 「幫我檢查整個專案」讓 Agent 自己決定一路查到哪裡 指定目錄、目標與停止條件
長任務分階段 研究、分析、寫作一路堆在同一段工作裡 一個階段做完,留下必要結果再進下一段
先限制探索來源 一開始就把整個網路交給 Agent 搜 先查最有價值的來源,不足再放寬
按工作難度選推理 簡單工作也使用最高推理強度 容易檢查的工作求快,難題才多給推理資源
沒有新資訊就停 搜尋、失敗、換方法,再回到類似結果 設停止條件,整理目前卡點後再決定下一步

這五招裡,我最想先實測的是「限制探索來源」,因為它很容易做出 A/B 差異。

A 組只寫:

幫我研究 ChatGPT Work 的使用量機制。

B 組則把第一輪範圍寫清楚:

第一輪只查 OpenAI Help Center 與官方開發者文件,先回答使用量受哪些因素影響,以及 Work、Codex 的額度關係。官方資料回答不了的部分先列出缺口,不要立刻擴大搜尋範圍。

雙軌
〔圖 4:自由探索 vs. 限定第一輪的雙軌工作路徑圖。左側讓 Agent 自行擴張搜尋範圍,呈現較多分岔、重新搜尋與回頭路;右側先限定官方來源與指定問題,遇到資料缺口時先回到人決定是否擴大。核心不是證明「一定比較省詞元」,而是希望讀者關注:設定邊界後,「是否繼續探索」的決策重新回到人手上。〕

兩組都使用相同模型、相同題目,從新的工作階段開始。我會記錄完成時間、搜尋輪數、打開多少來源,以及前後使用量的變化。這組測試不能證明「限制來源一定省下多少詞元」,但能把抽象的概念變成一段看得見的工作流程:Agent 少走了哪些路,最後的答案有沒有因此變差。

另外四招就不一定全部硬做 A/B。像長任務分階段,比較適合畫成「一路做到尾」和「研究 → 收斂 → 寫作」兩條工作軌跡;推理強度則必須連答案品質一起比較,單看使用量沒有意義。

用量歸零後,我反而比較知道什麼時候該讓 AI 多想

剛看到每週使用量 0% 時,我第一個反應確實是:以後是不是該省一點?現在我比較少這樣想。而是每次把工作丟出去前,多問一句:這件事,我準備讓 AI 花多少力氣來做?

如果今天遇到一個難解的 Bug、重要的研究問題,或錯一次會浪費更多時間的工作,多花一些資源很合理。真正讓我介意的,是 Agent 不知道邊界在哪裡,只能自己一直找;工作做到一半沒有停損點,只好繼續試;本來只需要一小塊資料,最後卻讀了一大圈。

我現在會把詞元 想成一筆認知資源預算。該花的地方就花,剩下的,盡量不要讓 AI 做白工。


上一篇
【Day 14】ChatGPT Work vs Codex 差在哪?從 Agentic Coding 看懂 AI 如何自己修改、驗證與探索方案
下一篇
【Day 16】文件正在變成 AI 時代的新原始碼:讓 Codex 讀懂專案怎麼工作
系列文
2026 年,會用 AI 不等於會帶 AI:用 ChatGPT × Codex 從零開始實現一人 AI 團隊 共 17 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言