iT邦幫忙

2026 iThome 鐵人賽

DAY 17
0

Anthony 前 12 次罰球投進 5 球,接下來 24 次會投進其中的三分之二,最後的整體命中率比原來增加幾個百分點?正確答案四捨五入後是 17。Qwen3-0.6B-Base 模型抽樣兩次候選答案,兩次都選到了 3 這個答案;我們這次設計的 router 在看見兩次抽樣的答案都一致後,便設在 k=2 停止,照這套路由決策,後面六個候選不再計入,而顯而易見地、它很有效率地答錯了。

昨天的 Self-refinement 替每一道題固定增加 critique 與 revision,64 題多花 45,508 tokens,只得到一個仍不穩定的小幅改善。既然額外計算並非總是划算,下一個直覺便是:簡單題少想一點,困難題再多想幾次。然而,這可不太容易,就如同班納博士問彼得的「你如何取捨天性之中何者為善?何者為惡?」系統要如何一道題已經「想得夠完整或夠正確到能回答」了?

這裡的「簡單」與「困難」,並非題庫預先貼好的標籤,對 adaptive compute 而言,簡單是目前模型用較小預算便得到穩定、可擷取的答案;困難則是候選仍然分散,暫時還不適合停止。這個判斷還必須在看不到 reference answer、correctness 與 verifier 結果時完成,否則 router 只是先翻解答,再宣稱自己知道該想多久。

今天沿用 Day 14 已在我的本地計算環境上上生成的 frozen candidate pool:同一組 Qwen3-0.6B-Base、64 題 validation subset,每題最多八個 sampled completions。原始生成使用 CUDA 與 bfloat16,本日只重播不同的路由決策,因此新增 generation 與 model tokens 都是 0,sealed-test inference 仍然維持 0。固定預算和 adaptive policy 面對完全相同的 512 個候選,差別只在每題讀到第幾個候選便停止。

選擇答案時仍使用 Day 15 的 consensus_quality_v1 selector。Router 能看到答案是否可擷取、相同答案出現幾次、格式是否完整,以及輸出有沒有碰到 token 上限;規則則在查看正式結果以前固定成:

k=2:兩個答案相同,而且可擷取 → 停止
k=4:至少三個答案相同,而且可擷取 → 停止
其他情況 → 繼續到 k=8

這個保守設計讓系統判讀兩次同樣答案就取得一致的結論,比兩個完全不同的答案更能收斂;四次裡有三次一致,訊號看起來又更強。當然了,「模型重複同一個答案」與「模型知道答案正確」依然是兩件事,開頭那兩個 3 已經先示範了一次。

把固定 k=1/2/4/8 與 adaptive policy 放在一起,結果如下:

policy       correct    total tokens
fixed k=1     5/64         18,586
fixed k=2     9/64         36,110
fixed k=4    11/64         69,430
fixed k=8    11/64        136,623
adaptive     11/64        125,514

Adaptive 與固定 k=8 都答對 11 題,並且逐題選出完全相同的答案;它少讀 40 個候選,節省 11,109 tokens,早停確實省到了一點計算。問題在另一邊:固定 k=4 也答對 11 題,只花 69,430 tokens。Adaptive 多用了 56,084 tokens,沒有增加任何正確答案,所以沒有形成新的 accuracy–token Pareto 點。

觀察這些題目在何時停止的,64 題裡只有 4 題在 k=2 停止、4 題在 k=4 停止,其餘 56 題全部跑到 k=8。這套 policy 幾乎就是固定跑八次,偶爾提早下班;程式裡多了一個 if,計算自然不會因此變得聰明。

更值得注意的是,提早停止的八題最後全部判錯。這不表示早停破壞了八個原本正確的答案,因為固定跑到 k=8 後仍會選出相同結果;它說明的事情更直接:agreement 沒有找出真正容易的題目,只找到了八道模型很快形成共識的題目,而共識可以來自共同的錯誤。

這裡沒有看完這 64 題再調低門檻,因為那會把 validation correctness 汙染至 router。若要做更好的版本,合理的做法是在獨立的 training 或 calibration split 上,先用「得到穩定正解所需的最小 k」建立事後難度標籤,再訓練或校準一個只看候選訊號的 difficulty router,最後帶到新的 evaluation set。難度因此是模型與預算共同決定的狀態,也需要資料來估計。

回到文章開頭的 Anthony 的罰球題,兩個 3 的確是一致答案,卻不是值得信任的答案。Adaptive compute 是圖節省的從來不只是幾次生成,而是在 verifier 還不能驗證正確時繼續計算,並在已經得到可靠答案時及時停止推論;這次實驗證明,我們設計的簡單規則還分不出兩者。模型在遇到什麼提問時應該多想,一個自動化分流器可以分流得多精準,這個問題連 AI 巨頭們都還沒有標準答案。


上一篇
Self-refinement—模型有可能藉由重複檢查來修正答案嗎?
系列文
模型真的會推理嗎?30 天從 Base Model 打造可驗證的小型推理模型17
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言