iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
自我挑戰組

模型真的會推理嗎?30 天從 Base Model 打造可驗證的小型推理模型 系列

基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?

參賽天數 21 天 | 共 21 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 11

公平比較:對齊 token、延遲、工具與花費預算

Day 10 的 37.5% pass@1 和 83.33% pass@8 兩組數據,後者明顯厲害,但相對而言它也多耗費八倍的候選機會,而沒有考慮計算成本,實務...

2026-08-11 ‧ 由 tingerwu 分享
DAY 12

Prompt 與 output contract—論輸入和輸出之格式的重要

Day 11 提到了推論成本的比較,而這樣的比較仰賴每種方法都得使用相同的 prompt、題目與評分方式,否則 token 再怎麼對齊也沒有意義。我們可以仔細檢...

2026-08-12 ‧ 由 tingerwu 分享
DAY 13

Decompose、plan、solve——拆解問題在什麼時候會有用?

Day 12 的聯立方程是用來檢查問題拆解的,直接作答時,模型一開頭先寫了 \boxed{-10},後面才算出 x=-49,生成在 256-token 上限停止...

2026-08-13 ‧ 由 tingerwu 分享
DAY 14

Self-consistency—多抽樣與多數決

同一道不等式題,模型抽樣八次後依序給出 1, 2, 1, 2, 1, 3, 1, 3。題目要求同時滿足 n+10>11 與 -4n>-12,唯一的整...

2026-08-14 ‧ 由 tingerwu 分享
DAY 15

Best-of-N—候選答案很多的時候,真的就比較會選嗎?

73^{-1} mod 74 的答案是 73,因為 73 乘上自己,除以 74 會餘 1。模型對這個題目共回答了八次,八個答案都剛好不同。其中一個候選答案答對了...

2026-08-15 ‧ 由 tingerwu 分享
DAY 16

Self-refinement—模型有可能藉由重複檢查來修正答案嗎?

252 的正因數中,有多少個是偶數?Qwen3-0.6B 模型第一次只回答了 12,相當簡潔,而且答對了。接著我們讓同一個模型檢查這份答案,它列出一串正因數,也...

2026-08-16 ‧ 由 tingerwu 分享
DAY 17

Adaptive compute—困難題目要想多久?

Anthony 前 12 次罰球投進 5 球,接下來 24 次會投進其中的三分之二,最後的整體命中率比原來增加幾個百分點?正確答案四捨五入後是 17。Qwen3...

2026-08-17 ‧ 由 tingerwu 分享
DAY 18

可被驗證的 reasoning example 要保存什麼?

4^6 = 8^n,那麼 n 是多少?這道的解法之一是把兩邊改寫成 2 的次方,就會得到 2^12 = 2^(3n),所以 n=4。我們的 Qwen3-0.6B...

2026-08-18 ‧ 由 tingerwu 分享
DAY 19

最小規模的監督式微調 (SFT) 可做到什麼?

監督式微調 (supervised fine-tuning, SFT) 是指準備一批成對的輸入與目標輸出,讓預訓練模型繼續學習。前幾天不論使用 self-con...

2026-08-19 ‧ 由 tingerwu 分享
DAY 20

只教答案、保留軌跡,還是標記步驟—論三種 SFT 的實驗結果

我們在 Day 18 的文章裡出過 4^6 = 8^n 的題目,其中 teacher trajectory 第一行寫著 $n=3$,後面才完成正確推導並以 \b...

2026-08-20 ‧ 由 tingerwu 分享