基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?
Day 10 的 37.5% pass@1 和 83.33% pass@8 兩組數據,後者明顯厲害,但相對而言它也多耗費八倍的候選機會,而沒有考慮計算成本,實務...
Day 11 提到了推論成本的比較,而這樣的比較仰賴每種方法都得使用相同的 prompt、題目與評分方式,否則 token 再怎麼對齊也沒有意義。我們可以仔細檢...
Day 12 的聯立方程是用來檢查問題拆解的,直接作答時,模型一開頭先寫了 \boxed{-10},後面才算出 x=-49,生成在 256-token 上限停止...
同一道不等式題,模型抽樣八次後依序給出 1, 2, 1, 2, 1, 3, 1, 3。題目要求同時滿足 n+10>11 與 -4n>-12,唯一的整...
73^{-1} mod 74 的答案是 73,因為 73 乘上自己,除以 74 會餘 1。模型對這個題目共回答了八次,八個答案都剛好不同。其中一個候選答案答對了...
252 的正因數中,有多少個是偶數?Qwen3-0.6B 模型第一次只回答了 12,相當簡潔,而且答對了。接著我們讓同一個模型檢查這份答案,它列出一串正因數,也...
Anthony 前 12 次罰球投進 5 球,接下來 24 次會投進其中的三分之二,最後的整體命中率比原來增加幾個百分點?正確答案四捨五入後是 17。Qwen3...
4^6 = 8^n,那麼 n 是多少?這道的解法之一是把兩邊改寫成 2 的次方,就會得到 2^12 = 2^(3n),所以 n=4。我們的 Qwen3-0.6B...
監督式微調 (supervised fine-tuning, SFT) 是指準備一批成對的輸入與目標輸出,讓預訓練模型繼續學習。前幾天不論使用 self-con...
我們在 Day 18 的文章裡出過 4^6 = 8^n 的題目,其中 teacher trajectory 第一行寫著 $n=3$,後面才完成正確推導並以 \b...