基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?
我原本把鐵人賽的 Day 1 規劃為「推理模型不是回答比較長的聊天模型」,文章也已經寫好了,直到真的準備開始發文的此刻,才發覺這個開場實在太快了,即使如今 Ch...