基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?
我原本把鐵人賽的 Day 1 規劃為「推理模型不是回答比較長的聊天模型」,文章也已經寫好了,直到真的準備開始發文的此刻,才發覺這個開場實在太快了,即使如今 Ch...
Day 01 稍微介紹大型語言模型和 reasoning model,接著我們可以進一步去思考的是:如果推理模型終究還是在預測下一個 token,我們要怎麼知道...
Day 01 先把大型語言模型與 reasoning model 放回同一條訓練路徑上,Day 02 則暫時停在這條路徑的起點,讓 Qwen/Qwen3-0.6...
我在 Day 03 留下的問題是那些已經下載好的權重裡面,到底裝著什麼。讀取數億個浮點數想當然是不太可行,基本上就是駭客任務》裡的數碼瀑布是另一件事,應該知道的...
Day 04 我們把 The answer to 2 + 3 is 送進 Qwen3 0.6B Base,最後得到 [1, 9, 151936] 的 logit...
Day 05 最後提到要把隨機性加回來,聽起來貌似會新增一堆幻覺,實際比較像讓模型在每一個決策點,允許它偶爾不要走那條分數最高的路。 前一篇使用 greedy...
Day 06 裡我們問了模型 9 次同樣的問題,並且觀察 sampling 如何讓文字變得不同,同時也可看到答案正確和格式正確並不是同一件事。不過只靠單一題目,...
Day 07 的 1000 題裡,模型答對了 178 題,從模型停止生成答案到 correct=True 之間,還隔著答案擷取、正規化和數學等價判定等步驟。任何...
Day 08 中出現的 verifier,本質上還只是改考卷的人,模型寫完答案,它負責把最後結果擷取出來,並判定和參考答案是否相同。而這套流程若改在可驗證獎勵強...
Day 09 先把 verifier 的工作簡化成一件事:給它一個模型生成的回答,判斷最後答案是否正確。不過,當同一道題開始產生四個、八個或多個候選後,原本單一...