iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
自我挑戰組

模型真的會推理嗎?30 天從 Base Model 打造可驗證的小型推理模型 系列

基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?

參賽天數 22 天 | 共 22 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 21

從 RLHF 到 RLVR

在過去幾天的鐵人賽文章中,我有使用一道 4^6 = 8^n 數學題,來展示 teacher trajectory,第一行先寫了 $n=3$,最後才推到正確的 \...

2026-08-21 ‧ 由 tingerwu 分享
DAY 22

正確答案如何推動模型訓練中的梯度更新?

Day 21 的 RLVR 內容談及 final-answer verifier:答案對就給 1,答案錯就給 0;今天我們先不論訓練後的模型有沒有變強,讓我們延...

2026-08-22 ‧ 由 tingerwu 分享