iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
自我挑戰組

模型真的會推理嗎?30 天從 Base Model 打造可驗證的小型推理模型 系列

基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?

參賽天數 21 天 | 共 21 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

LLM 只是在預測下一個 token 嗎?從大語言模型到推理模型

我原本把鐵人賽的 Day 1 規劃為「推理模型不是回答比較長的聊天模型」,文章也已經寫好了,直到真的準備開始發文的此刻,才發覺這個開場實在太快了,即使如今 Ch...

2026-08-01 ‧ 由 tingerwu 分享
DAY 2

模型明明答對了,我們為什麼還不相信它會推理?

Day 01 稍微介紹大型語言模型和 reasoning model,接著我們可以進一步去思考的是:如果推理模型終究還是在預測下一個 token,我們要怎麼知道...

2026-08-02 ‧ 由 tingerwu 分享
DAY 3

Base、Instruct、Reasoning:同一骨架上的不同後訓練

Day 01 先把大型語言模型與 reasoning model 放回同一條訓練路徑上,Day 02 則暫時停在這條路徑的起點,讓 Qwen/Qwen3-0.6...

2026-08-03 ‧ 由 tingerwu 分享
DAY 4

從預訓練 Qwen3 0.6B Base 開始的「From Scratch」

我在 Day 03 留下的問題是那些已經下載好的權重裡面,到底裝著什麼。讀取數億個浮點數想當然是不太可行,基本上就是駭客任務》裡的數碼瀑布是另一件事,應該知道的...

2026-08-04 ‧ 由 tingerwu 分享
DAY 5

從 logits 到 token:自迴歸生成、attention 與 KV cache

Day 04 我們把 The answer to 2 + 3 is 送進 Qwen3 0.6B Base,最後得到 [1, 9, 151936] 的 logit...

2026-08-05 ‧ 由 tingerwu 分享
DAY 6

Temperature、top-p 與 seed:同一模型為何有不同的答案?

Day 05 最後提到要把隨機性加回來,聽起來貌似會新增一堆幻覺,實際比較像讓模型在每一個決策點,允許它偶爾不要走那條分數最高的路。 前一篇使用 greedy...

2026-08-06 ‧ 由 tingerwu 分享
DAY 7

建立一個可重現的 reasoning baseline

Day 06 裡我們問了模型 9 次同樣的問題,並且觀察 sampling 如何讓文字變得不同,同時也可看到答案正確和格式正確並不是同一件事。不過只靠單一題目,...

2026-08-07 ‧ 由 tingerwu 分享
DAY 8

答案擷取、正規化與數學等價判定

Day 07 的 1000 題裡,模型答對了 178 題,從模型停止生成答案到 correct=True 之間,還隔著答案擷取、正規化和數學等價判定等步驟。任何...

2026-08-08 ‧ 由 tingerwu 分享
DAY 9

Verifier-first:先判對錯,再分析推理軌跡

Day 08 中出現的 verifier,本質上還只是改考卷的人,模型寫完答案,它負責把最後結果擷取出來,並判定和參考答案是否相同。而這套流程若改在可驗證獎勵強...

2026-08-09 ‧ 由 tingerwu 分享
DAY 10

關於自洽性與不確定性:論推理模型評估指標 pass@1 和 pass@k

Day 09 先把 verifier 的工作簡化成一件事:給它一個模型生成的回答,判斷最後答案是否正確。不過,當同一道題開始產生四個、八個或多個候選後,原本單一...

2026-08-10 ‧ 由 tingerwu 分享