iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
自我挑戰組

模型真的會推理嗎?30 天從 Base Model 打造可驗證的小型推理模型 系列

基礎或一般指令型 LLM 著重文字續寫與指令遵循,reasoning model 則透過問題分解、多次取樣、反思與可驗證獎勵,把更多運算投入解題。推理模型仍以逐 token 預測產生文字,但若只用「隨機鸚鵡」概括它,便忽略了後訓練、測試時運算與外部驗證帶來的能力差異。本系列以 Sebastian Raschka 的《Build a Reasoning Model (From Scratch)》為主,從 Qwen3 0.6B Base 出發,實作評估、SFT、RLVR、GRPO、verifier 與工具使用,手把手進行實作和探索:模型只是生成更像推理的文字,還是真的提高了解題能力?

參賽天數 1 天 | 共 1 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

LLM 只是在預測下一個 token 嗎?從大語言模型到推理模型

我原本把鐵人賽的 Day 1 規劃為「推理模型不是回答比較長的聊天模型」,文章也已經寫好了,直到真的準備開始發文的此刻,才發覺這個開場實在太快了,即使如今 Ch...

2026-08-01 ‧ 由 tingerwu 分享