Day 16 做完後,我原本很自然地想到一件事:既然三次 independent sampling 太粗,那多抽幾次不就好了?
現在每題只有 3 個 sampl...
Day 14 裡,筆者遇過候選已經提供正式求助窗口,Judge 卻說它沒有提供的情況。Day 15 則談到另一個限制:Reward Model 能替同一組候選排...
這系列走到今天,裝過的 plugin、skill 已經一大串了。每次都在測「這個 skill 有沒有用」,卻沒問過另一個更基本的問題:這些從 marketpla...
上一篇用模糊描述,測試能不能找回知識庫裡的 BlackByte 案例。雖然沒有輸入名稱,系統還是找到了相關資料,這有接近我原本的期待。
不過,接著想到另一個問題...
Day 15 跑完 frozen benchmark 後,整體結果其實滿漂亮的。24 題裡答對 23 題,Accuracy 是 95.83%,Agreement...
今天為什麼研究這個?
Day 16 已能為每個目標日輸出 personal baseline 的 center、scale 與資料狀態。下一個問題是:今天的值離...