iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
自我挑戰組

從多數決到可信投票:30 天打造 TACT 大語言模型推理聚合方法 系列

這個系列將以我開發的 TACT(Trust-Anchored Confidence Tempering)為主軸,從 LLM Self-Consistency 的多數決限制出發,逐步說明有號信心加權、死區安全機制、無標籤估計、數學推導、Python 實作與實驗設計。我也會公開失敗案例、消融實驗與真實模型軌跡,討論何時可以信任信心訊號,以及證據不足時為何應退回一般多數決。

參賽天數 5 天 | 共 8 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|如果模型會投票,每一票真的都該一樣重嗎?

我做 TACT,是被一個很直覺的想法坑到的:模型越有把握,那一票就應該越重。 聽起來很合理,實驗一跑卻翻車了。只要模型的信心方向反過來,高信心加權就會把錯誤放大...

2026-08-14 ‧ 由 vito1317 分享
DAY 2

Day 2|Self-Consistency 只有一行?我在平手規則踩過的坑

上一篇把問題攤開後,這回來寫最小版 Self-Consistency。多數決那一行很短,旁邊那些看似無聊的小事才會咬人。 我以前真的寫過這種一行版本: Coun...

2026-08-15 ‧ 由 vito1317 分享
DAY 3

Day 3|信心加權只改幾行,為什麼反而更容易投錯?

上一篇的投票器只看答案,不看模型講得多有把握。今天替每條推理軌跡加上一個信心分數,再看看這個看似合理的改動會出什麼事。 先說結論:正向信心加權確實可能大幅贏過多...

2026-08-16 ‧ 由 vito1317 分享
DAY 4

Day 4|同樣是 0.9,為什麼不能直接拿來比?

第三篇直接把信心塞進票重,結果很刺激:信心方向正確時,準確率可以大幅上升;方向反過來,也能把多數決拖得很慘。 不過在判斷方向之前,還有一個比較不起眼的問題要處理...

2026-08-17 ‧ 由 vito1317 分享
DAY 5

Day 5|高信心真的比較常答對嗎?用 AUC 把方向量出來

第四篇把原始信心換成題內排名,總算解決了尺度亂飄的問題。可惜排名只告訴我誰比較有把握,還沒回答最關鍵的一句:有把握的軌跡,真的比較常答對嗎? 今天會用有答案的開...

2026-08-18 ‧ 由 vito1317 分享
DAY 5

Day 6|每題的 D 都不一樣,該聽誰的?

第五篇算出每一題的 Somers' D,麻煩也跟著來了。開發集裡可能有 100 題,就會得到 100 個方向和強度都不同的 D。有人強烈正向,有人接近 0,也可...

2026-08-20 ‧ 由 vito1317 分享
DAY 5

Day 7|少一題就翻盤?用 jackknife 檢查 D̂ 有多脆弱

Day 6 算出了全域 D̂ 和虛無標準誤 SE₀。數字看起來已經很完整,卻還有一種翻車方式:只要拿掉某一題,整個方向就變了。 這種情況在開發集不大時特別常見。...

2026-08-23 ‧ 由 vito1317 分享
DAY 5

Day 8|證據不夠就別加權:TACT 的死區怎麼工作?

Day 7 把全域 D̂ 除以保守標準誤,得到 ζ=D̂/SE。現在終於能回答一個很實際的問題:這份信心訊號,夠不夠格改動多數決? TACT 的答案偏保守。證據...

2026-08-24 ‧ 由 vito1317 分享