iT邦幫忙

2026 iThome 鐵人賽

DAY 23
0
自我挑戰組

用數據守護雙眼:生活型態對視力影響的探索性資料分析系列 第 23 篇

輕量急速王者!LightGBM 葉節點導向生長與多類別預測實戰

  • 分享至 

  • xImage
  •  

針對 Day 22 XGBoost 在全域損失最小化過程中過度吸附中度風險、導致低度風險預測歸零(Macro F1 跌至 0.248)的現象,導入微軟開發的另一梯度提升巨頭——LightGBM(Light Gradient Boosting Machine)。運用其特有的葉節點導向生長、基於直方圖的特徵分箱(Histogram-based Binning)以及多類別權重平衡參數,探討 LightGBM 能否在極速訓練的同時,修復極端風險等級的召回平衡性。

一、 實作前情境:為什麼在 XGBoost 之後還要嘗試 LightGBM?
在 Day 22 中,XGBoost 拿下了全場最高的 43.00% 總準確率,但混淆矩陣揭示它把低度風險(Low Risk)預測歸零,將大量樣本吸入中度風險。

LightGBM 與 XGBoost 雖然同屬梯度提升家族,但底層架構存在核心差異:

1.生長策略差異(Level-wise vs. Leaf-wise):

  • XGBoost 預設採用層級生長,同一層的所有節點一併分裂,容易產生冗餘分支。
  • LightGBM 採用葉節點導向生長,每次只挑選「能帶來最大分裂增益」的單一葉節點進行分裂。在特徵重疊的資料集上,能用更少的葉節點精準切開高資訊量區域。

2.類別非平衡感知與直方圖加速:

  • LightGBM 原生支援將連續特徵分箱為直方圖(Discrete Bins),能有效減少微小量測雜訊對分裂點的干擾,對於自覺量表這種連續但包含雜訊的特徵具備平滑防過擬合效果。
  • 透過調整 class_weight='balanced',強制約束模型在多分類情境下關注少數類(低度與高度風險)。

上一篇
梯度提升王牌出擊!XGBoost 多分類殘差迭代與高風險召回攻防
下一篇
五大演算法終極爭霸!全模型性能評測與多類別 ROC-AUC 曲線大對決
系列文
用數據守護雙眼:生活型態對視力影響的探索性資料分析 共 24 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言