iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
自我挑戰組

用數據守護雙眼:生活型態對視力影響的探索性資料分析系列 第 5

探索分類特徵!類別變數分佈檢視與受試者輪廓初探

  • 分享至 

  • xImage
  •  

一、 實作前情境:為什麼要檢視類別特徵?
昨天我們完成了 7 個數值型欄位的 describe() 檢驗,確認數值都在合理生理範圍內。
但這份資料集還有 6 個屬於字串物件的類別欄位:

  1. 人口學變數:Gender(性別)、Role(身分)
  2. 護眼與就醫習慣:Blue_Light_Filter_Used(藍光濾鏡)、Eye_Checkup_Last_Year(去年是否眼科檢查)
  3. 自覺症狀與風險:Blurred_Vision(視力模糊)、Digital_Eye_Strain_Risk(用眼疲勞綜合風險等級)
    在正式視覺化之前,必須先確認:
  • 類別文字是否有髒污(例如出現多餘空白 'Yes ' 與 'Yes' 被判定為兩類)?
  • 樣本類別比例是否極度失衡(Class Imbalance,例如99%都是同一類)?

二、 撰寫與執行類別檢驗腳本
在昨天的單元格下方,新增一個程式碼儲存格,寫一個迴圈一次印出所有類別欄位的次數與百分比:

# ==========================================
# Day 5:類別變數分佈與受試者輪廓探索
# ==========================================

# 1.篩選出所有資料型態為 object 的類別欄位
categorical_cols = df.select_dtypes(include=['object']).columns

print(f"共有 {len(categorical_cols)} 個類別欄位需要檢驗:\n{categorical_cols.tolist()}\n")

# 2.依序印出每個欄位的次數統計與百分比
for col in categorical_cols:
    print(f"=== 欄位:{col} ===")
    counts = df[col].value_counts()
    percentages = df[col].value_counts(normalize=True) * 100
    
    # 結合成 DataFrame 方便閱讀
    summary = pd.DataFrame({'人數 (筆數)': counts, '佔比 (%)': percentages.round(1)})
    print(summary)
    print("-" * 35)

https://ithelp.ithome.com.tw/upload/images/20260919/20178794nd4NksHmw5.png

三、執行結果解讀與受試者輪廓畫像
人口學結構:均衡且具多元性

  • 性別:女性266人(53.2%)、男性226人(45.2%)、其他8人(1.6%)。男女比約1:1,樣本代表性相當不錯。
  • 角色身分:學生266人(53.2%)、職場人士234人(46.8%)。兩大目標族群幾乎呈現1:1對稱分佈,後續非常適合做兩組族群用眼習慣的橫向對比。
    護眼與就醫習慣現況
  • 藍光濾鏡使用率 (Blue_Light_Filter_Used):有使用(Yes)為303人(60.6%)、未啟用(No)為197人(39.4%)。超過六成的受試者具備基本的藍光防護意識,兩組樣本人數均破百,後續做差異性假設檢定(Hypothesis Testing)時樣本量非常充足!
  • 過去一年眼科檢查 (Eye_Checkup_Last_Year):未檢查(No)260人(52.0%)、有檢查(Yes)240人(48.0%)。剛好維持在一半一半的狀態,顯示現代人對於主動就診檢查眼睛的習慣存在明顯分野。
    視力症狀與綜合風險指標(專案核心亮點)
    1.視力模糊症狀 (Blurred_Vision):高達 31.0%(155人) 的受試者明確表示在用眼後有出現視力模糊症狀!這近三分之一的比例,是我們探討「到底是每日螢幕時數過長、還是不休息導致視力模糊」的最佳切入點。
    2.用眼疲勞綜合風險等級 (Digital_Eye_Strain_Risk):
  • 中度風險 (Medium):235人(47.0%),近半數族群處於亞健康狀態。
  • 高度風險:147人(29.4%),接近三成受試者眼睛疲勞風險嚴重超標。
  • 低度風險:118人(23.6%)。
  • 解讀:中高風險加總高達76.4%,呈現典型的金字塔或紡錘型分佈,完全沒有嚴重的類別失衡,後續做多分類視覺化或特徵影響分析時結構非常扎實。

上一篇
資料健康檢查!缺失值排查、型態驗證與數值合理性驗證
系列文
用數據守護雙眼:生活型態對視力影響的探索性資料分析5
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言