政府公文不只是把字讀出來,還要處理繁體中文、直橫混排、密集表格、跨欄儲存格與複雜閱讀順序。本作品打造一套專為繁體中文公文設計的 TW-OCR 系統,將文字偵測、版面分析、表格重建與 AI 文字辨識整合成完整流程。除了提升辨識準確度,也針對單張 GPU 的記憶體與多人使用情境進行最佳化,在固定回歸測試集達整頁字元錯誤率 0.3850%,並將偵測記憶體降低 67%、常駐模型記憶體降低 48%。希望讓政府文件能更可靠地轉換為可搜尋、可分析、可供 AI 使用的結構化資料。
如果今天只是要辨識一張乾淨的 A4 文件,我大概不會想自己做 OCR。 市面上已經有非常多成熟的 OCR 工具,開源、商用、雲端 API 都有。丟一張圖片進去,...
昨天聊完為什麼我要自己做一套繁體中文公文 OCR,今天先不急著講 CRAFT、PaliGemma2 或 LoRA。 因為在開始調模型之前,我遇到一個更基本的問題...
前兩天我們先處理了兩件事情。 Day 1 講的是: 為什麼政府公文不能只當成一般 OCR 問題。 Day 2 則先建立了一把尺: 到底怎樣才算 OCR 準。 今...