hi 鐵人賽 我又回來啦
繁體中文文件辨識長期面臨字型多變、排版複雜、手寫與印刷混雜,以及大量領域專有名詞與專業術語的挑戰。傳統 OCR 僅能做到「看到字」,卻難以真正「理解字義」。當文件涉及法律、醫療、財務或技術領域時,單一字元錯誤就可能導致整段語意失真。
本系列從「LLM OCR」出發——不只是用大型語言模型輔助後處理,而是讓 LLM 深度參與辨識流程,結合視覺與語言能力進行端到端的文字提取與校正。更關鍵的是,系統會導入領域字義理解機制,透過領域知識庫、術語詞典與上下文推理,讓模型能辨識並正確詮釋專業詞彙,大幅降低「看對字卻解錯意」的情況。
昨天留下的問題其實很不舒服:沒有答案卷時,誰來說 OCR 對不對? 最省事的答案是讓產生結果的模型再讀一次。也是我不採用的答案。Day 5 已經把這個坑叫出名字...
昨天寫完 verifier_protocol.py,我在終端機前面坐了很久。 介面訂好了,gpt-oss:20b 還是跑不起來。本機 4GB 顯卡差一個數量級,...
我手上現在有三張表,散在三篇文章裡。 Day 10 那張講速度跟準確率:純文字區、表格區、混排區各跑多快、各漏多少字。Day 11 那張講硬體:gpt-oss:...
昨天收尾時我說,接下來要拿真的年報來跑,不能再靠查規格過關。 今天就是那一天。老實講,我原本規劃的這篇是一篇「語意」文章:OCR 已經把字讀出來了,接著討論「關...
昨天收在一個很尷尬的地方:第 61 頁三個公文字號,整頁送 0/6,切半送還是 0/6。 交叉引用解析要吃文字。沒有文字,後面什麼都不用談。所以今天分兩段:前半...
Day 14 那筆 M-01 我一直忘不掉。 「民國一百一十一年七月二十五日/3,065,000股」被讀成「民國一十一年十二月十五日/3,065,000股」。股...