hi 鐵人賽 我又回來啦
繁體中文文件辨識長期面臨字型多變、排版複雜、手寫與印刷混雜,以及大量領域專有名詞與專業術語的挑戰。傳統 OCR 僅能做到「看到字」,卻難以真正「理解字義」。當文件涉及法律、醫療、財務或技術領域時,單一字元錯誤就可能導致整段語意失真。
本系列從「LLM OCR」出發——不只是用大型語言模型輔助後處理,而是讓 LLM 深度參與辨識流程,結合視覺與語言能力進行端到端的文字提取與校正。更關鍵的是,系統會導入領域字義理解機制,透過領域知識庫、術語詞典與上下文推理,讓模型能辨識並正確詮釋專業詞彙,大幅降低「看對字卻解錯意」的情況。
去年寫完《Android 不會只更新 UI!用 Vibe Coding 加速打造 AI-native App》的最後一篇,我就在想一件事那系列在講「怎麼讓 AI...
昨天我說,先讓你看它壞掉。 今天直接跑這個測試。 規則很簡單:不搭架構。一頁圖丟進去,叫它把字讀出來。 沒有版面偵測、區塊分流、前後處理,也沒有驗證。 這是刻意...
昨天我們看到一顆 26B 的模型直接吃整頁文件會怎麼壞 今天要講的是另一半:就算你想用更大的模型去救它,你的硬體也不會答應 而且不是「跑不動」那種不答應 是跑得...
昨天結論是:單序列速度撞到記憶體頻寬的物理上限,調參救不回來,只剩兩條路 今天走第一條:量化 我先講結論,因為這篇會有點長: 量化不是「把模型變小」,是「用精度...
Day 3 的結論是「調參救不回來,只剩量化跟推測解碼兩條路」 Day 4 走完第一條 今天走第二條,然後把 Phase 1 收掉 先預告今天的結局:我們會得到...
昨天收 Phase 1 的時候我講了一句可能會害到自己的話:今天測的法說會簡報,版面其實相當乾淨 今天這篇就是去把髒的找出來 而且不是我用眼睛翻頁挑的,是用分數...
昨天結尾我留了一個問題:錯誤分類表裡,簡體字、異體字、形近字三個類別的計數全是 0 而我明明在第 24 頁親眼看到「綠」被讀成「線」 今天這篇要講一個「沒炸」的...
兩天前我說要把繁中的難點攤開,現在攤完了 桌上有一堆壞掉的東西:位置跑掉的貨幣符號、被吃掉的總數、讀成「線」的「綠」、重複一百次的材料名、以及三個誠實的 0 今...
繁中的難點攤開之後,總要有一顆模型去承擔它們 所以今天回到最基本、也最容易被跳過的那一題:選型 而我要先講一句可能有點掃興的話——這一題在我這台機器上,有一半是...
昨天的結論是「平均而言 MoE 比較划算」 今天要處理的是那個「平均」兩個字 因為 Day 2 就已經告訴我們一件事:這份文件根本不是均質的。純文字頁覆蓋率 9...