做去識別化工具的時候,有一個很小、但很經典的坑。
假設文件裡同時出現兩個詞:「測試科技」和「測試科技股份有限公司」。
如果工具先換掉短的那個,長的那個就會變成:「C1股份有限公司」。
名字是換掉了,但也等於告訴別人:
這是一間公司的全名,而且開頭那幾個字就是C1。
解法不難:
先換長的,再換短的。
就這樣,一個排序而已,但這種小地方,才是一個工具能不能真的拿來用的關鍵。
這個坑有趣的地方在於,它很難在寫需求的時候就想到。
需求文件會寫「把公司名稱換掉」,
但不會寫「公司名稱有長有短,而且短的剛好是長的開頭」。
通常是拿接近真實的樣本資料跑過一次,才看到。
這也是為什麼現在帶同學做工具,一定會留一段時間做同一件事:
準備一份像真的一樣的假資料,實際跑一次。
不是不相信AI寫的程式。
而是有些問題,不會出現在需求裡,也不會出現在程式碼裡,
它只會出現在資料裡,要實際資料跑了才會知道問題點。