我是 Kota,宇鯨智能的創辦人,從 2021 年開始了一人公司,協助中小企業透過 Data / AI 技術進行數位轉型。
我特別關注想要建立新的服務模式、獲取營收的製造業。這背後需要進行大量的流程再造和數位管理,也需要藉由 AI 技術自動化瓶頸的步驟,這些是我特別擅長的領域。
前一篇提到,我們最後選了一個比較小的 Transformer 分類模型,直接放在業務的電腦上執行;也用了客戶內部的新資料做定期類似盲測,來完成驗收工作。不過,最初的目標是減少業務每天處理報價的時間,除了模型的效果,還必須決定其實整個流程裡,哪些事情應該交給軟體自動化處理,哪些事情仍然需要人來做。
前面提過,這個案子最麻煩的地方之一,就是每個客戶提供的 Excel 格式都不一樣。有些欄位從第一列開始,有些前面有標題、說明或其他資訊,欄位名稱和版面配置也沒有固定規則。
一個作法是讓 LLM 來解析 Excel,自動判斷真正的資料從哪裡開始、哪些欄位需要處理、欄位名稱如何對應。不過考量不同客戶的版面差異幾乎是沒有邊界的,以及 LLM 模型在當時無法跑在只有 CPU 的電腦上,我們決定從簡,業務匯入資料到 Excel 後,透過選單指定欄位的對應關係,並指定一個資料起始點的位置,接著才交給 Transformer 模型進行分類。
這樣的設計並不是完全自動,但對業務來說,指出資料從哪裡開始並不是一件困難的事情;相反地,如果要求程式自己適應所有可能出現的 Excel 版面,系統需要處理的不確定性和例外情況就會增加很多。因此,我們沒有把「完全不需要人碰」當成自動化的前提,而是先思考哪一小段工作由人處理最簡單,再把後面大量、重複性的工作交給系統。
資料進到系統之後,下一步就是利用模型把零件描述對應到內部料號。不過模型不可能每一筆都判對,如果採用最保守的方法,就是業務從頭到尾把檢查模型每一筆分類結果。
這樣雖然可以透過人工降低錯誤風險,但如果一張報價單裡有大量零件,因為不知道哪一筆可能是錯的,業務仍然需要確認幾百筆結果,原本自動化節省的時間,反而又花在檢查。比較好的方式,是提前讓業務知道哪些資料特別需要檢查。
我們使用的分類模型除了輸出它認為最可能的料號,也會提供一個 Confidence Score,也就是模型對這次分類結果的信心程度。有些結果的信心值非常高,甚至可以超過 95%;另外一些則落在中間或偏低。經過一段時間的測試之後,我們就可以開始觀察,不同信心值區間的結果,實際上有多少機會分類正確。
最後的使用方式,是讓高信心值、而且經過測試確認錯誤率已經很低的分類結果自動化處理,業務則去檢查低信心值的結果上。如果有 70% 的分類結果都是高信度,那使用者只需要檢查剩下 30% 的分類結果,也就是大約只需要花原本 30% 的時間就能完成這個工作。這些分類錯誤的資料,通常是新的描述方式,或者在訓練資料出現次數較少的零件,確實需要業務進行專業判斷。
在這個專案中,我們對人機協作的交界點做了 2 次判斷:
這兩個地方的共同點,是我們沒有要求 AI 或軟體把整條流程完全吃掉。對人來說很容易、但對系統來說需要處理大量例外的事情,可以保留少量人工操作;對人來說大量、重複、耗時間,但系統可以穩定處理的事情,就盡量交給系統。我們認為這樣的做法,能夠盡可能在技術複雜度和使用者體驗上達到一個平衡。
我們當時在梳理這段流程時曾經估算,如果能把這些重複性的工作大量自動化,省下來的工作量可能接近一位業務人員。不過這並不代表系統上線之後,公司就少需要一位業務,因為報價只是業務工作的一部分。業務真正還需要做的事情,包括開發市場、拜訪客戶、了解客戶需求、處理新的專案,以及維持既有客戶關係;相較之下,報價資料整理反而是其中重複性比較高,也比較接近行政作業的一段。
也可以從機會成本的角度試想看看,如果有 10% 的報價因為速度太慢而被競爭對手拿走,一個月報價 30 次,平均訂單金額是 50 萬,那損失是 50 * 30 * 10% = 150 萬,這樣就要看公司規模判斷是不是一個值得賺回來的數字。
如果一開始就把目標設定成完全無人介入,我們可能會花很多成本處理那些只有少數情況才會出現的例外;但如果因為模型可能犯錯,就要求人把所有結果重新檢查一遍,又很難真正得到自動化的效益。
比較實際的做法,是先把整個工作流程拆開,看清楚人和系統各自擅長處理什麼。在這個案例裡,人負責提供少量必要的資訊、處理模型比較可能犯錯的情況;系統則負責大量、重複,而且有高信心度能夠穩定處理的工作。透過「人機協作」機制,AI 就不必背負著要「考 100 分」的重擔!
有興趣知道更多的,也歡迎和我聯繫交流( kota@yujing.io )!