上一篇用快取讓同一句搜尋不用每次重算。不過快取總有沒命中的時候:第一次有人搜尋「送男生的植鞣皮夾」,系統還是得呼叫模型,而每一次呼叫都要等待,也都要付錢。
前面整理商品資料的那幾篇,已經談過哪些步驟用規則就夠、哪些需要模型,也談過怎麼評估模型的答案好不好。確定某個步驟要交給大型語言模型(LLM)之後,還有三件事要決定,很多人要到第一次把 AI 功能放上線,才會遇到:
很多人聽過「開源模型免費」,就以為自己架模型比較省錢。但這句話把兩件事混在一起了:一是你拿不拿得到模型本身,二是誰負責把模型跑起來。
Qwen、Llama 這類大家常說的開源模型,比較精確的叫法是開放權重(open weights)模型。權重就是模型訓練好之後的參數,公開了,你就能自己架,也能用別人幫你架好的服務;GPT、Claude 這類封閉模型拿不到權重,只能透過 API 呼叫。開放權重模型能拿來做什麼,要看發布頁上的授權,例如 Qwen3-8B 是 Apache 2.0,Llama 3.3 則是 Meta 自己訂的社群授權。

自己架的好處是版本和資料都在自己手上,但主機要錢,就算沒人在用也一樣要付,硬體、擴充和維護也都得自己顧。所以流量還說不準的小產品,通常會先用現成的 API:註冊、拿到金鑰就能開始,代價是用多少付多少,每分鐘能呼叫幾次也有限制,也就是呼叫頻率限制(rate limit),資料也要交給對方處理。常見的選擇有這幾種:
挑的時候,先想清楚你的資料能不能交給外面的服務,還有萬一出問題,能不能很快換到另一家。
服務選好了,接下來要決定用多強的模型。能力、速度和價錢通常沒辦法全都要,越強的模型通常越貴,也可能比較慢。模型的強弱可以先從參數量(像 8B 就是大約 80 億個參數)或各家的等級(像 Claude 的 Haiku、Sonnet、Opus)大致判斷。同一個模型還可以讓它先想再回答,這個設定通常叫做推理強度(reasoning effort):想得越多,通常答得越好,但思考產生的 token(模型切分文字的單位,也是計費單位)一樣要算錢,使用者也得多等一下。
Artificial Analysis 用同一套測驗替各家模型打分數。下圖依它 2026 年 10 月初的資料,比較 Claude Opus 5.5 和 GPT-6.1 Sol,每個點是一種推理強度,越往右上,分數越高、每題測驗的平均花費也越多:

兩個都開到最高時,Opus 5.5 多 6 分,花費卻是八倍多;但 Opus 5.5 只要調到 High,每題大約 2 美元就有 54 分。多出來的那幾分值不值得,要看你的工作需不需要,最後還是要拿自己的工作試過才知道。一般可以這樣挑:
各家的計價方式不太一樣,自己算很容易算錯,最準的還是服務商後台的帳單。與其自己算,不如先做好三件事:
上限擋下來時,AI 功能會直接失敗,而且這種錯誤看起來很像呼叫頻率限制。程式要能認出它、不要重試,直接改顯示不需要 AI 的版本,並通知自己。
帳單突然暴增,很多時候是程式出了錯,常見的有這三種:
最後,每次呼叫也要設上限:最多產生多少 token、最多等幾秒。要注意的是,模型先思考時,思考的 token 也算在輸出上限裡,上限設太小,答案可能被截斷,費用卻照算。
模型選好之後,也不代表就不會再換。新模型推出、價格調整,或某個功能的品質一直不夠好,都會讓你想換模型。前面談評估的那一篇,已經看過怎麼準備測試資料、用哪些指標判斷答案好不好;比較兩個模型時,這套做法一樣適用:同一批測試資料、同一份正確答案、同一版提示詞(prompt),測試資料也要包含容易混淆、需求不明確的句子。除了準確度,還要一起比較這幾項:
測試資料不多的時候,差一兩筆,正確率就會差好幾個百分點,所以結果只能看出大致的方向。新模型的準確度如果不輸原本的,又明顯更快、更便宜,就值得換;如果只好一點點,卻貴了好幾倍,就未必划算。比較結果也只適用於這件工作:搜尋的意圖解析換了模型,不代表撰寫品牌介紹也要跟著換。
為了讓換模型又快又安全,有幾個習慣最好一開始就養成: