昨天我們完成了開發環境的準備,今天正式進入 AI Engineering 的第一步:選擇模型。在打造應用程式時,並非總是「越大越好」,優秀的軟體架構必須在效能、成本與精準度之間做出權衡。
巨型語言模型 (LLMs):全能的系統中樞
代表模型如 GPT-4o 與 Gemini 1.5 Pro。
能力邊界: 具備極強的跨領域推論、複雜邏輯拆解與長文本理解能力。
適用場景: 適合擔任系統的「大腦中樞」,例如處理多步驟的 Agent 任務分派,或是應對毫無結構的開放式對話。
工程挑戰: API 呼叫成本較高,且回應延遲(Latency)較長,需考量系統的即時性。
小型語言模型 (SLMs):輕量敏捷的任務專家
代表模型如開源的 Llama 3 (8B)、Qwen 或 Gemma。
能力邊界: 參數量較小,面對複雜推演容易出現幻覺。但若針對單一任務進行最佳化,表現能媲美甚至超越大型模型。
適用場景: 適合資料隱私要求高或需要極快回應的場景。例如,專門負責將原始文本轉換為特定的資料交換標準格式,這類規則明確的任務,使用 SLM 就能以極低延遲與成本完成。
開發與選擇策略
在開發初期,建議採用敏捷開發的策略,先使用 GPT-4o 或 Gemini 進行概念驗證(PoC),確保核心業務邏輯可行。待服務準備大規模上線時,再找出系統中的瓶頸,將特定的單一任務模組抽離,替換成低成本的開源 SLMs。