Day 2 釐清了 AI、Generative AI、LLM 的層級關係,知道專題的核心功能幾乎都建立在 LLM 之上。但 LLM 不是只有一種,市面上主流的三大家分別是 OpenAI 的 GPT、Google 的 Gemini,以及 Anthropic 的 Claude。
Day 3 的目標,不是要選出「絕對最強」的那一個——這三家幾乎每隔幾個月就會互相超車一次,榜單參考價值有限。真正該問的問題是:以「情境生成 → 角色扮演 → 即時修正 → 學習報告」這個流程來說,我該優先用哪一個來開發?
先從最基本的「怎麼用」開始比較:
GPT(ChatGPT / OpenAI API)
Gemini(Google AI)
Claude(Anthropic)
補充一點:三個平台的實際版本與效能排名變動很快,光是 2026 年內就更新了好幾輪,任何比較文章(包含這篇)的具體排名都只能參考當下時間點。實際開發時,建議直接去各家的官方文件確認目前的模型版本與定價,而不是完全依賴網路上的比較表。
與其空談優劣,Day 3 更務實的做法,是直接拿專題會用到的三種任務,分別丟給三個平台的免費版試用,觀察差異:
Prompt 範例:
請根據「在美國咖啡廳點餐」這個情境,生成:情境背景、AI 要扮演的角色、使用者角色、對話目的,以及建議使用的英文表達方式。
觀察重點:生成的情境夠不夠具體?角色設定是否合理?有沒有主動給出實用的表達建議?
Prompt 範例:
你現在扮演美國咖啡廳的店員,我是顧客,情境是我要點一杯咖啡。請用店員的身份開始跟我對話,我回覆之後請自然地繼續互動,不要用固定劇本。
觀察重點:AI 是不是真的「順著對話走」,還是每次都用類似的罐頭回覆?角色是否有一致性?
Prompt 範例:
我說了這句英文:「I want a coffee with not too much sweet.」請告訴我:(1) 文法修正後的句子 (2) 更自然、母語者常用的說法 (3) 簡單說明為什麼這樣說更自然。
觀察重點:修正是否準確?「更自然的說法」是不是真的道地,還是只是換句話說?有沒有清楚的教學說明?
同一組 Prompt,分別在三個平台跑一次,把結果並排比較,會比看任何排行榜都更有參考價值——因為這就是專題實際會用到的場景,不是通用的跑分測試。
除了生成品質,選擇時還要考慮幾個開發面的現實問題:
以目前規劃的功能來看,比較務實的作法是:
重點是:先讓系統動起來,比一開始就選對「完美模型」更重要。 Prompt 設計(Day 4、Day 5 要做的事)對輸出品質的影響,往往比選哪一家模型還大。
Day 3 從「怎麼用」出發,實際比較了 GPT、Gemini、Claude 在情境生成、角色扮演、英文修正這三項專題核心任務上的使用方式與初步表現差異,也確認了選型不需要追求絕對最強,而是要符合開發階段的實際需求(好串接、生態系熟悉、後續能接 Dify)。
明天(Day 4)要進入更關鍵的一步:學習 Prompt Engineering 的基礎概念與設計方法——因為不管最後選哪個模型,能不能問對問題,才是決定 AI 輸出品質的關鍵。
本文為「30 天 AI 情境英文口語教練」自主學習專題系列文章 — Day 3