開場:一個情境跑得通,不代表每個情境都跑得通
Day 13 寫完第一版 Prompt,拿一兩個情境測試,看起來還不錯。但我心裡其實有個疑慮:我測的都是「咖啡廳點餐」這種很好發揮的情境,如果換成別的場合,Prompt 還撐得住嗎?
所以今天不改任何東西,純粹當一個挑剔的測試者,丟不同類型的情境進去,觀察 AI 的回應會在哪些地方露出破綻。
今天的測試設計
我刻意挑了幾種「性質不同」的情境,而不是隨便找幾個類似的:
日常生活型:在咖啡廳點餐、在餐廳反映餐點有問題
旅遊型:機場辦理登機、旅館 Check-in
正式場合型:第一次英文面試、與同事討論工作進度
社交型:跟朋友閒聊週末計畫
同時也刻意加了幾個「不太標準」的輸入,例如很短的「面試」兩個字、很口語的「想練習跟地勤吵行李超重」,還有一句寫得很長又夾雜好幾個需求的描述,用來測試 Prompt 面對不同輸入品質時的表現。
觀察到的結果
表現穩定的部分
日常生活型和旅遊型的情境表現最好。這類情境本身就有明確的角色(店員、櫃檯人員)和固定的對話流程,AI 生成的角色設定和關鍵句型都相當貼近真實場景,也確實用了「Can I get...?」這類母語者常用的說法,而不是教科書式的「I want...」。
出現問題的部分
正式場合型的用詞偏口語:面試、跟同事討論工作這類情境,AI 有時候會生成太隨性的句型,不太符合正式場合該有的語氣。看起來 Prompt 裡沒有明確要求「語氣要配合場合正式程度」,AI 就用了預設的偏日常風格。
社交型情境的角色設定很空洞:跟朋友聊天這種沒有明確「任務目標」的情境,AI 生出來的角色設定很模糊,不知道這場對話該往哪裡走。這點也顯示出一個缺口:Prompt 沒有處理「情境本身缺乏明確目標」的狀況。
輸入太短時,補完的內容每次都不同:只打「面試」兩個字,連續測三次,每次補完的產業、職位都不一樣。這在 Day 13 就觀察到了,今天用更多樣本確認這個現象是穩定會發生的。
輸入太長太雜時,AI 會漏掉部分需求:一次塞了三個需求進去,AI 只處理了前兩個,第三個被默默忽略。
格式污染仍然偶爾出現:Day 13 記下來的那個「多餘客套話」問題,今天十幾次測試中還是出現了兩三次,頻率不算高,但確實還沒根除。