Recap: 昨天畫面做出來了,但測試的方式還是篇人工
每次貼的履歷都不一樣,結果變好,分不出是 prompt 的作用還是題目變簡單
接下來幾天每天都在改 prompt,改之前得先有一批固定的題目
接下來會用十份假履歷來做測試
然後每份履歷都故意要有一些毛病來做驗證
像是以下之類的
| 標記 | 想測出什麼 |
|---|---|
vague |
通篇「負責開發」,會不會腦補細節 |
quantified |
原文有 QPS、P99,會不會誇大 |
skill_gap |
職稱與技能不相稱,看不看得出來 |
timeline_gap |
沒說明的空白期,抓不抓得到 |
explained_gap |
已說明原因的空白期,會不會誤判 |
輸入固定了,接下來換輸出
Day 04 的 /analyze 只回一個 analysis 字串,整份分析擠在裡面
程式數不出它給了幾點建議,也檢查不了每一點有沒有指回履歷原文
明天把它拆成有欄位的 schema