以前做產品,我很習慣看:
PV
UV
CTR
CVR
Retention
Feature 上線之後,有多少人點、有多少人用、最後有沒有 Conversion。
但最近開始做 AI Product,我發現有些以前很直覺的 Metric,突然沒有那麼直覺了。
假設一個 AI Assistant 上線後:
MAU ↑
Messages ↑
Conversation Turns ↑
第一眼看起來:
大家很愛用!
但另一種可能是:
User 問一次
↓
答案不好
↓
換個問法再問
↓
還是不對
↓
再問一次
Messages 很高。
Engagement 也很好看。
但 Product 可能其實做得很差。
所以我開始覺得:
AI Product 真正該看的,不是 User 跟 AI 說了多少話,而是 AI 到底幫 User 完成了多少事情。
這件事情跟傳統 Social / Content Product 很不一樣。
以前我們可能很喜歡:
Session Duration ↑
Interaction ↑
Engagement ↑
但假設 User 問 AI:
「我今年還有幾天假?」
最好的體驗可能是:
User 問一次
↓
AI 正確回答
↓
結束
30 秒就離開。
這個 Session 很短。
但 Product 非常成功。
反過來,如果 User 問了五次才得到答案:
Turns ↑
Time Spent ↑
Messages ↑
看起來 Engagement 更高,
實際上可能只是:
AI 一直沒有解決問題。
所以 AI Product 有一個很有趣的 Metric 反轉:
有些 Interaction,我們真正想優化的是「越少越好」。
之前聽 Lenny's Podcast 談 AI Evals 和 Production Monitoring 時,有一個觀點讓我印象很深。
很多 AI Product 都會放:
👍 Thumbs Up
👎 Thumbs Down
看起來這應該是最直接的 User Satisfaction Metric。
但問題是:
User 不一定會按。
有時候他不滿意第一個答案,不會特地按 👎。
他只是:
Regenerate。
重新產生一次答案。
這其實已經是一個很有價值的 Signal:
第一次的答案,很可能沒有滿足他的需求。
相關討論:
Lenny's Podcast|Why most AI products fail
另一篇 Lenny 的 AI Evals 指南也提到,Thumbs up / down 這類 Human Feedback 有兩個問題:
Sparse
很多 User 根本不會按
Ambiguous
按了 👎,到底是哪裡不好?
所以只看:
Thumbs-up Rate = 85%
不一定足以告訴我們 AI Product 做得好不好。
這讓我開始覺得,AI Product 除了 Explicit Feedback,還應該看:
Implicit Feedback。
例如:
Regenerate
重新產生答案
Rephrase
換一種方式再問一次
Retry
重新執行 Task
Abandon
做到一半離開
Escalate
最後還是找人工
Edit
大量修改 AI 產出的結果
這些 Behavior 都可能透露:
前一個 Output 到底有沒有真的幫上忙。
但這裡要小心。
例如 User 問:
「幫我介紹 Agent。」
下一句又問:
「可以再給我一個企業案例嗎?」
這不代表第一題失敗。
他可能只是想深入。
所以:
Repeat Question
≠
一定不滿意
更精準的做法是看:
User 是在 Continue,還是在 Correct?
例如:
「再多說一點」
→ Continue
「不是,我是問台灣的規定」
→ Correct
「重來」
→ Regenerate
重新輸入幾乎相同的問題
→ Rephrase / Retry
後面三種,就很值得 Product Team 回頭看 Trace。
最直接的是:
👍 / 👎
Rating
CSAT
Comment
這些很重要。
但問題是:
只有願意 Feedback 的 User 才會留下資料。
所以不能只靠這一層。
這是我覺得 AI Product 特別值得看的。
Regeneration Rate
Rephrase Rate
Retry Rate
Abandonment Rate
Escalation Rate
Turns per Task
例如:
User 沒按 👎,
但連續 Rephrase 三次,
最後點:
「聯絡客服」
這條 Journey 本身可能已經比 Rating 更能說明問題。
但前兩層其實都還只是 Signal。
最終我還是會回到:
User 的 Task 到底完成了嗎?
例如:
AI Search
→ User 找到需要的資訊了嗎?
Customer Service
→ 問題真的解決了嗎?
Agent
→ Task 真的執行成功了嗎?
Enterprise Assistant
→ 有沒有減少人工處理?
所以我會把 Metric 想成:
Explicit Feedback
User 怎麼評價?
↓
Implicit Behavior
User 接下來怎麼做?
↓
Task Outcome
事情到底有沒有完成?
越往下,其實越接近 Product Value。
假設兩個 AI Assistant:
平均 6 Turns
Messages 很高
Thumbs Up 80%
Task Success 60%
平均 2 Turns
Messages 比較少
Thumbs Up 80%
Task Success 90%
如果只看 Engagement,
A 好像比較熱鬧。
但如果 User 的 Goal 是:
把事情處理完。
我反而會更在意 B。
所以對 Task-oriented AI,我可能會開始看:
Turns per Successful Task
也就是:
User 平均要花多少 Interaction,才能真的把一件事完成?
這也剛好接回 Day 8 寫過的 Clarification Cost:
每一次 Ask、Retry、Rephrase,
其實都是 User Effort。
昨天 Day 15,我寫了一個 Metric:
Cost per Successful Task
不要只看一次 Model Call 多貴,
而是看完成一件有價值的事情,到底花多少資源。
今天可以把另一半補上:
Cost per Successful Task
AI 花多少資源?
×
Value per Successful Task
AI 到底替 User / Business 解決多少問題?
例如企業 AI 最後真正值得看的,可能不是:
一個月產生 100,000 則 Message。
而是:
Self-service Resolution ↑
Task Completion ↑
Time to Resolution ↓
Human Escalation ↓
User Effort ↓
這才開始接近 AI 真正創造的 Product Value。
最後我會整理成:
1. Adoption
User 有沒有開始使用?
2. Explicit Feedback
User 說滿不滿意?
3. Implicit Behavior
User 下一步的行為透露什麼?
4. Task Outcome
事情最後有沒有完成?
其中第一層只能告訴我:
AI 有沒有人用。
最後一層才開始回答:
AI 有沒有用。
這兩件事,我覺得差很多。
AI Product 很容易產生大量漂亮的 Usage Data。
Messages。
Sessions。
Turns。
Thumbs Up。
但如果 User 一直 Rephrase、Retry、Regenerate,
最後還是沒有完成 Task,
再高的 Engagement 也不一定是成功。
所以我現在會更想知道:
User 為什麼繼續問?
是想知道更多?
還是因為上一題根本沒有解決?
AI Product 真正值得看的,不是 User 跟 AI 說了多少話,而是 AI 幫 User 完成了多少有價值的事。
User 沒有按 👎,
不代表他滿意。
有時候他的下一個 Action,
已經把答案告訴我們了。