昨天介紹了 VoCare 的整體概念,也提到這個專案希望讓 AI 不只是「回答問題」,而是能真正融入使用者的日常生活。
但在開始做功能之前,其實還有一個更重要的問題:
VoCare 到底想解決什麼問題?
因為如果只是看到 AI 很熱門,就開始塞聊天、語音、影像辨識、提醒等功能,很容易最後變成一個「功能很多,但不知道為什麼需要這些功能」的系統。
所以今天想先從使用情境開始,重新整理 VoCare 的需求。
VoCare 最初的想法其實很單純,就是希望做一個可以陪伴使用者的 AI。
但如果只是:
使用者輸入問題 → AI 回答
那本質上就只是一個一般的 Chatbot。
現在不論是 ChatGPT、Gemini 或其他 AI 服務,都已經能做到很好的文字與語音對話,所以如果 VoCare 只是再做一個聊天介面,其實沒有太大的意義。
因此我後來開始思考:
有沒有一些事情,是 AI 可以在使用者「沒有主動開口」的情況下幫忙的?
例如使用者已經坐在電腦前好幾個小時,可能已經很疲勞,但他自己沒有注意到;或是一位長者到了吃藥時間卻忘記了。
這些情況下,真正有幫助的系統,應該不是等待使用者詢問,而是能在適當的時間主動提醒。
這也慢慢變成 VoCare 最重要的核心概念:
從被動回答,變成主動陪伴。
先從一般使用者來看。
現在很多人的生活幾乎離不開電腦和手機,不論是上課、寫程式、工作或娛樂,都可能長時間坐在螢幕前。
我自己在做專案的時候也常常會遇到類似的情況。
原本只想再寫一下程式,結果回過神來已經過了一兩個小時;有時候明明已經很累,還是會繼續盯著螢幕。
因此在一般生活模式中,我希望 VoCare 可以協助處理一些容易被忽略的事情,例如:
這些功能看起來各自很普通,但如果可以結合 AI,就有機會做得更自然。
舉例來說,一般的提醒 App 可能只會在固定時間跳出:
18:00 記得吃飯。
但如果系統知道使用者今天 18:00 還在忙一件事情,或是已經延後過一次提醒,就可以用比較符合當下情境的方式互動。
例如:
你原本預計六點吃飯,現在已經六點半了,要不要先休息一下?
這就是我希望 VoCare 和一般提醒工具產生差異的地方。
VoCare 的另一個主要方向是長者照護。
相較於一般使用者,長者需要考慮的不只是方便性,還包含 安全性。
例如:
這些事情如果只靠固定時間提醒,其實不一定足夠。
其中最明顯的例子就是跌倒。
假設手機相機偵測到使用者快速下降,而且身體最後接近地面,系統可能會判定發生跌倒。
但問題是:
偵測到跌倒,就一定是真的跌倒嗎?
有可能只是使用者坐到地上,也可能只是鏡頭判斷錯誤。
如果每次偵測到疑似跌倒就直接通知家屬,久而久之很容易造成大量誤報。
所以 VoCare 的想法是加入多個步驟,例如:
這樣就不是單純做一個「跌倒辨識模型」,而是把 AI 的分析結果放進一個完整的決策流程裡。
在整理需求的時候,我也發現另一個問題:
每個人的正常狀態其實不一樣。
例如某個人每天平均會走很多路,突然某一天活動量大幅降低,可能值得注意。
但另一個人本來每天活動量就比較少,如果用完全相同的標準判斷,很可能會一直產生錯誤提醒。
疲勞也是一樣。
有人工作一小時就會休息一次,有人習慣連續專注兩三個小時。
因此 VoCare 不能只靠一組固定門檻判斷所有人,而是希望慢慢建立每個使用者自己的基準。
例如:
未來系統就可以根據這些資訊,讓提醒變得比較個人化。
如果 VoCare 只知道使用者輸入的文字,其實很難做到前面提到的功能。
因此目前的設計會以手機作為主要的感測裝置,使用手機原本就有的:
來取得不同類型的資料。
例如相機可以協助觀察姿勢、動作或疲勞狀態;麥克風則可以用來做語音互動,以及在特定情境下判斷使用者是否有回應。
這裡也出現了一個很重要的 AI Engineering 問題:
如果不同資料給出了不同結果,到底該相信誰?
假設影像判斷疑似跌倒,但是使用者馬上用語音回答:
我沒事,只是在撿東西。
這時候系統就不應該單純依賴影像判斷。
因此之後 VoCare 會需要一個 多模態融合與分級決策機制,把不同來源的資訊整合之後再決定下一步。
在規劃長者照護功能時,我也認為有一件事情很重要:
安全相關的判斷不能完全交給生成式 AI 自己決定。
例如發生疑似跌倒、持續沒有回應這類情況,如果完全讓語言模型自由判斷要不要通知家屬,風險其實很高。
因此目前 VoCare 的想法是把決策拆成兩部分。
AI 比較適合負責:
但真正涉及安全的動作,例如警報升級、通知家屬,則保留一套固定規則。
簡單來說:
AI 可以協助判斷,但安全底線要由系統規則控制。
這也是我目前在設計 VoCare 時很重視的一個原則。
整理完這些情境之後,VoCare 的功能就比較不是「想到什麼做什麼」,而是可以從問題反推需求。
例如:
問題:使用者常常忘記行程
可以對應到:
問題:使用者容易工作太久忘記休息
可以對應到:
問題:長者可能發生跌倒
可以對應到:
問題:每個人的生活習慣不同
則可以對應到:
這樣整理之後,整個專案的方向就清楚很多。
今天主要重新整理了 VoCare 想解決的問題。
我目前認為 VoCare 最核心的目標並不是做出最多 AI 功能,而是:
讓 AI 能根據使用者的狀態,在適當的時候提供適當的協助。
因此除了 AI 對話之外,還會需要語音、影像、個人化資料、提醒機制以及安全規則互相配合。
同時我也慢慢發現,各個功能之間要如何合作將是一個重要的課題。