iT邦幫忙

2026 iThome 鐵人賽

DAY 9
0
AI Engineering

VoCare:從 AI 陪伴到智慧長者照護的實作之路系列 第 9

Day 9|VoCare 的多模態感知設計

  • 分享至 

  • xImage
  •  

前幾天介紹的功能,大多是從使用者「說了什麼」開始處理。

但如果 VoCare 想做到主動陪伴,只知道文字或語音其實還不夠。有些時候,使用者可能根本不會主動告訴系統自己累了、坐太久了,甚至發生了跌倒。

因此 VoCare 另一個重要方向就是 多模態感知


什麼是多模態?

簡單來說,就是讓系統不要只依賴一種資訊。

目前 VoCare 主要會利用手機本身的 相機與麥克風,再搭配使用者資料,取得不同來源的資訊。

主要資訊來源

  • 語音:使用者說了什麼、是否有回應
  • 相機:姿勢、動作、疲勞或跌倒狀況
  • 使用者資料:平常習慣、提醒、行程與個人化資訊

把這些資訊放在一起,通常會比單獨依賴某一項結果更可靠。


一個簡單的例子:疑似跌倒

假設相機分析結果顯示:

疑似跌倒

系統詢問使用者
「你還好嗎?」

麥克風等待回應

如果使用者馬上回答:

我沒事,只是在撿東西。

那系統就可以降低警示。

但如果 影像持續顯示使用者倒在地面,而且 語音也一直沒有回應,就代表這個狀況可能需要進一步處理。

這就是 多模態資訊的價值。

不同資訊可能互相矛盾

實際使用時,不一定每個模組都會得到相同答案。

例如相機認為使用者可能疲勞,但使用者自己表示目前狀況正常。

這時候 VoCare 不能單純因為某個 AI 模型給出高分,就直接採取行動,而是需要把不同來源的結果放在一起判斷。

整體流程
影像資訊
語音資訊
使用者資料

多模態資訊整合

決策規則

提醒 / 確認 / 警示

也就是:

讓 AI 負責提供資訊,再由整體系統決定接下來該怎麼做。

為什麼先使用手機?

目前 VoCare 不打算一開始就加入大量額外感測器,而是先利用手機原本就有的:

相機
麥克風

這樣除了可以降低硬體複雜度,也比較方便先測試整套 AI 感知與判斷流程。

等核心功能穩定之後,再思考是否需要加入其他硬體。

Day 9 小結

多模態感知對 VoCare 來說,是從:

「聊天型 AI」

往:

「能觀察使用者狀態的 AI」

前進的重要一步。

重點並不是收集越多資料越好,而是:

把不同來源的資訊互相驗證,再做出比較合理的判斷。


上一篇
Day 8|一句話變成行程:VoCare 的智慧提醒設計
下一篇
Day 10|VoCare 的疲勞與久坐偵測設計
系列文
VoCare:從 AI 陪伴到智慧長者照護的實作之路10
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言