用 30 天挑戰打造一個 AI Companion,從語音辨識、語音合成與 Voice Cloning 開始,逐步加入長期記憶、RAG、AI Agent、個人化互動與 Real-Time Avatar,並實際整合成可持續互動的 AI 系統。
本系列以高齡陪伴與智慧健康照護作為主要應用情境,讓 AI 不只會聽、會說,也能從日常對話中記住使用者的生活與健康狀態,結合衛教知識與個人化互動策略,提供更自然且具有延續性的陪伴體驗。
現在的 AI 已經很會聊天了 現在的 AI 已經不只是回答問題,也開始具備記憶能力,可以保留使用者的偏好與過去提供過的資訊。 但我開始好奇: 如果 AI 不只...
如果要做一個能自然互動的「高齡智慧健康照護 AI Companion」,第一步就是先讓它能夠「聽懂」使用者在說什麼。 對高齡使用者來說,比起打字,直接透過語音描...
昨天先完成了 Speech-to-Text,讓 AI 可以把使用者說的話轉成文字。 今天要做的事情剛好相反: Text ↓ TTS ↓ Audio ↓ Play...
前一天完成了 TTS,讓 AI 可以把文字轉成語音。 但目前使用的還是模型內建的固定聲線。 今天想進一步測試: 如果只提供一小段真人錄音,AI 能不能用相似的...
前幾天分別完成了 STT、TTS 和 Voice Cloning,但目前都還是各自獨立運作。 所以今天的目標很單純: 把 STT、LLM、TTS 串起來,完成...
Day 05 已經把 STT、LLM 和 TTS 串成第一版完整語音對話。 目前流程是: Microphone ↓ VAD ↓ Final STT ↓ LLM...
前幾天已經把 STT、LLM 和 TTS 串起來,AI Companion 終於可以完成一輪完整語音對話。 目前流程是: Microphone ↓ VAD ↓...
Day 07 開始把整條語音 Pipeline 往 Streaming 架構調整後,AI 已經可以更早開始回答。 但實際對話時還有一個問題: 只要 AI 開始說...
前幾天完成語音對話、Streaming 和 Barge-in 之後,AI Companion 已經可以比較自然地和使用者對話。 但目前還有一個問題: 每次重新開...
Day 09 完成了第一版 Memory,讓 AI 可以從對話中抽取值得記住的資訊,並存進資料庫。 例如: 使用者: 「我平常晚上喜歡出去散步。」...