用 30 天挑戰做出一個 AI Companion,從語音辨識、語音合成與 Voice Cloning 開始,逐步加入長期記憶、RAG、AI Agent、個人化互動與 Real-Time Avatar,並以高齡陪伴作為主要應用情境。希望透過 30 天的實作,將這些功能一步步整合起來,完成一個能聽、能說、能記得使用者偏好與互動,也能自然與人交流的 AI Companion。
現在的 AI 已經很會聊天了 現在的 AI 已經不只是回答問題,也開始具備一定的記憶能力,可以保留使用者的偏好或過去提供過的資訊。 但我開始好奇另一件事: 如...
如果要做一個可以自然對話的 AI Companion,第一件事不是讓它回答,而是先讓它「聽懂」。 今天要完成的流程是: 使用者說話 ↓ 麥克風收到聲音...
昨天先完成了 Speech-to-Text,讓 AI 可以把我說的話轉成文字。 今天要做的事情剛好相反: Text ↓ TTS ↓ Audio ↓ Playba...
Day 03 完成 TTS 後,AI 已經可以把文字轉成語音。 但一般 TTS 使用的是模型原本提供的聲線。如果希望 AI Companion 不只是「會說話」...
前幾天都還只是單一模組 前幾天分別完成了 STT、TTS 和 Voice Cloning,但它們目前都還是各自運作。 所以今天的目標很單純: 把 STT、LL...
DAY 05 已經把 STT、LLM、TTS 串起來,AI Companion 終於可以完成完整語音對話。 但實際使用後會發現: 可以對話,不代表聊起來自然。...