
在 Day 20 的文章中,我第一次實際使用自己規劃的 App,也發現一個明顯的落差:人聲引導還是得做進 App,練習呼吸的體驗才會完整。今天我嘗試用 ElevenLabs 的文字轉語音(Text-to-Speech)製作人聲引導音檔,本文會先介紹 ElevenLabs,再分享製作過程。
ElevenLabs 是一家成立於 2022 年的人工智慧研究與產品公司,由前 Google 機器學習工程師 Piotr Dąbkowski 與前 Palantir 策略師 Mati Staniszewski 共同創辦。兩人最初希望改善電影配音品質,進而投入語音生成技術,致力讓內容跨越語言與聲音的限制。其核心技術能將文字轉換為自然、富有情緒的語音,並提供聲音複製、聲音設計、多語配音及音效生成等工具,協助創作者與企業製作音訊內容。旗下的 ElevenCreative 則支援語音、音樂、圖像與影片的生成及編輯,服務創作者與行銷團隊。
之前有和 AI 討論人聲製作的選擇,一開始嘗試了 iOS 內建的 TTS,聽起來過於清晰、缺乏情感,比較適合朗讀文章或報導等情境,用在需要放鬆的呼吸練習上並不合適。ElevenLabs 則能透過標籤控制語氣與情緒,做出更接近真人、自然帶有情緒的引導聲音。
本文以 4-7-8 呼吸法為例。這段文案會在練習開始前播放,先讓使用者把當下的狀態安頓下來,再用三輪引導熟悉節奏,之後就進入只有背景音樂的練習階段。這樣安排是為了避免人聲主導性太強,佔據整段練習。
歡迎來到這段呼吸練習,找一個舒服的姿勢,坐著或躺著都可以。
如果願意,輕輕閉上眼睛。自然呼吸,放鬆你的肩膀,讓身體慢慢沉下來。準備好了,我們開始。
吸氣四秒,1 — 2 — 3 — 4。
屏氣七秒,1 — 2 — 3 — 4 — 5 — 6 — 7。
吐氣八秒,1 — 2 — 3 — 4 — 5 — 6 — 7 — 8。
吸氣四秒,1 — 2 — 3 — 4。
屏氣七秒,1 — 2 — 3 — 4 — 5 — 6 — 7。
吐氣八秒,1 — 2 — 3 — 4 — 5 — 6 — 7 — 8。
吸氣四秒,1 — 2 — 3 — 4。
屏氣七秒,1 — 2 — 3 — 4 — 5 — 6 — 7。
吐氣八秒,1 — 2 — 3 — 4 — 5 — 6 — 7 — 8。
如果要生成繁體中文語音,ElevenLabs 免費版目前只有三種聲音可選,我從中挑了語調最接近我想要的一種。

ElevenLabs 官方文件有一篇最佳實踐,說明如何控制語調、情緒等元素,讓 AI 生成的語音更自然、更有情感。我主要用的是 Audio Tag(音訊標籤),讓人聲引導聽起來緩慢且柔和。
做法是在文案中插入標籤,例如標註某句要更柔和、更緩慢,或在句子之間加入停頓,生成的語音就會照著標籤調整語氣。

除此之外,還有許多標籤可以嘗試:


詳細內容可以參考官方文件中的 Audio Tag 介紹
ElevenLabs 每次生成都會給兩個版本,建議兩個都聽,也多生成幾次比較。即使套用了 Audio Tag,有時還是會遇到前面語氣都很一致,中間卻莫名地音調飆高、情緒突然變得很 high,或音量突然變大。

這類問題看來蠻常見,回報結果時已經有預設的對應選項可以勾選。

我大概生成了 4 輪,才找到一個語氣穩定、情緒符合標籤設定、中途沒有突然變調的版本。
輸出的音檔是 MP3 格式。接著我把需求和音檔交給 Claude Code 實作,再實際在手機上體驗看看。
加入人聲引導後,體驗落差明顯改善了。開頭的引導語,像是找個舒服的位置、調整姿勢、放鬆肩膀,能讓我慢慢進入狀態,而不是一開始就直接練習,感到不知所措。