今天滑鼠掛了。
與其等新的,不如把這個系列一直沒碰的東西補起來——用說的操作 agent。
這是最容易混淆的地方。OpenClaw 的語音分成兩套,設定在不同地方,用途也不一樣。
本機語音:把你說的話轉成文字(聽寫),把它的回覆唸出來(朗讀)。跑在你自己電腦上,不出網路。
即時語音:真的跟它對話,你講完它馬上回話。走雲端供應商,要有金鑰。
前者是輸入法,後者是通話。
Companion → 語音與音訊。
我的設定長這樣:
聽寫 開啟
語言 自動偵測
停頓多久算講完 1.5 秒
朗讀 piper
音色 en_US-amy-low
「停頓多久算講完」那個值得調。 預設 1.5 秒,講話會停頓思考的人會一直被截斷。
WebUI → 設定 → 語音對話。
這頁有幾個東西:
觸發詞 — 最多 32 個,所有連到這個 Gateway 的裝置共用。設好之後講那個詞就能喚醒它。
供應商 — Google Live Voice、OpenAI Realtime Voice、xAI Grok Voice,或讓它自動挑第一個有有效憑證的。
音色 — 十種可選:alloy、ash、ballad、coral、echo、sage、shimmer、verse、marin、cedar。
看一下我上面的本機設定:
音色 en_US-amy-low
那是英文音色。
而我的 agent 回我中文。
結果就是它用英文的發音規則去唸中文,唸出來的東西沒辦法聽。我一開始還以為是朗讀壞了。
這不是 bug,是我沒設。 預設給的是英文音色,因為它不知道你會用什麼語言。
聽寫那邊設的是「自動偵測」所以沒事,但朗讀是固定的,要自己挑。
順便講一下今天怎麼活下來的。
WebUI 有命令面板,Ctrl+K 叫出來,打幾個字就能跳到任何一頁。設定、自動化、技能、裝置,全部不用滑鼠。
另外 Ctrl+B 收合側邊欄、Ctrl+Shift+, 直接開設定。
說實話,用了一天之後我發現鍵盤比滑鼠快。那個命令面板省掉的點擊比我想的多。
語音這塊我之前一直跳過,因為「用打的比較快」。
今天被迫試了一天,結論是:打字還是比較快,而且我除非沒鍵盤不然我還是乖乖用手打的
而真正讓我意外的是命令面板。滑鼠修好之後我大概也不會再用側邊欄點來點去了。