
前兩天面試了師爺的「能看、能寫」和「能畫、能唱、能拍」,
今天是最後一關:能說、能聽、能聊。
Day3 整理認知刺激的研究時,有一個實作的小期盼:
家人一起參與問答遊戲,
嘗試能不能實作 Google Cloud Speech-to-Text 的 Speaker Diarization。
Speaker Diarization 是「分辨說話者」:
不只把聲音轉成文字,還要分出哪一句是誰說的。
可惜目前 Cloud STT 的繁體中文(台灣)不支援這項功能;
今天換 Gemini 3.5 Transcribe 試試看,能不能完成這個期盼。
今天老爺想問師爺三件事:
師爺念題目,長輩聽得清楚嗎?能不能用家人的聲音念?
師爺聽得出「怕、踏、卡、啦」,也分得出是誰在說話嗎?
全家一起聊天時,師爺知道什麼時候該開口嗎?
今天就在 Google AI Studio,完成師爺的最後一關面試!
今天要面試的三類模型,都是最近才推出的(官方發布紀錄):
| 日期 | 推出 | 本事 |
|---|---|---|
| 2026-08-26 | Gemini 3.5 Transcribe | 能聽:把語音轉成文字 |
| 2026-09-15 | Gemini 3.8 Live | 能聊:即時語音對話 |
| 2026-09-22 | Gemini 3.8 Flash TTS、Flash-Lite TTS | 能說:把文字念出來 |
9 月 22 日同一天,還推出了 Voice design(用文字描述做出新聲音)、
Voice replication(複製真人的聲音),以及 150 種以上的聲音庫。
師爺的這些新本事,都是最近六週才學會的。
Day19 的才藝課要另外繳學費;
今天這三類,在官方價格頁的 Free Tier 欄位,都寫著 Free of charge:
| 本事 | 模型 | 免費層 | 付費層(2026 年底前) |
|---|---|---|---|
| 能說 | 3.8 Flash TTS | 有 | 每 10 秒語音約 0.00225 美元 |
| 能說 | 3.8 Flash-Lite TTS | 有 | 每 10 秒語音約 0.0015 美元 |
| 能聽 | 3.5 Transcribe | 有 | 每分鐘約 0.005 美元 |
| 能聊 | 3.8 Live | 有 | 每分鐘輸入約 0.005、輸出約 0.018 美元 |
TTS 的價格,2027 年 1 月 1 日起翻倍。
同一張價格表上,免費層的「Used to improve our products」寫的是 Yes:
送進免費層的內容,會用於改進 Google 的產品。
Day18 也提過,免費層的條款要求:不要送出敏感、機密或個人資訊。
額度方面,AI Studio 左側選單的「Rate Limit」頁,
會列出每個模型的上限。
我用一個沒有綁定付款方式的帳號(免費層),
跟付費的專案(Tier 1)對照:

| 模型 | 免費層 RPM/TPM/RPD | Tier 1 RPM/TPM/RPD |
|---|---|---|
| 3.8 Flash TTS | 3/10K/10 | 10/10K/100 |
| 3.8 Flash-Lite TTS | 3/10K/10 | 10/10K/100 |
| 3.5 Transcribe | 3/10K/25 | 10/10K/100 |
| 3.8 Live | 無上限/65K/無上限 | 無上限/150K/無上限 |
| 對照:Nano Banana 2 Lite | 0/0/0 | 150/100K/1K |
今天的三類模型,免費層的額度都不是 0,
跟 Day19 的 Nano Banana 2 Lite 不一樣:
看起來不只 AI Studio 能免費試,API 也有免費額度。
但額度比較少:
免費層的 TTS 每天 10 次,付費的 Tier 1 也只有 100 次。
Live 的請求次數沒有上限,限制的是每分鐘的 token。
不用開兩個帳號也能比較:
Rate Limit 頁右上角的「Compare tiers」,可以選 Tier 1~3,
每個數字旁邊會多一個「+」,顯示跟目前等級差多少。

實際用 API 呼叫、打到上限會怎樣,留到 API 篇實測。
免費層帳號在 AI Studio 的試用結果:
| 項目 | 結果 |
|---|---|
| TTS(文字轉語音) | 可以,按 Run 產生 8 秒的語音,也能下載 |
| Voice design(用文字描述做新聲音) | 不行,要連結付費金鑰 |
| Voice replication(複製真人的聲音) | 不行,要連結付費金鑰 |
| Transcribe(語音轉文字) | 可以,8 秒的語音算 270 個 token |
| Live(即時語音對話) | 可以,語音對話、打斷、開鏡頭、分享螢幕都能用 |
TTS(Text-to-Speech)是把文字念成語音。
官方說明的分工:
| 模型 | 官方建議用在 |
|---|---|
| 3.8 Flash TTS | 細膩的表演、難念的字、地方口音和方言、長篇朗讀 |
| 3.8 Flash-Lite TTS | 大量產生、朗讀功能、Voice replication、日常的單人語音 |
兩個模型的語言清單,都有「Chinese (Hant script)」(繁體中文),
但沒有台語。
TTS 和今天後面的 Live 都會說話,差別在:
TTS 是照稿念,一字不差;Live 是對話,邊聽邊回。
念題目、念口令,交給 TTS;要跟長輩一來一往地聊,交給 Live。
3.8 TTS 的新寫法,把「念什麼」和「怎麼念」分開:
這次拿 Day18 師爺出的題目來念。
長輩需要時間想,所以在題目和選項之間加停頓:
照片中這條項鍊的墜飾,
上面雕刻的是哪一種莊嚴的形象呢?<short pause>
是菩薩,<short pause> 還是動物?
① 在 Playground 右側的 Run settings,模型選 Gemini 3.8 Flash TTS
② 在文字框貼上題目,上方有三個設定:
- Speaker:選聲音,預設是 Fola。
- Style:選語氣。
- 〈 〉+ Expression:點了會出現 argh、breath、cheer 等標籤,
可以插進文字裡。
③ 按右下角的 Run,下方出現播放列,可以試聽、下載

每一段文字右上角的 ▶ 是「Preview this block」,只試聽那一段;
要產生可下載的音檔,要記得按 Run。
(我第一次用的時候,還以為只能線上聽,沒注意到 Run。XD)
④ 同一段題目,Flash 和 Flash-Lite 各念一次:
| 觀察 | 3.8 Flash TTS | 3.8 Flash-Lite TTS |
|---|---|---|
| 聽得出停頓嗎 | 聽得出停頓 | 聽得出停頓 |
| 第一次聽的感覺 | 比較自然 | 沒有 Flash 自然 |
四個實測音檔(聲音都是預設的 Fola),點連結會下載 wav 檔:

介面上還能按「Add speech block」加第二位說話者,
官方說明一次最多兩位。
Voice design 用一段文字描述,做出一個新的聲音,
存在專案裡,之後每次都能叫出同一個聲音。
官方建議描述裡寫不會變的特質:年齡、性別、音色、口音;
情緒留給語氣(style),一兩句就好。
TTS 有免費層,但在 AI Studio 用免費帳號,
Voice design 和 Voice replication 需要先連結付費API才能使用。
「Voice Design runs on the paid tier. Link a paid API key to continue.」

Voice replication 用一小段錄音,複製一個人的聲音。
像說書人的口技:聽過一次,就學得維妙維肖。
快問快答原本就能讓家人錄音念題(Day6);
如果能複製家人的聲音,
師爺新出的題目,也能用熟悉的聲音念給長輩聽。
官方規定要準備兩段錄音,而且是同一位成年人:
| 錄音 | 內容 |
|---|---|
| 參考音 | 10~30 秒,自然、清楚地說話 |
| 同意聲明 | 念出官方指定的一句話,表示同意 Google 用這個聲音做合成模型 |
兩段錄音,官方建議用同一支麥克風、在同一個環境錄:
它會比對兩段是不是同一個人,條件一致比較容易通過。
也就是說,
只能複製願意親自錄音、親口同意的人的聲音。如果用在 App 裡,也應該讓長輩知道:
這是用家人的聲音念的,不是家人本人。
① Create new voice → Voice Replication


② 「Add a voice sample」:錄一段參考音
畫面寫著:「Twenty seconds of natural speech works best. A story, not a monotone.」
也就是自然地說話 20 秒左右。
③ 「Verify it's you」:按 Record verification,念出畫面上的同意聲明
"I am the owner of this voice and I consent to Google
using this voice to create a synthetic voice model."

④ 取名字,按「Replicate voice」
Create voice 的選項卡寫著「Upload or record a sample」,
但實測時,兩段都只能在瀏覽器現場錄音,不能上傳音檔。
⑤ 驗證
第一次沒有照畫面上的英文念,按下 Replicate voice 就失敗了:

Consent flow failed.
The recorded phrase didn't match the text on screen.
Please read the prompt exactly as written.
同意聲明要一字不差,照畫面上的英文念。
重新錄一次英文聲明,就成功了:
畫面顯示「aaron is ready」,聲音已經存進聲音庫,
Speaker 的下拉選單也能直接選。

⑥ 用複製的聲音念念看
我用複製的聲音,念了 Day18 的題目和幾句問答。
自己聽起來,不太像我本人,主要是音色不像。
不過,後面「分辨說話者」的實測,會看到一個意外的結果。
複製的聲音存在專案裡,
最後一次使用後保存 1 年,每個專案最多 200 個(跟 Voice design 共用)。
Gemini 3.5 Transcribe 是專門把語音轉成文字的模型,
跟 Day12 的俠客 Cloud STT 做的是同一件事。
| 比較 | Cloud STT(Chirp 3) | Gemini 3.5 Transcribe |
|---|---|---|
| 提示可能出現的詞 | 語音調整 | 自訂詞彙,最多 1,000 個 |
| 分辨說話者 | 繁體中文(台灣)不支援 | 最多 8 人 |
| 繁體中文(台灣) | cmn-Hant-TW | 只有簡體 cmn-Hans-CN |
| 價格 | 每分鐘 0.016 美元(Day17) | 每分鐘約 0.005 美元 |
Cloud STT 的支援語言表,
cmn-Hant-TW 的 chirp、chirp_2、chirp_3,「Diarization」欄位都是空的。
Day3 想做的分辨說話者,Cloud STT 目前還未支援繁體中文台灣。
選 Gemini 3.5 Transcribe 之後,右側的 Run settings 有這些設定:

| 設定 | 預設 | 作用 |
|---|---|---|
| Primary language | Detect | 主要語言,預設自動偵測 |
| Word timestamps | 開 | 每個字的開始、結束時間 |
| Speaker labels | 開 | 分辨說話者 |
| Smart transcription | 關 | 整理成好讀的文字 |
| Custom vocabulary | 空白 | 自訂詞彙 |
官方說明,有些開關不能同時用:
實測打開 Smart 時,時間戳和說話者標籤會自動變成灰色、不能點。
所以下面分幾輪測,每一輪都開新的 Playground。
Day16的 Cloud STT,「怕」念八次只回五個字,
官方有回覆這是刻意設計的安全機制,
用來避免模型在靜音或模糊音訊時產生幻覺、陷入無限重複。我們今天試試 Transcribe 能不能完整輸出重複字 怕 × 8 !
Transcribe 有兩種模式:
| 模式 | 官方說明 |
|---|---|
| Verbatim(預設) | 逐字照錄,保留贅字、重複和說錯的地方 |
| Smart | 刪掉贅字和重複、直接套用說話者改口後的版本、整理格式 |
照字面看,健口操要數次數,應該用 Verbatim。
用Day16同一份錄音(我自己念的「怕」× 8),
Primary language 選 Chinese (Traditional),其他維持預設:
| 設定 | 轉出來的文字 | 幾個「怕」 |
|---|---|---|
| Verbatim(預設) | 怕。怕。怕。怕。怕。怕。怕。怕。 | 8 |
| Smart | 怕怕怕怕怕怕怕怕。 | 8 |


八個「怕」,一個都沒少。
時間戳的部分,介面只顯示整段的時間(00:01~00:11),
看不到每一個「怕」的時間點;
要用來算念的節奏,留到 API 篇看回傳的資料。
練繞口令時,會想知道自己哪裡念錯。
Day16 那份把「十是十」念成「十是四」的錄音:
四是四,十是四,十四是十四,四十是四十。
| 設定 | 轉出來的文字 |
|---|---|
| Verbatim(預設) | 44 144 1444 40 440 |
| Smart | 40是40。 |


兩種模式都沒有留下「十是四」。
正確念的版本這次沒有測;
念錯時,Transcribe 跟 Day16 的 Cloud STT 一樣,
看起來還沒辦法用來找出繞口令念錯的地方。
終於來到 Day3 的願望。
只有我一個人能錄音,
所以用我自己的錄音,跟 TTS 的聲音輪流說話,接成一段對話:
| # | 誰 | 台詞 |
|---|---|---|
| 1 | 我 | 今天的第一題,請大家看這張照片。 |
| 2 | 另一個聲音 | 這是什麼東西呢?是電鍋,還是收音機? |
| 3 | 我 | 答對了,是電鍋! |
| 4 | 另一個聲音 | 以前家裡的電鍋,都拿來煮什麼呢? |
| 5 | 我 | 我記得阿嬤都用它來蒸饅頭。 |
| 6 | 另一個聲音 | 那我們下一題,來看看另一張照片。 |
「另一個聲音」換兩種,各做一段:
| 錄音 | 另一個聲音 | 想知道 |
|---|---|---|
| 真假的我 | 複製我的聲音(Voice replication) | 分不分得出真的我和複製的我 |
| 對照組 1 | 預設聲音 Fola,音高跟我差很多 | 明顯不同的聲音,分不分得出來 |
| 對照組 2 | 預設聲音 Bodi,跟我同樣是男聲 | 比較接近的聲音,分不分得出來 |
上傳到 Transcribe,時間戳和說話者標籤都開著:



| 觀察 | 真假的我 | 對照組 1(Fola) | 對照組 2(Bodi) |
|---|---|---|---|
| 分成幾個人 | 1 個 | 2 個 | 2 個 |
| 每一句歸給誰 | 6 句全部算同一人 | 6 句全對 | 6 句全對 |
| 文字內容 | 全對,簡體 | 全對,簡體 | 全對,簡體 |
實測影片:
https://youtu.be/gXP_aMcXExY
分辨說話者有作用,但分不出真的我和複製的我。
同樣是男聲的 Bodi,6 句都分對了;
複製的聲音,卻 6 句都跟我算成同一個人。看起來,複製的聲音雖然我自己聽起來不太像,
在模型「聽」起來,跟我是同一個人。
Live API 是即時的語音對話:
不用等錄完再送,師爺邊聽邊想、邊回答。
官方說明裡,跟長輩聊天最相關的三件事:
| 功能 | 官方說明 | 跟長輩聊天的關係 |
|---|---|---|
| 插話 | 使用者隨時可以打斷模型 |
長輩想到什麼,可以直接說 |
| 判斷說完了沒 | 預設安靜約 0.8 秒,就當作說完 |
長輩說話慢、會停下來想,可能被搶話 |
| Proactive audio | 內容不相關時,模型可以決定不回應 |
家人彼此聊天時,師爺不插嘴 |
Proactive audio 在 3.8 Live 是固定開啟的。
全家聊天時,師爺懂得察言觀色,該聽的時候就聽。
這正是 Day18 說的:師爺不是取代家人,而是幫全家搭橋。
在 AI Studio 使用 Live API:
① Playground 右側點模型名稱,打開 Model selection
② 上方分類選「Live」,點 Gemini 3.8 Live

③ 畫面出現「Try the Live API」,可以選 Talk(說話)、Webcam(開鏡頭)、Share Screen(分享螢幕)

開始的畫面有三種方式:
Talk(說話)、Webcam(開鏡頭)、Share Screen(分享螢幕)。
對話時,畫面會同步顯示雙方說的話:
| 誰說的 | 顯示的文字 |
|---|---|
| 我說的話 | 簡體中文 |
| 師爺說的話 | 一開始是簡體;請它改用繁體之後,大部分變成繁體 |

Day18 寫給師爺的工作守則(系統指令,System instructions),
這次繼續沿用,再加上這次聊天需要的四條:
| 新加的守則 | 出處 |
|---|---|
| 開場先說今天的日期 | Day3 的現實定向感治療 |
| 問經驗和感受,不考記憶的對錯 | 借用認知刺激的帶領原則:提問時鼓勵分享想法,而不是考事實 |
| 先問二選一,再接開放式的問題;邀請長輩反問家人 | 讓全家多聊、互相提問 |
| 大家彼此聊天時,安靜聽;有人叫「師爺」再回答 | Proactive audio |
官方建議系統指令照「角色 → 對話規則 → 不能做的事」排列;
你是「健口動一動」App 的師爺,陪長輩和家人一起聊天。
請用繁體中文(台灣)的用詞回答。
開場:
- 先跟大家打招呼,說今天是幾月幾號、星期幾。
說話原則:
- 句子簡短,一次只說一件事。
- 用正面的說法,不說「不要」「錯了」。
- 長輩答錯時不糾正,換個方式給提示。
- 每題只給兩個選項。
- 問經驗和感受,不考記憶的對錯。
- 先問一題二選一,答完再接一個開放式的問題,
用「什麼時候、在哪裡、跟誰、怎麼」開頭,
不問「有沒有」「是不是」。
- 每題結束後,邀請長輩反問家人一個問題。
- 大家彼此聊天時,安靜聽就好;
有人叫「師爺」再回答。
- 不提供醫療建議。
今天的話題:一張老照片,照片裡是一台紅色的大同電鍋。
家裡只有我一個人能測,
所以用「假裝跟家人說話」的方式,看師爺的反應:
| 編號 | 我怎麼做 | 看什麼 | 結果 |
|---|---|---|---|
| L1 | 說「你好」 | 打招呼、日期對不對 | 正確 |
| L2 | 回答時停 3 秒:「紅色……我小時候,家裡就有一台。」 | 會不會搶話 | 會,停下來想一下就被接話 |
| L3 | 師爺說到一半,直接打斷 | 停不停得下來 | 立刻停下來 |
| L4 | 轉頭對家人說:「媽,你看這個電鍋,跟我們家那台好像喔。」 | 會不會插嘴 | 沒有插嘴 |
| L5 | 「師爺,換下一題。」 | 有沒有接話 | 有,換了下一題 |
| L6 | 讓師爺出一題 | 有沒有接開放式問題、邀請反問 | 都有 |
| L7 | 用台語問「你食飽未?」 | 聽不聽得懂、會不會說 | 會用台語回答,但念得不太像 |
| L8 | 「好,今天就聊到這裡,謝謝師爺。」 | 收尾自然嗎 | 自然 |
實測影片:
https://youtu.be/EwZacF206Y4
師爺會等、會聽,也知道家人說話時不插嘴;只是長輩停下、還在思考的時候,師爺沒有等待就先接下一段話
對「一起大冒險」來說,師爺當主持人看起來可行,
但長輩說話慢、會停下來想,「多久算說完」要調長一點;
API 可以調整VAD,留到 API 篇。
台語的部分:
官方語言清單都沒有台語,Live 會試著用台語回答,但聽起來不太像。
Live API 跟 Day17 的驛站一樣,用 WebSocket 連線;
不過官方建議,App 可以直接連到 Gemini,
用 ephemeral token(臨時權杖)取代 API 金鑰。
聘書(API 金鑰)不能交給 App,只能由鏢局發一張限時的臨時聘書。
| 要注意的事 | 官方說明 |
|---|---|
| 臨時權杖 | 預設 1 分鐘內要開始連線,30 分鐘後失效 |
| 對話長度 | 預設只有語音最長 15 分鐘,加上影像只有 2 分鐘;每條連線約 10 分鐘 |
| 費用 | 每一輪都會把前面的對話一起計算 |
這些要等到真的寫進 App,才測得出來,留到 API 篇。
AI Studio 的 Spend 頁,可以設定專案每月的花費上限(實驗功能)。
今天實測前,我把上限設在 NT$300。
設好之後,按鈕變成「Edit spend cap」,金額旁邊多了上限:

這張也是今天實測的起點:NT$87.88,是 Day19 的花費。
這次實測,AI Studio 的 Spend 頁:

| 時間點 | Spend | 增加 |
|---|---|---|
| 開始前 | NT$87.88 | |
| TTS、Voice replication、Transcribe 做完後 | NT$90.15 | NT$2.27 |
| Live 做完後 | NT$94.51 | NT$4.36 |
Live 剛做完時,Spend 還是 NT$90.15,過了一段時間後更新成 NT$94.51。
官方說明,AI Studio 的帳單資料最多會延遲約 10 分鐘;
Live 之後增加的 NT$4.36,可能也包含前面幾項較晚入帳的費用,
各模型實際花了多少,要看帳單報表的明細。
今天全部加起來 NT$6.63,約 0.21 美元。
Rate Limit 頁也看得到今天用了多少:
3.8 Flash TTS 用了 18 次(Tier 1 每天 100 次),
3.8 Live 每分鐘最多用了 1.45K token(上限 150K)。
Live 的計費方式跟其他模型不一樣:
官方說明,每一輪都會把前面累積的對話一起計算,
而且 Proactive audio 開著時,師爺在聽的整段時間都算輸入。
三天的面試,師爺展現了這些本事:
| 篇 | 本事 | 這次用的模型 | API 免費層 |
|---|---|---|---|
| 上 | 能看、能寫 | Gemini 3.5 Flash-Lite、3.8 Flash | 有 |
| 中 | 能畫、能唱、能拍 | Nano Banana 2、Lyria 3.5、Veo 3.1 | 沒有 |
| 下 | 能說、能聽、能聊 | 3.8 Flash TTS、3.5 Transcribe、3.8 Live | 有 |
今天的重點:
能說(TTS):
文字照念,停頓用英文標籤 short pause 指定;
複製聲音只能現場錄音,同意聲明要照英文一字不差地念。
能聽(Transcribe):
「怕」念八次留下八個,不再停在五個;繞口令念錯的地方還留不住。
分辨說話者:
Day3 的願望做到了一半:分得出不同的人,
但分不出真的我和複製的我XD
能聊(Live):
家人彼此聊天時不插嘴;
長輩停下來想時會被搶話,要再調整。
師爺會說、會聽、會聊,最好的時候,是讓全家一起開口。
師爺的面試到這裡告一段落。
接下來是正式聘用:用 Gemini API,把「一起大冒險」和「一起畫畫」功能實作到健口動一動。
API 呼叫能不能走免費層、打到每分鐘和每日上限會怎樣,
也會在 API 篇一起實測。
明天開始:Gemini API 正式聘用!
感謝有緣看到這邊的你~
希望佛菩薩也祝福你:🌟開心順遂 健康平安🌟
南無觀世音菩薩🍀 南無地藏菩薩🏠 南無阿彌陀佛☀️