iT邦幫忙

2026 iThome 鐵人賽

DAY 20
0

一、前言

前兩天面試了師爺的「能看、能寫」和「能畫、能唱、能拍」,
今天是最後一關:能說、能聽、能聊。

Day3 整理認知刺激的研究時,有一個實作的小期盼:

家人一起參與問答遊戲,
嘗試能不能實作 Google Cloud Speech-to-Text 的 Speaker Diarization。

Speaker Diarization 是「分辨說話者」:
不只把聲音轉成文字,還要分出哪一句是誰說的。

可惜目前 Cloud STT 的繁體中文(台灣)不支援這項功能;
今天換 Gemini 3.5 Transcribe 試試看,能不能完成這個期盼。

今天老爺想問師爺三件事:

  • 師爺念題目,長輩聽得清楚嗎?能不能用家人的聲音念?
  • 師爺聽得出「怕、踏、卡、啦」,也分得出是誰在說話嗎?
  • 全家一起聊天時,師爺知道什麼時候該開口嗎?

今天就在 Google AI Studio,完成師爺的最後一關面試!


二、新幫手與免費層

(一)最近六週才推出

今天要面試的三類模型,都是最近才推出的(官方發布紀錄):

日期 推出 本事
2026-08-26 Gemini 3.5 Transcribe 能聽:把語音轉成文字
2026-09-15 Gemini 3.8 Live 能聊:即時語音對話
2026-09-22 Gemini 3.8 Flash TTS、Flash-Lite TTS 能說:把文字念出來

9 月 22 日同一天,還推出了 Voice design(用文字描述做出新聲音)、
Voice replication(複製真人的聲音),以及 150 種以上的聲音庫。

師爺的這些新本事,都是最近六週才學會的。

(二)三類都有免費層

Day19 的才藝課要另外繳學費;
今天這三類,在官方價格頁的 Free Tier 欄位,都寫著 Free of charge:

本事 模型 免費層 付費層(2026 年底前)
能說 3.8 Flash TTS 有 每 10 秒語音約 0.00225 美元
能說 3.8 Flash-Lite TTS 有 每 10 秒語音約 0.0015 美元
能聽 3.5 Transcribe 有 每分鐘約 0.005 美元
能聊 3.8 Live 有 每分鐘輸入約 0.005、輸出約 0.018 美元

TTS 的價格,2027 年 1 月 1 日起翻倍。

同一張價格表上,免費層的「Used to improve our products」寫的是 Yes:
送進免費層的內容,會用於改進 Google 的產品。
Day18 也提過,免費層的條款要求:不要送出敏感、機密或個人資訊。

額度方面,AI Studio 左側選單的「Rate Limit」頁,
會列出每個模型的上限。

我用一個沒有綁定付款方式的帳號(免費層),
跟付費的專案(Tier 1)對照:

模型 免費層 RPM/TPM/RPD Tier 1 RPM/TPM/RPD
3.8 Flash TTS 3/10K/10 10/10K/100
3.8 Flash-Lite TTS 3/10K/10 10/10K/100
3.5 Transcribe 3/10K/25 10/10K/100
3.8 Live 無上限/65K/無上限 無上限/150K/無上限
對照:Nano Banana 2 Lite 0/0/0 150/100K/1K
  • RPM:每分鐘最多幾次請求。
  • TPM:每分鐘最多多少輸入 token。
  • RPD:每天最多幾次請求,太平洋時間午夜重置。

今天的三類模型,免費層的額度都不是 0,
跟 Day19 的 Nano Banana 2 Lite 不一樣:
看起來不只 AI Studio 能免費試,API 也有免費額度。

但額度比較少:
免費層的 TTS 每天 10 次,付費的 Tier 1 也只有 100 次。
Live 的請求次數沒有上限,限制的是每分鐘的 token。

不用開兩個帳號也能比較:
Rate Limit 頁右上角的「Compare tiers」,可以選 Tier 1~3,
每個數字旁邊會多一個「+」,顯示跟目前等級差多少。

實際用 API 呼叫、打到上限會怎樣,留到 API 篇實測。

免費層帳號在 AI Studio 的試用結果:

項目 結果
TTS(文字轉語音) 可以,按 Run 產生 8 秒的語音,也能下載
Voice design(用文字描述做新聲音) 不行,要連結付費金鑰
Voice replication(複製真人的聲音) 不行,要連結付費金鑰
Transcribe(語音轉文字) 可以,8 秒的語音算 270 個 token
Live(即時語音對話) 可以,語音對話、打斷、開鏡頭、分享螢幕都能用

三、能說:TTS

(一)兩個 TTS 模型

TTS(Text-to-Speech)是把文字念成語音。

官方說明的分工:

模型 官方建議用在
3.8 Flash TTS 細膩的表演、難念的字、地方口音和方言、長篇朗讀
3.8 Flash-Lite TTS 大量產生、朗讀功能、Voice replication、日常的單人語音

兩個模型的語言清單,都有「Chinese (Hant script)」(繁體中文),
但沒有台語。

TTS 和今天後面的 Live 都會說話,差別在:
TTS 是照稿念,一字不差;Live 是對話,邊聽邊回。
念題目、念口令,交給 TTS;要跟長輩一來一往地聊,交給 Live。

(二)念題:語氣與停頓

3.8 TTS 的新寫法,把「念什麼」和「怎麼念」分開:

  • 文字:一律照念,不能夾帶「請溫柔地念」這類指示,不然會被念出來。
  • 語氣(style):整段話的情緒、速度,例如 speaking slowly。
  • 行內標籤:某個位置的停頓或聲音,例如〈short pause〉、〈long pause〉。

文字是中文時,官方建議 行內標籤還是用英文。
官方也建議 先不加語氣 念一次,真的需要再加短短的語氣。

這次拿 Day18 師爺出的題目來念。
長輩需要時間想,所以在題目和選項之間加停頓:

照片中這條項鍊的墜飾,
上面雕刻的是哪一種莊嚴的形象呢?<short pause>
是菩薩,<short pause> 還是動物?

① 在 Playground 右側的 Run settings,模型選 Gemini 3.8 Flash TTS

② 在文字框貼上題目,上方有三個設定:

  • Speaker:選聲音,預設是 Fola。
  • Style:選語氣。
  • 〈 〉+ Expression:點了會出現 argh、breath、cheer 等標籤,
    可以插進文字裡。

③ 按右下角的 Run,下方出現播放列,可以試聽、下載

每一段文字右上角的 ▶ 是「Preview this block」,只試聽那一段;
要產生可下載的音檔,要記得按 Run。
(我第一次用的時候,還以為只能線上聽,沒注意到 Run。XD)

④ 同一段題目,Flash 和 Flash-Lite 各念一次:

觀察 3.8 Flash TTS 3.8 Flash-Lite TTS
聽得出停頓嗎 聽得出停頓 聽得出停頓
第一次聽的感覺 比較自然 沒有 Flash 自然

四個實測音檔(聲音都是預設的 Fola),點連結會下載 wav 檔:

介面上還能按「Add speech block」加第二位說話者,
官方說明一次最多兩位。

(三)Voice design:用文字描述做聲音

Voice design 用一段文字描述,做出一個新的聲音,
存在專案裡,之後每次都能叫出同一個聲音。

官方建議描述裡寫不會變的特質:年齡、性別、音色、口音;
情緒留給語氣(style),一兩句就好。

TTS 有免費層,但在 AI Studio 用免費帳號,
Voice design 和 Voice replication 需要先連結付費API才能使用。
「Voice Design runs on the paid tier. Link a paid API key to continue.」

(四)Voice replication

Voice replication 用一小段錄音,複製一個人的聲音。

像說書人的口技:聽過一次,就學得維妙維肖。

快問快答原本就能讓家人錄音念題(Day6);
如果能複製家人的聲音,
師爺新出的題目,也能用熟悉的聲音念給長輩聽。

官方規定要準備兩段錄音,而且是同一位成年人:

錄音 內容
參考音 10~30 秒,自然、清楚地說話
同意聲明 念出官方指定的一句話,表示同意 Google 用這個聲音做合成模型

兩段錄音,官方建議用同一支麥克風、在同一個環境錄:
它會比對兩段是不是同一個人,條件一致比較容易通過。

也就是說,只能複製願意親自錄音、親口同意的人的聲音。

如果用在 App 裡,也應該讓長輩知道:
這是用家人的聲音念的,不是家人本人。

① Create new voice → Voice Replication

② 「Add a voice sample」:錄一段參考音

畫面寫著:「Twenty seconds of natural speech works best. A story, not a monotone.」
也就是自然地說話 20 秒左右。

③ 「Verify it's you」:按 Record verification,念出畫面上的同意聲明

"I am the owner of this voice and I consent to Google
using this voice to create a synthetic voice model."

④ 取名字,按「Replicate voice」

Create voice 的選項卡寫著「Upload or record a sample」,
但實測時,兩段都只能在瀏覽器現場錄音,不能上傳音檔。

⑤ 驗證

第一次沒有照畫面上的英文念,按下 Replicate voice 就失敗了:

Consent flow failed.
The recorded phrase didn't match the text on screen.
Please read the prompt exactly as written.

同意聲明要一字不差,照畫面上的英文念。

重新錄一次英文聲明,就成功了:
畫面顯示「aaron is ready」,聲音已經存進聲音庫,
Speaker 的下拉選單也能直接選。

⑥ 用複製的聲音念念看

我用複製的聲音,念了 Day18 的題目和幾句問答。
自己聽起來,不太像我本人,主要是音色不像。

不過,後面「分辨說話者」的實測,會看到一個意外的結果。

複製的聲音存在專案裡,
最後一次使用後保存 1 年,每個專案最多 200 個(跟 Voice design 共用)。


四、能聽:Transcribe

(一)跟俠客 Cloud STT 比一比

Gemini 3.5 Transcribe 是專門把語音轉成文字的模型,
跟 Day12 的俠客 Cloud STT 做的是同一件事。

比較 Cloud STT(Chirp 3) Gemini 3.5 Transcribe
提示可能出現的詞 語音調整 自訂詞彙,最多 1,000 個
分辨說話者 繁體中文(台灣)不支援 最多 8 人
繁體中文(台灣) cmn-Hant-TW 只有簡體 cmn-Hans-CN
價格 每分鐘 0.016 美元(Day17) 每分鐘約 0.005 美元

Cloud STT 的支援語言表,
cmn-Hant-TW 的 chirp、chirp_2、chirp_3,「Diarization」欄位都是空的。
Day3 想做的分辨說話者,Cloud STT 目前還未支援繁體中文台灣。

(二)設定:四個開關

選 Gemini 3.5 Transcribe 之後,右側的 Run settings 有這些設定:

設定 預設 作用
Primary language Detect 主要語言,預設自動偵測
Word timestamps 開 每個字的開始、結束時間
Speaker labels 開 分辨說話者
Smart transcription 關 整理成好讀的文字
Custom vocabulary 空白 自訂詞彙

官方說明,有些開關不能同時用:

  • 自訂詞彙:不能和時間戳、說話者標籤一起用。
  • Smart:也不能和時間戳、說話者標籤一起用。

實測打開 Smart 時,時間戳和說話者標籤會自動變成灰色、不能點。

所以下面分幾輪測,每一輪都開新的 Playground。

(三)怕 × 8:重複的字留得住嗎

Day16的 Cloud STT,「怕」念八次只回五個字,
官方有回覆這是刻意設計的安全機制,
用來避免模型在靜音或模糊音訊時產生幻覺、陷入無限重複。

我們今天試試 Transcribe 能不能完整輸出重複字 怕 × 8 !

Transcribe 有兩種模式:

模式 官方說明
Verbatim(預設) 逐字照錄,保留贅字、重複和說錯的地方
Smart 刪掉贅字和重複、直接套用說話者改口後的版本、整理格式

照字面看,健口操要數次數,應該用 Verbatim。

用Day16同一份錄音(我自己念的「怕」× 8),
Primary language 選 Chinese (Traditional),其他維持預設:

設定 轉出來的文字 幾個「怕」
Verbatim(預設) 怕。怕。怕。怕。怕。怕。怕。怕。 8
Smart 怕怕怕怕怕怕怕怕。 8

八個「怕」,一個都沒少。

  • Verbatim:每個「怕」後面都加了句號,看起來把每一聲當成一句。
  • Smart:官方說明會整理結巴、贅字這類說話時的不流暢;
    這份錄音是一聲一聲清楚念的,沒有結巴或贅字,八個「怕」都完整保留。
  • 字:兩種模式都是「怕」,沒有變成同音的「帕」。

時間戳的部分,介面只顯示整段的時間(00:01~00:11),
看不到每一個「怕」的時間點;
要用來算念的節奏,留到 API 篇看回傳的資料。

(四)十是四:念錯的地方留得住嗎

練繞口令時,會想知道自己哪裡念錯。

Day16 那份把「十是十」念成「十是四」的錄音:

四是四,十是四,十四是十四,四十是四十。

設定 轉出來的文字
Verbatim(預設) 44 144 1444 40 440
Smart 40是40。

兩種模式都沒有留下「十是四」。

  • Verbatim:整句變成一串阿拉伯數字,「是」字都不見了。
  • Smart:只留下最後一小段「40是40」,前面三段都沒了。

正確念的版本這次沒有測;
念錯時,Transcribe 跟 Day16 的 Cloud STT 一樣,
看起來還沒辦法用來找出繞口令念錯的地方。

(五)分辨說話者:誰說了什麼

終於來到 Day3 的願望。

只有我一個人能錄音,
所以用我自己的錄音,跟 TTS 的聲音輪流說話,接成一段對話:

# 誰 台詞
1 我 今天的第一題,請大家看這張照片。
2 另一個聲音 這是什麼東西呢?是電鍋,還是收音機?
3 我 答對了,是電鍋!
4 另一個聲音 以前家裡的電鍋,都拿來煮什麼呢?
5 我 我記得阿嬤都用它來蒸饅頭。
6 另一個聲音 那我們下一題,來看看另一張照片。

「另一個聲音」換兩種,各做一段:

錄音 另一個聲音 想知道
真假的我 複製我的聲音(Voice replication) 分不分得出真的我和複製的我
對照組 1 預設聲音 Fola,音高跟我差很多 明顯不同的聲音,分不分得出來
對照組 2 預設聲音 Bodi,跟我同樣是男聲 比較接近的聲音,分不分得出來

上傳到 Transcribe,時間戳和說話者標籤都開著:

觀察 真假的我 對照組 1(Fola) 對照組 2(Bodi)
分成幾個人 1 個 2 個 2 個
每一句歸給誰 6 句全部算同一人 6 句全對 6 句全對
文字內容 全對,簡體 全對,簡體 全對,簡體

實測影片:
https://youtu.be/gXP_aMcXExY

Gemini 3.5 Transcribe 分辨說話者實測影片

分辨說話者有作用,但分不出真的我和複製的我。

同樣是男聲的 Bodi,6 句都分對了;
複製的聲音,卻 6 句都跟我算成同一個人。

看起來,複製的聲音雖然我自己聽起來不太像,
在模型「聽」起來,跟我是同一個人。


五、能聊:Live API

(一)邊聽邊回的師爺

Live API 是即時的語音對話:
不用等錄完再送,師爺邊聽邊想、邊回答。

官方說明裡,跟長輩聊天最相關的三件事:

功能 官方說明 跟長輩聊天的關係
插話 使用者隨時可以打斷模型 長輩想到什麼,可以直接說
判斷說完了沒 預設安靜約 0.8 秒,就當作說完 長輩說話慢、會停下來想,可能被搶話
Proactive audio 內容不相關時,模型可以決定不回應 家人彼此聊天時,師爺不插嘴

Proactive audio 在 3.8 Live 是固定開啟的。

全家聊天時,師爺懂得察言觀色,該聽的時候就聽。
這正是 Day18 說的:師爺不是取代家人,而是幫全家搭橋。

在 AI Studio 使用 Live API:

① Playground 右側點模型名稱,打開 Model selection

② 上方分類選「Live」,點 Gemini 3.8 Live

③ 畫面出現「Try the Live API」,可以選 Talk(說話)、Webcam(開鏡頭)、Share Screen(分享螢幕)

開始的畫面有三種方式:
Talk(說話)、Webcam(開鏡頭)、Share Screen(分享螢幕)。

對話時,畫面會同步顯示雙方說的話:

誰說的 顯示的文字
我說的話 簡體中文
師爺說的話 一開始是簡體;請它改用繁體之後,大部分變成繁體

(二)系統指令:師爺的聊天守則

Day18 寫給師爺的工作守則(系統指令,System instructions),
這次繼續沿用,再加上這次聊天需要的四條:

新加的守則 出處
開場先說今天的日期 Day3 的現實定向感治療
問經驗和感受,不考記憶的對錯 借用認知刺激的帶領原則:提問時鼓勵分享想法,而不是考事實
先問二選一,再接開放式的問題;邀請長輩反問家人 讓全家多聊、互相提問
大家彼此聊天時,安靜聽;有人叫「師爺」再回答 Proactive audio

官方建議系統指令照「角色 → 對話規則 → 不能做的事」排列;

你是「健口動一動」App 的師爺,陪長輩和家人一起聊天。
請用繁體中文(台灣)的用詞回答。

開場:
- 先跟大家打招呼,說今天是幾月幾號、星期幾。

說話原則:
- 句子簡短,一次只說一件事。
- 用正面的說法,不說「不要」「錯了」。
- 長輩答錯時不糾正,換個方式給提示。
- 每題只給兩個選項。
- 問經驗和感受,不考記憶的對錯。
- 先問一題二選一,答完再接一個開放式的問題,
  用「什麼時候、在哪裡、跟誰、怎麼」開頭,
  不問「有沒有」「是不是」。
- 每題結束後,邀請長輩反問家人一個問題。
- 大家彼此聊天時,安靜聽就好;
  有人叫「師爺」再回答。
- 不提供醫療建議。

今天的話題:一張老照片,照片裡是一台紅色的大同電鍋。

(三)一個人的實測

家裡只有我一個人能測,
所以用「假裝跟家人說話」的方式,看師爺的反應:

編號 我怎麼做 看什麼 結果
L1 說「你好」 打招呼、日期對不對 正確
L2 回答時停 3 秒:「紅色……我小時候,家裡就有一台。」 會不會搶話 會,停下來想一下就被接話
L3 師爺說到一半,直接打斷 停不停得下來 立刻停下來
L4 轉頭對家人說:「媽,你看這個電鍋,跟我們家那台好像喔。」 會不會插嘴 沒有插嘴
L5 「師爺,換下一題。」 有沒有接話 有,換了下一題
L6 讓師爺出一題 有沒有接開放式問題、邀請反問 都有
L7 用台語問「你食飽未?」 聽不聽得懂、會不會說 會用台語回答,但念得不太像
L8 「好,今天就聊到這裡,謝謝師爺。」 收尾自然嗎 自然

實測影片:
https://youtu.be/EwZacF206Y4

Gemini 3.8 Live 實測影片

師爺會等、會聽,也知道家人說話時不插嘴;
只是長輩停下、還在思考的時候,師爺沒有等待就先接下一段話

對「一起大冒險」來說,師爺當主持人看起來可行,
但長輩說話慢、會停下來想,「多久算說完」要調長一點;
API 可以調整VAD,留到 API 篇。

台語的部分:
官方語言清單都沒有台語,Live 會試著用台語回答,但聽起來不太像。

(四)如果要寫進 App

Live API 跟 Day17 的驛站一樣,用 WebSocket 連線;
不過官方建議,App 可以直接連到 Gemini,
用 ephemeral token(臨時權杖)取代 API 金鑰。

聘書(API 金鑰)不能交給 App,只能由鏢局發一張限時的臨時聘書。

要注意的事 官方說明
臨時權杖 預設 1 分鐘內要開始連線,30 分鐘後失效
對話長度 預設只有語音最長 15 分鐘,加上影像只有 2 分鐘;每條連線約 10 分鐘
費用 每一輪都會把前面的對話一起計算

這些要等到真的寫進 App,才測得出來,留到 API 篇。


六、費用

(一)設定花費上限

AI Studio 的 Spend 頁,可以設定專案每月的花費上限(實驗功能)。
今天實測前,我把上限設在 NT$300。
設好之後,按鈕變成「Edit spend cap」,金額旁邊多了上限:

這張也是今天實測的起點:NT$87.88,是 Day19 的花費。

(二)這次實測的花費

這次實測,AI Studio 的 Spend 頁:

時間點 Spend 增加
開始前 NT$87.88
TTS、Voice replication、Transcribe 做完後 NT$90.15 NT$2.27
Live 做完後 NT$94.51 NT$4.36

Live 剛做完時,Spend 還是 NT$90.15,過了一段時間後更新成 NT$94.51。

官方說明,AI Studio 的帳單資料最多會延遲約 10 分鐘;
Live 之後增加的 NT$4.36,可能也包含前面幾項較晚入帳的費用,
各模型實際花了多少,要看帳單報表的明細。

今天全部加起來 NT$6.63,約 0.21 美元。

Rate Limit 頁也看得到今天用了多少:
3.8 Flash TTS 用了 18 次(Tier 1 每天 100 次),
3.8 Live 每分鐘最多用了 1.45K token(上限 150K)。

Live 的計費方式跟其他模型不一樣:
官方說明,每一輪都會把前面累積的對話一起計算,
而且 Proactive audio 開著時,師爺在聽的整段時間都算輸入。


七、小結

三天的面試,師爺展現了這些本事:

篇 本事 這次用的模型 API 免費層
上 能看、能寫 Gemini 3.5 Flash-Lite、3.8 Flash 有
中 能畫、能唱、能拍 Nano Banana 2、Lyria 3.5、Veo 3.1 沒有
下 能說、能聽、能聊 3.8 Flash TTS、3.5 Transcribe、3.8 Live 有

今天的重點:

  • 能說(TTS):
    文字照念,停頓用英文標籤 short pause 指定;
    複製聲音只能現場錄音,同意聲明要照英文一字不差地念。

  • 能聽(Transcribe):
    「怕」念八次留下八個,不再停在五個;繞口令念錯的地方還留不住。

  • 分辨說話者:
    Day3 的願望做到了一半:分得出不同的人,

    但分不出真的我和複製的我XD

  • 能聊(Live):
    家人彼此聊天時不插嘴;
    長輩停下來想時會被搶話,要再調整。

師爺會說、會聽、會聊,最好的時候,是讓全家一起開口。


八、預告

師爺的面試到這裡告一段落。

接下來是正式聘用:
用 Gemini API,把「一起大冒險」和「一起畫畫」功能實作到健口動一動。

API 呼叫能不能走免費層、打到每分鐘和每日上限會怎樣,
也會在 API 篇一起實測。

明天開始:Gemini API 正式聘用!

感謝有緣看到這邊的你~
希望佛菩薩也祝福你:🌟開心順遂 健康平安🌟
南無觀世音菩薩🍀 南無地藏菩薩🏠 南無阿彌陀佛☀️


上一篇
Google AI Studio:師爺 Gemini 登場(中)
下一篇
Gemini API:師爺正式聘用(上)
系列文
Build on Google AI :長者照護 —— 口腔機能訓練 與 延緩認知退化 共 24 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言