iT邦幫忙

2026 iThome 鐵人賽

DAY 18
0

一、前言

還記得 Day15 收進保險箱的那把 Gemini 金鑰嗎?
那是一張聘書,現在,師爺上門了。

府裡為什麼要請師爺?
要先回到 Day3 寫下的初衷:

讓健口動一動成為互動的契機,
把家人的陪伴與互動融入遊戲和訓練。

所以府裡請師爺,
不是要他取代家人陪長輩聊天,而是幫全家搭起互動的橋。

正式請進府裡做事之前,老爺想先面試了解:

  • 師爺是誰?平時出沒何處?
  • 不寫程式,能不能先試試他的本事?
  • 他出的題目,能不能讓全家一起參與?

今天就在 Google AI Studio 面試師爺,讓我們往下看!


二、Gemini

(一)Gemini 是什麼

Gemini 是 Google 的生成式 AI 模型系列。

它是多模態模型:
文字、圖片、聲音、影片,都能一起看懂。

Google AI Studio 的模型清單,
列出了 Gemini API 可以使用的主要模型(2026-10-02)。

除了 Gemini 系列,也有 Google 其他系列的模型:

功能 代表模型 系列
看圖、讀文字、聽聲音,回覆文字 Gemini 3.8 Flash、Gemini 3.5 Flash-Lite Gemini
產生、修改圖片 Nano Banana 2(gemini-3.1-flash-image) Gemini
把文字唸成語音 Gemini 3.8 Flash TTS Gemini
把錄音轉成文字 Gemini 3.5 Transcribe Gemini
即時語音對話 Gemini 3.8 Live Gemini
產生影片 Gemini Omni 1.1 Flash Gemini
產生影片 Veo 3.1 Veo
產生整首歌 Lyria 3.5 Lyria
開放模型,可以自己部署 Gemma 4 Gemma

Nano Banana 是暱稱,
模型代號 gemini-3.1-flash-image 看得出它屬於 Gemini 系列。

府裡能請的幫手不少,各有專長:
今天先請 Gemini 裡擅長「看圖、寫字」的兩位出場。

清單上的價格,是付費層的價格。
哪些模型有免費層,以 官方價格頁 的 Free Tier 欄位為準;
今天用的 Gemini 3.8 Flash、3.5 Flash-Lite 都有免費層。

(二)模型名稱怎麼選

清單裡同一個模型,常有好幾種名稱。
官方把 模型版本 分成四種:

版本 例子 意思
穩定版 gemini-3.5-flash-lite 通常不會再改變
預覽版 gemini-3.1-pro-preview 可以用在正式環境,速率限制可能較嚴;停用前至少 2 週通知
Latest gemini-flash-latest 永遠指向最新版本;遇到重大變更,換掉背後的模型前會提前 2 週寄信通知
實驗版 (目前清單上沒有) 不適合正式環境,隨時可能變動

Latest 比較像一個職稱,不是人名:
今天值班的是 Gemini 3.8 Flash,下一版推出後,就換別人上場。

官方的建議是:

Most production apps should use a specific stable model.

正式上線的 App,大多應該使用指定的穩定版模型。
寫進程式時用固定的名稱,
才不會哪天模型換了,回覆的風格也跟著改變。

(三)使用 Gemini 模型的常見入口

師爺平時出沒何處? 常見的入口有這幾個:

入口 怎麼使用 用來做什麼
Gemini App 網頁、手機 App AI 助理:聊天問答、畫圖、做影片和音樂、深度研究
Google AI Studio 瀏覽器 試模型、試提示詞、建立 API 金鑰、做 App 原型
Gemini API 寫程式呼叫 讓 App、後端使用模型
Gemini Enterprise Agent Platform Google Cloud 專案 建構、部署、管理企業級 AI 代理的整合式平台;可用 200 多個模型(含 Claude)、訓練與微調模型(原 Vertex AI)

同一位師爺,可以找他閒聊,也可以談好條件,請他到府裡正式做事。

用得到 Gemini 的工具還有很多,例如寫程式的 Google Antigravity。

Day15 建立 API 金鑰的地方,就是 Google AI Studio;
今天就用它來實際試試 Gemini。


三、Google AI Studio

(一)為什麼先在 AI Studio 試

直接寫程式呼叫 API,每改一次提示詞,就要改程式、重新執行。

AI Studio 把這些都搬到瀏覽器裡:

  • 試提示詞:改完馬上送出,馬上看結果。
  • 比模型:同一個問題,並排看兩個模型的回答。
  • 拿程式碼:試好之後,一鍵產生對應的程式碼。

就像正式聘用前的面試:先看看本事,再決定怎麼請。

費用方面,官方帳單說明 寫著:
「AI Studio usage remains free of charge
unless users link a paid API key for access to paid features.」

沒有連結付費金鑰,在 AI Studio 試用是免費的。

免費層有一條要留意的條款(Day15 提過):
不要把敏感、機密或個人資訊送進免費服務。

所以今天出題用的照片,
是家裡的項鍊,沒有人、也沒有個資。

(二)開始使用

① 用 Google 帳號登入 aistudio.google.com

② 左側選單點「Playground」

③ 右側「Run settings」最上方點模型,選 Gemini 3.5 Flash-Lite


四、實作:用照片產生快問快答

健口動一動的快問快答,原本是家人一題一題自己出。

今天的實作:
上傳一張照片,請 Gemini 出三題給長輩的快問快答。

(一)系統指令:設定說話原則

系統指令(System instructions)是給模型的固定指示,
對話中的每一次回覆,都會套用這些指示。

像是貼在師爺桌上的工作守則,每次動筆前都先看一眼。

這次的指示,參考 Day3 整理的照護原則:

Day3 照護原則 寫成系統指令
說話簡短清楚 句子簡短,一次只說一件事
避免負向說法 用正面的說法,不說「不要」「錯了」
不直接糾正 長輩答錯時,換個方式給提示
減少選擇 每題只給兩個選項

再加上最重要的一條:
每題結束後,邀請在場的家人也說說看。

在右側「Run settings」的「System instructions」貼上:

你是「健口動一動」App 的快問快答主持人,
陪長輩和家人一起玩快問快答。

說話原則:
- 句子簡短,一次只說一件事。
- 用正面的說法,不說「不要」「錯了」。
- 長輩答錯時不糾正,換個方式給提示。
- 每題只給兩個選項。
- 每題結束後,邀請在場的家人
  也說說自己的答案或回憶。
- 不提供醫療建議。

最後一條「不提供醫療建議」,
來自 Gemini API 條款:服務不能用來提供醫療建議。
健口動一動定位在陪伴與日常保健,不是治療。

(二)輸出格式:指定 JSON

Gemini 產生的題目,之後要交給 App 顯示在畫面上。

如果每次都用自由文字回答,這次寫「第一題:」,下次寫「Q1.」,
App 很難穩定地把題目拆出來。

結構化輸出(Structured output)
可以指定回覆的 JSON 格式,
讓每一次的回覆,都是同一個格式。
就像發給師爺一張欄位固定的答案卷,照格子填就好。

官方建議兩件事:

  • 用 description 說明每個欄位:模型會參考它來填內容。
  • 型別寫清楚:字串、整數、陣列,能限制的就限制。

① 在「Run settings」打開「Structured output」

② 點「Code Editor」,貼上這份格式:

{
  "type": "object",
  "properties": {
    "questions": {
      "type": "array",
      "minItems": 3,
      "maxItems": 3,
      "items": {
        "type": "object",
        "properties": {
          "question": {
            "type": "string",
            "description": "給長輩的題目,一句話"
          },
          "options": {
            "type": "array",
            "items": { "type": "string" },
            "minItems": 2,
            "maxItems": 2,
            "description": "兩個選項"
          },
          "answer": {
            "type": "string",
            "description": "正確答案,必須是選項之一"
          },
          "hint": {
            "type": "string",
            "description": "答錯時的提示,不直接說出答案"
          },
          "family_prompt": {
            "type": "string",
            "description": "邀請家人一起回答或分享回憶的話"
          }
        },
        "required": [
          "question", "options", "answer",
          "hint", "family_prompt"
        ]
      }
    }
  },
  "required": ["questions"]
}

每一題有五個欄位:

欄位 內容 App 怎麼用
question 題目 顯示在畫面上
options 兩個選項 做成兩個大按鈕
answer 正確答案 判斷對錯
hint 提示 長輩答錯時顯示
family_prompt 邀請家人一起聊的話 每題結束後顯示

family_prompt 這一欄,
是把「促成家人互動」直接寫進輸出格式。
每出一題,都要附上一句邀請家人加入的話。

(三)上傳照片,產生題目

① 點輸入框左下角的「⊕」,上傳照片

② 輸入提示詞,送出:

請根據這張照片,出三題給長輩的快問快答。

官方的 圖片提示建議:
照片要清楚、不模糊,方向也要轉正。

輸出結果:

{
  "questions": [
    {
      "question": "照片中這條項鍊的墜飾,上面雕刻的是哪一種莊嚴的形象呢?",
      "options": [
        "菩薩",
        "動物"
      ],
      "answer": "菩薩",
      "hint": "它是一位常常帶給大家平安、慈祥感覺的莊嚴神像喔!",
      "family_prompt": "大家家裡也有類似這樣保平安的墜子或飾品嗎?身邊的家人也一起來聊聊吧!"
    },
    {
      "question": "請問這個墜飾連接的項鍊繩子,摸起來是什麼感覺呢?",
      "options": [
        "棉繩材質",
        "金屬鐵鍊"
      ],
      "answer": "棉繩材質",
      "hint": "它不是硬梆梆的鐵鍊,而是軟軟的、帶有質感的編織繩喔!",
      "family_prompt": "平常大家戴項鍊時,喜歡這種舒服的繩子,還是亮晶晶的金鍊子呢?家人們也分享一下吧!"
    },
    {
      "question": "照片裡金屬墜飾的形狀,看起來比較接近哪一個形狀呢?",
      "options": [
        "橢圓形",
        "正方形"
      ],
      "answer": "橢圓形",
      "hint": "它長長的、圓圓的,有一點像是一顆雞蛋的形狀喔!",
      "family_prompt": "大家覺得這個形狀是不是很古錐又好握呢?旁邊的家人也來說說看自己的看法吧!"
    }
  ]
}

怎麼確認輸出符合設定:

  • 回覆是完整的 JSON,剛好三題。
  • 每題兩個選項。
  • 題目句子簡短,沒有「不要」「錯了」。
  • 每題都有一句 family_prompt。

格式對了,內容卻不一定對。
官方在結構化輸出的說明裡提醒:

While output is syntactically correct JSON,
always validate values in your application.

JSON 的格式保證正確,但裡面的值,App 還是要自己檢查。
例如 answer 是不是真的出現在 options 裡;
答案卷的格子都填滿了,不代表每一格都填對。


五、比一比:Flash-Lite 與 Flash

同一份系統指令、同一張照片,換一個模型,結果會差多少?

App 上線後,每出一次題就會呼叫一次模型,
速度影響長輩要等多久,模型也決定了費用。

(一)Compare 模式

AI Studio 的 Compare 模式,
可以把同一個提示詞,同時送給兩個模型,並排比較回答和回應時間。

① 點右上角的「Compare」

② 左邊保留 Gemini 3.5 Flash-Lite,右邊選 Gemini 3.8 Flash

Compare 的每個模型有自己的 Run settings,
點模型名稱旁的「Show run settings」,
System instructions 可以勾 Sync 兩邊同步;
Structured outputs 要兩邊各自打開。

③ 上傳同一張照片,送出同一句提示詞

實測結果:

比較項目 Gemini 3.5 Flash-Lite Gemini 3.8 Flash
回應時間 約 3.6 秒 約 9.7 秒
輸入 token 1,205 1,084
輸出 token(含思考) 340 1,518
題目 三題、各兩個選項,有 family_prompt 三題、各兩個選項,有 family_prompt

兩邊的思考程度都是預設值:
Flash-Lite 預設 Minimal,Flash 預設 Medium(最低只能選 Low)。
速度和 token 的差距,有一部分來自思考程度的不同。

出題的內容,兩邊也不太一樣:

題目 Gemini 3.5 Flash-Lite Gemini 3.8 Flash
第一題 刻的是「佛菩薩像」還是「動物造型」 是「觀音菩薩」還是「土地公公」
第二題 繩子是「棉麻繩」還是「金屬鐵鍊」 牌子是「金屬」還是「木頭」做的
第三題 背景是「筆記型電腦」還是「電視機」 項鍊戴在「脖子」還是「手指」
家人互動 請家人分享有沒有類似的吊飾 請家人聊聊幫長輩求護身符的回憶
  • Flash-Lite:
    題目多是照片看得到的外觀,第三題問到背景的筆電,離主題有點遠。
  • Flash:
    選項更具體,像「觀音菩薩、土地公公」是長輩熟悉的神明;
    family_prompt 也比較能勾起回憶。
    但第三題的提示寫「這是一條項鍊,掛在胸前」,等於說出答案,
    沒照輸出格式裡「不直接說出答案」的說明。

貴一點、慢一點,題目比較有溫度;但不管哪個模型,內容都要再檢查。

(二)token 與思考

費用是用 token 計算的。
token 是模型計算資料量的單位,像稿費按字數算:

  • 文字:官方說明,1 個 token 大約是 4 個字元,
    100 個 token 大約是 60~80 個英文單字。
  • 圖片:也會換算成 token,解析度越高、token 越多。

另外,Gemini 預設會先 思考 再回答:

When thinking is turned on, response pricing is
the sum of output tokens and thinking tokens.

思考用掉的 token,跟輸出一起計費。

官方也建議,查資料、分類這類簡單的任務,
可以把思考程度調成 minimal 或 low,回覆比較快,token 也比較少。

師爺想得越久,答得越周到,但也越慢、越貴。
出題要想多深,可以在 Run settings 調整思考程度,
比較看看速度和題目品質。

(三)出題 1,000 次要多少錢

AI Studio 的模型清單上,
兩個模型的付費層價格(每 100 萬 token,美元):

模型 輸入 輸出(含思考)
Gemini 3.5 Flash-Lite 0.30 2.50
Gemini 3.8 Flash 0.75 3.75

Gemini 3.8 Flash 的價格是優惠價,到 2026 年 12 月 31 日;
依 官方價格頁,2027 年起調為輸入 1.50、輸出 7.50。

套進上面的實測數字:

模型 出題 1,000 次
Gemini 3.5 Flash-Lite 約 US$1.21
Gemini 3.8 Flash 約 US$6.51

在 AI Studio 免費試用,這筆錢不用付。
但 App 正式上線、處理家人的照片時,
依免費層條款要改用付費層,這時就是實際的成本。


六、拿程式碼:Get code

提示詞和設定都試好之後,下一步是接進 App。

點「Run settings」上方的「Get code」,
AI Studio 會把剛才的模型、系統指令、輸出格式,轉成呼叫 Gemini API 的程式碼。

面試談好的條件,一鍵寫成聘書上的條款。

今天試好的系統指令和輸出格式,之後的 Gemini API 篇會直接接進 App。


七、小結

今天在 Google AI Studio 面試了師爺 Gemini:

  • 師爺是誰:
    Google 的多模態模型系列,看、寫、畫、說、聽都有;
    作曲的 Lyria、影片的 Veo,則是其他系列的幫手。
  • 怎麼稱呼:
    正式上線用指定的穩定版名稱;Latest 是會換人的職稱。
  • 說話規矩(系統指令):
    把 Day3 的照護原則寫進系統指令,再加上「邀請家人也說說看」。
  • 答案卷(輸出格式):
    用結構化輸出指定 JSON,格式有保證,內容還是要 App 自己檢查。
  • 比一比:
    Compare 模式並排比較 Flash-Lite 與 Flash;
    思考 token 跟輸出一起計費,費用要一起算。

師爺Gemini的本事,是幫全家搭起互動的橋。


八、預告

今天看了師爺「能看、能寫」,
Day17 預告裡還有一項:還能畫。

明天繼續面試,
看看師爺怎麼畫圖,順便聽聽他的聲音。

師爺的面試,明天繼續!

感謝有緣看到這邊的你~
希望佛菩薩也祝福你:🌟平安幸福 開心自在🌟
南無觀世音菩薩🍀 南無地藏菩薩🏠 南無阿彌陀佛☀️


上一篇
Flutter : Google Cloud Speech to Text(下)
下一篇
Google AI Studio:師爺 Gemini 登場(中)
系列文
Build on Google AI :長者照護 —— 口腔機能訓練 與 延緩認知退化 共 24 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言