在過去四天,我們聚焦在多模態的「視覺能力」(手繪草圖、發票 OCR、商業圖表與多圖 DIFF)。今天我們要解鎖 Gemini 原生多模態的另一張王牌——原生音訊理解(Native Audio Understanding)。
過去處理會議或課堂錄音,通常必須走兩階段工作流:先透過語音轉文字(Speech-to-Text, STT)引擎(如 Whisper)轉出長篇逐字稿,再丟進 LLM 做重點摘要。這種做法不僅耗時、成本加倍,而且逐字稿往往充斥著贅字、語病與同音錯字,讓後續摘要品質大打折扣。
Gemini 3 Flash 具備原生端到端(End-to-End)處理音訊的能力,能直接「聽」錄音檔的音頻訊號,精準捕捉語氣、停頓與多位講者的發言輪替。今天我們要在 Google AI Studio 中,用平板直接上傳音訊檔,實測如何設計高效率的會議/課堂摘要提示詞!
為什麼「直接聽音訊」遠勝「先轉文字再摘要」?
可用prompt:
【角色】你是一位高效敏捷團隊的資深專案經理(PM)與執行秘書。
【任務】請仔細聆聽上傳的音訊錄音,進行端到端語音分析,產出專業的【標準會議紀要】。
【分析與提煉規範:4D 架構】
【30 秒高階摘要 (Digest)】
【決策共識與爭點 (Decision & Debate)】
【行動清單與任務指派 (Duty & Action Items)】
【關鍵時間戳記 (Key Timestamps)】
【交付底線】
今日結語
從「看懂圖表」跨越到「聽懂對話」,多模態大模型正徹底打破人機互動的輸入邊界。
Gemini 3 Flash 的原生端到端音訊處理能力,讓我們告別了繁瑣且容易出錯的傳統逐字稿轉寫流程。透過「4D 會議提煉架構」,平板用戶只需按下錄音並直接上傳,幾秒鐘內就能將原本鬆散、口語化的對話雜訊,自動沉澱為條理分明、立即可執行的工程行動清單!