iT邦幫忙

2026 iThome 鐵人賽

DAY 25
0
ChatGPT & Codex

2026 年,會用 AI 不等於會帶 AI:用 ChatGPT × Codex 從零開始實現一人 AI 團隊系列 第 25 篇

【Day 25】讓你的專業被看見:用 AI 把口播做成線稿動畫,完成自己的解說影片

  • 分享至 

  • xImage
  •  

摘要

這篇帶你把一段現有口播,做成「線稿動畫+字幕+圓形講者畫中畫」的直式短片。從整理素材、核對字幕、安排分鏡,到預覽修正、輸出 MP4,再上傳 YouTube。文中用一支已完成的 45 秒影片說明,提供三段可交給 AI 的階段指令,讓第一次製作有明確的起點和檢查方式。

引言

手上有一段口播,但整段都看著人臉,想替內容加一點畫面,可以從這種做法開始:讓講者留在右下角,主畫面跟著他說的內容畫出圖解。說到繩索就畫下降動作,說到洞穴生活就畫帳篷,觀眾一邊聽、一邊看懂。

我這次拿一段訪談做了測試。下面先看成品,再拆開製作流程。第一次練習,先選一段意思完整的短片,走完一次,比一開始就做長片容易掌握。

先把閱讀地圖放在腦中。第一章準備口播,第二章拿到字幕與分鏡,第三章看預覽並修改,第四章留下 MP4。 你負責提供內容、看結果與指出問題,AI 接手畫面製作和輸出。每一段指令後都列出應拿到的成果,拿到並確認了,再往下一步走。

cover_image

封面為概念插畫;以下截圖才是本次實際成片畫面。

一、先看成品,再準備自己的素材

你在 YouTube 或 IG Reels 看過的出鏡口播,主畫面通常是講者;加入圖解與補充畫面後,也能讓觀眾跟著講述理解內容。這次先以現有口播為起點,保留聲音與人臉,改變主畫面的呈現。

這支示範是 45 秒、720×1280、30 fps 的直式影片。主畫面是隨講述內容出現的線稿動畫,下方有英文字幕,右下角保留圓形講者畫中畫;聲音沿用原影片。

觀看這次的 YouTube 成品:口播不用一直看人臉!

口播線稿成片截圖:主畫面、字幕與講者畫中畫

圖一 實際成片約第 6 秒。上方是線稿主畫面,下方保留字幕、來源與講者畫中畫。

口播內容轉成洞穴線稿畫面

圖二 實際成片約第 18.8 秒,用圖解呈現洞穴空間。截圖保留原影片的來源說明。

截圖可以看畫面怎麼安排;完整的動作、切鏡與聲畫同步,則需要播放影片檢查。

素材來自 NASA 太空人 Jeanette Epps 的公開訪談片段,這是改編測試,不是我本人錄製的口播,也不代表 NASA 背書。原始素材可查 NASA 訪談來源。使用其他人的素材時,要先確認來源與使用條件;NASA 也有自己的影像與媒體使用指引。

這次使用 Claude Code 搭配 Claude Opus 5.5 製作動畫畫面與畫中畫,再由主協調者匯出 MP4。下面把這段製作流程整理成三個階段,提供可交給 Codex 的提示詞與各階段應拿到的成果。

開始前,把素材集中在一個資料夾,再用 Codex 開啟這個本機資料夾,後面的指令都在同一段對話接著做。若還沒有自己的素材,可以先用手機錄一段約 30–45 秒、意思完整的解說,讓講者清楚入鏡、聲音聽得清楚。第一輪只需要這一段,不必先準備整套頻道素材。

準備項目 用途與注意事項
一段口播 MP4 選聲音清楚、講者可見、意思完整的片段;第一次可先做約 30–45 秒
帶時間碼的字幕,如 SRT 讓 AI 知道每句話何時出現;若沒有,先從口播轉錄,再人工核對
原始來源或自己的錄製說明 保留素材出處,方便做片尾與影片描述
想要的畫面樣式 例如白紙線稿、少量青綠與橘色、右下角圓形講者
製作工具與輸出資料夾 讓 AI 先確認環境可用,再開始製作

這次走的是本機製作:用網頁動畫畫出線稿,透過瀏覽器取出畫面,再合成影片。既有工具使用 Python、Playwright/Chromium、Pillow 與 FFmpeg;你不必先背這些名稱,先請 AI 檢查能否完成下面的流程。

二、核對字幕,把每句話變成分鏡

先把流程記成這條線:現有口播 → 核對字幕 → 分鏡 → 動畫與畫中畫 → 預覽修正 → MP4 → YouTube。

口播影片從素材到 YouTube 的製作流程

圖三 先準備素材與字幕,按內容製作畫面,預覽後有問題就回到製作步驟。確認 MP4 後再選擇是否上傳;環境小測試是為讀者重做加入的起手步驟。

先確認環境與素材,避免做到最後才發現只有網頁預覽,沒有可播放的影片。先貼入第一段指令,把中括號換成自己的素材位置與影片條件。

請檢查 [素材資料夾] 裡的口播影片、字幕與來源說明。
我想做成約 [45] 秒、720×1280、30 fps 的直式影片,
保留原聲,加入線稿動畫、字幕及右下角圓形講者畫中畫。

若只有影片、還沒有字幕,先提出可用的轉錄方式,
產出帶時間碼的 SRT,標出聽不清楚的部分供我核對。
不要猜寫聽不清楚的詞,也不要在核對前開始動畫製作。
若目前工具不能轉錄,說明我需要補什麼。

再確認影片與字幕可讀、時間碼相符,
以及目前環境能否預覽畫面並輸出帶聲音的 MP4。
優先沿用現有工具,列出缺少的項目與處理方式;
不要直接開通付費服務或加入不必要的外部工具。
先回報可行的製作路徑,並輸出一張測試畫面,
確認素材讀取與畫面產出可用;還不要生成整支影片。

**這一步應拿到:**素材清單、影片規格、字幕問題、一張測試畫面,以及可執行的預覽與輸出方法。若缺字幕,就先補轉錄;若缺輸出工具,就先解決輸出,再往下做。

接著逐句對照原聲,確認名稱、數字、專有名詞及斷句。這支示範當時依「保留提供的字幕」要求,連原字幕的轉錄錯誤也保留下來,而且片段結尾停在句子中間。做自己的版本時,應先修正字幕、選好完整結尾,再把這份核對後的字幕當成製作依據。

字幕確定後,請 AI 列出分鏡。分鏡不需要寫成電影劇本,只要回答三件事:**哪個時間、說什麼、畫什麼。**例如這次的畫面安排:

口播段落 主畫面怎麼表達
提到垂降與攀升 用繩索、人物和上下箭頭呈現動作
提到洞穴裝備 依序畫出頭盔、繩索與扣環
提到在洞穴過夜 畫帳篷、睡袋與燈光
提到探索地下世界 用照明光束帶出洞穴空間

這次共做了 17 個分鏡,依字幕時間切換。自己的影片不必照抄這個數量;一句話需要停留多久、什麼時候換畫面,應跟著內容決定。

製作時先守住三個原則。先確認說什麼,再決定畫什麼;先看小段預覽,再輸出全片;先指出一個具體問題,再要求修改。 這樣字幕有錯就回到字幕,圖解不合意思就回到分鏡,位置遮擋就調整構圖,不必每次把整支片重做。

三、製作畫面,先預覽再修正

有了分鏡,就可以把製作要求講清楚。重點是讓圖解幫觀眾理解口播,同時替字幕與講者留好位置。

核對字幕後,貼入第二段指令,讓 AI 把內容做成分鏡與預覽。

請依核對後的字幕列出分鏡表:
每鏡包含起訖時間、口播重點、畫面內容與動作。
畫面只表達素材已說到的內容,不補寫未提供的事實。

依這份分鏡製作白紙線稿風格的直式短片,
以少量青綠與橘色標示重點。
主畫面放圖解,下方放可讀字幕,
右下角保留原影片講者的圓形畫中畫。
原聲與講者動作保持同步,字幕及人臉不要互相遮住。

先交付代表性畫面截圖和一小段帶聲音的預覽,
確認呈現與輸出方式可用後,再完成全片預覽。
保留可修改的製作檔與分鏡表。

**這一步應拿到:**分鏡表、可修改的製作檔、代表性截圖,以及能檢查聲畫同步的預覽。拿到截圖時先看構圖,拿到影片時再看節奏;兩者要分開檢查。

我會先看三個位置:開頭是否立刻有內容、最長的字幕是否清楚、講者的人臉是否留在圓框內。再完整播放,確認每個畫面出現時,口播正在談同一件事。

這次預覽後修過洞穴線條、地圖標籤的位置,也讓開頭直接進入繪製中的畫面。這些都是能指出時間和位置的修改。交給 AI 時,可以這樣寫:「12 秒的繩索動作太快,讓人物下降慢一點」,或「這行字幕太擠,換行並留出左右空間」。一次先改幾個明確問題,再重看受影響的段落。

如果畫中畫無法穩定播放,請 AI 先找原因並提供替代方式。這次為了讓匯出時的講者畫面同步,製作流程改用預先取出的連續影格。對讀者而言,驗收重點仍是:嘴型與原聲同步、人臉不被裁掉、字幕能讀清楚。

四、驗收 MP4,再把影片放上 YouTube

預覽順了,還要完成最後一步:輸出真的能播放的影片。動畫網頁能動,不等於交付的 MP4 一定有聲音、沒有黑畫面。

確認預覽後,貼入第三段指令,輸出並檢查成片。

請把確認後的版本輸出為 MP4,
尺寸 720×1280、30 fps,片長與選定口播一致,
保留原聲、核對後的字幕與講者畫中畫。

檢查成品能正常播放、有聲音、沒有黑畫面,
字幕與人臉不互相遮擋,口播、字幕及畫面時間一致。
抽查開頭、各分鏡交界及結尾,列出仍有的問題。

交付 MP4、封面截圖、製作檔與簡短驗收結果,
並整理 YouTube 標題和描述草稿,包含必要素材出處。
這一步先交付檔案與文案,不代為發布。

**這一步應拿到:**可以播放的 MP4、封面截圖、製作檔和驗收結果。收到後,自己從頭到尾播放一次,再用手機看字幕與畫中畫的大小。

檢查項目 合格時應看到什麼
檔案與規格 MP4 可開啟,尺寸、片長符合要求
聲畫同步 原聲正常,講者嘴型、字幕與畫面對得上
畫面可讀 字幕清楚,人臉完整,圖解沒有擋住重要資訊
內容與結尾 圖解符合口播,影片在完整句意處結束

這次成品的技術驗證確認了可解碼、45 秒片長、720×1280 尺寸、有聲音及抽樣畫面有動作。這些結果能確認檔案基本可用,字幕正確性與敘事完整度仍需要人看。

準備上傳時,在 YouTube Studio 選擇上傳影片,放入 MP4,填入標題、描述及觀眾設定,再檢查影片處理結果。第一次可以先設為私人,播放確認後再決定是否公開;私人、不公開與公開的差異可查 YouTube 官方說明。

標題先說清楚這支片在講什麼,描述補上素材來源與改編說明。如果用自己的口播,就寫自己的內容;如果用這次 NASA 訪談練習,則要保留素材出處與「改編測試、無背書」的說明。這次案例已公開,讀者可以回到第一章的連結,對照自己的成果。

結論

先準備一段口播,核對字幕,再把每句話安排成看得懂的畫面。AI 可以幫你列分鏡、做動畫和輸出影片,你則用預覽確認內容、位置與節奏。

第一次完成的標誌,是拿到一支能播放、聲畫對得上、字幕清楚的 MP4。先走完這一支,再換自己的題材,會更知道下一次要怎麼下指令。

三張帶走圖卡

圖卡1:準備影片與字幕

圖卡2:交給 AI 製作畫面

圖卡3:輸出前檢查


上一篇
【Day 24】用 AI 把西門紅樓照片做成 3D:跟著 Codex 與 Blender 完成自己的第一個模型
系列文
2026 年,會用 AI 不等於會帶 AI:用 ChatGPT × Codex 從零開始實現一人 AI 團隊 共 25 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言