今天用 AI 語音辨識自己生一份字幕出來。不用把檔案上傳到任何網站,整個流程在你自己電腦上跑完。
圖片來源: AI生成字幕 · dyphire/mpv-config · Discussion #164,更多可以看裡面範例。
去 Purfview/whisper-standalone-win 抓執行檔。這是把 whisper 包成免安裝 exe 的專案不用安裝 Python。
下載目前版本Faster-Whisper-XXL_r245.4_windows.7z,下載完解壓縮之後放一個mpv.exe相同位置(例如: D:\mpv-lazy )。
模型不用自己抓,第一次跑會自動下載到執行檔旁邊的 _models\ 資料夾。
額外補充說明:
One Click Transcribe.bat這個檔案很方便,可以把 mp4 移至到這個檔案上面,他就會開始進行產生字幕。
去 dyphire/mpv-sub-fastwhisper 抓 sub-fastwhisper.lua,只有這一個檔案。放進:
mpv-lazy\portable_config\scripts\
另外它還會呼叫 FFmpeg,不過那是分段模式,這個有要做即時翻譯時候,需要安裝 ffmpeg 依賴。可用 scoop 裝。
scoop install ffmpeg
在 D:\mpv-lazy\portable_config\input_uosc.conf 加上以下設定
ALT+m script-message-to sub_export export-selected-subtitles #! 字幕 > 導出當前內封字幕
ALT+f script-message-to sub_fastwhisper sub-fastwhisper #! 字幕 > 生成 AI 字幕
# script-message-to sub_fastwhisper sub-translate #! 字幕 > 翻譯當前 srt 字幕
如果你沒有要調整位置可以不用調整,假如你要調整 AI 翻譯位置,那就需要繼續調整設定檔。
這邊範例以 ollama 為例,請開啟 ollama 預設會是 11434,所以需要調整 sub_fastwhisper-api_url,模型 gemma4:e4b 或 gemma4:12b 都翻譯效果都還不錯。
在 mpv-lazy/portable_config/script-opts.conf 設定加上設定檔案。
## sub-fastwhisper.lua
## Faster-Whisper 語音辨識 / AI 字幕
script-opts-append = sub_fastwhisper-fast_whisper_path=D:/Faster-Whisper-XXL/faster-whisper-xxl.exe
script-opts-append = sub_fastwhisper-model=turbo
script-opts-append = sub_fastwhisper-device=cuda
#計算精度,不指定則使用 default
#script-opts-append = sub_fastwhisper-compute_type=float16
#語音語言;不設定即自動偵測
#script-opts-append = sub_fastwhisper-language=ja
#CPU 執行緒;你原本是註解狀態,因此這裡也先不啟用
#script-opts-append = sub_fastwhisper-threads=8
script-opts-append = sub_fastwhisper-max_line_width=100
script-opts-append = sub_fastwhisper-output_path=source
script-opts-append = sub_fastwhisper-update_interval=20
script-opts-append = sub_fastwhisper-use_segment=no
script-opts-append = sub_fastwhisper-segment_duration=10
## GPT / AI 翻譯 API
script-opts-append = sub_fastwhisper-api_url=http://localhost:11434/v1/chat/completions
script-opts-append = sub_fastwhisper-api_key=
script-opts-append = sub_fastwhisper-api_mode=gemma4
script-opts-append = sub_fastwhisper-api_temperature=0.95
script-opts-append = sub_fastwhisper-api_rate=15
script-opts-append = sub_fastwhisper-translate=Chinese
script-opts-append = sub_fastwhisper-font_name=Noto Sans CJK SC
ollama 先下載 gemma4 模型,之後打開 ollama 就可以進行翻譯,另外同時翻譯就不建議同時做超分動作。
可用的模型從 tiny 一路到 large-v3。實務上的取捨:
| 模型 | 大概要多少 VRAM |
|---|---|
tiny / base |
~1 GB |
small |
~2 GB |
medium |
~5 GB |
large-v3-turbo |
~6 GB |
N卡就直接選 large-v3-turbo 模型就好。
large-v3-turbo 就是出自這裡。