我們如何打造 AI 自動剪片引擎:從語音辨識到 LLM 選段
一小時的直播或訪談影片,要變成三支能發的短影音,人工做的話:看完一遍、記時間點、剪輯、上字幕,熟手也要半天。這件事高頻、規則說得清楚、又極度耗人力——教科書等級的自動化標的。所以我們自己動手建了一套 AI 剪片引擎,現在是我們 AI 產品線的付費功能之一。這篇分享整條 pipeline 的架構,和那些文件不會告訴你的坑。
整條 pipeline 長什麼樣
核心流程四段,每段用的技術不同:
- 語音辨識:影片抽出音軌,丟給 Whisper 做逐字稿,拿到帶時間戳的文字。
- LLM 選段:把逐字稿交給 LLM,請它從內容裡挑出「有完整起承轉合、單獨看得懂、有記憶點」的片段,回傳時間區間和推薦理由。
- 剪輯合成:用 ffmpeg 按時間區間切出片段,轉直式、加安全邊界。
- 自動字幕:用第一步的時間戳資料燒上字幕,斷句和字數按短影音的閱讀節奏重排。
聽起來很順?每一段我們都摔過跤。
坑一:逐字稿的時間戳,不能直接拿來剪
Whisper 的辨識品質很好,但它給的分段時間戳是「語音段落」,不是「剪輯點」。直接按它的時間切,片段開頭常常吃到上一句的尾巴,結尾把人家的話砍在半空中。我們的解法是切點往外推一小段緩衝,再對音軌找靜音點對齊——讓剪輯點落在呼吸的空隙,而不是字的中間。這個細節決定了成品看起來是「機器切的」還是「人剪的」。
另一個實務坑:台灣的內容大量中英夾雜,再加上專有名詞(品牌名、產品名)辨識常出錯。我們讓用戶可以提供詞彙表,在辨識後用文字修正層把常錯詞替換回來——比重訓模型便宜一百倍,效果夠用。
坑二:LLM 挑的「精華」,跟人類的「爆點」是兩回事
第一版我們只跟模型說「挑出最精彩的片段」,結果它挑的都是「資訊最完整」的段落——結構嚴謹、四平八穩、無聊到滑掉。後來才想通:模型對「精彩」的預設理解偏向知識密度,但短影音要的是情緒密度。
現在的提示詞是明確定義過的選段標準:開頭三秒有沒有鉤子、有沒有反直覺的觀點、有沒有情緒起伏、能不能脫離上下文獨立成立,並要求模型對每個候選片段逐項評分再排序。同一支影片,改版前後挑出來的片段幾乎沒有重疊——提示詞工程在這種主觀任務上的槓桿,比換模型大得多。
AI 剪片最難的不是剪,是替「什麼叫值得看」寫下可以執行的定義。
坑三:這種服務的成本結構,跟聊天機器人完全不同
剪片是重運算服務:Whisper 吃 CPU/GPU、ffmpeg 吃 CPU、一支影片處理好幾分鐘。它跟一般 Web 服務的資源模式衝突,塞在同一台主機上會把網站拖垮。我們的做法是把剪片引擎拆成獨立服務、獨立部署,前台只負責收件和金流,用任務佇列跟引擎溝通,用戶端永遠不直接碰引擎。另外,LLM 選段那步我們按 模型分級的原則 只在關鍵步驟用旗艦模型,不然單支影片的處理成本會讓訂閱制算不過來。
哪些環節,我們仍然留給人
誠實說:引擎產出的片段,我們自己拿來經營社群時,發佈前還是會人工看過——十支裡挑三支、偶爾微調字幕斷句。AI 把半天的工作壓成十分鐘的挑選,這就是它該做的事;最後一哩的品味,目前還是人的。宣稱「全自動、不用人看」的工具,要嘛是內容量大到不在乎單支品質,要嘛是還沒被自己的成品嚇過。
這套引擎從架構到上線都是我們自己建置、自己維運、自己付帳單的,所以上面每個坑都有實際的痛感背書。如果你的團隊也有大量影音素材想自動化產製,或想建置類似的 AI pipeline,可以看看 AI 應用開發服務 和我們的 作品案例,或直接 來聊聊。
這類問題,我們每天都在自己的產品上解
免費 30 分鐘線上諮詢・先釐清方向,不推銷・一個工作天內回覆