做AI影片時,最捨不得刪的,常常是畫面、動作和光影都剛好,人物卻把台詞念錯的鏡頭。硬把別段音軌剪過來,有時能救急,但停頓、情緒和環境底噪很容易接不上。比較穩的做法,是先鎖住畫面,再單獨重做聲音。
先分清楚:是錯詞,還是聲線問題
人物念錯字、漏字或斷句不對,要用文字轉語音重新配正確台詞。先記下人物開口和閉口的起止位置,再把台詞依鏡頭拆短,標出停頓和重音。嘴部特寫尤其要留意:重生成音訊不會自動修正口型,時長差太多時,仍要重做嘴部鏡頭,或另加口型同步流程。
若原台詞沒有錯,只是角色聲線不一致,處理方式又不同。可考慮聲音轉換,保留原本正確的說話節奏,只換音色。兩件事別混用:聲音轉換不能把錯詞改正,文字轉語音也不保證天然貼合原口型。

AI短劇配音模型怎麼選
不必只押一個模型。CosyVoice 系列可用來測試角色台詞重配和多語種聲音克隆;F5-TTS 可放進同一輪試聽比較;IndexTTS2 把時長控制列為重點,適合測試需要卡住鏡頭長度的台詞。若句子內容與節奏已經正確,只想統一角色聲線,Seed-VC 這類聲音轉換方案更合適。用同一段參考音訊、同一句台詞和相同輸出規格測幾個模型,再聽吐字、情緒、時長與後期好不好剪,比只看展示頁可靠。
參考音訊要乾淨,盡量避開配樂、混響和多人說話。每個角色分開建立聲音素材和台詞表,別讓同一段參考音訊到處混用。語速、停頓、情緒、音高等控制項會因模型與介面而異,先生成兩三版短句試聽,再擴到整集,能少走很多彎路。
音效出錯,要換另一類模型
腳步、開門、衣物摩擦、兵器碰撞和環境氛圍,屬於另一條聲音鏈。Sony AI 公開的 Woosh 面向文字到音訊和影片到音訊的音效生成;MMAudio 也可依據影片和文字生成同步音訊。它們適合補動作聲和環境聲,不負責角色台詞。替換時要對準動作發生的那一格,再處理響度、空間感和背景音樂的遮擋關係,否則音效再對也會顯得飄。

最後別漏掉授權
聲音克隆前先取得配音演員或真人參考聲音的授權,並保存台詞版本、參考音訊來源、模型版本、生成記錄和混音工程。開源程式碼不等於所有用途都可直接商用,模型許可、音樂、字體和素材權利仍要分開核對。需要同時處理角色設定、配音、音效和後期時,可透過AI短劇製作服務尋找能串起聲音流程的團隊。把錯誤台詞、對應鏡頭、角色設定和目標長度一次交代清楚,修一條音軌會比重做整段影片輕鬆得多。