AI 複製你自己的聲音實測:MiniMax 錄 3 分鐘,打字就能出口白,再用對嘴讓照片開口

用手機錄約 3 分鐘自己的聲音,在 MiniMax 建出聲音分身,之後貼稿就能生成口白,再用對嘴讓照片開口。附盲測音檔、設定、費用與 7 個踩雷。

AI 複製你自己的聲音實測:MiniMax 錄 3 分鐘,打字就能出口白,再用對嘴讓照片開口

⏱️ 一分鐘教你一個 AI 工具技巧|第 4 集 · 看全系列 ›

我先放兩段聲音給你聽,同一句話:「以前我整理資料夾,要一個一個檔案改名、搬移,弄到半夜都還沒弄完。」

一段是我本人坐在房間裡念的,另一段是我打了字,AI 用「我的聲音」生出來的。你猜得出哪一段是真的嗎?

聲音 A

聲音 B

答案我放在下面「盲測揭曉」。這篇要做的事很單純:用 MiniMax 把自己的聲音存成一個「分身」,之後寫好稿、貼上去,就能出一段像自己念的口白;最後還可以讓一張照片跟著口白開口說話。這也是我這支 Reel 的整條口白產線,我把完整步驟與踩過的雷都寫在這裡。

💡 快速摘要(TL;DR|2026.10 實測)

  • 這是什麼:MiniMax 的 Voice Clone(Instant Clone)。錄約 3 分鐘自己的聲音存成分身,之後打字就能生出你的口白。
  • 怎麼用:錄音 → 上傳樣本建分身 → 在 Text to Speech 選自己的聲音、貼稿生成。我這集的樣本是 6 段、共約 200 秒。
  • 花多少:網頁版 1 字約 1 credit,新帳號送 10,000;這支片 6 句口白只用 468 credits。
  • 最大的雷:樣本只放同一種語氣;語言要手動選 Chinese (Mandarin),繁體稿會被判成 Cantonese。
  • 對嘴要先知道:讓照片開口目前只能在我自己的電腦跑(要本機 PowerShell),雲端環境連不到,下面會誠實寫。

✍️ 真人實測宣告
本文根據作者實際錄音、建分身、生成口白與對嘴的操作及帳務紀錄撰寫,數據皆為真實紀錄。

📑 快速導覽目錄



🎙️ 為什麼我要複製自己的聲音

我常做 Reels,每一支都需要口白。自己錄的問題是:念錯要重來、環境稍微吵就不能用、錄完還要剪掉換氣聲。更麻煩的是,改一個字就得整段重錄。

之前我用過別的聲線再轉成自己的音色,流程很長。後來改用 MiniMax 直接建自己的分身,才發現產線可以縮成:寫稿,貼上,按生成。改字只要重按一次。

這個做法適合你,如果你也有這些需求:

  • 常做影片,需要穩定的口白,但不想每次開麥克風
  • 聲音想有「自己的感覺」,不要罐頭配音
  • 想把靜態圖變成會講話的角色

先講一個前提:只複製你自己的聲音。MiniMax 上傳樣本時會要你勾選「我擁有這段聲音的權利與授權」,這不是形式,別拿別人的聲音來建。


🎯 先講結論:三個動作就夠

  1. 錄:用手機語音備忘錄,同一種語氣錄約 3 分鐘(10 到 300 秒都收)
  2. 建:到 MiniMax 的 Voice Clone 上傳樣本,存成分身
  3. 生:到 Text to Speech 選自己的聲音,貼稿,語言手動選 Chinese (Mandarin),按生成

第 4 步「照片開口」是加分項,不做也完全不影響前三步。


🎧 盲測揭曉:哪一段是真人

回到開頭那兩段音檔:聲音 A 是我本人原音,聲音 B 是 MiniMax 用我的分身生成的。

兩段念的是同一句話:「以前我整理資料夾,要一個一個檔案改名、搬移,弄到半夜都還沒弄完。」你猜對了嗎?

這個盲測是我決定把口白交給分身的理由。接下來是怎麼做出來的。


🎤 Step 1:錄一段乾淨的聲音

分身像不像,八成取決於樣本。我的錄法:

  • 工具:手機內建的語音備忘錄就夠
  • 環境:安靜的房間,嘴巴離手機約 15 公分
  • 每段前後留 1 秒靜音:後面剪接、對嘴都比較好處理
  • 念錯整段重錄,不要在檔案裡硬剪
  • 同一天、同一個位置錄完:不同天的音量、房間回音會有差,分身會被平均掉
  • 全部用同一種語氣:我這次用的是「活潑」那一組,共 6 段(檔名 lively_1 到 lively_6),加起來約 200 秒

講稿我也是先寫好再念,這樣每段的語氣與速度比較一致。如果你想要我那份錄音講稿的範本,留言「工具」,我私訊給你。


🧬 Step 2:上傳樣本,建出聲音分身

  1. 開 minimax.io/audio,左側選 Voice Clone(也就是 Instant Clone)。旁邊的 Voice Design 是用文字描述「造」一個聲音,不是這個
  2. 點 Add or drop a file,把樣本一次丟進去。下面的 Uploaded Samples 會顯示 6/10
  3. Advanced Settings 的兩個開關(Remove Background Noise、Enable Accent Optimization)我都關著。前者我的錄音不需要;後者我擔心會把台灣腔修掉,沒有拿來驗證,所以不碰
  4. 下方有試聽欄與授權勾選,確認聲音是自己的再勾,然後存檔,替分身取一個好認的名字
MiniMax Voice Clone 上傳頁 6 段 lively 樣本全部顯示 100% 完成,Uploaded Samples 6/10
6 段樣本全部上傳完成(100%),計數是 6/10。Advanced Settings 兩個開關保持關閉。

樣本的硬限制要先知道:

  • 總長度 10 到 300 秒
  • 每個檔案 20MB 以下
  • 最多 10 個檔

我之前一次丟了 7 段、總共 360 秒,直接報錯。這集用的 6 段約 200 秒,順利過關。

還有一個我花最多時間才搞懂的點:不要把不同語氣混在一個分身裡。我先前把「冷靜」和「聊天」兩種語氣的檔案放在一起,結果兩邊都被平均掉,兩種都不像。想要兩種語氣,就各建一個分身(免費帳號有 3 個 voice slot)。


⌨️ Step 3:打字生出口白

  1. 左側選 Text to Speech
  2. Model 選 speech-2.8-hd
  3. 右側 Voice 選你剛存的分身。這裡一定要確認,預設會是別的內建聲音
  4. 語言手動選 Chinese (Mandarin)(原因在下面雷區)
  5. 貼上稿子,按 Generate
MiniMax Text to Speech 頁面 Model 為 speech-2.8-hd、Voice 為 myvoice_lively、語言 Chinese (Mandarin),稿中帶有停頓標記
口白生成頁:Model、Voice、語言三個地方要逐一確認。稿中紫色的 <#0.3#> 是停頓標記。(這張是我先前另一支片的設定,Speed 為 1;本系列我用 1.15。)

我這個系列的設定與寫稿習慣:

項目我的設定為什麼
Speed1.15(本系列)我的分身原本就偏快,剛好貼近我平常講話節奏;每個人的分身不同,建議自己試
Pitch0動了就聽起來不像同一個人
Voice Modifier不碰會改音色,在免費額度還會扣次數
停頓<#0.3#> 只放段落之間句與句之間標點本身就會停,再加標記會停兩次,變得很拖
第一句開頭加一個「欸,」防止第一個字音量太小被吃掉

生出來之後聽一遍,念錯的字或語氣怪的句子,改稿重生成即可,不用重錄。


👄 Step 4:讓照片開口(進階,目前只能本機跑)

先講清楚:這一步目前只能在我自己的電腦上跑。對嘴用的是 LatentSync(透過 Replicate 執行),我試過從雲端環境和 Cowork 連過去,都連不到(會被擋),所以得在本機開 PowerShell 執行。如果你只想要分身口白,前三步就完整了,可以直接跳到費用。

我的做法是這樣:

  1. 先準備「母帶」:把角色圖用 Fish Audio 的 Creatify Aurora 生成一段約 7 秒的短片,再「正放加倒放」接長到比口白還久。母帶只做一次,角色不換就一直沿用。
  2. 送對嘴:在本機 PowerShell 執行(指令與路徑換成你自己的):
    python latentsync_replicate.py <母帶.mp4> <口白.wav>
  3. 送去對嘴的音檔,開頭要留至少 0.5 秒空白,不然第一個字的嘴型會糊掉
  4. 出片後抽兩個畫面比對,確認嘴巴真的有在動,再往下剪

這集 67 秒的口白,LatentSync 跑了 281 秒,費用 US$0.281。

那個 latentsync_replicate.py 是我自己寫的小腳本,需要 Replicate 帳號與 API token。想要的話留言「工具」,我私訊給你。


💰 這支片花了多少

項目實際花費備註
建分身0網頁版免費,佔 1 個 voice slot
6 句口白468 credits網頁版約 1 字 1 credit;新帳號送 10,000
對嘴(LatentSync)US$0.28167 秒口白,GPU 約 281 秒

以我這集 6 句口白用掉 468 credits 來算,免費的 10,000 credits 可以做不少支。用完想續用,付費方案 Starter 是 US$5 一個月、10 萬 credits(月底到期)。費用以 MiniMax 官網當下為準,價格可能調整。


⚠️ 踩雷筆記:做之前先知道的 7 件事

  1. 繁體稿會被判成 Cantonese:語言欄位自動偵測會誤判,一定要手動改成 Chinese (Mandarin)
  2. Voice 欄位預設不是你的分身:每次生成前先看右側選的是誰
  3. 樣本總長超過 300 秒會報錯:不是檔案數的問題,是總長
  4. 語氣不要混:calm 和 chat 放在一起,兩邊都會被平均掉
  5. Pitch 別亂調:我試過調高,聽起來完全不像同一個人
  6. 停頓標記別句句加:標點本身就會停,標記只放段落之間
  7. 「Claude」這類英文字詞發音不穩:我目前選擇接受,要修的話可以試著改寫成中文發音字,我還沒驗證過效果

❓ 常見問題 FAQ

Q1:一定要錄 3 分鐘嗎?

MiniMax 的頁面寫最短 10 秒就能複製,所以不是必須。我這次錄約 200 秒,沒有拿更短的樣本做比較,所以不確定短樣本會差多少。想省事可以先用短的試,不滿意再補錄。

Q2:複製別人的聲音可以嗎?

不行,也不建議。上傳時要勾選你擁有該聲音的權利,這篇所有做法都是只針對自己的聲音。

Q3:我的聲音會被別人拿去用嗎?

分身是存在你自己帳號的 voice slot 裡。至於 MiniMax 如何處理上傳的聲音樣本,我沒有深入研究過服務條款,如果你在意,建議上傳前先讀官方的條款與隱私說明。

Q4:不做對嘴可以嗎?

可以。前三步已經能完整產出口白,拿去配任何影片都行,對嘴只是讓角色講話更有畫面。

Q5:一定要用 speech-2.8-hd 嗎?

我只用過這一個,聽起來最像我,所以沒有拿其他模型比較。


⏱️ 一分鐘版:沒時間看全文?

這支 Reel 把三個章節各演一次:① 錄一段聲音 ② 打字出口白 ③ 照片開口。

⏱️ 本系列「一分鐘教你一個 AI 工具技巧」


💡 結語:聲音錄一次,之後只剩寫稿

這條產線讓我最有感的地方是:口白從「一件要排時間的事」變成「寫稿的延伸」。念錯不用重來,改一個字只要重按一次生成。

如果你只做一件事,就做前三步:錄約 3 分鐘同一種語氣的聲音,建分身,語言記得手動選 Chinese (Mandarin)。想要錄音講稿範本、對嘴腳本,留言「工具」,我私訊給你,也可以直接到 AI 工作流入口頁 看。

下一集我要拆解:一支 Reel 背後到底串了哪 5 個 AI 工具,敬請期待。

👉 要私訊拿工具:IG 私訊 @pinkjhs.life