AI 複製你自己的聲音實測:MiniMax 錄 3 分鐘,打字就能出口白,再用對嘴讓照片開口
用手機錄約 3 分鐘自己的聲音,在 MiniMax 建出聲音分身,之後貼稿就能生成口白,再用對嘴讓照片開口。附盲測音檔、設定、費用與 7 個踩雷。
⏱️ 一分鐘教你一個 AI 工具技巧|第 4 集 · 看全系列 ›
我先放兩段聲音給你聽,同一句話:「以前我整理資料夾,要一個一個檔案改名、搬移,弄到半夜都還沒弄完。」
一段是我本人坐在房間裡念的,另一段是我打了字,AI 用「我的聲音」生出來的。你猜得出哪一段是真的嗎?
聲音 A
聲音 B
答案我放在下面「盲測揭曉」。這篇要做的事很單純:用 MiniMax 把自己的聲音存成一個「分身」,之後寫好稿、貼上去,就能出一段像自己念的口白;最後還可以讓一張照片跟著口白開口說話。這也是我這支 Reel 的整條口白產線,我把完整步驟與踩過的雷都寫在這裡。
💡 快速摘要(TL;DR|2026.10 實測)
- 這是什麼:MiniMax 的 Voice Clone(Instant Clone)。錄約 3 分鐘自己的聲音存成分身,之後打字就能生出你的口白。
- 怎麼用:錄音 → 上傳樣本建分身 → 在 Text to Speech 選自己的聲音、貼稿生成。我這集的樣本是 6 段、共約 200 秒。
- 花多少:網頁版 1 字約 1 credit,新帳號送 10,000;這支片 6 句口白只用 468 credits。
- 最大的雷:樣本只放同一種語氣;語言要手動選 Chinese (Mandarin),繁體稿會被判成 Cantonese。
- 對嘴要先知道:讓照片開口目前只能在我自己的電腦跑(要本機 PowerShell),雲端環境連不到,下面會誠實寫。
✍️ 真人實測宣告
本文根據作者實際錄音、建分身、生成口白與對嘴的操作及帳務紀錄撰寫,數據皆為真實紀錄。
📑 快速導覽目錄
- 🎙️ 為什麼我要複製自己的聲音
- 🎯 先講結論:三個動作就夠
- 🎧 盲測揭曉:哪一段是真人
- 🎤 Step 1:錄一段乾淨的聲音
- 🧬 Step 2:上傳樣本,建出聲音分身
- ⌨️ Step 3:打字生出口白
- 👄 Step 4:讓照片開口(進階,目前只能本機跑)
- 💰 這支片花了多少
- ⚠️ 踩雷筆記:做之前先知道的 7 件事
- ❓ 常見問題 FAQ
- ⏱️ 一分鐘版:沒時間看全文?
- 💡 結語
🎙️ 為什麼我要複製自己的聲音
我常做 Reels,每一支都需要口白。自己錄的問題是:念錯要重來、環境稍微吵就不能用、錄完還要剪掉換氣聲。更麻煩的是,改一個字就得整段重錄。
之前我用過別的聲線再轉成自己的音色,流程很長。後來改用 MiniMax 直接建自己的分身,才發現產線可以縮成:寫稿,貼上,按生成。改字只要重按一次。
這個做法適合你,如果你也有這些需求:
- 常做影片,需要穩定的口白,但不想每次開麥克風
- 聲音想有「自己的感覺」,不要罐頭配音
- 想把靜態圖變成會講話的角色
先講一個前提:只複製你自己的聲音。MiniMax 上傳樣本時會要你勾選「我擁有這段聲音的權利與授權」,這不是形式,別拿別人的聲音來建。
🎯 先講結論:三個動作就夠
- 錄:用手機語音備忘錄,同一種語氣錄約 3 分鐘(10 到 300 秒都收)
- 建:到 MiniMax 的 Voice Clone 上傳樣本,存成分身
- 生:到 Text to Speech 選自己的聲音,貼稿,語言手動選 Chinese (Mandarin),按生成
第 4 步「照片開口」是加分項,不做也完全不影響前三步。
🎧 盲測揭曉:哪一段是真人
回到開頭那兩段音檔:聲音 A 是我本人原音,聲音 B 是 MiniMax 用我的分身生成的。
兩段念的是同一句話:「以前我整理資料夾,要一個一個檔案改名、搬移,弄到半夜都還沒弄完。」你猜對了嗎?
這個盲測是我決定把口白交給分身的理由。接下來是怎麼做出來的。
🎤 Step 1:錄一段乾淨的聲音
分身像不像,八成取決於樣本。我的錄法:
- 工具:手機內建的語音備忘錄就夠
- 環境:安靜的房間,嘴巴離手機約 15 公分
- 每段前後留 1 秒靜音:後面剪接、對嘴都比較好處理
- 念錯整段重錄,不要在檔案裡硬剪
- 同一天、同一個位置錄完:不同天的音量、房間回音會有差,分身會被平均掉
- 全部用同一種語氣:我這次用的是「活潑」那一組,共 6 段(檔名 lively_1 到 lively_6),加起來約 200 秒
講稿我也是先寫好再念,這樣每段的語氣與速度比較一致。如果你想要我那份錄音講稿的範本,留言「工具」,我私訊給你。
🧬 Step 2:上傳樣本,建出聲音分身
- 開 minimax.io/audio,左側選 Voice Clone(也就是 Instant Clone)。旁邊的 Voice Design 是用文字描述「造」一個聲音,不是這個
- 點 Add or drop a file,把樣本一次丟進去。下面的 Uploaded Samples 會顯示 6/10
- Advanced Settings 的兩個開關(Remove Background Noise、Enable Accent Optimization)我都關著。前者我的錄音不需要;後者我擔心會把台灣腔修掉,沒有拿來驗證,所以不碰
- 下方有試聽欄與授權勾選,確認聲音是自己的再勾,然後存檔,替分身取一個好認的名字
樣本的硬限制要先知道:
- 總長度 10 到 300 秒
- 每個檔案 20MB 以下
- 最多 10 個檔
我之前一次丟了 7 段、總共 360 秒,直接報錯。這集用的 6 段約 200 秒,順利過關。
還有一個我花最多時間才搞懂的點:不要把不同語氣混在一個分身裡。我先前把「冷靜」和「聊天」兩種語氣的檔案放在一起,結果兩邊都被平均掉,兩種都不像。想要兩種語氣,就各建一個分身(免費帳號有 3 個 voice slot)。
⌨️ Step 3:打字生出口白
- 左側選 Text to Speech
- Model 選 speech-2.8-hd
- 右側 Voice 選你剛存的分身。這裡一定要確認,預設會是別的內建聲音
- 語言手動選 Chinese (Mandarin)(原因在下面雷區)
- 貼上稿子,按 Generate
我這個系列的設定與寫稿習慣:
| 項目 | 我的設定 | 為什麼 |
|---|---|---|
| Speed | 1.15(本系列) | 我的分身原本就偏快,剛好貼近我平常講話節奏;每個人的分身不同,建議自己試 |
| Pitch | 0 | 動了就聽起來不像同一個人 |
| Voice Modifier | 不碰 | 會改音色,在免費額度還會扣次數 |
| 停頓 | <#0.3#> 只放段落之間 | 句與句之間標點本身就會停,再加標記會停兩次,變得很拖 |
| 第一句開頭 | 加一個「欸,」 | 防止第一個字音量太小被吃掉 |
生出來之後聽一遍,念錯的字或語氣怪的句子,改稿重生成即可,不用重錄。
👄 Step 4:讓照片開口(進階,目前只能本機跑)
先講清楚:這一步目前只能在我自己的電腦上跑。對嘴用的是 LatentSync(透過 Replicate 執行),我試過從雲端環境和 Cowork 連過去,都連不到(會被擋),所以得在本機開 PowerShell 執行。如果你只想要分身口白,前三步就完整了,可以直接跳到費用。
我的做法是這樣:
- 先準備「母帶」:把角色圖用 Fish Audio 的 Creatify Aurora 生成一段約 7 秒的短片,再「正放加倒放」接長到比口白還久。母帶只做一次,角色不換就一直沿用。
- 送對嘴:在本機 PowerShell 執行(指令與路徑換成你自己的):
python latentsync_replicate.py <母帶.mp4> <口白.wav> - 送去對嘴的音檔,開頭要留至少 0.5 秒空白,不然第一個字的嘴型會糊掉
- 出片後抽兩個畫面比對,確認嘴巴真的有在動,再往下剪
這集 67 秒的口白,LatentSync 跑了 281 秒,費用 US$0.281。
那個 latentsync_replicate.py 是我自己寫的小腳本,需要 Replicate 帳號與 API token。想要的話留言「工具」,我私訊給你。
💰 這支片花了多少
| 項目 | 實際花費 | 備註 |
|---|---|---|
| 建分身 | 0 | 網頁版免費,佔 1 個 voice slot |
| 6 句口白 | 468 credits | 網頁版約 1 字 1 credit;新帳號送 10,000 |
| 對嘴(LatentSync) | US$0.281 | 67 秒口白,GPU 約 281 秒 |
以我這集 6 句口白用掉 468 credits 來算,免費的 10,000 credits 可以做不少支。用完想續用,付費方案 Starter 是 US$5 一個月、10 萬 credits(月底到期)。費用以 MiniMax 官網當下為準,價格可能調整。
⚠️ 踩雷筆記:做之前先知道的 7 件事
- 繁體稿會被判成 Cantonese:語言欄位自動偵測會誤判,一定要手動改成 Chinese (Mandarin)
- Voice 欄位預設不是你的分身:每次生成前先看右側選的是誰
- 樣本總長超過 300 秒會報錯:不是檔案數的問題,是總長
- 語氣不要混:calm 和 chat 放在一起,兩邊都會被平均掉
- Pitch 別亂調:我試過調高,聽起來完全不像同一個人
- 停頓標記別句句加:標點本身就會停,標記只放段落之間
- 「Claude」這類英文字詞發音不穩:我目前選擇接受,要修的話可以試著改寫成中文發音字,我還沒驗證過效果
❓ 常見問題 FAQ
Q1:一定要錄 3 分鐘嗎?
MiniMax 的頁面寫最短 10 秒就能複製,所以不是必須。我這次錄約 200 秒,沒有拿更短的樣本做比較,所以不確定短樣本會差多少。想省事可以先用短的試,不滿意再補錄。
Q2:複製別人的聲音可以嗎?
不行,也不建議。上傳時要勾選你擁有該聲音的權利,這篇所有做法都是只針對自己的聲音。
Q3:我的聲音會被別人拿去用嗎?
分身是存在你自己帳號的 voice slot 裡。至於 MiniMax 如何處理上傳的聲音樣本,我沒有深入研究過服務條款,如果你在意,建議上傳前先讀官方的條款與隱私說明。
Q4:不做對嘴可以嗎?
可以。前三步已經能完整產出口白,拿去配任何影片都行,對嘴只是讓角色講話更有畫面。
Q5:一定要用 speech-2.8-hd 嗎?
我只用過這一個,聽起來最像我,所以沒有拿其他模型比較。
⏱️ 一分鐘版:沒時間看全文?
這支 Reel 把三個章節各演一次:① 錄一段聲音 ② 打字出口白 ③ 照片開口。
⏱️ 本系列「一分鐘教你一個 AI 工具技巧」
- 前導集:Claude Chat 跟 Cowork 合併了
- 第 1 集:IG 貼文圖字體一致性
- 第 2 集:Reels 加動畫實測:Claude 六輪改稿,全用講的
- 第 3 集:Claude Code 必裝 3 件
- 第 4 集:複製自己的聲音(本篇)
- 第 5 集:一支 Reel 背後用了 5 個 AI 工具(籌備中)
💡 結語:聲音錄一次,之後只剩寫稿
這條產線讓我最有感的地方是:口白從「一件要排時間的事」變成「寫稿的延伸」。念錯不用重來,改一個字只要重按一次生成。
如果你只做一件事,就做前三步:錄約 3 分鐘同一種語氣的聲音,建分身,語言記得手動選 Chinese (Mandarin)。想要錄音講稿範本、對嘴腳本,留言「工具」,我私訊給你,也可以直接到 AI 工作流入口頁 看。
下一集我要拆解:一支 Reel 背後到底串了哪 5 個 AI 工具,敬請期待。
👉 要私訊拿工具:IG 私訊 @pinkjhs.life