一支麥克風就能驅動 Live2D 模型的嘴和 VRM 虛擬形象 的母音口型。它不依賴臉部追蹤:沒有攝影機或手機時照樣能用,有臉部追蹤時則和它融合在一起
設定位於 追蹤 裡攝影機追蹤下方的口型同步區塊。它是應用程式層級的設定,不隨場景切換,Web 控制台 的追蹤頁面改的也是同一份。聲音只在這台電腦上處理:不會從喇叭播放,也不會透過 外掛 API 傳送——外掛讀得到的是音量和母音讀數,而不是聲音本身
設定
- 在口型同步區塊開啟啟用口型同步,它預設關閉。macOS 第一次會詢問麥克風權限
- 在麥克風裡選預設麥克風,或者一支特定的輸入裝置
- 對著麥克風說話,看輸入位準和 A、I、U、E、O 五個母音指示條是否跟著動,需要時再調整 位準
- 每個形象自己的追蹤區塊裡,麥克風口型同步 預設是一律,所以總開關一開啟,場景裡的形象就開始對口型
麥克風
預設麥克風跟隨系統的預設輸入裝置,也可以指定一支麥克風。清單裡是執行 Persona 的那台電腦上的輸入裝置——在 Web 控制台裡也一樣,不會列出瀏覽器所在裝置上的麥克風。已安裝的虛擬音訊裝置會和一般麥克風一樣出現在清單裡。這一列下方顯示實際正在擷取的裝置名稱
選取的麥克風找不到時,Persona 不會悄悄改用另一支:清單顯示無法使用的麥克風,狀態變為無法使用,直到你換一支或者點重試
Persona 不會把麥克風的聲音播放給你聽(沒有監聽功能),也不會直接擷取電腦自己播放出來的聲音
位準
| 控制項 | 範圍 | 預設值 | 作用 |
|---|---|---|---|
| 輸入增益 | 0 – 30 dB | 0 dB | 提升音量偏小的麥克風,在雜訊閘之前生效。提升過多會讓嘴一直大張 |
| 雜訊閘 | −60 – 0 dB | −45 dB | 忽略低於此位準的聲音 |
| 平滑 | 0 – 300 ms | 80 ms | 平滑嘴部開合與母音變化。數值越高,延遲越大 |
雜訊閘比較的是加過增益之後的位準。高於雜訊閘的那一段——從雜訊閘一直到滿刻度——對應嘴從閉合到全開,所以嘴總是張著時,調低輸入增益或調高雜訊閘;說話時嘴幾乎不動,就反過來調。三項變更都立即作用於正在進行的分析;換麥克風或者開啟口型同步則會重新開始擷取
狀態與指示條
啟用口型同步旁邊顯示目前狀態:
| 狀態 | 含義 |
|---|---|
| 已關閉 | 口型同步沒有開啟 |
| 啟動中… | 正在開啟麥克風、載入音訊分析器 |
| 正在聆聽 | 正在擷取並分析 |
| 無法使用 | 擷取失敗,下方會顯示原因和重試按鈕 |
口型同步開啟時,設定下方顯示輸入位準和 A、I、U、E、O 五個母音指示條。指示條是相似度權重而不是機率:含糊的發音可能讓兩個同時升起,不像任何母音的聲音會讓它們回落,而嘴仍依音量張開
擷取會在三種情況下停下並顯示無法使用:麥克風權限遭拒(先在系統設定裡允許 Persona 使用麥克風)、選取的麥克風不存在或被拔除,或者音訊分析器無法啟動。重試會用同一支麥克風重新開始擷取
校正聲音
麥克風正在擷取時,聲音設定檔一列顯示這支麥克風的情況:有自己的校正就顯示已針對〈麥克風〉校正,否則顯示預設設定檔。狀態為正在聆聽時,校正聲音…才能點
對話框列出 A、I、U、E、O 和背景噪音六項,每項都附有發音提示:
- 用平時說話的音量、和麥克風平時的距離,點一項的錄製,把這個音平穩地持續兩秒;背景噪音那一項則保持安靜、正常呼吸
- 錄好的一項會打勾,按鈕變成重試,可以單獨重錄。母音必須高於雜訊閘才算數,背景噪音沒有音量要求。沒錄好時,對話框會提示「聲音太小。請以高於噪音閘門檻的音量發聲後重試。」或「擷取的音訊不足。請保持發聲平穩後重試。」,並保留上一次成功擷取的校正資料
- 六項都錄好後點預覽設定檔,草稿立即生效。依序發 A、I、U、E、O,對應的指示條應當最高,場景裡形象的嘴也會跟著變。哪個音被混淆就重錄它,再預覽一次
- 點儲存設定檔儲存。取消或關閉對話框會捨棄草稿,還原之前儲存的設定檔或內建設定檔
這支麥克風已有校正時,對話框會載入既有的校正資料,只重錄一個母音即可,不必六項全部重來。關閉口型同步、切換麥克風、擷取出錯或點重試,都會捨棄尚未儲存的校正資料
設定檔依實體麥克風儲存,每支一份,開始擷取時自動載入所選麥克風的那一份。重設設定檔只在目前麥克風有校正時出現,它刪除這支麥克風的校正、回到內建設定檔,其他麥克風的設定檔不受影響。選預設麥克風時,Persona 會盡量找出它實際對應哪一支麥克風;找不出來時,請先選一支特定的麥克風再校正
沒有校正時使用內建的起始設定檔,也就是那一列顯示的預設設定檔。這套設定檔不一定適合你的聲音和麥克風。如果母音辨識不準確,請用自己的聲音重新校正。不支援匯入 MotionSync 設定檔
正如對話框所說,「校正過程完全在你的電腦上進行。我們不會收集或上傳你的錄音。」校正只保留每次分析得出的 12 個 MFCC 係數,從不儲存錄音本身。設定檔存在這台電腦上 Persona 的本機設定裡,不會寫進模型的附屬檔案,也不會透過外掛 API 傳出。詳見 隱私與安全
麥克風口型同步
每個形象可以各自決定要不要跟著麥克風動。選取圖層後,它詳細資訊裡的追蹤區塊有一項麥克風口型同步,使用在追蹤中設定的麥克風:
| 選項 | 作用 |
|---|---|
| 關閉 | 這個形象不受麥克風影響 |
| 一律 · 預設 | 一律跟隨麥克風;有即時臉部追蹤時,兩者依音量融合 |
| 臉部追蹤無法使用時 | 有即時人臉時嘴巴完全交給臉部追蹤,沒有時才用麥克風——包括中途失去人臉、保持最後姿態的那段時間 |
一律遇上即時臉部追蹤時,Persona 依平滑後的音量在兩者之間融合:安靜時嘴完全保留追蹤到的動作,無聲的哈欠、下巴動作和唇形都在;一開口,麥克風的母音就逐漸接手。沒有即時人臉時,嘴完全交給麥克風,追蹤保持住的最後姿態不會混進來
新加入的形象和舊場景裡的形象都預設為一律,但啟用口型同步預設關閉,所以開啟總開關之前什麼都不會動。這個模式屬於場景裡的這一個實例,隨場景儲存:同一個模型的兩份複本可以用不同的模式,參數繫結 則仍屬於模型本身
驅動模型
Live2D
不需要新的附屬檔案。麥克風的數值疊加在常規的嘴部輸入上——MouthOpen、MouthSmile、JawOpen,以及 ARKitJawOpen、ARKitMouthClose、ARKitMouthFunnel 和 ARKitMouthPucker——所以模型原有的嘴部繫結照常運作。張嘴程度在母音口型和音量之間連續融合,遇到子音時口型不會突然切換
模型在 .model3.json 裡宣告的 LipSync 參數組,也就是 模型資訊 裡口型同步一列列出的那些參數,只要沒有被哪條繫結驅動,就會直接收到音量——所以嘴部參數名稱不標準的模型不繫結也能動。模型有逐個母音的口型參數時,在參數裡把 VoiceA…VoiceO 綁上去
動作附帶的音訊或透過 外掛 API 播放的語音 播放期間,嘴由它們驅動,麥克風讓位
VRM
A、I、U、E、O 分別驅動 aa、ih、ou、ee、oh 這幾個 表情,權重是音量乘以該母音的比重。一個母音預設都沒有、但有 ARKit jawOpen 表情的模型,改為依音量張開下巴。嘴形好不好看,取決於模型自己的表情做得如何
和即時臉部追蹤融合時,母音預設與相衝突的 ARKit 嘴部表情依音量交接。麥克風寫入的權重每個影格結束時都會還原,不會殘留在追蹤保持住的姿態裡
語音輸入
參數繫結 編輯器的嘴巴群組裡還有 12 個語音輸入,Live2D 和 VRM 的繫結都能用:
| 輸入 | 編輯器裡的名稱 | 範圍 | 含義 |
|---|---|---|---|
VoiceVolume | 語音音量 | 0 – 1 | 平滑後的音量包絡 |
VoiceA、VoiceI、VoiceU、VoiceE、VoiceO | 語音 A … 語音 O | 0 – 1 | 各母音的強度,已乘以音量並平滑 |
VoiceSilence | 語音靜音 | 0 – 1 | 1 減去音量,安靜時為 1 |
VoiceFrequency | 語音口型 | 0 – 1 | 母音投射到常規嘴型軸上的位置,0.5 為中性;它不是音高 |
VoiceVolumePlusMouthOpen | 語音 + 嘴巴開閉 | 0 – 2 | 音量加上臉部追蹤的張嘴程度 |
VoiceFrequencyPlusMouthSmile | 語音 + 嘴巴變形 | 0 – 1 | 臉部追蹤的嘴型,加上聲音帶來的正負偏移 |
VoiceMouthOpen | 語音嘴巴開閉 | 0 – 1 | 依母音加權、乘以音量的張嘴投影 |
VoiceMouthSpread | 語音嘴巴橫向伸展 | −1 – 1 | 依母音加權、乘以音量、有正負的嘴角伸展投影 |
VoiceVolumePlusMouthOpen 和 VoiceFrequencyPlusMouthSmile 這兩個組合輸入相加後可能超出上表的範圍,由繫結自己的範圍截斷。沒有即時人臉時,它們只取聲音那一半,失去人臉後保持住的姿態不會加進來。麥克風沒有作用於這個形象時(口型同步關閉、模式為關閉,或臉部追蹤無法使用時正把嘴留給即時人臉),它們只剩臉部追蹤那一半,所以基於組合輸入的繫結照樣跟著臉部追蹤走
匯入
.vtube.json 裡的這些輸入名稱不區分大小寫
Persona 用自己的方式分析聲音,同一段聲音在這裡得到的音量和母音辨識,不保證與 VTube Studio 一致
自動化
自動化 的麥克風音量觸發條件共用這裡的麥克風、輸入增益、雜訊閘和平滑。它在啟用口型同步關閉時也能運作,只是不會動任何形象的嘴
自動化的 播放音訊 操作也能用檔案驅動嘴型:把它的驅動口型同步設成某個虛擬形象,Live2D 或 VRM 都可以,檔案播放期間這個虛擬形象的嘴就跟著它動,麥克風讓位。分析使用內建的聲音設定檔,而不是麥克風的校正資料,讀取的是調整音量與淡入淡出之前的聲音,也不會開啟麥克風。多個檔案同時驅動同一個虛擬形象時,以最後開始播放的為準;都停下後,麥克風與臉部追蹤重新接手
最後更新於 2026年9月19日