00:00 / 00:00

Persona

口型同步

一支麥克風就能驅動 Live2D 模型的嘴和 VRM 虛擬形象 的母音口型。它不依賴臉部追蹤:沒有攝影機或手機時照樣能用,有臉部追蹤時則和它融合在一起

設定位於 追蹤攝影機追蹤下方的口型同步區塊。它是應用程式層級的設定,不隨場景切換,Web 控制台追蹤頁面改的也是同一份。聲音只在這台電腦上處理:不會從喇叭播放,也不會透過 外掛 API 傳送——外掛讀得到的是音量和母音讀數,而不是聲音本身

設定

  1. 口型同步區塊開啟啟用口型同步,它預設關閉。macOS 第一次會詢問麥克風權限
  2. 麥克風裡選預設麥克風,或者一支特定的輸入裝置
  3. 對著麥克風說話,看輸入位準和 A、I、U、E、O 五個母音指示條是否跟著動,需要時再調整 位準
  4. 每個形象自己的追蹤區塊裡,麥克風口型同步 預設是一律,所以總開關一開啟,場景裡的形象就開始對口型

麥克風

預設麥克風跟隨系統的預設輸入裝置,也可以指定一支麥克風。清單裡是執行 Persona 的那台電腦上的輸入裝置——在 Web 控制台裡也一樣,不會列出瀏覽器所在裝置上的麥克風。已安裝的虛擬音訊裝置會和一般麥克風一樣出現在清單裡。這一列下方顯示實際正在擷取的裝置名稱

選取的麥克風找不到時,Persona 不會悄悄改用另一支:清單顯示無法使用的麥克風,狀態變為無法使用,直到你換一支或者點重試

Persona 不會把麥克風的聲音播放給你聽(沒有監聽功能),也不會直接擷取電腦自己播放出來的聲音

位準

控制項範圍預設值作用
輸入增益0 – 30 dB0 dB提升音量偏小的麥克風,在雜訊閘之前生效。提升過多會讓嘴一直大張
雜訊閘−60 – 0 dB−45 dB忽略低於此位準的聲音
平滑0 – 300 ms80 ms平滑嘴部開合與母音變化。數值越高,延遲越大

雜訊閘比較的是加過增益之後的位準。高於雜訊閘的那一段——從雜訊閘一直到滿刻度——對應嘴從閉合到全開,所以嘴總是張著時,調低輸入增益或調高雜訊閘;說話時嘴幾乎不動,就反過來調。三項變更都立即作用於正在進行的分析;換麥克風或者開啟口型同步則會重新開始擷取

狀態與指示條

啟用口型同步旁邊顯示目前狀態:

狀態含義
已關閉口型同步沒有開啟
啟動中…正在開啟麥克風、載入音訊分析器
正在聆聽正在擷取並分析
無法使用擷取失敗,下方會顯示原因和重試按鈕

口型同步開啟時,設定下方顯示輸入位準和 A、I、U、E、O 五個母音指示條。指示條是相似度權重而不是機率:含糊的發音可能讓兩個同時升起,不像任何母音的聲音會讓它們回落,而嘴仍依音量張開

擷取會在三種情況下停下並顯示無法使用:麥克風權限遭拒(先在系統設定裡允許 Persona 使用麥克風)、選取的麥克風不存在或被拔除,或者音訊分析器無法啟動。重試會用同一支麥克風重新開始擷取

校正聲音

麥克風正在擷取時,聲音設定檔一列顯示這支麥克風的情況:有自己的校正就顯示已針對〈麥克風〉校正,否則顯示預設設定檔。狀態為正在聆聽時,校正聲音…才能點

對話框列出 A、I、U、E、O 和背景噪音六項,每項都附有發音提示:

  1. 用平時說話的音量、和麥克風平時的距離,點一項的錄製,把這個音平穩地持續兩秒;背景噪音那一項則保持安靜、正常呼吸
  2. 錄好的一項會打勾,按鈕變成重試,可以單獨重錄。母音必須高於雜訊閘才算數,背景噪音沒有音量要求。沒錄好時,對話框會提示「聲音太小。請以高於噪音閘門檻的音量發聲後重試。」或「擷取的音訊不足。請保持發聲平穩後重試。」,並保留上一次成功擷取的校正資料
  3. 六項都錄好後點預覽設定檔,草稿立即生效。依序發 A、I、U、E、O,對應的指示條應當最高,場景裡形象的嘴也會跟著變。哪個音被混淆就重錄它,再預覽一次
  4. 儲存設定檔儲存。取消或關閉對話框會捨棄草稿,還原之前儲存的設定檔或內建設定檔

這支麥克風已有校正時,對話框會載入既有的校正資料,只重錄一個母音即可,不必六項全部重來。關閉口型同步、切換麥克風、擷取出錯或點重試,都會捨棄尚未儲存的校正資料

設定檔依實體麥克風儲存,每支一份,開始擷取時自動載入所選麥克風的那一份。重設設定檔只在目前麥克風有校正時出現,它刪除這支麥克風的校正、回到內建設定檔,其他麥克風的設定檔不受影響。選預設麥克風時,Persona 會盡量找出它實際對應哪一支麥克風;找不出來時,請先選一支特定的麥克風再校正

沒有校正時使用內建的起始設定檔,也就是那一列顯示的預設設定檔。這套設定檔不一定適合你的聲音和麥克風。如果母音辨識不準確,請用自己的聲音重新校正。不支援匯入 MotionSync 設定檔

麥克風口型同步

每個形象可以各自決定要不要跟著麥克風動。選取圖層後,它詳細資訊裡的追蹤區塊有一項麥克風口型同步,使用在追蹤中設定的麥克風:

選項作用
關閉這個形象不受麥克風影響
一律 · 預設一律跟隨麥克風;有即時臉部追蹤時,兩者依音量融合
臉部追蹤無法使用時有即時人臉時嘴巴完全交給臉部追蹤,沒有時才用麥克風——包括中途失去人臉、保持最後姿態的那段時間

一律遇上即時臉部追蹤時,Persona 依平滑後的音量在兩者之間融合:安靜時嘴完全保留追蹤到的動作,無聲的哈欠、下巴動作和唇形都在;一開口,麥克風的母音就逐漸接手。沒有即時人臉時,嘴完全交給麥克風,追蹤保持住的最後姿態不會混進來

新加入的形象和舊場景裡的形象都預設為一律,但啟用口型同步預設關閉,所以開啟總開關之前什麼都不會動。這個模式屬於場景裡的這一個實例,隨場景儲存:同一個模型的兩份複本可以用不同的模式,參數繫結 則仍屬於模型本身

驅動模型

Live2D

不需要新的附屬檔案。麥克風的數值疊加在常規的嘴部輸入上——MouthOpenMouthSmileJawOpen,以及 ARKitJawOpenARKitMouthCloseARKitMouthFunnelARKitMouthPucker——所以模型原有的嘴部繫結照常運作。張嘴程度在母音口型和音量之間連續融合,遇到子音時口型不會突然切換

模型在 .model3.json 裡宣告的 LipSync 參數組,也就是 模型資訊口型同步一列列出的那些參數,只要沒有被哪條繫結驅動,就會直接收到音量——所以嘴部參數名稱不標準的模型不繫結也能動。模型有逐個母音的口型參數時,在參數裡把 VoiceAVoiceO 綁上去

動作附帶的音訊或透過 外掛 API 播放的語音 播放期間,嘴由它們驅動,麥克風讓位

VRM

A、I、U、E、O 分別驅動 aaihoueeoh 這幾個 表情,權重是音量乘以該母音的比重。一個母音預設都沒有、但有 ARKit jawOpen 表情的模型,改為依音量張開下巴。嘴形好不好看,取決於模型自己的表情做得如何

和即時臉部追蹤融合時,母音預設與相衝突的 ARKit 嘴部表情依音量交接。麥克風寫入的權重每個影格結束時都會還原,不會殘留在追蹤保持住的姿態裡

語音輸入

參數繫結 編輯器的嘴巴群組裡還有 12 個語音輸入,Live2D 和 VRM 的繫結都能用:

輸入編輯器裡的名稱範圍含義
VoiceVolume語音音量0 – 1平滑後的音量包絡
VoiceAVoiceIVoiceUVoiceEVoiceO語音 A … 語音 O0 – 1各母音的強度,已乘以音量並平滑
VoiceSilence語音靜音0 – 11 減去音量,安靜時為 1
VoiceFrequency語音口型0 – 1母音投射到常規嘴型軸上的位置,0.5 為中性;它不是音高
VoiceVolumePlusMouthOpen語音 + 嘴巴開閉0 – 2音量加上臉部追蹤的張嘴程度
VoiceFrequencyPlusMouthSmile語音 + 嘴巴變形0 – 1臉部追蹤的嘴型,加上聲音帶來的正負偏移
VoiceMouthOpen語音嘴巴開閉0 – 1依母音加權、乘以音量的張嘴投影
VoiceMouthSpread語音嘴巴橫向伸展−1 – 1依母音加權、乘以音量、有正負的嘴角伸展投影

VoiceVolumePlusMouthOpenVoiceFrequencyPlusMouthSmile 這兩個組合輸入相加後可能超出上表的範圍,由繫結自己的範圍截斷。沒有即時人臉時,它們只取聲音那一半,失去人臉後保持住的姿態不會加進來。麥克風沒有作用於這個形象時(口型同步關閉、模式為關閉,或臉部追蹤無法使用時正把嘴留給即時人臉),它們只剩臉部追蹤那一半,所以基於組合輸入的繫結照樣跟著臉部追蹤走

匯入

.vtube.json 裡的這些輸入名稱不區分大小寫

Persona 用自己的方式分析聲音,同一段聲音在這裡得到的音量和母音辨識,不保證與 VTube Studio 一致

自動化

自動化麥克風音量觸發條件共用這裡的麥克風、輸入增益雜訊閘平滑。它在啟用口型同步關閉時也能運作,只是不會動任何形象的嘴

自動化的 播放音訊 操作也能用檔案驅動嘴型:把它的驅動口型同步設成某個虛擬形象,Live2D 或 VRM 都可以,檔案播放期間這個虛擬形象的嘴就跟著它動,麥克風讓位。分析使用內建的聲音設定檔,而不是麥克風的校正資料,讀取的是調整音量與淡入淡出之前的聲音,也不會開啟麥克風。多個檔案同時驅動同一個虛擬形象時,以最後開始播放的為準;都停下後,麥克風與臉部追蹤重新接手

最後更新於 2026年9月19日

Tech otakus destroy the world