00:00 / 00:00

Persona

口型同步

一支麦克风就能驱动 Live2D 模型的嘴和 VRM 虚拟形象 的元音口型。它不依赖面部捕捉:没有摄像头或手机时照样能用,有面部捕捉时则和它融合在一起

设置位于 捕捉摄像头追踪下方的口型同步区块。它是应用级设置,不随场景切换,Web 控制台捕捉页改的也是同一份。声音只在这台电脑上处理:不会从扬声器播放,也不会经由 插件 API 发送——插件读得到的是音量和元音读数,而不是声音本身

配置

  1. 口型同步区块打开启用口型同步,它默认关闭。macOS 第一次会询问麦克风权限
  2. 麦克风里选默认麦克风,或者指定的输入设备
  3. 对着麦克风说话,看输入电平和 A、I、U、E、O 五个元音指示条是否跟着动,需要时再调整 电平
  4. 每个形象自己的捕捉区块里,麦克风口型同步 默认是始终,所以总开关一打开,场景里的形象就开始对口型

麦克风

默认麦克风跟随系统的默认输入设备,也可以指定一支麦克风。列表里是运行 Persona 的那台电脑上的输入设备——在 Web 控制台里也一样,不会列出浏览器所在设备上的麦克风。已安装的虚拟音频设备会和普通麦克风一样出现在列表里。这一行下方显示实际正在采集的设备名

选中的麦克风找不到时,Persona 不会自动切换到其他麦克风:列表显示不可用的麦克风,状态变为不可用,直到你换一支或者点重试

Persona 不会把麦克风的声音回放给你听(没有监听功能),也不会直接采集电脑自己播放出来的声音

电平

控制项范围默认值作用
输入增益0 – 30 dB0 dB提升音量偏小的麦克风,在噪声门之前生效。提升过多会让嘴一直大张
噪声门−60 – 0 dB−45 dB忽略低于此电平的声音
平滑0 – 300 ms80 ms平滑嘴部开合与元音变化。数值越高,延迟越大

噪声门比较的是加过增益之后的电平。高于噪声门的那一段——从噪声门一直到满刻度——对应嘴从闭合到全开,所以嘴总是张着时,调低输入增益或调高噪声门;说话时嘴几乎不动,就反过来调。三项改动都立即作用于正在进行的分析;换麦克风或者打开口型同步则会重新开始采集

状态与指示条

启用口型同步旁边显示当前状态:

状态含义
已关闭口型同步没有开启
启动中…正在打开麦克风、加载音频分析器
正在监听正在采集并分析
不可用采集失败,下方会显示原因和重试按钮

口型同步开启时,设置下方显示输入电平和 A、I、U、E、O 五个元音指示条。指示条是相似度权重而不是概率:含糊的发音可能让两个同时升起,不像任何元音的声音会让它们回落,而嘴仍按音量张开

采集会在三种情况下停下并显示不可用:麦克风权限被拒绝(先在系统设置里允许 Persona 使用麦克风)、选中的麦克风不存在或被拔出,或者音频分析器无法启动。重试会用同一支麦克风重新开始采集

校准声音

麦克风正在采集时,声音配置一行显示这支麦克风的情况:有自己的校准就显示已针对〈麦克风〉校准,否则显示默认配置。状态为正在监听时,校准声音…才能点

对话框列出 A、I、U、E、O 和背景噪声六项,每项都附有发音提示:

  1. 用平时说话的音量、和麦克风平时的距离,点一项的录制,把这个音平稳地持续两秒;背景噪声那一项则保持安静、正常呼吸
  2. 录好的一项会打勾,按钮变成重试,可以单独重录。元音必须高于噪声门才算数,背景噪声没有音量要求。没录好时,对话框会提示「声音太小。请以高于噪声门限的音量发声后重试。」或「采集的音频不足。请保持发声平稳后重试。」,并保留上一次成功采集的校准数据
  3. 六项都录好后点预览配置,草稿立即生效。依次发 A、I、U、E、O,对应的指示条应当最高,场景里形象的嘴也会跟着变。哪个音被混淆就重录它,再预览一次
  4. 保存配置保存。取消或关闭对话框会丢弃草稿,恢复之前保存的配置或内置配置

这支麦克风已有校准时,对话框会载入已有的校准数据,只重录一个元音即可,不必六项全部重来。关闭口型同步、切换麦克风、采集出错或点重试,都会丢弃尚未保存的校准数据

配置按实体麦克风保存,每支一份,开始采集时自动载入所选麦克风的那一份。重置配置只在当前麦克风有校准时出现,它删除这支麦克风的校准、回到内置配置,其他麦克风的配置不受影响。选默认麦克风时,Persona 会尽量找出它实际对应哪一支麦克风;找不出来时,请先选一支具体的麦克风再校准

没有校准时使用内置的起始配置,也就是那一行显示的默认配置。这套配置不一定适合你的声音和麦克风。如果元音识别不准确,请用自己的声音重新校准。不支持导入 MotionSync 配置

麦克风口型同步

每个形象可以各自决定要不要跟着麦克风动。选中图层后,它详情里的捕捉区块有一项麦克风口型同步,使用在捕捉中配置的麦克风:

选项作用
关闭这个形象不受麦克风影响
始终 · 默认始终跟随麦克风;有实时面部捕捉时,两者按音量融合
面部捕捉不可用时有实时人脸时嘴巴完全交给面部捕捉,没有时才用麦克风——包括中途丢失人脸、保持最后姿态的那段时间

始终遇上实时面部捕捉时,Persona 按平滑后的音量在两者之间融合:安静时嘴完全保留捕捉到的动作,无声的哈欠、下巴动作和唇形都在;一开口,麦克风的元音就逐渐接管。没有实时人脸时,嘴完全交给麦克风,捕捉保持住的最后姿态不会混进来

新添加的形象和旧场景里的形象都默认为始终,但启用口型同步默认关闭,所以打开总开关之前什么都不会动。这个模式属于场景里的这一个实例,随场景保存:同一个模型的两份拷贝可以用不同的模式,参数绑定 则仍属于模型本身

驱动模型

Live2D

不需要新的附属文件。麦克风的数值叠加在常规的嘴部输入上——MouthOpenMouthSmileJawOpen,以及 ARKitJawOpenARKitMouthCloseARKitMouthFunnelARKitMouthPucker——所以模型原有的嘴部绑定照常工作。张嘴程度在元音口型和音量之间连续融合,遇到辅音时口型不会突然切换

模型在 .model3.json 里声明的 LipSync 参数组,也就是 模型信息口型同步一行列出的那些参数,只要没有被哪条绑定驱动,就会直接收到音量——所以嘴部参数名不标准的模型不绑定也能动。模型有逐个元音的口型参数时,在参数里把 VoiceAVoiceO 绑上去

动作自带的音频或经由 插件 API 播放的语音 播放期间,嘴由它们驱动,麦克风让位

VRM

A、I、U、E、O 分别驱动 aaihoueeoh 这几个 表情,权重是音量乘以该元音的份额。一个元音预设都没有、但有 ARKit jawOpen 表情的模型,改为按音量张开下巴。口型效果取决于模型提供的表情

和实时面部捕捉融合时,元音预设与相冲突的 ARKit 嘴部表情按音量交接。麦克风写入的权重每帧结束时都会复原,不会残留在捕捉保持住的姿态里

语音输入

参数绑定 编辑器的嘴巴分组里还有 12 个语音输入,Live2D 和 VRM 的绑定都能用:

输入编辑器里的名称范围含义
VoiceVolume语音音量0 – 1平滑后的音量包络
VoiceAVoiceIVoiceUVoiceEVoiceO语音 A … 语音 O0 – 1各元音的强度,已乘以音量并平滑
VoiceSilence语音静音0 – 11 减去音量,安静时为 1
VoiceFrequency语音口型0 – 1元音投射到常规嘴型轴上的位置,0.5 为中性;它不是音高
VoiceVolumePlusMouthOpen语音 + 嘴巴开闭0 – 2音量加上面部捕捉的张嘴程度
VoiceFrequencyPlusMouthSmile语音 + 嘴巴变形0 – 1面部捕捉的嘴型,加上声音带来的正负偏移
VoiceMouthOpen语音嘴巴开闭0 – 1按元音加权、乘以音量的张嘴投影
VoiceMouthSpread语音嘴巴横向伸展−1 – 1按元音加权、乘以音量、有正负的嘴角伸展投影

VoiceVolumePlusMouthOpenVoiceFrequencyPlusMouthSmile 这两个组合输入相加后可能超出上表的范围,由绑定自己的范围截断。没有实时人脸时,它们只取声音那一半,丢失人脸后保持住的姿态不会加进来。麦克风没有作用于这个形象时(口型同步关闭、模式为关闭,或面部捕捉不可用时正把嘴留给实时人脸),它们只剩面部捕捉那一半,所以基于组合输入的绑定照样跟着面部捕捉走

导入

.vtube.json 里的这些输入名不区分大小写

Persona 用自己的方式分析声音,同一段声音在这里得到的音量和元音识别,可能与 VTube Studio 不同

自动化

自动化麦克风音量触发条件共用这里的麦克风、输入增益噪声门平滑。它在启用口型同步关闭时也能工作,只是不会动任何形象的嘴

自动化的 播放音频 操作也能用文件驱动嘴型:把它的驱动口型同步设成某个虚拟形象,Live2D 或 VRM 都行,文件播放期间这个虚拟形象的嘴就跟着它动,麦克风让位。分析使用内置的声音配置,而不是麦克风的校准数据,读取的是调整音量和淡入淡出之前的声音,也不会打开麦克风。多个文件同时驱动同一个虚拟形象时,以最后开始播放的为准;都停下后,麦克风和面部捕捉重新接管

最后更新于 2026年9月19日

Tech otakus destroy the world