从一张插画开始,到做出属于自己的VTuber模型并开始直播的完整步骤。
从接近正面的全身或上半身插画,自动生成带骨骼的3D角色。没有图片时,用文字描述角色特征也能生成。
对着麦克风说话时,应用会从声音推定元音并驱动口型。不需要动作捕捉,也不需要额外设备。
语音识别与表情切换由本机的本地AI完成。会根据说话内容自动切换表情差分。
用「挥手」这样的文字描述动作来生成短动画。直播中会根据说话内容或待机状态自动播放。
在「模型生成/设置」模式下依次完成下面5个阶段,最后切换到「直播」模式驱动角色。阶段可以随时从画面左侧的「制作阶段」列表来回切换。
启动后首页会并排显示两个模式。要制作或调整角色时进入「モデル生成/設定」(模型生成/设置),要用做好的角色直播时进入「配信」(直播)。


只需选择一张输入图片,然后点击「3D生成を開始」(开始3D生成)。推荐使用接近正面的全身或上半身插画。每生成一体消耗800点数(付费)。






选择表情模板(笑脸、生气、悲伤等)后点击「表情を生成」(生成表情),会一并自动生成脸部差分与口型同步用的口型(闭口以及各个元音)。每套消耗200点数(付费)。



一边预览实际的直播画面,一边决定角色的呈现方式。背景默认为绿幕,因此可以直接按在OBS中做色度键合成的前提来设置。


像「一边挥手一边轻轻点头致意」这样用文字指示动作,生成角色的短动画。生成的动画会在直播画面中叠加在角色上自动播放。每秒消耗85点数(付费),5秒则为425点数。



既可以保持绿幕直播、在OBS一侧合成,也可以替换为应用内的背景。随附的背景与读取自己的图片都是免费的;用AI生成背景则消耗60点数(付费)。动画会按背景分别保存。

回到首页进入「配信」(直播)模式。选好角色后直播画面就会启动。之后只要对着麦克风说话,口型同步、表情切换、动画播放就会全部自动运行。




有两种方法。使用「选项」中的 OBS联动 更简单,而且应用界面不会被拍进去。
http://127.0.0.1:58090/)3D模型生成需要几分钟到十几分钟(画面会显示进度与当前工序)。表情生成与动画生成各需几分钟左右。生成期间只需等待,完成后会有对话框提示。
用于云端生成功能的付费点数。3D模型 800pt / 表情套装 200pt / 背景 60pt / 动画每秒 85pt / 用特征生成输入图片 25pt。余额显示在画面右上,可从应用内的商店购买。直播本身(口型同步、表情切换、动画播放、输出到OBS)不消耗点数。若因系统故障导致生成失败,点数会自动返还。
不会。直播中的语音识别以及表情与动画的选择,都由本机的本地AI处理。
请确认直播状态面板中的「マイク」(麦克风)是否为 ON,以及输入设备下拉框中是否选择了正确的麦克风。macOS 还需要在系统设置中授予应用麦克风权限。
在首页选择「モデル生成/設定」(模型生成/设置)→「保存済み選択」(选择已保存),即可从带缩略图的列表中选择过去创建的角色并继续。
所示画面来自开发中版本,规格可能会有变更。