
在「上传声线」区域上传人物声线音频(WAV),生成视频的语速与声线相关。在「上传台词」区域输入台词,不宜过长。

在动作描述文本框描述人物动作表情(中文,简单明确)。设置宽度和高度,宽高比与上传图片一致,分辨率不超过720×1280或1280×720。帧数121不要改。

在加载图像节点上传人物图片(正面、清晰、单人),点击运行。第一次生成较慢,需加载模型。

生成完成后鼠标移入预览区自动播放。人物根据音频说话并做出自然的表情和动作。
正面、五官清晰、单人。复杂背景或多人容易出错。
清晰无背景噪音的人声,决定语速和音色。
太长会被截断,先短台词测试。
「微笑看镜头」「微微点头」「挥手」即可,避免复杂动作。
先用420×820测试,满意后再提高分辨率。
数字人适合纯口播;本工作流动作表情更丰富,但设置更复杂。

扫码添加客服微信