高动态音画视频

生成「会说话、有动作」的人物视频:上传人物图片、声线音频和台词,AI让人物按音频语速说话,同时根据描述做出动作表情。动作表情比数字人更丰富。

操作步骤

1
上传声线和台词

上传声线音频和台词

在「上传声线」区域上传人物声线音频(WAV),生成视频的语速与声线相关。在「上传台词」区域输入台词,不宜过长。

2
写动作描述

写动作描述并设置尺寸

在动作描述文本框描述人物动作表情(中文,简单明确)。设置宽度和高度,宽高比与上传图片一致,分辨率不超过720×1280或1280×720。帧数121不要改。

3
上传人物图片

上传人物图片并运行

在加载图像节点上传人物图片(正面、清晰、单人),点击运行。第一次生成较慢,需加载模型。

4
预览结果

预览结果

生成完成后鼠标移入预览区自动播放。人物根据音频说话并做出自然的表情和动作。

注意:建议分辨率不超过720×1280(竖屏)或1280×720(横屏),过高容易卡死。帧数保持121,千万不要改。

关键参数

声线音频
人物说话声线参考(WAV),清晰人声1-10秒
台词
人物要说的内容,简短,与音频时长匹配
动作描述
人物动作和表情,中文,简单明确
宽/高
不超过720×1280 / 1280×720
帧数
保持121,不要改
人物图片
正面、五官清晰、单人

使用技巧

图片要求

正面、五官清晰、单人。复杂背景或多人容易出错。

声线选择

清晰无背景噪音的人声,决定语速和音色。

台词简短

太长会被截断,先短台词测试。

动作简单

「微笑看镜头」「微微点头」「挥手」即可,避免复杂动作。

先低后高

先用420×820测试,满意后再提高分辨率。

与数字人区别

数字人适合纯口播;本工作流动作表情更丰富,但设置更复杂。

动作描述示例

女人保持不动,热情的看向镜头,微微挥手。

常见问题

任务卡住不动?
超过半小时且GPU 100%时,点X结束,降低分辨率重试。
动作不自然?
动作描述要简单;换更清晰的图片;多生成几次。
台词被截断?
缩短台词或使用更短的声线音频。
第一次为什么特别慢?
首次需加载模型,后续会快一些,不要中途关闭。

会说话有动作的人物视频

图片+声线+台词,生成高动态音画视频

立即购买
客服微信

扫码添加客服微信