
先理解两个输入的分工
动作控制可以简化成一句话:图片告诉模型“谁来做”,参考视频告诉模型“怎么做”。
如果图片是全身正面人物,而参考视频是背面近景快速旋转,模型必须同时改变视角、补全身体和迁移动作,难度会显著增加。好的输入组合会尽量减少这些额外推断。
第一步:准备主体图片
主体应足够大、轮廓清楚,计划参与动作的肢体必须可见。需要全身舞蹈就使用全身照;只需要上半身手势,可以使用半身图。
避免多人、严重遮挡、紧贴画面边缘和复杂道具。模型需要明确知道哪个主体接收动作。
第二步:选择参考视频
理想参考视频具有这些特征:
- 单一主体和连续动作
- 固定或容易理解的镜头
- 肢体没有频繁离开画面
- 没有快速切镜
- 时长只覆盖真正需要的动作
先裁掉无关开头和结尾,可以让模型更集中地理解动作路径。
第三步:匹配构图和姿态
图片与参考视频不必完全相同,但主体大小、朝向和可见肢体越接近,迁移越容易。正面图配正面动作、半身图配半身手势,是更稳妥的起点。
参考视频中存在转身和背面动作时,单张正面图片无法提供真实背面,生成内容属于模型推断。
第四步:用提示词说明要跟随什么
提示词不需要重写整条参考视频。重点写清:
- 需要跟随的舞蹈、姿态或步伐
- 是否需要参考镜头运动
- 哪些人物外观必须保持
- 哪些背景和服装不能改变
例如:人物保持原有脸部、发型和服装,跟随参考视频的上半身节奏和手臂动作,固定中景,背景保持不变。
第五步:检查迁移质量
完整观看并检查身份、四肢、遮挡、脚步方向、节奏和镜头。动作正确但人物改变时,应减少复杂转身或换用更匹配的源图;人物稳定但动作不清时,应缩短参考片段并突出主要动作。
打开 AI 动作控制 上传两个输入。若你并不需要特定动作,只想让一张图片自然动起来,图片转视频 会更简单。
结论
动作控制不是“任意图片加任意视频”。把构图、姿态、主体大小和动作范围匹配好,能减少模型必须猜测的信息,让结果更容易检查和继续优化。