如何用一张图片和一条参考视频控制动作

Styvid 团队

2026/4/20

#动作控制#参考视频#动作迁移#图片输入#AI 视频
一张主体图片与一条参考视频连接到动作控制流程

先理解两个输入的分工

动作控制可以简化成一句话:图片告诉模型“谁来做”,参考视频告诉模型“怎么做”。

如果图片是全身正面人物,而参考视频是背面近景快速旋转,模型必须同时改变视角、补全身体和迁移动作,难度会显著增加。好的输入组合会尽量减少这些额外推断。

第一步:准备主体图片

主体应足够大、轮廓清楚,计划参与动作的肢体必须可见。需要全身舞蹈就使用全身照;只需要上半身手势,可以使用半身图。

避免多人、严重遮挡、紧贴画面边缘和复杂道具。模型需要明确知道哪个主体接收动作。

第二步:选择参考视频

理想参考视频具有这些特征:

  • 单一主体和连续动作
  • 固定或容易理解的镜头
  • 肢体没有频繁离开画面
  • 没有快速切镜
  • 时长只覆盖真正需要的动作

先裁掉无关开头和结尾,可以让模型更集中地理解动作路径。

第三步:匹配构图和姿态

图片与参考视频不必完全相同,但主体大小、朝向和可见肢体越接近,迁移越容易。正面图配正面动作、半身图配半身手势,是更稳妥的起点。

参考视频中存在转身和背面动作时,单张正面图片无法提供真实背面,生成内容属于模型推断。

第四步:用提示词说明要跟随什么

提示词不需要重写整条参考视频。重点写清:

  • 需要跟随的舞蹈、姿态或步伐
  • 是否需要参考镜头运动
  • 哪些人物外观必须保持
  • 哪些背景和服装不能改变

例如:人物保持原有脸部、发型和服装,跟随参考视频的上半身节奏和手臂动作,固定中景,背景保持不变。

第五步:检查迁移质量

完整观看并检查身份、四肢、遮挡、脚步方向、节奏和镜头。动作正确但人物改变时,应减少复杂转身或换用更匹配的源图;人物稳定但动作不清时,应缩短参考片段并突出主要动作。

打开 AI 动作控制 上传两个输入。若你并不需要特定动作,只想让一张图片自然动起来,图片转视频 会更简单。

结论

动作控制不是“任意图片加任意视频”。把构图、姿态、主体大小和动作范围匹配好,能减少模型必须猜测的信息,让结果更容易检查和继续优化。

相关工具与模型