Skip to main content
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
WanInfiniteTalkToVideo 节点可从音频输入生成视频序列。它使用视频扩散模型,以从一个或两个说话者提取的音频特征为条件,生成说话人视频的潜在表示。该节点可以生成新序列,或使用先前帧作为运动上下文来扩展现有序列。

输入参数

参数约束:
  • mode 设置为 "two_speakers" 时,参数 audio_encoder_output_2mask_1mask_2 变为必填项。
  • 如果提供了 audio_encoder_output_2,则必须同时提供 mask_1mask_2
  • 如果提供了 mask_1mask_2,则必须同时提供 audio_encoder_output_2
  • 如果提供了 previous_frames,则其包含的帧数必须至少等于 motion_frame_count 指定的数量。

输出参数