文字生成视频
T2V-A14B 将文字描述转换成视频,支持 480P 和 720P 输出。
开放的视频模型
了解 Wan 2.2 开放模型系列,让文字场景和静态图片成为流动的故事。
Wan3.video 创作工作台目前提供 W3.0 和 W3.0 Pro。本页为模型介绍。

Wan 2.2
根据输入素材和使用方式选择模型。系列中的不同模型各有适用场景和运行要求。
T2V-A14B 将文字描述转换成视频,支持 480P 和 720P 输出。
I2V-A14B 从图片开始生成。较小的 TI2V-5B 则在同一模型中支持文字和图片输入。
官方提供模型权重和推理代码,并支持 ComfyUI 与 Diffusers 集成,方便构建自定义工作流。
用文字描述场景,或在模型支持时准备参考图片。先想清楚哪些元素需要运动,哪些细节需要保持一致。
交代主体、动作、环境、光线和镜头运动。先完成一个清晰的画面,再尝试更复杂的叙事。
检查运动、构图和主体一致性。每次调整一项描述,便于判断哪些改动改善了结果。
目前不可以。创作按钮会打开提供 W3.0 和 W3.0 Pro 的工作台。如需使用 Wan 2.2 本身,请查看下方官方模型资源。
官方仓库以 Apache 2.0 许可证发布代码和模型权重。使用前请查看所选模型的许可证和运行要求。
具体要求取决于模型。官方 TI2V-5B 示例可通过卸载配置在 24 GB 显存的 GPU 上运行;较大的 A14B 模型需要更多资源。
不会。系列中另有用于音频驱动视频的 S2V 模型,基础文生视频和图生视频模型不能直接视为自带配乐生成功能。
模型资料来源:官方文档。具体选项因模型和服务而异。
准备好在线创作了吗?打开 Wan 3.0 工作台,选择设置,开始制作第一个镜头。