🧩 一个模型家族,四个方向
Wan 2.7 不是单一模型,而是阿里推出的一套视频生成家族。2026 年 4 月发布时,官方把它定位成“从演到导”的升级——不再只是生成一段素材,而是覆盖创作全链路。这个家族目前有四个成员:
- Wan 2.7 T2V——文生视频。给一段 prompt,出一段最长 15 秒的片子,支持同步生成音频。
- Wan 2.7 I2V——图生视频。给一张起始图加 prompt,让静态画面动起来。支持首末帧控制、片段续接和音频同步。
- Wan 2.7 R2V——参考生视频。用参考图或参考视频来保持角色/物体的视觉一致性,最长 10 秒。
- Wan 2.7 Video Edit——视频编辑。用自然语言指令修改已有视频的背景、光照、风格或主体外观,不需要整段重新生成。
四个成员共享同一套输出规格:720p 或 1080p,30fps,MP4 格式。时长方面,T2V 和 I2V 最长 15 秒,R2V 和 Video Edit 最长 10 秒。
wan-2-7 这个 Agent Skill 做的事情,就是把这套模型的调用方式封装成 Claude Code、Cursor 这类工具能直接理解和执行的形式。你不需要自己去翻 API 文档、拼请求体、处理轮询——skill 里写好了路由逻辑和参数 schema,Agent 读完之后就能替你干活。
📦 第一次怎么装
路线一:Claude Code Skill(推荐)
wan-2-7 的 skill 由 RunComfy 维护,发布在 agentspace-so/runcomfy-agent-skills 仓库中。在项目根目录执行:
npx skills add https://github.com/agentspace-so/runcomfy-agent-skills --skill wan-2-7
如果你想把 RunComfy 全套视频技能一次装好,也可以用:
npx skills add agentspace-so/runcomfy-skills --skill wan-2-7 -g
安装之前,确保本机已经装好了 RunComfy CLI 并完成了登录:
npm i -g @runcomfy/cli
runcomfy login
runcomfy login 会打开浏览器设备码流程,按提示授权即可。如果在 CI 或容器环境里跑,改用环境变量 RUNCOMFY_TOKEN 替代登录步骤。
路线二:MCP Server(适合 Cursor / Claude Desktop)
如果你用的不是 Claude Code,而是 Cursor、Claude Desktop、Continue 或其他支持 MCP 的客户端,可以通过 AetherWave Studio 的 MCP server 接入 Wan 2.7。这个 server 一个 key 覆盖了 16 个创意 AI 工具,Wan 2.7 是其中的视频生成选项之一。
在 Claude Code 中执行:
claude mcp add aetherwave \
-e AETHERWAVE_API_KEY=aw_live_your_key_here \
-- npx -y @aetherwave-studio/mcp
在 Cursor 的 Settings → MCP → Add new server 中粘贴:
{
"aetherwave": {
"command": "npx",
"args": ["-y", "@aetherwave-studio/mcp"],
"env": { "AETHERWAVE_API_KEY": "aw_live_..." }
}
}
API key 在 aetherwavestudio.com 的 Profile → Developer 标签页获取。配置完成后重启客户端,Agent 的工具列表里就会出现 Wan 2.7 的入口。
🛠️ 装好之后怎么用
wan-2-7 skill 的触发词包括 Wan、Wan 2.7、wan-ai、阿里视频,以及任何明确要求用这个模型生成或编辑视频的表述。在 Claude Code 里,你可以直接说:
用 wan-2-7 生成一段 8 秒的视频:产品放在木质桌面上,镜头从左前方缓慢推进到正上方,光线柔和。
Agent 会把你的需求映射到对应的模型端点和参数,通过 RunComfy CLI 提交任务,轮询完成后把视频文件保存到你指定的目录。
如果你想直接跑命令,底层的入口长这样:
runcomfy run wan-ai/wan-2-7/text-to-video \
--input '{"prompt": "你的视频描述", "resolution": "1080p", "duration": 10}' \
--output-dir /absolute/path
音频驱动唇形同步是 wan-2-7 区别于多数视频模型的一项能力。你给它一张人物肖像图加一段音频文件,它会生成口型同步的视频。对应的命令是:
runcomfy run wan-ai/wan-2-7/text-to-video \
--input '{
"prompt": "Medium close-up of the spokesperson, warm key light, locked tripod, slight breathing motion.",
"audio_url": "https://your-host.com/voiceover.mp3",
"duration": 12,
"aspect_ratio": "9:16"
}' \
--output-dir /absolute/path
音频文件支持 WAV 或 MP3 格式,时长 3 到 30 秒,大小不超过 15MB。不传 audio_url 时,模型会自动生成背景音乐。
💡 几个让它出片更稳的技巧
- 一段视频只做一件事。Wan 2.7 的 prompt 遵循一条原则:front-load the shot,one primary action per clip。不要在一条 prompt 里塞“先推进再旋转然后拉远”,模型会在动作之间失去连贯性。写“慢速推进”就只写慢速推进,写“从左到右的平移”就只写平移。用
"Slow dolly in"、"locked tripod, low angle"这类明确的镜头术语,比写“镜头动起来”有效得多。 - 短片段比长片段稳。Replicate 的官方建议是 2 到 5 秒的片段运动最连贯。10 秒以上的片段在尾部容易出现运动退化。如果你需要更长的成片,用首末帧模式生成两段 5 秒片段,再拼接,比一次生成 15 秒效果更可控。
- 音频驱动唇形同步,正面肖像成功率最高。正面、表情中性的肖像在测试中产生了清晰口型同步的概率远高于侧面角度。源脸部的朝向是影响质量的最大单一因素,比分辨率或音频比特率更重要。如果你要做数字人口播,选一张正脸朝向镜头的照片,效果会好很多。
- 善用
negative_prompt排除常见瑕疵。Wan 2.7 支持负面提示词,可以明确排除模糊面部、扭曲肢体、不需要的文字等。在生成前就设好这些过滤条件,比生成后再筛选省时间。 - 锁定 seed 做可控迭代。当你生成了一版基本满意的视频,记下它的
seed值。下次用同一个 seed 加微调后的 prompt 重新生成,可以在保持整体风格一致的前提下调整细节。不加 seed 的话,每次生成的结果都是随机的。 - 迭代时用 720p,定稿再跑 1080p。720p 的生成速度更快、成本更低,适合快速试 prompt 和参数。方向确认之后再切到 1080p 出最终版本。
🔀 什么时候用它,什么时候换别的
Wan 2.7 的强项是运动物理准确、指令跟随稳定、音频驱动唇形同步可靠。如果你需要的是“一段动作自然的短视频”,或者“一张肖像跟着音频说话”,它很难被替代。
但在几个场景里,RunComfy 目录下的其他模型可能更合适:多模态创作——同时给图片、参考视频和参考音频来做复合控制,Seedance 2.0 Pro 更擅长;极致身份保持——HappyHorse 1.0 I2V 在面部保真度上表现更突出;已有视频的精细编辑——Kling Video O1 在既有素材的镜头语言编辑上更顺手。skill 本身会在生成前做一次路由判断,如果你的需求超出了 Wan 2.7 的舒适区,它会建议你换用哪个模型。
🤖 适合哪些 AI 工具
wan-2-7 的 skill 版本明确兼容 Claude Code、Cursor 和 OpenClaw。安装时 CLI 会列出可选的 Agent 列表,按实际使用情况勾选即可。
MCP server 路线的兼容面更宽,支持 Claude Code、Claude Desktop、Cursor、Continue(VS Code / JetBrains),以及任何遵循 MCP 规范的 JSON-RPC over stdio 客户端。如果你想在 ComfyUI 里用 Wan 2.7,官方模板库已经支持,更新到 0.18.5 版本后在 Template Library → Video 里就能找到对应的工作流。
需要留意的是,wan-2-7 skill 走的是 RunComfy 的云端 API,不是本地模型。Wan 2.7 的本地运行需要 24GB 以上显存(RTX 3090 起步),14B 模型的文件大小约 28GB,5 秒 720p 的生成时间在 RTX 3090 上约 8 到 12 分钟。如果你有稳定的 GPU 环境且需要批量生成,本地运行长期成本更低;如果只是按需出片,走 skill 或 MCP 的云端路线更省事。

◯ 评论 0