🧩 它不是“一个模型”,而是一个智能路由

市面上大多数图生视频工具的做法是:给你一个模型,你对着它反复调 prompt,直到出片。image-to-video 这个 skill 走的是另一条路——它本身不生成视频,它做的事情是读懂你的意图,然后从 RunComfy 目录里挑出最合适的那个 i2v 模型来执行

目前它手里有三张牌,对应三种典型需求:

  • HappyHorse 1.0 I2V——通用动画的首选。在 Arena 排行榜上排第一,自带原生音频能力,并且对人物身份保持做得比较好。你拿一张产品图或人像图让它动起来,它不会把脸或 logo 改掉。
  • Wan 2.7——专门为唇形同步场景准备的。你给它一张人物照片加一段 audio_url,它就能让照片里的人物跟着音频说话。适合做口播视频或数字人场景。
  • Seedance 2.0 Pro——多模态输入的旗舰。你可以同时给它一张图片、一段参考视频和一段参考音频,它会综合这三种信号来生成动画。适合对画面运动有精确控制需求的场景。

skill 会自动判断你的请求该走哪个模型。你说“让这张照片里的人开口说话”,它不会去调 HappyHorse,而是直接走 Wan 2.7 的 lip-sync 路线。你说“让这个产品图动起来”,它不会去调 Seedance 的多模态管线,而是用 HappyHorse 出片。这种“意图到模型”的映射,就是这个 skill 最大的价值——省掉了你在多个模型之间试错的时间和 credits。

📦 第一次怎么装

这个 skill 属于 RunComfy agent skills 仓库的一部分,通过 skills CLI 安装:

npx skills add https://github.com/agentspace-so/runcomfy-agent-skills/tree/main/skills/image-to-video

如果你想把整个 RunComfy 技能集一次装好,也可以用:

npx skills add agentspace-so/runcomfy-skills --skill image-to-video -g

安装之前,确保本机已经装好了 runcomfy CLI 并完成了账号登录。这个 skill 本身不包含模型权重,它调用的是 runcomfy run <vendor>/<model>/image-to-video 这条命令来执行生成。如果你还没配置过 RunComfy 环境,先跑一次 runcomfy --help 确认 CLI 可用。

skill 文件会被写入你选择的 Agent 目录中。在 Claude Code 里,安装后可以直接通过 /image-to-video 触发。

🛠️ 装好之后怎么用

使用方式很直接——把图片和你的意图一起说给 Agent。它的触发词覆盖面比较广,包括“image to video”“image-to-video”“i2v”“animate image”“make this move”,以及任何明确要求把静态图变成视频的表述。

几个典型的使用方式:

  • 通用动画:“把这张产品图变成一段 5 秒的动画,镜头缓慢推进。”Agent 会走 HappyHorse 1.0,利用它的身份保持能力确保产品外观不变形。
  • 唇形同步:“让这张照片里的人说这段话。”附带一个音频文件或 URL,Agent 会识别出这是 lip-sync 需求,走 Wan 2.7 管线,把 audio_url 传给模型。
  • 多模态控制:“以这张图为首帧,参考这段视频的运动节奏,生成一段动画。”Agent 会切换到 Seedance 2.0 Pro,同时传入图像、参考视频和音频信号。

这个 skill 还内置了各个模型的文档化 prompting 模式。这意味着你不用自己去翻 RunComfy 的模型文档来搞清楚“该用什么词描述运动”,skill 会把对应的 prompt 模板和参数建议一并交给调用方,减少无效迭代。对于按次计费的 i2v 模型来说,少试一次就是省一次钱。

💡 几个让它更好用的技巧

  • 说清楚“动什么”,比说“动起来”有用得多。“让图片动起来”这种描述会让模型自己发挥,结果往往不可控。换成“镜头从左侧缓慢推进到产品正面,背景有轻微的光线变化”或者“人物头部轻微左右转动,嘴唇跟着音频动”,skill 会把你的意图准确映射到对应模型和 prompt 模板上。
  • 唇形同步场景一定要带上音频。Wan 2.7 的 lip-sync 能力需要 audio_url 参数才能工作。如果你只给了一张人脸照片说“让她说话”,Agent 没有音频信号可用,可能会回退到通用模型做一个简单的头部动画,效果差很多。
  • 利用它的身份保持能力做产品视频。HappyHorse 1.0 在保持原图主体一致性方面表现突出。如果你要为一个已经有官方产品图的商品做动态展示,用这个模型比用通用 i2v 模型更稳妥——它不会把产品的颜色、形状或 logo 改掉。
  • 需要复杂运动控制时,准备一段参考视频。Seedance 2.0 Pro 的多模态能力允许你传入一段参考视频来“示范”你想要的运动方式。比如你想让一张静态街景图产生和某段手持镜头视频一样的晃动感,把参考视频一起给它,比用文字描述“轻微手持晃动”精确得多。
  • 配合 RunComfy 目录的其他 skill 使用。这个 skill 只负责“图转视频”这一环。如果你需要先生成或编辑图片再做动画,可以先用同仓库下的图片编辑类 skill 处理完,再把结果喂给 image-to-video。整个流程都在 RunComfy 生态内完成,不用在多个平台之间倒腾文件。

🤖 适合哪些 AI 工具

image-to-video 是一个标准的 Agent Skill,本质上是一份 SKILL.md 文件,不绑定特定平台。

目前经过验证的兼容工具包括:Claude Code、Codex CLI、Cursor。安装时 CLI 会列出可选的 Agent 列表,按实际使用情况勾选即可。在 Claude Code 中,它注册为一个斜杠命令,输入 /image-to-video 即可手动调用,Agent 检测到相关意图时也会自动触发。

需要留意的是,这个 skill 依赖 RunComfy 平台和本地 CLI 环境。它不是离线工具,生成过程需要联网访问 RunComfy 的模型服务。如果你需要完全本地化的 i2v 方案(比如用 ComfyUI 跑本地 LTX-Video 模型),那属于另一条技术路线,这个 skill 不适合那个场景。