🧩 它凭什么在盲测榜上排第一
HappyHorse 1.0 是阿里巴巴 ATH 创新事业部研发的 AI 视频生成模型,采用 150 亿参数、40 层单流自注意力 Transformer 架构,原生支持音视频联合生成,支持英语、普通话、粤语、日语、韩语、德语和法语七种语言的唇形同步。2026 年 4 月初,它以匿名形式亮相 Artificial Analysis Video Arena 榜单,在文本生成视频和图像生成视频两个核心赛道上 Elo 得分排名第一。
它最核心的卖点,是把视频和音频的生成彻底合并进了同一个流程。大多数开源视频模型的工作方式是:先生成一段没有声音的视频,再找另一个模型配音,再找另一个工具做口型对齐,几道工序下来,时间和误差都在叠加。而 HappyHorse 1.0 用一个统一的 Transformer 同时处理视频和音频,一次前向推理直接输出带声音的成片,口型、脚步声、环境音全部在同一个过程里生成,不需要任何后期拼接。
happyhorse-1-0 这个 Agent Skill 做的事情,是把这套能力封装成 Claude Code、Cursor 这类工具能直接调用的形式。你不需要自己去拼 API 请求体、处理任务轮询、下载视频文件。skill 里写好了路由逻辑和参数 schema,Agent 读完之后就能替你完成从 prompt 组装到视频落盘的全流程。
它覆盖四种生成模式:
- 文生视频(T2V)——给一段 prompt,直接出片。最长 15 秒,支持 720P 和 1080P 两档分辨率,画幅覆盖 16:9、9:16、1:1、4:3、3:4。
- 图生视频(I2V)——给一张首帧图加 prompt,让静态画面动起来。适合产品展示和照片动画化。
- 参考生视频(R2V)——用最多 9 张参考图来保持角色和物体的视觉一致性,适合多镜头叙事场景。
- 视频编辑(Edit)——用自然语言指令修改已有视频的背景、光照或风格。
速度方面,模型采用 DMD-2 蒸馏技术,把去噪步数从通常的 25 到 50 步压缩到了 8 步。在单张 H100 上,生成一段 1080p 视频只需要大约 38 秒,256p 的预览版本则在 2 秒左右就能出来。
📦 三条安装路线,按你的工具选
路线一:Claude Code / Codex / Cursor Skill(最省事)
happyhorse-1-0 的 skill 由 agentspace-so 和 runcomfy 维护,发布在 RunComfy Agent Skills 仓库中。在项目根目录执行:
npx skills add https://github.com/agentspace-so/runcomfy-agent-skills --skill happyhorse-1-0
或者全局安装:
npx skills add agentspace-so/runcomfy-skills --skill happyhorse-1-0 -g
安装之前,确保本机已经装好了 RunComfy CLI 并完成登录:
npm i -g @runcomfy/cli
runcomfy login
runcomfy login 会打开浏览器设备码流程,按提示授权即可。如果在 CI 或容器环境里跑,改用环境变量 RUNCOMFY_TOKEN 替代登录步骤。
路线二:MCP Server(适合 Cursor / VS Code / Windsurf)
如果你用的是 Cursor、VS Code、Windsurf 或 Roo Code,可以通过 MCP 协议接入。RunAPI 提供了专门针对 HappyHorse 模型线的 MCP server,覆盖 3 个端点、4 个模型变体。在 Claude Code 中执行:
claude mcp add happyhorse -s user -- npx -y @runapi.ai/happyhorse-mcp
其他 MCP 客户端用同样的 stdio 命令接入:
{
"mcpServers": {
"happyhorse": {
"command": "npx",
"args": ["-y", "@runapi.ai/happyhorse-mcp"],
"env": { "RUNAPI_API_KEY": "${RUNAPI_API_KEY}" }
}
}
}
check_pricing 工具不需要密钥就能查价格。创建任务和查询状态需要先在 runapi.ai 注册并获取 API key。
这个 MCP server 暴露了五个工具:text_to_video、image_to_video、edit_video、get_task 和 check_pricing。
路线三:dLazy MCP(一站式覆盖四种模式)
dLazy 的 happyhorse-1.0 模型封装把 T2V、I2V、R2V 和视频编辑整合成一个入口,根据 generation_mode 参数自动路由到对应子模型。把 dLazy 注册成 MCP server 后,工具会自动出现在客户端的工具列表里——Claude Code 中名字是 mcp__dlazy__happyhorse-1.0,OpenClaw 等通用客户端按裸 happyhorse-1.0 调用。
dLazy 支持异步任务和批量生成:默认轮询直到完成,加 --no-wait 可立即返回 generateId,加 --batch <n> 可以并行扇出多个生成任务。
🛠️ 装好之后怎么用
happyhorse-1-0 的触发词包括 happyhorse、happy horse、happyhorse 1.0、happyhorse video,以及任何明确要求用这个模型生成视频的表述。在 Claude Code 里你可以直接说:
用 happyhorse-1-0 生成一段 10 秒的视频:产品瓶身置于大理石台面,镜头从左前方缓慢环绕到正上方,光线柔和,16:9 画幅。
Agent 会把你的需求映射到对应的参数,通过 RunComfy CLI 提交任务。如果你想直接跑命令,默认配置(16:9、1080P、5 秒)的写法是:
runcomfy run happyhorse/happyhorse-1-0/text-to-video \
--input '{"prompt": "你的视频描述"}' \
--output-dir /absolute/path
竖版短视频(9:16、8 秒、无水印)的写法:
runcomfy run happyhorse/happyhorse-1-0/text-to-video \
--input '{
"prompt": "你的视频描述",
"aspect_ratio": "9:16",
"duration": 8,
"watermark": false
}' \
--output-dir /absolute/path
主要应用场景:
- 带对白的产品视频。HappyHorse 1.0 的原生音频能力让它特别适合需要口播或环境音的产品展示——你不需要后期配音,生成的视频直接带同步声音。
- 多语言广告和短剧。七种语言的唇形同步是联合训练出来的,不是后期贴上去的。做多语言版本时不需要为每种语言单独对口型。
- 多镜头品牌故事。skill 内置了基于锚点的多镜头一致性提示结构,同一角色和服装在多个镜头之间保持视觉一致。
- 社交媒体短视频。9:16 竖版输出,配合 Fast 模式快速迭代,适合高频出片的运营场景。
💡 几个让出片更稳的技巧
- 写多镜头 prompt 时用锚点描述法。skill 内置了多镜头角色一致性的提示结构。不要写“然后镜头切到...”,而是为每个镜头设定一个明确的视觉锚点——主体的位置、服装的颜色、环境的特征。模型会根据这些锚点在镜头之间保持连续性。
- 对白放在引号里。HappyHorse 1.0 原生支持音视频联合生成。如果你希望模型生成特定的对白,把台词用双引号括起来能显著提升语音清晰度和口型同步质量。
- 开发阶段用 720P 快速迭代。720P 的生成成本更低、速度更快(H100 上 256p 预览仅需 2 秒)。你可以用它快速试 prompt 和画幅,方向确认后再切到 1080P 出最终版本。
- 用 seed 参数做变体对比。把 seed 固定下来,只改 prompt 里的一个变量(比如镜头角度或光线方向),可以精确判断哪个变量对结果影响最大。这是做可控迭代的基础。
- 时长按秒计费,测试时别拉满。duration 支持 3 到 15 秒,默认 5 秒。测试阶段用默认值就够,确认方向后再拉长。
- 注意 watermark 参数。默认
watermark: true会带提供商水印。如果你需要无水印输出,在参数里显式设为false。
🔀 什么时候用它,什么时候换别的
HappyHorse 1.0 的强项是多镜头角色一致性、原生音画同步生成、以及盲测榜单第一的综合画质。skill 内部有一套模型路由逻辑,遇到以下场景时它会自动建议你换用更合适的模型:
- 需要精细唇形同步配合参考视频 → 路由到 Seedance 2.0 Pro。Seedance 的多模态参考能力在处理“参考视频中的说话方式”这类任务时更精准。
- 需要精细运动控制和多参考条件 → 路由到 Wan 2.7。Wan 2.7 在复杂动作编排上更灵活。
- 需要极快速的迭代(亚秒级每帧) → 路由到 LTX 2。LTX 2 的速度优势在开发阶段很有用。
- 需要对已有素材做电影感的运动编辑 → 路由到 Kling Video O1。
如果你明确说了“HappyHorse”或者“happy horse video”,skill 会无条件路由到这个模型,不会做替换建议。
🤖 适合哪些 AI 工具
happyhorse-1-0 的 skill 版本明确兼容 Claude Code、Codex CLI、Cursor 和 OpenClaw。只要你的工具支持读取项目目录中的 skill 文件或 skills.sh 格式,理论上都能用。
MCP 服务器路线的兼容面更宽,@runapi.ai/happyhorse-mcp 支持 Claude Code、Codex、Cursor、Windsurf、VS Code、Roo Code,以及任何遵循 MCP 协议的 JSON-RPC over stdio 客户端。dLazy 的 MCP 封装在 Claude Code 中显示为 mcp__dlazy__happyhorse-1.0,在 OpenClaw 等通用客户端中按裸工具名调用。
需要留意的是,happyhorse-1-0 的 skill 走的是 RunComfy 或 RunAPI 的云端 API,不是本地模型。如果你需要完全本地化的视频生成方案,HappyHorse 1.0 虽然已经开源了模型权重,但本地部署需要自行搭建推理环境。skill 和 MCP 路线更适合按需出片、不想维护 GPU 环境的用户。

◯ 评论 0