🎬 主要功能:自动选模型的“数字人视频生产线”
ai-avatar-video的独特之处不在于它调用了某个单一模型,而在于它内置了一套意图分类与模型路由机制。
当用户提出一个视频生成需求时,这个技能会先判断几个关键维度——有没有现成的音频文件?要的是写实肖像还是风格化角色?单镜头还是电影级构图?——然后从RunComfy平台上的多个音频驱动头像模型中自动选择最合适的一个,并把该模型的提示词模板和精确的runcomfy run调用命令一起交给AI执行。
目前被路由的主要模型包括:
- ByteDance OmniHuman(默认路由):音频驱动的全身数字人。输入一张肖像照片和一段音频,输出的视频中人物会自然地说话、唱歌、做手势。适用于UGC配音、虚拟主播、多语言产品演示等场景。
- HappyHorse 1.0:无需外部音频文件,脚本直接写在提示词里,模型生成视频的同时自带语音。适用于“写一段台词→直接出视频”的场景,但音频每次重新生成,不适合对特定MP3做精确唇形同步。
- Seedance v2 Pro:多模态旗舰,支持最多9张参考图、3段参考视频、3段参考音频的组合输入,带电影级运镜和光照控制。适用于广告创意等对画面品质要求高的场景。
- Wan 2-7:开源权重方案,通过
audio_url字段驱动嘴型,适用于需要更大场景自由度的项目。
核心调用流程非常简洁。安装RunComfy CLI并完成登录后,一次典型的生成调用只需要:
runcomfy run <vendor>/<model>/<endpoint> \
--input '{"prompt": "...", "audio_url": "https://...", "image_url": "https://..."}' \
--output-dir ./out
提交请求、轮询状态、下载结果,全部由CLI自动完成。
🚀 首次安装:三步完成,基于RunComfy CLI
ai-avatar-video本身不是一个独立工具,而是依赖于runcomfy CLI的一个技能。安装分三步走:
第一步:安装RunComfy CLI
npm i -g @runcomfy/cli
也可以用npx -y @runcomfy/cli --version做一次性试用,不安装到系统。
第二步:登录RunComfy账号
runcomfy login
CI或容器环境中,可以用环境变量export RUNCOMFY_TOKEN=<token>替代交互式登录。
第三步:安装ai-avatar-video技能
npx skills add agentspace-so/runcomfy-agent-skills --skill ai-avatar-video -g
加-g标志表示全局安装,技能对当前用户下所有AI编程工具可见。
🎯 主要应用场景:把文字变成“有人说话”的视频
场景一:UGC风格配音视频
拿到一段录音和一张人物照片,快速产出一条看起来像真人对着镜头说话的短视频。OmniHuman是这个场景的默认选项,支持同一张肖像配合不同语言的音频产出多语言版本。
场景二:有脚本、没有录音的视频
手里只有一段文字稿,没有现成的音频文件。HappyHorse 1.0可以直接把台词写进提示词,模型在生成视频的同时合成语音,省去单独做TTS的步骤。
场景三:产品演示与虚拟主播
用一张产品经理的肖像照片,配合产品介绍脚本,生成一段“产品经理本人讲解”的视频。相比真人反复录制,这种方式修改脚本的成本几乎为零。
场景四:电影级多模态短片
Seedance v2 Pro支持同时传入参考图、参考视频和参考音频,适合制作有特定人物形象、特定场景氛围的广告短片或概念视频。
💡 使用帮助:几个关键细节要留意
技能如何被触发
这个技能会在用户提到“talking head”、“lip sync”、“avatar video”、“make this portrait talk”、“virtual presenter”、“HeyGen alternative”、“Synthesia alternative”、“digital human”等关键词时被自动唤起。你不需要记住确切的命令格式,用自然语言描述需求即可。
模型选择由AI自动完成
你不需要手动指定用OmniHuman还是HappyHorse。技能会先问几个关键问题——有没有现成的音频?要写实还是风格化?——然后自动路由到最匹配的模型。如果对某个模型有明确偏好,也可以在请求中直接说明。
音频格式需要注意
使用OmniHuman等音频驱动模型时,audio_url需要指向一个可公开访问的音频文件地址。本地文件需要先上传到可访问的存储位置,或者通过RunComfy的文件上传接口处理后再传入。
与RunComfy平台其他技能共享CLI
ai-avatar-video使用的是和AI图像生成、AI视频生成、换脸等兄弟技能相同的runcomfy CLI。一次安装CLI和登录,所有RunComfy技能都可以直接使用。
🤖 适合哪些AI工具?
ai-avatar-video是RunComfy Agent Skills生态中的一员,兼容所有支持skills add命令的AI编程环境:
- Claude Code:作为Anthropic官方命令行AI工具,Claude Code可以直接加载这个技能。安装后,对话中提到“让这张照片说话”或“做个数字人视频”,Claude Code会自动识别意图并调用相应模型。
- Cursor:在Cursor的AI对话中同样可以通过技能机制触发,适合在编码过程中顺带生成演示素材。
- Codex CLI:OpenAI的命令行工具也支持相同的技能加载方式。
RunComfy Agent Skills生态中包含一系列通过同一个runcomfy CLI分发的兄弟技能——AI图像生成、AI视频生成、换脸、ControlNet姿态控制、LoRA训练等。安装ai-avatar-video后,如果你后续需要其他媒体生成能力,只需要安装对应的技能即可,CLI本身不需要重新配置。
📝 总结
ai-avatar-video的核心价值在于把“选模型”这件事交给了AI。
RunComfy平台上提供了多个音频驱动头像模型,每个有各自的适用边界——有的要音频文件,有的可以从脚本直接生成;有的适合写实肖像,有的擅长电影级构图。对于不熟悉这些模型差异的用户来说,手动选择本身就是一道门槛。这个技能把这些选择逻辑封装了起来,用户只需要用自然语言描述想要什么,AI负责判断该走哪条路。
如果你有照片和音频/脚本,想要快速产出数字人视频,这个技能值得装一个试试。

◯ 评论 0