🎵 主要功能:用标签和歌词“描述”一首歌

ace-step 做的事情很直接——你给它一段风格描述(tags)和一段歌词(lyrics),它返回一首完整的音频。

这个技能的核心设计思路是把音乐生成拆成两个可控的输入维度。风格部分用标签来描述,比如“pop, female vocal, piano”,模型会根据这些标签决定编曲、音色和氛围。人声部分用歌词来控制,支持 [Verse][Chorus][Bridge] 这样的结构标记,让生成的歌曲有段落变化,而不是从头到尾一个调子。如果不需要人声,歌词留空即可得到纯器乐。

技能背后是 StepFun-AI 的开源音乐基础模型 ACE Step。它通过 RunComfy CLI 调用,目前提供四个端点:

  • text-to-audio(基础版):默认端点,根据标签和歌词生成完整音频。
  • ACE Step 1.5 text-to-audio:升级版本,在生成质量和风格一致性上有所提升。
  • inpainting:对已有音频的特定片段进行重新生成,适合修改某一段歌词或某一段旋律。
  • outpainting:在已有音频的基础上向前或向后扩展,适合把短片段接成长曲。

调用方式非常直接。安装 RunComfy CLI 并完成登录后,一次典型的生成调用是:

runcomfy run acestep-ai/ace-step/text-to-audio \
  --input '{"tags": "pop, female vocal, piano", "lyrics": "[Verse] ...", "duration": 120}' \
  --output-dir ./out

提交请求、轮询状态、下载音频文件,CLI 自动完成。技能也支持 --language 参数来指定人声语言,ACE Step 1.5 对多语言的支持覆盖了 50 多种语言。

🚀 首次安装:两步,和 RunComfy 生态其他技能一样

ace-step 本身不是一个独立工具,它依赖 runcomfy CLI 运行。

第一步:安装 RunComfy CLI 并登录

npm i -g @runcomfy/cli
runcomfy login

CI 或容器环境中可以用环境变量 export RUNCOMFY_TOKEN=<token> 替代交互式登录。

第二步:安装 ace-step 技能

npx skills add agentspace-so/runcomfy-agent-skills --skill ace-step -g

-g 表示全局安装,技能对当前用户下所有 AI 编程工具可见。

如果你已经在使用 RunComfy 生态中的其他技能(比如 ai-avatar-video 或 face-swap),CLI 已经装好了,只需要执行第二步安装这个技能即可。

🎯 主要应用场景:谁在用,用来干什么

场景一:为视频或播客快速配一段原创音乐

剪辑视频需要一个有节奏感的背景音,但不想用版权库里的素材。给 ace-step 一段风格标签,几秒钟就能拿到一段可用的器乐片段,直接拖进剪辑软件。

场景二:Demo 创作和灵感验证

音乐人脑子里有一段旋律或一段歌词,想快速听到它“变成歌”的样子。ace-step 可以把歌词和风格描述直接变成带人声的音频,用来判断这个方向值不值得继续做。

场景三:多语言歌曲的快速原型

ACE Step 1.5 支持 50 多种语言的人声生成。如果你需要制作同一首歌的不同语言版本,可以用同一套标签和结构,只替换歌词语言参数,快速产出多个语言版本的 Demo。

场景四:已有音频的局部修改与延长

inpainting 和 outpainting 端点让这个技能不只能“从零生成”。如果一段音频里某句歌词不满意,可以用 inpainting 重做那一段;如果一段旋律太短,可以用 outpainting 往后接。

💡 使用帮助:几个值得记住的要点

标签和歌词是两个独立输入

tags 控制风格和编曲,lyrics 控制人声内容和结构。这是 ACE Step 和很多“一句话生成音乐”的模型不一样的地方——它把风格和人声拆开了,让你可以精细控制。比如同一段旋律,换一组 tags 就能从“acoustic guitar, soft”变成“synth, energetic”。

歌词结构标记很重要

写歌词时用 [Verse][Chorus][Bridge] 标记段落,模型会根据这些标记安排歌曲结构。如果歌词是一整段没有标记的文本,生成的歌曲可能从头到尾一个调子,缺少变化。

时长参数需要留意

生成音频有时长限制,具体上限取决于你使用的端点。ACE Step 1.5 在消费级 GPU 上就能运行,生成速度也比较可观。如果需要的音频比较长,可以考虑用 outpainting 分段扩展。

和其他 RunComfy 音乐技能的关系

RunComfy 平台上还有一个 ai-music 技能,它会在多个音乐模型之间做智能路由(包括 ElevenLabs 和 ACE Step)。如果你对用哪个模型没有明确偏好,ai-music 会帮你选。如果你明确想用 ACE Step,直接用 ace-step 这个技能更直接。

🤖 适合哪些 AI 工具?

ace-step 是 RunComfy Agent Skills 生态中的一员,兼容所有支持 skills add 命令的 AI 编程环境:

  • Claude Code:安装后,对话中提到“生成音乐”、“写首歌”、“做个背景音”等意图时,Claude Code 会自动识别并调用这个技能。
  • Cursor:同样通过技能机制触发,适合在开发过程中顺带生成音频素材。
  • Codex CLI:支持相同的技能加载方式。

RunComfy Agent Skills 生态中还有一系列通过同一个 runcomfy CLI 分发的兄弟技能——ai-avatar-video、face-swap、ai-image-generation、ai-video-generation 等。安装 ace-step 后,如果需要其他媒体生成能力,只需要安装对应的技能即可,CLI 本身不需要重新配置。

📝 总结

ace-step 的定位很清晰:它是 RunComfy 平台上 ACE Step 音乐模型的命令行入口,用标签和歌词两个维度来控制生成结果

它的优势在于可控性和本地运行的可能性。ACE Step 是 MIT 许可证的开源模型,训练数据来自免版税素材。如果你对音乐版权有严格要求,或者需要在自己的硬件上运行,这个模型和技能的组合是一个值得考虑的选项。通过 RunComfy CLI 调用,又省去了本地部署的硬件门槛。

如果你需要快速产出歌曲 Demo、器乐片段或带人声的音频,并且已经在使用 Claude Code、Cursor 或 Codex CLI,这个技能可以让你在对话中直接“要一首歌”。