🎵 它把三件音乐制作的事塞进了一个插件里

ai-music-mcp 是挂在 GitHub 上的一个开源项目,作者是 ExpertVagabond。它不是网页工具,也不是一个独立的 App,而是一个 MCP 服务器——你可以把它理解成 AI 助手的一个“音乐技能包”,装好之后,你在 Claude、Cursor 这些工具里说话,它就在你本机跑模型出音频。

它一共干了三件事。第一件,文生音乐。通过 Meta 的 MusicGen 模型,给一段文字描述就能生成纯器乐音频,时长在 1 到 30 秒之间,模型可选 small、medium、large 三档。第二件,分轨。用 Demucs 把任意音频拆成人声、鼓、贝斯和其他四个独立音轨,方便你拿去做混音或者采样。第三件,声音转换。通过 RVC 把一段人声换成目标音色,支持变调和 F0 方法选择。

最省事的地方在于,它还提供了一个“全流程”工具:一条命令串起生成、分轨、换声,你输入一句提示词,等它跑完,拿到的是一个已经处理好的成品音频,人声和伴奏已经分开了,人声也已经换成了你要的音色。

整个过程全部跑在你的电脑上,没有云端 API 调用,没有按首计费,没有速率限制,也没有“额度用完了”这种事的。

📦 装它之前得先备好几样东西

ai-music-mcp 本身是一个 npm 包,安装命令就一行:

npm install -g ai-music-mcp

但它依赖的东西不算少。按照项目文档的说法,你需要 Node.js 18 以上来跑 MCP 服务器,Python 3.11 以上来跑模型,还要装 PyTorch、ffmpeg 和 ffprobe。光装这些还不够,你还得额外克隆两个仓库:一个是 ai-music-studio,里面是 MusicGen 和 Demucs 的 Python 脚本和虚拟环境;另一个是 RVC WebUI,只有在你需要声音转换功能的时候才要装。

装完之后,打开你的 MCP 客户端配置文件,把下面这段加进去:

{
  "mcpServers": {
    "ai-music": {
      "command": "ai-music-mcp",
      "env": {
        "MUSIC_STUDIO_DIR": "/你的路径/ai-music-studio",
        "RVC_DIR": "/你的路径/ai-music-rvc",
        "MUSIC_OUTPUT_DIR": "~/Desktop/AI-Music"
      }
    }
  }
}

这三个环境变量里,MUSIC_STUDIO_DIR 是必须填的,另外两个看情况。输出目录如果不管,默认丢在桌面的 AI-Music 文件夹里。

说实话,第一次配环境需要花点时间,尤其是 PyTorch 和 ffmpeg 的安装。但配好之后,后面每一次生成都不需要再碰这些配置了。

🎧 用起来是什么感觉

配置完成之后,你在 Claude 或者 Cursor 的对话框里直接说需求就行。比如:“帮我生成一段 20 秒的暗黑 trap 节奏,低音重一点,带 hi-hat。”插件会调用 music_generate 工具,把提示词传给 MusicGen,等模型跑完,音频就出现在你指定的输出目录里。

如果你想做一整条链路,可以说:“生成一段 lo-fi chill 节拍,把它分轨,然后把里面的人声换成我的声音模型。”它会调用 music_full_pipeline,一口气跑完生成、Demucs 分轨、RVC 换声三步,整个过程大概 5 到 15 分钟。

生成的文件结构也很清楚。以一条叫 dark-trap-beat-808s 的音频为例,输出目录里会有:

~/Desktop/AI-Music/
├── dark-trap-beat-808s.wav     ← 生成的器乐
├── stems/htdemucs/dark-trap-beat-808s/
│   ├── vocals.wav
│   ├── drums.wav
│   ├── bass.wav
│   └── other.wav
└── converted/
    └── converted-vocals-dark-trap.wav

分轨出来的每一轨都是独立 WAV,可以直接拖进 DAW 里继续加工。

🎯 什么人在什么场景下会用它

第一种场景,短视频配乐。你做 vlog 或者社媒内容,需要一段不撞库的原创背景音乐。用这个插件说一句话,几十秒的 BGM 就出来了,不用去素材网站翻,也不用担心版权问题。

第二种场景,音乐制作的素材挖掘。你是一个 Beatmaker 或者制作人,想快速搞到一些鼓点、贝斯线或者氛围音色作为灵感起点。生成一段器乐,分轨,挑出要用的那一轨,剩下的丢掉。整个过程不需要离开你的 AI 编程工具。

第三种场景,人声实验。你有 RVC 训练好的声音模型,想把某段人声换成另一个音色,或者做变调处理。这个插件把 RVC 的调用封装成了 MCP 工具,你不需要去 WebUI 里点来点去,直接在对话框里描述就行。

第四种场景,零成本的批量试验。因为一切都在本地跑,没有按次收费,你可以反复试不同的提示词、不同的模型大小、不同的时长,不用担心账单。

⚖️ 和 Suno 这类工具比,它的位置在哪

说到 AI 音乐生成,大多数人第一反应是 Suno 或者 Udio。这些工具确实强,一句话就能出一首带人声的完整歌曲,音质和编曲水平也相当能打。但它们的逻辑是“云端生成、按首付费”,而且你拿到的成品是一整轨混好的音频,没法拆开。

ai-music-mcp 走的是另一条路。它的对比表格里写得很清楚:Suno 和同类云端 API 是“只能生成,没有分轨,没有换声,固定模型”;而它自己“本地运行,零费用,分轨和换声都是内置的”。

换个说法:Suno 适合“我要一首能直接发出去的歌”,ai-music-mcp 适合“我要可以拆开、可以继续加工的音乐素材”。两者不是替代关系,更像是流水线上的不同环节。你可以用 Suno 生成一首 Demo,把音频下载下来,再用 ai-music-mcp 分轨,提取出伴奏或者人声去做进一步的混音。

另外,在“AI 插件”这个生态里,还有一个叫 ai-musicify 的项目值得提一下。它是一个 npm 包,定位是“歌词创作与旋律学习工具”,帮你想歌词、分析和弦、生成旋律提示,然后导出到 Suno 或者 Tunee 去生成音频。它自己不生成音频文件,只做前端的创作辅助。所以 ai-musicify 和 ai-music-mcp 是一个做“前”一个做“后”——前者帮你把词曲构思清楚,后者帮你把音频跑出来、拆开、改掉。

🤖 它能接进哪些 AI 工具

因为 ai-music-mcp 走的是 MCP 协议,所以理论上任何支持 MCP 客户端的 AI 工具都可以接入。项目文档里明确列出的包括:

  • Claude Desktop:Anthropic 的桌面客户端,通过 claude_desktop_config.json 配置,这是最常用的接入方式。
  • Cursor:在 .cursor/mcp.json 里添加配置即可,写代码的时候顺手生成音乐素材。
  • Codex CLI:OpenAI 的命令行编程工具,同样支持 MCP 协议加载。
  • 任何其他 MCP 客户端:Windsurf、VS Code 的 MCP 扩展、以及你自己搭建的 MCP 客户端,只要遵循协议规范,都能调用它的工具。

它的 GitHub 仓库里还有一个 .claude-plugin 目录,说明作者也在为 Claude 的插件市场做适配。

📌 一句话判断

如果你手里有一台能跑 PyTorch 的机器,愿意花一次时间把环境搭好,以后就能在一个聊天窗口里完成“生成—分轨—换声”这条链路,不花一分钱,不传一个文件到云上。这就是 ai-music-mcp 的全部卖点。