🧩 它做什么,不做什么

大多数“AI 视频剪辑”工具的思路是:你给一段素材,它直接吐出一个成品。问题是——如果它剪错了,你几乎没办法干预。video-edit 走的是另一条路:让 AI 负责判断,让 FFmpeg 负责执行,中间用一份结构化的“编辑计划”连接起来。

具体来说,agent 拿到原始素材后,先做分析——探测时长、分辨率、音轨,转写语音,抽帧看画面,识别静音段和节奏点。基于这些信息,agent 生成一份编辑计划(EditPlan),里面写清楚每一刀切在哪里、哪些片段保留、字幕放在什么时间轴位置、BGM 从哪里进入。然后 FFmpeg 照着这份计划逐条执行,渲染出最终视频。

这个设计带来的实际好处是可审计、可复现、可回滚。编辑计划是一个 JSON 或 YAML 文件,你可以读它、改它、用 git 追踪它的变化。FFmpeg 的渲染结果是确定性的——同样的计划,同样的输入,永远得到同样的输出。如果 agent 某一刀切得不对,你改计划里的一个时间戳,重新渲染就行,不需要从头再来。

它的典型能力覆盖:播客/访谈剪辑(砍掉停顿和废话,保留有效对话)、短视频生成(从长视频里挑出高光片段,做成 9:16 竖版)、字幕烧录(逐字或分段字幕,支持多种样式)、多机位同步(用音频波形对齐多个机位,再按计划切换角度)。

📦 第一次怎么装

video-edit 通常以 Agent Skill 的形式分发。在项目根目录执行:

npx skills add computerlovetech/video-edit-cli --skill video-edit-cli

安装完成后,Agent 会获得一个无头的编辑工作台,包含 inspect、transcribe、cut、master、package 等一系列原子命令。唯一的系统依赖是 ffmpegffprobe,确保它们在 PATH 里即可。

如果你更喜欢 MCP 方式,也可以用类似下面的配置把 video-edit 挂到 Claude Desktop 或 Cursor 上:

{
  "mcpServers": {
    "video-edit": {
      "command": "npx",
      "args": ["-y", "video-edit-mcp"],
      "env": { "VIDEO_EDIT_WORKSPACE": "/path/to/your/media" }
    }
  }
}

全部处理在本地完成,不上传素材,不需要 API key。

🛠️ 装好之后怎么用

使用方式就是“用自然语言描述你要什么”。比如:

把这段播客里我停顿超过 1.5 秒的地方都砍掉,保留有效对话,加逐字字幕,导出 1080p。

Agent 会按照 skill 里定义的流程走:先 workspace init 初始化项目,再 probe 探测媒体信息,transcribe 转写语音,分析完成后生成编辑计划,最后用 FFmpeg 渲染。每个命令都会输出 JSON 结果,源素材保持不变,所有派生文件旁边会生成一个 .provenance.json,记录这个文件是怎么来的。

如果你用的是 vedit 这类带时间线 UI 的实现,流程会更直观:agent 在对话里说“砍掉前 40 秒,删掉我沉默的段落,屏幕录制加速 2 倍,按音乐节拍切 B-roll,烧入字幕”,时间线上的片段会实时重新排列。它暴露了 77 个 MCP 工具,和鼠标操作调用的是同一套底层指令,没有“只有 AI 能做的事”。

对于多机位场景,video-studio 这类实现会先用音频互相关对齐多个机位,然后在共享时间线上按计划切换角度,处理帧率不匹配和长镜头时钟漂移的问题。

💡 几个让它更好用的技巧

  • 先看 agent 生成的编辑计划,再让它渲染。编辑计划是纯文本的,你可以在渲染之前扫一眼时间戳对不对。这是 video-edit 相对于“一键生成”类工具最大的优势——你有干预的机会。
  • 静音检测的阈值可以调。默认可能是 -30dB 或 0.5 秒,但不同录音环境的底噪不一样。如果 agent 砍得太狠或太松,告诉它“静音阈值调到 -25dB”或者“停顿超过 2 秒才算静音”,它会重新生成计划。
  • 字幕样式在计划里改,不在渲染时改。字体、字号、颜色、位置这些参数都写在 EditPlan 里。改计划比改渲染命令更直接,也不会因为 FFmpeg 参数顺序问题导致样式不生效。
  • 多机位素材先对齐再剪。如果你的素材来自多个机位加独立录音机,让 agent 先跑音频同步,确认波形对齐了再进入剪辑阶段。对齐没做好,后面切得再准也是白搭。
  • 配合 whisper 做词级时间戳。video-edit 本身只负责“切”和“排”,语音转写通常交给 Whisper。用 --word_timestamps 参数拿到每个词的起止时间,agent 才能做出“切在词与词之间”的精准剪辑,而不是切在半个音节上。

🤖 适合哪些 AI 工具

video-edit 是一个标准的 Agent Skill,本质上是一份 SKILL.md 文件,不绑定特定平台。只要你的 AI 编码工具能读取项目目录中的 skill 文件或支持 MCP 协议,就能用。

目前经过验证的兼容工具包括:Claude Code、Cursor、Codex CLI、GitHub Copilot、Windsurf、OpenClaw,以及其他支持 Agent Skill 工作流的工具。在 Claude Code 中安装后,直接输入 /video-edit 或描述剪辑需求即可触发。

需要留意的是,video-edit 的定位是“对已有素材做剪辑”,不是生成视频内容。它不会凭空产生画面,也不会替代 HyperFrames 这类基于 HTML/CSS 的合成框架。如果你的需求是“从零做一个动画视频”,应该走合成路线;如果素材已经在硬盘上了,video-edit 才是正确的入口。