进阶之路,让可灵真正听你的话

基础操作熟练之后,下面这些功能才是可灵真正拉开差距的地方。

进阶一:写好提示词,让AI听懂你在说什么

同样一句话,不同写法出来的东西天差地别。可灵的提示词有一套经过验证的结构:

提示词 = 主体 + 运动 + 场景 + 镜头语言 + 光影氛围 + 声音

拆开来看:

主体:谁或什么,描述要具体。 “一位大约四十出头的高个男子,修剪整齐的花白胡须,穿着炭灰色羊毛大衣和酒红色围巾”——比“一个男人”好得多

运动:在做什么、怎么动。“他慢慢翻过一页书,停顿片刻,用一只爪子推了推眼镜”——越具体越好。

场景:在哪里。“温馨的咖啡厅,身边一杯拿铁冒着热气,窗边透进金色的晨光”

镜头语言:怎么拍。用镜头思维写提示词,而非关键词堆叠。比如“缓慢的推镜,从雨夜城市十字路口的远景开始,镜头随着他走向对面人行道逐步收紧为中景”——这比堆砌“推镜、夜景、城市”这种关键词有效得多。

光影与氛围:什么调性。“电影级调色,温暖的琥珀色调”

声音:听起来什么样。“背景传来轻柔的爵士钢琴曲”

进阶技巧以镜头动作开场,为可灵提供清晰的构图起点尽早锚定主体,在提示词开头就清晰定义主要角色,便于模型在多个镜头间进行一致追踪

进阶二:智能分镜——让AI帮你“导演”

可灵3.0的智能分镜是核心功能之一。你不需要手动设置镜头,AI会自动识别提示词中的场景转换,智能调度远景、中景、特写等景别和正反打、跟拍、俯仰等机位

实际操作中,你只需要在提示词里描述多个场景或动作,AI就会自动识别并生成多镜头视频。比如你写“清晨她在公园跑步→路过咖啡店买了杯咖啡→坐在长椅上休息”,可灵会自动切三个镜头,不用你手动拼接。

支持对话、跨镜头台词、画外音等高级视听语言。真正实现了“像写分镜脚本一样写提示词”

进阶三:多镜头故事板——像导演一样组织镜头

可灵3.0支持单次生成最多6个独立镜头切换,彻底省去了手动剪辑拼接的繁琐工作

你可以为每个镜头指定时长、景别、视角、叙事内容。可灵会理解这些镜头之间的逻辑关系,一次生成一组视觉连贯的镜头序列。相当于可灵内置了一个AI导演,帮你自动完成镜头的组织和切换。

进阶之路,让可灵真正听你的话
进阶之路,让可灵真正听你的话


进阶四:主体参考与角色一致性——解决“变脸”难题

这是AI视频领域最难解决的问题之一——同一个角色在不同镜头里长得不一样。可灵3.0通过两种方式解决:

方式一:图生视频+主体参考。在图生视频基础上额外添加多图或视频主体,二次锚定角色特征。同时上传角色定妆图、场景图、道具图,让它在多镜头里保持人物长相、服装、场景一致

方式二:视频角色主体(仅3.0 Omni) 。上传3到8秒的角色视频,AI提取并记住角色的样貌、身形、神韵和音色,在所有生成中保持一致。适合制作连续剧集、品牌虚拟形象等

主体库功能更进一步——把一个人物或物品的多角度图传上去,封装成一个“主体”,更便于后续调用

进阶五:动作控制——让角色按你的意思动

可灵2.6及以上版本支持动作控制功能。你可以上传一段参考动作视频,让AI把这段动作迁移到你的角色身上

操作步骤:添加要模仿的人物动作视频(可以上传本地视频或从动作库中选择)→ 添加人物图(注意与视频人物比例一致效果更佳)→ 输入prompt控制背景元素等其他信息

获得更好效果的技巧

  • 参考图人物全身/半身与参考动作视频保持一致

  • 参考动作幅度大且干净、速度不过快、位移不过大的生成效果更佳

  • 如果参考动作幅度较大,参考图应留出足够的空间给人物做动作

  • 人物需要露出清晰的上半身或全身的肢体及头部,避免遮挡

  • 推荐使用一镜到底的动作视频,角色始终出现在画面中

生成时长:选择“人物朝向与视频一致”最长支持30秒,选择“人物朝向与图片一致”最长支持10秒

进阶六:视频编辑——生成之后还能改

可灵O1最大的突破之一是用嘴改视频。你不需要手动遮罩或关键帧,只需要输入文字指令

  • 增加内容:“在桌子上加一杯奶茶”

  • 删除内容:“移除路人”

  • 修改内容:“将白天改为黄昏”或“替换主角服装的颜色”

  • 风格重绘:整体色调、材质、视角修改

从局部的主体替换到整体的视频风格重绘,模型自动完成像素级的语义重构

进阶七:数字人——一张图加一段话,让角色开口

可灵数字人2.0经过上传角色图 → 添加配音内容 → 描述角色表现三个步骤,即可生成“能说会演”的数字人

支持用静态人像图 + 文本或音频生成自然口型同步的1080p视频。需要电脑端v3.0.2+版本正面清晰人像及合规驱动源

详细操作:进入「创建作品」页面 → 点击右上角齿轮图标 → 开启「高级模式」→ 在编辑区左侧工具栏找到并点击「人物驱动」按钮 → 上传照片(1024×1024 PNG/JPG格式人像图)

进阶八:原生音频——音画一起出

可灵3.0支持原生级音画同步。视频和声音一次生成,不需要后期配音。

多语混说是核心能力——支持在同一视频中混合使用中、英、日、韩、西五种语言及方言。角色可以在一段对话中自然切换语言

原生级文字功能确保招牌、字幕在视频中清晰可读、结构严谨。特别适合电商广告、产品展示、教育视频等需要文字信息的场景

第三部分:免费还是付费?

可灵采用按秒计费模式。可灵视频3.0约$0.05/秒,可灵3.0 Omni约$0.08/秒。3到15秒视频成本在$0.15到$1.20之间

免费用户有每日赠送积分,日常轻度使用够用。如果需要高清输出、大量生成或使用Omni的进阶功能,再考虑付费。


可灵的学习曲线不算陡,但功能藏得比较深。新手阶段的核心是把提示词写明白——主体、动作、场景、镜头、氛围,五个要素填清楚,比什么技巧都管用。进阶阶段的核心是学会控制——智能分镜、主体参考、动作控制、视频编辑,这些才是让AI真正“听你话”的手段。

从“会生成”到“会导演”,中间差的不是智商,是愿不愿意花时间把上面这些功能挨个试一遍。试完你会发现,可灵能做的远比你想象的多。