进阶之路,让可灵真正听你的话
基础操作熟练之后,下面这些功能才是可灵真正拉开差距的地方。
进阶一:写好提示词,让AI听懂你在说什么
同样一句话,不同写法出来的东西天差地别。可灵的提示词有一套经过验证的结构:
拆开来看:
主体:谁或什么,描述要具体。 “一位大约四十出头的高个男子,修剪整齐的花白胡须,穿着炭灰色羊毛大衣和酒红色围巾”——比“一个男人”好得多。
运动:在做什么、怎么动。“他慢慢翻过一页书,停顿片刻,用一只爪子推了推眼镜”——越具体越好。
场景:在哪里。“温馨的咖啡厅,身边一杯拿铁冒着热气,窗边透进金色的晨光”。
镜头语言:怎么拍。用镜头思维写提示词,而非关键词堆叠。比如“缓慢的推镜,从雨夜城市十字路口的远景开始,镜头随着他走向对面人行道逐步收紧为中景”——这比堆砌“推镜、夜景、城市”这种关键词有效得多。
进阶技巧:以镜头动作开场,为可灵提供清晰的构图起点。尽早锚定主体,在提示词开头就清晰定义主要角色,便于模型在多个镜头间进行一致追踪。
进阶二:智能分镜——让AI帮你“导演”
可灵3.0的智能分镜是核心功能之一。你不需要手动设置镜头,AI会自动识别提示词中的场景转换,智能调度远景、中景、特写等景别和正反打、跟拍、俯仰等机位。
实际操作中,你只需要在提示词里描述多个场景或动作,AI就会自动识别并生成多镜头视频。比如你写“清晨她在公园跑步→路过咖啡店买了杯咖啡→坐在长椅上休息”,可灵会自动切三个镜头,不用你手动拼接。
支持对话、跨镜头台词、画外音等高级视听语言。真正实现了“像写分镜脚本一样写提示词”。
进阶三:多镜头故事板——像导演一样组织镜头
可灵3.0支持单次生成最多6个独立镜头切换,彻底省去了手动剪辑拼接的繁琐工作。
你可以为每个镜头指定时长、景别、视角、叙事内容。可灵会理解这些镜头之间的逻辑关系,一次生成一组视觉连贯的镜头序列。相当于可灵内置了一个AI导演,帮你自动完成镜头的组织和切换。

进阶四:主体参考与角色一致性——解决“变脸”难题
这是AI视频领域最难解决的问题之一——同一个角色在不同镜头里长得不一样。可灵3.0通过两种方式解决:
方式一:图生视频+主体参考。在图生视频基础上额外添加多图或视频主体,二次锚定角色特征。同时上传角色定妆图、场景图、道具图,让它在多镜头里保持人物长相、服装、场景一致。
方式二:视频角色主体(仅3.0 Omni) 。上传3到8秒的角色视频,AI提取并记住角色的样貌、身形、神韵和音色,在所有生成中保持一致。适合制作连续剧集、品牌虚拟形象等。
主体库功能更进一步——把一个人物或物品的多角度图传上去,封装成一个“主体”,更便于后续调用。
进阶五:动作控制——让角色按你的意思动
可灵2.6及以上版本支持动作控制功能。你可以上传一段参考动作视频,让AI把这段动作迁移到你的角色身上。
操作步骤:添加要模仿的人物动作视频(可以上传本地视频或从动作库中选择)→ 添加人物图(注意与视频人物比例一致效果更佳)→ 输入prompt控制背景元素等其他信息。
获得更好效果的技巧:
生成时长:选择“人物朝向与视频一致”最长支持30秒,选择“人物朝向与图片一致”最长支持10秒。
进阶六:视频编辑——生成之后还能改
可灵O1最大的突破之一是用嘴改视频。你不需要手动遮罩或关键帧,只需要输入文字指令:
从局部的主体替换到整体的视频风格重绘,模型自动完成像素级的语义重构。
进阶七:数字人——一张图加一段话,让角色开口
可灵数字人2.0经过上传角色图 → 添加配音内容 → 描述角色表现三个步骤,即可生成“能说会演”的数字人。
支持用静态人像图 + 文本或音频生成自然口型同步的1080p视频。需要电脑端v3.0.2+版本、正面清晰人像及合规驱动源。
详细操作:进入「创建作品」页面 → 点击右上角齿轮图标 → 开启「高级模式」→ 在编辑区左侧工具栏找到并点击「人物驱动」按钮 → 上传照片(1024×1024 PNG/JPG格式人像图)。
进阶八:原生音频——音画一起出
可灵3.0支持原生级音画同步。视频和声音一次生成,不需要后期配音。
多语混说是核心能力——支持在同一视频中混合使用中、英、日、韩、西五种语言及方言。角色可以在一段对话中自然切换语言。
原生级文字功能确保招牌、字幕在视频中清晰可读、结构严谨。特别适合电商广告、产品展示、教育视频等需要文字信息的场景。
第三部分:免费还是付费?
可灵采用按秒计费模式。可灵视频3.0约$0.05/秒,可灵3.0 Omni约$0.08/秒。3到15秒视频成本在$0.15到$1.20之间。
免费用户有每日赠送积分,日常轻度使用够用。如果需要高清输出、大量生成或使用Omni的进阶功能,再考虑付费。
可灵的学习曲线不算陡,但功能藏得比较深。新手阶段的核心是把提示词写明白——主体、动作、场景、镜头、氛围,五个要素填清楚,比什么技巧都管用。进阶阶段的核心是学会控制——智能分镜、主体参考、动作控制、视频编辑,这些才是让AI真正“听你话”的手段。
从“会生成”到“会导演”,中间差的不是智商,是愿不愿意花时间把上面这些功能挨个试一遍。试完你会发现,可灵能做的远比你想象的多。



◯ 评论 0