可灵能做的事情,说穿了就一句话:让不会拍视频的人也能拍出像样的视频但怎么“拍”,差别很大。从最初级的文字生视频,到现在的多镜头故事板、原生音频、主体一致性控制——可灵正在一步步把“生成视频”这件事,变成“导演视频”。

视频生成:三种方式,覆盖多数场景

视频生成是可灵最基础的能力,分文生视频图生视频两种。文生视频就是输入一段文字描述,AI生成对应的视频;图生视频则是上传一张图片,AI让图片里的内容动起来

但图生视频还有更精细的玩法。

首帧生视频:上传一张图作为视频的第一帧,AI从这一帧开始往后生成

首尾帧生视频:上传两张图——第一帧和最后一帧——AI自动“脑补”出中间的运动变化过程。比如你给一张“日出”和一张“日落”,可灵自己生成太阳从升起到落下的完整过程

参考生视频:上传参考视频或图片,AI从中提取视觉特征,在全新场景中复现

单次生成最长15秒。但通过视频续写功能,可以不断延长——最长能续写到3分钟。分辨率方面,可灵支持1080P高清输出,部分版本甚至支持原生4K(3840×2160)直出

多镜头叙事:从“生成一段”到“导演一组”

这是可灵3.0最核心的升级。

以前的AI视频生成,基本是一段一段来的——你给一个提示词,它生成一段5秒或10秒的连续画面。如果你想拍一个有多个镜头的短片,得一段一段生成、再手动拼接。

可灵3.0的多镜头故事板改变了这件事。你可以在故事板里为每个镜头指定时长、景别、视角、叙事内容和镜头运动。比如:

  • 镜头1:日出时山路的广角镜头,5秒

  • 镜头2:头盔内骑士脸部的特写,3秒

  • 镜头3:跟拍摩托车的无人机俯冲镜头,7秒

可灵会理解这些镜头之间的逻辑关系,一次生成一组视觉连贯的镜头序列。它还会根据你的指令动态调整机位角度和构图——从经典的正反打对话,到交叉剪辑和旁白,都能处理

相当于可灵内置了一个AI导演,帮你自动完成镜头的组织和切换

可灵的核心功能:从生成视频到导演镜头
可灵的核心功能:从生成视频到导演镜头

原生音频:视频和声音一起出来

这是可灵另一个标志性的能力。

以前AI生成视频,画面是画面,声音是声音——你得另外配音、加音效、对口型。可灵3.0的原生音频功能,让视频和声音一次生成

具体来说:

音画同步:声音和画面动作实时匹配。玻璃瓶滚过木桌落在地毯上——滚动的摩擦声、落地的闷响、室内环境音,一次生成

多语言口型匹配:支持中、英、日、韩、西五种语言及方言的精准口型匹配。提取3秒以上人声,即可为角色绑定专属声线,口型、神态与音色同步。多人场景下还能指定具体是谁在说话

文字清晰度:招牌、字幕、品牌标识在视频中保持清晰可读

主体一致性:同一个角色,从头到尾不变

这是AI视频生成领域最难解决的问题之一。

很多AI视频模型生成一段5秒的视频还行,一旦镜头切换、场景变化,角色就会“变脸”——同一个角色在不同镜头里长得不一样。可灵3.0的主体参考技术解决的就是这个问题

它的做法是:上传参考素材(图片或视频),AI提取人物的视觉特征和声音特征,然后在整个视频的各个镜头中锁定这些特征。无论镜头如何推拉摇移,人物的形象、服装、声音都能保持一致

可灵还推出了主体库功能,支持通过多视角图创建主体。角色、道具、场景都可以被“记住”——就像导演给每个演员建了一份档案,拍到哪儿都不会搞混

动作控制:让角色按你的意思动

可灵3.0的动作控制3.0功能,在动作、表情、口型、手势的一致性控制上实现了突破

实际操作中,你可以上传一段动作参考视频(比如一段舞蹈),再结合提示词,让AI把这段动作迁移到你的角色身上。最终生成的视频在人物动作流畅性上保持高水平一致性。面部表情、手势、口型同步都可以精确控制

视频编辑:生成之后还能改

生成只是第一步。可灵O1模型把视频编辑也整合了进来

你可以用自然语言直接修改已生成的视频

  • “移除路人”

  • “将白天改为黄昏”

  • “替换主角服装的颜色”

  • “修改视频背景”

不需要手动遮罩、不需要关键帧,文字指令就是最高效的修改工具。你还可以对视频进行风格重绘、内容增删、镜头延展等操作

图片生成方面,可灵图片3.0系列支持系列组图生成——生成一组风格、光影、细节高度统一的图片,适配影视分镜、概念设定等专业需求

数字人:一张图加一段话,让角色开口

可灵的数字人功能,你只需要一张角色图片和一段文字或音频,就能生成最长1分钟的数字人视频

它支持多类角色和中英日韩多语种,口型与语音精准同步,情绪动作精细控制。适用于广告、电商、教育等场景

可灵的核心功能,本质上是一套从生成到导演的完整工具链:文生视频和图生视频负责“拍出来”,多镜头故事板负责“组织镜头”,原生音频负责“配上声”,主体参考和动作控制负责“保持连贯”,视频编辑负责“改到满意”。

你负责想,它负责拍。区别在于,现在的可灵不只是“拍一段”,而是能“导一组”了。