如果你关注过AI视频生成,大概率听过“可灵”这个名字。

可灵(英文名Kling),是快手自研的AI视频生成大模型。用最直白的话说就是:你给它一段文字,它给你生成一段视频;你给它一张图片,它能让这张图动起来。

它从哪里来?

可灵正式上线是2024年6月。当时正值AI视频生成最热的时候,OpenAI的Sora年初刚发布,但只放出了几个演示视频,普通人根本用不上。可灵是全球第一个真正可用的DiT架构视频生成模型——别人还在画饼,快手直接把产品端出来了。

上线之后迭代速度很快。2025年4月发布了2.0版本,同年12月推出了全模态视频模型“可灵O1”。2026年1月,可灵3.0系列正式面向全球上线,标志着可灵进入了3.0时代

到2026年6月,可灵的全球注册用户已经突破一亿,覆盖224个国家和地区,企业客户接近5万家

可灵:快手做的视频生成AI
可灵:快手做的视频生成AI


它能做什么?

可灵的核心能力,说到底就一件事:生成视频

但具体怎么生成,有好几种方式:

文生视频:输入文字描述,AI直接生成对应的视频。这是最基础的方式。

图生视频:上传一张图片,AI让图片里的内容动起来。比如你上传一张风景照,它可以生成风吹草动、云卷云舒的效果。

视频续写:生成一段视频后,可以在它的基础上继续延长。单次生成最长15秒,但通过续写功能,最终可以生成最长3分钟的视频

首尾帧生成:你指定第一帧和最后一帧的画面,AI自动补全中间的全部内容

分辨率方面,可灵支持1080P高清输出,部分版本甚至支持原生4K(3840×2160)直出

它厉害在哪?

可灵的技术路线对标Sora,采用3D时空联合注意力机制来实现对复杂运动和物理规律的建模。用大白话解释就是:它生成的视频里,东西该怎么动就怎么动,不会出现那种“人走路像飘”的违和感。

可灵3.0系列是All-in-One多模态一体化模型——文字、声音、图片、视频都可以作为输入,也可以作为输出。它把影像创作中的理解、生成、编辑整合成了一个连续流程

在叙事能力上,可灵3.0支持智能分镜,创作者可以通过文字指令直接控制镜头的远近、推拉和叙事节奏。动作控制3.0功能能精准生成复杂的全身动作、手部动作和面部表情,效果可以媲美专业的动作捕捉技术

此外,可灵还实现了音画同步多语言口型匹配——支持中、英、日、韩、西五种语言。生成视频的时候,人物的口型能和声音对上。

谁在用?

可灵的用户覆盖了从普通创作者到专业影视公司的各个层面。

个人创作者可以用它做短视频、做创意内容。专业领域的使用场景更广——广告营销、影视短剧、游戏是主要方向。可灵曾与李少红、贾樟柯等9位导演共同发起“AIGC导演共创计划”,也亮相过釜山国际电影节和法国戛纳MIPCOM电视与内容产业盛会

值得一提的是,可灵在2026年从快手体系中独立拆分,开始独立融资。2026年第二季度,可灵AI的收入同比增长超过200%


可灵就是快手做的那个AI视频生成工具——你给文字或图片,它出视频。从最初的5秒片段到现在最长3分钟,从720P到原生4K,它正在从“能看”走向“专业可用”