Kling 4.0 是快手可灵 AI 第四代视频模型,支持单次原生 30 秒生成、多关键帧叙事、全能参考(Omni Reference)以及最高 4K 的 10-bit HDR 输出。
即将上线
Kling 4.0 生成功能即将上线
Kling 4.0 在本平台开放后,即可在此工作台直接生成。在此之前,您可以先使用 Kling 3 或 Seedance 2.5 创作视频。
现在即可使用
Kling 4.0
可灵 AI 视频模型
Kling 4.0 · 模型概览
Kling 4.0 是快手旗下可灵 AI 推出的第四代视频模型,围绕视觉真实感、创作可控性与叙事完整性全面升级:单次生成最长 30 秒,最多支持 10 个关键帧和 15 项多模态参考,并提供立体声音频与最高 4K 的 10-bit HDR 输出。
单次即可生成最长 30 秒的视频,是 Kling 3.0 上限 15 秒的两倍,足以容纳开场、主体动作与完整结尾。
在时间轴上放置最多 10 个关键帧,锁定构图、人物站位与叙事节点,关键帧之间的动态由 Kling 4.0 自动生成。
单次最多组合 10 张图片、5 段视频和 7 个主体,合计不超过 15 项,让人物、产品与风格保持更高一致性,并增强了基于参考的视频编辑能力。
高速运动、连续动作与复杂运镜的画面更加稳定流畅,大场面、追逐戏与大幅度运镜都能从容驾驭。
输出分辨率最高可达 4K,1080p 与 4K 均支持 10-bit HDR,色彩范围更广、渐变更平滑,为后期调色留出更大空间。
声音与画面同步生成,提供高品质立体声音频、更精准的口型匹配,并支持多种语言、口音与方言。
可对生成的片段进行一次或多次续拍,累计延展至最长 2 分钟,人物与场景在镜头之间保持连贯。
Kling 4.0 主要规格一览。
| 规格 | Kling 4.0 |
|---|---|
| 开发方 | 可灵 AI(快手科技) |
| 版本 | Kling 4.0(又称 Kling 4、可灵 4.0)与 Kling 4.0 Flash |
| 单次生成时长 | 最长 30 秒,原生生成 |
| 视频续拍 | 累计最长 2 分钟 |
| 关键帧 | 最多 10 个 |
| 全能参考 | 最多 15 项:10 张图片、5 段视频、7 个主体 |
| 提示词长度 | 最多 8000 tokens |
| 分辨率 | 最高 4K |
| HDR | 1080p 与 4K 支持 10-bit HDR |
| 画面比例 | 新增 21:9 超宽画幅 |
| 音频 | 双声道立体声,口型匹配更精准 |
| 语言 | 中文、英语、日语、韩语、西班牙语等,并支持多种口音与方言 |
Kling 4.0 分为两个版本:完整版追求极致的真实感与可控性,Flash 则侧重生成速度与成本效率。
面向高画质场景的完整版
面向高频创作的轻量版
借助单次 30 秒生成与关键帧,完整呈现开场、情节推进与收尾,再通过续拍延展为更长的连续段落。
利用全能参考保持产品与人物形象一致,输出 4K HDR 素材,用于新品发布页、社交媒体投放与电商详情页。
制作讲解视频、角色对白与本地化版本,在多种语言、口音与方言下实现口型同步。
高速运动、连续动作与复杂运镜的稳定性提升,适合追逐戏、体育集锦与气势恢宏的大全景镜头。
用最多 10 个关键帧锁定关键镜头,在正式制作前测试构图、节奏与运镜路径。
以 21:9 超宽画幅构图,并输出 10-bit HDR 素材,为专业调色留出空间。
创作流程
Kling 4.0 更适合先规划后生成:先明确叙事节点,再用关键帧与参考素材锚定画面,最后根据发布渠道选择输出规格。
第 01 步
将视频拆分为若干节点:例如第 0–10 秒交代主体与环境,第 10–20 秒展开主要动作,第 20–30 秒完成高潮或定格画面。结构清晰,模型就能更好地把握动作与运镜节奏。
第 02 步
为必须精确呈现的画面上传关键帧,再添加图片、视频或主体参考来控制人物、产品与风格。Kling 4.0 最多支持 10 个关键帧和 15 项参考素材。
第 03 步
描述主体、动作、运镜、光线、对白与声音。提示词长度上限为 8000 tokens,复杂场景可以逐个镜头进行描述。
第 04 步
选择画面比例(包括 21:9 超宽画幅)与所需分辨率。检查生成结果后,如叙事需要更多时长,可继续续拍,累计最长 2 分钟。
Kling 4.0 的可控性明显高于以往的可灵模型,以下做法有助于把这种控制力转化为稳定、可用的成片。
在片段开头和结尾放置关键帧,确定场景的起点与落点;中间只在叙事需要特定瞬间时再补充关键帧。
每个角色或产品使用一张干净、光线充足的参考图,让全能参考稳定保持各自形象,避免多种造型混杂。
为每一段分别写明运镜方式,例如缓慢推近、环绕或跟拍,而不是用一句话概括整段 30 秒。
把台词放在引号内,并注明说话人及语言或口音,让口型与声音对应到正确的角色。
按时间写明环境音、音效与音乐,让立体声音频配合画面动作,而不是相互干扰。
向 2 分钟续拍时,各段的角色与风格描述保持一致,只改变动作内容。
下表对比 Kling 4.0、Kling 3.0 与 Seedance 2.5 已公开的能力,展示各模型最适合的场景。
| 能力 | Kling 4.0 | Kling 3.0 | Seedance 2.5 |
|---|---|---|---|
| 单次生成时长 | 原生 30 秒 | 3–15 秒 | 最长 30 秒 |
| 叙事控制 | 最多 10 个关键帧,可在时间轴层面精确控制 | 单条提示词生成多镜头叙事 | 首帧控制,以及用于镜头调度的 3D 空间预演 |
| 参考素材 | 最多 15 项:10 张图片、5 段视频、7 个主体 | Kling 3.0 Omni:最多 7 张图片和 1 段参考视频 | 最多 50 项:30 张图片、10 段视频、10 段音频 |
| 分辨率 | 最高 4K,1080p 与 4K 支持 10-bit HDR | 720p 与 1080p,另有原生 4K 模式 | 720p 至原生 4K |
| 音频 | 立体声音频、更精准的口型匹配,支持多种语言、口音与方言 | 原生音频,支持多语言语音与口音 | 原生音频,可使用音频文件作为参考 |
| 更长的段落 | 视频续拍,累计最长 2 分钟 | 单条视频内包含多个镜头 | 可延长或编辑已上传的视频 |
| 适用场景 | 需要关键帧精度、丰富参考素材与 HDR 交付的长镜头叙事场景 | 15 秒以内的电影感短片,适用于社交媒体、广告与短场景 | 参考素材密集的 30 秒制作与 4K 品牌内容 |
自 2024 年 6 月上线以来,可灵 AI 每隔几个月便推出一次重要模型更新。Kling 4.0 在视频时长、创作控制与输出画质上实现了最大的一次跨越。
| 版本 | 发布时间 | 主要亮点 |
|---|---|---|
| Kling 1.0 | 2024 年 6 月 | 可灵文生视频与图生视频正式对外开放 |
| Kling 1.5 | 2024 年 9 月 | 支持 1080p 高清输出,动态质量提升 |
| Kling 2.0 | 2025 年 4 月 | 动态表现、语义理解与画面质感大幅提升,并新增多模态视频编辑 |
| Kling 2.5 Turbo | 2025 年 9 月 | 生成速度更快、成本更低,提示词遵循能力更强 |
| Kling 2.6 | 2025 年 12 月 | 首个支持原生音频的可灵模型,可生成人声、音效与环境声 |
| Kling 3.0 | 2026 年 2 月 | 支持 3–15 秒视频、多镜头叙事与多语言原生音频 |
| Kling 4.0 | 2026 年 | 单次原生 30 秒生成、10 个关键帧、15 项参考、最高 4K 10-bit HDR,续拍最长 2 分钟 |
以下示例均按完整的 30 秒视频撰写,包含清晰的节奏节点、运镜与声音描述,便于模型从头到尾把握场景节奏。
0–10 秒:一块哑光黑色智能手表在湿润的石质底座上缓慢旋转,柔和轮廓光,微距镜头。10–20 秒:镜头环绕移动,屏幕亮起,雨滴从表镜滑落。20–30 秒:镜头拉远,呈现黄昏时分被雨水浸润的城市天台全景,表盘微微发光。低沉的氛围合成器音乐与轻柔雨声,立体声。
夜晚温暖的咖啡馆。一位身穿绿色外套的年轻女子从笔记本上抬起头,用英语说:"You came back." 对面的男子微笑着用西班牙语回答:"Nunca me fui del todo." 镜头缓慢推近,浅景深,背景是低声交谈与轻柔的钢琴声。
以第 1、5、10 个关键帧为锚点:一位骑红色自行车的快递员在日出时驶入狭窄小巷,正午穿过拥挤的集市,日落时停在港口大门前。人物服装与自行车保持一致。跟拍镜头位于车把高度,21:9 超宽画幅,鼓点节奏逐渐增强。
0–10 秒:一辆拉力赛车在泥泞的林间弯道漂移,泥浆溅向镜头,低机位跟拍。10–20 秒:无人机镜头升起,跟随赛车越过坡顶,阳光穿过树林形成光晕。20–30 秒:赛车以慢动作冲过终点线,观众欢呼。立体声的引擎轰鸣与人群声。
明亮的演播室里,一位主持人手持一副无线耳机,用英语说:"Twelve hours of battery, one small case." 随后用日语重复这句话,再对着镜头微笑。中景,柔和主光,干净的演播室环境音。
21:9 超宽画幅,10-bit HDR。黎明时分云雾缭绕的山谷。0–10 秒:镜头在云层之上缓慢航拍滑行。10–20 秒:镜头下降,逐渐接近山脊上的一位骑手。20–30 秒:骑手停下,阳光越过群峰洒落。渐强的管弦乐与轻柔风声。
关于 Kling 4.0 的功能、参考素材、分辨率、提示词以及与其他视频模型对比的解答。
Kling 4.0 是快手旗下可灵 AI 推出的视频生成模型。它可以根据文字、图片和多模态参考素材单次生成原生 30 秒视频,最多支持 10 个关键帧和 15 项参考,并新增立体声音频、更精准的口型匹配,以及最高 4K 的 10-bit HDR 输出。
新账号可获得免费额度即刻开始体验,无需下载。Kling 4.0 生成按积分计费,当前套餐与积分包请查看定价页。
Kling 4.0 是完整版模型,支持单次原生 30 秒生成、10 个关键帧、15 项多模态参考与最高 4K 的 10-bit HDR 输出。Kling 4.0 Flash 面向高频创作场景,主打更快的生成速度与更高的性价比。Flash 适合草稿与快速迭代,完整版适合追求高画质的最终成片。
Kling 4.0 单次生成最长 30 秒,是 Kling 3.0 上限 15 秒的两倍。借助视频续拍功能,可对片段进行一次或多次续拍,累计延展至最长 2 分钟。
支持。Kling 4.0 最高支持 4K 分辨率,并在 1080p 与 4K 下提供 10-bit HDR 输出。与常见的 8-bit 视频相比,10-bit 色彩的渐变更平滑,后期调色空间也更大。
全能参考(Omni Reference)单次最多支持 10 张图片、5 段视频和 7 个主体,合计不超过 15 项。多关键帧功能最多支持 10 个关键帧,用于控制整段视频的构图与节奏。
全能参考(Omni Reference)是 Kling 4.0 的多模态参考系统。单次生成最多支持 10 张图片、5 段视频和 7 个主体,合计不超过 15 项,用于控制人物、产品、风格与动作。相比以往版本,参考维度更丰富,一致性也更稳定。
可以。可灵 AI 将视频编辑能力的增强列为 Kling 4.0 全能参考升级的一部分。每次最多可使用 5 段视频参考来引导已有场景的改动,具体修改内容由提示词描述。
Kling 4.0 新增 21:9 超宽画幅,适合电影感构图,在以往可灵模型的横屏、竖屏与方形画幅基础上进一步扩展。
Kling 4.0 强化了高速运动、连续动作与复杂运镜下的稳定性。大场面、追逐戏与大幅度运镜的画面比以往版本更加稳定流畅。
Kling 4.0 在生成视频的同时生成高品质立体声音频,口型匹配更加精准。语音支持中文、英语、日语、韩语、西班牙语、葡萄牙语、德语、法语、印地语等多种语言,并支持多种口音与方言。
Kling 4.0 在真实感、可控性与叙事长度上全面升级:
两者都能生成最长 30 秒、最高 4K 的视频。Kling 4.0 的优势在于关键帧级别的时序控制、10-bit HDR 输出以及最长 2 分钟的续拍。Seedance 2.5 可容纳最多 50 项参考素材(含音频文件),更适合参考素材密集的品牌与产品内容。
Kling 4.0 的提示词上限为 8000 tokens,足以把 30 秒视频按镜头逐一描述,包括运镜、对白与声音。
建议围绕时间轴组织提示词,而不只描述单一瞬间:
必须精确呈现的内容交给关键帧与参考素材,文字部分用于引导动作与节奏。
Kling 4.0 由快手科技旗下的 AI 视频生成平台可灵 AI 开发。可灵模型家族于 2024 年 6 月上线,此后每隔几个月推出一次重要升级,从 Kling 1.0 一路迭代至 Kling 4.0。