2026 年,AI 视频生成模型行业正经历从“技术验证”到“工业化商用”的关键跃迁。
7月31日,字节跳动发布新一代视频创作闭源模型Seedance2.5。模型正式从生成一个片段”走向“完成一段创作”。
核心亮点,是把单次视频生成时长从15秒提升至30秒,支持多轮延长,优化镜头衔接和场景过渡;多模态参考能力方面,用户单次输入最多30张图片、10段视频、10段音频作为参考素材等。该模型已陆续上线豆包、即梦等产品,还将向企业用户开放。
同一天,稀宇科技正式发布MiniMax H3。它是国内首个商用级旗舰开源全模态视频模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持15s 2K分辨率。
在今年的2月5日,快手可灵3.0全球上线,覆盖图片生成、视频生成、后期编辑全流程。据传闻,可灵4.0或将今年Q3或Q4公测。
若可灵4.0如期发布,国内AI视频模型将形成Seedance、Kling、MiniMax H3三足鼎立。
三巨头的陆续推出,标志国内AI视频模型告别单纯画质内卷,分化为闭源工业化路线与开源生态路线两大阵营;行业正式从技术演示阶段,全面进入商业化落地淘汰赛。
今天我们来研究AI视频生成模型。下文从:① AI 视频生成模型--基础知识扫盲;② 市场空间&竞对:③ 产业链;④ 相关标的;⑤ 总结&展望;等五个维度来解析。

一、AI 视频生成模型--基础知识扫盲
1、概念
AI 视频生成模型,是指以深度学习为核心技术,通过文本、图像、音频或视频等多模态输入,自动化生成视频内容的AI系统。其核心目标是将自然语言或视觉素材转化为具有时序连贯性、物理合理性和叙事表达力的动态视频画面。
其核心产品形态包括文生视频(Text-to-Video)、图生视频(Image-to-Video)、视频编辑与风格迁移(Video-to-Video),以及全模态统一生成。由于AI视频生成同时融合文本、图像、音频等多模态信息,天然具备更高的复杂性与表达力,代表着AIGC产业能力上限。
与传统视频制作依赖摄影设备、演员和后期团队不同,AI视频生成将"拍摄-渲染-剪辑"的全流程压缩为一次模型推理,从根本上重构了视频内容的生产范式。
2、难在哪?
AI 视频生成需处理空间、时间、因果与交互等高维结构,并要求将文字、图像、音频等模态映射到同一表征空间,其复杂性要求模型必须具备对真实世界的综合理解与推演能力:
1)空间:视频需理解物体形状、位置关系、遮挡与深度等三维结构;
2)时间:视频要求模型在连续帧中保持状态演化一致性,学习动力学规律与行为轨迹;
3)因果与交互:视频呈现对象间的作用、反应与事件链条,迫使模型掌握因果机制和多实体交互规则。
当前文本、图片、音乐等模态生成技术已相对成熟,AI视频模型仍是行业技术短板,其突破将对AIGC的产业应用前景起到决定性作用。
3、五大核心特点
4、四大技术路径演进

下表:AI 视频生成技术各阶段能力对比
发展阶段 | 分辨率 | 视频时长 | 动作连贯性与物理质量 | 核心缺陷 |
早期萌芽探索阶段 | 极低约 64×64 | 3 秒以内 | 运动模式单一,严重模糊,时间 一致性极差 | 画面几乎无可辨识的主体,无实用价值 |
技术突破阶段 | 低约 256×256 | 5-10 秒 | 画质明显提升,但主体一致性差,运动常违反物理规律,画面易“畸变”、“抽搐” | 画质较粗糙,角色外貌易突变,无法维持逻辑 性长镜头 |
架构统一能力飞跃阶段 | 480P-1080P | 约30-60 秒 | 开始具备初步物理规律模拟能力(光影、遮挡),运动流畅度大幅提高 | 复杂交互和长视频的逻辑一致性仍有破绽 |
真实世界技术成熟阶段 | 1080P-4K/8K | 分钟级以上 | 运动与物理一致性显著增强,可同步生成原生音频,向理解三维世界演进 | 长程交互、记忆与可控性仍在探索,计算成本 极高 |
(1)2014-2016 | GAN–VAE阶段:确立视频可被端到端生成
视频生成技术最早可追溯至2016年UC Berkeley提出的VGAN,该模型首次将生成式对抗网络(GAN)引入视频生成任务,并通过空间–时间卷积结构实现低分辨率短时动态序列的合成。
但该阶段的模型多基于GAN的对抗式重建能力 VAE的连续潜空间表达,受限于模型架构限制,应用范围仅限于简单场景(如数字、基础动作),生成分辨率与时长均较低(64×64像素),存在严重的模式崩溃和训练不稳定性,无法用于开放域视频生成。
但确立“视频可被端到端生成”的技术方向,是后续技术跃迁的理论起点。
(2)2017-2021年 | Transformer表征阶段:时空表征能力显著提升
2017年Transformer论文发表后,该架构快速渗透至各类序列建模场景,并在视频生成任务中开启探索。自2021年Google推出Video Vision Transformer(ViViT)起,GODIVA、VideoGPT、Phenaki、CogVideo、NUWA 等视频模型相继出现。
相较于GAN系列,Transformer具备明确的概率密度建模能力、收敛过程更稳定,并能够有效捕捉跨帧长程依赖,在生成时序一致、衔接自然的动态内容上更具优势。但由于其计算复杂度随空间与时间token数呈平方级增长,分辨率与时长提升将带来指数级的算力压力,导致该阶段模型在生成效果上仍受限制,其产业价值主要体现在从“能生成”迈向“能理解再生成”。
(3)2020–2023 | Diffusion扩散模型阶段:时长与物理一致性,存在技术上限
扩散模型(Diffusion)通过“逐步加噪—逆向去噪”的显式概率建模范式,解决了GAN在训练稳定性和可控性上的核心缺陷,为高质量视觉生成奠定了基础。
2022年,Meta发布Make-A-Video,其可根据自然语言生成约5秒短视频,是推动视频生成技术进入商业化探索阶段的早期代表之一。
但传统扩散模型的去噪网络基于 U-Net,以局部卷积为核心,仅能在空间维度做局部感受野建模,缺乏时间维度的统一表征,无法捕捉跨帧长程依赖与物理一致性。基于该架构的视频扩散模型会出现误差沿时间轴累积的问题,引发跨帧漂移、运动不连续等现象,制约了生成视频的时长上限与整体一致性。
下图: 扩散模型的前向扩噪/逆向去噪过程展示

(4)2024年--至今 | DiT架构革命:Sora→全模态融合
2024年2月,OpenAI发布Sora,首次在工业级规模上验证DiT(Diffusion Transformer)架构:以Transformer替代U-Net作为去噪网络,将视频切分为时空Patch Token,通过全局自注意力机制统一处理全画面时空信息。
DiT 在继承扩散模型生成稳定性、训练可控性等基础优势的同时,引入了Transformer的推理能力、长程依赖建模能力与多模态统一表示能力。
这是AI视频的"GPT-1时刻"——视频生成首次展现出可行性,物体持久性等简单行为从算力扩展中涌现。此后Google Veo、Runway、Seedance、快手可灵、Vidu等海内外厂商快速跟进,DiT成为全行业统一标准。
而后,随着Seedance 2.5、MiniMax H3为代表的发布,行业进入"全模态融合 工业化生产"阶段。核心标志包括:原生4K输出、音画同步直出、30秒长视频、智能分镜叙事、局部编辑控制、物理规律模拟。竞争焦点从"能生成"转向"可交付"。
下图:DiT架构亦遵循大模型scaling law规则

5、商业模式
AI生产视频商业化路径,分为C端订阅与B端API/解决方案两大模式:
To C端:主要通过订阅制收费,用户可按需选择免费版、标准版、高级版、尊享版等不同等级,月度订阅价格从几元至数百元不等,典型客户包括内容创作者、短视频用户及泛娱乐消费群体。
To B端:主要通过API调用与定制化解决方案变现,客户覆盖影视制作、互联网平台、电商营销、广告代理等行业,费用按调用次数、生成时长或项目定制程度计价,月度支出从几十元至数万元不等。
下图:主要的视频大模型定价

我们以快手可灵 Kling 为例:
(1)期初海外自媒体、视频超级创作者为主,通常是个人或小团队用于创作效率提高的场景,有较好的付费意愿,通过 APP 和 PC 端直接登录,订阅会员费的模式获取快速通道和积分,生成不同分辨率的视频消耗对应定价的积分。
(2)随着视频模型的能力升级,目前更多企业客户(B 端)开始接入 API 使用视频模型。客户销售方式通常分类两类,一类是分销平台,类似于Higgsfield 这些为创作者提供多模态生成工具的聚合模型平台,会引入各类多模态生成模型;另一类是直接销售给 B 端,例如广告、游戏、电商等行业的企业客户;通常 API 接入的模式则按照实际的 Token 消耗收费。
6、世界模型是AI视频生成的拐点
(1)AI生成短视频逼近专业水准,物理性与时长仍是瓶颈
AI视频生成经历了GAN-VAE(2014-2016)、Transformer(2017-2021)、Diffusion(2020-2023)到DiT(2024至今)四个阶段,主流厂商已全面收敛于DiT架构。
当前美学质量与多模态融合已接近专业水准,Veo 3率先实现音视同步商业化。但两大结构性瓶颈仍未突破:一是物理可信度不足,隐式物理与显式物理两条路径各有取舍;二是生成时长受限,主流模型仅5-20秒,长时一致性难以维持。

(2)世界模型为何是发展拐点
世界模型(World Model)是人工智能领域用于模拟环境动态并预测未来状态的核心技术框架。其核心思想是让AI系统学会“理解世界如何运作”,而不仅仅是“根据输入产生输出”,即让AI像人类一样,可预测物理世界,从而指导决策。
世界模型由"状态表征 动态建模 决策"三模块构成,其"维持可运行世界"的底层逻辑恰好直击视频生成在长时一致性与物理可信度上的核心短板。
与DiT范式不同,世界模型具备独立的架构路径,在空间一致性和物理逻辑方面迭代更快——DeepMind的Genie从2代到3代不到一年即实现量级提升。同时,世界模型四代演进路径的前三阶段与视频生成技术需求高度耦合,视频生成本质上是世界模型的雏形形态。
下图:世界模型四代演进路径

目前,全球已有12家以上厂商入局世界模型赛道,涵盖NVIDIA、Google DeepMind、World Labs、Runway、字节跳动、华为、可灵等。隐式物理路径以NVIDIA Cosmos和Google Genie为代表,强调端到端学习;显式物理路径以World Labs和Runway为代表,强调可交互3D重建。
2026年,世界模型有望迎来"GPT-3时刻"---从技术展示迈向商业化应用,视频生成的时长瓶颈与物理可信度问题,将随之迎来实质突破!
二、市场空间&竞对
1、全球市场
全球AI视频生成市场正处于高速成长阶段,根据Precedence Research预测,2025年市场规模约为2.19亿美元,预计2026年将增长至2.96亿美元,同比增长35.16%;至2034年有望达到33.32亿美元,2025–2034年间的复合增长率(CAGR)达35.32%。
分群体和行业看,目前行业以B端客户为主,约占65%-70%,其中营销广告、影视娱乐两大行业贡献70%以上的份额。
2、中国市场
2025年中国AI视频生成模型行业市场规模为12.1亿元,同比增长77.9%;预计2030年市场规模将达到1,497.0亿元,复合年增长率为402.7%。中国市场增速显著快于全球平均水平。
另外,国内AI视频生成工具月活用户,2025年约860万 → 2026年1月已超2000万,增长132%。
其中,AI漫剧/短剧是市场,巨量引擎预测2025年AI漫剧规模突破200亿元;DataEye预估2026年国内AI剧/漫剧市场突破400亿元,同比增长138%。
下图:AI视频生成行业增长驱动因子评估:

3、竞争格局
第一梯队
1)Google Veo3.1:海外天花板,物理仿真、光影流体、电影运镜最强,但亚洲人脸弱。
2) Seedance2.5:国内第一,30 秒原生长视频、亚洲人、中文、短剧最强,复杂流体、物理碰撞弱于Veo3.1。
3)Runway Gen4.5:创意工具链最完善、短片美学,面向海外工作室。
第二梯队
1)可灵 Kling3.0 :全球首个原生4K直出,原生单次15秒,支持智能分镜、基础主体参考,适合常规短视频、广告素材。
2)MiniMax H3:视频编辑能力Artificial Analysis榜单全球第一,其 2K 分辨率下的每秒单价,仅为Seedance的1/3不到。
3)生数 Vidu Q3:"为剧而生",全球首个16秒原生 一体化音画同步、口型匹配业内标杆。
4)爱诗 PixVerse V6:生成速度快,擅长电影运镜与自动多镜头分镜,创意风格表现力突出,适合轻量化短视频快速创作,全球用户超1亿。
下图:各大AI视频生成模型全对比

三、产业链
中国AI视频生成模型产业链,上游为算力与数据,产业链价值占比30%,技术壁垒最高;中游是模型研发与训练;产业链价值占比40-50%,为核心枢纽;下游为AI视频模型的应用场景,产业链价值占比20%-30%,是商业变现的主体。
AI 视频生成产业链目前是一个“算力抽税、模型打工、流量变现”的格局,三者协同驱动行业从技术研发走向规模化、合规化与商业化落地。


1、上游:算力基础设施-- 价值占比约30%
上游包含环节: AI 芯片(GPU)、智算中心、云服务提供商,以及数据采集、清洗、标注和版权交易服务等基础设施,是AI视频生产的发动机和燃料。(1)AI芯片(算力)瓶颈:
视频生成对算力的消耗呈指数级高于文本和图像生成。 一条15秒视频约消耗30万Token,是代码生成的数十倍。训练阶段需要千卡级GPU集群(A100/H100/H200),推理阶段需高带宽显存支撑高分辨率长视频的实时去噪。AI 芯片,尤其是GPU 供应链的波动直接影响整个行业的研发节奏。
(2)高质量数据的极度稀缺:
视频模型训练需要千万小时级别的真实世界视频数据。数据质量直接决定模型能力上限。相比于图文,高质量的“视频-文本”对数据极度缺乏。模型需要理解物理世界的规律,这就要求训练数据不仅画质高,还要有极其精准的时空多维度标注。
(3)数据层合规与版权:
数据层包括视频数据采集与标注、多模态数据对齐(文本-视频-音频配对)、数据清洗与去重、合成数据生成(仿真数据用于具身智能训练)、版权合规管理,抓取受版权保护的影视素材进行训练,面临严峻的法律和监管不确定性。
2、 中游:模型研发、训练与工具平台--价值占比40%-50%
中游这是整个产业链的“大脑”,负责将算力和数据转化为实际的生成能力。包含:基础视频生成模型(Google Veo、 Seedance等),以及基于这些模型搭建的 API 接口、视频编辑与转码优化工具(MaaS 服务)。
技术难点包括:1)时空一致性: 早期模型生成的视频往往会出现人物变形、背景闪烁等问题。让画面在时间流逝中保持连贯,是目前最大的技术门槛。2)物理规律的模拟:AI 很难理解真实世界的物理法则(比如重力、流体动力学、物体碰撞)。3)推理成本与实时性: 目前生成一段几秒钟的高质量视频往往需要等待数分钟。如何优化算法,降低单次生成的推理成本并走向“实时生成”,是商业化落地的关键。
(1)模型与算法层
产业链核心环节,技术壁垒最高。包含:①基础模型训练(DiT/A2D架构设计、预训练 后训练pipeline、Scaling Law验证);②多模态融合(文本编码器如T5/Qwen、视觉Tokenizer/3D VAE、音频联合生成);③推理优化(Flow Matching、模型蒸馏、量化压缩、KV Cache优化);④可控生成技术(局部编辑、主体参考、风格控制、智能分镜)。
可灵3.0将文生/图生/参考生/编辑融合于统一模型训练;Runway Gen-4.5的A2D架构融合自回归场景理解与扩散像素渲染;MiniMax H3打破任务边界,将T2I/T2V/T2A/编辑/参考统一建模。
(2)工具与平台层
将模型能力封装为创作者可用的工具产品。包括:视频编辑器(时间线、图层、遮罩)、智能分镜/Agent工作流(万兴剧厂"无限画布"、可灵"灵动画布Agent模式")、模板化创作引擎、API/SDK开发平台。工具层的核心价值是降低创作门槛——从需要数周prompt工程经验,到"一句话生成完整短片"。
3、下游:场景应用与分发--价值占比20%-30%
下游AI生成视频的应用是技术的“变现场”,直接面向 B 端企业和 C 端消费者。
核心场景包括:① AI漫剧/短剧(DataEye预估2026年国内400亿 ,海外6.5亿美元 550%增速);② 广告营销(动态AI视频素材点击率比静态图文高41%);③ 电商展示(产品图转视频);④ 影视辅助(概念设计、背景扩展、低优先级特效);⑤教育培训(上万所中小学制作教学微课);⑥ 具身智能训练数据(Seedance 2.5为穹彻智能/微分智飞生成机器人操作数据);⑦ 游戏开发环节,AI 3D建模则可逐步替代传统手工建模。
B端需求贡献行业65%-70%营收。C端则以订阅制为主,付费率从3%-8%向15%-20%提升;B端以API调用为主,按Token/时长计费(720p约-0.74/5秒)。
另外分发渠道,主要分为短视频平台(如抖音、快手)、内容分发网络以及广告投流平台等。

四、相关标的
以下是不完全列举:
1、算力基础设施层
(1)AI芯片:① 昇腾(950等)、② 寒武纪(MLU训练芯片)、海光信息(DCU)、摩尔线程、沐曦股份、云天励飞(推理芯片);长鑫(DRAM)、澜起(内存接口芯片)等。
(2)AI服务器龙头:① 浪潮信息:国内AI服务器龙头,为Seedance等视频大模型提供核心硬件支撑;② 中科曙光:高端智算设备商,深度适配大模型推理场景。③ 工业富联:全球AI服务器代工领域的绝对龙头,全球市占率超40%。④ 紫光股份:AI算力网络 整机全栈龙头,旗下新华三为AI服务器及高速交换机核心供应商。
(3)数据中心AIDC :① 润泽科技:IDC龙头,绑定字节;② 光环新网:第三方IDC老牌龙头,京津冀、长三角核心地段布局优质机房资源;③ 宝信软件:华东IDC龙头;④ 数据港批发型IDC龙头;⑤ 奥飞数据:华南IDC龙头。
(4)光器件/光模块:中际旭创、新易盛、天孚通信、意华股份等。
(5)电源&温控:① 中恒电气、② 金盘科技、③ 英维克、④ 申菱环境。
2、模型与算法
(1)视频模型大厂:① 字节跳动(未上市):Seedance 2.5/即梦AI,国内用户规模最大AI视频工具(MAU 800万 )。② 阿里巴巴:happyHorse AI视频生产模型,可生产15秒视频。③ 腾讯:混元HunyuanVideo,13亿参数开源DiT架构。④ 智谱:清影CogVideo(国内首款开源文生视频。
(2)快手:可灵AI 3.0,年化收入超5亿美元,拟200亿美元估值分拆IPO。
(3)MiniMax(稀宇科技):H3模型,视频编辑能力全球第一,首款开源多模态生成模型。
(4)昆仑万维:SkyReels V3/V4,影视级AI视频生成平台,开源SkyReels-A1/A2。
(5)其他未上市的龙头:① 生数科技:Vidu Q3,全球首个16秒音画直出;② 爱诗科技:PixVerse V6,全球用户超1亿等。
3、工具与平台层
(1)万兴科技:万兴天幕/万兴剧厂/万兴喵影,全球AIGC视频创意软件中国第三方第一;AI漫剧全链路;战略投资生数科技/灵漫快创。
(2)蓝色光标:集成Seedance 2.0实现广告视频批量生成,AI营销全链路。
(3)美图公司:MOKI,集成美图奇想大模型 Vidu 可灵AI三引擎,智能匹配最佳模型。
(4)四方精创:AI视频内容审核与处理。
(5)商汤科技:稀缺大模型及AI短剧出海平台龙头,Seko 2.0,"一人剧组"AI短剧制作,SekoIDX角色一致性,SekoTalk多人对口型。
4、AI视频模型的应用:AI影视、营销、漫剧/短剧、游戏等
(1)AI影视/短剧内容制作:中文在线、欢瑞世纪、荣信文化、引力传媒、捷成股份、华策影视、上海电影、华录百纳、芒果超媒。
(2)AI短剧工具平台:万兴科技、掌阅科技、光线传媒、当虹科技。
(3)AI短剧营销与出海分发:蓝色光标、易点天下、昆仑万维。
(4)中文在线:AI漫剧IP源头,数字内容与IP运营龙头,AI短剧出海绝对龙头。
(5)AI游戏开发:三七互娱、世纪华通、完美世界、巨人网络、游族网络等。
五、总结&展望
2026年的AI视频生成,正处在一个前所未有的历史性拐点上。当字节Seedance 2.5与MiniMax H3选择在同一天亮相,当快手可灵以200亿美元估值蓄势待发,——这个行业的故事,已经从"谁能生成画面"的实验室叙事,走向了"谁能交付产品"的产业叙事。
回望技术演进之路,从2016年GAN生成64像素模糊短片,到2024年Sora以DiT架构开启"GPT-1时刻",再到2026年原生4K、30秒长视频、音画四轨同步直出——短短十年间,AI视频走完了传统影视工业百年的技术历程。
这不仅是分辨率的提升、时长的延长,更是AI从"像素统计"到"世界模拟"的认知跃迁。
当PixVerse V6让AI理解重力与碰撞,当Seedance 2.5为具身智能机器人生成训练数据——视频生成模型正在从"内容工具"进化为"世界理解器"。
竞争格局上,一个清晰的趋势已经浮现:中国在时长、商业化、性价比上全面领先,美国在分辨率、物理模拟、架构创新上保持优势。全球TOP10文生视频模型中8款来自中国,Seedance生态五端协同、MiniMax以三分之一价格开源破局——中国企业的"应用驱动 生态闭环"模式,正在跑通美国"技术驱动 单点突破"未能跑通的商业化路径。
Sora的关停不是AI视频的终局,而是产业重构的起点。
未来,三条主线将定义AI视频的下一个十年:
第一,从"生成画面"到"理解世界"。 视频模型不再只服务于内容产业,已经开始理解和预测真实世界——Runway的GWM-1已延伸至机器人仿真和可交互世界,Seedance 2.5已被具身智能公司用于生成机器人训练数据。
第二,从"工具替代"到"范式重构"。 AI不是影视的效率辅助,而是正在彻底重构产业运行的底层范式。AI漫剧单集制作成本降至人工拍摄的1/10,制作周期从"年更"迈向"日更",万兴科技提出"千亿级AI影视出海"愿景。当一个创作者能完成过去一个团队的工作,影视产业的"创意平权"时代真正到来。
第三,从"中美竞速"到"中国引领"。 随着Sora退场、Runway被超越,中国AI视频正从"追赶者"转变为"引领者"。Seedance 2.5产业渗透至徐工/小鹏/穹彻智能、MiniMax H3开源推动国产芯片适配。

中国企业的"技术 场景 生态"三位一体模式,正在定义AI视频的全球标准。
总之,AI视频生成的未来,不在于它能多逼真地模拟现实,而在于它能多深刻地拓展想象的边界。
而这条边界的拓展速度,或许将远超我们所有人的预期。


VIP复盘网