视频大模型卷向第二个维度,生数科技 Vidu S1 打响第一枪 | 前沿在线

编辑:前沿在线 编辑部

你觉得视频大模型接下来会卷什么?

更高的分辨率?更长的时长?更逼真的画质?

这些当然还会继续卷。而且卷得很凶。就在过去三个月里,头部模型已经从 1080P 卷到了原生 4K,时长从十几秒卷到了三十秒。

影视级内容、广告、短剧这些场景,就是需要更高清、更长、更逼真的生成能力,这条路还远没到尽头。

但我想说的是,除了画质和时长,一个新的竞争维度正在打开。

这个新维度叫:实时交互。

是 AI 不再是一段你只能看的视频,而是一个能跟你面对面聊天的角色。

这件事,已经发生了。

今年 WAIC 上,生数科技展台前排队的人绕了三圈。有人玩了十分钟不想走,有人反复测各种指令,连路过的老外都停下来看了两眼。

最火的一个测试,是让 AI 角色 “把眼镜摘下来”。

很多人第一次看到这个动作的时候,都愣了一下。不是因为这个动作有多难,而是因为它居然真的能摘。

很多 2D 数字人方案里,眼镜是贴在脸上的贴图,跟脸是两层东西,自然摘不下来。

它能摘,说明它真的理解 “眼镜” 是什么,理解眼镜和脸的关系,理解 “摘” 这个动作的物理逻辑。

一个简单的动作,背后是两套完全不同的技术路线。

而这,就是视频大模型第二条战线的起点。

画质这仗,还远没打完

先说清楚,画质、时长、一致性,这些基础能力依然非常重要,而且还在快速进步。

过去半年,整个行业在这条战线上的进步可以用 “狂飙” 来形容。

分辨率上,头部模型已经从 1080P 卷到了原生 4K,不是后期超分,是从底层直接生成 4K 画面。

时长上,从十几秒卷到了三十秒,简单场景甚至能拉到几分钟。一致性、物理合理性、镜头逻辑,也都在快速提升。

据前沿在线梳理,目前国内至少有三家能做到原生 4K 输出,能做到 1080P、30 秒稳定生成的团队就更多了。

更重要的是,AI 视频正在告别 “抽卡时代”。

前两年做 AI 视频,提示词是个高度玄学的东西。同样的指令生成十次有十个结果,能用的素材全靠碰运气,业内戏称 “AI 视频生产 = 抽卡”。

但现在不一样了,随着多条件控制能力的跃升,模型已经能按分镜脚本精准控制镜头语言,生成过程越来越可控。

“能生成” 早就不是壁垒了,”能不能稳定产出好内容” 才是。

但问题也来了,当头部模型的基础能力都到了很高的水平,再往上卷,边际收益就开始递减了。

从 480P 到 720P,人人都能看出区别;从 720P 到 1080P,仔细看能看出来;

从 1080P 到 4K 呢?在手机屏幕上、在短视频场景下,大部分人其实感知不到明显差异。

不是说 4K 没用。恰恰相反,影视级内容、高端广告、大屏展示这些场景,对画质的追求是无止境的。

4K、8K、120fps、物理级渲染,这些方向依然有巨大的价值空间,而且会一直卷下去。

但对大部分通用场景来说,短视频、社交媒体、日常创作,720P、1080P 已经 “够用” 了。

当所有人都过了 “够用” 这个门槛,竞争就会自然地往新的维度延伸。

这其实是所有行业的规律,任何一条增长曲线,都会有边际收益递减的一天。真正厉害的公司,会在第一条曲线还没到顶的时候,就开始布局第二条曲线。

视频大模型行业,现在正处在这个节点上。第一条战线还在打,而且打得很凶;但第二条战线已经悄悄开打了。

第二条战线为什么不一样?

那这条新战线到底是什么?很多人第一反应是,生成得更快了。

但我得说,这个理解还是浅了。实时交互不是 “更快的生成”,是生成范式变了。

第一条战线上的视频生成是什么样的?

你输入一段提示词,模型算几十秒,给你返回一段固定的视频。

整个过程是单向的、一次性的、不可干预的。就像去照相馆拍照,摄影师按快门,你等结果,不满意就重拍。

第二条战线上的实时交互是什么样的?

你边说它边生成,你随时打断它随时调整,你换个话题它马上跟着变。

整个过程是双向的、持续的、可干预的。

就像跟一个真人视频通话,对话是流动的,反应是即时的,过程是共创的。

这两种模式的差别有多大?就像唱片和现场演出的差别。唱片再高清也是固定的,现场演出再粗糙,它是活的。

Vidu S1负责人张金涛在一次专访中说过一个判断我很认同:视频生成未来的关键变化,不只是从 “生成得不够好” 变成 “生成得更好”,而是从 “生成一段内容” 走向 “生成一种体验”。

离线视频生成对应的是高质量内容生产,电影、广告、短片、精准剪辑。

但人类还有很多需求,本质上是实时发生的。

比如你喜欢一个人,你不会只满足于每天看他的照片,或者看他提前录好的视频;你会想和他说话,想见到他,想看到他对你产生即时反应。

游戏也是一样,真正吸引人的不是看一段提前录好的内容,而是在一个世界里行动,并且立刻得到反馈。

从这个角度看,流式视频生成不是简单地让视频生成更快,而是让视频模型从 “一次性生成内容” 变成 “持续生成交互体验”。

新维度会带来什么变化?我觉得至少三个本质不同。

首先是商业模式变了。

以前卖的是内容,按条收费,一锤子买卖。以后卖的是时间,按分钟收费、按订阅收费,持续性收入。

一个工具卖 99 块钱一年用户觉得贵,一个能陪你聊天的 AI 角色一个月收 29 块,用户觉得便宜。价值逻辑完全不一样。

从工具到陪伴,用户付费的心理账户完全不同。这不是定价的问题,是价值感知的问题。

然后是用户规模变了。

以前的用户是创作者,做视频的、做广告的、做短剧的,几千万的规模。以后的用户是所有人,只要你需要跟 AI 交互就是潜在用户,几十亿的规模。

从生产工具到消费入口,用户量级差了好几个数量级。

这个变化有多重要?你看看大语言模型的发展路径就知道了。

最早的大模型也是给开发者用的工具,后来 ChatGPT 出来,变成了人人能用的产品,用户规模直接涨了一百倍。

视频大模型也会走同样的路,从创作者工具,到大众消费产品。

最后是核心壁垒变了。

第一条战线比的是谁的数据多、谁的模型大、谁生成得好看。

第二条战线比的是谁的推理快、谁的延迟低、谁的部署成本低、谁的长时稳定性好。算法的权重在下降,工程化的权重在快速上升。

这个变化最容易被忽略,但可能是最根本的。

第一条战线是算法驱动的时代,谁有新算法谁就领先。第二条战线是工程驱动的时代,谁能把成本压到最低、把体验做到最好,谁就能赢。

这就是为什么说这是一条新战线。

不是说它比画质更高级,而是说它是一个完全不同的赛场,比的东西完全不一样。你在第一条战线上积累的优势,到了第二条战线上可能根本用不上。

真正的壁垒在哪?

目前在这条新战线上,已经有不少玩家在布局。

海外的 HeyGen等数字人公司在往 AI 生成方向转型,国内其他视频模型公司也在探索实时交互的可能性,传统数字人厂商也在升级技术路线。

在第一批跑出来的玩家中,生数的 Vidu S1 是最受关注的一个。

7 月 3 日,在 2026 全球数字经济大会上,生数科技创始人朱军正式对外发布了这款全新的实时交互模型

它由朱军教授的 00 后博士生张金涛担任负责人,带领团队完成全链路研发。

Vidu S1 面向的是一类全新的使用场景:让视频模型从离线成片,走向可对话、可响应、可持续在线的实时交互。

它的核心能力包括语音实时控制视频生成内容、无限长实时生成、540P+25FPS 实时交互,以及自定义初始图像与音色。

它为什么能先跑出来?

答案可能跟你想的不一样,不是靠堆 GPU,不是靠模型更大,是靠全栈工程优化。

Vidu S1 最狠的一点是什么?

它单张高端消费级显卡(如 RTX 5090)就能跑 540P、25FPS 的实时交互,最高支持 42FPS。

什么概念?

相比传统高端定制数字人方案,动捕加建模加服务器集群,成本下降了一到两个数量级

以前做一个高质量数字人几十万起步,现在一张显卡的成本,就能跑一个能实时对话的数字角色。门槛被大幅拉低了。

有意思的是,这很像那些颠覆性技术的经典路径。

一开始画质差、效果糙、主流玩家看不上,但成本低一个数量级,体验是全新的,然后慢慢往上爬,最后把主流市场给颠覆了。

它是怎么做到的?

不是某一个技术点的突破,是一整套体系的协同。

如果把生数的技术能力拆开来看,你会发现它的壁垒不是某一层,而是从底到顶一整条链。

最底层是算子层,就是SageAttention,一个 8 位整数量化(INT8)注意力加速方案

传统注意力运算都是 FP16 浮点,SageAttention把Q和K矩阵量化成INT8,同时保留V矩阵的高精度,在几乎不损失生成质量的前提下,实现了 2 到 3 倍的加速。

而且是即插即用的,不需要重新训练模型。

据张金涛在公开采访中透露,SageAttention 已被 Nvidia、AMD、Google、华为、Meta、字节跳动、腾讯等约 200 家企业在产品中使用或集成,某种程度上已经成了行业标准。GitHub 上 3000+ 星标。

一个做视频模型的公司,先做出了一个全行业都在用的加速算子

这就是底层实力。很多人只看到了 Vidu S1 这个产品,没看到底下这一层又一层的积累。

中间层是模型层,TurboDiffusion,一个扩散模型推理加速框架

这一层的加速来自四个方向的协同:注意力加速把 SageAttention 和 SLA 稀疏线性注意力结合起来,通过稀疏化剪掉 90% 的计算量,同时保持生成质量基本无损;步数蒸馏,用 rCM 正则化一致性模型方法,把扩散模型原本几十上百步的去噪过程,蒸馏到 3 到 4 步就能完成,这是提速最核心的一步;

还有 W8A8 全局 8 位整数量化,把权重和激活值都压缩到 INT8,显存占用减半,计算速度翻倍。

四个方向叠在一起,最终实现了 100 到 200 倍的端到端加速。GitHub 上也是 3.6K 星标,行业里广泛在用。

这里有个很有意思的观察。很多人以为,把注意力剪得越稀疏,效果会越差。

但实际情况是,传统注意力机制里有大量计算是冗余的、是浪费的。

找到那些真正重要的计算,把资源投上去,反而能又快又好。这就是工程优化的魅力,不是简单地做减法,是找到规律之后的精准优化。

最上层是系统层,TurboServe,一个流式推理部署引擎

实时交互跟离线生成不一样,它是持续的、流动的,不能断不能卡不能崩。这就需要专门的调度引擎,动态分配算力,管理用户状态,保证服务稳定。

三层优化全栈打通,才跑出了单卡实时生成这个结果。

所以你看,真正的壁垒是什么?

不是我有多少张 A100,不是我模型参数有多大。

真正的壁垒是你能不能用更少的资源跑出更好的效果,是从算子到模型到部署的全链路工程能力。

算法可以抄,论文可以复现。但一套打磨了好几年的全栈工程体系,抄不走。

张金涛说过一句话我觉得很到位:推理速度本身就是智能水平的一部分

如果给足够的时间,很多复杂任务都不难解决。但如果要在实时交互的约束下做到又快又好,那就是另一回事了。

支撑这套能力的,是自回归扩散模型(AR+Diffusion)路线。

模型并非一次性产出完整片段,而是基于已经生成的历史画面,结合用户当前的语音、指令等上下文信息,实时预测并生成下一帧内容。

这种逐帧生成的方式,天然具备可被实时打断和改写的特性。

用户随时发出的新指令,都能被模型实时理解并体现在后续画面中,不必等待一整段视频生成完毕再重新开始。

论文里的数据也能说明问题。

根据生数发表在 arXiv 上的技术论文,Vidu S1 在两个基准上做了测试:一个是公开的HDTF数据集,三项指标CSIM 0.9192、Sync-D 7.847(音视频同步误差,越低越好)、DOVER 0.5660,在对比的商业系统中均处于第一梯队;

另一个是生数自建的 Vidu-StreamBench 人类偏好测试,在 “主体可控性” 这个指标上,Vidu S1 对另外两家海外主流方案的偏好率达到了 100%。

这个数字看起来很夸张,但其实很好理解:路线差异带来的代差。很多 2D 数字人方案,主要聚焦于口型驱动和上半身微动作,动作生成能力相对有限,对自由指令的跟随能力天然较弱。

而 Vidu S1 是端到端生成的,理解指令后实时生成动作,这是两种技术范式的差距。

当然,这里必须说明:Vidu-StreamBench 是生数自己构建的 benchmark,不是第三方独立测试。

自建 benchmark 难免有偏向性,这个 100% 的数字也有路线差异放大的因素。但即使打个折,也能说明问题,在指令跟随这个维度上,Vidu S1 确实有明显优势。

更关键的是,这些成绩是在 RTX 5090 上、3 步配置下最高 42FPS 的推理速度下取得的,超过了 30FPS 的实时播放阈值。

值得一提的是,Vidu S1 还具备一定程度的场景理解能力。

当用户开启摄像头,模型能识别画面中的人物数量、动作状态等信息,并据此给出实时反馈,而不只是被动响应语音指令。

这让交互不再局限于对话本身,也延伸到了对物理环境的感知。

自定义角色方面,Vidu S1 支持用户上传任意图片创建角色。

无论是真人形象、动漫人物、萌宠,还是游戏角色和其他虚拟形象,都可以作为初始角色使用;

声音层面,用户也可以选择系统音色,或录制自己的声音进行定制。上传图片并完成基础设置后,新角色几乎可以立即进入对话状态。

这意味着,数字人的创建门槛被进一步降低了。

普通用户可以用宠物、插画或自创人物生成互动角色;企业则可以通过 API,将品牌IP、虚拟客服、数字主播、游戏 NPC 或教育陪练接入自己的业务。

生数的做法也很坦诚。

他们没有只剪几个精美的 demo 做宣传,而是把前端和 API 都开放出来,让用户自己去试、去感受。

这意味着模型的缺点会非常直接地暴露在所有人面前,但他们觉得值得。一个新方向刚开始出现时,它不一定是完美的,更重要的是它能不能让大家看到一种新的可能性。

更深一层看,Vidu S1 并不是一个孤立的产品。它是生数通用世界模型布局中的一环。

朱军在央视专访里讲过一个判断:视频并非简单的像素序列,而是对现实世界动态变化的记录。

人物、物体、环境、动作和事件,都以时空变化的方式包含在视频之中。

通过大规模视频训练,模型不仅能够生成画面,也在逐步学习物体如何运动、环境如何变化,以及不同动作可能带来怎样的结果。

所以在生数的技术路线里,从视频生成到实时交互再到机器人行动,底层是一体的。

Vidu 在像素空间生成动态内容,学习世界如何变化;Vidu S1 引入实时输入,让模型能够持续理解指令、更新状态并作出响应;Motubrain 则把对环境的理解和对未来的预测,转化为机器人可以执行的动作。

三者分别对应世界模型能力的逐步演进:生成世界、与世界实时交互,并最终行动于世界。

这也是为什么生数能从视频模型自然延伸到机器人领域。不是跨界追热点,是视频模型技术路线的自然延伸。

当你的模型已经通过海量视频学会了世界如何运转,下一步自然就是让它在物理世界里行动起来。

实时交互的下一步

Vidu S1 跑出来了,实时交互这条新战线也正式打开了。

但这只是一个开始。接下来,这个方向还有很大的进化空间,整个行业都在往几个方向同时推进。

画质和实时性能的平衡是第一个方向。

现在能做到实时交互的,分辨率普遍还在 540P 左右;画质好的方案,又做不到实时。

接下来的关键突破点,是在保持实时帧率的前提下,把分辨率逐步提升到 720P、1080P 甚至更高。

这不是某一家的问题,是整个行业共同的技术方向。谁能先做到 1080P 实时,谁就能拿下对画质有要求的场景。

动作范围和场景复杂度的扩展是第二个方向。

目前的实时交互主要还是上半身、小动作、简单场景。接下来,全身动作、复杂场景、多人交互、环境互动这些能力,都会逐步解锁。

从 “坐着聊天” 到 “自由活动”,从 “单角色对话” 到 “多角色互动”,交互的丰富度会不断提升。

长时一致性的持续验证是第三个方向

“无限时长” 是一个很吸引人的概念,Vidu S1 已经实现了连续数小时的稳定生成。

但真正的长时一致性,几天、几周、甚至更长时间的连续交互,角色记忆、性格、成长轨迹的持续保持,还需要更大规模、更长时间的验证。

实验室里跑通和千万级用户天天用,是两个量级的挑战。

杀手级应用的探索是第四个方向

技术跑出来了,接下来就是找场景。虚拟陪伴、互动游戏、虚拟主播、智能客服、在线教育、语言陪练…… 现在大家都在试,各种方向都有团队在跑。

哪个场景能最先跑通商业模式、能跑出大规模用户,是接下来一两年最值得关注的事。

这些都是整个赛道正在快速推进的方向。

技术路线是对的,基础能力已经跑通了,接下来就是不断迭代、不断扩展、不断找场景的过程。

两条战线,两种未来

这两条战线,会分别走向哪里?

我觉得可以分开来看。

第一条战线(画质/时长),走向的是 “内容生产的革命”。

这条战线上的玩家,目标是把 AI 视频生成的质量做到影视级,把时长做到电影级,最终替代传统的影视制作流程。

受益的是内容行业。

短剧、广告、影视、动画,这些需要大量视频内容的行业,生产效率会大幅提升,成本会大幅下降。

以前需要几十人团队几个月做的事情,以后可能几个人几周就能做完。

这件事已经不是未来时了,是正在发生的现在进行时。

今年有个很有意思的现象,二手视频相机价格崩了。

索尼 A7S3 这种曾经的视频神机,二手价格半年跌了五千多。

闲鱼上挂着大量 99 新的视频机,转手理由清一色是 “闲置吃灰”。为什么?因为以前拍短剧、拍短视频、拍电商素材,都得买台好相机。现在呢?很多团队直接用 AI 生成了,连相机都不用了。

上游的变化更夸张。据中国网络视听协会的数据,2026 年一季度全行业上线的微短剧里,AI 生成的已经占了 95% 以上,真人短剧上线量还不到 AI 短剧的二十分之一。

多地影视基地真人剧组大幅缩减,演员劳务行情腰斩,重金打造的实景棚在闲置。

有业内人士形容:”提示词取代了摄影机。”

以前拍一部 20 集短剧,需要组几十人的摄制组,搭场景、找演员、拍素材、做后期,至少三个月,单集成本三五万。

现在用 AI,十个人的小团队二十天就能做三十集,单集成本最低能压到几百块,成本降幅超过 90%。

冲击还传导到了教育端。

今年 3 月,中国传媒大学一口气停招了翻译、摄影、漫画等 16 个本科专业和方向,其中摄影专业并入了影视摄影与制作专业,强化 “前期 + 后期 + AI” 一体化培养

不是个例,广西艺术学院、湖北美术学院等也相继撤销了摄影本科专业。

信号很明确,只会按快门的传统摄影师,已经撑不起一个独立的本科专业了。

但话说回来,AI 不是来抢饭碗的,是来搭梯子的。

工业级的影视制作,天然对应着漫长的周期和高昂的成本。

创意的每一次修正,都要换算成实打实的人力、时间与资金投入。

AI 的出现,相当于给这套笨重的生产流程装上了加速器。

大量基础生成与调优工作被工具承接,团队不用再把时间耗在流程周转上,能把精力真正放回创意与品质本身。

它没有抢走谁的导演身份,反而让每一个有表达欲的人,都拥有了把想法落地的可能。

十九世纪英国经济学家杰文斯提出过一个悖论:当技术进步提高资源使用效率时,该资源的消费量不仅不会减少,反而可能增加

因为效率提升导致使用成本下降,进而刺激了更广泛的应用需求。

这个原理同样适用于影视行业。

单位内容的制作成本每下探一个数量级,能够入场的创作者规模至少会增长一个数量级,最终落地的作品总量则会迎来至少两个数量级的爆发

这不是简单的 “降价走量”,而是原本被高成本堵在门外的创意产能,被一次性释放了出来。

承压的是传统内容制作公司和整个上游产业链。

如果你的核心竞争力是 “能拍片子”” 能做特效 “,那 AI 生成的方案很快就能追上甚至超过你。相机、灯光、场地、器材租赁,这些曾经的刚需,需求都在萎缩。

这条战线的终局,是AI 成为内容生产的基础设施。

就像现在的 PS、PR 一样,人人都能用,人人都能用它做出专业级的内容。

第二条战线(实时交互),走向的是 “人机交互的革命”。

这条战线上的玩家,目标是把 AI 从一个工具变成一个 “角色”,从 “你用它” 变成 “你跟它对话”。

受益的是交互行业。

虚拟陪伴、互动游戏、智能客服、在线教育,这些需要高频人机交互的场景,体验会有质的飞跃。以前是打字聊天、语音聊天,以后是面对面视频聊天,完全不是一个维度的体验。

承压的是传统数字人公司。如果你的技术路线还是 2D 驱动、预设动作,那 AI 生成的方案会从根本上颠覆你。

这条战线的终局,是AI 成为新的人机交互入口。以前的入口是键盘、鼠标、触摸屏、语音助手,以后可能就是一个站在你面前的 AI 角色。

两条战线,两种未来,都有巨大的想象空间。

而且有意思的是,这两条战线不是完全分开的,它们最终可能会汇合。当实时交互的画质也做到了影视级,当离线生成的内容也能实时交互,那时候就不分什么第一条第二条战线了。

那时候的 AI 视频,既是高质量的,又是可交互的。

就像手机行业,当年大家分屏卷芯片卷拍照,最后所有功能都汇合到了一台手机上。

视频大模型也会走这条路,先分头突破,最后汇合到一个统一的形态。

当然,这都是比较远的事了。短期来看,两条战线还会各自发展一段时间,各自有各自的玩家、各自的赛道、各自的竞争逻辑。

我们在哪?

中国公司在这两条战线上,分别处于什么位置?

我的判断是:在第一条战线上,中国跟海外处于并跑甚至局部领先的状态。各有优势,各有特色,整体差距不大。

海外有 Sora 这样的标杆,我们有 Seedance、Kling、Vidu 等一批模型,在 4K、时长、多模态参考等某些维度上甚至做得更好。

在第二条战线上,在落地速度和工程化实践上,中国公司暂时走在前面。不是某一家公司领先,是整个生态领先。

为什么这么说?三个原因。

首先我们有最丰富的应用场景。

全球最发达的短剧产业,每天需要海量内容;全球最活跃的直播生态,虚拟主播需求旺盛;全球最大规模的短视频用户,对新内容形态接受度最高;全球最卷的电商客服,对数字人降本增效的需求最迫切。

模型做出来马上就能拿到真实场景里去用,用户反馈马上就能回来,然后快速迭代。

这就是技术落地的飞轮。

海外呢?海外是先有模型后找场景,我们是先有海量场景再用模型去放大。落地速度根本不在一个量级。

据前沿在线观察,中国 AI 视频的落地速度,确实比海外快很多

海外很多公司还在研究技术、发论文,我们这边已经在各种场景里试错、迭代、赚钱了。这种场景驱动的迭代,速度是非常快的。

然后我们有最完整的产业链。

上游有生数、字节、快手这样的模型公司做底层能力,中游有万兴这样的工具公司做全链路产品,下游有灵河、长信这样的内容公司做场景落地,平台有抖音快手做分发和商业化闭环。

从模型到工具到内容到发行,整条链路都跑通了。

这不是单点优势,是体系优势。单点优势容易被追上,体系优势很难被打破。

更深一层看,当 AI 影视的基础生成能力快速同质化,赛道的胜负逻辑已经悄然生变。

不少人以为 AI 影视的核心竞争力还停留在拼模型、卷画质、比时长,但当主流产品都能实现稳定的工业级输出,”能做出好内容” 就不再是某一家的独家壁垒。

此时,真正能拉开差距的,是工具之外的生态承载力。打通从创作、分发到变现的完整链路,才能留住创作者、形成持续的内容供给。

工具解决的是 “怎么拍” 的效率问题,生态解决的是 “为什么拍” 的动力问题。

AI 影视要真正成为内容行业的主流生产方式,不能只靠技术迭代推着走,更要靠正向的商业循环养着走。

而中国,恰恰是生态最完整的地方。

最后我们的工程师文化更适合工程化竞争

第一条战线比算法比论文,海外有先发优势。但第二条战线比工程化、比落地速度、比迭代效率,这是我们的强项。

你看 SageAttention、TurboDiffusion 这些底层优化工作,都是中国团队做出来的。而且不是在实验室里做的,是在真实产品的压力下磨出来的。这种从实战中长出来的工程能力,往往最扎实。

但也不能太乐观。我们有优势,也有明显的不足。

基础研究积累相对薄弱。

原创性的算法、开创性的理论,还是海外做得多。我们更多是在工程化和落地上领先,底层原创性的东西还不够多。

高端算力依赖进口。

芯片这个东西,是卡脖子的环节。人家不给你芯片,你工程能力再强也没用。这是整个 AI 行业的共同问题,不是某一家公司的问题。

全球化能力弱。

中国公司做国内市场很厉害,但出海能力普遍不强。海外市场那么大,能不能拿下来,是个问号。

所以我的判断是:我们有不错的起点,有生态优势,但领先幅度不大,而且优势主要在应用和工程层面,不是在底层技术层面。海外大厂一旦发力,追赶速度会很快。

真正的胜负手,是谁能先把场景跑通、把生态建起来。技术可以追,生态一旦建起来,就很难被颠覆了。

说了这么多,最后给几个我比较确定的判断,再留几个我也没想明白的悬念。

比较确定的是:

视频大模型正在从单维度竞争走向多维度竞争。

画质这条战线还会继续打,而且远没到尽头;同时实时交互这条新战线已经打开,会越来越热闹。

以后的视频大模型公司,两条腿走路的会比单腿蹦的走得稳。

工程化的权重在快速上升。

第一条战线是算法驱动为主,第二条战线是工程驱动为主。整体来看,整个行业的竞争重心正在从 “谁的算法新” 转向 “谁的工程强”。

谁能把成本压到最低、把体验做到最好、把稳定性做到最高,谁就更有可能赢。

中国在实时交互这个方向上有不错的起点,有生态优势。能不能把这个优势保持住、放大,就看接下来两三年的落地速度了。

还有一个判断我越来越坚定:数据范式的变化,很多时候会比单纯改模型结构更本质。

模型结构像智商,150 和 140 当然有差距,但当模型已经足够强之后,更大的差别可能来自 “老师” 和 “教材”。

数据就像老师和教材,同一个知识点,好老师十分钟就能讲明白,因为他知道怎么组织信息、怎么拆步骤;但如果教材很差、讲法很乱,你可能看十个小时也学不会。

这个逻辑放到视频生成里也一样。尤其是未来的实时交互视频,模型不能只学 “最后生成什么画面”,还要学 “过程如何连续发生”。

它要理解状态变化、动作反馈、上下文延续和多模态交互。

谁能把人类的视觉偏好、娱乐偏好和实时交互过程更好地组织成可学习的数据,谁就更可能推动下一阶段的突破。

往更远了看,实时交互也不是终点。

视频模型的终极形态,可能不只是生成视频,而是理解世界。

当一个模型能够通过海量视频学会物体如何运动、环境如何变化、动作带来什么结果,它就不只是一个内容生成工具了,而是一个能够理解和预测世界的智能体。

从生成内容,到实时交互,再到行动于物理世界。这是一条清晰的技术演进路线,也是很多公司正在走的路。今天屏幕里的 AI 能听懂指令做动作,明天可能就是机器人在真实世界里听懂指令干活。

还不确定的是:

两条战线什么时候会汇合

画质和实时性能不能兼得?什么时候能做到 1080P 实时?什么时候能做到影视级的实时交互?这些都是技术问题,但需要时间来回答。

实时交互的杀手级应用是什么?

是虚拟陪伴?是互动游戏?是虚拟主播?还是现在还没人想到的什么场景?一个新的技术范式,往往会催生出大家预想不到的杀手级应用。

最终的市场格局会是什么样?

是一家通吃,还是多家并存?是模型公司赢,还是应用公司赢?是垂直场景的公司跑出来,还是通用平台跑出来?

海外大厂什么时候进场?

会带来什么变化?OpenAI、Google、Meta 这些公司,一旦把注意力转到实时交互视频上来,会是什么局面?我们的领先优势能保持多久?

世界模型的终局到底是什么样?

AI 真的能像人一样理解和行动于这个世界吗?还是说,它永远只是一个高级的模拟系统?

这些问题,现在都没有答案。

任何新技术的发展都有它的节奏。从技术触发,到热度攀升,到泡沫破裂,到稳步爬升,最后走向成熟。

现在的实时交互视频生成,还处在热度刚开始攀升的阶段,离真正成熟还有很长的路要走。

Vidu S1 不是终点,它是实时交互这条新战线上第一个真正被大规模体验的产品。

但这只是开始。接下来的一两年,会有更多玩家进场,竞争才真正开始。

而这场多维度的竞争,才刚刚拉开序幕。

END –

Frontiers
Frontiers
文章: 461