AI文生视频领域,几乎只剩Sora还是个期货了。
最近两个月,国内外的AI-geneRated Video应用持续爆发,中国的快手、字节、智谱AI、生数科技、爱诗科技,海外的谷歌、LuMa、Runway,格局如八仙过海。
虽然不同平台水平差异依旧存在,但整体可用性已经大大提高,而且风格化特征也比较全面。唯一的缺憾是,在融入工作流方面,AI视频工具们的水平还是差了一点。Sora的前景,现阶段需要依赖这些后来者去实现。
放弃期货,文生视频应用爆发
业界普遍将视频视为AI应用落地的重点领域。英伟达CEO黄仁勋在全球顶级计算机图形学会议SIGGRAPH 2024上邀请了Meta的CEO扎克伯格进行对话,双方都认可视频能力将是AI大模型的进化方向。
出身于英伟达研究小组的LuMa AI首席科学家宋佳铭,在与a16z合伙人Anjney Midha对谈时提到,视频关联着3D世界,从学习角度看,视频数据使模型更好地理解和推理3D世界。因此,实时高质量的视频生成,将推动具身AI的发展。
视频就像一座“桥”,许多AI公司正在抢先通过它,尤其是OpenAI让Sora变成了外界无法使用的期货,给了其他平台进一步发展的空间。
(整理自公开信息)
(图源:天眼查)
超长战线背后是这些公司的试探。一部分是关于商业模式,另一部分是关于技术应用前景。
可灵、即梦、Vidu等推出了会员订阅模式,进行应用普及化尝试。爱诗科技创始人王长虎在接受采访时表示,爱诗目前的策略以面向消费者为主,广泛收集用户反馈,以更好地基于用户体验迭代底层模型。至于更远的应用,目前谈论为时尚早,主要是因为面向消费者的收费模式无法承担成本。
LuMa AI则采取了面向消费者的产品形态,原本专注于3D领域,进入视频生成领域是为了探索3D生成与重建的更多可能性,以视频驱动3D发展。这在产业领域有更多的应用前景,例如批量制造电影需要的三维素材等。
最重要的是,LuMa AI的期望不是售卖技术或者素材,而是建立类似TikTok的平台,形成一个基于3D的生态系统。王长虎也表示,爱诗科技也瞄准了AIGC时代的平台性机会,但平台的形态暂时无法预测,因为AI产业不会以复制现有平台的方式成长。
此外,目前让AI-geneRated Video进入完整工作流的应用已经在成形。开源视频编辑工具ClappeR最近热度上升,特色在于集合各类AI技术,用ProMpt的方式调动AI Agent生成和迭代故事,直接跳过了手工编辑文件的过程。
(图源:机器之心)
因此,AI-geneRated Video的进化速度远比我们想象的快。目前,行业的重点无疑在于生成速度和生成效率。但是,大模型并不提供完全确定的商业模式方向,这更多取决于团队的选择。在这个过程中,除了商业化之外,AI公司还要思考如何避免陷入合规困境和成本困境。所以,把文生视频变得成熟并不容易,现在仅仅相当于ChatGPT刚刚问世的阶段。
AI-geneRated Video的“硬伤”和突破口
a16z曾发表观点,巨头在从科研成果到商业产品的转化中需要更关注法律安全、版权等问题,因此效率往往较慢。行业所面临的相关问题,逻辑大致相同。
1.商业化的“落差”,目前的AI-geneRated Video很难满足甲方的需求
彭博社报道,OpenAI一直试图向好莱坞推荐Sora,但未能成功。用Sora制作的第一则商业化广告是6月公开的玩具反斗城广告。然而,该视频不仅使用了一些旧素材,公开新闻稿也未说明完全由AI生成。
导演Nik KleveROV在一条删除的动态中表示,制作这些镜头的创意机构提供了约十几个工作人员参与,Sora支持了80%到85%的流程。这对需要高效低成本的AI-geneRated Video来说并不是好消息。
2.训练成本、高质量数据集难以满足
视频本质上是由一系列图像构成,图像有很多公开的数据集,但视频缺乏。OpenAI曾因违规使用YouTube视频进行训练而受到指控,英伟达也被媒体曝光从Netflix和YouTube收集大量数据,用于训练自己的CoSMos项目。这体现了两个关键点:一是视频领域的重要性,二是视频数据集是个大问题,除了版权问题,这些视频数据还缺乏标签。
3.AI资产泡沫的问题,AI必须为用户解决重要复杂的问题才能有价值,但现在的发展成效远不能与互联网等技术当年初生时的情况相比。
技术革命之后必须伴随产业革命,产业革命需要现象级产品的引领。AI更需要的是一个成功的场景。目前看来,AI-geneRated Video尚未取得这类成果。
PeRplexITy的创始人对此提供了另一个观点,基础模型的价值本质映射着背后团队的价值。当Sora未能提供符合预期的突破时,谁能在这个领域担起大任呢?
由此出发,关键或许在于谁能先把AI-geneRated Video真正融入到某一个商业系统的工作流中,就像ClappeR对视频制作的探索一样。这涉及到与其他领域的融合,包括气象、城市、影视、汽车、制造业。也许Sora会在某一天拿出更具体的成果,也许是其他创业公司颠覆了我们对AI视频的认知。