2月16日, OpenAI推出一个名为“Sora”的文本转视频AI模型,只需提供文本便能生成一分钟的视频,且视频效果逼真,引发广泛关注。
广东省产业协会会长杜兰表示, Sora的横空出世,把AI视频向前推进了一大截,将提高影视制作行业的效率,但不会动摇真正有内容创作能力的公司和创作者。未来,Sora或将加快AI与人形机器人等实体产业的融合。
OpenAI公布了由Sora生成的多个视频:一位时尚女性漫步于街头、一只狗在雪地里嬉戏、车辆行驶在崎岖的山路上、鲨鱼在摩天大楼间穿梭……不少专家认为,从视频的质量来看,Sora的表现让人印象深刻。
文本生成视频并非新鲜事。此前,Runway等多家国外人工智能公司都曾推出文生视频大模型。在国内,字节跳动等企业也都曾推出文生视频或图生视频的AI工具。
在专家看来,与同类AI模型相比,Sora实现了“弯道超车”。“Sora在视频时长、镜头和画面的运动幅度、画面清晰度、稳定性等方面都有很大超越。”杜兰表示,此前类似模型仅能生成不足10秒,且镜头视角单一、内容高度失真的视频,而Sora生成的视频长度不仅突破到60秒,且能实现多角度镜头切换以及视频合成、图像生成。
“如果说ChatGPT是‘读万卷书’,那么Sora就是‘行万里路’,用自己的眼睛理解这个世界。”杜兰表示,Sora被定位为“世界模拟器”,让AI更好地理解真实世界,最终实现打造通用人工智能的目标。
对物理世界的理解和模拟能力是Sora备受关注的亮点之一。Sora能对真实世界逻辑进行推断,从而最大限度还原物理世界,例如,对物体的阴影、人物墨镜的反光等细节进行高清呈现。
不过,Sora 的所谓“世界模拟器”并不完美。例如,玻璃的破碎状态难以模仿、被咬过的饼干没有咬痕、人行走的左右腿交换位置出错等。目前,Sora仍存在难以准确模拟复杂场景的物理特性、无法理解因果关系、混淆空间细节等弱点,处于世界模型研究应用的初期阶段。
杜兰预测,未来,有了Sora对真实世界更深的理解,AI与人形等实体产业的融合可能会加快,将其与相融合,就能让机器人基于自己的理解,自动把人的命令转化为一系列动作,而不是每一个步骤都需要人类去提问,实现真正意义上的智能体(AI Agent)。
“我们可以期待智能硬件今后会多一双具备理解能力的眼睛,不光能听懂、读懂语言文字,还能‘看懂’这个世界。”杜兰说,Sora的横空出世,把AI视频向前推进了一大截,对国内科技企业既是一种激励,也是一种鞭策。
Sora的到来,让不少视频生产、影视创作等领域的从业者感到担忧。“扔进一部小说,出来一部大片。”有的从业者感慨:“现实,不存在了”。
对此,杜兰认为,Sora短期内肯定会对影视制作、短视频创作、广告传媒等领域产生影响,但主要作为一种辅助工具,用于提高影视制作行业的效率,比如,对电影的特效场景进行概念验证,或者为动画创作提供灵感、风格参考等。
“它不会动摇真正有内容创作能力的公司或者个体创作者。”杜兰表示,真正优秀的影视作品凝聚着对人性与美的理解,永远离不开人的创意。
“AI写作、AI绘画走红以来,并没有哪些仅靠AI生成的作品真正火爆,能火起来的还是经过了人的大量参与。”她表示,以近日在网络走红的AI动画短片《猴王问世》为例,其创作者的创作过程其实并不轻松,先后使用ChatGPT、MidJourney和Runway等多个AI产品,且多个创作环节依然由人主导。
此前,该短片创作者冯先生就曾表示,面对中国古籍中很多晦涩难懂的词语、传统文化元素等内容,AI尚不能准确理解,依然需要人工处理。
不容忽视的是,Sora的强势出圈也引发了人们对AI深度伪造视频可能加剧错误、虚假信息传播的担忧。
OpenAI公开表示,目前仅对测试、评估该模型风险的安全人员开放,还将向特定的艺术家、设计师、电影制作人员提供访问权限,并称在向公众开放前将采取几项重要的安全措施,防止模型生成涉及极端暴力、性内容、真实政治家或名人等描述的自动化流程。
“在AI产品的开发设计上,应该贯彻人机协同的理念,不要把所有的任务都交给AI,而是始终要有人来兜底。”杜兰表示,AI科技研发人员和企业应坚持在开放、对话、应用中解决技术问题,更要有一些确保安全可信度的技术性举措,加强审查,确保数据符合法律和伦理,通过人类反馈及时调整AI模型的价值观等。