超级文生视频模型Sora正式来了!多模态训练数据是关键

2024-12-17 14:41:36 来源:i黑马
        【每日科技网】

  OpenAI圣诞季“十二连发”的第三个工作日,迎来了重头戏——万众期待的OpenAI视频生成模型Sora正式版发布!

  OpenAI官方甚至直言 :“Sora就是我给你们的假期礼物。”

超级文生视频模型Sora正式来了!多模态训练数据是关键

  今年2月,Sora问世便以其卓越的表现震撼了科技届。而此次OpenAI发布更的Sora Turbo,在生成视频的速度和效果上,显然更快、更强!

01 Sora的创新表现

  整体来说,Sora展示的一系列功能,在视频生成的质量、功能的独创性、技术的复杂度等方面,超出了目前市场上已有的文生视频产品。

  OpenAI在直播中介绍,Sora支持从480p到1080p的全系列分辨率,单个视频最长可达20秒。用户可以通过文本描述(文生视频)、图片(图生视频)以及现有视频(视频生视频)来生成视频内容。

  特别值得一提的是,Sora上线全新UI界面以及丰富的编辑工具,以便创造者对视频进行修改、创建、扩展、循环、混合。

  例如,Storyboard(故事板)允许用户通过时间轴来控制视频内容,添加分镜头,以及调整动作或画面的持续时长。Re-cut(剪辑)是在故事板上对视频进行修剪和延展,实现更的视频编辑。Blend(混合)则是将两个视频内容进行过渡和融合,创造出新的视觉效果。

02 Sora的技术原理

  OpenAI已经给我们展示了Sora的“全能进化”。这些独特的创新功能极大地拓展了创作者的创作空间,让视频更接近创作者的自我表达、帮助他们完成一个理想的镜头故事。

  如此强大的功能背后有哪些黑科技,Sora是怎么做到的?

  Sora的设计灵感来源于大型语言模型(LLM),通过训练互联网规模数据来获得通用能力。大语言模型使用文本标记,而Sora则使用之前已被证明是用于视觉数据模型的有效表示的视觉“碎片/补丁”(patches)来达到类似效果。

  OpenAI首先通过对视频进行时间和空间上的压缩,将其压缩到一个更低维的潜在空间(可将这个潜在空间看做是时空碎片的集合),然后将原视频转化为这些碎片/补丁(patches)。让它们充当像转换器中的标记符号一样的角色,使Sora模型可以在不同分辨率、持续时间和宽高比的视频和图像数据集上进行训练。

  然后,Sora利用一种基于Transformer的模型,根据给定的文本提示和已经提取的空间时间补丁,开始生成最终的视频内容。在这个过程中,模型会“涂改”初始的噪声视频,逐步去除无关信息,添加必要细节,最终生成与文本指令相匹配的视频。

  此外,训练从文本到视频的生成系统,还需要大量带有对应文本字幕的视频。为此,OpenAI借鉴了DALL-E 3中提出的re-captioning技术,将其应用到视频上。首先训练了一个高度描述性的字幕模型,之后用它为训练数据集中的所有视频生成文本字幕,以此来提高文本逼真度以及视频的整体质量。

超级文生视频模型Sora正式来了!多模态训练数据是关键

03 文生视频模型背后的数据

  总的来说,Sora模型凭借其强大的数据处理能力和深度学习能力,成功地将文字与视频内容紧密地联系在一起,为用户带来了前所未有的视频生成体验。这个模型就像是AI的“大脑”,里面存储了海量的视频和图像信息。通过不断学习这些数据,模型得以建立对现实世界中各类场景、情境、运动规律以及人类活动特征的深度理解和精准捕捉。

  其中,高质量视频训练数据在提升输入文字与生成内容匹配度方面扮演着至关重要的角色。不仅能够提升模型的性能,还能够为用户提供更加真实、准确和连贯的视频生成体验。

  标贝科技始终专注于为企业提供高质量的精标数据服务以及丰富的多模态数据资源。针对大模型数据需求,我们精心打磨了多模态大模型数据解决方案,覆盖从数据采集、预处理、清洗、标注到质检等系列工程化流程,积累了高质量的多模态大模型训练数据集,为客户打造优质的服务体验。

04 标贝科技多模态大模型训练数据-视频caption数据集

视频caption数据样例1:生活类

#FormatImgID_2#

视频caption数据样例2:运动类

超级文生视频模型Sora正式来了!多模态训练数据是关键

视频caption数据样例3:动物类

超级文生视频模型Sora正式来了!多模态训练数据是关键

视频caption数据样例4:其他

超级文生视频模型Sora正式来了!多模态训练数据是关键

免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
    本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

猜你喜欢

从一颗模组到一个平台,澜存科技如何让 AI 进入真实终端

近日,上海澜存科技有限公司宣布完成数千万元Pre-A轮股权融资,本轮投资方为锡创投,拓界资本担任独家财务顾问。继2026年4月完成由凡创资本领投、申冉基金跟投的天使轮融资后,澜存在三个月内连续完成两轮

1个月前

余承东体验首款阔直板华为Pura X View:越用越爱用 爱不释手

华为常务董事、产品投资评审委员会主任、终端BG董事长余承东分享了他对首款阔直板华为PuraXView的使用体验。他表示,自己已经使用这款手机超过一个月,越用越爱,爱不释手。余承东回忆,刚拿到这部手机时

千匠网络实践:如何让大模型从“能用”走向“好用”

过去两年,几乎所有上规模的企业都接入了大模型。智能客服、知识问答、AI助手——这些应用已经算不上新鲜事。但在演示会议室与真实业务场景之间,一个显著落差正在浮现:能聊天,但不理解企业业务语境;能生成内容

千匠网络

2个月前

海能达发布全新专业防爆PDT对讲机CH690Ex

随着我国应急管理体系持续完善,消防救援任务正在从传统火灾处置,向化工园区事故、危险品泄漏、地下空间救援、大型综合灾害等多风险、多场景方向发展。在这些复杂环境中,救援现场往往面临爆炸性气体、可燃性粉尘、

2个月前

海能达CCW 2026载誉收官:AI与融合通信引领专用通信新未来

6月16日至18日,2026年全球关键通信展(CCW2026)在英国伦敦举行。展会期间,海能达集中展示了从终端到系统、从感知到决策的全链路创新版图,AI与融合通信产品及解决方案贯穿三天展期,持续获得高

3个月前

登陆欧洲 Intersolar!远景AI电力系统支撑全球 AI 算力发展

慕尼黑,2026年6月23日——在IntersolarEurope2026上,远景科技集团发布面向AI数据中心的下一代电力基础设施——融合风光储一体化方案、固态变压器(SST)、800V直流供电、储能

3个月前