字节跳动进军视频AI 豆包视频生成大年夜模型宣告

活动现场展示了视频天生效果，无论是语义理解能力，多个主体运动的繁芜交互画面，还是多镜头切换的内容同等性，豆包视频天生大模型均达到业界前辈水平。
火山引擎总裁谭待表示：“视频天生有很多难关亟待打破。
豆包两款模型会持续演进，在办理关键问题上探索更多可能性，加速拓展AI视频的创作空间和运用落地。
”

有创作者在抢鲜体验豆包视频天生模型时创造，其天生的视频不仅能够遵照繁芜指令，让不同人物完成多个动作指令的互动，人物样貌、服装细节乃至头饰在不同运镜下也保持同等，靠近实拍效果。

据火山引擎先容，豆包视频天生模型基于DiT架构，通过高效的DiT领悟打算单元，让视频在大动态与运镜中自由切换，拥有变焦、环抱、平摇、缩放、目标跟随等多镜头措辞能力。
全新设计的扩散模型演习方法还占领了多镜头切换的同等性难题，在镜头切换时可同时保持主体、风格、氛围的同等性。

经由剪映、即梦AI等业务场景打磨和持续迭代，豆包视频天生模型适配电影、电视、电脑、手机等各种设备的比例，不仅适用于电商营销、动画教诲、城市文旅、微剧本等企业场景，也能为专业创作者和艺术家们供应创作赞助。

目前，新款豆包视频天生模型正在即梦AI内测版小范围测试，未来将逐步开放给所有用户。

在产品能力日益完善的同时，豆包大模型的利用量也在极速增长。
据火山引擎表露，截至9月，豆包措辞模型的日均tokens利用量超过1.3万亿，比较5月首次发布时猛增十倍，多模态数据处理量也分别达到每天5000万张图片和85万小时语音。

此前，豆包大模型以低于行业99%的定价，引领海内大模型开启贬价潮。
谭待认为，大模型价格已不再是阻碍创新的门槛，随着企业大规模运用，大模型支持更大的并发流量正在成为行业发展的关键成分。

来源：北京日报客户端

：赵语涵

每期AI知识网