机器之心编辑部
智谱大模型团队自研打造。
自从快手可灵 AI 火爆海内外,海内视频天生也犹如 2023 年的文今年夜模型一样,越来越卷了。
刚刚,又一视频天生大模型产品宣告正式上线:智谱 AI 正式发布「清影」。只要你有好的创意(几个字到几百个字),再加上一点点耐心(30 秒),「清影」就能天生 1440x960 清晰度的高精度视频。
视频加载中...
即日起,清影上线清言 App,所有用户都可以全方位体验对话、图片、视频、代码和 Agent 生成功能。除了覆盖智谱清言的网页端和 App,你也可以在「AI 动态照片小程序」上进行操作,快速为手机里的照片实现动态效果。
智谱「清影」天生的视频时长有 6 秒,清晰度达到 1440×960,所有用户均可以免费利用。
PC 端访问链接:https://chatglm.cn/移动端访问链接:https://chatglm.cn/download?fr=web_home
智谱 AI 表示,随着技能的不断发展,「清影」的天生能力很快将可以用于短视频制作,广告天生乃至电影剪辑等事情中。
在天生式 AI 视频模型的研发中,Scaling Law 连续在算法和数据两方面发挥浸染。「我们积极在模型层面探索更高效的 scaling 办法。」在智谱 Open Day 上,智谱 AI CEO 张鹏表示:「随着算法、数据不断迭代,相信 Scaling Law 将连续发挥强有力浸染。」
拿捏各种风格
从目前的一些 Demo,以及大略试用的情形看来,智谱 AI 的「清影」具有如下特点:
在风景、动物、科幻、人文历史等类型的视频内容上天生的表现较好;善于天生的视频风格包括卡通风格、真实拍照风格、二次元动漫风格等;实体类型呈现效果上看,动物 > 植物 > 物品 > 建筑 > 人物。它既可以笔墨天生视频,也可以完成图生视频,天生的风格覆盖奇幻动画风格。
文生视频
提示词:低角度向上推进,缓缓举头,冰山上溘然涌现一条恶龙,然后恶龙创造你,冲向你。好莱坞电影风。
提示词:一个法师正在海浪中施展法术,宝石将海水都聚拢过来,打开了一道邪术传送门。
提示词:蘑菇变成小熊。
到真实景物:
提示词:在一片森林中,人视,参天算夜树遮蔽着太阳,树叶的缝隙中洒下一些阳光,丁达尔效应。
提示词:一只水豚鼠像人一样站立着,手里拿着冰激凌,愉快得吃起来。
图生视频
除了文本天生视频,也可以到清影上玩图片天生视频。图生视频带来了更多的新玩法,包括表情包梗图、广告制作、剧情创作、短视频创作等。同时,基于清影的「老照片动起来」小程序也会同步上线,只需一步上传老照片,AI 就能让凝练在旧光阴中的照片灵动起来。
提示词:一条自由移动的七彩鱼。
提示词:图中男子站起来,风吹着他的头发。
提示词:小黄鸭玩具漂浮在拍浮池的水面,特写。
再到当代艺术:
提示词:摄像机环绕着一大堆老式电视旋转,这些电视播放着不同的节目 ——20 世纪 50 年代的科幻电影、胆怯电影、新闻、静态、70 年代的情景笑剧等,背景设在纽约博物馆的一个大型画廊里。
提示词:取出一个苹果手机拍照。
无提示词。
你常用的表情包,智谱 AI 能把它延长成「连续剧」。
提示词:师徒四人伸脱手相互击掌,脸上是困惑的表情。
视频链接:https://mp.weixin.qq.com/s/fNsMxyuutjVkEtX_xRnsMA
提示词:小猫张大了嘴,脸上是困惑表情,很多问号。
视频链接:https://mp.weixin.qq.com/s/fNsMxyuutjVkEtX_xRnsMA
可以看出,清影各种风格都可以拿捏,还有更多的玩法等待人们来发掘。只须要在智谱清言 PC/APP 上,点击「清影智能体」功能,就可以让你的每一个创意在瞬间化为现实。
全自研技能
All in 大模型的智谱 AI,很早就开始支配多模态天生式 AI 模型。从 2021 年开始,智谱 AI 先后发布了 CogView(NeurIPS’21)、 CogView2(NeurIPS’22)、CogVideo(ICLR’23)、Relay Diffusion(ICLR’24)、CogView3 (2024)等多项研究。
据先容,「清影」依托于智谱 AI 大模型团队自研打造的新一代视频天生大模型 CogVideoX。
去年 11 月,其团队基于文生图模型 CogView2 打造出了文本到视频天生模型 CogVideo,并随后将其开源。
CogVideo 拥有 94 亿参数,它通过 CogView2 天生一系列初始帧,基于双向把稳力模型对图像进行插帧的方法实现视频天生。此外,CogVideo 根据文本描述天生 3D 环境,可直策应用预演习模型,避免了昂贵的演习,它也支持中文的 Prompt 输入。
本次清影底座的视频天生模型是 CogVideoX,它能将文本、韶光、空间三个维度领悟起来,参考了 Sora 的算法设计,它也是一个 DiT 架构,通过优化,CogVideoX 比较前代(CogVideo)推理速率提升了 6 倍。
OpenAI 的 Sora 横空出世,让 AI 在视频天生方面取得了显著进展,但大多数模型在天生具有连贯性和逻辑同等性的视频内容方面仍旧存在困难。
为理解决这些问题,智谱 AI 自研了一个高效的三维变分自编码器构造(3D VAE),可以将原视频空间极致压缩到 2%,使得模型演习本钱大幅低落,演习难度也大大降落。
模型构造采取因果三维卷积(Causal 3D convolution)为紧张模型组件,并将自编码器中常用的把稳力模块移除,使得模型具备不同分辨率迁移利用的能力。
同时,在韶光维度上因果卷积使得模型视频编解码具备从前向后的序列独立性, 这有助于通过微调将模型扩展到更高帧率和更永劫光的场景。
除此以外,视频天生还面临这样一个问题,即视频数据大多缺少对应的描述性文本或者描述质量低下,为此智谱 AI 自研了一个端到真个视频理解模型,用于为海量的视频数据天生详细的、贴合内容的描述,进而构建海量的高质量视频文本对,使得演习出的模型指令遵照度高。
末了值得一提的是,智谱 AI 自研了一个将文本、韶光、空间领悟起来的 transformer 架构,该架构没有采取传统 cross attention 模块,而是在输入阶段就将文本嵌入和视频嵌入连接起来,以便更充分地进行两种模态的交互。
然而文本和视频特色空间存在很大差异,智谱 AI 通过 expert adaptive layernorm 对两者分别进行处理,使得模型能够高效利用参数来更好地将视觉信息与语义信息对齐。
智谱 AI 表示,通过优化技能,智谱 AI 天生式视频模型的推理速率提升了 6 倍。目前天生 6s 视频,模型花费的理论韶光是 30 秒钟。
如今随着「清影」的上线,视频天生赛道又涌现了智谱 AI 这位重磅玩家。
除了大家都能考试测验的运用之外,清影 API 也同步上线大模型开放平台 bigmodel.cn,企业和开拓者可以通过调用 API 的办法,体验和利用文生视频以及图生视频的模型能力。
随着各家公司 AI 视频生成功能的不断上线,今年的天生式 AI 竞赛已经进入白热化阶段。对付大多数用户来说,选择也更多了:现在,无论是完备没有视频制作根本的人,还是专业的内容创作者,都能借助大模型能力实现视频创作。