当前位置:首页 > 科技资讯 > 正文

字节新宠Seedance 2.0,春节燃爆多模态模型大战

在预热阶段便引发广泛关注的Seedance 2.0提前亮相,字节跳动正式加入春节模型大战,带来一场科技与创意的盛宴。

根据字节跳动此前规划,原定于2月14日发布的视频模型Seedance 2.0、图像创作模型Seedream 5.0 Preview以及豆包大模型2.0,如今已提前面世。

字节透露,Seedance 2.0采用了统一的多模态音视频联合生成架构,这一架构支持文字、图片、音频、视频四种模态输入,集成了目前业界最全面的多模态内容参考和编辑能力。

令人瞩目的是,Seedance 2.0支持混合模态输入,用户可同时输入多达9张图片、3段视频、3段音频以及自然语言指令,极大地丰富了创作可能性。

字节新宠Seedance 2.0,春节燃爆多模态模型大战 Seedance 2.0 多模态模型 字节 春节 第1张

在多模态参考能力演示中,Seedance 2.0展示了其强大的生成能力,通过一系列精心设计的提示词,成功生成了具有电影质感的视频,人物鲜活,转场丝滑。

根据实测,用户可直接在交互界面选择“全能参考”生成模式,并通过提示词中的@符号来标记参考图,保证生成的一致性。

生成5秒视频需扣除40个点数,由于大量用户排队,预计生成时间为2小时。系统提供两次免费加速机会,但需注意版权限制,部分名人相关图片无法生成内容。

字节新宠Seedance 2.0,春节燃爆多模态模型大战 Seedance 2.0 多模态模型 字节 春节 第2张

相比之前的1.5版本,Seedance 2.0在生成质量、复杂交互和运动场景下的高可用率、以及更符合物理学特点等方面均有显著提升。

字节官方表示,Seedance 2.0解决了物理规律遵循和长效一致性难题,核心依靠海量世界知识、稀疏架构的效能优势,以及多模态联合训练所涌现的泛化能力。

此外,Seedance 2.0还具备强大的视频编辑能力,支持对指定片段、角色、动作或剧情进行定向修改。同时,最长支持15秒的多镜头视频生成,为影视、广告等领域提供了便捷的内容制作解决方案。

需要注意的是,即梦的APP端和PC端虽均整合了Seedance 2.0模型,但功能略有差异。移动端“出镜”功能默认采用Seedance 2.0,而创作功能中则提供了不同选项。PC端用户则可在视频生成的不同入口使用Seedance 2.0。

对此差异,字节内部人士表示,主要是基于不同设备应用场景的不同,为创作者提供了多样化的创作能力。

在基准测试方面,字节跳动透露,Seedance 2.0在文生视频和图生视频覆盖的运动稳定性、指令遵循、音画同步等维度上大幅领先同类产品。但公司也承认,仍需持续改善细节稳定性、拟真度以及多人口型匹配等问题。

字节新宠Seedance 2.0,春节燃爆多模态模型大战 Seedance 2.0 多模态模型 字节 春节 第3张

在多模态任务方面,Seedance 2.0在提示词指令遵循、多模态遵循两个维度表现尤为突出。而在编辑一致性、参考对齐和动态质量上,也处于行业领先地位。

字节表示,Seedance 2.0在多模态任务处理上指令响应更加完整,生成画面更加真实。在一致性表现上,模型在主体形象与声音还原方面表现相对较好。但公司也承认在模型的多主体一致性、文字还原精度及复杂编辑效果上仍有优化空间。