新闻资讯

阿里通义万相 2.1 模型宣布升级:首次实现中文文字视频生成功能

IT之家 1 月 10 日消息,阿里旗下通义万相宣布推出2.1 版本模型升级,视频生成、图像生成两大能力均有显著提升。

阿里通义万相 2.1 模型宣布升级:首次实现中文文字视频生成功能
(图侵删)

在视频生成方面,通义万相 2.1通过自研的高效 VAE 和 DiT 架构增强了时空上下文建模能力,支持无限长 1080P 视频的高效编解码,首次实现了中文文字视频生成功能,登上 VBench 榜单第一。

据介绍,通义万相 2.1 支持中英文视频,都可以一键生成艺术字,还提供多种视频特效选项,以增强视觉表现力,例如过渡、粒子效果、模拟等等。

▲Prompt:以红色新年宣纸为背景,出现一滴水墨,晕染墨汁缓缓晕染开来。文字的笔画边缘模糊且自然,随着晕染的进行,水墨在纸上呈现“福”字,墨色从深到浅过渡,呈现出独特的东方韵味。背景高级简洁,杂志摄影感。

IT之家注意到,通义万相 2.1 还支持复杂运镜,可还原碰撞、反弹、切割、挤压等真实世界的物理规律,例如雨滴落在伞上会溅起水花。

▲Prompt:一对穿着正式晚礼服的夫妇在回家途中遭遇大雨,他们撑着黑色雨伞。平拍镜头下,男士穿着黑色西装,女士穿着白色长裙。他们在雨中缓缓行走,雨水沿着伞面滴落。镜头跟随他们的步伐平稳移动,展现出他们在雨中的优雅姿态。

图片生成方面,通义万相 2.1 支持文生组图,采用了 IC-LoRA 图像生成训练方法,利用 DiT 架构,增强文本到图像的上下文能力;对多张图像进行拼接与联合描述即可实现关联图像间的组合生成,并保持特征稳定连续。

▲Prompt:浪漫的公园里,一对青年男女在温馨的拥抱交谈

  • 镜报:维卡里奥伤缺,热刺有意冬窗2000万镑签伯恩利门将特拉福德
  • 英国国家电网拟向其输电业务投入350亿英镑_1
  • 法媒:阿什拉夫、维蒂尼亚已续约至2029年,努诺-门德斯也将续约
  • 终于知道wd提现到支付宝安全吗避坑分享
  • 博腾股份副总经理王丰平辞职_3
  • 美国务卿:美国将再为乌克兰提供5亿美元军援
  • 喜报!长春净月高新区获评5A级吉林省景区城!
  • J罗:我想参加2026世界杯,我速度不快但可以用40米传球创造机会
  • 阿里通义万相 2.1 模型宣布升级:首次实现中文文字视频生成功能的相关内容

    关键词: