阿里万相3.0正式公测:视频生成与文档转化新突破
- 5899
阿里巴巴最新的视频生成模型Wan3.0已正式进入公测阶段。与前一版本Wan2.5相比,新模型的视频生成时长实现了翻倍,最长可达到30秒,并且支持的输入形式大大增加—除了常见的文字和图片外,现在用户还可以直接使用PDF文件、网页链接以及PowerPoint演示文稿作为素材,生成动态视频内容。Wan3.0在输入方面进行了显著改善,支持将文本、图像、视频和音频进行同步处理。每次可以输入的素材包括最多十张图片、五段视频和五段音频。此外,网页及文档输入也被支持,用户可以轻松将静态的PDF或PPT内容转化为动态的视频画面,为制作营销材料和培训视频等场景降低了创作门槛。该模型还会根据用户输入的提示内容,主动推荐合适的视频时长,并提供一个视频延长工具,方便用户在现有片段上继续扩展内容。
在针对AI视频生成过程中常见的画面漂移和失真问题上,Wan3.0进行了优化,特别是在人脸和用户界面(UI)的处理上有了显著改善。阿里方面表示,新模型旨在确保生成过程中参考素材中的角色、道具及空间布局等细节保持高度一致,从而减少视觉上的瑕疵。不过,这些改进效果目前仍需用户实际进行测试后才能进行验证。
Wan3.0的使用渠道包括wan.video官网、阿里云百炼平台(Model Studio),以及通过Qwen Cloud的API调用。服务分为两个版本:标准版(Standard)目前提供七折优惠,还有更快速的Prime版本可供用户选择。该模型的应用场景覆盖了影视制作、短剧和社交媒体视频创作,企业用户也能将文本与图片素材转化成宣传视频或培训材料。此外,技术开发层面,Wan3.0生成的仿真画面可用于训练自动驾驶系统和机器人,为这些领域提供接近真实环境的模拟数据。
值得注意的是,Wan3.0的发布正值阿里在AI领域进行高强度投入的时期。公司刚刚宣布的港股上市公司中最大规模的一次股票配售,募资将持续用于AI领域。上周发布的财报显示,季度利润同比下滑75%,原因便是AI相关投资大幅增加。阿里在AI视频领域的快速迭代与巨额资金的持续注入,表明其并非试水而是深入布局。
对于内容创作者和企业用户而言,Wan3.0的关键在于输入形式的灵活性显著提升,若其文档直接转视频的功能能够稳定运行,必将改变部分用户的工作流程。至于生成质量是否能够达到官方宣称的标准,还需通过实际测试加以验证。