8月6日,阿里巴巴正式开启其视频生成大模型Wan 3.0的公测。此次升级聚焦于生成时长、万能创作、全能参考以及真实世界还原等维度,其中最直观的变化是单次可生成30秒视频,使得AI视频从“生成一个镜头”迈向“讲述一段完整的故事”,连续运镜、一镜到底等复杂镜头语言得以实现。此外,Wan3.0还具备智能时长功能,可根据提示词自动推荐合适的视频长度。
Wan3.0的另一大突破在于输入模态的扩展。除了文本、图片、音频、视频四种基础模态外,它首次支持doc、xls、ppt、pdf、md等文档格式输入。用户上传一份PPT或文档,搭配提示词,即可生成教学课件、产品演示、业务汇报等视频内容。例如,上传一个智能眼镜产品的PPT,就能得到一个完整的形象片。单个文件或链接不超过100MB、50页。这背后是模型强大的提示词工程与指令遵循能力,将提示词转化为调度输入、控制表达的中枢。
在真实世界还原方面,Wan3.0力求精准复刻现实场景与数字化信息。生成视频中的人像追求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作联动。在全能参考任务中,角色、道具、声音、空间关系、风格等细粒度维度均可稳定保持。同时,图表、数据与界面内容的画面审美也得到提升。
Wan3.0的视频编辑能力亦有大幅提升,支持修改画面、剧情与台词。不过,在声音质感与文字准确度方面仍有进步空间。
即日起,Wan3.0在阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友开启公测,并在千问APP灰度开放。API价格方面,480P/720P/1080P分别为0.3/0.6/1.2元/秒,API接口将于近期全量开放。
从行业视角看,Wan3.0将文档转化为视频的能力,标志着AI视频生成正从内容生成工具升级为生产力工具,有望在教育培训、企业营销、产品演示等场景中发挥更大价值。不过,其实际效果和商业化落地仍有待市场检验。