通义万相 2.5 在云栖大会上亮相,首次实现音画精准同步,支持文生视频、图生视频等多种模态生成。用户仅需输入一句话,即可生成 10 秒 1080P 高清电影级视频,并自动匹配音效、BGM 和人声。模型采用原生多模态架构,技术领先,大幅降低视频创作门槛,被玩家称为 “Veo 3 的真正对手”。
AIWW评析
通义万相 2.5 的发布标志着 AI 视频生成技术迈入新阶段。其原生多模态架构解决了传统多模型拼接的生硬问题,实现了音画无缝同步,这在 AI 视觉生成领域具有里程碑意义。从实测效果来看,无论是画面质感还是指令理解能力,都达到了国际顶尖水平。这一技术不仅为专业创作者提供了强大工具,也让普通人能够轻松实现电影级视频创作。未来,随着模型的进一步优化,AI 生成整部电影或将成为现实。
