详细介绍
通义万相(Wan)是阿里巴巴通义推出的 AI 视频与图像生成平台,主要用于通过文字、图片、音频、视频以及文档等多种输入方式生成和编辑视觉内容。
目前,万相官网的核心产品已经升级到万相 3.0。相比此前以单一文生视频、图生视频为主的生成方式,万相 3.0 进一步向多模态、全能参考和完整视频创作方向发展,支持文生视频、图生视频、参考生视频等多种生成方式,并能够使用图片、视频、音频、文件和网页等素材作为输入,最长可生成 30 秒、30fps 的视频。
除了视频生成,万相产品体系还覆盖文生图、图像生成与编辑等能力,因此可以将其理解为一个以AI图片和视频创作为核心的综合视觉生成平台。
万相 3.0 有什么特点?
万相 3.0 最明显的变化,是从传统的「输入一句提示词生成一段视频」,进一步发展为能够综合利用多种素材进行创作的全能参考视频生成模型。
万相 3.0 的定位是 All-in-One 全能参考视频生成模型,统一支持文生视频、图生视频以及参考生视频等多种使用方式。
目前重点展示的能力包括:
- 全能创作
- 原生 30 秒视频生成
- 多素材参考生成
- 文档和网页解析
- 文生视频
- 图生视频
- 参考生视频
- 视频编辑与延长等能力
万相 3.0 最多可以支持 20 个素材进行参考生成,同时支持复杂文档和网页解析。
万相 3.0 能做什么?
1. 文生视频
万相 3.0 支持直接使用文字描述生成视频。
用户可以描述人物、环境、动作、镜头、光影、画面风格以及故事情节等内容,模型根据提示词生成对应的视频。
例如,可以描述:
一名女孩在雨夜的城市街道中缓慢行走,霓虹灯倒映在积水中,镜头从远景逐渐推进到人物近景。
模型会根据这些描述生成对应的视频画面。
API 中称这一模式为 文生视频(Text-to-Video),不需要上传图片或其他媒体,只需要提供文本提示词即可。
2. 图生视频
万相 3.0 支持以图片作为视频生成的基础。
上传一张图片后,可以通过提示词描述希望发生的动作、镜头运动或者场景变化,让静态图片转化为动态视频。
例如,可以将一张人物照片生成:
- 人物走动
- 人物转身
- 人物说话
- 镜头推进
- 镜头环绕
- 环境动态变化
万相 3.0 还支持首帧生视频以及首尾帧生视频等方式,可以通过指定视频开始和结束时的画面,对生成过程进行控制。
3. 参考生视频
这是万相 3.0 的核心能力之一。
用户可以提供参考图片、参考视频、参考音频等素材,然后通过文字描述新的创作要求,让模型综合参考这些素材生成视频。
例如,可以提供一个人物参考图、一段动作参考视频,再描述新的场景,让模型尽可能保持人物特征和动作表现,同时生成新的视觉内容。
支持的参考素材包括:
- 参考图片
- 参考视频
- 参考音频
- 首帧图片
- 尾帧图片
其中参考图片最多可输入 10 张,参考视频最多 5 段、参考音频最多 5 段(且各自总时长不超过 15 秒)。
这使万相 3.0 不再局限于「从零生成」,而是可以利用已有的视觉和声音素材进行更精细的创作控制。
4. 多素材组合创作
万相 3.0 支持同时使用多种类型的参考素材。
支持的输入素材类型包括:
- 图片
- 视频
- 音频
- 文档
- 网页链接
其中图片、视频和音频可以作为参考素材参与视频生成;文档和网页也可以作为内容来源进行解析。
这也是万相 3.0 与传统 AI 视频生成工具比较明显的区别之一。
它不仅可以理解「一句提示词」,还能够结合用户提供的一组素材完成视频创作。
5. 文档生成视频
万相 3.0 进一步扩展了视频生成的输入形式,支持将办公文档等内容作为视频生成素材。
支持的文件类型包括:
- DOC
- DOCX
- XLS
- XLSX
- PPT
- PPTX
- TXT
- KEY
- PAGES
- NUMBERS
- MD
单个文件大小不超过 100MB;部分文档格式(PDF、DOC、DOCX、PPT、PPTX、KEY、PAGES 等)页数不超过 50 页。
这意味着,用户可以把原本用于汇报、培训、产品介绍或者知识分享的文档作为输入,让 AI 根据其中的内容进一步生成视频。
例如:
PPT → 宣传视频
PDF → 知识讲解视频
产品资料 → 产品介绍视频
Markdown/文字资料 → 内容视频
对于企业宣传、教育培训、知识类视频和营销内容制作,这种能力具有比较明显的实用价值。
6. 网页内容生成视频
除了文件之外,万相 3.0 还支持将公开网页作为输入素材。
可通过 link 类型传入网页链接,解析无需登录即可访问的公开网页,例如新闻、博客等内容。
因此,用户可以将一篇文章、产品介绍或者其他公开网页内容交给万相,再结合提示词进行视频创作。
这让万相 3.0 的使用方式从单纯的「AI生成视频」,进一步扩展到已有内容 → AI视频化。
7. 原生 30 秒视频生成
万相 3.0 将单次视频生成时长进一步提升到了 30 秒。
在没有视频输入的情况下,视频生成时长可以设置为 2~30 秒;有视频输入时,输入与输出视频的总时长不超过 30 秒,输出帧率为 30fps。
相比更短的视频生成长度,30 秒可以容纳更加完整的故事、动作和镜头变化,因此更适合:
- 广告片段
- 产品宣传
- 短视频
- 剧情片段
- 创意短片
- 教学内容
- 社交媒体视频
需要注意的是,30 秒是当前 API 支持的最长生成时长,并不意味着所有生成模式、所有输入组合都能生成完整 30 秒,具体上限还要看各生成方式自身的限制。
8. 多种镜头与画面控制
万相系列一直比较重视视频生成中的运动和镜头控制。
万相 3.0 可以通过文字描述对人物动作、场景变化以及镜头运动进行控制。
例如,可以在提示词中描述:
- 镜头推进
- 镜头拉远
- 横向移动
- 环绕拍摄
- 近距离特写
- 广角镜头
- 电影感画面
- 人物运动
- 环境变化
这使其不仅适用于简单的「图片动起来」,也可以用于更加复杂的动态场景创作。
9. 首帧与首尾帧生成
对于需要控制视频开头和结尾画面的场景,万相 3.0 支持首帧和首尾帧生成模式。
例如:
首帧:人物站在房间门口
↓
生成中间动作和镜头变化
↓
尾帧:人物来到窗边
通过指定开始和结束画面,可以对视频整体的视觉走向进行更明确的控制。
API 中分别用 first_frame 和 last_frame 表示,并支持首帧、首尾帧等素材组合。
10. 视频编辑与延长
万相 3.0 的应用并不局限于从零生成视频。
万相 3.0 还提供视频编辑、视频延长等模式,可以利用已有视频素材进一步进行处理和创作。
因此,万相更适合被理解为一个覆盖生成 + 编辑 + 参考创作的视频创作工具,而不仅仅是一款传统的文生视频模型。
万相 3.0 的输入方式
万相 3.0 最大的特点之一,就是输入形式比较丰富。
简单来说,可以按照以下方式使用:
| 输入方式 | 主要用途 |
|---|---|
| 文字 | 根据描述生成视频 |
| 图片 | 图生视频、首帧生成 |
| 首尾帧图片 | 控制视频起始和结束画面 |
| 参考图片 | 控制人物、物体、场景等视觉元素 |
| 参考视频 | 参考人物动作、表演和视频内容 |
| 参考音频 | 为视频生成提供声音参考 |
| 文档 | 根据文档内容生成视频 |
| 网页 | 根据公开网页内容生成视频 |
这些媒体输入类型可以按组合规则灵活搭配,来满足不同的创作需求。
这也是万相 3.0 当前产品定位中非常重要的一部分:从单一 Prompt 驱动的生成,转向多模态素材驱动的创作。
万相 3.0 支持哪些视频规格?
万相 3.0 支持的视频规格包括:
- 480P
- 720P
- 1080P
视频帧率为 30fps。
画面比例支持:
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
- 自适应比例
其中自适应模式可以根据输入素材比例和生成意图自动选择合适的画面比例。
因此,它既可以用于横屏视频,也适合抖音、小红书、视频号等常见的竖屏内容创作场景。
万相与 Wan 模型家族
「万相」既可以指面向普通用户的 AI 创作平台,也可以指阿里通义推出的 Wan 系列视觉生成模型。
Wan 模型家族从早期视觉生成模型开始不断迭代,先后推出了 Wan2.1、Wan2.2、Wan2.5、Wan2.6、Wan2.7 等模型。
其中,Wan2.1 于 2025 年 2 月首次开源;之后推出的 Wan2.2 进一步扩展了视频生成能力。Wan2.5 则开始重点探索原生多模态视频生成,并加入音画同步等能力;Wan2.6 又进一步增强了角色扮演、多镜头叙事以及音画同步等功能;Wan2.7 则把能力扩充到多镜头叙事、视频编辑等更完整的创作流程。
而目前万相官网的核心产品已经是 万相 3.0。
需要注意的是,万相 3.0 不应简单理解成 Wan2.6 的改名版本。它是新一代产品和模型能力体系,提供独立的万相 3.0 视频生成 API,模型名称包括 wan3.0-video 和高速版 wan3.0-video-prime。
万相 3.0 适合哪些人?
万相的应用范围比较广,尤其适合以下用户:
短视频创作者
可以利用文字、图片以及参考素材快速制作视频内容,减少传统拍摄和后期制作成本。
自媒体创作者
适合制作短视频、知识内容、故事类视频、社交媒体素材等。
广告和营销人员
可以利用产品图片、品牌素材以及文字资料生成广告创意和产品宣传视频。
电商从业者
可以将商品图片、产品资料等素材转换成更加动态的营销内容。
企业用户
可以将 PPT、PDF、产品资料、网页内容等转换为宣传片、培训视频和产品介绍视频。
影视和视觉创作者
可以利用参考图片、参考视频以及多种控制方式进行角色、场景和镜头创作。
AI开发者
可以通过阿里云百炼 API 调用万相 3.0,将视频生成能力集成到自己的应用、网站和自动化工作流中。目前提供标准版 wan3.0-video 和高速版 wan3.0-video-prime 两种型号。
万相 3.0 可以通过哪些方式使用?
对于普通用户,可以直接进入万相官网进行体验。
对于开发者,则可以通过阿里云百炼调用万相 3.0 API。
API 目前支持北京、新加坡、日本(东京)、德国(法兰克福)、美国(弗吉尼亚)和中国香港等地域,具体可用模型、地域和服务范围以阿里云当前控制台为准。
视频生成 API 采用异步任务模式,一般需要先创建任务,再通过 task_id 查询生成结果。
万相的优势
综合目前的产品能力,万相比较突出的特点主要有以下几个方面:
一是多模态输入。
不只是文字和图片,还可以使用视频、音频、文档以及网页作为创作素材。
二是全能参考创作。
万相 3.0 将文生视频、图生视频、首尾帧生成和参考生视频等能力统一到一个模型体系中。
三是更长的视频生成。
单次最长可以生成 30 秒、30fps 的视频,为完整故事和连续镜头提供了更大的创作空间。
四是文档和网页内容可以直接参与创作。
这使它不仅可以服务于娱乐和创意视频,也能够应用到企业宣传、教育培训、知识内容等场景。
五是同时面向普通用户和开发者。
普通用户可以直接使用万相进行创作,开发者则可以通过阿里云百炼 API 将万相能力集成到自己的产品中。
总结
通义万相(Wan)是阿里巴巴通义推出的 AI 视频与图像生成平台,目前官网的核心产品已经升级到万相 3.0。
万相 3.0 不仅支持传统的文生视频、图生视频,还提供首尾帧生成、参考生视频、多素材参考、视频编辑和视频延长等能力,并支持图片、视频、音频、文档和网页等多种输入方式。万相 3.0 单次最长可以生成 30 秒、30fps 视频,并支持最高 1080P 输出。
相比此前的 Wan2.x 系列,万相 3.0 更强调多模态输入、全能参考和完整视频创作流程。对于普通用户,它可以降低 AI 视频制作门槛;对于企业和开发者,则可以进一步通过阿里云百炼 API 将视频生成能力应用到内容生产、营销、电商、教育、影视等业务场景。
如果你正在寻找一款支持AI视频生成、图片生成、参考生视频以及多素材创作的国产 AI 工具,万相是目前值得关注的选择之一。
网站预览
