AI 视频模型
OmniHuman 1.5 AI 视频生成器
当项目以一张可用人像图和一段驱动音频开始,并且片段应跟随这些来源媒体、而不是走文字生视频流程时,可选择 OmniHuman 1.5。
OmniHuman 1.5 任务方向
这些本地参考用于把 OmniHuman 1.5 当前的输入和控制项转化为具体任务方向,不作为该模型的生成结果展示。
每张卡都会标明它是已核验的模型系列示例,还是视觉参考。视觉参考不代表模型基准,也不构成前后效果声明。
- 输入要求
- 需上传 1 张图片和 1 段音频
- 当前设置
- 提示词长度: 最多 1,000 个字符 · 视频时长: 由上传音频时长决定(无时长选择器) · 输出分辨率: 720P / 1080P · 画面比例: 由上传素材决定画面比例
- 选型边界
- 如果只有文字,或只有图片但没有音频,不应使用这个工作流。它不承诺口型同步、身份保持或表演效果;任一必需来源文件缺失时,请比较文字或图片主导模型。
动作节拍
说明一个主体动作,以及片段应从哪个瞬间开始。
- 任务方向
- 说明一个主体动作,以及片段应从哪个瞬间开始。
视觉参考,不作为该模型输出
ImageStyle 本地视觉参考,不作为特定模型的生成结果展示。
镜头方向
说明镜头行为,以及它应随时间揭示的视觉变化。
- 任务方向
- 说明镜头行为,以及它应随时间揭示的视觉变化。
视觉参考,不作为该模型输出
ImageStyle 本地视觉参考,不作为特定模型的生成结果展示。
结束状态
定义最终视觉状态,但不要把这条参考当作当前模型的生成结果。
- 任务方向
- 定义最终视觉状态,但不要把这条参考当作当前模型的生成结果。
视觉参考,不作为该模型输出
ImageStyle 本地视觉参考,不作为特定模型的生成结果展示。
- 生成内容
- AI 视频
- 输入方式
- 需上传 1 张图片和 1 段音频
- 视频时长
- 由上传音频时长决定(无时长选择器)
与相近模型对比当前可用设置
先看输入、输出和画面控制是否匹配任务,再进入对应工作区生成。此表不把示例素材当作跨模型性能测试。
OmniHuman 1.5
当前页面
适合把上传的人像图片和音频结合成视频。
- 输入方式
- 需上传 1 张图片和 1 段音频
- 提示词长度
- 最多 1,000 个字符
- 视频时长
- 由上传音频时长决定(无时长选择器)
Seedance 2 Mini
适合结合文字、媒体参考、生成音频和网页搜索的多模态短视频。
- 输入方式
- 文字提示词或兼容参考媒体(最多 3 图片、最多 3 视频、最多 3 音频)
- 提示词长度
- 最多 20,000 个字符
- 视频时长
- 4–15 秒
Seedance 2 Fast
适合当前 Fast 命名、默认 15 秒片段的多模态视频工作流。
- 输入方式
- 文字提示词或兼容参考媒体(最多 5 图片、最多 3 视频、最多 3 音频)
- 提示词长度
- 最多 20,000 个字符
- 视频时长
- 4–15 秒
Seedance 2
适合需要明确选择 480p 至 4K 输出的多模态视频任务。
- 输入方式
- 文字提示词或兼容参考媒体(最多 5 图片、最多 3 视频、最多 3 音频)
- 提示词长度
- 最多 20,000 个字符
- 视频时长
- 4–15 秒
OmniHuman 1.5 可以帮助你控制什么
让人像和音频共同驱动
OmniHuman 1.5 当前需要一张人像图和一段音频。上传音频决定时长,来源媒体决定画面比例,工作区提供 720p、1080p 和快速模式。
上传必需媒体
需上传 1 张图片和 1 段音频。只上传你有权在当前项目中使用的媒体。
确认片段设置
当前片段设置包括 由上传音频时长决定(无时长选择器)、720P / 1080P 和由上传素材决定画面比例。
OmniHuman 1.5 当前设置
以下内容来自当前 ImageStyle 模型配置,用于帮助你在开始前判断是否匹配任务。
| 设置 | 当前可用内容 |
|---|---|
| 输入方式 | 需上传 1 张图片和 1 段音频 |
| 提示词长度 | 最多 1,000 个字符 |
| 视频时长 | 由上传音频时长决定(无时长选择器) |
| 输出分辨率 | 720P / 1080P |
| 画面比例 | 由上传素材决定画面比例 |
| 额外控制 | 以当前基础设置为准 |
AI 视频模型
何时选择 OmniHuman 1.5
适合把上传的人像图片和音频结合成视频。
当前工作流适配点
当项目以一张可用人像图和一段驱动音频开始,并且片段应跟随这些来源媒体、而不是走文字生视频流程时,可选择 OmniHuman 1.5。
需要比较其他模型时
如果只有文字,或只有图片但没有音频,不应使用这个工作流。它不承诺口型同步、身份保持或表演效果;任一必需来源文件缺失时,请比较文字或图片主导模型。
如何使用 OmniHuman 1.5 生成视频
把人像和音频作为两个主要来源,再只用可选提示词澄清围绕这些来源媒体的处理方向。
- 1
核对两个必需来源
在设置输出选项前,确认人像主体和驱动音频都已获项目授权,并且二者相互匹配。
- 2
检查画面和音频的一致性
让上传图片中的主体与音频的语言、节奏或表演目标保持一致;只有需要补充控制时再填写文字方向。
- 3
确认时长和输出设置
生成前在工作区确认当前的 由上传音频时长决定(无时长选择器)、720P / 1080P 和由上传素材决定画面比例。
- 4
生成后检查连续性
在公开使用前检查主体运动、镜头变化、可见文字、声音和最后画面。
开始前与发布前的检查
- 设置以工作区为准
- 模型可用性和设置会变化;提交前请以当前工作区显示的选项为准。
- 只使用已授权媒体
- 上传图片、视频或音频时,请确认你有权在当前项目中使用和发布它。
- 人工核对视频结果
- 发布前仍应人工检查动作连续性、文字、声音、人物、商品细节和标识。
OmniHuman 1.5 常见问题
- OmniHuman 1.5 可以只用文字或只用图片吗?
- 不可以。当前工作流需要一张人像图和一段音频;任一来源不可用时,请使用文字或图片主导的视频模型。
- OmniHuman 1.5 可以从参考媒体开始吗?
- 需上传 1 张图片和 1 段音频。生成前请确认媒体类型和数量限制,并只上传已授权素材。
- OmniHuman 1.5 支持多长的视频?
- 当前视频时长设置为 由上传音频时长决定(无时长选择器)。
- OmniHuman 1.5 有哪些输出控制?
- 当前支持 720P / 1080P、由上传素材决定画面比例;其他可用控制包括以当前基础设置为准。
- 生成结果可以直接发布吗?
- 不建议直接发布。公开使用前,请人工检查动作连续性、文字、声音、商品细节和其他必须准确的元素。
更新日期:
能力来源: 当前 ImageStyle 视频模型配置。