Vidu

Vidu Reference-to-Image

Vidu Reference-to-Image 从最多 4 张参考图像生成新图像,保留主体身份同时应用新提示词。支持 1:1、16:9 和 9:16 宽高比及编辑功能。

Vidu Reference-to-Image 是一个专为参考驱动创意工作流打造的专业模型。上传最多 4 张参考图像——模型提取并保留主体的身份、服装、姿势线索和视觉风格,同时根据文字提示词生成全新构图。与通用生成器不同,Vidu 专门为这种参考到输出的流程优化:你总是从现有图像开始进行转换。该模型默认以图像到图像模式运行,支持编辑指令修改特定元素同时保留整体构图。输出三种宽高比(1:1、16:9、9:16),覆盖方形社交帖子、宽屏内容和竖屏故事。定位为高端参考工具。在 Astorie 上,Vidu Reference-to-Image 构成强大流程的第一阶段:生成参考一致的静帧,然后用 Vidu Q1、Q2 或 Q3 视频模型添加动画——同一角色身份从静态延续到动态。

Illustrative sample of Vidu Reference-to-Image on the Astorie canvas — the same reference character placed in a brand-new scene while preserving face, outfit, and identity
示意样图——代表性输出,非模型逐字渲染结果。

支持的功能

文本生成图像
图像到图像
图像编辑
参考图像
多图输入
标签

最适合

  • 在新场景和环境中创建角色或产品的变体
  • 在内容系列中保持面部和身份一致性
  • 电商产品照——同一产品,不同造型和背景
  • 作为 Vidu Q1/Q2/Q3 视频动画输入的预制作静帧
  • 具有一致品牌角色的社交媒体内容系列

优势

  • 强大的主体身份保留——面部、服装和独特特征准确延续
  • 最多 4 张参考图像用于多角度主体理解
  • 内置编辑模式,优化特定元素无需重新生成整张图像
  • 与 Vidu 视频模型的直接流程,从静态到动态保持角色身份
  • 处理多样参考质量——不仅适用于棚拍,也适用于日常照片

局限性

  • 仅限参考模式——无纯文字生成图像;始终需要至少一张输入图像
  • 三种宽高比(1:1、16:9、9:16)——无超宽或自定义比例
  • 高端档位模型——大量迭代场景请先用更轻量的图像模型起草
  • 背景控制基于提示词而非可选项——效果取决于提示词的具体程度

使用技巧

提供 2-3 张不同角度的参考图像以获得最佳身份保留——正面、四分之三和侧面视角让模型完整理解主体。
在提示词中对新场景非常具体:"站在阳光普照的日本花园中,樱花盛开"比"户外场景"效果好得多。
生成后使用编辑模式优化——调整光照、更换配饰或修改背景,无需从头重新生成。
视频制作:用 Vidu Reference 生成主静帧,然后输入 Vidu Q2 或 Q3 添加动画——角色身份在整个流程中保持一致。
更轻量的探索方式:用 Kling Omni Image 起草参考构图,然后用 Vidu Reference 生成最终高保真版本。

Astorie 上使用 Vidu Reference-to-Image

Astorie 的无限画布上将 Vidu Reference-to-Image 与其他 AI 模型连接使用。无需 GPU,免费开始。

免费开始

常见问题

Vidu 可以不用参考照片生成图像吗?

不可以。Vidu Reference-to-Image 专为基于参考的生成设计。它始终需要至少一张输入图像。如需纯文字生成图像,请使用 FLUX、Imagen 4 或 Midjourney。

Vidu 可以使用多少张参考图像?

Vidu Reference-to-Image 接受最多 4 张参考图像。提供同一主体的多个角度(正面、四分之三、侧面)能让模型更好地理解和保留身份。

我可以用 Vidu 图像进行视频生成吗?

是的。Vidu Reference-to-Image 直接与 Vidu Q1、Q2 和 Q3 视频模型配合。生成参考一致的静帧,然后输入 Vidu 视频节点——角色身份会延续到动画中。

相关功能

操作指南

延伸阅读

相关图像模型

返回所有图像模型