Flexible multilingual image generation model

















Wan v2.6 文本生成图片是一款多功能图像生成模型,可将文字描述快速转化为成品视觉效果,为艺术家、设计师和内容创作者提供从创意到画面的高效路径。无论是照片级真实感还是风格化创作,都可通过简单文本提示,生成反映你所描述情绪、光线、主体和细节的图片。无论你是在勾勒概念艺术、故事插图、制作营销视觉,还是探索创意方向,Wan v2.6 都能根据你的输入灵活起步,紧密回应你的想法。
该模型的亮点之一是其双语理解能力。你可以用中文或英文输入提示,模型都能顺畅解析。这对于跨语言、跨文化创作的用户尤为有用,让你不必先翻译想法,就能用最自然的语言表达愿景。提示内容也可以非常详细——你有最多 2000 字符空间,可充分描述场景、氛围、镜头角度、艺术风格与细腻视觉细节,精确引导最终效果。
模型仅需文本就可工作,但你也可以提供一张可选参考图像,辅助输出风格。当你提交参考图时,模型将借其外观和氛围来调整生成的图片,非常适合希望新视觉与现有美学、品牌色系或灵感板相匹配的创作者。参考图支持 JPEG、PNG、BMP 和 WEBP 等常见格式,分辨率涵盖每边 384 至 5000 像素。
操作结果轻松直观。你可以通过便捷的预设选择输出图片的比例和尺寸——如正方形 HD、竖图 4:3、竖图 16:9、横图 4:3、横图 16:9——也可自定义精确尺寸,满足特定画布需求。如果未指定尺寸但有参考图片,输出将与参考图等比例匹配,最大可至 1280x1280 像素。这种灵活性让你可以生成适用于社交媒体、打印、宽屏场景或竖屏移动内容的视觉作品,无需额外裁剪。
你还可以为主提示添加负面提示,以描述你想避免的内容。这是一种简单而有效的方式来提升生成效果——比如避免低分辨率、形变或杂质。负面提示支持最多 500 字符,足以屏蔽常见问题,引导模型生成更精致的结果。
Wan v2.6 支持一次生成多张图片。单次最多可请求五张图片,便于探索同一创意的不同变体,挑选最佳方案,具体返回图片数量会视生成情况而定。此批量模式特别适合头脑风暴,便于并排比较多个概念再做决策。
对于重视一致性和可复现性的创作者,模型支持种子控制。设置种子可让你复现某一特定结果,或者在保持整体构图稳定的情况下,微调局部细节。当你已接近理想效果,只需小幅优化而无需重头开始时,这一功能尤为实用。每次生成都会返回所用种子代码,方便你保存或之后复用。
模型输出 PNG 格式图片,这是一种清晰高保真的格式,便于后期编辑、图层叠加和设计集成。示例输出多展现出丰富、氛围感强烈的场景——比如云中漂浮的古老图书馆,金色阳光穿越巨大窗户的照片级渲染。这类提示展现了模型处理复杂光影、分层环境和细腻细节的能力,当然模型还能根据你的提示适应多种题材与风格。
Wan v2.6 同时具备混合文本和图片的能力,部分模式下可同时输出生成文本和图像。这为需要超越单纯图片创作的用户打开了更多可能,不过模型的核心优势仍在于图像生成。
系统默认启用内容审核机制,对你输入的内容和生成的图片均会自动筛查,从而确保生成内容合乎安全和合规标准,适合专业及商业创意场景。
适用人群方面:插画师和概念艺术家可快速构思场景与角色;平面设计师能直接生成背景、主视觉及风格探索;市场和社交媒体创作者可按需比例输出吸睛视觉;影视与叙事创作者可制作灵感板、前期分镜等。双语提示支持,也大大扩展了模型在中英文创作环境下的适用范围。
一些实用建议有助于获得更优效果。详细、具象的提示通常生成结果更贴合,所以建议明确描述光线、风格与构图。善用负面提示,规避常见缺陷,可显著提升图片质量。一次批量生成多图并对比,能高效筛选最佳方案。喜欢的结果务必保存种子,便于后续复用或微调。总体来说,Wan v2.6 文本生成图片是将文字创意转化为精美视觉的专业、灵活工具,适用于各种创意工作。
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
输入提示词,描述你想要的图像,包含风格、光线和构图细节
模型能理解你场景中的物理效果、光线和情感意图
点击生成最终成果,下载制作级图像
展现模型营造宽幅、氛围灯光和潮流电影感画面的能力,助力叙事创作。

表现多人精致造型的活力场景,适用于现代生活方式品牌和营销。

突出模型在建筑结构、氛围光线和照片级细节的表现力,赋能现代理想视觉叙事。

“High-end studio product photography of premium wireless over-ear headphones in matte black finish. Dramatic three-point lighting with soft key light from upper left, rim light highlighting the ear cup contours, and subtle fill. Clean white seamless backdrop with soft gradient. Sharp focus on texture details of the leather headband and brushed metal accents. Professional advertising quality, 8K resolution, photorealistic rendering.”

立即切换至推理引导式生成
![V4.0q [fast]](https://v3b.fal.media/files/b/0aa0cdc0/4AWx22ZkcZYZBZ73YKkdT.jpg)
Fast text-accurate image generation
0.1 积分

Unified image generation and editing
1.5 积分

Design-first text to image generation
0.2 积分

High-quality text-to-image with accurate text
1.3 积分

Detailed images with fine typography
4 积分

High-fidelity text-to-image generation
0.1 积分
![V4.0q [instant]](https://v3b.fal.media/files/b/0aa12d17/6liDSFFStjD4rStlm4CS1.jpg)
Fast text rendering image generation
0.1 积分

Flagship multilingual text-to-image generation
0.3 积分

Precise structured text-to-image generation
0.2 积分