Flexible multilingual image generation model

















Wan v2.6 Text to Image 是一款多功能圖像生成模型,能將書面描述轉化為完成的視覺圖像,為藝術家、設計師和內容創作者提供從想法到圖像的快速途徑。適合寫實和風格化作品,它能讀取純文字提示,並產生反映您描述的心情、燈光、主體和細節的圖像。無論您是在草擬概念藝術、插畫故事、製作行銷視覺內容,或探索創意方向,Wan v2.6 都能提供靈活的起點,緊密回應您的文字描述。
此模型的亮點之一是其雙語理解能力。您可以用英文或中文撰寫提示,模型都能流暢解讀。這對跨語言或文化工作的創作者特別有價值,您可以用最自然的語言描述願景,而無需先翻譯想法。提示詞也可以相當詳細——最多支援 2,000 個字符,讓您能層層加入場景、大氣、攝影機角度、藝術風格和精細視覺細節,精準引導結果。
模型僅依文字運作,但您也可以提供一張可選的參考圖像來引導輸出風格。提供參考時,模型會借鑒其外觀和感覺來影響生成圖像,這在您需要符合現有美學、品牌色調或心情板的嶄新視覺時非常實用。支援常見格式包括 JPEG、PNG、BMP 和 WEBP,每邊解析度從 384 到 5000 像素。
控制輸出結果很簡單。您可使用方便的預設選項選擇輸出形狀和尺寸——如 square HD、portrait 4:3、portrait 16:9、landscape 4:3 和 landscape 16:9——或輸入精確尺寸以獲得特定畫布。若未指定尺寸且提供參考圖像,輸出將匹配參考尺寸,上限為 1280 x 1280 區域。此靈活性讓您能直接生成適合社群貼文、列印版面、寬銀幕場景或直式手機內容的視覺圖像,無需額外裁切。
除了主要提示詞,您還可加入負面提示詞來描述想避免的元素。這是簡單有效的清理結果方式——例如引導模型避開低解析度、變形或不需要的偽影。您有 500 個字符空間,足以排除常見問題,並推動模型朝向您想要的精緻外觀。
Wan v2.6 也能一次生成多張圖像。您可一次要求最多五張圖像,讓您探索同一想法的變化並挑選最佳結果,雖然視生成情況,模型有時可能返回較少張數。此批次方式適合腦storm會議,讓您並排比較概念的多種詮釋,再決定方向。
對重視一致性和可重現性的創作者,模型支援種子控制。設定種子可重現特定結果,或在維持整體構圖穩定的前提下,對提示進行小幅控制調整。這在您找到接近理想結果時非常有用,只需微調細節而非從頭開始。每個生成也會回報使用的種子,讓您儲存並回訪喜歡的外觀。
模型輸出 PNG 格式圖像,這是乾淨、高保真的格式,適合後續編輯、疊加和融入設計工作。其範例輸出偏向豐富、大氣的場景——想像一座古老圖書館飄浮在雲端,金黃時段光芒從巨大窗戶灑入,以寫實方式呈現。此類提示展現模型處理複雜燈光、層疊環境和引人入勝細節的舒適度,但依您的提示詞,它能處理廣泛的主體和風格。
Wan v2.6 也具備混合文字與圖像功能,在特定模式下可搭配生成文字。這為想要超越單張圖像的創作者開啟可能性,雖然模型的主要強項仍是圖像生成。
內容審核內建且預設啟用,會篩選您提供的輸入和產生的圖像。這有助保持生成內容在安全適當範圍內,對專業和商業創作用作至關重要。
最適合的用戶包括:插畫家和概念藝術家能快速視覺化場景與角色;平面設計師能生成背景、英雄圖像和風格探索;行銷人員與社群媒體創作者能產生吸睛視覺,並符合所需畫幅比例;電影製作者與故事講述者能建構心情板與預視化畫面。雙語提示支援擴大了其適用範圍,涵蓋英文與中文環境的創作者。
幾點實用提示有助獲得最佳結果。詳細描述性的提示詞能產生更忠實的圖像,因此值得詳述燈光、風格和構圖。使用負面提示排除常見缺陷,能明顯提升輸出品質。一次生成多張圖像並比較,是有效找到想法最佳詮釋的方式。儲存喜愛結果的種子,讓您日後回訪或精煉。總體而言,Wan v2.6 Text to Image 是一款能幹、適應性強的工具,將書面想法轉化為廣泛創作用的精緻視覺。
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
輸入提示詞,描述您想要的圖像,包含風格、光線與構圖細節
模型能理解您場景中的物理、光線與情感意圖
點擊以生成最終成果,並下載專業等級的圖像
展現生成電影感寬角視覺,具大氣燈光與時尚膠片外觀,完美用於故事講述。

示範生成活潑勵志場景,含多人精準性別與造型——適合現代生活品牌。

強調模型渲染建築複雜度、大氣燈光與寫實細節——提升現代勵志視覺故事。

“High-end studio product photography of premium wireless over-ear headphones in matte black finish. Dramatic three-point lighting with soft key light from upper left, rim light highlighting the ear cup contours, and subtle fill. Clean white seamless backdrop with soft gradient. Sharp focus on texture details of the leather headband and brushed metal accents. Professional advertising quality, 8K resolution, photorealistic rendering.”

立即切換至推理引導式合成
![V4.0q [instant]](https://v3b.fal.media/files/b/0aa12d17/6liDSFFStjD4rStlm4CS1.jpg)
Fast text rendering image generation
0.1 點數
![V4.0q [fast]](https://v3b.fal.media/files/b/0aa0cdc0/4AWx22ZkcZYZBZ73YKkdT.jpg)
Fast text-accurate image generation
0.1 點數

Fast high-quality text-to-image generation
0.3 點數

Precise structured text-to-image generation
0.2 點數

Detailed images with fine typography
4 點數

Fast efficient image generation
6 點數

Flagship multilingual text-to-image generation
0.3 點數

High-quality text-to-image with accurate text
1.3 點數

Fast, efficient image generation
6 點數