Cinematic video from references
Seedance 2 Reference to Video هو نموذج الفيديو الأكثر تقدماً من ByteDance المعتمد على المراجع، تم تصميمه لصناع المحتوى الذين يرغبون في توجيه عملية التوليد باستخدام مواد حقيقية بدلاً من النص فقط. بدلاً من وصف كل شيء من البداية، يمكنك تغذية النموذج بمزيج من ملفات المراجع تصل إلى 9 صور، و3 مقاطع فيديو، و3 مقاطع صوتية (بحد أقصى 12 ملف عبر جميع الأنواع)، وتدمجها مع مطالبة مكتوبة. تشير إلى كل عنصر مباشرة في مطالبتك باستخدام وسوم بسيطة مثل @Image1 أو @Video1 أو @Audio1، ليعرف النموذج بالضبط أي وجه أو بيئة أو حركة أو صوت ترغب في الحفاظ عليه. النتيجة هي مقطع سينمائي مستمر واحد يحترم مراجعك أثناء ملء العالم من حولها.
الميزة الأبرز هي الصوت الأصلي. في جلسة توليد واحدة، ينتج النموذج صوتاً متزامناً مع الصورة: ضوضاء محيطة، مؤثرات صوتية، موسيقى، وحتى حوار متزامن مع حركة الشفاه. لا توجد خطوة منفصلة لإضافة الصوت لاحقاً. هذا يعني أن مشهد الحشود الصاخبة يمكن أن يظهر مع صرخات متداخلة، ونقر كاميرا، وصفارات الإنذار البعيدة، ومحرك سيارة يعمل، وكل ذلك مضبوط مع الحركة على الشاشة. يمكنك ترك توليد الصوت مفعلاً للحصول على مقطع نهائي جاهز، أو إيقافه إذا كنت تفضل إضافة الصوت بنفسك.
التحكم الإبداعي يُعد من أكبر نقاط القوة. يمكنك توجيه الكاميرا من خلال مطالبتك باستخدام لغة سينمائية، وطلب حركات مثل الدوللي زووم، والتتبع، وتحريك الكاميرا باليد مع اهتزازات خفيفة طبيعية، والتبديل بين وجهات النظر، واختيار زوايا تصوير على مستوى العين أو مرتفعة. النموذج يفسر هذه التعليمات كما يفعل مدير التصوير. كما يتعامل مع الفيزياء الواقعية، لذلك تظهر ديناميكيات السوائل، وحركة الأقمشة، وحركة الشخصيات بشكل مقنع. من القدرات المفيدة أيضاً التحرير متعدد اللقطات: داخل عملية توليد واحدة تصل حتى 15 ثانية، يستطيع النموذج إنشاء انتقالات طبيعية بين لقطات متعددة وليس مجرد إطار ثابت واحد.
وبفضل قبول المراجع الصورية، يتميز النموذج بثبات عالٍ في التفاصيل. عند تقديم صورة شخصية مرجعية، يستطيع النموذج عرض نفس الوجه والملابس عبر اللقطة بأكملها، حتى عند تحويل الشخصية إلى نمط بصري مختلف. تظهر الأمثلة مزيجاً من الشخصيات الكرتونية ثلاثية الأبعاد المركبة بسلاسة في بيئة واقعية بالكامل، مع الحفاظ التام على تفاصيل الشخصية والملابس كما في الصورة الأصلية، مع تفاعل واقعي مع الضوء، وارتدادات الفلاش، ولمسات إضاءة أعمدة الشارع والظلال. هذا يجعله مثالياً لمن يحتاج أن يحافظ على شخصية متكررة أو منتج محدد أو مظهر ثابت طوال المشهد.
بالنسبة لخيارات الإخراج، يمكنك التوليد بدقة 480p لسرعة أكبر، أو 720p لتحقيق توازن بين الجودة والسرعة، أو 1080p للحصول على نتائج عالية الجودة. المدة مرنة من 4 إلى 15 ثانية، أو يمكنك ترك النموذج يحددها تلقائياً حسب طلبك. نسبة العرض/الارتفاع مرنة أيضاً: اختر 16:9 للأفقي، أو 9:16 للعمودي والمنصات الاجتماعية، أو 1:1 للمربع، أو 21:9 للإطار السينمائي، أو 4:3، 3:4، أو أوتو ليدع النموذج يختار الأنسب. يمكنك أيضاً طلب تشفير بجودة أعلى عند الحاجة لملف أكبر وأنقى، وتثبيت القيمة العشوائية لإعادة إنتاج نتيجة أعجبتك (مع احتمال حدوث فروقات بسيطة).
حدود إدخال المراجع واضحة: الصور يمكن أن تكون JPEG أو PNG أو WebP حتى 30 ميجابايت لكل صورة، وبحد أقصى 9 صور. الفيديوهات يجب أن تكون MP4 أو MOV، لمدة إجمالية بين 2 إلى 15 ثانية، وحجم إجمالي أقل من 50 ميجابايت، وكل فيديو بين 480p و720p، وبحد أقصى 3 فيديوهات. الصوت يمكن أن يكون MP3 أو WAV، حتى 3 مقاطع صوتية بمدة إجمالية لا تتجاوز 15 ثانية وبحجم 15 ميجابايت لكل منها. قاعدة مهمة: إذا أضفت مراجع صوتية، يجب أن ترفق معها على الأقل صورة واحدة أو فيديو مرجعي. وفي جميع الحالات، لا يمكن أن يتجاوز العدد الكلي لملفات المراجع 12 ملفاً عبر كل الأنواع.
من المستفيد؟ صناع الأفلام والمخرجون يمكنهم استخدامه لمعاينة أو إنتاج تسلسلات سينمائية قصيرة بلغة كاميرا واقعية وصوت نهائي متكامل. بمقدور منشئي المحتوى ومنتجي وسائل التواصل الاجتماعي تحويل صورة شخصية واحدة إلى مقاطع عمودية متسقة. المعلنون والمسوقون يمكنهم إدراج صورة منتج داخل بيئة منسقة بإضاءة وحركات كاميرا محكمة. الرسامون ومبدعو الوسائط المختلطة يمكنهم مزج شخصيات كرتونية مع عوالم واقعية تماماً، بنفس الأسلوب الهجين الموجود بالأمثلة. وبما أنه يعتمد على صورك وفيديوهاتك وصوتك، فهو مثالي عندما تكون هوية العلامة التجارية، أو شخصية معينة، أو مظهر محدد أكثر أهمية من التوليد النصي التقليدي.
بعض أفضل ممارسات الاستخدام تأتي بشكل طبيعي من طريقة عمله. أكتب مطالبتك كالمخرج: صف النمط، الإضاءة والبيئة، الشخصية، تسلسل الأحداث، والصوت المطلوب، واذكر المراجع التي تريد المحافظة عليها بوضوح باستخدام وسوم @ حتى يعرف النموذج ما يجب أن يبقى. حافظ على فيديوهاتك المرجعية ضمن الحدود المسموحة حتى تستخدم بسلاسة، وتذكر أن إدخال الصوت يتطلب مرجعاً بصرياً واحداً على الأقل. وللحصول على نتائج احترافية، اعتمد على أوصاف تفصيلية للحركة والتعليمات الموجهة للكاميرا، حيث يتجاوب النموذج جيداً مع هذا المستوى من التحديد، كما يظهر في مثال حشد الجمهور والموكب المعقد. مع اختيار مراجع مناسبة وتوجيه واضح، يقدم Seedance 2 Reference to Video مقاطع سينمائية متكاملة بالصوت ملتزمة بالمواد التي تقدمها له.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
صف مشهد الفيديو الخاص بك مع الحركة وزوايا الكاميرا والأجواء
ينشئ النموذج حركة سينمائية بفيزياء وإضاءة طبيعية
نزّل وشارك الفيديو الجاهز للنشر
يسلط الضوء على تحكم الكاميرا الاحترافي مع حركات كاميرا متعددة المراحل، ومحاكاة الأجواء الطبيعية، وديناميكيات المشهد على نطاق مناظر طبيعية مناسبة لأفلام السفر العريضة.
يعرض قدرة Seedance 2 على معالجة انتقالات المشهد المعقدة، والفيزياء الأسلوبية (تحطم الزجاج، تطاير العناصر)، وإضاءة مسرحية متقنة — لإبراز القدرة السردية السينمائية في إنتاج فيديوهات موسيقية.
يبرز محرك الفيزياء الواقعية وتوليد الصوت الأصلي مع تصميم صوتي بيئي (صوت الثلج، الرياح، التنفس) — لتقديم لقطات وثائقية بجودة نتفليكس مع حركات حيوانات دقيقة وأجواء مثالية.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
انتقل إلى الإنشاء الموجَّه بالاستدلال اليوم

Frontier 2K text-to-video generation
7.3 رصيد

Fast balanced text-to-video generation
1.6 رصيد

Fast cinematic video with audio
0.1 رصيد
Text to video with audio
0.7 رصيد

Cinematic video from references
0.4 رصيد

Cinematic video with native audio
1.4 رصيد
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 رصيد

Film-grade video with audio
0.1 رصيد

Text to video with audio
0.3 رصيد