Text to video with audio
Grok Imagine Video 1.5 Text to Video، الذي طورته xAI، يحول الوصفات المكتوبة إلى مقاطع فيديو قصيرة كاملة مع الصوت، كل ذلك من مطالبة نصية واحدة. تصف المشهد الذي تريده، ويولد النموذج مقطعًا متحركًا يحمل صوتًا يطابق كلماتك. لا حاجة لتقديم صور مرجعية أو لقطات مسبقًا. تكتب فقط، ويتولى النموذج الباقي، مما يجعله واحدًا من أكثر الطرق مباشرة للانتقال من فكرة في رأسك إلى مقطع نهائي على الشاشة.
في قلب هذا النموذج تقنية سرد القصص القائمة على المطالبة. يمكن أن يصل وصفك النصي إلى طول كبير، مما يمنحك مساحة لتوضيح الشخصيات والإعدادات والإضاءة والمزاج والحركة والأسلوب بكل التفاصيل التي تريدها. مثال على المطالبة يظهر نوع النطاق التعبيري الذي يستجيب له النموذج: "Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." هذه الجملة الواحدة تحتوي على الشخصية والحركة والبيئة والإضاءة وأسلوب بصري محدد جدًا، ويعمل النموذج على دمج كل هذه العناصر في مقطع متحرك متماسك.
إحدى الميزات البارزة لهذا النموذج هي توليد الصوت جنبًا إلى جنب مع المرئيات. بدلاً من إنتاج مقطع صامت يجب عليك تسجيله أو تصميم صوته بشكل منفصل، يقدم فيديو مع صوت مدمج من البداية. النموذج مصمم للإخراج المصمم والتحويلي ومزامنة الشفاه، مما يشير إلى راحته مع المشاهد التعبيرية القائمة على الشخصيات حيث يجب أن تكون الأفواه والتعبيرات والحركة مترابطة مع ما يحدث على الشاشة.
لديك سيطرة حقيقية على شكل وطول إخراجك. يمكن تعديل المدة، مما يتيح لك إنتاج أي شيء من نبضة سريعة لثانية واحدة إلى مقطع لمدة خمس عشرة ثانية، حتى تطابق الطول مع ما تصنعه، سواء كان حلقة اجتماعية سريعة أو لحظة سردية أطول. الافتراضي عند ست ثوانٍ، طول مريح لمعظم الأفكار القصيرة. يمكن تعيين الدقة إلى 480p أو 720p أو 1080p، مما يمنحك خيارًا بين مسودات أسرع وأخف وصور نهائية أكثر وضوحًا وتفصيلاً. الافتراضي 720p يحقق توازنًا عمليًا بين الوضوح والكفاءة.
دعم نسب العرض إلى الارتفاع واسع بشكل غير عادي. يمكنك الاختيار من 16:9 للإطارات السينمائية والأفقية، أو 9:16 الرأسية لصيغ الهواتف المحمولة والاجتماعية، أو المربع 1:1 للمنشورات المناسبة للتغذية، ومجموعة من الخيارات الوسيطة بما في ذلك 4:3 و3:2 و2:3 و3:4. هذه المرونة تعني أنه يمكنك توليد مقطع مُطَوَّر بالفعل بشكل صحيح لموقعه، سواء كان مقطعًا أفقيًا أو قصة رأسية أو بلاط اجتماعي مربع، دون الحاجة إلى القص أو إعادة التنسيق لاحقًا.
يخرج النموذج فيديو MP4 قياسي، الذي يعمل ويشارك بسهولة عبر أدوات التحرير والمنصات الاجتماعية وبرامج العروض. تُعْمَل المقاطع بمعدل 24 إطارًا في الثانية، معدل إطارات مرتبط طويلاً بالمظهر السينمائي، ويولد النموذج تسلسل الإطارات الكامل اللازم لملء المدة المختارة.
هذا النموذج مناسب بشكل طبيعي لمجموعة واسعة من المحترفين الإبداعيين. يمكن للرسامين المتحركين والرسامين الاستفادة من قواه المصممة لإحياء جماليات الأنمي والتشيبي والشوجو والأساليب المصورة الأخرى في الحركة. يمكن لمنشئي وسائل التواصل الاجتماعي والمسوقين توليد مقاطع رأسية ومربعة مخصصة لمنصاتهم دون إعادة تنسيق إضافية. يمكن لصانعي الأفلام ورسامي القصص تصور المشاهد والمزاجات وطاقة الكاميرا بسرعة قبل الالتزام بإنتاج كامل. يمكن للمصممين وفرق المحتوى إنتاج لحظات تجارية قصيرة ومفاهيم متحركة ومقاطع شخصيات تعبيرية مباشرة من وصف مكتوب. وبما أنه لا يحتاج إلى أكثر من مطالبة، فإنه يخفض الحاجز أمام أي شخص لديه رؤية قوية لكن ليس لديه خط أنابيب للقطات أو الرسم لتحقيقها.
العمل مع النموذج يكافئ المطالبات الوصفية المتعددة الطبقات. كلما حددت الموضوع والحركة والإعداد والإضاءة والأسلوب البصري بوضوح أكبر، كلما عكس النتيجة نيتك بدقة أكبر، كما يظهر مثال الأنمي. تكديس إشارات أسلوبية محددة وكلمات مزاجية ووصفات حركة يعطي النموذج هدفًا أغنى للتصويب نحوه. إذا أردت مظهرًا مصممًا أو تحويليًا، فإن القول صراحةً مع الجمالية التي تسعى إليها يساعد في توجيه الإخراج نحو ذلك الاتجاه.
هناك بعض الاعتبارات العملية التي يستحق الحفاظ عليها في الاعتبار. المقاطع قصيرة بتصميم، محددة بـخمس عشرة ثانية، لذا يتألق هذا النموذج في اللحظات القوية المستقلة بدلاً من المشاهد المستمرة الطويلة. الدقة الأعلى تنتج تفاصيل أكثر لكنها تشمل عملًا أكثر للعرض، لذا يمكن أن يكون إعداد أخف مفيدًا للتكرار السريع والمسودات قبل الالتزام بإصدار 1080p مصقول. بما أن الإخراج يُولَّد بالكامل من نصك، يمكن أن تختلف النتيجة الدقيقة بين التشغيلات، مما يجعل التكرار جزءًا طبيعيًا من العملية: حسِّن صياغتك، اضبط الإطار والطول، وأعد التوليد حتى يصل المقطع إلى ما تخيلته. مع مزيجها من توليد يشمل الصوت وإطارات مرنة وطول قابل للتعديل وميل واضح للمحتوى المصمم التعبيري، Grok Imagine Video 1.5 Text to Video نقطة انطلاق متعددة الاستخدامات لتحويل الأفكار المكتوبة إلى مقاطع قصيرة تحمل صوتًا.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
صف مشهد الفيديو الخاص بك مع الحركة وزوايا الكاميرا والأجواء
ينشئ النموذج حركة سينمائية بفيزياء وإضاءة طبيعية
نزّل وشارك الفيديو الجاهز للنشر
يعرض السيطرة العدوانية على الكاميرا بحركة درون FPV بلقطة واحدة مستحيلة، مثبتًا سيطرة النموذج على الحركة المستمرة والمقياس الديناميكي في 16:9 الأفقية.
يستفيد من واقعية النموذج لكوميديا bodycam مزيفة سخيفة مع حوار مزامن، صيغة مصممة لتصبح فيروسية من خلال الأصالة الجادة.
يُظْهِر السيطرة الدقيقة على الكاميرا والحركة الزمنية بهايبرلابس متسارع مع ديناميكيات مسارات ضوئية مستمرة، مثالي لمقطع بطل سينمائي 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
انتقل إلى الإنشاء الموجَّه بالاستدلال اليوم

Frontier 2K text-to-video generation
7.3 رصيد

Film-grade video with audio
0.1 رصيد
Text to video with audio
0.7 رصيد

Cinematic video with native audio
1.4 رصيد

Cinematic video from references
0.4 رصيد

Cinematic video from references
10 رصيد
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 رصيد

Fast balanced text-to-video generation
1.6 رصيد

Fast cinematic video with audio
0.1 رصيد