ShortGenius
隆重推出 Grok Imagine Video 1.5 Text to Video

Grok Imagine Video 1.5 Text to Video

Text prompts become clips with built-in audio, up to 15 seconds

Text to video with audio

角色VLOG

ASMR微距

宠物播客

Grok Imagine Video 1.5 Text to Video,由 xAI 开发,将书面描述转化为带有音频的短视频片段,一切仅从单个文本提示开始。您描述想要的场景,模型就会生成一个动态的、带有声音的剪辑,与您的文字相匹配。不需要先提供参考图像或素材。只需简单书写,模型处理其余一切,使其成为从头脑中的想法到屏幕成品剪辑的最直接方式之一。

该模型的核心是基于提示的叙事创作。您的文本描述可以达到相当长的长度,让您有足够空间详细描述人物、场景、光照、氛围、动作和风格。示例提示展示了模型响应的表现范围:"Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." 这单个句子涵盖了人物、动作、环境、光照和非常具体的视觉风格,模型会将所有这些元素整合成一个连贯的动画剪辑。

该模型的一个突出特性是它与视觉一同生成音频。与生成需要您单独配乐或设计声音的无声剪辑不同,它从一开始就提供内置声音的视频。模型针对风格化输出、变换和 lipsync 进行了优化,这表明它擅长处理富有表现力的、以人物为主导的场景,其中嘴巴、表情和动作需要与屏幕上发生的事情相连。

您可以真正控制输出的形状和长度。持续时间可调节,让您生成从快速 1 秒节拍到 15 秒剪辑的任何内容,从而匹配您正在制作的内容长度,无论是简短的社交循环还是较长的叙事时刻。默认值为 6 秒,适合大多数短格式创意。分辨率可设置为 480p、720p 或 1080p,让您在更快的轻量草稿和更清晰、高细节的最终渲染之间选择。默认的 720p 在清晰度和效率之间达到了实用平衡。

支持的宽高比异常广泛。您可以选择宽屏 16:9 用于电影感和横向构图、高耸的 9:16 用于竖屏手机和社交格式、正方形 1:1 用于适合动态的消息,以及介于之间的多种选项,包括 4:3、3:2、2:3 和 3:4。这种灵活性意味着您可以生成已正确构图的剪辑,适合其目标平台,无论是横向预告片、竖屏故事还是方形社交图块,无需后续裁剪或重新格式化。

模型输出标准的 MP4 视频,便于在编辑工具、社交平台和演示软件中播放和分享。剪辑以 24 帧每秒渲染,这种帧率长期以来与电影般的视觉效果相关联,模型会生成填充您选择持续时间的完整帧序列。

该模型非常适合广泛的创意专业人士。动画师和插画家可以利用其风格化优势,将 anime、chibi、shojo 和其他插图美学转化为动态内容。社交媒体创作者和营销人员可以生成针对其平台的竖屏和方形剪辑,无需额外重新格式化。电影制作人和故事板艺术家可以快速可视化场景、氛围和镜头能量,然后再投入完整制作。设计师和内容团队可以直接从书面简报生成短品牌时刻、动画概念和富有表现力的角色剪辑。因为它只需提示即可使用,它也降低了任何有强烈愿景但缺乏素材或绘图流程的人的门槛。

使用该模型时,奖励使用描述性、分层的提示。您越清楚地命名主体、动作、场景、光照和视觉风格,结果就越忠实于您的意图,正如 anime 示例所示。叠加具体的风格提示、氛围词汇和动作描述,为模型提供更丰富的目标。如果您想要风格化或变换外观,明确说明并附上您追求的美学,有助于引导输出方向。

有一些实际注意事项值得牢记。剪辑设计为短片,最长 15 秒,因此该模型擅长冲击力强、自成一体的时刻,而不是长连续场景。更高分辨率产生更多细节,但自然需要更多渲染工作,因此轻量设置有助于快速迭代和草稿,然后再投入精炼的 1080p 版本。因为输出完全从您的文本生成,确切结果在多次运行中可能有所不同,这使得迭代成为正常流程的一部分:优化您的措辞、调整构图和长度,并重新生成,直到剪辑符合您的想象。凭借音频包容生成、灵活构图、可调长度以及对风格化、表现力内容的明显亲和力,Grok Imagine Video 1.5 Text to Video 是将书面想法转化为短小、带声音剪辑的多功能起点。

使用最先进的视频模型进行生成

A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.

第 1 步

写下你的场景

描述你的视频场景,包含动作、镜头角度和氛围

第 2 步

AI 生成

模型以自然的物理效果和光线打造电影级动态画面

第 3 步

开始分享

下载并分享可直接使用的视频成品

超越提示词:全新的掌控维度

FPV电影感

FPV电影感

展示激进的镜头控制,通过不可能的一镜到底 FPV 无人机动作,证明模型对连续动态和宽屏动态尺度的掌控。

身体摄像机荒诞

身体摄像机荒诞

利用模型的真实感制作假身体摄像机荒诞喜剧,带有同步对话,这种格式通过冷面真实感设计为病毒传播。

城市超速 lapse

城市超速 lapse

演示精确镜头控制和时间运动,通过加速超速 lapse 和连续光轨动态,理想用于电影感 16:9 主打剪辑。

与同类模型对比

Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.

等待终于结束

用 Grok Imagine Video 1.5 Text to Video 体验极致完美

立即切换至推理引导式生成

常见问题

是的。Grok Imagine Video 1.5 会生成带有音频的视频,因此您获得的是已内置声音的剪辑,而不是需要单独配乐的无声文件。它还支持 lipsync,意味着它能将屏幕上的嘴巴和表情动作与场景发生的事件相连接。