Video from image, audio references
xAI에서 개발한 Grok Imagine Video 1.5 Reference to Video는 참조 이미지와 선택적 오디오 트랙을 완전히 애니메이션된 비디오로 변환합니다. 단일 프레임에서 시작하는 대신, 이 모델은 최종 클립의 외관과 내용을 안내하는 이미지 세트를 입력할 수 있게 하며, 이를 보고 싶은 동작, 분위기, 액션을 설명하는 텍스트 프롬프트와 결합합니다. 결과는 제공한 시각적 세계에서 직접 가져온 짧은 비디오로, 이미 아트워크, 사진, 제품 샷 또는 무드 보드를 가지고 이를 동영상으로 만들고 싶은 크리에이터에게 자연스러운 선택입니다.
여기서 핵심 기능은 다중 이미지 참조입니다. 1개에서 7개까지 참조 이미지를 제공할 수 있으며, 모델은 이를 스타일과 내용 가이드로 함께 사용합니다. 프롬프트에서 각 이미지를 개별적으로 지목하며, 조각들이 어떻게 관련되거나, 블렌드되거나, 전환되기를 원하는지 모델에게 정확히 알려줍니다. 이를 통해 "이 세 이미지를 사용해 장소를 발견하고 멋진 모션 그래픽스를 만들어라" 같은 장면을 설명하고 모델이 이를 하나의 일관된 시퀀스로 엮을 수 있습니다. 캐릭터, 배경, 텍스처, 색상 팔레트를 가져오든 동일 주제의 세 변형이든, 모델은 각 참조를 구성 요소로 취급합니다.
오디오도 1급 입력입니다. 단일 참조 오디오 클립을 첨부하고 프롬프트에서 이미지와 함께 참조할 수 있습니다. 이를 통해 이미지 중 한 명이 오디오 트랙의 목소리로 말하게 하거나, 제공한 시각과 음성 퍼포먼스나 사운드를 동기화할 수 있습니다. 이미지와 오디오를 프롬프트에서 직접 태그할 수 있어 각 요소가 완성된 비디오에 어떻게 기여할지 세밀한 제어가 가능합니다.
출력 비디오는 24 frames per second로 생성되며, 두 가지 해상도 중 선택 가능합니다: 빠른 테스트와 초안을 위한 가벼운 480p 옵션, 더 세련된 결과를 위한 선명한 720p 옵션입니다. 길이는 1초에서 최대 15초까지 유연하며, 빠른 루프부터 긴 장면까지 만들 수 있습니다. 예시 출력은 1280x720 클립으로 24fps에서 10초가 약간 넘는 길이로, 모델이 단일 생성에서 제공할 수 있는 길이와 부드러움을 보여줍니다.
종횡비 지원 범위가 넓어, 시네마틱 및 가로 작업을 위한 와이드스크린 16:9, 수직 소셜 형식을 위한 세로 9:16, 피드를 위한 정사각형 1:1, 그리고 그 사이의 여러 클래식 비율(4:3, 3:2, 2:3, 3:4)을 포함합니다. 이 범위 덕분에 플랫폼이나 프로젝트에 맞는 정확한 프레임을 타겟팅할 수 있으며, 후속 크로핑 없이 수직 숏, 정사각형 광고, 와이드스크린 장면을 만들 수 있습니다.
크리에이티브 컨트롤은 간단합니다. 텍스트 프롬프트가 동작과 스토리를 설명하며 참조 이미지와 오디오를 지목합니다. 참조 이미지 수와 순서, 원하는 길이, 해상도, 종횡비를 선택합니다. 프롬프트는 상세할 수 있으며, 이미지가 어떻게 결합되고 무엇이 움직이며 장면이 어떻게 진화할지 구체적으로 지정할 수 있는 충분한 텍스트를 지원합니다.
누가 가장 큰 혜택을 볼까요? 영화 제작자와 비디오 크리에이터는 컨셉 아트나 로케이션 사진을 입력하고 액션을 설명해 장면을 빠르게 프로토타입할 수 있습니다. 디자이너와 모션 그래픽 아티스트는 정적 컴포지션을 애니메이션화하고 여러 시각 자산을 하나의 움직이는 작품으로 블렌드할 수 있습니다. 숏폼 수직 비디오를 만드는 콘텐츠 크리에이터는 소수의 이미지를 올바른 종횡비의 게시 준비 클립으로 변환할 수 있습니다. 마케터와 제품 팀은 설명적 동작 프롬프트로 정적 제품 샷을 생동감 있게 만들 수 있습니다. 처음부터 시작하지 않고 기존 시각 라이브러리에서 작업하는 누구나, 최종 비디오를 이미 가진 외관에 고정시키는 참조 기반 워크플로를 특히 효율적으로 느낄 것입니다.
몇 가지 실용적 고려사항을 유념하세요. 모델은 최소 하나의 참조 이미지와 텍스트 프롬프트가 필요하며, 생성당 최대 7개의 이미지와 1개의 오디오 클립을 허용합니다. 이미지가 스타일과 내용 가이드 역할을 하므로, 화면에 원하는 것을 명확히 나타내는 깨끗하고 잘 구성된 참조를 선택하면 가장 예측 가능한 결과를 얻습니다. 프롬프트에서 각 이미지를 명시적으로 태그하면 결합 방식을 가장 명확히 제어할 수 있습니다. 이 모델은 상업적 사용이 승인되어 클라이언트 작업과 공개 프로젝트에 적합합니다. 모든 생성 서비스와 마찬가지로 xAI 사용 약관을 준수해야 합니다.
요약하자면, Grok Imagine Video 1.5 Reference to Video는 특정 소스 이미지를 충실히 유지하면서 동작을 추가하고, 선택적으로 음성이나 사운드를 더하고 싶은 크리에이터를 위해 만들어졌습니다. 다중 이미지 참조, 오디오 입력, 최대 15초의 유연한 길이, 두 가지 해상도, 다양한 종횡비를 결합해 이미 아끼는 시각을 애니메이션화하는 집중적이고 제어 가능한 방법을 제공합니다.
Add the image that you want change
룩, 캐릭터, 환경을 안내할 이미지를 선택적으로 추가하세요
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
프롬프트 입력 - 모델이 장면의 물리, 조명, 감정적 의도를 이해합니다
클릭하여 최종 결과물을 생성하고 프로덕션 수준의 비디오를 다운로드하세요
카메라가 문을 통과하며 전경이 배경보다 빠르게 이동하는 다중 이미지 참조 패럴랙스를 보여줍니다. 시네마틱 16:9 건축 쇼케이스.
인과적 물리 강조: 클립 중간에 비가 시작되며 물방울이 물웅덩이 잔물결을 일으키고 포장도를 순차적으로 어둡게 합니다. 시네마틱 와이드 대기 변형.
증기가 피어오르고 네온 반사가 반짝이는 완벽한 루프 친화적 시네마그래프, 나머지는 얼어붙은 상태입니다. 무한 루프 풍경 분위기에 완벽합니다.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
오늘 바로 추론 기반 생성으로 전환하세요

Animate images into video with audio
10 크레딧

Animate images into cinematic video
0.6 크레딧

Cinematic video from images
10 크레딧

Multimodal references to video
10 크레딧
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 크레딧

Cinematic video from images fast
0.1 크레딧

Animate images into 2K video
7.8 크레딧

Animate image to 1080p video
2.8 크레딧