Grok Imagine Video 1.5 API: 출시 전 참조 이미지 및 1080p 검증
요약
xAI가 Grok Imagine Video 1.5 API 출시를 발표하며 텍스트-투-비디오, 이미지 참조, 네이티브 1080p 지원을 공개했습니다. 개발자를 위해 기능 검증 방법, 비용 계산, 테스트 가이드를 제공하며 API 통합 시 주의사항을 다룹니다.
핵심 포인트
- 최대 7개의 시각적 참조 이미지 및 음성 참조 지원
- 네이티브 1080p 해상도 지원 및 관련 가격 책정 확인 필요
- API 통합 시 기능 매트릭스 및 비용 검증 단계 권장
- 텍스트-투-비디오 및 이미지-투-비디오 기능의 가용성 차이 주의
Grok Imagine Video 1.5 API: 출시 전 참조 이미지 및 1080p 검증
빠른 답변
xAI는 2026년 7월 31일, grok-imagine-video-1.5가 이제 API에서 텍스트-투-비디오 (text-to-video), 이미지 참조 (image references), 그리고 네이티브 1080p를 지원한다고 발표했습니다. 이번 릴리스 예시에서는 reference_image_urls를 전달하며, 최대 7개의 시각적 참조를 허용합니다. 또한 음성 참조 (voice references)는 요청 시 API에서 사용할 수 있다고 명시되어 있습니다.
모든 헤드라인에 언급된 기능을 모든 계정에 대해 안정적인 계약(contract)으로 아직 간주하지 마십시오. 지난 7월 27일에 마지막으로 업데이트된 xAI의 이전 참조-투-비디오 (reference-to-video) 가이드에는 여전히 1.5 모델이 해당 모드를 지원하지 않는다고 되어 있는 반면, 새로운 릴리스 페이지에는 지원한다고 되어 있습니다. 일반 비디오 가이드 또한 릴리스에서는 1080p가 텍스트-투-비디오 (text-to-video)에도 작동한다고 명시했음에도 불구하고, 1080p를 이미지-투-비디오 (image-to-video)로 제한하고 있습니다. 따라서 가장 안전한 출시 단계는 다음과 같습니다:
새로운 릴리스 계약 (newer release contract)
-> 계정 수준 기능 카나리 (account-level capability canary)
-> 출력 및 비용 검증 (output and cost verification)
...
이 가이드는 해당 게이트를 통과하는 데 필요한 기능 매트릭스 (capability matrix), 비용 계산, 그리고 8가지 테스트를 제공합니다.
대상 사용자
이 가이드는 Grok Imagine Video 1.5를 앱, 콘텐츠 파이프라인 (content pipeline), 제품 데모 생성기 (product-demo generator), 또는 자동화된 크리에이티브 워크플로우 (automated creative workflow)에 통합하려는 개발자를 위한 것입니다. 특히 참조 이미지 (reference-image) 지원, 1080p 가격 책정, 텍스트-투-비디오 (text-to-video) 가용성, 또는 grok-imagine-video-1.5와 더 넓은 범위의 grok-imagine-video 워크플로우 간의 차이점을 찾고 있다면 매우 유용합니다.
만약 에이전트 (agent)가 자산을 자동으로 생성한다면, Grok Build parallel-agent checklist에서 사용된 것과 동일한 제한된 작업 (bounded-job) 원칙을 유지하십시오. 모델 평가 규율을 위해서는 Grok 4.5 coding-agent evaluation의 고정 피스처 (fixed-fixture) 접근 방식을 재사용하십시오.
변경 사항 및 사용 가능 위치
xAI의 7월 31일 릴리스는 소비자용과 API용 가용성을 분리합니다:
| 접점 (Surface) | 확인된 경계 (Confirmed boundary) |
|---|---|
| grok.com 및 iOS | SuperGrok Heavy 및 Plus 사용자를 대상으로 미국에서 이미지 및 음성 참조 (Image and voice references) 기능이 시작되었으며, 다른 등급은 향후 며칠에 걸쳐 출시될 예정입니다 |
| ... | |
현재 모델 페이지에는 텍스트 및 이미지 입력, 비디오 출력, 별칭(aliases)인 grok-imagine-video-1.5-preview 및 grok-imagine-video-1.5-2026-05-30, 그리고 us-east-1 및 us-west-2에서의 가용성이 나열되어 있습니다. 모든 리전(region)이나 키(key)가 동일한 액세스 권한을 가진다고 가정하지 말고, 귀하의 팀에 해당하는 모델 목록을 확인하십시오. |
코드로 우회하기 전에 API 계약(contract)을 감사하십시오
이번 릴리스는 연결된 여러 문서 페이지보다 최신 상태입니다. 이러한 차이점을 편리한 문구를 선택해도 된다는 허가로 간주하지 말고, 테스트 요구 사항으로 취급하십시오.
| 기능 (Capability) | 신규 릴리스 내용 | 이전/일반 문서 내용 | 출시 결정 사항 |
|---|---|---|---|
| Text-to-video | 1.5 버전에서 활성화됨 | 현재 모델 페이지에 텍스트 입력이 나열됨 | 프롬프트 전용 작업을 한 번 실행하고 반환된 모델을 기록하십시오 |
| ... | |||
| 이러한 불일치는 문서 전파(documentation propagation) 문제일 가능성이 높지만, 이는 추론일 뿐입니다. 귀하의 대상 계정에서 성공적인 요청이 발생하는 것만이 해당 계정에 대한 현재 가용성을 증명합니다. |
전체 클립 비용을 계산하십시오
xAI의 가격 책정 페이지에는 이미지당 입력 비용에 초당 비디오 출력 비용이 추가되는 방식이 나열되어 있습니다:
| 해상도 (Resolution) | 출력 가격 (Output price) | 6초 클립 + 이미지 1장 | 6초 클립 + 이미지 7장 |
|---|---|---|---|
| 480p | $0.08/sec | $0.49 | $0.55 |
| ... | |||
| 공식은 다음과 같습니다: |
estimated_cost = duration_seconds * resolution_rate + reference_image_count * $0.01
비싼 재시도(retries)를 맹목적으로 곱하지 마십시오. 7개의 참조 이미지를 사용한 3가지 변수의 6초 1080p 테스트는 실패하거나 반복된 생성 이전에 약 $4.71의 비용이 듭니다. 워커(worker)에 작업 수준의 제한(job-level limit)과 일일 예산을 설정하십시오. 제공업체는 다르지만, API hard-spend-limit runbook은 재사용 가능한 제어 패턴을 제공합니다.
제한된 참조 이미지 카나리(canary)를 실행하십시오
1. 6초 길이의 고정된 피스처(fixture) 하나를 동결하십시오
민감하지 않은 제품 객체, 정리된 배경 하나, 그리고 짧은 동작 프롬프트(motion prompt)를 사용하십시오. 지속 시간(duration), 종횡비(aspect ratio), 시드(seed)와 유사한 입력값, 그리고 평가 루브릭(evaluation rubric)을 고정하십시오. 실제 사람의 얼굴이나 목소리로 시작하지 마십시오.
2. 출시 형태의 SDK 요청을 한 번 전송하십시오
7월 31일 출시 버전은 이 Python 형태를 사용합니다. 이는 계약 프로브(contract probe)이며, 모든 계정이 이미 해당 기능을 보유하고 있다는 증거는 아닙:
import os
import xai_sdk
...
키(key)는 환경 설정(environment configuration)에 유지하십시오. 절대 로그에 남기거나, 클라이언트 앱에 임베드하거나, 참조 URL에 배치하지 마십시오.
3. 결과와 증거를 영구 저장하십시오
비디오 API는 비동기(asynchronous) 방식이며, 반환된 xAI URL은 일시적입니다. 데이터 정책이 허용한다면 자산(asset)을 즉시 영구 저장하십시오. 요청 ID(request ID), 요청된 모델, 모드, 참조 횟수, 지속 시간, 해상도, 최종 상태(terminal status), 에러 코드, 측정된 지연 시간(latency), 예상 비용, 그리고 출력 체크섬(checksum)을 저장하십시오.
4. 정체성(identity)과 장면(scene)을 분리하여 판단하십시오
모든 참조(reference)에 대해, 그것이 유지해야 할 단일 속성을 명시하십시오: 제품 기하학(geometry), 캐릭터 외형, 위치, 의상, 또는 색상 팔레트(palette). 클립이 인상적으로 보이더라도, 관련 없는 참조가 다른 역할로 유출(leak)될 경우 생성을 실패로 표시하십시오.
8가지 수락 테스트(acceptance tests)
| 테스트 | 예상 결과 |
|---|---|
| 720p에서 참조 하나 사용 | 작업이 done 상태에 도달함; 의도한 객체가 식별 가능한 상태로 유지됨 |
| ... |
정확한 프로덕션 리전(region), 계정, SDK 버전, 그리고 요청 형태(request shape)가 통과될 때만 해당 기능을 프로모션하십시오. 새로운 경로(route)가 실제 성공률과 수락된 출력(accepted-output) 증거를 확보할 때까지 기존 베이스 모델 경로를 사용 가능한 상태로 유지하십시오.
복사 가능한 롤아웃 기록(rollout record)
grok_video_canary:
checked_at: "2026-08-01T09:00:00+08:00"
model_requested: "grok-imagine-video-1.5"
...
흔한 실수
헤드라인을 프로덕션 요구사항으로 그대로 복사하는 것. 출시 발표는 모든 모델 카드(model card), SDK, 리전, 그리고 계정 권한(entitlement)의 업데이트보다 앞서 진행될 수 있습니다.
생성 모드 결합. Reference-to-video (참조 기반 비디오 생성), image-to-video (이미지 기반 비디오 생성), edit (편집), extend (확장)는 서로 다른 필드 규약 (field contracts)을 가집니다. 모든 선택적 필드를 포함하는 하나의 페이로드 (payload)를 만들기보다는 라우터 (router)를 구축하십시오.
해상도 경제성 무시. 6초 길이의 클립의 경우, 재시도 배수를 고려하기 전에도 1080p 출력 비용은 480p의 거의 3배에 달합니다.
임시 URL만 유지. 완료된 작업 (job)은 영구적인 자산 아카이브 (asset archive)가 아닙니다.
권한 없는 얼굴 또는 목소리 사용. 동의와 사용 권한을 확보하고, 보유 기간을 제한하며, 인간의 게시 검토 단계 (human publication gate)를 유지하십시오. 기술적 접근 권한이 법적 허가를 의미하지는 않습니다.
FAQ
Grok Imagine Video 1.5는 API에서 참조 이미지 (reference images)를 지원하나요?
xAI의 7월 31일 발표에 따르면 지원하며, reference_image_urls를 사용하는 1.5 SDK 예시를 제공합니다. 이전의 reference-to-video 가이드에서는 그렇지 않다고 명시되어 있으므로, 이를 필수적인 프로덕션 경로로 만들기 전에 대상 계정에서 해당 기능을 확인하십시오.
참조 이미지를 몇 개까지 사용할 수 있나요?
발표 및 참조 가이드에서는 최대 7개로 설명하고 있습니다. 8번째 이미지가 유료 요청을 생성하거나 혼란을 야기하지 않도록 클라이언트 측에서 최대치를 설정하십시오.
10초 길이의 1080p 클립 비용은 얼마인가요?
나열된 출력 가격은 초당 $0.25이므로, 출력 비용은 $2.50입니다. 입력 이미지당 $0.01을 추가하십시오. 정확한 모드에 대한 가용성은 여전히 계정 수준의 카나리 (canary) 테스트가 필요합니다.
API에서 음성 참조 (voice reference) 액세스는 자동으로 이루어지나요?
아니요. xAI는 API 음성 참조가 요청 시 사용 가능하다고 밝히고 있습니다. 액세스가 명시적으로 확인될 때까지 해당 경로는 비활성화 상태로 유지하십시오.
Sources
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기