Ideogram V4.5 Edit를 사용해 이미지 수정의 정밀도를 높이세요
요약
Ideogram V4.5 Edit은 텍스트 프롬프트, 참조 이미지, 마스크를 활용하여 높은 정밀도로 이미지를 수정할 수 있는 기능입니다. 특히 고정밀 모드(high mode)는 변경되지 않은 픽셀을 복원하는 '정밀 편집' 기능을 제공하여 기존 영역 보존에 강점을 가집니다.
핵심 포인트
- 텍스트 프롬프트, 참조 이미지, 마스크를 이용한 정교한 이미지 수정 가능
- 고정밀 모드(high mode)는 변경되지 않은 픽셀 복원을 통해 높은 보존성을 제공
- 마스크 기반 편집은 수정 영역과 보존 영역을 명확히 구분하여 제어 가능
- V4.5 Edit는 이전 버전 대비 향상된 참조 이미지 및 정밀도 컨트롤 기능을 갖춤
개요
v4.5/edit은 ideogram에서 유지 관리합니다. Ideogram 4.5 Edit는 텍스트 프롬프트, 선택적 참조 이미지 및 마스크를 사용하여 제공된 이미지를 수정합니다. 핵심 기능은 편집 정밀도(edit precision)입니다: 일반 모드(regular mode)는 Generate를 사용하며, 고정밀 모드(high mode)는 변경되지 않은 픽셀을 복원하는 정밀 편집(Precise Edit)을 사용합니다. 기존 이미지에 프롬프트 기반의 수정이 필요하고, 특히 고정밀 모드에서 변경되지 않은 영역을 보존하길 원할 때 선택하세요; 이 스키마는 모든 수정이 다른 모든 픽셀을 건드리지 않을 것이라고 보장하지 않습니다.
최적 사용 사례
특정 이미지 변경: 소스 이미지와 프롬프트를 제공하여 특정 시각적 수정을 요청합니다.
예시 기반 편집: 최대 네 개의 참조 이미지를 추가하여 요청된 결과에 정보를 제공할 수 있습니다.
영역 중심 편집: 소스 차원과 일치하는 마스크를 제공합니다. 검은색으로 표시된 영역은 수정할 영역이고, 흰색으로 표시된 영역은 보존할 영역입니다.
보존 민감 수정: 변경되지 않은 픽셀의 복원이 중요한 경우 고정밀 모드를 사용하세요.
변형 생성: 하나에서 여덟 개의 출력 이미지를 요청하고 선택적으로 시드(seed)를 설정할 수 있습니다.
제한 사항
마스크는 소스 차원과 일치해야 하며, 반올림 후 검은색 및 흰색 영역을 모두 포함해야 합니다. 마스크가 제공되는 경우 참조 이미지 한도는 세 개이고, 마스크가 없는 경우 네 개입니다. 이름이 지정된 이미지 크기 프리셋(image-size presets)과 사용자 정의 차원은 마스크가 없는 일반 편집에 대해서만 문서화되어 있습니다. 사용자 정의 차원은 최소한 한 변당 256픽셀 이상이어야 하며, 32의 배수여야 하고, 면적은 4,194,304픽셀을 초과할 수 없으며, 종횡비는 6:1보다 크지 않아야 합니다. 이 스키마는 지연 시간(latency), 가격 책정(pricing), 학습 데이터(training data), 아키텍처(architecture) 또는 지원되는 출력 형식에 대한 보장을 명시하지 않습니다.
비교
v4/image-to-image — Ideogram V4.0의 Image-to-Image는 핵심 구조를 보존하면서 스타일링 및 구성 재작업으로 설명됩니다. 반면, V4.5 Edit는 선택적 마스크, 최대 네 개의 참조 이미지, 그리고 일반 모드 대 고정밀 편집 정밀도를 문서화합니다.
ideogram/v2/edit — Ideogram V2 Edit는 프롬프트 제어 기능을 갖춘 고정밀 이미지 편집기로 설명됩니다. 제공된 설명에는 마스크, 참조 이미지 제한, 또는 정밀도 모드가 명시되어 있지 않으며, V4.5 Edit가 해당 컨트롤들을 스키마에 문서화했습니다.
ideogram/v3/edit — Ideogram V3 Edit는 프롬프트 제어와 고정밀도로 이미지를 수정하고 다듬는 것으로 설명됩니다. V4.5 Edit는 문서화된 마스크 및 참조 입력과 변경되지 않은 픽셀 복원 기능이 있는 고정밀 모드를 제공합니다.
ideogram-character — Ideogram Character는 하나의 참조 이미지로부터 일관된 캐릭터를 생성하는 데 중점을 두며, 기존 이미지에 캐릭터를 인페인팅할 수 있습니다. V4.5 Edit는 선택적 마스크와 최대 네 개의 참조 이미지를 갖춘 일반적인 프롬프트 기반 이미지 편집기입니다.
ideogram-v2-turbo — Ideogram V2 Turbo는 인페인팅, 프롬프트 이해력, 텍스트 렌더링 기능을 갖춘 빠른 이미지 모델로 설명됩니다. 제공된 설명에는 편집 입력이나 보존 컨트롤이 설정되어 있지 않으며, V4.5 Edit가 마스크, 참조, 그리고 두 가지 정밀 모드를 문서화했습니다.
기술 사양 (Technical specifications)
엔드포인트는 fal-ai/ideogram/v4.5/edit입니다. 입력 스키마는 원본 이미지 URL, 프롬프트, 선택적 마스크 및 참조 이미지 URL, 정밀도 및 품질 설정, 이미지 크기 지정, 이미지 개수, 시드(seed), 그리고 동기식 응답 모드를 지원합니다. 출력에는 필수 다운로드 URL과 선택적 콘텐츠 유형, 파일 이름, 파일 크기를 가진 일련의 이미지 파일과 사용된 시드가 포함됩니다.
모델 입력 및 출력 (Model inputs and outputs)
모델 입력 및 출력 (Model inputs and outputs)
필수 입력값: prompt (문자열, 1–10,000 문자)와 image_url (문자열). 선택적 입력값: reference_image_urls (문자열 배열, 최대 네 개); mask_url (문자열 또는 null); edit_precision (regular 또는 high, 기본값 regular); quality (very_low, low, medium, 또는 high, 기본값 medium); image_size (기본값 auto); num_images (정수, 기본값 1, 범위 1–8); seed (정수 또는 null; 자동 선택 시 생략 가능); sync_mode (부울, 기본값 false). 마스크는 원본 치수와 일치해야 하며, 검은색 영역은 편집되고 흰색 영역은 보존되어야 하고, 반올림 후에도 두 영역 모두 유지되어야 합니다. 마스크를 사용하는 경우 최대 세 개의 참조 이미지를 사용하고, 그렇지 않은 경우 최대 네 개의 참조 이미지를 사용할 수 있습니다. auto는 원본 기하학적 구조를 보존하며, 필요에 따라 제공업체 측에서 다운스케일링을 수행합니다. 이름 지정된 프리셋(square, square_hd, portrait_4_3, landscape_4_3, portrait_16_9, landscape_16_9) 또는 사용자 정의 치수만 비마스크의 일반 편집이 허용됩니다. 사용자 정의 치수는 최소 256, 32의 배수여야 하며, 면적은 최대 4,194,304 픽셀, 종횡비는 최대 6:1이어야 합니다. 너비와 높이 필드는 스키마 상 최대값이 14,142입니다. 출력에는 이미지와 시드가 필요하며, 각 이미지는 URL을 요구하고 content_type, file_name, file_size를 포함할 수 있습니다.
시작하기 (Getting started)
import { fal } from "@fal-ai/client";
input: {
...
관련 연구 (Related research)
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing — “Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing”은 편집을 안내하고 이미지 세부 사항을 보존하기 위해 마스크와 시각적 참조를 사용하는 엔드포인트의 문서화된 사용 사례와 관련이 있습니다. 제공된 자료는 이 모델이 논문의 방법을 사용한다고 확립하지 않습니다.
자주 묻는 질문 (Frequently asked questions)
Q: 편집을 하려면 무엇이 필요합니까?
A: 프롬프트와 기본 원본 이미지 URL을 제공해야 합니다.
Q: regular와 high 정밀도는 어떻게 다릅니까?
A: Regular는 Generate를 사용하고, High는 변경되지 않은 픽셀 복원 기능을 갖춘 Precise Edit를 사용합니다. 둘 다 구조화된 편집 지침을 준비합니다.
**Q: 참조 이미지를 몇 개 제공할 수 있습니까?
A: 최대 네 개의 참조 이미지와 원본 이미지를 사용할 수 있으며, 마스크를 제공할 경우 최대 세 개의 참조 이미지를 사용할 수 있습니다.
Q: 마스크는 어떻게 작동하나요?
A: 마스크는 원본 이미지의 크기와 일치해야 합니다. 검은색 영역은 편집할 픽셀을 표시하고 흰색 영역은 보존할 픽셀을 표시하며, 반올림 후 두 영역 모두 존재해야 합니다.
Q: 출력 크기를 선택할 수 있나요?
A: 기본적으로 원본 기하학적 구조를 유지하며, 필요에 따라 제공업체 측에서 다운스케일링합니다. 이름이 지정된 프리셋과 사용자 정의 크기는 마스크가 없는 일반 편집의 경우에만 문서화되어 있습니다.
Q: 한 요청으로 몇 개의 이미지를 받을 수 있나요?
A: num_images를 1부터 8까지 설정할 수 있으며, 기본값은 1입니다.
Q: 응답에는 무엇이 포함되나요?
A: 다운로드 가능한 이미지 URL과 사용된 시드(seed)가 포함된 images 배열을 포함합니다. 각 이미지는 콘텐츠 유형, 파일 이름, 파일 크기를 포함할 수도 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기