🚨 OpenAI Developers의 강력한 업데이트: Responses API의 웹 검색이 이제 이미지 결과도 지원합니다! 📸
요약
OpenAI의 Responses API가 웹 검색 도구에서 이미지 결과 반환 기능을 지원하기 시작했습니다. 이제 개발자는 단일 API 호출로 텍스트와 이미지를 동시에 받아 시각적으로 풍부한 AI 애플리케이션을 구축할 수 있습니다.
핵심 포인트
- Responses API의 웹 검색 도구가 텍스트와 이미지 결과를 동시에 지원
- search_content_types 파라미터를 통해 이미지 결과 요청 가능
- 제품 비교, 디자인 영감, 쇼핑 어시스턴트 등 다양한 시나리오 활용 가능
- 추가 도구 통합 없이 단일 호출로 시각적 그라운딩 구현 가능
🚨 OpenAI Developers가 개발자들에게 전하는 강력한 업데이트: Responses API의 웹 검색이 이제 이미지 결과도 지원합니다! 📸
@OpenAIDevs가 공유한 소식에 따르면, OpenAI는 Responses API에 중요한 능력을 추가했다고 발표했습니다: 웹 검색 (Web search) 도구가 이제 텍스트뿐만 아니라 이미지 결과도 반환할 수 있습니다.
이를 통해 여러분의 애플리케이션은 제품 사진, 장소, 시각적 참조, 영감의 원천 및 소스 링크를 직접적으로 드러낼 수 있습니다. 이제 AI 지원 애플리케이션은 단순히 "설명"하는 것에 그치지 않고, 직접 "보여주기"까지 합니다!
Responses API란 무엇인가? (짧고 깊은 통찰)
Responses API는 OpenAI의 가장 진보되고 권장되는 API 인터페이스입니다. Chat Completions의 단순함과 Assistants API의 강력한 도구 및 상태 관리 (state management) 능력을 결합합니다. 상태 유지 (Stateful) 상호작용, 내장 도구 (웹 검색 (web search), 파일 검색 (file search), 컴퓨터 사용 (computer use) 등), 추론 (reasoning) 모델 및 멀티모달 (multimodal) 워크플로우를 위해 설계되었습니다. 새로운 프로젝트에는 Chat Completions 대신 Responses API 사용을 권장합니다.
이 API를 통해 모델은 외부 데이터에 접근하고 에이전트 (agent)와 유사한 동작을 수행할 수 있습니다. 웹 검색 (web search) 도구 또한 이 생태계의 중요한 부분입니다.
새로운 기능: 웹 검색 (Web Search)에서의 이미지 지원 (GA)
이전에는 웹 검색이 텍스트 결과와 인용 (citations)만을 제공했습니다.
이제 search_content_types 파라미터를 통해 텍스트와 이미지 결과를 동시에 요청할 수 있습니다.
주요 파라미터:
✅ search_content_types: ["image", "text"] → 시각적 결과와 텍스트 결과가 모두 활성화됩니다.
✅ image_settings: { "max_results": 5, "caption": true } → 원하는 이미지 개수와 자동 캡션 (caption, 짧은 설명) 요청 여부를 결정합니다.
✅ include: ["web_search_call.results"] → 원시 이미지 결과 (image_url, thumbnail_url, source_website_url, caption)를 별도로 받습니다.
모델은 이 이미지들을 텍스트 결과와 함께 사용하여 풍부하고 인용이 포함된 응답을 생성합니다. 이미지는 웹에서 실시간으로 가져오며 출처와 함께 제공됩니다.
예시 사용 시나리오:
✅ 제품 비교: “비 오는 도시에서의 방수 러닝화 비교해줘” → 실제 제품 사진 + 설명.
✅ 시각적 참조: “미니멀한 패키징의 재활용 가능한 스킨케어 제품 찾아줘” → 디자이너를 위한 영감을 주는 이미지.
✅ 영감 창출: “따뜻한 전구색이 장착된 리브드 글라스 펜던트 조명 검색해줘” → 홈 데코, 제품 디자인 애플리케이션에 완벽함.
✅ 쇼핑 어시스턴트, 인테리어 디자인 도구, 레시피 추천기, 여행 플래너, 연구 애플리케이션… 이 모든 분야가 큰 혜택을 입을 것입니다.
왜 이렇게 중요한가요?
✅ 시각적 그라운딩 (Visual grounding): 텍テキスト + 이미지와 함께 응답이 훨씬 더 풍부해지고 사용자 친화적으로 변합니다. “백문이 불여일견”이라는 격언이 API 수준에서 실현됩니다.
✅ 개발자 편의성: 추가적인 도구 통합 없이, 단 한 번의 API 호출로 정보와 이미지를 모두 얻을 수 있습니다. 지연 시간 (Latency) 및 비용 측면에서 효율적입니다.
✅ 애플리케이션 품질: 쇼핑, 디자인, 교육, 여행과 같은 수직적 시장 (Verticals)에서 독보적인 경험을 창출할 수 있습니다.
✅ 인용 (Citations)을 통한 투명성과 신뢰성 향상 — 모델은 단순히 “찾았다”라고 말하는 것에 그치지 않고, 출처도 함께 보여줍니다.
이 기능은 일반적으로 사용 가능 (Generally Available, GA) 상태로 출시되었으며 즉시 사용할 수 있습니다.
Curl, Python, JavaScript 예제도 준비되어 있습니다. 간단한 요청만으로 “Golden Gate Bridge 일몰”과 같은 쿼리에 대해 텍스트와 멋진 이미지, 그리고 출처를 모두 받을 수 있습니다.
이 기능이 어떤 종류의 애플리케이션을 가장 크게 변화시킬 것이라고 생각하시나요? 쇼핑 어시스턴트일까요, 창의적인 디자인 도구일까요, 아니면 교육/연구 애플리케이션일까요?
직접 사용해 보신 분이 있다면 경험을 공유해 주세요. 함께 배워봅시다! 🚀🔥
AI 자동 생성 콘텐츠
본 콘텐츠는 X @kaan_alper (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기