사진을 Blender로 변환하는 벤치마크: GPT-6 Astra가 모든 사진에서 승리, GPT-6.1 Sol은 36센트에 61점 기록
요약
본 기사는 사진을 Blender로 변환하는 벤치마크 결과를 분석합니다. GPT-6 Astra가 가장 높은 점수를 기록하며 성능 면에서 우위를 보였으나, 비용 효율성 측면에서는 GPT-6.1 Sol이 뛰어난 모습을 보여주었습니다. 이 테스트는 LLM 기반 에이전트 루프를 통해 코드를 작성하고 실행하는 과정을 포함했습니다.
핵심 포인트
- GPT-6 Astra가 전반적인 성능(점수)에서 가장 우수한 결과를 보였습니다.
- GPT-6.1 Sol은 비용 효율성 측면에서 매우 뛰어난 성능을 입증했습니다.
- 테스트는 LLM이 코드를 작성하고 실행하는 에이전트 루프를 통해 진행되었습니다.
- 모델의 선택은 성능과 예산/시간 제약 사이의 트레이드오프가 중요함을 시사합니다.
저는 사진을 Blender로 변환하는 도구를 만들고 동일한 에이전트 루프를 통해 14개의 모델을 실행했습니다: 사진을 보고, Blender Python 코드를 작성하고 실행하며, 렌더링하고, 비교하고, 반복합니다. 장면당 제한 사항은 20분, $4, 60 요청입니다. 결정론적 스코어러(LLM이 아님)가 재렌더링된 각 장면을 0점에서 100점까지 평가합니다. OpenAI 모델들의 점수: 시도당 비용 및 장면당 시간 GPT-6 Astra 66점 $3.91 18분 GPT-6.1 Sol 61점 $0.36 18분 GPT-5.6 Sol 49점 $0.57 8분 GPT-5.6 Terra 44점 $0.33 8분 Astra는 세 사진 모두에서 가장 먼저 작업했으며, 비용 제한이 모든 장면에서 이를 막았습니다: 처음 렌더링은 4분 만에 이루어졌고, 이후 게이트웨이가 다음 요청을 거부할 때까지 다듬었으며 그 비용은 약 $3.90이었습니다. 시간 부족을 겪지 않았습니다. GPT-6.1 Sol은 전체 약 18분을 작동하여 가격은 10분의 1도 안 되면서 5점 차이로 마무리했습니다. 장난감 자동차의 경우 4점 차이가 났습니다 (66 대 70). GPT-5.6 Sol과 Terra는 약 8분 만에 작업을 완료했으며, 시간과 예산 대부분을 남겨두었습니다. 그들의 장면은 더 단순하며 고장 난 것은 아닙니다. 주의사항: GPT-6.1 Sol은 제 게이트웨이가 아닌 Codex에서 나중에 실행되었습니다. Astra가 그렇게 실행되었을 때는 63점을 기록하여 66점보다 낮았습니다. 모델당 사진 한 번의 실행이었고, 이 간략한 설명(brief)은 Astra를 중심으로 구성되었습니다. 모든 렌더링에 대한 상세 내용은 https://kaloyan.blog/ai-models-rebuild-a-photo-in-blender 에 제출되었으며 /u/smith2008이 r/OpenAI에 게시했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기