실제 Unity 작업에 16가지 AI 모델/추론 조합 테스트 및 사용량 비교
요약
본 기사는 실제 Unity 6 프로젝트를 대상으로 ChatGPT Plus, Claude Pro, Google AI Pro 등 주요 구독 서비스의 AI 모델들을 비교 테스트한 결과입니다. 단순 API 토큰 사용량 비교가 아닌, 월 €20 수준의 구독료로 얻을 수 있는 실질적인 코딩 에이전트 작업 품질과 효율성을 중점적으로 분석했습니다.
핵심 포인트
- Claude Opus 5.5는 높은 정확도와 깊은 조사 능력을 보여 가장 우수한 성능을 기록했습니다.
- 테스트는 단순한 코드 작성보다 실제 프로젝트 저장소 전체를 조사하는 '에이전트' 작업에 초점을 맞췄습니다.
- 각 서비스의 사용량 비율만으로는 컴퓨팅 단위가 같지 않으므로, 구독 가치와 워크플로우 비교가 중요합니다.
안녕하세요. 비슷한 테스트를 찾지 못해서 제가 직접 해봤습니다. 다른 분들에게도 유용할 수 있을 것 같아서요. 저는 합성 벤치마크나 API 토큰 가격이 아닌, 일반적인 유료 구독을 통해 얼마나 많은 실질적인 작업물을 얻을 수 있는지에 초점을 맞춰 어떤 AI 모델/추론 모드가 실제 코딩 업무에 가장 적합한지 알아보고 싶었습니다. 주로 상당히 큰 Unity 6 프로젝트로 작업하기 때문에, 하나의 실제 프로젝트 조사를 벤치마크로 사용했습니다. 테스트한 세 가지 구독 서비스는 다음과 같습니다: - ChatGPT Plus - Claude Pro - Google AI Pro 이들은 모두 대략 비슷한 월 €20 소비자 가격대를 형성합니다. 제 목표는 간단했습니다. 각 서비스에 비슷한 금액을 지불했을 때, 어떤 모델이 실제 코딩/에이전트 작업에 가장 좋은 품질, 속도 및 포함된 사용량 조합을 제공하는지 알아내는 것이었습니다.
과제
모든 모델은 동일한 Unity 프로젝트에서 본질적으로 같은 읽기 전용 조사 작업을 받았습니다. 이 프로젝트는 Unity 6과 여러 서드파티 에셋을 사용합니다. 과제 내용은 다음과 같았습니다:
- 리소스 수집(resource harvesting)이 현재 어떻게 작동하는지 조사하기 - 장착된 도구들이 리소스와 어떻게 상호작용하는지 추적하기 - 통합 검사하기 - 파일 위치 및 검사하기 - 직접적인 통합 또는 어댑터가 필요한지 판단하기 - 정확하게 관련된 스크립트, 프리팹(prefab), 컴포넌트를 식별하기 - 최소한의 통합 아키텍처를 추천하기 - 알려지지 않은 가정과 위험을 지적하기 - 아무것도 수정하지 않기
이것은 의도적으로 '함수 하나 작성해 줘'와 같은 작은 프롬프트가 아니었습니다. 저는 실제로 코딩 에이전트에게 사용하는 저장소 조사(repository investigation)에 더 가까운 것을 원했습니다.
측정 항목
각 테스트 실행마다 다음 사항을 기록했습니다:
- 사용 허용량 (Allowance used)
- 해당 구독의 자체 사용 한도 대비 비율 (%)
- 시간 (Time)
- 근사 벽시계 완료 시간 (approximate wall-clock completion time)
- 품질 (Quality) - 최종 조사에 대한 주관적 평가
품질을 평가할 때는 주로 다음 사항들을 살펴보았습니다: - 정확성 (correctness)
- 프로젝트별 조사 깊이 (depth of project-specific investigation)
- 환각 현상 여부 (hallucinations)
- 모델이 사실과 가정(assumption)을 구별했는지 여부
- 실제 관련 파일/컴포넌트를 찾았는지 여부
- 제안된 아키텍처가 실제 프로젝트와 일치하는지 여부
- 명백한 검색 경로 외에 관련 사항을 발견했는지 여부
중요한 주의사항
허용량 비율은 제공업체 간 동등한 컴퓨팅 단위가 아닙니다. 예를 들어, Claude Pro의 4%가 ChatGPT Plus나 Google AI Pro의 4%와 반드시 동일한 양의 컴퓨팅을 의미하지는 않습니다. 제가 측정하려던 것이 그것이 아니었습니다. 알고 싶었던 것은 다음과 같습니다: 만약 이 구독에 대해 월 약 €20를 지불한다면, 포함된 허용량으로 얼마나 유용한 코딩 작업을 얻을 수 있는가? 따라서 이것은 API 가격 벤치마크라기보다는 주로 구독 가치/실제 워크플로우 비교입니다.
| 모델 | 모드 | 허용량 | 시간 | 품질 |
|---|---|---|---|---|
| Claude Sonnet 5.5 | Medium | 약 1% | 5분 | 8.3/10 |
| GPT-6.1 Sol | Medium | 약 3% | 3분 | 9.0/10 |
| Claude Opus 5.5 | Medium | 약 4% | 8분 | 9.7/10 |
| Claude Opus 4.8 | Medium | 약 3% | 4분 | 8.6/10 |
| Gemini 3.1 Pro | High | 약 4% | 16분 | 8.6/10 |
| Claude Sonnet 4.6 | Medium | 약 4% | 4분 | 7.8/10 |
| Claude Sonnet 5.5 | High | 약 4% | 7분 | 8.9/10 |
| GPT-6.1 Sol | High | 약 5% | 5분 | 9.2/10 |
| Claude Opus 5.5 | High | 약 5% | 12분 | 9.8/10 |
| Claude Opus 4.8 | High | 약 6% | 11분 | 8.2/10 |
| Claude Sonnet 4.6 | High | 약 9% | 6분 | 8.0/10 |
| GPT-5.6 Sol | Medium | 약 12% | 13분 | 9.2/10 |
| GPT-6 Astra | Medium | 약 14% | 5분 | 9.0/10 |
| GPT-6.1 Sol | Ultra | 약 17% | 7분 | 9.3/10 |
| GPT-5.6 Sol | High | 약 18% | 16분 | 9.3/10 |
| GPT-6 Astra | High | 약 20% | 14분 | 9.3/10 |
| 제가 이 테스트가 흥미롭다고 생각한 한 가지 이유는 모델들이 최종 답변이 |
그들은 또한 매우 다른 조사 전략을 선택했습니다. 작업에 언급된 일부 에셋은 실제로 Unity 프로젝트로 가져와지지 않았습니다. 대부분의 모델은 저장소를 검색하여 누락되었음을 확인하고 거기서 멈췄습니다. Claude Opus 5.5(medium 및 high)는 독립적으로 로컬 Unity Asset Store 캐시를 검색하여 다운로드된 .unitypackage를 찾고, 복사본을 프로젝트 외부에 압축 해제한 다음, 실제 소스 파일과 프리팹을 검사하고 에셋이 실제로 수행하는 작업에 따라 추천 사항을 변경했습니다. 그러한 에이전트적 행동(agentic behavior)은 제가 모델들 사이에서 발견한 가장 큰 차이점 중 하나였습니다. ## 테스트하지 않은 모델 저는 Fable과 Gemini 4를 포함하고 싶었지만, 저에게 이용 가능한 일반 구독 할당량에는 포함되어 있지 않았거나 별도의 유료 사용/크레딧이 필요했습니다. 이 비교의 목적이 제가 실제로 월 약 €20으로 얻을 수 있는 것을 비교하는 것이었기 때문에, 저는 개별 청구되는 모델들은 제외했습니다. 실질적인 시사점 최고의 일상 기본값: GPT-6.1 Sol Medium 최고의 심층 조사 가치: Claude Opus 5.5 Medium 가장 저렴한 유용한 탐색가: Claude Sonnet 5.5 Medium 최고의 중요/포렌식 옵션: Claude Opus 5.5 High 이전의 Claude 모델, GPT-5.6 Sol 및 Astra는 이 특정 테스트에서 일반적으로 가성비가 떨어졌습니다. 제출자 /u/AlexXx52 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/ChatGPTCoding (top/week)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기