
GLM-5.2 vs Claude Opus 5 비교
요약
Claude Opus 5와 GPT-5.6 Luna 모델의 고난도 추론 및 지시 준수 능력을 비교 분석한 벤치마크 결과입니다. 수학, 물리, Python 코드 생성 및 엄격한 JSON 형식 준수 여부를 기준으로 두 모델의 강점과 한계를 상세히 다룹니다.
핵심 포인트
- Claude Opus 5는 알고리즘 실행 및 코드 완성도 면에서 우수함
- GPT-5.6 Luna는 지시 준수 능력은 높으나 셀프 테스트 오류로 인한 실행 실패 발생
- Opus 5는 JSON 출력 시 불필요한 마크다운 래핑 문제가 있음
- 용도에 따라 구조화 데이터는 Luna, 복잡한 알고리즘은 Opus를 권장
고난도 라운드에서는 Claude Opus 5가 17/18 (94.4%), GPT-5.6 Luna가 **16/18 (88.9%)**였습니다. 차이는 1문제이며, Opus가 항상 우위에 있다는 증거는 아닙니다. 중요한 것은 실패의 형태입니다. Opus는 3개의 알고리즘을 그대로 실행할 수 있는 형태로 납품한 반면, 엄격한 JSON (Strict JSON) 형식에 불필요한 감싸기(wrapping)를 추가했습니다. Luna는 3가지 형식 지시를 모두 준수했으나, 2개의 Python 파일이 import 시점에 중단되었습니다.
첫 8문제는 두 모델 모두 8/8로 차이가 없었습니다. 이에 따라 제2라운드를 18문제로 늘리고, 6개 분야 각각에 hard, harder, extreme 난이도를 배치했습니다. 정확한 분수, 다단계 물리 모델, 완전한 Python 파일, 잘못된 전제의 거부, 유일한 제약 해법, 문자 단위의 출력 형식을 요구했습니다. 설명이 능숙한지가 아니라, 결정적인 주장을 계산, JSON 파싱 (JSON Parsing), Python 실행을 통해 확인할 수 있는지를 평가했습니다.
동일한 문제문, system 지시, temperature, 문제별 출력 예산을 사용했습니다. 수학과 물리는 엄격한 값 또는 수치 허용 오차로 검증하였고, 코드는 답변 그대로 저장하여 공통의 hidden test로 import했습니다. JSON과 CSV는 '의미가 통하는가'가 아니라, 기계 입력으로서 합격하는지로 판정했습니다. 모델 자신의 assert를 삭제하면 작동하는 경우도 있지만, 원인 분석에는 사용하되 첫 납품 합격 기준에는 포함하지 않았습니다. 네트워크 지연(latency)은 생(raw) JSON에만 남겨두었으며, 승패에는 일절 반영하지 않았습니다.
| 평가 분야 | Opus 5 | GPT-5.6 Luna |
|---|---|---|
| 수학적 추론 | 3/3 | 3/3 |
| ... | Total | 17/18 (94.4%) |
Luna가 실패한 2문제는 끝부분의 셀프 테스트(self-test)를 제외하면 함수 본체가 hidden test를 통과했습니다. 하지만 셀프 테스트의 기대값이 잘못되어, 원본 파일은 import 시 AssertionError를 일으킵니다. '완전한 Python 파일'이라는 계약 관점에서는 실패입니다. Opus의 3개 파일은 원본 그대로 import 및 공통 테스트를 통과했습니다. 실무에서는 그럴듯한 함수와 즉시 이용 가능한 성과물을 구분해서 생각해야 합니다.
Opus의 유일한 실패는 반대 방향이었습니다. JSON의 키(key)와 값(value)은 올바르지만, 'JSON 객체만' 출력하라는 지시에 반하여 Markdown의 코드 펜스(code fence)를 추가했습니다. 독립 재시도(independent retry)에서도 마찬가지였습니다. Luna는 지시 준수 3문제를 모두 통과했습니다. 출력을 직접 파서(parser)로 전달하는 처리에서는, 감싸기 여부도 정확성의 일부입니다.
초기 시도 중 일부는 내부 추론이 출력 예산을 모두 소모하여 finish_reason=length가 되었습니다. 이는 증거로 저장했지만, 지능의 오류로는 계산하지 않았습니다. 두 모델의 유효 예산을 동일한 조건에서 늘린 후 채점했기 때문입니다. 다만, 긴 추론으로 인해 가시적 성과물의 영역이 부족해지는 통합상의 리스크는 남아 있습니다.
엄격한 JSON, CSV, 짧은 추출, 대량의 구조화 처리는 Luna를 제1후보로 두되, 스키마 검증 (schema validation)을 필수적으로 수행합니다. 긴 알고리즘, 경계 조건, 방어적 구현은 Opus를 제1후보로 합니다. 수학, 복잡한 물리, 잘못된 전제, 제약 추론은 본 샘플에서 동점이므로, 가격, API 호환성, 문장량으로 선택하는 것이 합리적입니다. 어떤 모델을 쓰든 JSON을 parse하고, 수치를 대조하며, 코드를 답변 그대로 실행하십시오.
실행 스크립트는 scripts/opus5_vs_luna_hard_benchmark.py이며, 모든 결과는 .tmp/opus5-vs-luna-hard-benchmark-results.json에 있습니다. 독립 재시도는 .tmp/opus5-hard-failure-retry.json 및 .tmp/luna-hard-failure-retry.json에 있습니다. API는 https://cn.crazyrouter.com/v1/chat/completions를 사용하며, 지연 시간은 생 데이터로만 확인할 수 있습니다.
아니요. 이 18문제에서 1문제를 앞섰다는 의미입니다. 이미지, 도구 사용, 초장문 맥락, 멀티턴 에이전트(agent)는 대상에서 제외되었습니다.
요구가 '완전한 Python 파일'이기 때문입니다. 원본 파일이 import에서 실패한다면, 사람이 직접 수정하지 않고는 사용할 수 없습니다.
지연 시간은 모델뿐만 아니라 게이트웨이, 상류 부하, 경로 상태에 따라서도 좌우됩니다. 운영 증거로서는 유용하지만, 지능의 정확성과는 별개의 문제입니다.
검증 가능한 정확성을 우선시한 이번 테스트에서는, 알고리즘 3문제를 완벽하게 해결한 Opus 5가 17/18 대 16/18로 1문제 차이로 앞서 나갔습니다. 반면, 엄격한 지시 준수 (Instruction Following) 측면에서는 Luna가 더 우세합니다. 결론은 만능 승자가 존재하는 것이 아니라, 재현 가능한 실패 경향에 기반하여 모델을 구분하여 사용하는 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기