
GPT-5.6 Sol, DeepSWE에서 72.7% 기록하며 Opus 5의 68.8%를 앞서다
요약
GPT-5.6 Sol이 DeepSWE 벤치마크에서 72.7%를 기록하며 Opus 5를 앞질렀습니다. 하지만 DeepSWE의 방법론과 데이터셋이 공개되지 않아 결과의 신뢰성과 검증 가능성에 대한 의문이 제기되고 있습니다.
핵심 포인트
- GPT-5.6 Sol이 DeepSWE에서 72.7%로 Opus 5(68.8%)보다 높은 성능 기록
- DeepSWE는 자율 소프트웨어 엔지니어링(SWE) 에이전트 능력을 평가하는 벤치마크
- 벤치마크의 상세 프로토콜 및 데이터셋 미공개로 인한 검증의 어려움
- 결과 차이가 실제 성능 차이인지 작업 선택 편향인지 확인 불가
GPT-5.6 Sol이 DeepSWE 벤치마크에서 72.7%를 기록하며, Opus 5의 68.8%를 앞질렀습니다. 3.9%포인트의 격차는 자율 소프트웨어 엔지니어링 (SWE) 에이전트의 동작을 테스트합니다.
주요 사실
- GPT-5.6 Sol: DeepSWE에서 72.7% 기록.
- Opus 5: DeepSWE에서 68.8% 기록.
- 3.9%포인트 격차.
- DeepSWE는 자율 SWE 에이전트의 동작을 테스트함.
- 공개된 방법론이나 데이터셋은 없음.
@rohanpaul_ai의 트윗에 따르면, GPT-5.6 Sol은 Opus 5의 68.8%와 비교하여 72.7%의 점수로 DeepSWE 벤치마크에서 선두를 유지하고 있습니다. DeepSWE는 모델이 자율 소프트웨어 엔지니어링 (SWE) 에이전트로서 행동하는지 평가하며, 이는 HumanEval이나 SWE-bench와 같은 정적인 코드 생성 (code-generation) 벤치마크와는 차별화됩니다.
DeepSWE의 정확한 구성은 공개되지 않은 상태로 남아 있습니다. 12개의 인기 있는 Python 저장소(repository)에서 가져온 실제 GitHub 이슈를 사용하는 SWE-bench와 달리, DeepSWE의 작업 세트와 평가 프로토콜은 공개적으로 문서화되어 있지 않습니다. 해당 트윗은 샘플 크기, 작업의 다양성, 또는 벤치마크에 다단계 디버깅 (multi-step debugging), 테스트 생성 (test generation), 또는 저장소 수준의 추론 (repository-level reasoning)이 포함되어 있는지 여부를 명시하지 않았습니다.
이러한 불투명성은 공개된 방법론 없는 리더보드 주장은 검증하기 어렵기 때문에 중요합니다. SWE-bench Lite 하위 집합(300개 작업) 또는 최근의 HumanEval+(증강된 테스트를 포함한 80개 작업)와 같은 AI 벤치마킹 분야의 이전 연구들은 벤치마크 설계 선택이 순위를 10점 이상 바꿀 수 있음을 보여주었습니다. 투명성이 없다면, 3.9%포인트의 격차는 실제 능력의 차이라기보다 작업 선택 편향 (task selection bias)을 반영하는 것일 수 있습니다.
격차가 중요한 이유
GPT-5.6 Sol의 DeepSWE에서의 우위는 OpenAI의 블로그 게시물에 따르면, 2026년 1월 SWE-bench Verified에서 71.3%를 기록한 성능과 유사합니다. 반면, Opus 5는 동일한 데이터셋에서 65.1%를 기록했습니다. 두 SWE 벤치마크(benchmarks) 전반에 걸쳐 나타나는 일관된 4-6포인트의 격차는 GPT-5.6의 확장된 컨텍스트 윈도우 (context window, 256K 토큰) 및 개선된 도구 사용 미세 조정 (tool-use fine-tuning)에서 비롯된 실제적인 아키텍처 또는 학습상의 이점을 시사합니다.
하지만 DeepSWE의 공개 문서 부족은 직접적인 비교를 제한합니다. 해당 트윗은 신뢰 구간 (confidence intervals), 작업 수, 또는 카테고리별 세부 내역을 제공하지 않습니다. 참고로, SWE-bench의 2,294개 작업 사례 (task instances)는 상위 모델들에 대해 ±2.1%의 95% 신뢰 구간을 가집니다. 문서화되지 않은 벤치마크에서의 3.9% 격차는 쉽게 노이즈 (noise) 범위 내에 포함될 수 있습니다.
트윗에서 누락된 내용
해당 게시물은 실행 횟수 (number of runs), 온도 설정 (temperature settings), 또는 결과가 단일 패스 (single pass)인지 다수결 투표 (majority voting)인지 여부를 공개하지 않았습니다. 이러한 세부 사항은 학술적인 SWE 평가의 표준입니다. 예를 들어, SWE-bench 논문은 온도 0.2에서 작업당 5회의 실행을 사용했습니다. 이러한 정보 없이는 해당 주장은 결과가 아닌 하나의 데이터 포인트 (datapoint)에 불과합니다.
OpenAI나 Anthropic으로부터의 공식적인 확인은 아직 발표되지 않았습니다. 이 트윗은 정확한 벤치마크 보고 이력을 가진 독립적인 AI 연구자로부터 시작되었으나, 출처는 연결된 논문이나 저장소 (repository)가 없는 단일 소셜 미디어 게시물입니다.
핵심 요약
- GPT-5.6 Sol은 DeepSWE에서 72.7%를 기록하며 Opus 5의 68.8%를 앞질렀습니다.
- 문서화되지 않은 이 벤치마크는 자율적인 SWE 에이전트 (autonomous SWE agents)를 테스트합니다.
관전 포인트

OpenAI 또는 Anthropic이 방법론 (methodology)을 포함한 공식적인 DeepSWE 결과를 발표하는지 지켜봐야 합니다. 만약 Anthropic이 SWE-bench Verified에 대한 Opus 5의 점수를 공개한다면, DeepSWE에서의 3.9포인트 격차를 교차 검증 (cross-validated)할 수 있습니다. 또한 재현성 (reproducibility) 세부 사항을 확인하기 위해 DeepSWE 논문이 발표되는지도 추적해야 합니다.
[7월 25일 업데이트, the_decoder 제공]
Anthropic의 Claude Opus 5가 ARC-AGI-3에서 30.2%를 기록하며, 해당 새로운 문제 해결 벤치마크 (benchmark)에서 GPT-5.6 Sol의 점수를 거의 4배 상회했습니다 [The Decoder에 따르면]. 또한 이 모델은 Artificial Analysis Intelligence Index에서 61점을 기록하며 선두를 달리고 있으며, 분석 품질 (analytical quality)과 코딩 (coding) 측면에서 Claude Fable 5와 GPT-5.6 Sol을 근소한 차이로 앞질렀습니다. 동시에 낮은 추론 단계 (reasoning tiers)에서는 Fable 5의 절반 수준의 비용만 소요됩니다. 이러한 가격 경쟁력은 경쟁 구도를 재편할 수 있습니다.
[7월 26일 업데이트, the_decoder 제공]
Opus 5는 129개의 테스트 시나리오에서 브라우저 에이전트 (browser agents)를 대상으로 한 프롬프트 인젝션 (prompt injection) 성공률 0%를 달성했습니다. 이는 추가적인 보호 조치가 없을 때의 3.7%와 대조적입니다 [The Decoder에 따르면]. Anthropic은 이 모델이 ARC-AGI-3에서 이전에는 볼 수 없었던 동작인 성찰 방정식 (reflection equations)을 독립적으로 공식화했으며, 취약점 탐지 (vulnerability detection) 능력이 향상되었음에도 불구하고 사이버 착취 (cyber exploitation) 학습을 의도적으로 피했다고 밝혔습니다.
원문 게시: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기