로컬 환경에서 구체적인 모델(Qwen)과 Claude Opus 4.6을 동일한 코딩 작업에 테스트한 결과 공유
요약
본 글은 로컬 환경에서 구체적인 모델(Qwen)과 Claude Opus 4.6을 동일한 코딩 작업에 테스트한 결과를 공유합니다. 세 가지 복잡한 프로그래밍 작업을 통해 두 모델의 성능을 비교했으며, 특히 숨겨진 테스트와 코드 검토 과정에서 두 모델 간의 결과 차이가 매우 적음을 보여줍니다.
핵심 포인트
- 로컬 Coder 모델이 Opus 4.6과 유사한 종합 코딩 능력을 보임.
- 쉬운 작업에서는 로컬 모델이 더 높은 점수를 기록했으나, 어려운 작업은 비슷했습니다.
- Opus 4.6은 코드의 깔끔함과 유지보수 측면에서 여전히 강점을 가집니다.
- 결론적으로 단발성 테스트만으로는 두 모델 간 우위를 판단하기 어렵습니다.
우선 오해를 피하기 위해 두 가지 말씀을 드립니다.
저는 특정 모델이나 회사가 더 우수하다고 주장하려는 것이 아닙니다. 저는 그 어떤 것에도 개인적인 이해관계가 없습니다. 단지 같은 업무 환경에서 실제로 어떻게 작동하는지 직접 확인하고 싶었을 뿐입니다.
제가 관심을 갖는 이유는 다음과 같습니다. 저는 코드를 작성하기 위해 로컬 모델을 사용하며, 제3자 플랫폼에 구독료를 지불하는 대신 이 로컬 모델들에 얼마나 의존할 수 있는지 알고 싶습니다. 이것이 주된 동기입니다.
[내가 한 일]
파이썬으로 세 가지 작업을 수행했습니다. 가장 간단한 것부터 가장 복잡한 순서로 진행되었습니다: 로그 파일 분석기, 병렬 프로세스 관리자, 그리고 테스트 프로그래밍 언어용 작은 인터프리터였습니다. 모든 모델에 동일한 지침을 주었고, 단 한 번의 시도만 했으며, 이후 수정은 없었습니다. 그 후 모델들이 본 적 없는 숨겨진 테스트(총 162개)와 고정된 체크리스트를 사용한 코드 검토가 있었습니다: 지침을 따랐는가? 코드가 읽기 쉬운가? 특이한 입력값에 의해 오류가 발생하는가? 주석은 사실인가?
[결과 (100점 만점, 가장 어려운 과제가 3배로 계산됨)]
Claude Opus 4.6: 92.7
Qwen3.8-Flash-Next "Coder" (로컬): 92.7
Qwen 3.8 27B Q6 (로컬): 87.0
https://preview.redd.it/kdtp1ed93ath1.png?width=2000&format=png&auto=webp&s=df7d60e9a0845e02cd75029abce498c3fdabb570
무엇을 추론하는가
숨겨진 테스트는 거의 동등하다: Opus 4.6은 162점 만점에 162점을 기록했고, Coder 모델은 161점, 27B는 160점을 기록했다.
Coder 모델은 Opus 4.6과 동일한 종합 결과를 얻었으며, 그 과정이 달랐다. 쉬운 작업에서는 두 로컬 모델 모두 Opus(88점)보다 높은 점수를 받았다 (97점 대 92점). 중간 난이도 작업에서는 Opus가 승리했다 (96점 대 94점 및 91점). 어려운 작업에서는 인터프리터, Opus, Coder 모두 92점을 받았고, 27B는 81점으로 떨어졌다.
https://preview.redd.it/zhkga08c3ath1.png?width=2120&format=png&auto=webp&s=c60f0554864c105e3a72acd93e71a5efa354b695
Opus 4.6이 여전히 더 나은 부분: 코드가 더 깔끔하고 유지보수가 쉽다. 로컬 Coder 모델이 더 잘한 부분: 이상한 입력에 대해 충돌하는 경우가 적었다.
각 모델당 단 한 번의 실행만으로는 '로컬 모델이 Opus 4.6과 동등하다'고 말할 수 없다. 오히려 이렇게 말하고 싶다: 이 정도 규모의 작업에서는 그 결과들을 구별하기 어려웠다. 내 포트폴리오에 있어서는 이미 흥미롭다. 참고로 Opus 4.6은 Claude의 최신 버전이 아니며, 현재 버전들이 나의 전체 테스트에서 더 높은 점수를 얻었다.
로컬 설정
내 PC: Intel Core i5-14400, 48 GB DDR4 RAM, RTX 5060 Ti 두 개 (각 16 GB) (총 32 GB VRAM), Windows 11.
Qwen 3.8 27B, Unsloth Q6 quant: 일정한 속도인 50 토큰/초.
Qwen3.8-Flash-Next "Coder": 5090 토큰/초 사이로, 평균 약 6065토큰/초. 이는 Strata 프로젝트의 코딩 변형으로, 레이어마다 전문가의 절반을 유지하는 축소 버전이며, IQ1_M GGUF와 같다. 세부 정보: https://github.com/Niko1221/Strata/blob/main/docs/MODELS.md#coder
제한 사항, 따라서 스스로 수치를 평가할 수 있다.
모델당 단 한 번의 실행. 2~3점 차이는 아무 의미가 없다.
저는 Coder 모델을 두 번 실행했습니다. 첫 번째 실행 때는 제 PC의 RAM이 고갈되어 중단되었고, 그래서 그 실행은 무시하고 처음부터 다시 했습니다. 여기에 보고된 수치는 두 번째 실행 때의 것입니다.
리뷰 부분은 AI(Claude Fable 5.1)가 수행했습니다.
Coder 모델은 다른 두 모델보다 더 많은 비정상 입력 케이스로 테스트되었습니다. 제가 시간에 따른 검증을 추가했기 때문입니다. 따라서 조금 더 엄격하게, 관대하지 않게 평가되었다고 할 수 있습니다.
파이썬과 작업 자체가 작습니다. 이것이 실제 대규모 프로젝트에서 작동하는 것에 대해서는 아무것도 말해주지 않습니다.
제출자: /u/Short_Regular_7191 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기