어떤 AI 모델이 실제로 최고의 소프트웨어를 만들까요? 이를 알아내기 위해 공개 벤치마크를 구축했습니다
요약
코딩 작업에 최적화된 AI 모델을 판별하기 위해 구축된 공개 벤치마크 'Favur Evals'를 소개합니다. 다양한 모델(OpenAI, DeepSeek, Qwen 등)을 에이전트 팀의 두뇌로 교체하며 코드 품질, 비용, 속도 등 8가지 엔지니어링 지표를 실시간으로 비교 분석합니다.
핵심 포인트
- Favur Evals는 모델별 코딩 성능을 실시간으로 비교하는 리더보드 제공
- 단일 모델 승자가 아닌 역할별(플래너, 코더 등) 최적 모델 조합 제시
- LLM 채점이 아닌 린트, 테스트 결과 등 객관적 지표로 점수 산정
- 코드 품질, 비용 효율성, 도구 규율 등 8가지 주제별 심층 분석 지원
오늘 우리는 **Favur Evals**를 공개합니다. 이는 우리 스스로에게 계속해서 답이 필요했던 질문, 즉 _'코딩 작업에 실제로 어떤 모델을 투입해야 하는가?'_에 대한 공개적이고 실시간적인 리더보드(leaderboard)입니다.
작동 방식은 다음과 같습니다. 우리는 고정된 작업 명세서(statement of work)를 가져와 플래너(planner), 아키텍트(architect), 테스터(tester), 코더(coder), 리뷰어(reviewer), 빌더(builder)로 구성된 AI 에이전트(AI agents) 팀 전체에 전달합니다. 그런 다음 팀 내부의 **모델(model)**만 교체하며 동일한 작업을 반복해서 실행합니다:
all-Qwen, all-OpenAI, all-DeepSeek, all-Gemini 등과 같은 방식입니다. 작업은 동일하고, 스캐폴딩(scaffolding)도 동일하지만, 두뇌만 다릅니다. 모든 실행 결과는 단순히 최종적인 diff(차이점)뿐만 아니라, 코드, 테스트, 비용, 규율(discipline) 등 전체 라이프사이클(lifecycle)에 걸쳐 점수가 매겨집니다.
리더보드에서 확인할 수 있는 것
단 한 명의 승자를 가리기를 거부하는 리더보드.
이 글을 쓰는 지금 이 순간에도, 1위는 단일 모델이 아닙니다. 오케스트레이션(orchestration) 비중이 높은 역할에는 Gemini Flash 3.5를, 8개의 전문화된 역할에는 Gemini Flash Lite를 배치한 두 모델의 혼합 구성입니다.
한편, 가장 강력한 테스트 스위트(test suites)는 all-OpenAI 실행에서 나왔고, 달러당 최고의 가치는 all-DeepSeek에서, 그리고 실패가 없는 가장 효율적인 실행은 all-Qwen에서 나왔습니다. 모델마다 작업의 서로 다른 부분에 정말로 강점이 있습니다. 이 리더보드는 어느 부분인지 가시적으로 보여주므로, 여러분이 채용하고자 하는 역할에 맞춰 모델을 선택할 수 있습니다.
주제별 분석(Subject breakdowns). 모든 복합 구성은 코드 품질(code quality), 테스트 품질(test quality), 비용 효율성(cost efficiency), 속도(velocity), 도구 규율(tool discipline), 노력 효율성(effort efficiency), 프로세스 규율(process discipline), 결과물(deliverables) 등 8가지 엔지니어링 주제로 나뉩니다. 따라서 우리의 혼합 방식 대신 여러분이 중요하게 생각하는 항목별로 순위를 매길 수 있습니다.
행동 지문(Behavior fingerprints). 각 모델이 각 역할에서 실제로 어떻게 행동하는지 보여줍니다: 캐시 활용도(cache utilization), 추론 깊이(reasoning depth), 도구 사용 주기(tool cadence), 처리량(throughput).
비용의 흐름. 실행 전반에 걸쳐 에이전트 역할별 비용 점유율을 보여줍니다 — 스포일러를 하자면: 어떤 모델을 사용하든 코드 리뷰(code review)가 가장 큰 비용 항목입니다.
점수 산정에 대해 알아두어야 할 한 가지
보드에 있는 그 어떤 것도 LLM(Large Language Model)에 의해 채점되지 않습니다. 모든 수치는 실행 과정에서 이미 생성된 산출물(artifacts) — 린트(lint), 복잡도 지표(complexity metrics), 실행 자체의 테스트 결과, 도구 텔레메트리(tool telemetry) — 로부터 매번 다시 계산됩니다. 동일한 실행 결과에는 매번 동일한 점수가 부여됩니다. 전체 루브릭(rubric)은 공개되어 있으며, 보드 위의 어떤 점수든 클릭하면 해당 점수의 산출 공식으로 확장됩니다.
이것들은 버전 관리되는 루브릭(rubric) 하에 있는 저희 파이프라인 내부의 상대적 순위입니다. 파이프라인이 개선됨에 따라 보드의 순위가 재배치되는데, 이는 의도된 설계입니다. 개별 수치는 하나의 점 추정치(point estimate)로 취급해야 하며, 최종 판결로 간주해서는 안 됩니다.
누가 이 프로젝트를 만들었나요
저희는 자율형 멀티 에이전트(multi-agent) 소프트웨어 팀인 Favur를 구축하고 있으며, 이 실행들은 Favur 자체 파이프라인에서 수행됩니다. 이 벤치마크는 독립적이며 자체 자금으로 운영됩니다. 특정 업체의 후원, 크레딧 또는 보조금을 받지 않으며, 보드에 있는 모든 모델은 진정으로 어려운 과제를 수행하고 있습니다.
직접 살펴보세요: evals.favur.dev.
새로운 실행 결과가 수시로 업데이트됩니다. @favurdev에서 확인하실 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기