
코딩 에이전트에게는 실시간 협업이 '대중의 지혜'보다 효과적이다
요약
AI 코딩 에이전트의 성능을 비교하기 위해 독립적 작업 방식과 실시간 협업 방식을 실험한 결과, 실시간 협업이 다수결 방식보다 더 높은 정확도를 보였습니다. Gemini 1.5 Flash 기반 에이전트들을 활용해 Project Euler 문제를 풀게 한 결과, 협업 시 정확도가 72%에서 87%로 크게 향상되었습니다.
핵심 포인트
- 실시간 협업 방식이 단순 다수결(Wisdom of the Crowd)보다 높은 성능을 기록함
- 협업 에이전트는 단독 실행 대비 정확도가 72%에서 87%로 상승함
- MCP 서버를 통한 에이전트 간 메시지 브로드캐스트가 협업의 핵심 요소임
- 협업 방식은 정확도 향상뿐만 아니라 평균 실행 시간 단축 효과도 보임
요약 (tl;dr): 저는 30개의 Project Euler 문제를 두 가지 방식으로 AI 코딩 에이전트에게 풀게 했습니다: 다섯 명의 에이전트가 각각 독립적으로 작업하는 방식과, 다섯 명의 에이전트가 실시간으로 협업하는 방식입니다. 두 방식 모두 마지막에 다섯 개의 답변에 대한 다수결 (majority vote)을 계산했습니다. 협업하는 에이전트들은 독립적인 에이전트들과 그들의 다수결 결과 모두를 앞질렀습니다. 투표 없이의 평균 정확도는 72%에서 87%로 상승했습니다.
설정 (The setup)
저는 Antigravity를 통해 실행되는 Gemini 3.5 Flash 기반의 AI 코딩 에이전트들에게 Project Euler의 수학 및 프로그래밍 문제 30개를 풀게 했습니다. 웹사이트에서 정답을 확인할 수 없었던 문제 하나(983)를 제외하고 올해 발표된 모든 문제를 대상으로 했습니다.
각 문제에 대해, 다섯 명의 에이전트가 다섯 개의 동시 실행 컨테이너에서 실행되었습니다. 저는 두 가지 방식으로 실행했습니다:
- 솔로 (Solo): 문제를 해결하는 동안 서로 통신할 수 있는 능력이 없음.
- 협업 (Collaborative): 협업할 수 있음을 알려주는 추가 프롬프트와, 마치 서로에게 이메일을 보내는 것처럼 어떤 에이전트든 나머지 에이전트들에게 메시지를 브로드캐스트(broadcast)할 수 있게 해주는 MCP 서버를 제공함.
두 경우 모두 마지막에 다섯 개의 답변에 대한 다수결 (majority vote)을 취했습니다. 따라서 비교를 위해 총 네 가지 방법이 존재합니다: 솔로 개인, 솔로와 투표, 협업 개인, 그리고 협업과 투표.
각 에이전트에게는 30분의 작업 시간이 주어졌으며, 마무리 및 최종 답변 제출을 위해 최대 10분의 추가 시간이 주어졌으므로, 단일 실행에 최대 약 40분이 소요될 수 있습니다.
결과 (The results)

개별적으로 수행했을 때, 단독 에이전트 (solo agents)는 150회 실행 중 108회(72%)를 정확히 수행했습니다. 실시간 협업 (real-time collaboration)을 적용한 동일한 설정에서는 150회 중 130회(87%)를 성공했습니다. 다수결 (majority vote) 방식은 30개 문제 중 24개(80%)에서 30개 중 27개(90%)로 향상되었습니다. 보시다시피 실시간 협업과 '대중의 지혜 (wisdom of the crowd)', 즉 다수결 방식 모두 효과적이지만, 실시간 협업이 전체 정확도에 더 강력한 영향을 미쳤습니다.
| 단독 (solo) | 협업 (collaborative) | |
|---|---|---|
| 평균 실행 시간 (average run time) | 14분 | 10분 |
| 5회 중 최악의 시간 중앙값 (median worst-of-5 time) | 31분 | 11분 |
5회 중 최악의 시간 (worst-of-5 time)이 중요한 이유는, 5개의 답변을 모두 기다려야 투표를 통해 최종 답변을 얻을 수 있기 때문입니다. 평균 시간은 다른 방식으로 중요합니다. 이는 사용되는 토큰 (tokens)과 연산량 (compute)을 측정하는 대리 지표 (proxy) 역할을 합니다. Antigravity는 불행히도 정확한 토큰 수를 제공하지 않지만, 토큰과 연산량은 문제를 해결하는 데 걸리는 시간에 비례하여 확장됩니다.

협업 실행의 더 많은 경우가 첫 5분 이내에 종료되며 (97 대 77), 30분을 초과하여 실행되는 경우는 더 적습니다 (23 대 38).

5회 중 최악의 시간 측면에서, 단독 세트는 30분에서 40분 사이에 몰려 있는데, 이는 많은 문제에서 최소 하나 이상의 에이전트가 제한 시간 (cap)까지 계속 실행되었기 때문입니다. 협업 세트는 대부분 첫 5분 이내에 완료되는데, 한 에이전트가 문제를 해결하고 그 결과를 공유하면 나머지 에이전트들도 빠르게 작업을 마칠 수 있기 때문입니다. 다만, 더 어려운 문제들은 여전히 실행 시간이 길어집니다.
언급할 만한 가치가 있는 세 가지 개별 문제들은 다음과 같습니다:
- 구조 작업 (The rescue). problem 989에서 단독 에이전트(solo agents)들은 5번의 시도 중 0번 성공했으며, 그중 두 명은 확신에 찬 오답을 제출했습니다. 협업 실행(collaborative run)에서는 5분 만에 한 에이전트가 문제 구조에 대한 검증된 특성(verified characterization)을 공유했고, 다른 두 에이전트가 문제 설명에 주어진 예시와 중간값(intermediate values)을 대조하여 확인했으며, 다섯 명의 에이전트 모두 만장일치로 정답에 수렴했습니다. 협업을 통해 그 어떤 개별 에이전트도 단 한 번도 풀지 못한 문제를 해결했습니다.
- 속도 향상 (The speedup). problem 993에서 단독 실행은 5번 중 3번 성공했으며, 한 에이전트는 미묘한 외삽 함정(extrapolation trap)에 빠졌습니다. 협업 실행은 5번 중 5번 모두 성공했으며, 약 4배 더 빨랐습니다.
- 실패 (The failure). problem 1006에서는 두 설정 모두에서 아무도 풀지 못했습니다. 하지만 협업 실행에서는 올바르게 검증된 _중간값 (intermediate value)_이 에이전트들 사이에서 공유되었고, 그중 두 명이 이를 최종 정답으로 제출했습니다.
면책 조항 (Disclaimers)
이 에이전트들은 결정론적(deterministic)이지 않습니다. 결과를 재현하려고 시도할 때 약간 다른 수치를 얻을 수도 있지만, 원칙적으로는 유사한 결과를 얻을 수 있어야 합니다.
Project Euler의 규칙에 따라, 숫자 정답은 여기나 리포지토리(repo)에 공개되지 않습니다. 실행 결과는 사이트 자체에서 검증된 비공개 정답을 기준으로 채점되었습니다.
미결 과제 (Open questions)
여기서 얻은 통찰은 단 5명의 에이전트만을 대상으로 한 실험에서 도출되었으므로, 여전히 많은 미지의 영역이 남아 있습니다.
- 에이전트가 25명, 50명, 100명이라면 어떨까요? 점점 더 어려운 문제를 푸는 데 있어 확장성(scale)이 있을까요?
- 100명의 에이전트가 있다면, 하나의 큰 그룹 채팅을 만드는 것이 나을까요, 아니면 10명씩 구성된 10개의 별도 그룹 채팅을 만들고 그룹 간에도 소통할 수 있는 방법을 마련하는 것이 나을까요?
- 다른 모델(models)에서도 동일하게 작동할까요?
- 다른 하네스(harnesses)에서도 작동할까요?
- 우리가 여기서 했던 것처럼 자유롭게 협업하게 두는 것이 나을까요, 아니면 특정 역할(specific roles)을 부여하는 것이 나을까요?
많은 미결 과제가 남아 있지만, 이것이 괜찮은 시작이라고 믿습니다.
관련 연구 (Prior art)
현재 실제 서비스 중인 사례 중 가장 유사한 것은 xAI의 Grok Heavy 라인업입니다. Grok 4 Heavy는 스터디 그룹처럼 서로 의견을 나누는(compare notes) 여러 에이전트를 병렬로 실행했으며, 최신 버전들은 복잡한 쿼리에 대해 멀티 에이전트 (multi-agent) 설정을 기본값으로 사용합니다.
부록 (Appendix)
정확한 프롬프트 (prompts), Dockerfile, 그리고 전체 실행 결과 데이터 (300회 실행 전체에 대한 정답 여부 및 소요 시간)는 부록에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기