Hermes Agent의 Mixture of Agents를 사용하여 3개의 AI 모델을 결합해 보았습니다! 그 결과는 다음과 같습니다
요약
Hermes Agent의 Mixture of Agents(MoA) 기술을 활용하여 여러 AI 모델의 강점을 결합하는 실험을 소개합니다. 여러 참조 모델이 독립적으로 문제를 분석하고, 어그리게이터 모델이 이를 종합하여 최선의 결정을 내리는 아키텍처를 설명합니다.
핵심 포인트
- MoA는 여러 모델의 관점을 결합해 단일 모델보다 뛰어난 성능을 목표로 함
- 참조 모델은 독립적 분석을 수행하는 '고문' 역할을 수행
- 어그리게이터 모델은 도구 실행 및 최종 결정을 내리는 '의사 결정자' 역할 수행
- 모델별 강점과 추론 패턴의 차이를 활용해 결과의 품질을 높임
우리는 한 가지 질문을 던지는 데 많은 시간을 보냅니다:
어떤 AI 모델이 가장 똑똑할까?
GPT? Claude? DeepSeek? MiniMax?
하지만 Hermes Agent의 Mixture of Agents (MoA)를 실험해 본 후, 저는 그것이 잘못된 질문일 수도 있다는 생각을 하기 시작했습니다.
하나의 AI 모델을 선택하는 대신, 여러 모델이 동일한 문제를 분석하게 하고 다른 모델이 그들의 최선의 아이디어를 결합하게 할 수 있다면 어떨까요?
다시 말해:
3개의 AI 모델 → 1개의 더 똑똑한 결정 → 더 나은 결과
이것이 Mixture of Agents (MoA)의 핵심 아이디어입니다.
그리고 저는 이를 직접 테스트해 보기로 했습니다.
🤝 Mixture of Agents란 무엇인가?
대부분의 AI 에이전트 (AI agents)는 단일 모델로 작동합니다.
사용자가 프롬프트 (prompt)를 보냅니다.
모델은 이에 대해 추론하고, 도구 (tools)를 사용하며, 답변을 제공합니다.
Mixture of Agents는 여기에 또 다른 계층을 도입합니다.
사용자의 프롬프트는 먼저 여러 개의 참조 모델 (reference models)로 병렬 전송됩니다.
각 모델은 독립적으로 동일한 문제를 분석하고 각자의 관점을 제공합니다.
그 후 이들의 응답은 어그리게이터 모델 (aggregator model)에게 전달되며, 이 모델은 서로 다른 접근 방식들을 검토하고, 가장 강력한 아이디어들을 결합하며, 다음에 무엇을 할지 결정합니다.
참조 모델들은 고문 (advisors)처럼 행동합니다.
어그리게이터는 의사 결정자 (decision-maker)입니다.
오직 어그리게이터만이 다음을 수행할 수 있습니다:
- 📂 파일 읽기
- 🛠️ 도구 실행
- 💻 터미널 명령 실행
- ✍️ 코드 수정
- ✅ 최종 응답 생성
따라서 사용자 관점에서는 여전히 하나의 AI 에이전트와 작업하는 것처럼 보입니다.
하지만 막후에서는, 그 에이전트가 중요한 결정을 내리기 전에 여러 AI 모델과 상담하고 있는 것입니다.
🏢 여러 명의 시니어 엔지니어에게 묻는 것과 같습니다
당신이 중요한 아키텍처 (architecture) 결정을 내리고 있다고 상상해 보세요.
한 명의 시니어 엔지니어에게 묻겠습니까?
아니면 세 명의 시니어 엔지니어가 먼저 독립적으로 문제를 검토하게 하겠습니까?
한 명은 즉시 보안 문제를 발견할 수도 있습니다.
다른 한 명은 아키텍처가 확장 가능한지(scale) 의문을 제기할 수도 있습니다.
세 번째 엔지니어는 훨씬 더 간단한 구현 방법을 찾아낼 수도 있습니다.
그들 중 누구도 반드시 완전한 정답을 가지고 있는 것은 아닙니다.
하지만 세 가지 관점을 모두 볼 수 있는 의사 결정자는 방향을 선택하기 전에 더 많은 정보를 갖게 됩니다.
LLM (Large Language Models)도 이와 유사한 방식으로 작동합니다.
모델마다 서로 다른 강점, 약점, 편향(biases), 그리고 추론 패턴(reasoning patterns)을 가지고 있습니다.
Mixture of Agents (MoA)의 목표는 단순히 더 많은 모델을 추가하는 것이 아닙니다.
최종 모델이 해결책을 확정하기 전에 다양한 관점에 접근할 수 있도록 하는 것입니다.
🎥 전체 영상 가이드
⚙️ 아키텍처 작동 방식
기본적인 워크플로우는 다음과 같습니다:
사용자의 프롬프트 (YOUR PROMPT)
│
┌────────────┼────────────┐
...
중요한 차이점은 이것입니다:
참조 모델(Reference models)은 조언하고, 애그리게이터(Aggregator)는 실행합니다.
조언자들은 사용자의 프로젝트를 수정하거나 도구(tools)를 실행하지 않습니다.
그들은 독립적으로 문제를 분석하고, 애그리게이터가 무엇을 할지 결정할 때 사용할 수 있는 추가적인 관점을 제공합니다.
🧪 3개의 AI 모델 실전 투입
제 실험을 위해 다음과 같이 구성했습니다:
- ⚡ DeepSeek V4 Flash — 참조 모델 (Reference Model)
- 🚀 MiniMax M2.7 — 참조 모델 (Reference Model)
- 🧠 GPT-5.4 — 애그리게이터 모델 (Aggregator Model)
그 다음 에이전트에게 실질적인 과제를 부여했습니다:
1인 유튜버를 위한 칸반 보드(Kanban board)를 제작하세요.
/moa를 사용하여 프롬프트를 제출했을 때, Hermes는 두 참조 모델 모두에게 동일한 문제를 병렬로 전달했습니다.
각 모델은 작업을 독립적으로 분석했습니다.
응답이 준비되면, 애그리게이터는 다음을 전달받습니다:
나의 원래 프롬프트 + DeepSeek의 관점 + MiniMax의 관점
그 후 애그리게이터는 이러한 아이디어들을 합성하여 실제 구현 방식에 어떻게 접근할지 결정할 수 있습니다.
결과는 어땠을까요?
약 14분 후, 에이전트는 다음과 같은 기능을 갖춘 작동 가능한 싱글 페이지 칸반 애플리케이션을 구축했습니다:
- 📋 크리에이터 중심의 7개 워크플로우 컬럼
- 📝 편집 가능한 작업 카드
- 🏷️ 태그 및 우선순위
- 📅 마감일
- ☑️ 체크리스트
- 🔍 검색
- 🎛️ 필터링
- 🖱️ 드래그 앤 드롭 카드
- 📊 워크플로우 통계
- 💾 로컬 브라우저 데이터 유지 (Local browser persistence)
이 모든 것이 단 하나의 초기 프롬프트로부터 이루어졌습니다.
흥미로운 점은 단순히 완성된 애플리케이션만이 아니었습니다.
실행 모델이 특정 방식에 전념하기 전에, 여러 모델이 어떻게 관점을 기여하는지 직접 확인할 수 있었다는 점입니다.
👀 서로 다른 AI 모델이 동일한 문제에 접근하는 방식 관찰하기
Hermes Agent 구현에서 가장 흥미로운 부분 중 하나는 참조 모델(reference models)이 무엇을 하고 있는지 가시성을 제공한다는 점입니다.
작업이 실행되는 동안, 각 참조 모델이 독립적으로 문제를 분석하는 모습을 볼 수 있습니다.
이를 통해 다음과 같은 사항을 관찰할 수 있습니다:
- 🧠 서로 다른 모델이 무엇을 포착하는지
- 🔍 한 모델은 잡아내지만 다른 모델은 놓치는 세부 사항
- 💡 동일한 문제에 대한 서로 다른 접근 방식
- 🤝 그러한 관점들이 어떻게 애그리게이터 (aggregator)에 정보를 제공하는지
이는 서로 다른 LLM (Large Language Models)이 항상 정확히 같은 방식으로 문제에 접근하지는 않는다는 점을 상기시켜 주는 유용한 지표입니다.
그리고 바로 그 지점에서 Mixture of Agents의 잠재적 가치가 발생합니다.
반드시 세 모델이 모두 동의할 필요는 없습니다.
때로는 의견의 불일치 자체가 유용한 부분이 되기도 합니다.
🎛️ 큰 차이를 만들 수 있는 하나의 설정
이해할 가치가 있는 설정 중 하나는 다음과 같습니다:
reference_max_tokens
이 설정은 각 참조 모델이 애그리게이터 (aggregator)를 위해 생성할 수 있는 출력 양을 제어합니다.
모든 어드바이저 (advisor)에게 수천 개의 토큰을 할당하는 것이 반드시 유용한 것은 아닙니다.
애그리게이터 (aggregator)에게 필요한 것은 종종 또 다른 완전한 해결책이 아니라 핵심적인 통찰력(key insights)입니다.
따라서 제한을 낮추면 다음과 같은 효과를 얻을 수 있습니다:
- ⚡ 더 빠른 응답
- 💰 더 낮은 토큰 사용량
- 🎯 더 집중된 조언
- 📉 애그리게이터 (aggregator)를 위한 불필요한 컨텍스트 (context) 감소
Hermes는 간결한 참조 응답을 위한 실용적인 기본값으로 600 토큰을 권장하지만, 이상적인 값은 작업에 따라 달라질 것입니다.
🧩 문제에 따른 서로 다른 AI 팀 구성
제가 유용하다고 느낀 또 다른 기능은 여러 개의 Mixture of Agents 프리셋 (presets)을 생성할 수 있는 능력입니다.
즉, 하나의 범용적인 AI 팀이 필요하지 않다는 뜻입니다.
다음과 같이 구성할 수 있습니다:
💻 코딩 (Coding)
소프트웨어 엔지니어링을 위해 특별히 선택된 모델들.
🔬 연구 (Research)
분석 및 긴 컨텍스트 추론 (long-context reasoning)에 서로 다른 강점을 가진 모델들.
🏗️ 아키텍처 (Architecture)
시스템 설계에 대해 상호 보완적인 관점을 제공하는 모델들.
📈 금융 분석 (Financial Analysis)
분석 작업에 최적화된 완전히 다른 조합.
끊임없이 질문하는 대신:
“가장 좋은 AI 모델은 무엇인가?”
더 흥미로운 질문은 다음과 같습니다:
“이 특정 문제를 해결하기 위한 최적의 모델 조합은 무엇인가?”
🎯 Mixture of Agents가 실제로 도움이 되는 경우
저는 모든 프롬프트에 Mixture of Agents (MoA)를 활성화하지는 않을 것입니다.
만약 다음과 같은 질문을 한다면:
15 × 27은 무엇인가?
세 개의 AI 모델을 사용한다고 해서 정답이 세 배 더 좋아지지는 않습니다.
추가적인 추론 (Reasoning)은 문제에 대해 여러 가지 유효한 접근 방식이 존재할 때 가치를 발휘합니다.
적합한 후보 사례는 다음과 같습니다:
- 🏗️ 소프트웨어 아키텍처 (Software architecture)
- 🔍 코드 리뷰 (Code reviews)
- 🐞 복잡한 디버깅 (Complex debugging)
- 📚 기술 조사 (Technical research)
- 🔄 마이그레이션 계획 (Migration planning)
- ⚙️ 시스템 설계 (System design)
- 🤖 AI 에이전트 워크플로우 (AI agent workflows)
이들은 두 번째 또는 세 번째의 관점이 첫 번째 모델이 간과한 무언가를 찾아낼 수 있는 문제들입니다.
⚖️ 트레이드오프 (The Trade-Offs)
Mixture of Agents는 공짜로 얻는 지능 업그레이드가 아닙니다.
💰 더 높은 API 비용
추가적인 모델 호출 (Model calls)이 발생합니다.
두 개의 참조 모델 (Reference models)과 하나의 어그리게이터 (Aggregator)를 사용하면, 단일 모델에 전적으로 의존하는 대신 여러 관점에 대해 비용을 지불하게 됩니다.
Hermes는 프롬프트 캐싱 (Prompt caching)을 유지하여 도움이 되긴 하지만, 추가적인 참조 호출은 여전히 추가 비용을 발생시킵니다.
⏳ 지연 시간 (Latency) 증가
어그리게이터가 결과물을 사용하기 전에 참조 출력값 (Reference outputs)을 먼저 받아야 합니다.
이는 복잡한 작업의 경우 모든 것을 하나의 모델에 직접 보내는 것보다 시간이 더 오래 걸릴 수 있음을 의미합니다.
🤔 더 많은 모델 ≠ 더 나은 결과
모델을 맹목적으로 추가하는 것이 목표가 아닙니다.
만약 모든 참조 모델이 유사한 강점을 가지고 있고 문제를 유사한 방식으로 접근한다면, 추가적인 관점이 큰 도움이 되지 않을 수 있습니다.
진정한 가치는 다양성 (Diversity)에서 옵니다.
강력한 조합은 단순히 리더보드에서 점수가 가장 높은 세 개의 모델을 선택하는 것이 아니라, 서로 다른 분야에 뛰어난 모델들을 포함하는 것일 수 있습니다.
💡 더 큰 아이디어: AI 모델은 경쟁할 필요가 없다
저에게 가장 흥미로웠던 시사점은 칸반 (Kanban) 애플리케이션 그 자체는 아니었습니다.
그것은 우리가 AI 모델을 생각하는 방식의 변화였습니다.
대부분의 AI 산업 담론은 경쟁을 중심으로 돌아갑니다:
어떤 모델이 1위인가?
어떤 모델이 가장 높은 벤치마크 점수 (benchmark score)를 기록하고 있는가?
어떤 모델이 내가 현재 사용 중인 모델을 대체해야 하는가?
하지만 그것은 이야기의 일부일 뿐일지도 모릅니다.
AI 시스템의 다음 단계는 단순히 다음과 같은 형태가 아닐 수도 있습니다:
더 똑똑한 모델 하나.
그것은 또한 다음과 같은 형태일 수 있습니다:
함께 작동하는 여러 개의 특화된 모델들.
Claude, DeepSeek, MiniMax, GPT, 혹은 다음에 등장할 그 무엇 사이에서 하나를 선택하는 대신, AI 에이전트 (AI agents)는 잠재적으로 서로 다른 모델들을 하나의 팀으로 사용하여, 최종 결정을 내리기 전에 각 모델의 개별적인 강점을 활용할 수 있습니다.
그렇게 되면 질문은 다음과 같이 바뀝니다:
“어떤 AI 모델이 가장 똑똑한가?”
에서:
“어떤 AI 모델의 조합이 가장 똑똑한 결정을 내리는가?”
로 말이죠.
그리고 저는 이것이 훨씬 더 흥미로운 문제라고 생각합니다.
💬 당신은 어떤 3개의 AI 모델을 선택하시겠습니까?
제가 꼭 보고 싶은 실험은 다음과 같습니다:
당신만의 AI 팀을 구축할 수 있습니다.
두 명의 조언자 (advisors)와 한 명의 최종 의사 결정자 (final decision-maker)를 선택할 수 있습니다.
당신은 어떤 세 가지 모델을 선택하시겠습니까?
그리고 더 중요한 것은:
왜 그 조합인가요?
댓글에 당신의 AI 팀을 남겨주세요. 👇
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기