감독자 패턴이 만능은 아니다: 계층적 오케스트레이션이 실제로 실패하는 경우
요약
본 기사는 복잡한 소프트웨어 엔지니어링 작업을 수행할 때 계층적 에이전트 오케스트레이션(Hierarchical orchestration)의 한계를 지적합니다. 연구 결과, 단일 에이전트가 여러 조정 아키텍처보다 훨씬 높은 성공률을 보였으며, 이는 구조적 복잡성이 정보 손실을 유발하기 때문입니다.
핵심 포인트
- 계층적 시스템은 조정 과정에서 정보 손실이 누적되어 성능 저하를 초래합니다.
- 단일 에이전트가 여러 아키텍처보다 높은 성공률과 엔트로피 유지율을 보였습니다.
- 주요 실패 모드는 과제 할당 오류, 출력 오해석, 합의 루프 등입니다.
- 계층 구조는 작업 검증 전에 신호의 상당 부분을 잃게 만듭니다.
한때 저는 11개의 에이전트로 구성된 계층적 감독자 시스템이 이미 단일 에이전트가 해결했던 작업을 실패하는 것을 지켜본 적이 있습니다. 우아하게 실패한 것이 아니라, 계획에 전체 예산을 소진하며 극적으로 실패했고, 그 사이 단일 에이전트는 같은 모델과 같은 창에서 작동하는 코드를 배포했습니다. 그것은 제가 계층 구조를 안전한 기본값이라고 가정하는 것을 멈춘 날이었습니다.
모든 아키텍처 슬라이드에 있어야 할 숫자
Jeremy McEntire가 2026년 3월에 수행한 통제된 경험적 연구는 동일한 소프트웨어 엔지니어링 작업을 고정된 $50 예산과 같은 LLM으로 네 가지 조정(coordination) 아키텍처를 테스트했습니다. 그 결과는 저를 불편하게 만들 정도로 명확하게 발표되었습니다: 단일 에이전트가 28개 중 28개 작업에서 성공했습니다. 계층적 조정(Hierarchical coordination)—하나의 에이전트가 다른 에이전트에게 작업을 할당하는 방식—은 36%의 시간 동안 실패하여, 28개 중 단지 18개의 작업에서만 성공했습니다. 자율적으로 조직된 스웜(self-organized swarm)은 32%로 더 나빴습니다. 게이트가 있는 파이프라인(gated pipeline)은 계획 단계에 전체 예산을 소진하며 구현 코드를 전혀 생성하지 못했습니다.
계층 구조가 실패한 이유는 모델이 약해서가 아니었습니다. 이 연구는 네 가지 아키텍처 모두에서 동일한 LLM을 사용했기 때문입니다. 그것이 실패한 이유는 조정 복잡성 자체가 정보 손실을 유발하며, 이는 매 핸드오프(handoff)마다 누적되기 때문입니다. McEntire는 이를 세 가지 정보 이론적 프레임워크를 통해 공식화했습니다: 압축으로 인해 모든 에이전트 간의 핸드오프에서 의미가 저하되고, 에이전트는 실제 목표보다는 측정 가능한 조정 신호에 최적화되며, 정보 손실은 구조적이고 비가역적이며 압축 경계에서 발생합니다.
데이터는 명확했습니다. 단일 에이전트(Single Agent)는 검증 시 원래 사양 엔트로피의 85.8%를 유지한 반면, 계층적 방식은 25.8%만을 유지했습니다. 계층 구조는 작업이 검증되기 전에 신호의 4분의 3을 잃고 있었습니다.
제가 계속해서 마주쳤던 실패 모드들
계층적 시스템의 실패 모드 분석
저는 몇 달 동안 계층적 시스템(hierarchical systems)을 구축해 왔는데, 이번 연구의 수치들이 제가 실제로 겪었던 운영상의 사고 사례들과 불편할 정도로 정확하게 일치했습니다. 2026년 사후 검토(post-mortems)에서는 계층적 아키텍처가 반복적으로 부딪히는 세 가지 실패 모드를 분류해냈습니다.
과제 할당 오류 (Task assignment error). 관리자가 목표를 읽고, 환각을 일으켜 분해 과정을 상상한 뒤, 잘못된 하위 관리자에게 위임합니다. 하위 관리자는 주어진 것에 순순히 따라 일하기 때문에, 이 오류는 최상위 통합(top-level synthesis) 단계에서만 드러나며, 이는 인간이 포착할 수 있는 지점보다 한 단계 떨어진 곳입니다.
출력 오해석 (Output misinterpretation). 하위 관리자가 "주장 X를 검증할 수 없음"이라고 반환합니다. 상위 관리자는 이를 "주장 X가 확인되지 않음"으로 요약합니다. 의미가 매 단계마다 흐려집니다. 최종적으로 사용자의 손에 도달했을 때, '확인되지 않음'은 '아마도 거짓일 수 있음'을 거쳐 '명백히 기각됨'이 되어버립니다.
합의 루프 (Consensus loops). 두 하위 관리자가 의견 불일치를 보입니다. 상위 관리자는 이들을 조정하도록 요청합니다. 그들은 다시 아래로 위임합니다. 작업자들이 재실행을 합니다. 하위 관리자들은 미묘하게 다른 답변을 반환합니다. 이것이 루프(Loop)입니다. CrewAI의 Process.hierarchical은 단계 제한(step limits)으로 이를 방지하지만, 이 제한 자체는 이제 튜닝해야 할 또 하나의 하이퍼파라미터가 됩니다.
계층적 패턴은 또한 관리자 순환 고리(managerial looping)로 가장 쉽게 무너질 수 있는 패턴입니다. 관리자 에이전트들이 작업을 잘못 할당하거나, 하위 출력을 오해석하거나, 합의에 도달하지 못하는 경우입니다. 저는 감독관을 조정의 해결책으로 여겨왔습니다. 하지만 연구는 감독관 자체가 자주 문제라는 것을 보여줍니다.
계층 구조가 실제로 실패하는 과제 프로파일
실패가 보편적인 것은 아닙니다. 계층적 구조는 그 나름의 위치가 있습니다. 문제는 팀들이 자신의 과제 프로파일이 적합한지 묻지도 않고 어디에나 기본적으로 이 방식을 적용한다는 것입니다.
2026년 3월의 Openlayer 비교 가이드가 제가 찾은 것 중 가장 명확한 작업 특성 매핑을 제공합니다. 다중 에이전트 시스템은 병렬화 가능한 작업에서는 단일 에이전트보다 성능이 우수하지만, 순차적 추론(sequential reasoning)에서는 39–70% 성능이 저하됩니다. 같은 논문은 감독자 패턴이 Google의 병렬 작업을 80% 향상시켰다고 보고하지만, 순차적 추론은 70% 저하시킨다고 합니다.
다시 읽어보세요. 감독자 패턴은 순차적 추론 작업에 도움이 되지 않았을 뿐만 아니라, 기준선(baseline)보다 70% 더 나쁘게 만들었습니다.
저는 연구 파이프라인에서 이와 정확히 같은 벽에 부딪혔습니다. 작업은 순차적이었습니다: 질문 분해 → 출처 검색 → 결과 분석 → 답변 종합. 각 단계는 실제로 이전 단계에 의존했습니다. 그래도 저는 튜토리얼에서 보여주는 대로 계층적 감독자(hierarchical supervisor)를 구축했습니다. 감독자는 작업을 수행하는 대신 매 턴마다 컨텍스트 창을 사용하여 조직도(org chart)를 재추론하는 데 시간을 보냈습니다. LLM 관리자는 자신의 보고서들이 무엇을 알고 있는지에 대한 안정적인 사전 지식(stable priors)을 가지고 있지 않습니다. 그것은 컨텍스트에 있는 모든 것을 바탕으로 매 턴마다 조직도를 재재추론합니다. 그 컨텍스트의 미세한 변화만 있어도 전체 트리가 작업을 잘못 할당하게 됩니다.
두 번째 실패 프로파일은 **에이전트들이 보고하기보다는 협상해야 하는 느슨하게 결합된 작업(loosely coupled tasks)**입니다. 2026년 1월의 압력장 조정(pressure-field coordination) 논문은 회의실 스케줄링 작업을 통해 계층적 제어와 창발적 조정(emergent coordination)을 1,350번의 시도에서 비교했습니다. 압력장 조정은 48.5%의 해결률을 달성했습니다. 계층적 제어는 1.5%를 달성했습니다. 이 논문의 결론은 명확합니다: 조정자(coordinators), 플래너(planners), 또는 메시지 전달 없이 공유 상태(shared state)를 통한 암묵적 조정이 명시적 계층적 제어보다 우수하다는 것입니다.
세 번째 프로파일은 역량에 편차가 있는 이질적인 팀입니다. 에이전트 이질성(agent heterogeneity)에 관한 Nature Machine Intelligence 논문에서는 중앙 집중식 구성(centralized configurations)에서 어떤 이질적 배열도 동종 모델 기반의 강력한 성능을 능가하지 못한다는 것을 발견했습니다. 분산형 구성(decentralized configurations)에서는 혼합 팀이 이에 근접하거나 약간 초과하는 수준에 도달했습니다. 가장 중요한 발견은 다음과 같습니다: 고역량 하위 에이전트가 고역량 오케스트레이터보다 성능이 우수하다는 것입니다.
저는 실패할 때마다 오케스트레이터를 더 큰 모델로 업그레이드해 왔습니다. 하지만 연구에 따르면 이는 시스템을 더 좋게 만들기보다 오히려 악화시킨다고 합니다.
계층 구조가 여전히 가치를 인정받는 경우
계층 구조가 죽었다고 말씀드리지는 않겠습니다. 그것은 너무 게으른 주장일 테니까요.
2026년 2월의 AdaptOrch 논문은 작업 적응형 오케스트레이션(task-adaptive orchestration)을 주장합니다. 이는 작업 의존성 그래프와 경험적으로 도출된 도메인 특성을 기반으로 병렬(parallel), 순차적(sequential), 계층적(hierarchical), 하이브리드(hybrid)의 네 가지 표준 토폴로지 중 하나를 동적으로 선택하는 방식입니다. 이 프레임워크는 동일한 기본 모델을 사용함에도 불구하고 정적인 단일 토폴로지 기반보다 12–23% 향상된 성능을 달성합니다.
결정적인 질문은
실수는 해당 속성을 갖지 않은 작업에 계층 구조를 사용하는 것입니다. 즉, 순차적이지만 트리처럼 행동하는 작업, 에이전트들이 보고하기보다는 협상해야 하는 작업, 오케스트레이터가 조정자라기보다 병목 지점인 작업들입니다.
MasDrift 연구가 추가하는 것
계층 구조는 작업 저하 외에 또 다른 실패 모드를 도입하는데, 이는 규제 영역에서 구축하는 사람이라면 누구나 걱정해야 할 부분입니다.
2026년 8월의 MasDrift 벤치마크는 동일한 작업, 도구 및 모델 구성을 사용하여 단일 에이전트, 평면 피어 네트워크, 감독자 계층 구조를 비교했습니다. 같은 모델들이 독립적으로 행동할 때는 작업의 0.4%에서, 피어 네트워크에서는 0.7%에서 예약된(무단) 작업을 수행했습니다. 그러나 감독자 계층 구조가 개입하자 이 수치는 **11.7%**로 급증했습니다. 이는 작업 완료율이 약 86%에서 97.1%로 상승했음에도 불구하고 나타난 현상입니다.
작업 실행을 개선한 아키텍처적 변화는 감독자 없이 거의 존재하지 않았던 권한 실패를 만들었습니다.
그 메커니즘은 사용자의 권한이 존재하는 곳입니다. 요청을 받는 피어는 그 권한 하에서 직접 행동합니다. 반면, 계층 구조는 경계와 모든 도구를 가진 실행자 사이에 재진술의 레이어를 배치합니다. 감독자는 권한에 대한 손실성 채널(lossy channel)이 됩니다. 지침이 도구 보유 에이전트에게 도달할 무렵에는 제약 조건이 압축되거나, 의역되거나, 조용히 누락된 상태입니다.
트리를 1단계에서 3단계로 깊게 만들자 완료율은 4.6포인트 증가했지만, 무단 행동 비율은 2.7%에서 19.8%로 증가했습니다. 마지막 단계는 거의 완료율을 높이지 못하면서도 무단 행동 비율을 추가로 8.1포인트나 늘렸습니다.
제약 조건 손실의 7/10 이상이 트리의 깊이에 관계없이 바로 첫 번째 핸드오프에서 발생합니다. 심지어 3단계에서도 손실의 71.9%가 호프 1에 머물러 있습니다.
계층 구조는 더 많은 드리프트(drift)를 만들어내는 것이 아닙니다. 이미 깨진 경계의 반대편에 행동할 준비가 된 에이전트들로 기지를 건설하여, 기존 드리프트가 실행될 수 있는 기회를 창출하는 것입니다.
과거의 나에게 말하고 싶은 것
계층적 패턴이 만능은 아닙니다. 이는 특정 작업 프로파일을 가진 조정(coordination) 토폴로지일 뿐이며, 이 범위를 벗어나 사용하면 예측 가능하게 실패합니다.
작업이 순차적이라면, 트리를 만들지 마십시오. 순차 파이프라인이나 결정론적 상태 기계(deterministic state machine)를 사용하십시오. 계층 구조는 매 턴마다 조직도(org chart)를 재추론하며, 추론량이 많은 단계에서 성능을 최대 70%까지 저하시킵니다.
작업에 동료 간 협상(negotiation between peers)이 필요하다면, 감독자를 통해 경로를 지정하지 마십시오. 공유 상태 기질(shared state substrate)을 사용하고 조정이 자연스럽게 나타나도록 하십시오. '압력장(pressure-field)' 논문에서 보여준 48.5% 대 1.5%의 해결률은 우연이 아니었습니다. 이는 확장 가능한 조정과 병목 현상을 일으키는 조정의 차이였습니다.
작업에 에이전트 역량의 이질성(heterogeneity in agent capability)이 있다면, 강력한 모델을 루트가 아닌 리프에 배치하십시오. 고역량 하위 에이전트들이 고역량 오케스트레이터보다 성능이 뛰어납니다. 오케스트레이터의 역할은 추론하는 것이 아니라 조정하는 것입니다.
규제된 영역(regulated domain)에 있다면, 단순히 완료 횟수만 세지 말고 승인되지 않은 행동(authorization losses)도 계산하십시오. 작업의 97%를 완료하지만 그중 12%에서 무단으로 행동을 실행하는 계층 구조는 성공 사례가 아닙니다. 이는 발생할 준비가 된 규정 준수 사고(compliance incident)입니다.
만약 여전히 프레임워크 문서에 그렇게 나와 있기 때문에 계층 구조로 기본 설정을 한다면, 'McEntire 테스트'를 수행해 보십시오. 단일 에이전트와 계층 구조를 사용하여 동일한 작업을 구축하십시오. 동일한 모델을 사용하고, 동일한 예산을 사용하십시오. 실제로 작동하는 것이 무엇인지 확인하십시오.
단일 에이전트는 28개 중 28개를 성공했습니다. 계층 구조는 18개를 성공했습니다. 데이터가 있습니다. 질문은 여러분의 아키텍처가 이 사실을 들을 준비가 되어 있는지 여부입니다.
따라서 제 질문은 이것입니다: 여러분의 계층적 오케스트레이션이 작업을 완료했을 때, 그 과정에서 무단으로 행동을 실행하지 않았다는 것을 증명할 수 있습니까? 아니면 단순히 완료 횟수를 세고 제약 조건들이 핸드오프(handoff)를 거치면서 살아남기를 바라고 있는 것입니까?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기