
핸드오프 문제: 멀티 모델 AI 파이프라인이 양질의 연구를 조용히 오염시키는 이유
요약
멀티 모델 AI 파이프라인에서 모델 간 데이터 전달(handoff) 시 발생하는 정보 왜곡과 인식론적 실패 문제를 다룹니다. 단순한 산문 형태의 전달 대신, 증거와 범위를 포함한 구조화된 스키마를 통해 데이터의 무결성을 유지하는 방안을 제시합니다.
핵심 포인트
- 모델 간 핸드오프 시 발생하는 '깨진 주장 계보' 문제 경고
- 자유 형식의 산문 대신 구조화된 전송 계약(Transfer Contract) 필요
- 주장, 근거, 범위 등을 포함한 스키마 기반의 데이터 전달 권장
- 작성 모델이 증거의 의미(semantics)를 변경하지 못하도록 규율 설정
가상적이지만 대표적인 핸드오프(handoff) 사례를 생각해 봅시다. 하나의 연구 모델(research model)이 신중한 발견을 내놓습니다. 즉, 통제된 환경의 특정 데이터셋에서 관찰된 연관성이며, 테스트된 도메인을 넘어선 일반화는 제한적이라는 내용입니다. 인과관계가 아닌 상관관계이며, 확정된 결과가 아닌 프리프린트(preprint) 단계의 결과입니다.
그런 다음 작성 모델(writing model)이 압축된 요약을 전달받아 깔끔한 문장을 만들어냅니다: "연구에 따르면 X는 Y의 원인이 된다."
어떠한 오류도 발생하지 않았습니다. JSON은 파싱되었고, 다음 단계가 실행되었습니다. 산문(prose)은 매끄럽게 읽힙니다. 하지만 그 문장은 원문이 그렇지 않았던 방식과 달리 이제 틀린 내용이 되었습니다. 핸드오프는 구문론적(syntactically)으로는 성공했지만, 인식론적(epistemically)으로는 실패했습니다.
그 간극이 바로 여기서 다루고자 하는 주제입니다. 모델 선택(model selection)이나 프롬프트 엔지니어링(prompt engineering), 혹은 이번 분기에 어떤 벤더가 가장 똑똑한 추론기(reasoner)를 보유했는지에 대한 문제가 아닙니다. 더 조용한 문제는 깨진 주장 계보(broken claim lineage)입니다. 증거가 검사 가능한 구조(inspectable structure)가 아닌 설득력 있는 산문(persuasive prose)의 형태로 모델 경계를 넘나드는 것입니다.
만약 당신이 멀티 모델 파이프라인(multi-model pipelines)을 구축한다면, 이것은 재현성(reproducibility) 문제입니다. 따라서 진단을 내리기 전에 해결책을 먼저 제시하겠습니다.
사전 정의된 전송 계약 (The transfer contract)
만약 단계 간의 인터페이스(interface)에서 가치가 유출된다면, 그 인터페이스는 스키마(schema)를 가질 자격이 있습니다. 실질적인 버전은 다섯 가지 필드를 가진 주장 수준의 기록(claim-level record)입니다:
claim: "..."
evidence: "소스 URL + 정확한 근거"
scope: "대상 집단, 작업, 모델, 관할권, 날짜"
...
도움이 된다면 counterevidence(반대 증거), status(상태), 또는 requires_review(검토 필요)를 추가하십시오. 핵심은 이 정확한 YAML 형식이 아니라 규율(discipline)을 갖추는 것입니다. 이 다섯 가지 필드 스키마는 저의 증거 기반 제안일 뿐, 표준화되었거나 실험적으로 검증된 형식이 아닙니다. 증거가 뒷받침하는 근본적인 아이디어는 통제된 환경에서 구조화된 전송(structured transfer)이 자유 형식의 산문(free-form prose)보다 더 많은 것을 보존한다는 것이지, 이 특정 키(key) 세트가 아닙니다.
이것이 작동하게 만드는 규칙은 분업(division of labor)입니다. 작성 모델(writing model)은 언어와 구조를 자유롭게 바꿀 수 있는데, 이는 재진술(rephrasing) 자체가 그 모델이 존재하는 이유이기 때문입니다. 하지만 해당 모델이 해서는 안 되는 일은 증거의 '의미(semantics)'를 바꾸는 것입니다. 초안에는 나타나지만 원장(ledger)에는 없는 새로운 사실적 주장(factual claim)이 나타나면, 그것이 유지되기 전에 다시 연구(research) 단계로 되돌아가야 합니다.
그럼에도 불구하고 팀들이 이러한 파이프라인을 구축하는 이유
멀티 모델(multi-model) 시스템이 실수라고 결론 내리는 것은 쉽지만 잘못된 판단입니다. 이 시스템들은 구체적인 이유로 매력적입니다. 진정한 의미의 병렬 탐색(parallel exploration)을 수행할 수 있고, 전문 모델을 전문 작업에 할당할 수 있으며, 각 단계에 고유한 컨텍스트 윈도우(context window)와 도구를 부여할 수 있고, 단일 패스(single pass)가 허용하는 것보다 어려운 문제에 더 많은 총 추론(inference) 노력을 투입할 수 있기 때문입니다.
Anthropic의 엔지니어링 팀은 리드 연구자(lead researcher)가 서브 에이전트(subagents)에게 업무를 위임하고, 각 서브 에이전트가 발견 사항을 리드의 컨텍스트로 압축하여 전달하는 정보 필터 역할을 수행하는 프로덕션 연구 시스템을 구축했다고 설명했습니다. 그들은 여러 독립적인 검색 방향이 동시에 실행될 수 있는 너비 우선(breadth-first) 연구 작업에서 내부적인 이득을 보고했다고 밝혔습니다. 이는 실제적인 장점이며, 결점을 찾기 시작하기 전에 언급할 가치가 있습니다.
하지만 대가가 따릅니다. Anthropic의 보고에 따르면, 자사의 멀티 에이전트(multi-agent) 시스템은 일반적인 채팅보다 약 15배 더 많은 토큰(tokens)을 사용했습니다. 또한 밀접하게 결합된(tightly coupled) 작업에는 적합하지 않으며, 모호한 위임은 조정 실패(coordination failures)를 초래한다는 사실도 발견했습니다. 이는 산업 표준(industry benchmark)이 아니라 Anthropic이 자체 시스템과 데이터를 통해 얻은 내부 결과입니다. 그러나 이러한 트레이드오프(trade-off)의 형태는 시사하는 바가 큽니다. 전문화(specialization)는 병렬성과 깊이를 얻는 대신, 비용과 조정 리스크(coordination risk)를 대가로 지불하게 합니다.
문제는 전문화를 할 것인가 말 것인가가 아닙니다. 연결 부위(seams)에서 진실이 변질되지 않도록 하면서 어떻게 전문화할 것인가 하는 점입니다.
핸드오프(handoff)는 정보 병목 현상이다
위임된 시스템(delegated systems)에 대한 의사결정 이론적 분석(decision-theoretic analysis)에서 도출한 유용한 관점이 여기 있습니다. 한 기술 프리프린트(technical preprint)에서, Ao, Gao, 및 Simchi-Levi는 멀티 에이전트 계획(multi-agent planning)을 통신 네트워크로 모델링하며, 새로운 외생적 신호(exogenous signals)가 없는 한, 추가적인 단계들은 단지 동일한 기저의 증거(underlying evidence)를 재구성할 뿐이라고 주장합니다. 모델의 릴레이(relay)는 동일한 정보를 가진 단일 중앙 집중식 의사결정자(centralized decision maker)가 달성할 수 있는 범위 내로 제한됩니다. 단계를 추가한다고 해서 사실(facts)이 추가되지는 않습니다.
이러한 재정의는 파이프라인 설계 시 혼동하기 쉬운 세 가지 요소를 분리합니다:
- 시스템에 유입되는 새로운 증거 (New evidence entering the system) — 검색 호출(retrieval call), 도구 결과(tool result), 새로운 소스. 이는 시스템이 알고 있는 것을 진정으로 확장합니다.
- 동일한 증거가 다시 쓰여지는 것 (The same evidence being rewritten) — 요약의 요약. 이는 지식이 아닌 표현(wording)을 바꿉니다.
- 증거를 바탕으로 실제로 검증하는 것 (Verification that actually checks against evidence) — 주장을 자신의 유창함(fluency)이 아닌 소스(source)와 비교하는 것.
대부분의 "에이전트를 하나 더 추가하자"는 본능은 첫 번째 범주처럼 느껴지면서도 실제로는 두 번째 범주에 속합니다. 만약 모든 단계가 동일한 원본 자료의 변형된 버전을 보게 된다면, 핵심적인 설계 문제는 지능(intelligence)이 아니라 보존(preservation)입니다. 즉, 압축 과정에서 무엇이 살아남고, 무엇이 조용히 탈락하는가의 문제입니다.
동일한 저자들은 통제된 실험에서 자유 형식의 릴레이(free-form relay) 조건은 의사결정에 유의미한 정보를 손실한 반면, 더 구조화된 사후 확률 스타일(posterior-style)의 메시지 형식은 더 많은 정보를 보존했다고 보고했습니다. 이는 통제된 객관식 과제이며, 결과는 논문의 형식적 가정(formal assumptions)에 근거하므로, 이를 실제 배포된 시스템에 대한 측정된 보증이라기보다는 설계 관점(design lens)으로 취급하십시오. 관점으로서 이 이론은 유효합니다. 단계 사이의 인터페이스(interface)가 단계 그 자체보다 더 많은 역할을 수행합니다. 이것이 바로 위의 YAML 형식이 수고를 들일 가치가 있는 정확한 이유입니다.
아무도 거짓말을 하지 않는데 연구가 변질되는 방식
이 중 그 어떤 것도 모델이 환각 (Hallucination)을 일으킬 필요를 요구하지 않습니다. 이러한 실패는 대부분 평범한 전송 손실 (Transfer losses)입니다. 에이전트 간 메시지 오류에 관한 프리프린트인 AgentAsk에서 제안된 엣지 레벨 (Edge-level) 카테고리와 저의 편집적 종합을 바탕으로, 여러분이 감사 (Audit)할 수 있는 실무적인 분류 체계 (Taxonomy)를 다음과 같이 제시합니다:
- 데이터 격차 (Data gap). 필수적인 사실이나 주의 사항이 경계를 넘지 못함. (AgentAsk의 용어)
- 신호 오염 (Signal corruption). 전송 과정에서 숫자, 수식어, 또는 인용 (Citation)이 변경됨. (AgentAsk의 용어)
- 지시 대상 표류 (Referential drift). "이 연구" 또는 "그들"이 더 이상 의도된 출처를 가리키지 않음. (AgentAsk의 용어)
- 범위 인플레이션 (Scope inflation). 좁은 관찰 결과가 일반적인 주장으로 변함. (AgentAsk의 용어가 아닌 저의 종합)
- 검증 연극 (Verification theater). 검토자 (Reviewer)가 증거의 일치성 대신 유창성이나 형식을 확인함. (저의 종합)
앞의 세 가지는 AgentAsk의 것이며, 마지막 두 가지는 글쓰기 파이프라인 (Writing pipelines)에서 관찰되는 패턴에 대해 제가 붙인 편집적 라벨입니다. 범위 인플레이션 (Scope inflation)은 이 글을 쓰게 만든 사례입니다. 제한적이었던 발견이 제한 없는 주장으로 변하며, 문장은 충실도가 떨어질수록 오히려 더 "깔끔해"집니다.

주장은 덜 충실해지는 반면 문장은 더 깔끔해질 수 있습니다. 구조화된 기록은 이러한 손실을 가시화합니다.
이러한 전이 실패(transfer failures)가 이야기의 전부는 아니지만, 더 광범위한 흔적 증거(trace evidence)와 일치합니다. NeurIPS 2025 Datasets and Benchmarks Track에 채택된 MAST 멀티 에이전트 실패 분류 체계 (MAST taxonomy of multi-agent failures)는 7개의 프레임워크에 걸쳐 주석이 달린 1,642개의 실행 흔적(execution traces)을 분석하였으며, 시스템 설계, 에이전트 간 불일치(inter-agent misalignment), 작업 검증(task verification)에 걸친 14가지 실패 모드(failure modes)를 식별했습니다. 에이전트 간 모드 중에는 명확화 실패(failure to clarify), 정보 은닉(information withholding), 입력 무시(ignored input), 추론-행동 불일치(reasoning-action mismatch)가 있었습니다. 검증 모드 중에는 불완전하고 부정확한 검증(incomplete and incorrect verification)이 있었습니다.
두 가지 솔직한 주의 사항이 있습니다. 대규모 주석의 상당 부분은 보정된 LLM 주석가(LLM annotator)에 의해 생성되었습니다(인간 주석자 간 일치도는 κ=0.88이었으며, LLM 주석가는 인간 대비 κ=0.77로 보정됨). 또한 보고된 프레임워크 실패율은 서로 다른 벤치마크를 사용하므로 명시적으로 직접 비교할 수 없습니다. 백분율은 데이터셋별 특성일 뿐, 보편적인 실패 확률이 아닙니다. 중요한 점은 더 똑똑한 베이스 모델(base model)만으로는 해결할 수 없는 실패가 반복된다는 것이며, 이는 시스템 설계, 조정(coordination), 그리고 검증에 뿌리를 두고 있기 때문입니다.
더 많은 추론이 반드시 더 안전한 것은 아니다
유혹적인 해결책은 더 많은 숙고(deliberation)가 진실로 수렴한다는 이론에 근거하여, 모델이 각 단계에서 더 많은 추론(reasoning)을 교환하도록 하는 것입니다. 때로는 효과가 있지만, 그 효과가 항상 신뢰할 수 있는 것은 아닙.
오류 전파의 런타임 모니터링에 관한 프리프린트(preprint)에서는 사이버 보안, 머신러닝 (Machine Learning), 네트워킹 (Networking) 전반의 퀴즈 서브셋에 대해 모델들이 추론 흔적 (reasoning traces)을 교환할 때 어떤 일이 발생하는지 측정했습니다. 페어링된 추론 (Paired reasoning)은 종종 정확도를 향상시켰지만, 모든 곳에서 그런 것은 아니었습니다. 한 네트워킹 조건에서는 교환 후에 한 모델의 정확도가 감소했으며, 일부 설정에서는 추가된 추론이 수정된 것보다 더 많은 오류를 유발했습니다. 이것은 객관식 서브셋에 관한 6페이지 분량의 프리프린트이므로, 여기서 보편적인 비율을 추출하지는 마십시오. 방어 가능한 핵심 논점은 다음과 같습니다: 추가적인 추론은 또 다른 입력값일 뿐, 진실을 보장하는 것이 아닙니다.
더 중요해 보이는 것은 불확실성 (uncertainty)이 어떻게 전달되느냐 하는 것입니다. 에이전트 토론에서의 불확실성 전달에 관한 프리프린트인 DebUnc는 불확실성을 통합하기 위한 어텐션 기반 (attention-based) 방식이 테스트된 접근 방식 중 벤치마크 전반에 걸쳐 표준 토론 (standard debate)과 일관되게 일치하거나 이를 능가하는 유일한 방식이었으며, 불확실성 추정치가 개선됨에 따라 그 이점도 커진다는 것을 발견했습니다. 이 특정 방법은 오픈 소스 모델에 대한 접근과 코드 수정이 필요하므로, 많은 독점 API (proprietary APIs)에는 적용할 수 없습니다. 그럼에도 불구하고, 이 방향은 유념할 가치가 있습니다: 불확실성은 다음 단계로 넘어가기 전에 매끄럽게 다듬어 없애야 할 노이즈가 아닙니다. 그것은 다음 단계가 필요로 하는 데이터이며, 계약 (contract)의 uncertainty 필드에 포함되어야 합니다.
메커니즘은 이미 존재합니다
구조화된 전달 (Structured transfer)은 이미 관련 메커니즘을 갖추고 있는 설계 선택지이지만, 그 메커니즘만으로는 아무것도 증명할 수 없습니다. OpenAI Agents SDK handoff documentation (v0.18.3 기준)을 살펴보면, 구조화된 핸드오프 인자 (handoff arguments)를 위한 input_type과 수신 에이전트 (receiving agent)가 보게 될 내용을 제어하는 input_filter/history 컨트롤을 제공하며, 모델이 생성한 메타데이터 (metadata)와 애플리케이션 상태 (application state)를 명시적으로 구분합니다. 이것들은 핸드오프를 제어하기 위한 메커니즘입니다. 하지만 이것이 특정 핸드오프 설계가 사실적 정확도 (factual accuracy)를 향상시킨다는 증거는 아닙니다. 무엇이 경계를 넘을지 여전히 결정해야 하며, SDK는 단지 문을 제공할 뿐입니다.

모델을 전문화하고, 주장 계보 (claim lineage)를 보존하며, 최종 결과를 익명으로 검증하십시오.
경계에서 명확히 하고, 초안 작성 후 감사하십시오
두 가지 제어 루프 (control loops)가 서로 다른 시점에 도움이 됩니다.
첫 번째는 경계에서의 명확화 (clarification)입니다. AgentAsk는 오케스트레이션 (orchestration)을 재설계하지 않고도 에이전트 간 메시지 경계에 학습된 명확화 도구 (clarifier)를 추가했으며, 5개의 벤치마크와 4개의 프레임워크에 걸쳐 프레임워크 수준의 평균이 약 3.293.45 퍼센트 포인트 향상되었다고 보고했습니다. GPT-5 명확화 도구의 경우 약 4.404.69 포인트에 도달했습니다. 이는 저자들이 벤치마크 작업(수학, QA, 코드)에 대해 발표한 프리프린트 (preprint) 결과이며, 개방형 연구 글쓰기에 대한 결과는 아닙니다. 또한 명확화 도구가 모델 자체의 내재적 오류를 수정할 수는 없습니다. 전이 가능한 습관은 간단합니다. 핸드오프가 모호하거나 불완전할 때, 가정하기 전에 질문하십시오.
두 번째 루프는 초안이 존재한 후에 실행됩니다. 즉, 완성된 산문을 결과물이 아닌 용의자로 취급하는 전용 증거 감사 (evidence audit)입니다.
- 모든 실질적인 문장을 원장 항목 (ledger entry)으로 다시 매핑합니다;
- 뒷받침하는 항목이 없는 모든 문장에 플래그를 표시합니다;
- 각 인용 (citation)이 연결된 정확한 주장 (claim)을 가리키는지 확인합니다;
- 누락된 주의 사항 (caveats) 및 범위 (scope)를 복구합니다;
- 해결되지 않은 모든 사항은 인간에게 에스컬레이션 (escalate)합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기