PoTRE: 인지적 이질성(Cognitive Heterogeneity)에서 영감을 얻은 테스트 시간 추론(Test-Time Reasoning)
요약
PoTRE는 인지적 이질성을 활용하여 LLM의 복잡한 추론 능력을 향상시키는 새로운 프레임워크입니다. 네 가지 특화된 에이전트와 적응형 집계 계층을 통해 장기 계획 및 오류 수정 문제를 해결하며, 주요 벤치마크에서 SOTA 성능을 기록했습니다.
핵심 포인트
- 인지적 이질성을 기반으로 한 4가지 특화 에이전트 구조 제안
- HLE 벤치마크에서 49.92%의 SOTA 정확도 달성
- 동질적 모델 대비 적은 추론 토큰으로 향상된 성능 입증
- 작업 적응형 집계 계층을 통한 동적 관점 조정
대규모 언어 모델(LLMs)은 많은 작업에서 뛰어난 성능을 보이지만, 장기적인 계획(long-horizon planning)과 반복적인 오류 수정(iterative error correction)이 필요한 복잡한 추론에서는 자주 어려움을 겪습니다. 더욱이, 표준적인 단일 스트림 프롬프팅(single-stream prompting)은 모델이 새로운 추상화나 엄격한 도메인 제약 조건에 직면했을 때 취약하다는 것이 증명되었습니다. 우리는 추론을 네 가지 에이전트로 분리하는 이질적 프레임워크인 PoTRE (Poly-Topological Reasoning Ensembles)를 소개합니다: (1) 적대적 정제 에이전트 (Adversarial Refinement Agent), (2) 계층적 전략적 계획 에이전트 (Hierarchical strategic Planning Agent), (3) 스펙트럼 탐색 에이전트 (Spectrum Search Agent), 그리고 (4) 직접 체인 에이전트 (Direct Chain Agent). 최종적인 작업 적응형 집계 계층 (Task-Adaptive Aggregation Layer)은 최종 후보 선택, 의미론적 합성(semantic synthesis), 또는 신경-기호 검증(neuro-symbolic verification)을 통해 이러한 관점들을 동적으로 조정하여 견고한 글로벌 솔루션을 생성합니다. 우리는 세 가지 최첨단 벤치마크인 ARC-AGI-2, Humanity's Last Exam (HLE), 그리고 PRBench Finance에서 PoTRE를 평가합니다. PoTRE는 HLE에서 49.92%의 최첨단(state-of-the-art) 정확도를 달성하며 이전의 최고 공식 점수를 넘어섰습니다. 우리는 이러한 구조적 이질성이 대규모로 확장된 동질적(homogeneous) 베이스라인들과 비교했을 때, 유사하거나 더 적은 추론 토큰(inference tokens)을 사용하면서도 향상된 추론 성능을 달성함을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기