
에이전트 하네스 스케일링: EFC는 R2 0.99 대 0.42의 성공을 예측한다
요약
새로운 연구인 Effective Feedback Compute(EFC)는 에이전트의 성공 여부를 예측할 때 단순 토큰 수보다 유효한 피드백의 질이 중요함을 입증합니다. EFC를 활용해 연산 자원을 재할당하면 동일 예산 내에서 성공률을 0.27에서 0.90까지 대폭 높일 수 있습니다.
핵심 포인트
- EFC는 에이전트 성공 예측력을 R2 0.42에서 0.99로 향상시킴
- 단순 토큰/도구 호출량은 에이전트 실패의 33-42%만 설명함
- 자원 재할당을 통해 동일 컴퓨팅 비용으로 성공률을 약 3배 높임
- 에이전트 스케일링의 핵심은 볼륨이 아닌 피드백의 질임
새로운 연구는 Effective Feedback Compute (EFC)를 소개하며, 이는 원시 토큰 (raw tokens)의 R2 0.42 대비 에이전트 성공을 R2 0.99로 예측합니다. EFC를 통한 연산 자원 (compute) 재할당은 동일한 예산 내에서 성공률을 3배 높입니다.
Effective Feedback Compute (EFC)는 원시 토큰 수의 0.33-0.42 대비 에이전트 하네스 (agent harness) 성공을 R2 0.99로 예측합니다. @omarsar0가 공유한 새로운 연구에서 소개된 이 지표는 에이전트가 실제로 행동할 수 있는 피드백만을 계산합니다.
주요 사실
- EFC는 원시 수치(raw counts)의 0.33-0.42 대비 R2 0.99의 성공을 예측합니다.
- 재할당을 통해 동일한 연산 자원 (compute)에서 성공률을 0.27에서 0.90으로 높입니다.
- 원시 토큰/호출 (token/call) 수치는 에이전트 실패의 33-42%만을 설명합니다.
- 이 지표는 에이전트가 실제로 행동할 수 있는 피드백만을 계산합니다.
대부분의 에이전트 하네스 튜닝 (agent harness tuning)은 모든 토큰과 도구 호출 (tool call)을 동일하게 가치 있는 것으로 취급합니다. AI 연구자 @omarsar0가 공유한 새로운 연구는 이러한 가정이 틀렸음을 입증하며, 더 나은 좌표를 제시합니다.
이 연구는 에이전트가 실제로 행동할 수 있는 피드백만을 계산하는 지표인 **Effective Feedback Compute (EFC)**를 제안합니다. @omarsar0에 따르면, 원시 토큰 및 도구 호출 수는 에이전트 실패를 R2 0.33에서 0.42 수준으로만 설명합니다. EFC는 이를 0.99까지 끌어올립니다.
이것이 시사하는 바는 구조적입니다. 원시 볼륨 (raw volume) 대신 유용한 피드백을 기준으로 예산을 책정하면, 재할당만으로도 동일한 연산 자원 (compute)에서 성공률을 0.27에서 0.90으로 높일 수 있습니다. 이는 하네스 설계를 추측의 영역에서 예측 가능한 영역으로 바꿉니다.
이것이 보도 자료가 시사하는 것보다 더 중요한 이유: 이 발견은 AI 스케일링 (scaling) 전반에 걸친 패턴을 반영합니다. 즉, 원시 연산 스케일링 (raw compute scaling, 더 많은 토큰, 더 많은 호출)은 수확 체감의 법칙을 따릅니다. Chinchilla 스케일링 법칙 (scaling laws)이 토큰 수만으로는 언더피팅 (underfit)이 발생함을 보여주었고, Kaplan et al. 2020이 연산 최적화 훈련 (compute-optimal training)을 보여주었듯이, EFC는 에이전트 평가를 볼륨의 문제가 아닌 피드백의 질 (quality-of-feedback) 문제로 재정의합니다. R2가 0.42에서 0.99로 도약한 것은 점진적인 변화가 아닙니다. 이는 에이전트 벤치마킹 (agent benchmarking) 분야 전체가 잘못된 변수를 측정해 왔음을 시사합니다.
빌더들을 위한 실질적인 시사점: 만약 현재 귀하의 에이전트 하네스 (agent harness)가 총 도구 호출 (tool calls) 횟수나 토큰 처리량 (token throughput)을 최적화하고 있다면, 가치가 낮은 피드백 루프 (feedback loops)에 컴퓨팅 자원을 과다하게 할당하고 있을 가능성이 높습니다. EFC 기반의 예산 책정 (budgeting)으로 전환하면 컴퓨팅 비용을 늘리지 않고도 성공률을 거의 4배 가까이 향상시킬 수 있습니다. 이 논문은 기존 로그로부터 EFC를 계산할 수 있는 프레임워크를 제공하므로, 이러한 변화를 소급 적용할 수 있습니다.
원문에서 강조되지 않은 한계점: 원문 트윗과 연결된 논문은 테스트된 에이전트 아키텍처 (agent architectures), 작업 도메인 (task domains), 또는 EFC가 도구 사용 (tool-use), 코드 생성 (code generation), 웹 네비게이션 (web navigation) 에이전트 전반에 걸쳐 일반화될 수 있는지 여부를 공개하지 않았습니다. $R^2$ 0.99라는 수치는 매우 놀랍지만, 다양한 하네스 (harnesses)에 걸친 재현 (replication)이 필요합니다. 또한 해당 연구를 진행한 기업명도 밝혀지지 않았습니다.
핵심 요약 (Key Takeaways)
- 새로운 연구는 유효 피드백 컴퓨팅 (Effective Feedback Compute, EFC)을 소개하며, 이는 생토큰 (raw tokens)의 $R^2$ 0.42 대비 0.99의 에이전트 성공률을 예측합니다.
- EFC에 따라 컴퓨팅 자원을 재할당하면 동일한 예산 내에서 성공률을 3배 높일 수 있습니다.
주목해야 할 점 (What to watch)

다양한 에이전트 하네스 (예: SWE-Bench, WebArena, ToolBench)에 걸친 EFC 재현 연구를 주목하십시오. 만약 $R^2$ 0.99가 여러 도메인에서 유지된다면, 에이전트 평가 논문들이 컴퓨팅 예산을 보고하는 방식의 변화와 하네스 설계의 새로운 산업 표준을 기대할 수 있을 것입니다.
원문은 gentic.news에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기