스스로 분할하는 궤적: 훈련 단위로서의 에이전트 선언 경계
요약
장기 코딩 에이전트의 학습 효율을 높이기 위해 에이전트가 스스로 행동 경계를 설정하는 '의미론적 자기 분할' 기법을 제안합니다. 에이전트가 자신의 추측에 이름을 붙임으로써 실패와 수정 과정을 명확히 구분하고, 이를 통해 고품질의 지도 학습 데이터를 생성할 수 있음을 입증했습니다.
핵심 포인트
- 에이전트가 스스로 행동의 경계를 선언하여 의미론적 단계를 구분함
- 기존의 고정 윈도우 방식보다 정교한 학습 단위(credit units) 제공
- 실패 후 수정 과정을 포함한 4가지 지도 학습 대상 확보 가능
- DPO 적용 시 모델의 의사결정을 올바른 방향으로 개선하는 효과 확인
장기적 코딩 에이전트(Long-horizon coding-agent) 궤적은 학습에 사용할 수 있는 신용 단위(credit units)와 제대로 일치하지 않습니다. 단일 행동(single action)은 안정적인 가치를 갖지 못하며, 에피소드 레이블(episode label)은 생산적인 탐색과 포기된 방향을 하나로 합쳐버리고, 고정된 윈도우(fixed window)는 로깅 메커니즘이 끊기는 지점에서 잘라버립니다. 우리는 수집 시점의 의미론적 자기 분할(semantic self-segmentation)을 도입하며, 여기에서 선언적 계약(declarative contract)을 통해 행동하는 에이전트가 궤적이 생성되는 동안 자신의 경계를 스스로 드러내도록 합니다. 반증 가능한 인과적 가설(falsifiable causal hypotheses)로 구체화된 연속적인 채택은 가변 길이의 의미론적 단계(semantic phases)를 드러내며, 어떠한 마일스톤 어휘(milestone vocabulary), 골드 패치(gold patch), 환경 리플레이(environment replay), 교사 로짓(teacher logits), 또는 사후 분할기(retrospective segmenter)도 경계를 설정하지 않습니다. 에이전트가 자신의 추측(conjecture)에 이름을 붙이기 때문에, 검토자는 그 이름을 통해 이를 부정할 수 있으며, 이를 통해 우리의 프로토콜은 기록된 작업에는 거의 포함되지 않는 '잘못된 원인 후 수정(wrong-cause-then-correction)' 전환을 제조할 수 있습니다. 즉, 한 번의 수집으로 에피소드 레이블이 버리는 정확히 실패한 영역으로부터의 감사 감독(audit supervision)을 포함하여 4개의 지도 학습 대상(supervised targets)을 얻을 수 있습니다. 그런 다음 우리는 선언(declaration)을 삭제했을 때 무엇이 살아남는지 질문합니다. 절단 지점(cut points)은 유지하되 가설(hypothesis)은 주지 않았을 때, 모델은 행동 블록을 지배적인 가설에 2배 이상의 확률로 할당하며, 이는 동일한 궤적에서 동일한 길이의 블록을 할당하는 것보다 뛰어난 성능을 보입니다(paired sign test $p = 0.0002$). 이는 어휘 제어(lexical control)를 견뎌내고 레이블 순열(label permutation) 하에서는 무너집니다. 반대로 경계를 설정하라는 요청을 받았을 때, 코드에 눈먼 주석가(code-blind annotator)는 무작위 배치가 11.5개를 맞추는 것에 비해 40개 중 24개를 일치시켰으며, 기계적인 테스트 이벤트 규칙(mechanical test-event rule)은 엄격함에서 허용적임까지의 스윕(sweep) 과정 중 어느 끝에서도 우연을 넘어선 성능을 보이지 못했습니다. 따라서 이 세그먼트(segments)들은 일관성이 있으며 저렴하게 복제될 수 있는 것이 아닙니다. 다운스트림(Downstream) 작업에서, 2,551개의 단계 경계(phase-boundary) 쌍에 대한 DPO는 91개의 적대적 홀드아웃(adversarial held-out) 항목에 대해 어떠한 결정도 바꾸지 않은 반면, 60개 중 4개의 항목은 일치하는 구성 항목(matched-construction items)에서 변경되었으며, 이들은 모두 틀린 것에서 옳은 것으로 바뀌었습니다. 반면 두 개의 대조군(controls)은 아무것도 바꾸지 못했습니다. 한 생성기에서 얻은 1,825개의 쌍을 고려할 때, 다음에 변화시켜야 할 변수는 경계가 아니라 코퍼스 다양성(corpus diversity)입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기