수정된 추론으로부터 학습하기: 근본 원인 기반 온-정책 증류
요약
본 논문은 온-정책 자가 증류(OPSD)의 한계점인 추론 불일치와 증류 함정을 해결하기 위해 근본 원인 기반 온-정책 증류(RC-OPD)를 제안합니다. RC-OPD는 학생 자신의 추론 수정을 활용하여 특정 오류에 초점을 맞추고, 유효한 진행을 기반으로 안내를 제공하는 것이 특징입니다. 이 방법은 실패 시도에서 가장 이른 실질적 오류를 찾아 국소적인 수정과 앵커 기반 증류를 통해 성능 향상을 입증했습니다.
핵심 포인트
- RC-OPD는 추론 불일치와 증류 함정 문제를 해결합니다.
- 학생의 자체 수정 능력을 활용하여 오류에 집중적으로 지도합니다.
- 실패 시도에서 가장 이른 실질적 오류를 찾아 국소적인 수정을 개발합니다.
- 앵커 기반 증류로 유효한 진행을 지원하며 성능 향상을 보였습니다.
온-정책 자가 증류(On-policy self-distillation, OPSD)는 참고 해답을 특권적인 회고 지식으로 사용하여 학생이 생성한 추론 궤적을 지도합니다. 그러나 참고 기반의 안내는 학생 자신의 추론이 왜 실패했는지 다루지 않으면서 올바른 해답을 설명할 수 있습니다. 제공된 안내와 필요한 수정 사이의 이러한 추론 불일치는 학생이 자신의 추론 오류를 해결하지 않은 채 올바른 결론을 빌리도록 장려할 수 있습니다. 더욱이, 궤적 전체에 걸쳐 동일한 회고 지식을 적용하는 것은 증류 함정(distillation trap)의 위험을 초래할 수 있으며, 여기서는 유효한 추론에 대한 불필요한 제약 조건이 실질적인 오류 수정과 경쟁하게 됩니다. 이러한 문제들을 해결하기 위해, 우리는 학생 자신의 추론 수정을 사용하여 특정 오류를 다루는 동시에 유효한 진행을 기반으로 하는 안내를 제공하는 근본 원인 기반 온-정책 증류(Root-Cause-Guided On-Policy Distillation, RC-OPD)를 제안합니다. 각 실패 시도에 대해, RC-OPD는 가장 이른 실질적 오류를 찾아 국소적인 수정을 개발하고, 수정된 중간 결과를 유효한 접두사의 앵커로 사용합니다. 반복적인 진단--수정--계속 과정은 학생의 계속을 통해 수정을 테스트하여 고정된 수정 예산 내에서 추가 오류를 식별합니다. 올바른 답에 도달하는 수정 체인에 대해, 근본 원인 기반 증류는 실패 진단과 교정 목표를 사용하여 오류가 있는 부분을 지도하고, 앵커 기반 증류는 수정된 중간 결과로 이어지는 추론 체인을 통해 해당 유효한 접두사를 지원합니다. 우리는 여러 데이터셋과 모델 규모에 걸쳐 RC-OPD를 평가했습니다. 광범위한 실험 및 분석은 이것이 추론 불일치와 증류 함정을 완화하여 상당한 성능 향상을 가져온다는 것을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기