New Fellows Research: Claude가 다른 AI를 자율적으로 정렬할 수 있을까?
요약
Anthropic은 Claude가 자체적으로 다른 AI 모델의 정렬(alignment)을 개선할 수 있는지 연구했습니다. 48시간 동안 Claude에게 GPU와 시간을 제공하여 안전성 벤치마크를 '언덕 오르기' 방식으로 개선하게 했고, 그 결과 성능 저하 없이 신뢰성 있게 안전 점수를 높이는 데 성공했습니다.
핵심 포인트
- Claude가 자체적으로 모델의 정렬을 개선하는 능력을 보여주었습니다.
- 안전성 벤치마크를 '언덕 오르기' 방식으로 효과적으로 개선했습니다.
- 개선된 방법들은 별도의 벤치마크와 더 큰 모델에도 일반화되었습니다.
- Sonnet이 Opus 초기 체크포인트에 사후 학습을 진행하여 높은 안전 점수를 달성했습니다.
We gave Claude 48 hours and 1 GPU to improve the alignment of small models. It researched and proposed methods, then trained and tested the models on its own. It worked surprisingly well.
Claude는 기만(deception)이나 아첨(sycophancy)과 같은 일반적인 미정렬 문제를 해결하기 위해 안전성 벤치마크를 '언덕 오르기(hill-climbed)' 방식으로 개선했으며, 한 가지 제약 조건이 있었습니다. 바로 일반적인 능력을 유지해야 한다는 것이었습니다.
저희는 이후 이 모델의 최고의 방법들을 별도로 보관된(held-out) 벤치마크에 테스트하여 일반화되는지 확인했습니다.
10가지 정렬 실패 사례 전반에 걸쳐, Claude는 성능을 저하시키지 않으면서 안전 점수를 신뢰성 있게 개선했습니다.
또한 그 최고의 방법들은 아직 최적화하지 않은 벤치마크인 Petri 행동 감사(behavioral audit)와 최대 4.7배 더 큰 모델에도 일반화되었습니다.
과연 어느 날 모델이 자신의 더 강력한 후속 모델들을 정렬할 수 있을까요?
첫 번째 테스트로, 저희는 Sonnet 5가 더 유능한 모델인 Opus 4.8의 초기 체크포인트에 사후 학습(post-train)을 진행하게 했습니다. 이 모델은 전체 정렬 훈련을 거친 실제 Opus 4.8에 근접하는 안전 점수에 도달했습니다.
Claude는 측정 가능한 미정렬 문제를 신뢰성 있게 수정할 수 있습니다. 하지만 미묘하거나 희귀한 실패 사례는 아예 벤치마크가 없을 수도 있으므로, 모든 것이 올바른 것을 측정하는 것에 달려있습니다.
저희는 다른 사람들이 기반으로 삼을 수 있도록 자동화된 정렬 연구 환경을 공개합니다.
전체 보고서:
https://alignment.anthropic.com/2026/automated-alignment-researchers/
AI 자동 생성 콘텐츠
본 콘텐츠는 X @AnthropicAI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기