머신러닝 연구 에이전트는 왜 과적합하지 않을까?
요약
본 글은 머신러닝의 핵심 목표가 암기가 아닌 일반화에 있음을 설명하며, 과적합 방지를 위해 검증 및 테스트 세트를 분리하는 것이 중요하다고 강조합니다. 특히 연구 과정에서 벤치마크 데이터셋을 반복적으로 사용하는 것은 이론적으로는 과적합 위험이 있지만, 실제로는 새로운 데이터로의 성능 전이가 일어나며 발전해 왔음을 논합니다.
핵심 포인트
- ML은 암기가 아닌 일반화가 목표입니다.
- 테스트 세트는 모델의 '야생' 성능 대리 지표 역할을 합니다.
- 벤치마크 반복 사용은 이론적 과적합을 일으키지만, 실제로는 전이가 일어납니다.
- LLM 기반 연구 에이전트가 인간 커뮤니티의 최적화 루프를 자율적으로 수행할 수 있게 되었습니다.
기본적으로 머신러닝(Machine Learning)은 암기가 아니라 일반화(generalization)에 관한 것입니다. 학습 알고리즘에게 훈련 예제들을 한 무더기로 주고, 그것들로 모델을 적합시키도록 합니다. 하지만 목표는 훈련 예제에서 잘 수행하는 것이 아닙니다 — 그것은 쉽습니다. 답을 그냥 외우기만 하면 되니까요. 목표는 이전에 본 적 없는 새로운 예제에서 잘 수행하는 것입니다. 만약 모델이 학습된 데이터에서는 잘 작동하지만 새로운 데이터에서는 성능이 떨어진다면, 실제로 아무것도 배운 것이 아닙니다. 단지 스스로를 속여서 배웠다고 생각하게 만들었을 뿐입니다. 이러한 실패 모드를 과적합(overfitting)이라고 부릅니다.
입문 통계학이나 머신러닝 수업을 들은 사람이라면 누구나 표준적인 방어책을 알고 있습니다. 데이터의 일부를 따로 빼놓고, 그것으로는 훈련하지 않는 것입니다. 실제 관행에서 이 분리된 데이터는 두 가지 역할을 합니다. *검증 세트(validation set)*는 모델을 구축하는 동안 반복적으로 참고하는 것으로, 후보들을 비교하고 하이퍼파라미터(hyperparameters)를 조정하며 다음에 무엇을 시도할지 결정하는 데 사용됩니다. 최종 테스트 세트(test set) (또는 홀드아웃(holdout))은 아주 마지막에 단 한 번만 건드려야 합니다. 왜냐하면 훈련 과정에서 이 데이터는 본 적이 없기 때문에, 여기서의 강력한 성능은 야생에서 마주칠 새로운 예제들에 대한 정확한 대리 지표(proxy)가 되기 때문입니다.
머신러닝은 기본적으로 암기가 아니라 일반화에 관한 것입니다.
하지만 '홀드아웃' 조건이 매우 중요합니다. 이 정확한 대리 지표의 보장(correct-proxy guarantee)은 분리된 세트가 진정으로 보지 못한 상태로 유지될 때 성립됩니다. 만약 그 성능을 확인하고, 이에 대응하여 훈련 절차를 수정하며, 다시 확인하고 반복한다면, 그 세트는 더 이상 보지 못한 것이 아닙니다. 그것은 이미 당신의 훈련 과정 일부가 되어버린 것입니다. 이렇게 충분히 많이 하면, 마치 훈련 세트를 과적합시켰던 것처럼 그것도 과적합할 수 있으며, 그렇게 되면 보지 못한 데이터에 대한 대리 지표를 잃게 됩니다. 이는 검증 세트와 같이 의도적으로 재사용되는 모든 분리된 세트에 해당됩니다.
머신러닝의 핵심을 이루는 퍼즐
실제 머신러닝 연구는 우리가 방금 설명한 반복적인 개선 루프와 정확히 같습니다. 모든 사람은 수년간 수정되지 않은 소수의 벤치마크 데이터셋을 사용하여 성능을 측정합니다. 연구 커뮤니티는 거대하고 분산된 루프를 반복합니다. 즉, 벤치마크로 모델을 평가하고, 학습 절차를 수정하며, 재평가하고, 출판하고, 다음 그룹이 조금 더 개선할 수 있도록 합니다.
이는 교과서적인 설명에 따르면 심각한 과적합(overfitting)을 일으켜야 하는, 별도로 보관된 세트(held-out set)에 대한 언덕 오르기(hill-climbing)와 정확히 같은 종류입니다. 이제쯤이면 리더보드는 벤치마크에서는 훌륭해 보이지만 다른 모든 곳에서는 평범한 모델들로 포화되었어야 합니다.
하지만 실제로 그렇게 되지 않습니다. 오래되고 많이 재사용된 벤치마크를 위해 완전히 새로운 테스트 세트를 구축한 연구들은 개선 사항이 크게 *전이(transfer)*된다는 것을 발견했습니다. 즉, 새 데이터에서도 모델은 이전 벤치마크에서 보여주었던 것과 같은 이득을 보입니다. 벤치마크 주도 머신러닝은 교과서의 예측과는 달리 빠르고 대체로 실제 발전을 이루어 왔습니다. 왜일까요?
가설에는 부족함이 없지만, 그것들을 경험적으로 테스트하기는 어려웠습니다. 그 이유는 실험의 '주체' 자체가 전체 인간 연구 커뮤니티이기 때문입니다. 한 분야를 초기화하고, 기억을 지우고, 지난 10년을 통제된 조건에서 다시 실행할 수 없습니다.
하지만 우리는 비슷한 것을 할 수 있습니다. 이제는 인간 커뮤니티가 수행하는 것과 동일한 머신러닝 최적화 루프를 자율적으로 실행할 수 있는 능숙한 LLM 기반 연구 에이전트(research agents)들이 생겼습니다. 이들은 동일한 벤치마크 언덕 오르기를 수행하며—흥미롭게도, 이들 역시 과적합하지 않는 것처럼 보입니다. 차이점은 에이전트는 연구 커뮤니티와 달리 초기화할 수 있는 무언가라는 점입니다. 그 기억을 지우고, 어떤 정보를 볼지 정확하게 통제하여 실험을 다시 실행할 수 있습니다. 최근 논문인
오컴의 면도날(Occam's razor), 정밀하게 구현되다
이 설명은 매우 오래된 아이디어에서 시작됩니다. 오컴의 면도날은 데이터를 똑같이 잘 설명하는 가설들 중에서, 더 단순한 것이 맞을 가능성이 높다고 말합니다. 이 직관이 정확한 수학적 형태를 가지고 있으며, 이것이 전체 이야기의 근간을 이룹니다.
당신이 당신의 가설—즉 모델이나 전략—을 훈련 데이터를 암기하는 데 필요한 비트 수보다 훨씬 적은 작은 수의 비트로 설명할 수 있다고 가정해 봅시다. 만약 그 간결한 가설이 훈련 데이터에서 매우 잘 작동한다면, 그것은 새로운 데이터에서도 잘 작동해야만 합니다.
그 추론은 카운팅 논증(counting argument)을 거칩니다. 짧은 설명 자체가 많지 않기 때문에, '짧은' 설명 자체는 그리 많이 존재하지 않습니다. 후보 가설의 수가 적을수록, 그중 어느 하나가 우연히 훈련 세트에서 당신을 속였을 가능성은 낮아집니다—비록 당신이 검색 과정에 훈련 세트를 사용했더라도 말입니다.
직관을 얻는 또 다른 방법은 이렇습니다. 만약 당신의 압축된 설명이 훈련 데이터를 비밀리에 기록하기에는 너무 작다면, 그것이 훈련 데이터에서 잘 작동하더라도 그 이유는 답을 암기했기 때문일 수 없습니다—그럴 공간 자체가 없었기 때문입니다. 그것은 데이터 구조에 대한 진실한 무언가를 포착했기 때문이어야 합니다. 짧은 설명은 속일 수 없습니다. 공간이 부족하기 때문에요.
다음과 같은 매력적인 가설이 있습니다: 성공적인 머신러닝 전략은 높은 압축성을 가진다. 연구자는 프로젝트 기간 동안 수천 개의 벤치마크 점수를 들여다볼 수 있지만, 궁극적으로 살아남는 전략은 보통 친숙한 선택지들의 짧은 목록입니다—아키텍처 패밀리, 옵티마이저, 학습률 스케줄(learning-rate schedule), 데이터 처리 레시피, 정규화 방식 등. 만약 그 최종 레시피가 단 몇 비트로 전달될 수 있다면, 모델의 벤치마크에 대한 진정한 의존도는 실험의 길고 복잡한 기록이 시사하는 것보다 훨씬 작다는 것을 의미합니다. 언덕 오르기(hill-climbing) 과정은 광범위했지만, 그 끝에서 나온 것은—혹은 나올 수 있었던 것은—아주 작았을 뿐입니다.
압축(Compression), 지능(intelligence), 그리고 박식한 청취자의 힘
밝은 고등학생에게 특정 머신러닝 파이프라인을 설명하려고 상상해 보세요. 그들이 실제로 재현할 수 있을 만큼 충분히 자세하게 말입니다. 그것은 길고 힘들게 이어지는 대화가 될 것입니다. 당신은 경사 하강법(gradient descent)이 무엇인지, 신경망(neural network)이 무엇인지, PyTorch나 JAX나 TensorFlow가 무엇을 하는지, 학습률(learning rate)이 무엇인지 등을 설명해야 할 것이며, 끝도 없을 겁니다. 이 모든 것 중 대부분은 당신의 문제에 특정한 것이 아닙니다. 그것은 머신러닝이 어떻게 작동하는지에 대한 일반적인 배경 지식일 뿐입니다.
이제 같은 파이프라인을 전문가 ML 엔지니어에게 설명한다고 상상해 보세요. 대화는 몇 문장으로 압축됩니다. 당신은 공통 지식에 해당하는 모든 것을 건너뛰고, 오직 이 문제에 진정으로 특정한 것만을 전달합니다: 아키텍처 선택(architecture choice), 배치 크기(batch size), 옵티마이저(optimizer), 그리고 몇 가지 하이퍼파라미터(hyperparameters) 정도입니다. 청취자가 세상에 대해 이미 많이 알고 있을수록, 당신이 보내야 할 메시지는 더 짧아지고—더 공격적으로 압축할 수 있게 됩니다. 이 모든 '세계 지식'은 오컴의 면도날 논증(Occam's-razor argument)에서 당신에게 불리하게 작용하지 않습니다. 왜냐하면 그것을 훈련 데이터셋을 보지 않고도 모두 적어낼 수 있었기 때문입니다.
여기에 대규모 언어 모델(LLM)이 등장합니다. 현대 LLM은 엄청난 양의 세계 지식을 가지고 있습니다. 그들은 ML 도구 작동 방식에 대해 알고 있고; 표준 최적화 알고리즘을 알고 있으며; 일반적인 하이퍼파라미터 선택과 흔한 기본값들까지도 압니다. 만약 어떤 세부 사항이 명시되지 않았다면, 그것은 그럴듯한 값을 채워 넣을 수 있습니다. 이것이 LLM을 비범하게 좋은 *압축 디코더(compression decoder)*로 만드는 이유입니다: 간결하고 전문가 대 전문가의 메시지를 LLM에 건네주면, 그것은 완전하고 작동하는 절차로 풀어낼 수 있습니다. 생각해 보면, 바로 이것이 그들이 그렇게 강력한 이유입니다.
실험: 병목을 통과하는 전략 압축하기
이는 깔끔한 실험을 시사합니다. ML 연구 에이전트인 ‘탐험가(explorer)’에게 새로운 머신러닝 문제를 해결하도록 맡겨보세요. 검증 데이터셋에 대한 완전한 접근 권한을 주고, 수백 라운드에 걸쳐 자유롭게 실험하고 반복하며 더 나은 검증 성능을 추구하게 합니다. 여기서 검증 데이터셋은 벤치마크의 역할을 수행합니다. 즉, 에이전트가 계속해서 질의하는 ‘재사용 가능한 홀아웃(reusable holdout)’인 것입니다. 이것이야말로 과적합할 것이라고 예상되는 언덕 오르기 루프입니다.
다음으로, 그 해결책이 얼마나 압축 가능한지 테스트합니다. 두 번째 에이전트인 ‘압축기(compressor)’는 탐험가의 작업 전체 기록을 읽고 승리한 전략을 아주 짧은 프롬프트—단 몇 개의 토큰만으로—정제하려고 시도합니다. 이 프롬프트가 세 번째 에이전트인 ‘재현자(reproducer)’에게 전달되며, 재현자는 오직 그 프롬프트와 훈련 데이터만을 사용하여 처음부터 전략을 구현해야 합니다. 결정적으로, 재현자는 검증 데이터셋, 탐험가의 코드, 또는 그 기록에 접근할 수 없습니다. 짧은 프롬프트만이 검증 데이터셋으로부터 학습된 모든 정보가 도달할 수 있는 유일한 통로입니다. (저희 논문에서 보고하는 연구에서는 압축기와 재현자 모두 Claude 모델을 사용합니다.)
만약 재현자가—아무것도 모르는 상태에서 단 몇 개의 토큰만을 가지고 시작하여—탐험가의 성능과 일치한다면, 전략을 명시하는 데 필요한 모든 검증 의존적 정보가 그 작은 통로를 통해 통과했다는 의미입니다. 즉, 이 전략은 압축 가능했던 것입니다. 우리는 이를 ‘출력 압축(output compression)’의 증명서라고 부릅니다.
이 설정은 인간의 연구 커뮤니티가 갖지 못한 매우 유용한 속성을 가지고 있습니다. 바로 재현기(reproducer)를 반복적으로 초기화할 수 있다는 점입니다. 압축기(compressor)는 여러 가지 다른 압축을 시도하고 각 압축이 얼마나 잘 디코딩되는지 확인할 수 있는데, 이는 모든 시도가 이전 메모리와 상관없이 새로운 재현기에 도달하기 때문입니다. 이는 영화 *메멘토(Memento)*와 약간 비슷합니다. 마치 자신에게 짧은 쪽지를 남기는데, 그 쪽지를 읽을 때까지 자신의 기억이 지워지는 버전의 자신에게 보내는 것과 같습니다. 당신은 지식이 풍부하지만 기억상실증에 걸린 복사본인 자신이 작동시킬 수 있는 메모를 작성하는 법을 배우게 되며, 이 메모들은 매우 짧아도 됩니다. 왜냐하면 수신자가 당신이 말하지 않은 모든 것을 정확히 채워 넣을 것이기 때문입니다.

다른 쪽 끝에서 나오는 것들
압축된 결과물은 놀라울 정도로 작습니다. 표 형식 분류(tabular classification), 이미지 분류(image classification), 언어 모델링(language modeling), 확산 모델링(diffusion modeling), 보상 모델링(reward modeling)을 아우르는 8개의 데이터셋에 걸쳐, 단지 32토큰의 프롬프트만으로도 신규 재현기가 탐험가(explorer)가 적응적으로 최적화한 모델과 대다수의 문제에서 일치하는 것을 보여주었습니다. 한 언어 모델링 전략은 성능 저하 없이 압축되어 단지 16토큰까지 살아남았습니다.
이 프롬프트들은 실제로 어떤 모습일까요? 가장 흥미로운 예시는 간결함의 경계, 즉 압축이 거의 무너지는 지점에 있습니다. 한 언어 모델링 실험에서 탐험가는 사용자 정의 GPT 스타일의 학습 레시피를 발견했습니다. 16토큰 예산 하에서도 이것은 신규 재현기가 압축되지 않은 탐험가와 일치하기에 충분했습니다:
QKn 12L768 Mu .1 R² b2M 4x
인간 독자에게는 암호처럼 보이지만, 다른 ML 에이전트에게는 구체적인 의미를 전달합니다: QKn은
이제 재현기(reproducer)는 탐색기(explorer)와 더 이상 일치하지 않습니다. 누락된 조각들은 데이터의 함수로 이루어진 실제 훈련 선택들을 명시하며, 이는 가장 분명한 기본값들과 다릅니다. 이 경계는 압축 가능성의 한계를 보여주며 중요합니다. 이는 재현기가 사전 지식만으로는 성공하고 있지 않음을 보여줍니다. 몇 개의 압축된 토큰들이 데이터 자체로부터 학습된 진정한 정보를 담고 있으며, 이 토큰들이 사라질 때 성능도 함께 사라집니다.
또한 우리는 다른 방향에서 정보 병목(information bottleneck)을 부과하는 일련의 실험들을 수행했습니다. 탐색기의 출력을 압축하는 대신, 그 입력을 압축했습니다. 즉, 탐색기에게 각 모델의 수치적 검증 점수를 알려주는 대신, 단 하나의 비트만을 반환했습니다—이 모델이 현재까지의 최고 기록을 깼는지 아닌지? 질의당 단 하나의 피드백으로 줄였음에도 불구하고, 탐색기는 완전한 수치적 점수로 찾았을 때만큼 좋은 전략들을 찾아냈습니다. 검증 세트와 최종 전략 사이의 채널은 양방향 모두에서 좁으며, 심지어 한 비트 버전은 일반화에 대한 엄격한 수학적 보장까지 제공합니다.
속이는 자 잡기
AI 자동 생성 콘텐츠
본 콘텐츠는 Lobste.rs AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기