Amazon Nova 2를 위한 미세 조정(Fine-tuning) 대 지속적 사전 학습(Continued Pre-training)
요약
본 글은 대규모 언어 모델(LLM)을 특정 분야에 적응시키는 두 가지 방법, 지속적 사전 학습(CPT)과 지도 미세 조정(SFT)의 차이점을 설명합니다. CPT는 도메인 지식 습득에 초점을 맞추고 방대한 레이블 없는 텍스트를 사용하며, SFT는 특정 작업 수행 능력 및 행동 정렬을 위해 고품질의 레이블링된 예시 쌍을 학습하는 방식입니다.
핵심 포인트
- CPT: 대규모 원본 텍스트로 도메인 지식과 유창성 습득 (지식 습득).
- SFT: 레이블링된 프롬프트-응답 쌍으로 특정 작업 수행 능력 및 행동 형성 (행동 형성).
- 선택 기준: 모델의 부족한 부분이 '도메인 지식'인지, 아니면 '특정 행동 방식'인지에 따라 결정.
- 최적화 과정: 일반적으로 CPT 이후 SFT와 명령어 튜닝이 결합되어야 효과적이다.
면접관이 Amazon Nova 2 Lite를 특정 전문 분야에 맞게 어떻게 적응시킬지 질문한다고 상상해 보세요. 방대한 양의 원본 문서 라이브러리를 제공해야 할까요, 아니면 원하는 답변의 신중하게 준비된 예시들을 보여줘야 할까요? 이러한 선택들은 지속적 사전 학습(continued pre-training)과 지도 미세 조정(supervised fine-tuning)에 해당하며, 이들은 서로 다른 문제를 해결합니다. 지속적 사전 학습은 대량의 레이블 없는 텍스트로부터 도메인에 대한 더 깊은 친숙도를 개발하는 반면, 지도 미세 조정은 레이블링된 프롬프트-응답 예시들로부터 작업과 행동을 가르칩니다. 올바른 선택은 격차가 주로 도메인 유창성(domain fluency)의 부족인지 아니면 불분명한 행동(unclear behavior) 때문인지에 따라 달라집니다.
지식 습득과 행동 형성 분리하기가 가장 강력한 답변입니다
면접 질문: AWS에서 파운데이션 모델을 미세 조정하는 것과 지속적 사전 학습하는 것의 차이점은 무엇이며, 각각 어떤 데이터가 필요합니까?
모델 답변: 지속적 사전 학습(CPT)은 특정 도메인이나 컬렉션의 추가적인 원본 레이블 없는 텍스트에 노출시킴으로써 파운데이션 모델의 사전 학습을 확장합니다. 그 목적은 모델이 더 깊은 도메인 지식, 전문 용어, 작성 패턴, 그리고 특정 콘텐츠 유형에 대한 친숙도를 습득하도록 돕는 것입니다.
반면, 지도 미세 조정(SFT)은 레이블링된 입력-출력 쌍으로 모델을 학습시킵니다. 각 쌍은 프롬프트와 모델이 생성하는 법을 배워야 할 응답을 보여주며, 이를 통해 모델이 특정 작업, 지침, 워크플로우, 형식, 어조 또는 스타일에 맞춰 정렬되도록 합니다.
따라서 가장 간단한 구분은 **지식 습득 대 행동 형성(knowledge acquisition versus behavior shaping)**입니다. CPT는 “모델이 어떤 언어와 주제에 더 유창해져야 하는가?”라는 질문에 답하고, SFT는 “주어진 입력에 대해 모델이 무엇을 해야 하는가?”라는 질문에 답합니다.
데이터 요구사항은 이 구별에서 직접적으로 파생됩니다. CPT는 수십억 개의 토큰에 달하는 대규모 도메인 특화 원본 문서를 필요로 합니다. SFT는 각 입력이 원하는 출력과 쌍을 이루는 고품질의 레이블링된 예시가 필요합니다. 일반적으로 모델이 새로 습득한 지식을 유용한 작업을 완료하는 데 사용할 수 있도록 하려면 CPT 이후에 추가적인 명령어 튜닝(instruction-tuning) 단계가 필요합니다.
이를 전문가를 직무에 투입시키는 과정에 비유할 수 있습니다. CPT는 전문가에게 흡수할 광범위한 전문 도서관을 제공하는 것에 가깝고, SFT는 전문가에게 특정 과제에 응답하는 방법에 대한 작업 예시를 보여주는 것과 같습니다. 이 비유는 광범위한 노출과 명시적인 시연(demonstrations)을 구분하지만, 어느 한 가지 방법이 자동으로 정확한 답변을 보장한다는 의미는 아닙니다.

지속적 사전 학습(Continued pre-training)은 도메인 유창성을 구축하는 반면, 미세 조정(fine-tuning)은 원하는 행동을 시연합니다
취약한 후보자들이 저지르는 실수: 실제 면접 용어로 볼 때, 약한 답변은 종종 두 가지 방법을 모두
예를 들어, 모델이 기술 서비스 기록의 어휘는 이해하지만, 그 기록을 요구되는 구조화된 응답으로 일관되게 변환하지 못하는 경우를 가정해 봅시다. 훈련 세트는 대표적인 기록과 올바르게 형식화된 출력을 쌍으로 구성할 수 있습니다. 이 예시는 모든 입력에 예상되는 작업을 보여주는 목표 응답이 동반되기 때문에 SFT(Supervised Fine-tuning)를 설명합니다.
SFT는 또한 성공을 직접적으로 보여줄 수 있을 때 더 명확한 선택지입니다. 즉, “이러한 입력을 받으면 저와 같은 출력을 생성하라”는 식입니다. 이 선택 규칙은 실용적인 판단이지만, 필요한 훈련 데이터의 구조를 따릅니다.

지도 미세 조정(Supervised fine-tuning)은 요구되는 응답을 보여주는 예시로 시작합니다
약한 후보들이 저지르는 실수: 약한 답변은 SFT가 단순히 모델에 더 많은 주제 지식을 제공할 뿐이라고 말할 수 있습니다. 사실, 그 정의적인 입력은 레이블이 지정된 프롬프트-응답 데모 세트이며, 명시된 목적은 작업(tasks), 지침(instructions) 또는 원하는 행동과의 정렬(alignment)입니다.
원본 도메인 코퍼스는 지속적 사전 학습을 가리킨다
후속 질문 2: 언제 지속적 사전 학습(continued pre-training)을 선택해야 하나요?
모델 답변: 매우 방대한 양의 도메인별 텍스트를 가지고 있고, 모델이 해당 도메인에서 더 깊은 지식과 더 원어민 같은 유창성을 개발하기를 원할 때 CPT(Continued Pre-training)를 선택하세요. 적합한 자료로는 법률 문서, 의학 문헌, 기술 문서 또는 독점적인 비즈니스 콘텐츠가 포함될 수 있습니다. 이 문서들은 프롬프트-응답 레이블이 필요하지 않기 때문에 CPT는 원본 텍스트로 훈련합니다.
CPT는 수백억 개의 토큰 규모에서 특히 가치가 높습니다. 이는 모델이 전문 용어, 특유의 작문 패턴, 새로운 주제 영역, 그리고 특정 콘텐츠 유형을 학습하는 데 도움을 줄 수 있습니다. 따라서 CPT는 비교적 목표 지향적인 예시(demonstrations)를 모으는 것과는 다른 접근 방식입니다. 즉, 그 사용 사례가 정답 목록보다는 대규모 코퍼스(corpus)를 가정한다는 것입니다.
예를 들어, 전문 매뉴얼 모음에는 모델이 각 구절에 대해 특정 작업을 지정하지 않아도 흡수해야 할 언어와 개념들이 포함될 수 있습니다. 이것이 바로 CPT 형태의 데이터입니다. 반면에 “매뉴얼 발췌본 + 질문”과 “승인된 답변”과 같은 쌍은 모델이 어떻게 응답해야 하는지를 보여주기 때문에 SFT(Supervised Fine-Tuning) 형태의 데이터입니다.
CPT를 특정 도메인의 문학에 몰입하는 것에 비유해 보세요. 몰입을 통해 해당 도메인에 대한 친숙함은 쌓일 수 있지만, 그것만으로는 모델이 그 친숙함을 가지고 수행해야 할 유용한 작업을 지정해주지는 못합니다.

타겟 응답의 유무가 학습 데이터의 형태를 결정합니다
약한 후보들이 범하는 실수: 약한 답변은 단순히 독점 문서가 존재한다는 이유만으로 CPT를 추천할 수 있습니다. 더 강력한 답변은 기록된 대규모 볼륨 사용 사례에 충분한 도메인 텍스트가 존재하는지, 그리고 실제 격차가 응답 행동(response behavior)보다는 도메인 유창성(domain fluency)의 부족인지 확인합니다.
지속적 사전 학습이 첫 번째 적응 단계일 수 있다
후속 질문 3: 지속적 사전 학습이 모델을 특정 작업에 준비시킬까요?
모델 답변: 반드시 그렇지는 않습니다. CPT 이후에는 모델이 새로 습득한 지식을 활용하여 유용한 작업을 완료할 수 있도록 추가적인 명령어 미세 조정(instruction-tuning) 단계가 일반적으로 필요합니다. CPT는 특정 도메인의 지식을 심화시킬 수는 있지만, 그 원본 문서 자체만으로는 원하는 응답을 정의하는 레이블링된 데모(labeled demonstrations)를 직접 제공하지 못합니다.
합리적인 설계는 CPT와 SFT를 상호 배타적이기보다는 잠재적으로 보완적인 것으로 간주하는 것입니다. CPT가 먼저 모델에게 방대한 전문 코퍼스(specialist corpus)에 노출시킨 다음, 명령어 미세 조정이 그 지식을 어떻게 적용해야 하는지 시연할 수 있습니다. 첫 번째 단계는 도메인 친숙도를 개발하고; 나중 단계는 작업 수행 능력을 형성합니다.
예를 들어, 원본 기술 문서는 모델이 전문 용어와 작성 패턴을 접하도록 CPT를 지원할 수 있습니다. 그런 다음 레이블링된 예시는 진단 질문에 어떻게 답하거나, 도메인별 워크플로우를 따르거나, 요구되는 응답 형식을 반환하는지 보여줄 수 있습니다. 이 예시는 '지식 습득'과 '작업 수행'이 별개의 적응 목표임을 보여줍니다.

도메인 적응은 원본 텍스트 학습에서 명령어 중심 학습으로 이어질 수 있습니다
약한 후보자들이 저지르는 실수: 면접 용어로 비유하자면, 약한 후보자들은 단순히 원본 문서를 CPT에 쏟아붓는 것이 질문 답변, 형식 지정, 또는 워크플로우 준수를 자동으로 가르쳐줄 것이라고 암시하는 경우가 많습니다. 출처는 이 한계를 명확히 합니다: CPT 이후에는 일반적으로 추가적인 명령어 미세 조정이 필요합니다.
데이터 품질과 데이터 형태는 다른 요구사항입니다
후속 질문 4: 각 방법론에 필요한 학습 데이터셋은 정확히 어떤 모습이어야 하나요?
모델 답변: CPT(지속적 사전 학습) 데이터셋은 관련성 높고 레이블링되지 않은 도메인 텍스트의 대규모 코퍼스여야 합니다. 이 데이터가 제공하는 유용한 신호는 문서 자체에 있습니다: 주제, 전문 용어, 작성 패턴, 그리고 콘텐츠 유형입니다. 기록된 예시에는 법률, 의료, 기술 및 독점 비즈니스 텍스트가 포함됩니다.
SFT(지도 미세 조정) 데이터셋은 올바른 동작을 보여주는 레이블링된 입력-출력 쌍을 포함해야 합니다. 입력은 프롬프트 또는 작업 예시이며, 출력은 모델이 학습하도록 의도된 응답입니다. 이러한 쌍들은 특정 형식, 어조, 스타일, 지침, 워크플로우 또는 멀티모달 작업을 시연할 수 있습니다.
'레이블링되지 않았다(Unlabeled)'는 '관련성이 없다(unrelated)'를 의미하지 않으며, '레이블링되었다(labeled)'는 '자동으로 유용하다(automatically useful)'를 의미하지도 않습니다. 실질적인 관점에서 볼 때, CPT 자료는 모델이 흡수해야 할 도메인을 대표해야 하며, SFT 예시는 재현해야 할 동작을 명확하게 나타내야 합니다. 이는 별도의 소스 요구 사항이라기보다는 데이터셋 설계에 대한 판단입니다.
예를 들어, 단순히 파일 이름이나 카테고리를 가진 도메인 문서 폴더가 SFT 데이터셋이 되는 것은 아닙니다. SFT는 입력과 의도된 출력이 쌍을 이루는 더 강력한 관계를 요구합니다. 반대로, 모든 원시 구절을 시연으로 변환하는 것은 CPT에 불필요합니다. 왜냐하면 CPT는 원시 문서로 학습하도록 특별히 설계되었기 때문입니다.

데이터셋이 원하는 답변을 포함하는지 여부를 질문하여 방법을 선택하세요
약한 후보들이 저지르는 실수: 약한 답변은 데이터의 양만을 논합니다. 볼륨(Volume)은 CPT의 기록된 사용 사례에 중요하지만, SFT는 고품질 레이블링 쌍으로 정의됩니다. 따라서 데이터의 구조와 목적이 그 양만큼이나 중요합니다.
Nova 2 Lite가 두 경로를 모두 지원하지만, 모델 선택은 여전히 트레이드오프입니다
후속 질문 5: 이러한 구분은 Amazon Nova 2에 어떻게 적용되나요?
모델 답변: Amazon Nova 2는 현재 질문에서 다루고 있는 모델 세대이며, Nova 2 Lite는 CPT와 SFT를 모두 지원합니다. 문서에는 두 기술 모두에 대해 Nova 1.0 Micro, Lite, 그리고 Pro가 나열되어 있지만, 이는 이전 모델 세대를 나타냅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기