BERT에서 T5까지: 개체명 인식 (NER)에 관한 연구
요약
본 보고서는 BERT와 T5 모델을 활용하여 개체명 인식(NER) 작업을 수행하고 두 아키텍처의 성능을 비교 분석합니다. BERT는 인코더 전용 구조와 분류 헤드를 사용하고, T5는 시퀀스 투 시퀀스 구조와 퓨샷 프롬프트를 활용하여 미세 조정을 진행했습니다. 다양한 하이퍼파라미터 절제 연구와 성능 지표 분석을 통해 각 모델의 특성과 오류 패턴에 대한 통찰을 제공합니다.
핵심 포인트
- BERT(Encoder-only)와 T5(Seq2Seq) 모델을 활용한 NER 구현 및 비교
- BERT 모델에 가중치 교차 엔트로피(Weighted cross-entropy) 손실 함수 적용
- T5 모델의 퓨샷 프롬프트 기반 미세 조정 및 검증 전략 수행
- 하이퍼파라미터 절제 연구(Ablation study)를 통한 모델 성능 분석
- 두 아키텍처의 시퀀스 레이블링 능력 및 오류 패턴 비교
개체명 인식 (Named Entity Recognition, NER)은 현대 자연어 처리 (NLP) 애플리케이션에서 필수적인 사전 단계 중 하나였습니다. 본 보고서는 두 가지 사전 학습된 모델을 미세 조정 (Finetuning)하여 NER 작업을 구현하는 데 중점을 둡니다: (i) 단순한 분류 헤드 (Classification head)를 가진 인코더 전용 (Encoder-only) 모델 (BERT), 그리고 (ii) 퓨샷 프롬프트 (Few-shot prompts)를 사용하는 시퀀스 투 시퀀스 (Sequence-to-sequence) 모델 (T5)입니다. 기존의 7개 클래스 태그 및 3개 클래스 단순화 태그 체계 하에서, BERT에는 학습 손실 (Training loss)을 위해 가중치 교차 엔트로피 (Weighted cross-entropy)가 적용되었으며, T5는 두 가지 검증 전략 (Validation strategies)으로 미세 조정되었습니다. 또한 다양한 하이퍼파라미터 (Hyperparameters)를 사용한 절제 연구 (Ablation study)를 수행하였습니다. 나아가, 관련 분석을 통해 BERT의 일반적인 오류와 두 모델의 성능에 대한 가치 있는 통찰을 제공합니다. 다양한 성능 지표 (Performance metrics)를 바탕으로, 본 보고서는 위의 두 아키텍처 (Architectures)를 비교하고 시퀀스 레이블링 (Sequence labelling) 작업에서의 능력을 탐구하여, 향후 실질적인 활용 사례를 위한 토대를 마련하는 것을 목표로 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기