CLEF 2026 SimpleText 트랙: 다중 후보 LLM 단순화 및 복잡성 식별
요약
본 기사는 CLEF 2026 SimpleText 공유 과제 참여 결과를 설명합니다. Task 1에서는 GPT-4o-mini와 Claude Sonnet 4를 활용하여 다중 후보 생성 및 단순화 최적화 파이프라인을 구축했습니다. Task 2에서는 DeBERTa-v3-large NLI 모델을 미세 조정하여 환각 탐지(hallucination detection) 성능을 입증하며, 두 과제 모두 높은 순위를 기록했습니다.
핵심 포인트
- Task 1: GPT-4o-mini 기반 다중 후보 생성 및 점수 계산 휴리스틱 적용
- Claude Sonnet 4를 활용하여 Task 1.1에서 상위권의 문장 수준 시스템 달성
- DeBERTa-v3-large NLI 모델을 미세 조정하여 환각 탐지(hallucination detection)에 성공적으로 적용
- Task 2.1 및 Task 2.2 모두 최고 기록에 근접하는 높은 성능 지표를 달성함
우리는 Writerslogic 팀이 CLEF 2026 SimpleText 공유 과제에 참여한 내용을 설명하며, Task 1(텍스트 단순화)과 Task 2(복잡성 식별)를 다룹니다. Task 1의 경우, GPT-4o-mini를 사용하여 문장당 다양한 온도를 가진 다섯 개의 단순화 후보를 생성하는 다중 후보 생성 파이프라인을 개발한 후, 압축도, 원문 단어 유지율, Cochrane Plain Language Summary 어휘 사용, 그리고 어휘적 단순성을 보상하는 참조 없는 점수 계산 휴리스틱(reference-free scoring heuristic)을 사용하여 최적의 후보를 선택합니다. Task 1.1(문장 수준 단순화)에서 우리의 Claude Sonnet 4 제출물은 SARI 47.43과 BLEU 14.21을 달성하여, (두 개의 문서 수준 제출물에 이어) 결합된 Task 1 리더보드에서 상위권의 문장 수준 시스템이 되었습니다. Task 2의 경우, 우리는 DeBERTa-v3-large NLI 모델을 35만 개의 레이블링된 (출처, 문장) 쌍으로 미세 조정하여 환각 탐지(hallucination detection)를 자연어 추론(natural language inference)으로 구성했습니다. 이 모델은 가장 관련성 높은 출처 문장을 전제(premise)로, 후보를 가설(hypothesis)로 읽으면서, 근거 기반 콘텐츠와 환각된 콘텐츠를 구별하는 것을 직접 학습합니다. Task 2.1(이진 과잉 생성 식별)에서 우리의 미세 조정된 DeBERTa 시스템은 문서 수준의 매크로 F1 점수 0.8081을 달성했으며 (최고 앙상블에서 0.8085), 이는 식별 트랙 내 최고 순위 기록이며, AIIR Lab(0.8197)에 이어 전체 팀 중 2위를 차지했습니다. Task 2.2(다중 클래스 오류 분류)에서 우리의 최고 제출물은 0.804의 다중 클래스 정확도를 달성하여, AIIR Lab(0.827)에 이어 독특한 팀 중 2위에 올랐습니다. 우리는 Cochrane 체계적 문헌고찰에서 나온 영어 및 다국어 생물의학 텍스트를 대상으로 두 과제를 평가했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기