SAGE: 의료 기반 질의응답(QA) 데이터 합성을 위한 의미론적 앵커 유도 진화
요약
본 논문은 의료 질의응답(QA) 모델 개발 시 고품질 훈련 데이터 부족 문제를 해결하기 위해 SAGE라는 새로운 데이터 합성 프레임워크를 제안합니다. SAGE는 MeSH 같은 공개 분류 체계를 의미론적 앵커로 활용하여, 온프레미스 환경에서 구조화된 사전 지식을 기반으로 의료 데이터를 생성합니다. 실험 결과, SAGE로 합성된 데이터가 기존 방식보다 우수한 성능을 보였습니다.
핵심 포인트
- SAGE는 MeSH 같은 공개 분류 체계를 의미론적 앵커로 활용합니다.
- 온프레미스 환경에서 고품질의 의료 훈련 데이터를 생성할 수 있습니다.
- 원자적 및 연관적 합성을 반복하여 데이터 효율성을 높였습니다.
의료 질의응답(Medical Question Answering, QA)과 같은 임상 작업을 위한 신뢰할 수 있는 모델을 개발하는 것은 고품질의 전문가 주석이 달린 훈련 데이터의 제한적인 가용성으로 인해 심각하게 제약받습니다. 이러한 문제는 엄격한 개인 정보 보호 요구 사항과 자원이 제한된 임상 환경에서 대규모 오픈 소스 코퍼스나 독점 클라우드 API를 활용하는 비실용성으로 인해 더욱 악화됩니다. 이러한 장애물을 해결하기 위해, 우리는 작고 로컬에 배포되는 모델이 고품질의 의료 훈련 데이터를 생성할 수 있도록 하는 새로운 데이터 합성 프레임워크인 SAGE ( extit{Semantic Anchor-Guided Evolution})를 소개합니다. SAGE는 MeSH와 같은 가볍고 공개적으로 사용 가능한 분류 체계를 의미론적 앵커로 활용하여, 구조화된 사전 지식을 부과함으로써 데이터 생성 프로세스를 효과적으로 안내하고 기반을 다집니다(grounding). 핵심적으로 SAGE는 원자적(개별 개념 기반) 합성 및 연관적(관계 기반) 합성을 반복적으로 교차하며, 최소한의 시드로부터 훈련 데이터를 부트스트랩합니다. 이 접근 방식은 대규모 의료 문서 컬렉션이나 외부 API에 대한 의존성을 제거하여, 온프레미스 데이터 생성에 실용적인 해결책을 제공합니다. 여러 의료 질의응답 벤치마크 전반에 걸친 광범위한 실험 결과는 SAGE로 합성된 데이터로 미세 조정된 모델이 자체적으로 도출하거나 기존 문서 기반 패러다임을 사용하여 훈련된 모델보다 일관되게 우수함을 입증했으며, 이는 의료 LLM 개발을 위한 데이터 효율성과 자원 활용 측면에서 실질적인 개선을 강조합니다. 코드는 https://github.com/DIaacKr/SAGE에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기