의사-환자 대화의 강건한 요약: Beyond Transcription Challenge를 위한 TalTech 시스템
요약
TalTech은 긴 의사-환자 대화에서 직접 SOAP 노트를 생성하는 BeTraC 챌린지에서 1위를 차지했습니다. LoRA 미세 조정과 DAPO 강화 학습을 통해 Voxtral 모델을 최적화하여 낮은 환각률과 높은 사실적 신뢰성을 입증했습니다.
핵심 포인트
- 전사 과정 없이 음성에서 직접 의료 노트 생성
- DAPO 강화 학습을 통한 환각 현상 최소화
- Voxtral Mini 및 Small 모델의 챌린지 1위 달성
- 텍스트 미세 조정의 음성 도메인 전이 효과 확인
본 논문은 중간 전사(transcription) 과정 없이 긴 의사-환자 대화 녹음으로부터 SOAP 노트를 직접 생성해야 하는 Beyond Transcription Challenge (BeTraC)에 제출된 TalTech의 결과물을 설명합니다. 긴 오디오에 대한 강건성(robustness)을 기준으로 오픈 웨이트(open-weight) 음성 LLM들을 선별한 후, LoRA 지도 미세 조정(supervised fine-tuning)과 이어서 챌린지 지표인 Open Medical Concept F1을 보상으로 사용하는 DAPO 강화 학습(reinforcement learning)을 통해 Voxtral Mini (경량 트랙) 및 Voxtral Small (중량 트랙)을 최적화했습니다. 당사의 시스템은 두 트랙 모두에서 1위를 차지했으며, 독립적인 LLM-as-a-judge 평가 결과 모든 제출물 중 가장 낮은 환각(hallucination) 비율을 보여, 개념 매칭 지표를 활용한 강화 학습이 사실적 신뢰성을 저해하지 않을 수 있음을 입증했습니다. 또한, 텍스트 전사본(transcripts)을 통한 미세 조정이 음성 입력으로 잘 전이되며, 도메인 외(out-of-domain) 실제 녹음 데이터에 대한 강건성을 향상시키는 것으로 나타났습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기