밀집된 건강 서사(Health Narratives)를 위한 구조화된 주장 수준 담화 표현
요약
본 논문은 소셜 미디어 건강 서사에 나타나는 밀집되고 복잡한 주장을 분석하기 위한 구조화된 프레임워크를 제안합니다. 이 프레임워크는 원자적 주장, 주제, 입장 등 다차원적인 담화 속성을 연결하여 담화를 모델링하며, 벤치마크 구축과 함께 자동화된 구조적 담화 분석을 평가했습니다.
핵심 포인트
- 소셜 미디어 건강 서사는 매우 밀집되고 복잡한 주장을 포함한다.
- 제안된 프레임워크는 원자적 주장, 주제, 입장을 연결하여 모델링한다.
- LLM은 주제 분류에는 강하지만 고차원적인 화용론적 프로파일링에 어려움을 겪는다.
- 미래 시스템은 작업 분해와 특화된 추론 전략이 필요하다.
소셜 미디어 비디오 속의 건강 관련 담론은 짧은 대화 구간 내에서 여러 주제적 측면, 입장, 증거 프레임 및 수사적 기능을 아우르며 밀집하게 얽힌 주장을 포함하는 경우가 많습니다. 기존 접근 방식들은 이러한 구조를 충분히 포착하지 못하고, 주로 거친(coarse) 주제 수준, 감정 기반 또는 입장 지향적인 표현에 의존합니다. 저희의 분석에 따르면 분당 평균 13.22개의 원자적 주장(atomic claims)이 존재하며, 이는 더욱 풍부한 주장 수준 담화 표현을 필요로 합니다. 본 논문에서는 밀집된 건강 서사에서 주장을 위한 구조화된 프레임워크를 소개합니다. 저희의 프레임워크는 원자적 주장과 주제적 측면, 입장, 그리고 다차원적인 화용론적(pragmatic) 담화 속성을 연결하는 튜플을 통해 담화를 모델링합니다. 이러한 설정을 지원하기 위해, 저희는 60개의 비디오에서 수동으로 주석 처리된 1,191개의 주장으로 구성된 네 가지 건강 영역에 걸친 벤치마크를 구축했습니다. 이 프레임워크를 사용하여, 우리는 다양한 담화 맥락 설정 하에서 자동화된 구조적 담화 분석을 평가합니다. 그 결과, 현재의 LLM은 주제 분류 및 입장 예측에서는 강력한 성능을 보였으나, 고차원적인 화용론적 프로파일링에서는 어려움을 겪는 것으로 나타났습니다. 또한, 저희는 서로 다른 담화 작업들이 각기 다른 형태의 맥락 추론(contextual reasoning)로부터 이점을 얻는다는 것을 발견했으며, 이는 미래 시스템이 작업 분해(task decomposition)와 특화된 추론 전략을 요구할 수 있음을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기