언어 모델의 공감 능력 향상 가이드: 인간-LLM 협업을 통한 문화적 감수성을 갖춘 정신 건강 조언 생성
요약
저자원 언어 환경에서 LLM의 공감적 정신 건강 상담 능력을 향상시키기 위한 새로운 프레임워크를 제안합니다. RP-RCAF 프롬프팅 전략과 G-REFS 평가 체계를 통해 모델이 문화적 감수성을 갖춘 전문적인 조언을 생성하도록 유도합니다.
핵심 포인트
- 저자원 언어의 정신 건강 상담 데이터셋 구축
- RP-RCAF: 역할 수행 및 성찰적 사고 체인 프레임워크 제안
- G-REFS: Grok 4 기반의 자동화 및 전문가 통합 평가 체계 도입
- 기존 프롬프팅 방식 대비 전문 심리 상담에 근접한 성능 입증
최근 대규모 언어 모델 (LLMs)의 발전에도 불구하고, 저자원 언어 (low-resource languages)에서 공감적인 정신 건강 상담 응답을 생성하는 능력은 여전히 크게 탐구되지 않은 상태로 남아 있습니다. 이러한 격차를 해소하기 위해, 우리는 세 가지 상호 보완적인 출처로부터 625개의 실제 정신 건강 사례를 큐레이션했습니다: (1) 정신 건강 문제를 논의하는 공개된 Facebook 게시물, (2) 방글라데시 텔레비전 프로그램 "Ami Akhon Ki Korbo"의 스크립트, (3) 다양한 정서적 및 심리적 어려움을 다루는 익명화된 학생 설문 조사 응답입니다. 이러한 사례를 바탕으로, 우리는 면허를 소지한 임상 심리학자가 작성한 조언과 세 가지 현대적인 독점 LLM인 GPT-4o Mini, Claude 4.5 Haiku, Gemini 2.5 Pro가 생성한 응답으로 구성된 평가 코퍼스 (evaluation corpus)를 구축합니다. 나아가 우리는 역할 수행 성찰적 사고 사슬 조언 프레임워크 (Role-Playing Reflective Chain-of-Thought Advisory Framework, RP-RCAF)를 제안합니다. 이는 전문가가 작성한 퓨샷 (few-shot) 예시와 구조화된 자기 성찰을 결합하여, 자비로운 조언자 페르소나를 통해 지지적이고, 문화적으로 인지하며, 윤리적으로 정렬된 상담을 생성하는 작업 특화형 프롬프팅 전략입니다. 또한 우리는 정서적 민감도, 문화적 적절성, 언어적 명확성, 그리고 윤리적 건전성에 대해 자동화된 평가와 전문가 심리학자의 검증을 통합하는 Grok 4 기반 응답 평가 및 점수 산정 프레임워크 (Grok 4-Based Response Evaluation and Scoring Framework, G-REFS)를 도입합니다. 실험 결과에 따르면, RP-RCAF는 평가된 모든 모델에서 기존의 프롬프팅 방식을 일관되게 능가하며, 전문적인 심리 상담과 더 밀접하게 일치하는 응답을 생성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기