계속, 적응, 또는 양보: 풀-듀플렉스 에이전트의 오버래핑 음성에 대한 턴 내(In-Turn) 적응
요약
본 논문은 기존의 이분법적 평가 기준을 넘어, 사람이 대화 중 상대방의 발언을 통합하며 말을 이어가는 '턴 내 적응(in-turn adaptation)'을 측정하는 Duplex Cue를 제안합니다. 이를 통해 에이전트가 청자의 의도와 화자 행동에 어떻게 반응하는지 세밀하게 평가할 수 있습니다.
핵심 포인트
- 기존의 이분법적 평가는 턴 내 적응 같은 복잡한 인간 상호작용을 포착하지 못함.
- Duplex Cue는 청자의 의도(백채널, 협업, 중단)와 화자 행동을 분리하여 평가함.
- 실험 결과, 에이전트 모델은 실제 인간의 적응률(68.2%)에 크게 미치지 못하는 34.8% 수준이었음.
- 자연스러운 음성 상호작용 평가는 단순히 말하기 지속 여부를 넘어 청자의 기여 반응을 측정해야 함.
풀-듀플렉스 평가에서는 보통 에이전트가 계속 말하는지 아니면 멈추는지 여부에 초점을 맞춥니다. 이 이분법적 기준으로는 사람이 일상적으로 사용하는 세 번째 반응, 즉 청자가 방금 기여한 내용을 통합하면서 말을 계속하는 것을 표현할 수 없습니다. 이러한 기여는 빠진 단어일 수도 있고, 수정이거나 명확화일 수도 있습니다. 우리는 풀-듀플렉스 음성 에이전트에서 이러한 extit{턴 내 적응(in-turn adaptation)}을 평가하는 Duplex Cue를 소개합니다. Duplex Cue는 청자의 의도(백채널, 협업, 또는 중단)와 화자 행동(변화 없이 계속하기, 턴 내에서 적응하기, 또는 양보하기)을 분리합니다. 적응에는 인정(acknowledgment)뿐만 아니라 내용 수정도 포함됩니다. 비각본 영어 대화에서 얻은 300개의 인간 확인 신호를 사용한 단일 모델 사례 연구에서, 우리는 청자의 오디오를 재생하는 동안 생성된 PersonaPlex의 연속 응답과 녹음된 인간 반응을 비교합니다. 우리는 지속적으로 말하고 있는 화자가 신호 시작 시점에 있고 각 조건에서 점수화 가능한 응답이 있는 208쌍을 유지했습니다. 66개의 협업 쌍에서, 녹음된 화자들은 68.2%의 경우 적응하는 반면, PersonaPlex는 34.8%에 그쳤습니다. 모델은 그렇지 않은 경우 변화 없이 계속하거나(42.4%) 양보합니다(22.7%). 이러한 발견은 자연스러운 음성 상호작용을 평가하려면 에이전트가 말을 계속하는지 여부뿐만 아니라 청자의 기여에 어떻게 반응하는지를 측정해야 하는 이유를 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기