구조화되었지만 침묵하는: LLM 은닉 상태에서의 프로빙 역량 요구사항
요약
본 논문은 LLM이 도구를 사용하기 전에 사용자 쿼리 내의 '역량 요구사항'을 추론하는 것이 중요함을 강조합니다. 연구진은 TACIT 프레임워크를 도입하여 외부 요구사항을 세 가지 축으로 분해하고, 생성 이전 은닉 상태에서 이를 선형적으로 디코드할 수 있음을 입증했습니다. 특히, 모델이 내부 표현으로는 역량을 파악하지만 자연어 명시화에서는 신뢰도가 떨어지는 '구조화되었지만 침묵하는' 현상을 발견했습니다.
핵심 포인트
- 도구 사용 전, LLM은 쿼리 내의 역량 요구사항을 추론해야 한다.
- TACIT 프레임워크는 외부 요구사항을 Source, Transformation, World Effect 세 축으로 분해한다.
- LLM 은닉 상태에서 역량 구조가 높은 정확도로 선형 디코딩 가능하다.
- 모델은 내부 표현으로는 파악하지만 자연어 명시화에서는 신뢰도가 떨어진다.
신뢰할 수 있는 도구 사용은 단순히 메커니즘을 트리거하거나 쿼리를 API 설명에 매칭시키는 것 이상을 필요로 합니다. 에이전트는 특정 도구를 선택하기 전에, 사용자 쿼리에 내포된 역량 요구사항을 먼저 추론해야 합니다. 본 논문에서는 이러한 쿼리 측의 역량 요구사항이 생성 이전 LLM 은닉 표현으로부터 선형적으로 디코드 가능한지, 그리고 이러한 은닉 상태 접근성이 명시적인 언어 분류와 어떻게 비교되는지를 조사합니다. 우리는 TACIT이라는 프레임워크를 소개하며, 이 프레임워크는 외부 요구사항을 출처(Source), 변환(Transformation), 세계 효과(World Effect)의 세 가지 기본 축을 따라 분해하여 여덟 개의 구조적으로 구별되는 역량 클래스를 정의합니다. 벤치마크, 합성 예시, 그리고 새로운 도메인 시나리오에서 가져온 1,600개의 균형 잡힌 학습 쿼리를 사용하여, 우리는 네 가지 오픈 웨이트 LLM 계열의 생성 이전 은닉 상태에 선형 프로브를 훈련시킵니다. 우리의 경험적 결과는 세밀한 역량 구조가 모든 모델에서 높은 정확도로 선형 디코딩 가능하다는 것을 보여줍니다. 하지만 결정적으로, 우리는 표현(representation)과 언어화(verbalization) 간의 격차를 노출합니다: 동일한 모델들이 같은 쿼리를 자연어로 명시적으로 분류하도록 요청받았을 때는 현저히 신뢰도가 떨어집니다. 이러한 단절은 필요한 외부 역량에 대한 정보가 LLM 은닉 표현에는 선형적으로 접근 가능하지만, 신뢰성 있게 표현되지는 않는다는 것을 나타내며, 우리는 이 현상을 '구조화되었지만 침묵하는(structured but silent)' 것으로 정의합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기