양자 회로와 고전적 LLM의 분리
요약
본 연구는 저심도 양자 회로와 고전적 언어 모델(LLM) 사이의 무조건적 분리를 증명합니다. 양자 회로가 생성하는 분포와 확산 언어 모델(DLM) 간의 분포적 차이 및 특정 함수 계산 시 고전적 트랜스포머가 요구하는 거대한 너비를 수학적으로 제시합니다.
핵심 포인트
- 저심도 양자 회로와 고전적 언어 모델 간의 무조건적 분리 증명
- 상수 심도 양자 회로 분포와 확산 언어 모델 간의 샘플링 불가능성 확인
- 특정 함수 계산을 위해 고전적 트랜스포머가 거대한 너비를 가져야 함을 입증
- LLM 시대의 양자 우위(Quantum advantage) 연구를 위한 이론적 토대 마련
현대의 거대 언어 모델(Large Language Models, LLMs) — 트랜스포머(Transformers) 및 확산 언어 모델(Diffusion Language Models) — 은 예측(Prediction)과 생성(Generation)이라는 두 가지 정형적인 알고리즘 작업(Algorithmic tasks)을 중심으로 구축됩니다. 본 연구에서는 두 영역 모두에서 저심도 양자 계산(Low-depth quantum computation)과 그에 상응하는 제한된 자원 기반의 고전적 언어 모델 아키텍처(Classical language-model architectures) 사이의 무조건적 분리(Unconditional separations)를 증명합니다. 구체적으로, 우리는 다음과 같은 사항을 제시합니다: 1. 분포적 분리(Distributional separation). 우리는 $\textsf{QNC}^0$ 회로(즉, 유한한 팬인(Fan-in) 게이트로 구성된 상수 심도 양자 회로 제품군)에 의해 샘플링 가능한 분포를 제시합니다. 이 분포는 얕은 스케줄링(Shallow scheduling)과 디노이징(Denoising)을 갖춘 어떠한 상수 라운드 확산 언어 모델($\textsf{DLM}$)도 상수 거리 내에서 샘플링할 수 없습니다. 이는 현대 $\textsf{DLM}$들이 의존하는 핵심 기능인 서브리니어(Sublinear) 사고의 사슬(Chain-of-thought) 및 출력 토큰 수정/리마스킹(Output-token revision/remasking) 이벤트가 허용되더라도 마찬가지입니다. 2. 기능적 분리(Functional separation). 우리는 $\land \circ \textsf{QNC}^0[\log\log n]$ (즉, $n$이 입력 길이일 때 $O(\log\log n)$ 심도의 $\textsf{QNC}^0$ 회로 제품군 뒤에 단일 고전적 $\mathsf{AND}$ 게이트가 이어지는 구조)에서 계산 가능한 함수를 제시합니다. 이 함수를 계산하는 모든 상수 심도 디코더 전용 트랜스포머(Decoder-only transformer)는 반드시 거대해야 합니다. 즉, 해당 모델은 $n^{Ω(1)}$의 너비(Width)를 가져야만 합니다. 종합적으로, 우리의 연구는 거대 언어 모델 시대의 양자 우위(Quantum advantage)에 대한 연구를 개시합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기