UNREAL: 검색(Retrieval)과 장문 컨텍스트를 통합하여 지연 시간 50% 단축
요약
UNREAL은 검색(Retrieval)과 장문 컨텍스트 처리를 단일 모델 및 순방향 패스로 통합한 새로운 아키텍처입니다. 기존의 RAG 파이프라인이 여러 구성 요소와 높은 지연 시간을 요구했던 것과 달리, UNREAL은 하나의 7B 트랜스포머로 더 높은 재현율과 낮은 지연 시간(약 43% 단축)을 달성했습니다.
핵심 포인트
- RAG의 복잡한 파이프라인을 단일 모델로 통합하여 효율성을 극대화합니다.
- 지연 시간을 절반 수준으로 줄이고, 클라우드 비용 및 엔지니어링 리소스를 절감할 수 있습니다.
- 셀프-쿼리 벡터와 하이브리드 어텐션을 통해 검색과 장문 컨텍스트 처리를 동시에 수행합니다.
UNREAL이 검색과 장문 컨텍스트를 통합하다: 왜 하나의 모델이 두 개보다 나은가
주요 내용
“적절한 문서를 가져오고 전체 대화를 읽는 단일 추론 패스”라는 말은 마케팅 슬로건처럼 들렸지만, UNREAL 논문이 2025년 11월 프리프린트 서버에 공개되면서 현실이 되었습니다. 저자들은 7B 매개변수 트랜스포머가 구성 요소를 교체하지 않고도 방대한 코퍼스에서 관련 청크를 검색하고 16k 토큰 이상의 창(window)에 어텐션할 수 있음을 증명했습니다. 그 결과는 다음과 같습니다: 더 높은 재현율(recall), 향상된 장문 컨텍스트 QA 성능, 그리고 기존의 RAG + Longformer 스택보다 약 43% 낮은 지연 시간입니다.
만약 여전히 밀집 검색기(dense retriever), 벡터 저장소(vector store), 그리고 별도의 장문 컨텍스트 인코더를 조합하여 사용한다면, 엔지니어링 시간, GPU 메모리, 추론 예산을 낭비하게 됩니다. UNREAL은 더 깔끔한 경로를 보여줍니다—하나의 모델, 하나의 순방향 패스(forward pass), 하나의 프로덕션 엔드포인트입니다.
사례 연구: 법률 계약용 지식 기반 어시스턴트 구축
클라이언트의 2백만 페이지 분량의 계약 저장소에 대해 질문에 답할 AI 어시스턴트를 원하는 중견 로펌을 상상해 보세요. 이 엔지니어링 팀은 현재 다음과 같은 파이프라인을 운영하고 있습니다:
- 쿼리 인코더 (DPR)가 사용자의 질문을 768차원 벡터로 변환합니다.
- FAISS 인덱스가 상위 10개의 계약 구절(평균 각 1k 토큰)을 검색합니다.
- RAG 생성기 (BART-large)가 검색된 구절들을 사용자 프롬프트와 연결하고, 이 4k 토큰 입력을 디코더에 공급합니다.
- 장문 컨텍스트 폴백은 사용자가 “전체 조항 계층 구조를 보여주세요”라고 질문할 때 별도의 Longformer-Encoder-Decoder를 작동시킵니다.
이 로펌은 매달 벡터 저장소를 유지 관리하고, 인덱스 드리프트(index drift)를 모니터링하며, Longformer의 슬라이딩 윈도우 크기를 조정하는 데 온전한 주(week)를 소비합니다. 피크 시간대에는 단일 A100에서 지연 시간이 800ms까지 급증하며, 두 모델이 다른 토크나이저를 사용하기 때문에 어시스턴트가 관련 없는 계약의 증거를 혼합하는 경우도 발생합니다.
UNREAL을 사용해 보세요. 팀은 DPR + BART 조합을 unreal-7b-v1 체크포인트로 교체하고, 커스텀 리트리버를 LangChain 2.0의 UNREALRetriever로 대체했습니다. 새로운 흐름은 다음과 같습니다:**
- 사용자 프롬프트가 UNREAL 인코더에 직접 입력됩니다.
- UNREAL이 셀프-쿼리(self-query) 벡터를 생성하고, 미리 계산된 청크 임베딩(인덱싱 중 동일한 인코더가 해당 임베딩을 생성함)에 대해 빠른 내적 검색(inner-product search)을 실행하여 상위 5개 계약 청크를 선택합니다.
- 하이브리드 어텐션은 이들 청크에 대한 교차 어텐션(cross-attention)과 전체 6k 토큰 프롬프트(사용자의 질문과 붙여넣은 계약 발췌문)에 걸친 슬라이딩-윈도우 셀프-어텐션(sliding-window self-attention)을 혼합합니다.
이틀간의 통합 끝에, 해당 기업은 다음 수치를 측정했습니다:
| Metric | Old Pipeline | UNREAL Pipeline |
|---|---|---|
| End-to-end latency (single A100) | 720 ms | 350 ms |
| ... |
핵심 통계: UNREAL은 재현율(recall)을 8 퍼센트 포인트 향상시키면서 지연 시간을 절반으로 줄였습니다.
이 기업은 이제 단일 추론 엔드포인트를 운영하고, 클라우드 비용을 약 30% 절감했으며, 이전에 전담 데이터 엔지니어가 필요했던 야간 인덱스 재구축 작업을 없앴습니다.
핵심 내용: 다양한 벤치마크를 통한 구체적인 수치**
UNREAL의 저자들은 검색(retrieval), 장문 컨텍스트 추론, 또는 둘 다에 부하를 주는 세 가지 유형의 작업군에서 이 모델을 평가했습니다. 아래에서는 Hugging Face와 2026년 기업 블로그에 게재된 몇몇 제3자 복제 자료를 추가하여 가장 관련성 높은 수치들을 재현합니다.
| 벤치마크 | 태스크 | 입력 크기 | UNREAL-7B (v1) | 최적의 non-UNREAL 기준선 | 상대적 이득 |
|---|---|---|---|---|---|
| MassiveOpenQA | 오픈 도메인 검색 (10개 문서 회상) | 2k 프롬프트 | 0.78 recall @10 | DPR-RAG 0.70 | +11 % |
| ... | |||||
| UNREAL은 또한 단일 NVIDIA A100에서 4k 토큰 프롬프트와 검색된 청크 5개를 사용하여 350ms의 종단 간(end-to-end) 지연 시간을 보고합니다. 이와 대조적으로, 동일한 하드웨어에서 DPR + BART 파이프라인과 Longformer 인코더는 평균 620ms가 소요됩니다. 프롬프트 길이를 늘릴 때 지연 시간 격차는 더욱 커지는데, 16k 토큰의 경우 UNREAL은 800ms 미만을 유지하는 반면, 이중 모델 스택은 1.4초를 초과합니다. |
수치가 개선되는 이유
- **자가 생성 질의(Self-generated queries)**는 별도의 질의 인코더가 필요하지 않습니다. 나중에 답변을 생성하는 데 사용될 동일한 트랜스포머가 검색 벡터도 생성하므로, 해당 벡터가 색인된 청크와 동일한 표현 공간에 존재함을 보장합니다.
- **청크 레벨 인코더(Chunk-level encoder)**는 1~2k 토큰 블록의 밀집 벡터를 저장합니다. 각 블록이 일관된 의미 단위(단락, 코드 함수 또는 이미지 패치)를 포함하기 때문에, 검색 단계에서는 더 적지만 더 관련성 높은 조각들을 반환하며, 이는 교차 어텐션 비용을 줄입니다.
- **하이브리드 어텐션(Hybrid attention)**은 단순한 전체 자가 어텐션($O(N^2)$ 메모리)을 게이팅 혼합(gated mixture)으로 대체합니다: 모델은 전체 프롬프트에 걸쳐 국소적으로(슬라이딩 윈도우) 어텐션을 수행하는 동시에, 검색된 청크를 통해 교차 어텐션(cross-attention) 방식으로 전역적으로 어텐션을 수행합니다. 이 설계는 이차 항을 줄이는 동시에 코퍼스 내 어디에서든 증거를 통합할 수 있는 능력을 보존합니다.
- **통합 손실(Unified loss)**은 검색 회상과 다음 토큰 예측을 동시에 최적화합니다. 언어 모델링 헤드로부터 오는 기울기 신호는 인코더를 유사성 검색과 생성 모두에 좋은 표현으로 밀어붙여, 클래식 RAG 파이프라인의 성능을 저하시키는
인상적인 성능 향상을 이루었음에도 불구하고, UNREAL이 모든 문제를 즉시 해결해 주는 것은 아닙니다. 팀은 프로덕션에 적용하기 전에 다음 고려 사항들을 신중하게 검토해야 합니다.
1. 청크 크기 균형 맞추기 (Chunk-size balancing act)
청크 길이를 500 토큰으로 설정하면 벡터 스토어의 용량이 크게 늘어나며(테라바이트 규모 코퍼스 기준 수백만 개의 청크), 이는 인덱스 지연 시간 증가와 메모리 압박을 초래합니다. 반면, 더 큰 청크(2k 토큰)는 인덱스 크기를 줄여주지만, 관련성 신호가 여러 문장에 분산되면서 관련 없는 자료를 검색할 위험이 있습니다.
해결 방안: 도메인별(예: 법률 계약서, 과학 논문) 짧은 파일럿 테스트를 수행하여 청크 크기를 500 토큰부터 2k 토큰까지 변화시키며 테스트해야 합니다. 재현율(recall) @10과 다운스트림 QA 정확도를 추적하여 최적의 지점을 찾아내세요. UNREAL 논문에서는 이질적인 텍스트에 대해 1k 토큰 청크를 권장하지만, 코드나 표 형식 데이터에는 더 세밀한 단위가 필요할 수 있습니다.
2. 하이브리드 어텐션의 메모리 사용량 (Memory footprint of hybrid attention)
하이브리드 어텐션은 슬라이딩 윈도우 부분에 여전히 전체 크기의 KV 캐시를 저장합니다. 16k 토큰 프롬프트의 경우, 모델은 동일한 크기의 일반 디코더보다 약 2배 많은 VRAM을 소비합니다. 40GB A100 환경에서는 7B 체크포인트를 충분히 실행할 수 있지만, 30B 또는 70B 모델로 확장하려면 모델 병렬 처리(model parallelism)나 다중 GPU 추론 서버가 필요합니다.
해결 방안: 지연 시간 민감 서비스에는 7B 체크포인트를 배포하고, 배치 기반 작업(예: 오프라인 보고서 생성)을 위해 더 큰 체크포인트를 아껴두세요. FlashAttention-2와 회전 위치 압축(rotary-position-compression)을 사용하는 향후 메모리 효율적인 변형 모델(UNREAL-XL, 2026년 4분기 예정)에 주목하세요.
3. 언어 커버리지 (Language coverage)
발표된 모든 평가는 영어 데이터셋에 초점을 맞추고 있습니다. 저자들은 청크 인코더와 검색 파이프라인이 특정 언어의 토크나이저에 의존하지 않는다고 언급했지만, 다국어 벤치마크는 공개하지 않았습니다. 만약 제품이 비영어권 사용자를 대상으로 한다면, 낮은 재현율이나 토큰 길이 불일치를 경험할 수 있습니다.
완화 방안(Mitigation): 공개된 LoRA 스크립트를 사용하여 다국어 코퍼스에 UNREAL을 파인튜닝하세요. 초기 도입 사용자들(예: 유럽의 핀테크 기업)은 혼합 언어 데이터셋으로 20k 단계의 LoRA를 적용한 후 리콜(recall)이 5% 향상되었다고 보고했습니다. 공식 다국어 체크포인트는 2027년 1분기에 출시될 예정입니다.
4. 대규모 코퍼스에서의 검색 지연 시간 (Retrieval latency on massive corpora)
UNREAL은 미리 계산된 청크 임베딩(chunk embeddings)에 대한 내적 검색(inner-product search)을 기반으로 합니다. 코퍼스가 100B 토큰을 초과하면, 단순한 전체 탐색(naïve exhaustive search)은 비현실적이 됩니다. 저자들은 IVF-PQ 또는 HNSW 인덱스 사용을 제안하지만, 이는 엔지니어링 복잡성을 추가합니다.
완화 방안(Mitigation): Azure Cognitive Search의 UNREAL 베타 지원을 활용하세요. 이는 서브밀리초(sub-millisecond) 쿼리 시간을 제공하는 관리형 IVF-PQ 서비스를 제공합니다. 온프레미스 환경에 머무른다면, 가장 자주 접근되는 청크(예: 최근 뉴스 기사)를 GPU 메모리에 저장하는 캐시 레이어와 HNSW를 결합하세요.
전망 (The Outlook): 통합 모델에서 통합 AI로
UNREAL의 출시는 커뮤니티 포크(community forks) 물결을 일으켰습니다—UNREAL-Vision, UNREAL-Video, 심지어 UNREAL-Code까지 각기 모달리티별 청크 인코더(modality-specific chunk encoder)를 추가하면서도 핵심 트랜스포머 가중치(core transformer weights)는 재사용했습니다. 이러한 패턴은 더 광범위한 산업 변화를 시사합니다: 검색, 장문 컨텍스트 추론, 멀티모달 접지(multimodal grounding)를 처리하는 단일 백본(single backbones).
단기 기대치 (향후 12개월)
| 기간 | 개발 내용 | 영향 |
|---|---|---|
| 2026년 4분기 | Azure Cognitive Search가 관리형 UNREAL 엔드포인트(사용한 만큼 지불)를 통합합니다. | 기업들은 벡터 스토어 구축 없이 검색 증강 어시스턴트(retrieval-augmented assistant)를 가동할 수 있게 됩니다. |
| ... |
장기 비전 (2027년 이후)
만약 커뮤니티가 동일한 트랜스포머에 모달리티별 청크 인코더를 계속 공급한다면, 우리는 다음을 수행할 수 있는 **하나의 범용 증거 선택 엔진(one universal evidence-selection engine)**을 볼 수도 있습니다:
- PDF 단락, 이미지 패치, 코드 스니펫 또는 비디오 프레임을 가져옵니다.
- 아무리 길더라도 전체 사용자 대화에 주의를 기울입니다(Attend over the entire user conversation).
- 모델의 가중치 공간을 벗어나지 않으면서도 일관된 답변을 생성합니다.
그러한 시스템은 별도의 “지식 기반(knowledge bases)”, “벡터 스토어(vector stores)”, 그리고 “장문 컨텍스트 트랜스포머(long-context transformers)”가 필요 없게 만듭니다. 기업들은 인프라 구축보다는 데이터 큐레이션과 프롬프트 엔지니어링에 집중할 수 있습니다.
마무리 생각 (Closing Thoughts)
UNREAL이 검색 증강 생성(retrieval-augmented generation)의 최종 해답이라고 주장하는 것은 아니지만, 단일 모델만으로도 증거 선택(evidence selection)과 장문 컨텍스트 추론(long-context reasoning)을 처리할 수 있으며, 이 과정에서 재현율(recall), 정확도(accuracy), 지연 시간(latency) 면에서 측정 가능한 개선을 보여준다는 것을 입증합니다. 엔지니어링의 단순화만으로도—더 적은 서비스, 더 적은 데이터 파이프라인, 더 적은 버전 불일치—이미 RAG 스택을 운영하고 있는 모든 조직에게 심각한 평가를 정당화합니다.
작게 시작하십시오: 코퍼스(corpus)의 일부 하위 집합을 인덱싱하고, 리트리버(retriever)를 UNREALRetriever로 교체한 다음, 위의 핵심 통계를 모니터링하십시오. 만약 논문에서 보고된 8포인트 재현율 향상과 40% 지연 시간 감소가 관찰된다면, 나머지 파이프라인을 마이그레이션할 수 있는 확실한 비즈니스 사례를 갖게 된 것입니다.
다음 세대의 AI 제품들은 통합된 백본(backbones)으로 수렴할 가능성이 높으며, UNREAL은 그 방향으로 명확하고 데이터 기반의 한 걸음을 제시합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기