일반 데이터베이스와 벡터 데이터베이스의 차이점
요약
일반 데이터베이스가 정확히 일치하는 값을 찾는 것과 달리, 벡터 데이터베이스는 의미적 유사성을 기반으로 가장 가까운 점을 찾아냅니다. 하지만 대규모 벡터 검색 시 발생하는 속도 문제를 해결하기 위해 인덱싱 기술이 필수적으로 사용됩니다.
핵심 포인트
- 벡터 DB는 단어 일치보다 의미적 유사성(Semantic Similarity)에 강점을 가집니다.
- 대용량 벡터 검색은 시간이 오래 걸리므로, 인덱스 구축을 통해 속도를 개선해야 합니다.
- 인덱싱 기술 덕분에 수백만 개의 벡터를 빠르게 후보군으로 줄일 수 있습니다.
일반 데이터베이스는 정확히 일치하는 값을 찾습니다. 'cafe'를 검색하면 'cafe'라는 단어를 포함하는 행들이 나옵니다.
벡터 데이터베이스는 더 이상한 일을 합니다. 모든 항목은 공간상의 한 점이며, 아무런 공통 단어가 없더라도 사용자의 점과 가장 가까운 점을 찾아냅니다.
'작업하기 좋은 조용한 카페'를 요청하면 '공부하기 좋은 커피숍, 와이파이'가 반환됩니다. 공통된 단어는 전혀 없습니다. 하지만 여전히 올바른 답변입니다.
하지만 여기에 진짜 문제가 있습니다. 840만 개의 벡터가 있을 때, 사용자의 질의와 이 모든 벡터를 비교하는 데 3초 이상이 걸립니다. 아무도 3초를 기다려주지 않습니다.
그래서 데이터베이스는 인덱스를 구축합니다. 미리 벡터들을 근처 지역(neighbourhoods)으로 그룹화하는 것입니다. 이제 검색은 스캔하지 않고, 점프합니다. 네 번의 점프로 840만 개의 후보군을 28개로 줄입니다. 7밀리초가 걸립니다.
이것이 바로 전체 제품입니다. 벡터들이 존재하는 곳이 아닙니다. 올바른 것들을 얼마나 빠르게 찾는지가 핵심입니다.
사용해 본 모든 RAG 시스템은 이 단계에 의존합니다. 👇
#VectorDatabase #RAG #AIExplained #MachineLearning #Embeddings #SemanticSearch #LearnAI #TechExplained #ByteBuilders #AIForBeginners #DataScience #LLM #ArtificialIntelligence #DataEngineering #TechEducation
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: RAG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기