Databricks AI Classify: 대규모 문서 분류를 위한 비용 효율적인 솔루션
요약
Databricks가 대규모 문서 분류를 위해 벡터 검색과 AI 함수를 결합한 'Databricks AI Classify'를 도입했습니다. 이는 기존 LLM 방식의 높은 비용과 컨텍스트 제한 문제를 해결하며, 수만 개의 레이블을 가진 복잡한 분류 체계에서도 효율적이고 정확한 처리를 지원합니다.
핵심 포인트
- 기존 Regex 및 키워드 매칭 방식의 유지보수 어려움 해결
- LLM의 컨텍스트 윈도우 제한 및 환각 현상 극복
- 벡터 검색과 AI 함수를 결합한 비용 효율적인 2단계 워크플로
- 대규모 분류 체계(10만 개 이상의 레이블)에 최적화된 확장성 제공
인공지능 (AI) 및 데이터 분석 (Data Analytics) 영역에서, 방대한 분류 체계 (Taxonomies)를 바탕으로 대량의 문서를 효율적으로 분류하는 것은 여전히 중요한 과제로 남아 있습니다. 전통적인 방식은 종종 한계가 있으며, 정교한 대규모 언어 모델 (LLMs)조차 이러한 대규모 작업에서는 비효율적이고 비용이 많이 들 수 있습니다. Databricks는 벡터 검색 (Vector Search)과 AI 함수 (AI Functions)를 결합하여 탁월한 정확도와 비용 절감을 제공하며, 이 중요한 분야에서 LLMs를 능가하는 새로운 워크플로인 Databricks AI Classify를 도입했습니다. 이 혁신적인 접근 방식은 복잡한 분류 요구 사항을 처리하는 기업들에게 확장 가능하고 실용적인 솔루션을 제공합니다. — databricks classify beats llms cost
대규모 문서 분류의 과제
조직들은 때때로 100,000개 이상의 고유 레이블을 포함하는 방대한 분류 체계에 문서를 매핑해야 하는 상황에 직면합니다. 이는 생물 의학 개체 연결 (Biomedical Entity Linking), 공급업체 정규화 (Vendor Normalization), 기업 중복 제거 (Company Deduplication)와 같은 분야에서 특히 관련이 깊습니다. 이러한 작업은 비정형 텍스트 (Unstructured Text)를 수많은 사전 정의된 카테고리에 매칭하는 것을 포함하며, 이는 역사적으로 대규모 환경에서 효과적이고 경제적으로 해결하기 어려운 문제였습니다.
전통적 방식의 한계
수년 동안 기업들은 사용자 정의 정규 표현식 (Regex) 및 키워드 매칭 (Keyword Matching)과 같은 방법에 의존해 왔습니다. 이러한 기술은 단순한 작업에는 효과적일 수 있지만, 크고 진화하는 데이터 세트에 적용할 때는 상당한 단점이 있습니다. 정규 표현식 (Regex) 규칙은 종종 취약하며, 실제 데이터의 변형을 만났을 때 깨지기 쉽습니다. 특히 근본적인 분류 요구 사항이나 데이터 소스가 변경됨에 따라 이러한 규칙을 유지 관리하는 것은 복잡하고 시간이 많이 소요되는 작업이 됩니다.
기본적인 머신러닝 (Machine Learning) 분류기들은 개선된 방식이긴 하지만, 역시 장애물에 직면합니다. 이러한 모델을 학습시키는 과정은 종종 상당한 양의 레이블링된 데이터 (Labeled data)를 필요로 합니다. 거대한 분류 체계 (Taxonomy)의 경우, 충분하고 균형 잡힌 정답 데이터 (Ground truth data)를 확보하는 것, 특히 희귀한 레이블 (Rare labels)에 대한 데이터를 확보하는 것은 상당한 병목 현상이 될 수 있으며, 이는 정확도 측면에서 어려움을 겪는 모델로 이어질 수 있습니다.
LLM의 딜레마 (The LLM Dilemma)
보다 최근에는 대규모 언어 모델 (LLMs)이 분류를 포함한 다양한 자연어 처리 (NLP) 작업에서 강력한 도구로 등장했습니다. 하지만 거대한 분류 체계에 존재하는 엄청난 양의 레이블에 직면했을 때, LLM은 한계에 부딪힙니다. 한 번에 처리할 수 있는 정보의 양인 컨텍스트 윈도우 (Context windows)는 전체 레이블 세트를 전달하려고 시도할 때 쉽게 초과될 수 있습니다. 이는 종종 불완전한 처리로 이어지거나, 더 나쁘게는 부정확하거나 조작된 레이블을 생성하는 환각 (Hallucinations) 현상을 초래합니다. 또한, 모든 문서와 전체 분류 체계를 처리하기 위해 모든 데이터를 프런티어 LLM (Frontier LLM)으로 보내는 계산 비용 (Computational cost)은 대량의 프로덕션 워크로드 (Production workloads)에서 감당하기 어려울 정도로 비싸질 수 있습니다.
Databricks AI Classify: 하이브리드 접근 방식
Databricks는 벡터 검색 (Vector search)과 AI 함수 (AI functions)의 강점을 지능적으로 결합한 새로운 2단계 워크플로 (Workflow)를 통해 이러한 과제들을 해결합니다. 이 하이브리드 솔루션은 전통적인 방식과 단독 LLM의 한계를 모두 극복하도록 설계되었으며, 더욱 정확하고 비용 효율적인 대안을 제공합니다.
1단계: 후보 식별을 위한 벡터 검색 (Vector Search for Candidate Identification)
이 프로세스는 벡터 검색 (Vector Search)으로 시작됩니다. 입력 문서와 분류 체계 (Taxonomy) 내의 각 잠재적 레이블 (Label)은 모두 벡터 표현 (Vector representations)으로 임베딩 (Embedding)됩니다. Databricks는 이 목적으로 Qwen3-Embedding-8B와 같은 모델을 활용합니다. 텍스트를 수치 벡터로 변환함으로써, 시스템은 의미론적 (Semantic) 및 어휘적 (Lexical) 비교를 수행할 수 있습니다. 이를 통해 문서와 의미론적으로 가장 유사한 후보 레이블들의 짧은 목록 (Shortlist)을 효율적으로 식별할 수 있습니다. 이 초기 단계는 계산 집약적인 (Computationally intensive) AI 모델에 의해 평가되어야 하는 레이블의 수를 크게 줄여줍니다.
2단계: 축소된 세트에 대한 AI 분류 (AI Classification on a Reduced Set)
유망한 후보 레이블의 짧은 목록이 생성되면, Databricks AI Classify 기능이 적용됩니다. 결정적으로, 이 AI 기능은 전체 분류 체계가 아닌, 좁혀진 레이블 선택군에 대해서만 작동합니다. 이러한 집중적인 적용은 AI 모델이 가장 관련 있는 가능성에 집중할 수 있게 함으로써 분류의 정확도를 극적으로 향상시킵니다. 동시에, 필요한 계산 리소스를 대폭 줄여줌으로써 분류된 문서당 비용을 낮추는 결과로 이어집니다.
성능 및 비용 이점: 벤치마킹 결과 (Performance and Cost Benefits: Benchmarking Results)
AI Classify 워크플로의 효과를 검증하기 위해, Databricks는 Transactions, Companies, MedMentions라는 세 가지 다양한 데이터셋을 대상으로 벤치마킹 테스트를 수행했습니다. 결과는 Databricks 방식이 직접적인 LLM 호출 및 기타 방법보다 우수함을 명확히 보여주었습니다.
AI Classify 워크플로는 평균 점수 0.81로 일관되게 더 높은 정확도를 달성했습니다. 이는 평균 0.76을 기록한 차순위 모델인 Gemini 3.5 Flash보다 뛰어난 성능입니다. 아마도 더욱 놀라운 점은 비용 효율성일 것입니다. Databricks 솔루션은 직접적인 LLM 처리와 비교했을 때 문서당 비용이 약 100분의 1 수준으로 작동했습니다.
벡터 검색 (Vector search) 단독으로는 비용 효율성은 매우 높지만, 정확도가 크게 떨어지는 모습을 보였으며, 하이브리드 AI Classify 방식보다 20점 이상 낮은 점수를 기록했습니다. 이는 높은 정밀도(Precision)를 달성하기 위해 AI 기능이 반드시 필요함을 강조하는 동시에, 벡터 검색이 필수적인 확장성 (Scalability) 및 초기 필터링을 제공한다는 점을 보여줍니다.
프로덕션 환경을 위한 확장성 및 유지보수성
벡터 검색과 AI Classify를 결합한 워크플로우는 방대한 레이블 세트를 처리하기 위해 문서 분류 역량을 확장해야 하는 조직에 강력하고 실용적인 솔루션을 제공합니다. 이 방식은 정확도, 비용 효율성, 그리고 유지보수의 용이성 사이에서 결정적인 균형을 맞추고 있어, 프로덕션 (Production) 환경에 배포하기에 이상적입니다.
이 접근 방식의 핵심 장점 중 하나는 내재된 유지보수성입니다. 분류 체계 (Taxonomy)가 진화하여 새로운 레이블이 추가되거나 기존 레이블이 폐기될 때, 이를 원활하게 업데이트할 수 있습니다. 광범위한 모델 재학습 (Retraining)이나 복잡한 재배포 (Redeployment) 과정 없이도 새로운 레이블을 임베딩 (Embedding)하고 폐기된 레이블을 고려 대상에서 제외할 수 있습니다. 이러한 민첩성은 분류 스키마 (Schema)가 변경될 가능성이 높은 역동적인 산업 분야에서 운영되는 기업에 매우 중요합니다.
대규모 문서 분류의 복잡성에 직면한 모든 조직에게, 이 Databricks 워크플로우를 채택하는 것은 실용적이고 강력한 시작점이 될 것입니다. 이는 높은 정확도와 상당한 비용 절감을 달성할 수 있는 명확한 경로를 제공하며, 데이터 분석 및 운영 효율성을 위한 새로운 가능성을 열어줍니다.
tags: databricks, ai, machine learning, llms, document classification, vector search, cost savings, scalability, technology
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기