Aavache/LLMWebCrawler
요약
Aavache/LLMWebCrawler는 웹 페이지를 재귀적으로 크롤링하고 텍스트 임베딩을 추출하는 확장 가능한 서비스입니다. Ray와 FastAPI를 사용하여 분산 처리를 구현했으며, Milvus 같은 벡터 데이터베이스에 유사도 검색이 가능한 형태로 데이터를 저장합니다.
핵심 포인트
- 웹 크롤링 및 텍스트 임베딩 추출 기능 제공
- Ray를 활용한 워커 분산 처리 구조 채택
- Milvus와 같은 벡터 DB 기반의 유사 페이지 검색 구현
- FastAPI로 API 호스팅하여 서비스화 용이
확장 가능한 웹 크롤러입니다. 이 크롤러의 기능 목록은 다음과 같습니다:
- 이 서비스는 링크와 해당 텍스트, 그리고 대응하는 텍스트 임베딩을 저장하며 웹을 재귀적으로 크롤링할 수 있습니다.
- 텍스트 임베딩(text embeddings)을 얻기 위해 대규모 언어 모델(large language model) (예: Bert)을 사용합니다. 즉, 각 웹사이트에 존재하는 텍스트의 벡터 표현입니다.
- 이 서비스는 확장 가능하며, 여러 워커(workers)에 분산하기 위해 Ray를 사용합니다.
- 항목들은 벡터 데이터베이스(vector database)에 저장됩니다. 벡터 데이터베이스는 벡터 표현에 따라 샘플을 저장하고 검색하는 데 이상적입니다.
벡터 데이터베이스에 표현들을 저장함으로써, 두 벡터가 얼마나 가까운지에 따라 유사한 페이지를 검색할 수 있습니다. 이는 브라우저가 가장 관련성 높은 결과를 검색하는 데 매우 중요합니다.
터미널에서 크롤러 실행:
$ python cli_crawl.py --help
options:
-h, --help 이 도움말 메시지를 표시하고 종료합니다.
...
uvicorn과 FastAPI를 사용하여 API 호스팅:
uvicorn api_app:app --host 0.0.0.0 --port 80
start_api_and_head_node.sh의 예시를 확인해 보세요. 이때 ray head node는 먼저 초기화되어야 합니다.
저희 사용 사례의 경우, 웹 텍스트에서 임베딩을 추출하기 위해 Huggingface가 구현한 BERT 모델을 단순히 사용합니다. 더 정확하게 말하면, bert-base-uncased를 사용합니다. 코드는 독립적(agnostic)이므로 몇 줄의 코드로 새로운 모델을 등록하고 추가할 수 있습니다. llm/best.py를 확인해 보세요.
저희는 Milvus를 주요 데이터베이스 관리 소프트웨어로 사용합니다. 벡터 표현(임베딩)을 기반으로 항목을 검색하고 저장하는 내재된 기능 때문에 벡터 스타일의 데이터베이스를 사용합니다.
다음과 같이 독립형 Milvus 서버를 시작하세요. tmux와 같은 멀티플렉서 소프트웨어를 사용하는 것을 추천합니다.
tmux new -s milvus
milvus-server
Milvus에 대한 기본적인 요청들을 보려면 scripts/ 폴더를 확인해 보세요.
공식 docker compose 템플릿도 사용할 수 있습니다:
docker compose --file milvus-docker-compose.yml up -d
우리는 분산 및 병렬 처리를 실행하는 훌륭한 파이썬 프레임워크인 Ray를 사용합니다. Ray는 마스터-워커(master-worker) 패러다임을 따르며, 여기서 head 노드가 연결된 워커들에게 실행할 작업을 요청합니다.
- head 노드 설정
ray start --head
- 프로그램에서 head 노드에 연결하기
import ray
# head에 연결
ray.init("auto")
만약 Ray 노드를 중지하고 싶다면:
ray stop
또는 상태를 확인하려면:
ray status
- 워커 노드 초기화
ray start
워커 노드는 코드 구현을 가질 필요가 없습니다. head 노드가 인자와 구현체를 직렬화하여 워커들에게 제출할 것이기 때문입니다.
현재 구현은 PoC(Proof of Concept)입니다. 많은 개선이 이루어질 수 있습니다:
- [중요] 텍스트를 기반으로 유사한 URL을 검색하기 위한 API의 새로운 진입점 추가.
- 검색 및 API 최적화.
- LangChain과 같은 인기 라이브러리를 사용하여 새로운 LLM 모델 및 새로운 청킹 전략 추가.
- 벡터 DB에 더 많은 기능 저장, 예를 들어 요약 생성 등.
모든 이슈와 PR은 환영합니다 🙂.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기