Launch HN: Chonkie (YC X25) – 고급 청킹을 위한 오픈 소스 라이브러리
요약
Chonkie는 검색 증강 생성(RAG) 애플리케이션의 핵심 단계인 데이터 청킹 및 임베딩을 위한 경량 오픈소스 라이브러리입니다. 기존 라이브러리의 복잡성이나 낮은 성능에 대한 한계를 극복하고자 개발되었습니다. Chonkie는 토큰, 문장, 재귀적 방식 외에도 'Semantic Double Pass Chunking', 코드 기반의 'Code Chunking' 등 최신 연구 결과를 반영한 8가지 고급 청킹 전략을 지원합니다. 특히, 기존 대비 설치 용량이 훨씬 작고(기본 설치 약 15MB), 토큰 청킹 속도가 LangChain/Lla
핵심 포인트
- Chonkie는 RAG 파이프라인의 핵심인 데이터 청킹 및 임베딩을 위한 경량 오픈소스 라이브러리입니다.
- 토큰, 문장 기반 방식 외에도 'Semantic Double Pass Chunking', 'Code Chunking' 등 8가지 고급 전략을 지원하며 최신 연구 결과를 반영했습니다.
- 기존 대안 대비 설치 용량이 현저히 작고(약 15MB), 토큰 청킹 속도가 LangChain/LlamaIndex보다 최대 33배 빠릅니다.
- pgVector, Chroma, Qdrant 등 주요 벡터 데이터베이스와의 'handshake' 기능을 제공하여 검색 및 임베딩 과정을 간소화했습니다.
안녕하세요 HN! 저희는 Shreyash와 Bhavnick입니다. 저희는 데이터 청킹(chunking) 및 임베딩(embedding)을 위한 오픈 소스 라이브러리인 Chonkie (https://chonkie.ai)를 개발하고 있습니다.
Python: https://github.com/chonkie-inc/chonkie
TypeScript: https://github.com/chonkie-inc/chonkie-ts
저희 코드 청커(code chunker)를 보여주는 영상입니다:
.Bhavnick과 저는 몇 년 동안 LLM을 활용한 개인 프로젝트를 진행해 왔습니다. 이 기간 동안 저희는 RAG 애플리케이션을 지원하기 위해 자체 청킹 로직을 작성하는 경우가 많았습니다. 기존 라이브러리를 사용하는 것을 주저했는데, 그 이유는 기본적인 기능만 제공하거나 너무 무겁기(일부는 80MB 이상) 때문이었습니다.
저희는 Chonkie를 가볍고(lightweight), 빠르고(fast), 확장 가능하며(extensible), 사용하기 쉽게 만들기 위해 개발했습니다. 이 분야는 빠르게 진화하고 있으며, 저희는 Chonkie가 최신 전략들을 신속하게 지원할 수 있기를 바랐습니다. 현재 다음 기능을 지원합니다:
- 토큰 청킹(Token Chunking),
- 문장 청킹(Sentence Chunking),
- 재귀적 청킹(Recursive Chunking),
- 의미론적 청킹(Semantic Chunking),
- 의미론적 이중 패스 청킹 (Semantic Double Pass Chunking): 텍스트를 먼저 의미론적으로 청크한 다음, 밀접하게 관련된 청크들을 병합합니다.
- 코드 청킹 (Code Chunking): AST(Abstract Syntax Tree)를 생성하여 코드 파일을 분할하고 이상적인 분할 지점을 찾습니다.
- 후기 청킹 (Late Chunking): 논문(https://arxiv.org/abs/2409.04701)에 기반하며, 더 긴 문서를 임베딩하여 청크 임베딩을 도출합니다.
- 슬럼버 청킹 (Slumber Chunking):
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기