Launch HN: Danswer (YC W24) – 사설 데이터를 활용한 오픈 소스 AI 검색 및 채팅
요약
Danswer는 기업의 사내 문서를 활용하여 질문에 답변하는 자체 호스팅(self-hostable)형 AI 검색 및 채팅 플랫폼입니다. Slack, Google Drive, Jira 등 25여 개 업무 도구와 연동되어 팀 고유 지식을 자연어 질의를 통해 찾아냅니다. 핵심은 커스텀 RAG (Retrieval Augmented Generation) 파이프라인에 있으며, 하이브리드 키워드(BM25) 및 벡터 인덱스를 결합하여 정확도를 높였습니다. 오픈소스로 공개되어 보안과 비용 측면에서 민감한 데이터를 다루는 기업 환경에 최적화되었으며,
핵심 포인트
- Danswer는 Slack, Google Drive, Jira 등 25개 주요 업무 도구와 연동하여 사내 지식을 활용하는 ChatGPT 스타일 시스템을 제공합니다.
- 시스템은 커스텀 RAG 파이프라인을 사용하며, 벡터 인덱스와 BM25 키워드 인덱스를 결합한 하이브리드 검색 방식을 채택했습니다.
- 오픈소스 및 자체 호스팅(self-hostable) 구조로 설계되어 모든 데이터가 사내에 보관되며, LLM도 온프레미스 배포가 가능합니다.
- 검색 정확도를 높이기 위해 쿼리 증강(query-augmentation), 컨텍스트 재작성(contextual-rephrasing) 등 고급 전처리 기법을 적용했습니다.
Launch HN: Danswer (YC W24) – 사설 데이터를 활용한 오픈 소스 AI 검색 및 채팅
안녕하세요, HN 커뮤니티 여러분! 저희는 Danswer(https://github.com/danswer-ai/danswer)의 Chris와 Yuhong입니다. 저희는 팀이 가진 고유한 지식에 접근할 수 있는, 오픈 소스이며 자체 호스팅(self-hostable) 가능한 ChatGPT 스타일 시스템을 구축하고 있습니다. 이 시스템은 Slack, Google Drive, Jira 등 가장 흔하게 사용되는 25가지 업무 도구와 연결됩니다. 사용자분들은 자연어로 질문하면, 팀의 문서들을 기반으로 답변을 얻게 됩니다. 필요에 따라 답변에는 인용(citation)과 해당 문서를 생성하는 데 사용된 정확한 링크가 제시됩니다.
빠른 시연 영상:
원래 Danswer는 저희가 직장에서 겪었던 어려움에서 영감을 받아 시작한 사이드 프로젝트였습니다. 팀이 규모를 확장함에 따라 적절한 정보를 찾는 것이 점점 더 어려워진다는 것을 깨달았습니다. 저는 한 번 온콜(on call) 근무 중 고객의 미션 크리티컬 실패(mission critical failure)로부터 복구하는 것을 도우면서, 그 오류가 제가 한 번도 사용해 본 적 없는 모호한 레거시 기능과 관련되어 있다는 사실을 기억합니다. 대부분의 프로젝트에서는 ChatGPT에 간단히 질문하는 것만으로 해결되었겠지만, 이 순간에는 추가적인 컨텍스트(context)가 없으면 ChatGPT는 완전히 무지했습니다 (저 역시 찾을 수 없었습니다).
저희는 몇 년 안에 모든 조직이 팀별 지식 비서(team-specific knowledge assistants)를 사용하게 될 것이라고 믿습니다. 또한, 팀들은 자신들의 비밀 정보를 알려주고 싶어 하지 않으며, 모든 팀이 또 다른 SaaS 솔루션에 대한 예산을 가지고 있는 것도 아니라는 점을 이해하고 있기에, 저희는 이 프로젝트를 오픈 소스화했습니다. 이는 어떤 클라우드나 온프레미스(on-premise) 환경에도 배포할 수 있는 컨테이너 세트일 뿐입니다. 모든 데이터는 해당 인스턴스에 처리되고 영구 저장됩니다. 심지어 일부 팀은 시스템을 완전히 에어갭(airgap)하기 위해 오픈 소스 LLM을 자체 호스팅하는 것을 선택하기도 했습니다.
또한, 저희 시스템의 실제 설계에 대해서도 공유하고 싶습니다 (https://docs.danswer.dev/system_overview). 모델 선택, 하이퍼파라미터(hyperparameters), 프롬프팅(prompting) 등 흐름의 어느 부분에 대해 질문이 있으시면 댓글에서 더 깊이 논의할 준비가 되어 있습니다.
이 시스템은 저희가 구축한 커스텀 검색 증강 생성(Retrieval Augmented Generation, RAG) 파이프라인을 중심으로 작동합니다. 인덱싱 시간 동안 (저희는 10분마다 연결된 소스에서 문서를 가져옵니다), 문서들은 청크(chunked)되어 하이브리드 키워드+벡터 인덱스로 색인화됩니다 (https://github.com/danswer-ai/danswer/blob/main/backend/dans...).
벡터 인덱스는 자연어 쿼리를 이해할 수 있는 유연성을 시스템에 제공하며, 저희는 대조 손실(contrastive loss)로 학습된 최첨단 접두사 인식 임베딩 모델(prefix-aware embedding models)을 사용합니다. 선택적으로 이 시스템은 각 문서를 여러 번의 다른 세분성(granularity) 패스를 거치도록 구성될 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기