Launch HN: Trellis (YC W24) – 비정형 데이터용 AI 기반 워크플로우
요약
데이터 엔지니어링의 오랜 난제인 비정형 데이터(PDF, 이메일, 음성 통화 등)를 구조화된 SQL 형식으로 변환하는 AI ETL 솔루션 'Trellis'가 공개되었습니다. Trellis는 사용자가 정의한 자연어 스키마에 맞춰 복잡한 문서나 텍스트에서 필요한 데이터를 추출하여 데이터베이스 테이블로 자동 변환합니다. 특히 금융, 법률 등 비정형 데이터 의존도가 높은 산업에서 수작업 데이터 입력 및 분석의 병목 현상을 해소하는 데 강력한 가치를 제공하며, LLM 기반 Map-Reduce와 Vision Model을 활용해 복잡한 기술적 난
핵심 포인트
- Trellis는 전화 통화 녹취록, PDF 문서, 채팅 기록 등 비정형 데이터를 사용자가 정의한 스키마에 맞춰 구조화된 SQL 형식으로 변환하는 AI 기반 ETL 솔루션입니다.
- 핵심 기술로는 LLM 기반 Map-Reduce를 활용하여 장문 문서를 처리하고, Vision Model을 이용해 표 및 레이아웃 정보를 정확하게 추출합니다.
- 금융 서비스 업계에서 신용 리스크 모델 개선에 필수적인 PDF/이메일 데이터를 구조화하거나, 고객 지원 부서의 온보딩 프로세스를 가속화하는 등 다양한 산업별 활용 사례를 제시했습니다.
- 사용자들은 별도의 가입 없이 데모 사이트(demo.runtrellis.com)에서 솔루션을 직접 체험해 볼 수 있으며, API 연동을 위한 문서도 제공됩니다.
Launch HN: Trellis (YC W24) – 비정형 데이터용 AI 기반 워크플로우
안녕하세요, HN 독자 여러분. 저희는 Trellis(https://runtrellis.com/)의 Jacky와 Mac입니다. 저희는 비정형 데이터(unstructured data)를 위한 AI 기반 ETL을 구축하고 있습니다. Trellis는 전화 통화 녹취록, PDF 파일, 채팅 내용을 사용자가 정의한 자연어 스키마(schema)를 기반으로 구조화된 SQL 형식으로 변환합니다. 이를 통해 데이터 및 운영팀이 수동 데이터 입력 작업을 자동화하고 복잡한 데이터에 대해 SQL 쿼리를 실행할 수 있도록 돕습니다.
데모 영상은
확인하실 수 있으며, 가상 환경(sandbox)은 (로그인 필요 없음!) https://demo.runtrellis.com/에서 사용해 보실 수 있습니다. 저희가 Trellis를 적용해 보고 흥미롭다고 생각한 역사적 아카이브 중 하나는 검토하는 데 몇 달이 걸렸던 유명한 엔론(Enron) 이메일입니다. 여기에서 쇼케이스 데모를 생성했습니다: https://demo.runtrellis.com/showcase/enron-email-analysis, 관련 문서는 다음 링크에서 확인하실 수 있습니다: https://docs.runtrellis.com/docs/example-email-analytics.개발 배경:
저희가 만났던 스탠퍼드 AI 연구실(Stanford AI lab)에서 여러 F500 데이터 팀(Amazon, Meta, Standard Chartered 포함)과 협업하면서 반복적으로 같은 문제에 직면했습니다. 바로 기업 데이터의 80%가 비정형이며, 기존 플랫폼으로는 이를 처리할 수 없다는 것이었습니다. 예를 들어, 제가 함께 일하는 주요 상업은행은 핵심 데이터가 PDF와 이메일에 갇혀 있어 신용 위험 모델(credit risk models)을 개선할 수 없었습니다.
저희는 AI 연구실에서의 연구 결과가 추상화 계층(abstraction layer)으로 구현되어 해결책이 될 수 있다는 것을 깨달았습니다. 이 솔루션은 금융 언더라이팅(financial underwriting) 분석에 사용되는 것만큼이나 콜센터 녹취록 분석에도 잘 작동하는, 모든 비정형 데이터 소스를 받아 스키마가 정확한 테이블로 변환해주는 AI 기반 ETL입니다.
개발 과정에서 해결해야 했던 몇 가지 흥미로운 기술적 과제:
(1) 복잡한 문서 지원: 긴 문서를 처리하기 위해 LLM 기반 맵-리듀스(LLM-based map-reduce)를 사용하고, 테이블 및 레이아웃 추출을 위해 비전 모델(vision models)을 활용합니다. (2) 모델 라우팅(Model Routing): 비용과 속도를 최적화하기 위해 각 변환에 가장 적합한 모델을 선택합니다. 예를 들어, 데이터 추출 작업의 경우 금융 테이블의 구조화된 JSON을 반환하는 데 특화된 더 간단한 파인튜닝 모델(fine-tuned models)을 활용할 수 있습니다. (3) 데이터 유효성 검사 및 스키마 보장: 참조 링크와 이상 탐지(anomaly detection)를 통해 정확성을 확보합니다.
Trellis 출시 후, 저희는 다양한 사용 사례들을 목격했습니다. 특히 PDF가 API처럼 취급되는 레거시 산업에서 그렇습니다. 예를 들어, 금융 서비스 회사들은 채권(bonds)이나 신용 등급(credit ratings)과 같은 복잡한 문서를 구조화된 형식으로 처리해야 하며...
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기