FALCON: NL2SQL 쌍을 위한 모델 및 데이터셋에 구애받지 않는 합성 데이터 생성 프레임워크
요약
FALCON 프레임워크는 기존의 한계를 극복하고 현실적이고 모호성을 인지한 NL-to-SQL 합성 데이터 생성을 목표로 합니다. 이 프레임워크는 작고 개방적인 모델을 활용하여 복잡성이 높은 실제 세계 벤치마크와 유사한 데이터를 낮은 비용으로 생성합니다. 예약어 기반 SQL 시딩과 페르소나 기반 프롬프팅을 결합해 구조적 복잡성을 높이고, 정렬 기반 필터링으로 난이도를 유지하는 것이 특징입니다.
핵심 포인트
- FALCON은 현실적인 모호성을 인지한 NL-to-SQL 합성 데이터를 생성합니다.
- 예약어 시딩과 페르소나 프롬프팅을 결합하여 구조적 복잡성을 높였습니다.
- 정렬 기반 필터링으로 난이도를 유지하며, 기존 벤치마크를 능가하는 성능을 보입니다.
- 모델 및 데이터베이스에 구애받지 않아 로컬 환경에서도 사용 가능합니다.
관계형 데이터베이스는 가장 널리 배포된 구조화된 지식 형태 중 하나이며, 여기에 자연어 접근을 하려면 언어를 스키마 엔티티와 관계에 기반하고 사람들이 요청을 표현하는 방식에 내재된 모호성을 처리해야 합니다. 기존의 합성 NL-to-SQL 데이터 생성 방법들은 이러한 모호성을 크게 무시하며, 실제 세계 구조화된 지식 접근의 복잡성에 모델을 준비시키지 못하는 지나치게 단순화된 쿼리를 생성합니다. 우리는 FALCON이라는 프레임워크를 제시합니다. 이 프레임워크는 작고 개방적인 모델(compact open models)을 사용하여 낮은 비용으로 현실적이고 모호성을 인지한 NL-to-SQL 데이터를 생성하며, 이는 까다로운 실제 세계 벤치마크의 복잡성과 일치합니다. 우리의 접근 방식은 예약어 기반 SQL 시딩(reserved-word SQL seeding)과 페르소나 기반 프롬프팅을 결합하여 구조적으로 복잡한 쿼리를 생성하는 동시에, 정렬 기반 필터링(alignment-based filtering)을 통해 진정으로 잘못된 예시와 복잡하지만 유효한 쿼리를 구분함으로써 난이도를 유지합니다. 인간 평가를 통해 모델 크기에 걸쳐 일관되게 높은 품질이 확인되었으며, 우리가 생성한 데이터는 SQL 복잡성과 자연어 풍부성 모두에서 기존 벤치마크를 능가합니다. 난이도 계층화 분석(Difficulty-stratified analysis)은 FALCON 데이터로 학습된 모델이 쿼리 복잡성이 증가함에 따라 베이스라인으로 학습된 모델보다 성능이 점점 더 우수함을 보여주며, 이는 까다로운 학습 데이터를 생성하는 우리 파이프라인의 성공을 입증합니다. 기존 벤치마크 데이터의 소량과 결합할 경우, 혼합 학습(mixed training)은 단순한 쿼리에 대한 성능을 회복시키면서 복잡한 쿼리에서의 이러한 이점을 유지합니다. 모델 및 데이터베이스에 구애받지 않는 설계는 조직이 외부 API 없이도 로컬에서 고복잡도의 NL-to-SQL 학습 데이터를 생성할 수 있도록 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기